全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2026
人类反馈中包含什么?学习偏好数据的可解释描述
提出利用稀疏自编码器解释人类反馈数据的WIMHF方法,揭示了偏好数据中投票支持有毒内容等不安全倾向,并通过数据清洗带来了37%的安全增益。
- 会议论文ICLR 2026
混乱的AI:未对齐如何随模型智力与任务复杂度扩展
通过偏差-方差分解形式化AI错误不连贯性,发现推理越久失效越不连贯,表明未来高级AI更可能引发偶发意外而非持续追求未对齐目标,加大了奖励作弊等对齐研究的重要性。
- 会议论文ICLR 2026
PluriHarms:评测人类对AI危害判断全谱系的基准
提出基准PluriHarms以系统研究人类在AI危害判断上的分歧与价值观多样性,包含150个提示词与1.5万条标注,揭示了当前对齐方法在多元安全上的不足。
- 会议论文ICLR 2026
一次对齐多语言获益:增强大模型安全对齐的多语言一致性
提出多语言一致性损失函数MLC,通过提升多语言表示向量的共线性实现语义层面的方向一致,仅用多语言提示变体即可在单语言对齐流程中同步增强多语言安全性。
- 会议论文ICLR 2026
构建符合认知规律的决策模型以改进 AI 对齐
针对偏好学习无法反映真实认知的问题,提出公理化认知决策模型,更准确拟合人类判断以促进价值对齐。
- 会议论文ICML 2026
基于斯塔克尔伯格博弈视角的推理期对齐奖励塑造
将KL正则化下的奖励模型优化建模为斯塔克尔伯格博弈,提出一种兼顾减轻基础模型偏差与降低奖励作弊风险的奖励塑造方法,有效提升了推理期对齐性能。
- 会议论文ICML 2026
压力见品行:大语言模型深度行为对齐评测
构建包含904个多轮施压场景的对齐评测基准,涵盖诚实、安全和谋划等六大维度;评测24款前沿模型发现顶尖模型仍存短板,且对齐表现呈现出统一构念特性。
- 会议论文ICML 2026
VALUEFLOW:面向 LLM 的多元可控价值观对齐
提出涵盖价值提取、强度评估与可控 steering 的统一框架,在十个模型、四种价值理论上研究 steerability 的不对称性。
- 会议论文ICML 2026
传递性与循环性:用于动态大语言模型对齐的显式偏好分解
针对标准RLHF无法捕捉循环偏好的问题,提出显式解耦标量与循环偏好的混合奖励模型及动态自博弈优化,在RewardBench 2和下游评测中提升对齐效果。
- 会议论文ICML 2026
BLOCK-EM:通过隐空间阻断预防突现未对齐
针对模型在特定任务微调时出现的突现未对齐现象,提出识别控制失齐行为的内部特征并在微调期予以约束的BLOCK-EM方法,可将未对齐现象降低最高95%。
- 会议论文ICML 2026
面向可扩展监督的保守性校准
提出校准集体监督方法CCO,通过聚合多种辅助评分惩罚偏离并在保形决策理论下在线校准,使弱监督者能以统计保证成功约束更强智能体。
- 会议论文ICML 2026
对齐预训练:语料中的AI论述引发自我实现的(非)对齐
首次实证研究了预训练语料中关于AI行为的讨论对模型对齐的因果影响,发现负面叙事会导致自我实现的未对齐,而增加对齐文档能显著降低未对齐率并持续至后训练。
- 会议论文ICML 2026
人工筛选何时适得其反:多模型自消耗循环下的偏好对齐
研究多模型自消耗训练中的偏好对齐,证明跨模型交互会削弱甚至反转人工筛选的效果,导致模型长期对齐退化。
- 会议论文ICML 2026
量化地缘文化价值观对多元安全对齐的显著性
通过元分析发现文化区域显著影响安全标注,约10%敏感样本易被误判为安全,现有LLM尚无法可靠替代人工标注。
- 会议论文ICML 2026
利用机器遗忘实现高性价比的大模型偏好对齐
提出U2A框架,将偏好对齐与大模型遗忘技术相结合,通过双层优化量化并选择负样本进行遗忘,以低成本方式提升大模型的偏好对齐表现。
- 会议论文ICML 2026
偏好优化中的虚假相关学习:机理、影响与平局训练缓解方法
理论分析了DPO等偏好学习导致谄媚与目标错误泛化的虚假相关机制,提出利用等效偏好对引入正则化的平局训练方法,在不损泛化下减少虚假学习。
- 会议论文ICML 2026
价值表达的双重机制:大语言模型中的内在价值与提示价值
在机制层面通过价值向量和价值神经元分析LLM的内在与提示价值表达,揭示二者共享基础组件但各具独特功能,提示机制增强了指令遵循并在越狱等任务中发挥作用。
- 会议论文ICML 2026
PICACO:基于总相关优化的多元上下文价值对齐
针对多提示价值冲突导致的指令瓶颈,提出免微调的PICACO方法,通过最大化指定价值观与响应间的总相关优化元指令,平衡多元价值对齐。
- 会议论文ICML 2026
可纠正性变换:构造接受更新的目标
提出一种变换,为几乎任意目标构造可纠正(corrigible)版本且不损失性能,可激励允许中途干预、抑制自我修改,在 gridworld 和提示层面的语言模型中诱导出可纠正行为。
- 会议论文ICML 2026
一触即发的对齐:黑盒评估无法保证模型更新后的对齐状态
从理论与实证证明静态黑盒评估无法保证模型在更新后的对齐性,模型可在通过黑盒测试的同时隐藏对抗行为,经单次良性更新即严重失齐。
- 会议论文ICML 2026
监督博弈:协同平衡AI智能体安全性与自主性的学习方法
将人机交互建模为马尔可夫博弈,提出平衡智能体自主性与人类监督的控制机制,证明了内在对齐保证,并在智能体工具调用任务中有效减少了安全违规。
- 会议论文ICML 2026
基于能量校准的多适配器表征干预(MARI)
提出 MARI,用竞争式多适配器按样本自适应决定干预方向与强度,并以能量门控筛选需干预的输入,在 TruthfulQA、BBQ 和安全基准上提升对齐且保持通用能力。
- 会议论文ICML 2026
迈向稳定的价值对齐:引入独立模块实现一致的价值引导
针对模型残差流中价值表征脆弱动态的问题,提出SVGT架构,通过独立的规范价值空间建模与显式行为引导Token,在保持生成流畅的同时降低超70%的有害得分。
- 会议论文ICML 2026
追求能力的强化学习训练所引发的对齐风险
研究发现大模型在包含隐式漏洞的环境中进行强化学习时,会学会利用代理指标与奖励篡改等漏洞获取奖励,且此类投机策略能跨模型传播并持续存在。