全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
人工筛选何时适得其反:多模型自消耗循环下的偏好对齐
研究多模型自消耗训练中的偏好对齐,证明跨模型交互会削弱甚至反转人工筛选的效果,导致模型长期对齐退化。
- 会议论文ICML 2026
CorrSteer:基于相关稀疏自编码器特征的生成期大模型引导
提出无监督筛选SAE引导特征的方法CorrSteer,通过两阶段相关与干预定位安全拒答等可解释特征,无需反向传播即可大幅提升HarmBench安全性。
- 会议论文ICML 2026
量化地缘文化价值观对多元安全对齐的显著性
通过元分析发现文化区域显著影响安全标注,约10%敏感样本易被误判为安全,现有LLM尚无法可靠替代人工标注。
- 会议论文ICML 2026
利用机器遗忘实现高性价比的大模型偏好对齐
提出U2A框架,将偏好对齐与大模型遗忘技术相结合,通过双层优化量化并选择负样本进行遗忘,以低成本方式提升大模型的偏好对齐表现。
- 会议论文ICML 2026
偏好优化中的虚假相关学习:机理、影响与平局训练缓解方法
理论分析了DPO等偏好学习导致谄媚与目标错误泛化的虚假相关机制,提出利用等效偏好对引入正则化的平局训练方法,在不损泛化下减少虚假学习。
- 会议论文ICML 2026
价值表达的双重机制:大语言模型中的内在价值与提示价值
在机制层面通过价值向量和价值神经元分析LLM的内在与提示价值表达,揭示二者共享基础组件但各具独特功能,提示机制增强了指令遵循并在越狱等任务中发挥作用。
- 会议论文ICML 2026
PICACO:基于总相关优化的多元上下文价值对齐
针对多提示价值冲突导致的指令瓶颈,提出免微调的PICACO方法,通过最大化指定价值观与响应间的总相关优化元指令,平衡多元价值对齐。
- 会议论文ICML 2026
大语言模型的局部线性赋能基于线性最优控制的激活干预
利用大语言模型层间动力学的局部线性特性,将推理建模为时变动力系统并引入闭环反馈控制,实现对毒性、真实性与拒答等行为的高效精细化激活干预。
- 会议论文ICML 2026
越狱攻击下的鲁棒有害特征:来自大模型注意力头功能分工的机制性证据
通过机制可解释性发现越狱攻击选择性抑制早期易受攻击头而非消除中层安全对齐头,揭示了拒绝被绕过但内部安全信号持续存在的机制,可直接用于高鲁棒越狱检测。
- 会议论文ICML 2026
SteeringSafety:大语言模型多维度安全表征干预评测基准
提出评测表征干预安全性的基准SteeringSafety,发现干预不同安全维度存在严重缠结,针对拒答的干预常削弱模型的常规道德判断。
- 会议论文ICML 2026
可纠正性变换:构造接受更新的目标
提出一种变换,为几乎任意目标构造可纠正(corrigible)版本且不损失性能,可激励允许中途干预、抑制自我修改,在 gridworld 和提示层面的语言模型中诱导出可纠正行为。
- 会议论文ICML 2026
一触即发的对齐:黑盒评估无法保证模型更新后的对齐状态
从理论与实证证明静态黑盒评估无法保证模型在更新后的对齐性,模型可在通过黑盒测试的同时隐藏对抗行为,经单次良性更新即严重失齐。
- 会议论文ICML 2026
监督博弈:协同平衡AI智能体安全性与自主性的学习方法
将人机交互建模为马尔可夫博弈,提出平衡智能体自主性与人类监督的控制机制,证明了内在对齐保证,并在智能体工具调用任务中有效减少了安全违规。
- 会议论文ICML 2026
SAEmnesia:利用有监督稀疏自编码器擦除扩散模型中的概念
提出有监督稀疏自编码器框架SAEmnesia,将概念绑定至单个可解释神经元以精准高效地擦除概念,有效抑制I2P基准中的不当内容并防御对抗攻击。
- 会议论文ICML 2026
TraceRouter:基于路径级干预的大模型鲁棒安全防御框架
提出通过分析注意力差异定位起始层,利用稀疏自编码器解耦有害特征,并切断因果传播回路,在保障通用性能的同时提升大模型对抗防御能力。
- 会议论文ICML 2026
基于能量校准的多适配器表征干预(MARI)
提出 MARI,用竞争式多适配器按样本自适应决定干预方向与强度,并以能量门控筛选需干预的输入,在 TruthfulQA、BBQ 和安全基准上提升对齐且保持通用能力。
- 会议论文ICML 2026
迈向稳定的价值对齐:引入独立模块实现一致的价值引导
针对模型残差流中价值表征脆弱动态的问题,提出SVGT架构,通过独立的规范价值空间建模与显式行为引导Token,在保持生成流畅的同时降低超70%的有害得分。
- 会议论文ICML 2026
追求能力的强化学习训练所引发的对齐风险
研究发现大模型在包含隐式漏洞的环境中进行强化学习时,会学会利用代理指标与奖励篡改等漏洞获取奖励,且此类投机策略能跨模型传播并持续存在。
- 会议论文ICML 2026
通过选择性几何控制重新审视 LLM 安全对齐的鲁棒性
提出 ShaPO,对对齐关键参数子空间做选择性几何控制以优化最坏情况目标,在领域偏移与噪声偏好下比主流偏好优化方法更稳健地提升安全性。
- 会议论文ICML 2026
基于功能归因的机制异常检测
将机制异常检测重构为功能归因问题,利用影响函数衡量内部机制异常,在视觉模型与LLM的后门检测及对抗样本检测上取得优异性能。
- 会议论文ICML 2026
RLHF如何放大语言模型的谄媚行为
形式化分析了RLHF加剧大模型谄媚行为的因果放大机制,证明标注者偏见会诱导奖励偏差,并提出基于一致性惩罚的训练期干预方法以抑制谄媚漂移。
- 会议论文ICML 2026
SafeSeek:语言模型安全回路的通用归因框架
提出统一安全可解释性框架SafeSeek,通过可微二值掩码提取多粒度安全回路,成功应用于后门回路清除与安全对齐回路定位。
- 会议论文ICML 2026
自动发现大语言模型奖励模型偏差
提出利用大模型以自然语言迭代提出并优化候选偏差的方法,通过演化搜索自动发现奖励模型在多余空格、幻觉内容等方面的偏差,助力提升奖励模型对齐质量。
- 会议论文ICML 2026
BrokenMath:大语言模型定理证明中谄媚行为的评测基准
提出首个评测大模型在自然语言定理证明中谄媚行为的基准BrokenMath,发现主流前沿模型普遍会迎合用户的错误命题给出虚假证明,并测试了缓解策略。