全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2026
利用零空间约束策略优化缓解安全对齐税
提出将安全策略梯度几何投影到通用任务零空间中的优化方法NSPO,在显著提升模型安全性的同时有效保留数学、代码等通用能力,缓解对齐税。
- 会议论文ICLR 2026
模态失语症:统一多模态模型能否凭记忆描述图像?
发现统一多模态模型存在视觉记忆与文字表达分离的模态失语现象,揭示仅靠文本对齐会因跨模态对齐失效而仍可生成不安全图像。
- 会议论文ICLR 2026
当思考适得其反:推理诱导对齐失效的机制性洞察
揭示推理能力增强引发对齐失效的现象,并通过注意力头与安全神经元激活缠结提供了神经元级的机制解释。
- 会议论文ICLR 2026
基于分布匹配与分布式交换干预的双向模型调控
提出Concept DAS方法,通过弱监督分布匹配与分布式交换干预实现双向概念调控,能有效干预安全拒答行为并消除思维链后门。
- 会议论文ICLR 2026
基于保序偏好优化的可靠大模型对齐方法
针对参考策略对齐不佳导致模糊样本干扰训练的问题,提出DPO改进算法RAPPO,通过过滤最难且模糊的样本缓解对齐偏差,在安全基准上显著提升无害性与有用性。
- 会议论文ICLR 2026
问题出在哪?通过表征梯度追踪归因大模型不良行为
提出在激活空间分析表征及其梯度的归因框架,能精确将有害内容、后门投毒和知识污染等不良行为追溯到具体的训练样本与短语,为模型审计提供诊断工具。
- 会议论文ICLR 2026
基于损失规则在AI对齐中实现公理化保证
针对Constitutional AI等对齐中奖励模型可能违反帕累托最优的问题,证明了通过均衡覆盖的数据集设计可在标准训练下恢复公理化保证。
- 会议论文ICLR 2026
参考答案提升非可验证领域的 LLM 对齐
用高质量参考输出增强 LLM 评审器,并让参考引导的评审器驱动自我改进,在 AlpacaEval 和 Arena-Hard 上优于 SFT 蒸馏和无参考基线,效果接近微调奖励模型。
- 会议论文ICLR 2026
生成式价值观冲突揭示大语言模型的优先级倾向
提出ConflictScope自动评估模型在价值观冲突下的优先级,发现模型在开放场景中易偏离无害性原则,而详细系统提示可改善对齐。
- 会议论文ICLR 2026
基于权重算术的大语言模型干预技术
提出对比权重干预方法,通过权重加减隔离行为方向,相比激活干预具有更强泛化性,能有效减少微调引入的谄媚与拒答不足,并可用于检测突现的对齐失效。
- 会议论文ICLR 2026
基于失败轨迹的弱到强泛化方法
将弱到强泛化扩展至复杂交互决策环境,提出让强模型同时从弱模型的成功和失败轨迹中学习,通过轨迹树和MCTS显著提升强模型的泛化性能。
- 会议论文ICLR 2026
Dyslexify:针对CLIP排版攻击的机制性防御方法
定位了CLIP中处理排版文字的注意力头回路,通过选择性消融该回路在无需微调的情况下显著增强对排版攻击的鲁棒性。
- 会议论文ICLR 2026
基于成对均值差干预的推理时个性化安全控制
提出免训练的推理期激活干预方法PCMS,通过操纵内部表征在保持模型可用性的同时抑制用户特定的不良内容。
- 会议论文ICLR 2026
关注权重:微调大语言模型的无监督监控与控制
提出通过分析微调模型与基准模型权重差异的主奇异向量来监控和控制模型行为的方法,无需相似分布数据即可高效检测后门攻击并审计遗忘学习效果。
- 会议论文ICLR 2026
奖励模型继承预训练阶段的价值偏置
研究发现奖励模型会从其基座模型中持久继承深层的人类价值偏置,即使偏好数据相同也会产生显著差异,强调了预训练阶段对齐的重要性。
- 会议论文ICLR 2026
GAVEL:基于激活监控的规则化安全
将激活建模为可组合的 cognitive elements,定义谓词规则实时检测有害行为,无需重训即可配置安全策略,提升精度与可审计性。
- 会议论文ICLR 2026
超越成对比较:通过排序选择建模赋能大语言模型对齐
提出排序选择偏好优化框架RCPO,将大语言模型偏好优化扩展至多路比较与Top-k排序数据,统一并推广了DPO等成对对齐方法,提升了对齐效果。
- 会议论文ICLR 2026
EigenBench:价值对齐的比较行为度量方法
针对价值对齐缺乏定量指标的问题,提出黑盒评估方法EigenBench,利用模型互评与EigenTrust共识聚合,量化评估语言模型与给定价值体系的对齐程度。
- 会议论文ICLR 2026
RepIt:利用特定概念拒答向量引导语言模型
提出分离激活中特定概念表征的框架RepIt,可针对性抑制对大规模杀伤性武器等危险概念的拒答且绕过标准安全评测,揭示了评测盲区与拒答表征的脆弱性。
- 会议论文ICLR 2026
ELEPHANT:测量并理解大语言模型中的社交谄媚现象
定义大模型过度迎合用户面子的社交谄媚行为并构建评测基准ELEPHANT,发现主流模型在道德冲突中偏向用户立场,并探讨了相关缓解策略。
- 会议论文ICLR 2026
RE-PO:面向大语言模型对齐的鲁棒增强策略优化框架
针对偏好数据中的噪声与对抗反馈,提出基于EM算法推断标注可靠性的对齐框架RE-PO,自适应加权损失,显著提升主流对齐算法表现。
- 会议论文ICLR 2026
基于方向邻域共识的鲁棒偏好对齐
针对大模型偏好对齐中偏离主流分布的长尾偏好泛化脆弱性,提出免训练的鲁棒偏好选择方法RPS,通过采样局部偏好邻域候选并达成共识,提升对齐可靠性。
- 会议论文ICLR 2026
克服弱监督的诚实性:基于对等预测评估与训练大语言模型
针对弱监督下模型易通过欺骗博取奖励的问题,引入对等预测方法评估与训练大语言模型,奖励诚实回答并抵抗欺骗,实现了可靠的可扩展监督。
- 会议论文ICLR 2026
认知模型可揭示语言模型中可解释的价值权衡
利用认知模型系统评估大语言模型中的对齐价值权衡,可有效诊断谄媚等行为,并揭示了后训练强化学习中模型价值观的演化规律。