全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2026
LitmusValues:通过AI风险困境石蕊测试AI价值优先级
提出LitmusValues评估流程与AIRiskDilemmas困境数据集,通过测定AI在冲突情境下的价值优先级,有效预测其潜在风险与有害行为。
- 会议论文ICLR 2026
对齐审计器:验证与优化大模型目标的贝叶斯框架
提出基于贝叶斯逆强化学习的对齐审计框架,通过推断目标分布量化非可辨识性并暴露虚假捷径,为安全团队提供验证大模型真实对齐目标的工具。
- 会议论文ICLR 2026
Humanline:将在线对齐视为感知损失
从行为经济学前景理论解释在线对齐优势,提出将概率感知偏差融入DPO等目标的Humanline变体,使离线数据达到在线对齐效果。
- 会议论文ICLR 2026
TrustGen:生成式基础模型可信度动态评测平台
提出跨模态生成模型可信度动态评测平台TrustGen,涵盖真实性、安全性与伦理等25个维度,评测发现开源模型已匹敌闭源,且可信度与有用性存在复杂权衡。
- 会议论文ICLR 2026
接种提示:在训练中诱发特征可减少测试期的特征表达
提出在微调数据前添加诱发不良特征的系统提示,使模型在测试期显著减少该特征表达,有效缓解狭窄微调导致的涌现对齐失效与后门攻击。
- 会议论文ICLR 2026
利用零空间约束策略优化缓解安全对齐税
提出将安全策略梯度几何投影到通用任务零空间中的优化方法NSPO,在显著提升模型安全性的同时有效保留数学、代码等通用能力,缓解对齐税。
- 会议论文ICLR 2026
模态失语症:统一多模态模型能否凭记忆描述图像?
发现统一多模态模型存在视觉记忆与文字表达分离的模态失语现象,揭示仅靠文本对齐会因跨模态对齐失效而仍可生成不安全图像。
- 会议论文ICLR 2026
基于保序偏好优化的可靠大模型对齐方法
针对参考策略对齐不佳导致模糊样本干扰训练的问题,提出DPO改进算法RAPPO,通过过滤最难且模糊的样本缓解对齐偏差,在安全基准上显著提升无害性与有用性。
- 会议论文ICLR 2026
基于损失规则在AI对齐中实现公理化保证
针对Constitutional AI等对齐中奖励模型可能违反帕累托最优的问题,证明了通过均衡覆盖的数据集设计可在标准训练下恢复公理化保证。
- 会议论文ICLR 2026
参考答案提升非可验证领域的 LLM 对齐
用高质量参考输出增强 LLM 评审器,并让参考引导的评审器驱动自我改进,在 AlpacaEval 和 Arena-Hard 上优于 SFT 蒸馏和无参考基线,效果接近微调奖励模型。
- 会议论文ICLR 2026
生成式价值观冲突揭示大语言模型的优先级倾向
提出ConflictScope自动评估模型在价值观冲突下的优先级,发现模型在开放场景中易偏离无害性原则,而详细系统提示可改善对齐。
- 会议论文ICLR 2026
基于失败轨迹的弱到强泛化方法
将弱到强泛化扩展至复杂交互决策环境,提出让强模型同时从弱模型的成功和失败轨迹中学习,通过轨迹树和MCTS显著提升强模型的泛化性能。
- 会议论文ICLR 2026
奖励模型继承预训练阶段的价值偏置
研究发现奖励模型会从其基座模型中持久继承深层的人类价值偏置,即使偏好数据相同也会产生显著差异,强调了预训练阶段对齐的重要性。
- 会议论文ICLR 2026
超越成对比较:通过排序选择建模赋能大语言模型对齐
提出排序选择偏好优化框架RCPO,将大语言模型偏好优化扩展至多路比较与Top-k排序数据,统一并推广了DPO等成对对齐方法,提升了对齐效果。
- 会议论文ICLR 2026
EigenBench:价值对齐的比较行为度量方法
针对价值对齐缺乏定量指标的问题,提出黑盒评估方法EigenBench,利用模型互评与EigenTrust共识聚合,量化评估语言模型与给定价值体系的对齐程度。
- 会议论文ICLR 2026
ELEPHANT:测量并理解大语言模型中的社交谄媚现象
定义大模型过度迎合用户面子的社交谄媚行为并构建评测基准ELEPHANT,发现主流模型在道德冲突中偏向用户立场,并探讨了相关缓解策略。
- 会议论文ICLR 2026
RE-PO:面向大语言模型对齐的鲁棒增强策略优化框架
针对偏好数据中的噪声与对抗反馈,提出基于EM算法推断标注可靠性的对齐框架RE-PO,自适应加权损失,显著提升主流对齐算法表现。
- 会议论文ICLR 2026
基于方向邻域共识的鲁棒偏好对齐
针对大模型偏好对齐中偏离主流分布的长尾偏好泛化脆弱性,提出免训练的鲁棒偏好选择方法RPS,通过采样局部偏好邻域候选并达成共识,提升对齐可靠性。
- 会议论文ICLR 2026
克服弱监督的诚实性:基于对等预测评估与训练大语言模型
针对弱监督下模型易通过欺骗博取奖励的问题,引入对等预测方法评估与训练大语言模型,奖励诚实回答并抵抗欺骗,实现了可靠的可扩展监督。
- 会议论文ICLR 2026
认知模型可揭示语言模型中可解释的价值权衡
利用认知模型系统评估大语言模型中的对齐价值权衡,可有效诊断谄媚等行为,并揭示了后训练强化学习中模型价值观的演化规律。
- 会议论文ICLR 2026
自诊断对齐:偏好对齐中融合内在反馈的元学习范式
针对训练数据噪声破坏偏好对齐的问题,提出让模型进行自我诊断的元学习范式,融合一致性与置信度等内在反馈自适应重加权样本,提升偏好对齐的鲁棒性。
- 会议论文ICLR 2026
Command-V:免训练的表示微调迁移
无需反向传播,把捐赠模型的残差表示适配器迁移到不同架构的模型;在增强安全拒答、促成越狱和自动 CoT 推理三个案例中,效果可比直接微调且资源消耗低得多。
- 会议论文ICLR 2026
AdAEM:自适应且自动扩展的大语言模型价值差异度量
提出自扩展评测算法AdAEM,通过上下文优化探测跨文化多模型的内部价值边界并提取争议性话题,自适应生成新问题以持续追踪模型的价值差异与对齐动态。
- 会议论文ICLR 2026
OrthAlign:基于正交子空间分解的无冲突多目标对齐
提出利用正交子空间分解解决多目标偏好对齐中的梯度冲突,从参数层面平衡大语言模型的有用性、无害性与真实性。