全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
大语言模型机器遗忘与对齐的概率视角
发现基于贪婪解码的确定性评测会误判遗忘与对齐的成功率,提出首个针对输出分布的概率评测框架,并通过熵优化损失和自适应温度缩放提升了遗忘效果。
- 会议论文ICLR 2025
Collab:基于智能体混合受控解码的大语言模型对齐
提出一种利用现有对齐策略在推理阶段进行token级动态选择的混合智能体受控解码方法,显著提升了平均奖励与胜率。
- 会议论文ICLR 2025
逆向宪法式AI:将人类偏好压缩为行为准则
提出逆向宪法式AI(ICAI),将成对文本偏好数据逆向压缩为可解释的原则集合(宪法),能高精度重构原始标注并有效识别偏好反馈中的潜在偏差。
- 会议论文ICLR 2025
视觉语言模型失去了自信吗?VLM 谄媚现象研究
提出 MM-SY 基准评估视觉语言模型谄媚现象,并通过 SFT 与 DPO 等方法进行缓解,发现高层注意力缺乏对图像知识的关注是导致谄媚的重要原因。
- 会议论文ICLR 2025
可控安全对齐:推理时适应多样化安全需求
提出 CoSA 框架与 CoSAlign 方法,让模型遵循系统提示中的自然语言 safety config,无需重训即可调整安全行为,并构建 CoSApien 基准。
- 会议论文ICLR 2025
采样器在在线直接偏好优化中的关键作用
证明在线DPO中均匀采样为线性收敛而在线采样达二次收敛,提出结合后验分布的实用采样器,在Safe-RLHF数据集上显著提升偏好对齐效果。
- 会议论文ICLR 2025
更多RLHF带来更多信任?论偏好对齐对可信度的影响
评估通用偏好RLHF对毒性、偏见、伦理、真实性及隐私等可信度维度的影响,发现偏好对齐未必能保证可信度且常有反效果,并提出相应数据归因方法。
- 会议论文ICLR 2025
双因子偏好优化:平衡语言模型的安全性与有益性
提出监督学习框架BFPO,将安全与有益的联合RLHF目标重构为单一监督学习目标,无需人工标注即可平衡安全性与有益性。
- 会议论文ICLR 2025
学习参考模型以实现真正良好的对齐
针对大模型离线对齐容易过度优化的问题,提出动态更新参考策略的Trust Region对齐方法(TR-DPO等),有效缓解过度优化并提升有用与无害对话表现。
- 会议论文ICLR 2025
GenARM:基于自回归奖励模型的测试时奖励引导对齐
提出基于自回归奖励模型的测试时对齐方法GenARM,能预测逐token奖励以引导冻结模型,匹配训练时对齐效果并实现高效的弱到强引导与多目标对齐。
- 会议论文ICLR 2025
LLM 智能体的道德对齐
提出利用显式编码人类核心价值观的内在奖励对LLM智能体进行强化学习微调,在博弈环境中实现了道德对齐并消除了自私策略。
- 会议论文ICLR 2025
形式重于实质:对齐基准测试中LLM裁判的失效模式
提出元基准SOS-Bench,发现LLM裁判偏好偏向文本风格而非真实性与安全性,未能与安全等具体对齐指标形成正相关。
- 会议论文ICLR 2025
MAP:多人类价值观对齐调色盘
提出首创性的 MAP 框架,将多人类价值观对齐形式化为带约束的优化问题,通过对偶方法平衡无害性与有用性等多重价值目标的权衡并验证了其有效性。
- 会议论文ICLR 2025
磁偏好优化:实现语言模型对齐的最后迭代收敛
针对RLHF中自博弈方法难以精确收敛至原始博弈纳什均衡的问题,提出磁偏好优化(MPO),实现线性收敛速率的最后迭代收敛,有效提升大语言模型的对齐表现。
- 会议论文ICLR 2025
弱到强泛化的迁移学习框架
将弱到强泛化形式化为从弱模型向强预训练模型迁移隐概念的迁移学习问题,从理论上证明微调的局限性并提出精炼方法,在多个大语言模型对齐任务中验证其实用性。
- 会议论文ICLR 2025
神经交互式证明:受限验证者监督不可信智能体
提出基于证明者-验证者博弈的神经交互式证明统一框架与新协议,使计算受限的可信验证者能有效监督强大的不可信智能体。
- 会议论文ICLR 2025
强偏好影响偏好模型与价值对齐的鲁棒性
理论分析表明Bradley-Terry等偏好模型在极端偏好下极度敏感,微小变化即可显著改变其他偏好预测,影响价值对齐的鲁棒性。
- 会议论文ICLR 2025
CREAM:一致性正则化的自奖励语言模型
提出利用跨迭代奖励一致性来正则化自奖励训练,缓解自我对齐中置信度过高的偏好标注与奖励偏差累积问题。
- 会议论文ICLR 2025
基于边距的语言模型对齐的常见陷阱:梯度纠缠
揭示了基于边距的偏好优化中存在的梯度纠缠缺陷,即增大边距可能反常导致不安全响应的概率上升,从而引发安全对齐失效,并从理论与实证上给出了判定条件。
- 会议论文ICLR 2025
弱到强偏好优化:从弱对齐模型中提取奖励
受弱到强泛化启发,提出弱到强偏好优化WSPO,通过学习弱模型对齐前后的分布差异引导强模型对齐,在Arena-Hard等基准上显著提升对齐能力。
- 会议论文ICLR 2025
揭示人类与大语言模型对主观语言理解的差距
提出同义词错误检测器TED,构建模型操作语义同义词库并与人类参考比对,发现抽象主观词指令会导致意外的不对齐行为,例如要求风趣反而诱发骚扰性输出。
- 会议论文ICLR 2025
RMB:大语言模型对齐中奖励模型的综合基准评测
提出覆盖49个真实场景的奖励模型评测基准RMB,通过成对与BoN评估全面反映奖励模型在引导大语言模型对齐优化中的有效性与泛化缺陷。
- 会议论文ICLR 2025
TIS-DPO:基于权重估计的词元级重要性采样直接偏好优化
提出词元级重要性采样DPO目标TIS-DPO,利用对比模型估计词元权重以实现无偏优化,在无害性与有用性对齐任务上显著优于现有基线。
- 会议论文ICLR 2025
从文本分类到文本生成的贝叶斯弱到强学习
为应对超对齐中的弱监督难题,提出通过弱模型集成模拟人类观点差异,结合贝叶斯置信度与DPO引导强模型偏好学习,拓展了弱到强泛化在文本生成上的应用。