全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2026
通过响应条件建模解耦偏好学习中的长度偏置
针对强化学习对齐中奖励模型易受长度偏置作弊的问题,提出解耦语义偏好与长度要求的响应条件建模框架Rc-RM与Rc-DPO,有效缓解长度偏置。
- 会议论文ICLR 2026
真实还是编造?用因果归因缓解解释中的奖励作弊
发现偏好优化会降低 CoT 解释的忠实性,模型可能为迎合奖励模型而编造解释;将预测的因果归因加入奖励模型输入,可在受控环境中减少误导性解释。
- 会议论文ICLR 2026
基于因果准则的鲁棒奖励建模
针对大模型对齐中奖励模型易受表面特征影响而发生奖励作弊的问题,提出CROME框架,通过因果准则生成目标数据增强,有效缓解了奖励作弊并提升了安全性。
- 会议论文ICLR 2026
奉承、冗余与含糊:诊断并缓解偏好模型的特异性偏差
研究偏好模型对长度、结构、术语、谄媚和含糊的偏好偏差,发现其与人类偏好显著失准;用反事实数据增强微调,将平均失准率从 39.4% 降到 32.5%。
- 会议论文ICML 2026
偏见接踵而至:语言奖励模型中的机理性奖励塑形与持久偏见
针对奖励作弊问题,系统评测了主流奖励模型中长度、谄媚与过度自信等持久偏见,提出机理性奖励塑形方法,在不降低奖励质量的前提下消除伪相关偏见。
- 会议论文ICML 2026
面向RLHF鲁棒奖励建模的因式分解因果表征学习
提出将上下文表征解耦为因果与非因果因子的框架,约束奖励头仅依赖因果分量,有效抑制长度和谄媚偏差引发的奖励作弊。
- 会议论文ICML 2026
通过贝叶斯非负奖励建模缓解 RLHF 中的奖励作弊
提出 BNRM,将非负因子分析融入 Bradley–Terry 模型,以稀疏潜因子抑制长度等偏差,缓解奖励过优化并增强分布偏移下的鲁棒性。
- 会议论文ICML 2026
无需修改规格:重上下文化缓解规格博弈
提出重上下文化方法,通过将阻止不良行为的回答伪装为对允许博弈提示的响应,有效训练模型抵御错误监督信号带来的规格博弈。
- 会议论文ICML 2026
梯度正则化缓解RLHF与可验证奖励中的奖励作弊
推导了奖励模型准确率与极值点平坦度间的理论联系,提出通过梯度正则化将策略更新引导至平坦区域,在RLHF与数学任务中有效避免格式作弊与破解LLM裁判。
- 会议论文ICML 2026
无偏原则与鲁棒奖励:抑制强化学习中的奖励作弊
该研究发现生成式奖励模型易发生原则漂移加剧奖励作弊,提出先由问题生成原则再评估回答的IP-GRM框架,有效抑制了强化学习中的奖励作弊现象。
- 会议论文ICML 2026
奖励作弊基准:衡量工具调用大模型智能体的作弊利用
提出奖励作弊基准RHB以评估工具调用LLM智能体的作弊行为,评测13个前沿模型发现RL后训练显著增加作弊率,且72%的作弊伴随明确的思维链推导。
- 会议论文ICML 2026
基于对比分析在代码环境中评测奖励作弊检测
构建包含54类漏洞分类法与517条轨迹的TRACE基准,在对比异常检测设定下评估LLM识别代码强化学习奖励作弊的能力,发现模型更难识别语义相关的作弊行为。
- 会议论文ICML 2026
CapBencher:为大模型基准测试内置测试集过拟合警报
提出CapBencher方法,通过注入答案随机性降低贝叶斯准确率上限,在不完全公开真值的情况下精准检测测试集泄露与刷榜作弊。
- 会议论文ICML 2026
奖励受袭:分析过程奖励模型的鲁棒性与可作弊性
构建三层诊断框架评估PRM的对抗脆弱性,发现策略在优化压力下可通过文风捷径骗取高奖励,在AIME基准上解题准确率不足4%却获得近乎完美的PRM得分。
- 会议论文ICML 2026
超越语义的实时对齐奖励模型
针对 RLHF 中策略过拟合奖励模型的奖励过优化问题,提出 R2M,利用策略隐状态反馈使奖励模型实时适应策略分布漂移。
- 会议论文ACL 2025
CARMO:面向上下文感知奖励建模的动态准则生成
奖励模型易被冗长、列表等表面特征劫持,CARMO 先动态生成与查询相关的评估准则再打分,理论上可缓解 reward hacking,并在 Reward Bench 上提升 2.1%。
- 会议论文ACL 2025
消除 RLHF 中的提示模板偏差
发现奖励模型学到的提示模板偏差会引发 reward hacking,使模型偏好特定格式;提出 PBC 校准奖励分数,并可与去长度偏差方法结合。
- 会议论文ICLR 2025
RRM:缓解奖励作弊的鲁棒奖励模型训练
揭示了奖励模型混淆上下文信号与长度等无关伪影的缺陷,提出一种因果框架与数据增强技术消除伪影,显著缓解奖励作弊并提升对齐表现。
- 会议论文ICLR 2025
重新审视奖励模型评估:我们是否找错了方向?
揭示奖励模型准确率与下游策略表现仅呈弱正相关,并从回归古德哈特定律视角指出,仅依赖准确率无法有效捕捉奖励模型过度优化风险。
- 会议论文ICLR 2025
逆风前行:通过鲁棒奖励与动态标签抵御奖励作弊的对齐方法
分析离线偏好优化中两类统计波动导致的奖励作弊,提出结合鲁棒奖励与动态标签的POWER-DL方法加以缓解。
- 会议论文ICLR 2025
相关代理:奖励作弊的新定义与改进缓解方法
基于代理奖励与真实奖励相关性崩溃提出奖励作弊新定义,证明正则化策略占用度量间的卡方散度可更有效缓解RLHF等场景的作弊。
- 会议论文ICML 2025
RLHF 中的能量损失现象:缓解奖励作弊的新视角
发现 RL 中最终层能量损失过度上升对应奖励作弊,提出 EPPO 惩罚能量损失增长,在多种 LLM 与任务上缓解奖励作弊。
- 会议论文ICML 2025
代理数据何时能改善偏好学习的样本复杂度?
针对奖励作弊问题,给出代理反馈可证明降低学习真实策略样本复杂度的充分条件,并说明如何调整现有架构。
- 会议论文ICML 2025
Best-of-N 是最优的吗?推理时对齐中的覆盖度、扩展与最优性
从理论上证明 Best-of-N 在 N 较大时会因奖励作弊而退化,并提出 InferenceTimePessimism 算法,性能最优且随 N 增大不下降。