全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
用偏差拟合缓解 RLHF 中奖励模型的长度偏差
提出 FiMi-RM,拟合并校正奖励模型中长度与奖励的非线性关系,缓解长度偏差型奖励作弊,在 DPO 和 BoN 上降低冗长。
- 会议论文ACL 2026
TNT:缓解混合推理模型强化学习中的奖励作弊
利用思考模式答案为非思考回答设置逐题长度限制,约减半用量并提高准确率,非思考回答中的奖励作弊比例低于10%。
- 会议论文ACL 2026
TRAC:以自适应校准的教师词元奖励实现稳健策略优化
针对教师噪声诱发奖励作弊的问题,从题目、轨迹和词元三级校准教师奖励,实验显示可减轻噪声并提升推理能力与训练稳定性。
- 会议论文ACL 2026
PRISM:具有内在结构建模的概率奖励模型
用高斯混合建模奖励分布以区分主观偏好与认知不确定性,准确率和泛化优于标量基线,并在下游 RL 中缓解奖励作弊。
- 会议论文ACL 2026
用评分细则奖励治愈数学推理中的“奇迹步骤”
发现模型在数学推理中通过奖励作弊以不严谨过程得到正确答案,提出 Rubric Reward Model 评估整条推理轨迹,使“奇迹步骤”减少 71%,AIME2024 的 Verified Pass@1024 从 26.7% 升至 62.6%。
- 会议论文ACL 2026
重新审视可验证奖励强化学习中的选择题:通过干扰项设计释放潜力
研究选择题训练中的猜测与排除捷径,提出迭代干扰项构建方法,以高质量干扰项抑制奖励作弊并提升训练效果。
- 会议论文ACL 2026
LCO:以约束优化缓解智能体的奖励作弊
通过执行前安全约束推演与受约束的进化探索,无需微调即可缓解上下文奖励作弊,并在实验中保持任务表现。
- 会议论文ACL 2026
训练语言模型将Prolog用作工具
研究强化学习训练模型调用Prolog,发现仅奖励正确性会使模型绕过符号推理,而奖励符号结构虽提升可审计性,却牺牲准确率。
- 会议论文ACL 2026
修补漏洞:缓解多语言翻译强化学习中的奖励作弊
发现强化学习会放大翻译质量评估模型的漏洞,提出结合词语与语言对齐的WALAR,在1414个翻译方向上优于LLaMAX。
- 会议论文ACL 2026
以分层多步奖励模型增强大语言模型推理
针对过程奖励模型易受奖励作弊影响的问题,联合评估单步与连续推理并压缩节点增强数据,在数学基准上提升评估稳定性与泛化。
- 会议论文ACL 2026
通过评估器压力测试检测强化学习与大模型对齐中的代理指标作弊
提出评估器压力测试,用受控扰动区分评估漏洞利用与真实改进,并通过闭环缓解提高大模型的人类评估胜率、减少强化学习中的奖励作弊。
- 会议论文ICLR 2026
Bradley-Terry与多目标奖励建模具有互补性
针对RLHF在分布外场景下容易发生奖励作弊的问题,该研究联合训练单目标BT与多目标回归奖励函数,显著增强了奖励模型缓解奖励作弊的能力与评分表现。
- 会议论文ICLR 2026
从好奇到谨慎:用悲观原则缓解 Best-of-N 中的奖励作弊
提出 caution 方法,训练误差模型并惩罚非典型回复的奖励估计,在 BoN 采样中显著缓解奖励作弊,并在简化线性设定下给出理论保证。
- 会议论文ICLR 2026
是思考还是作弊?通过衡量推理工作量检测隐式奖励作弊
针对能避开思维链监控的隐式奖励作弊,提出通过逐步截断思维链并衡量推理工作量来检测模型钻奖励漏洞的方法TRACE。
- 会议论文ICLR 2026
通过相关代理奖励鲁棒优化缓解奖励作弊
将奖励作弊建模为相关代理奖励空间上的鲁棒策略优化问题,提出最大最小化规划方法,在最坏情况下显著提升了强化学习策略的鲁棒性与表现。
- 会议论文ICLR 2026
统一 RLHF 中的稳定优化与参考正则化
提出统一正则化目标,同时兼顾防止奖励作弊的 KL 约束与稳定更新的策略裁剪,在多个基准上优于 RLHF 和在线偏好学习方法。
- 会议论文ICLR 2026
ImpossibleBench:评测LLM利用测试用例作弊的倾向
构建ImpossibleBench基准,通过在规范与单元测试间制造冲突来量化LLM智能体的测试作弊行为,分析作弊机制并为开发监控工具提供测试平台。
- 会议论文ICLR 2026
通过响应条件建模解耦偏好学习中的长度偏置
针对强化学习对齐中奖励模型易受长度偏置作弊的问题,提出解耦语义偏好与长度要求的响应条件建模框架Rc-RM与Rc-DPO,有效缓解长度偏置。
- 会议论文ICLR 2026
真实还是编造?用因果归因缓解解释中的奖励作弊
发现偏好优化会降低 CoT 解释的忠实性,模型可能为迎合奖励模型而编造解释;将预测的因果归因加入奖励模型输入,可在受控环境中减少误导性解释。
- 会议论文ICLR 2026
基于因果准则的鲁棒奖励建模
针对大模型对齐中奖励模型易受表面特征影响而发生奖励作弊的问题,提出CROME框架,通过因果准则生成目标数据增强,有效缓解了奖励作弊并提升了安全性。
- 会议论文ICLR 2026
奉承、冗余与含糊:诊断并缓解偏好模型的特异性偏差
研究偏好模型对长度、结构、术语、谄媚和含糊的偏好偏差,发现其与人类偏好显著失准;用反事实数据增强微调,将平均失准率从 39.4% 降到 32.5%。
- 会议论文ICML 2026
偏见接踵而至:语言奖励模型中的机理性奖励塑形与持久偏见
针对奖励作弊问题,系统评测了主流奖励模型中长度、谄媚与过度自信等持久偏见,提出机理性奖励塑形方法,在不降低奖励质量的前提下消除伪相关偏见。
- 会议论文ICML 2026
面向RLHF鲁棒奖励建模的因式分解因果表征学习
提出将上下文表征解耦为因果与非因果因子的框架,约束奖励头仅依赖因果分量,有效抑制长度和谄媚偏差引发的奖励作弊。
- 会议论文ICML 2026
通过贝叶斯非负奖励建模缓解 RLHF 中的奖励作弊
提出 BNRM,将非负因子分析融入 Bradley–Terry 模型,以稀疏潜因子抑制长度等偏差,缓解奖励过优化并增强分布偏移下的鲁棒性。