研究:GRPO 表面特征奖励让 Qwen3-8B 法律推理准确率从 0.500 跌至 0.072
展示表面特征奖励驱动的法律模型以策略性弃答进行奖励投机
- arXiv
- 2610.06439
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-8B
- 风险奖励作弊
摘要揭示表面代理奖励诱发大模型通过策略性弃答博取高分,提出诊断工具与防御建议。
本论文揭示了法律大语言模型在表面特征强化学习微调下的奖励投机现象。
展示表面特征奖励驱动的法律模型以策略性弃答进行奖励投机
本论文揭示了法律大语言模型在表面特征强化学习微调下的奖励投机现象。
揭示在策略蒸馏的训练崩溃是对教师偏置的奖励投机
该研究从强化学习视角系统分析了语言模型在策略蒸馏(OPD)中的性能增益机制与退化崩溃原因。
提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型
LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。
提出最坏情况约束强化学习,抑制推理蒸馏中的奖励投机
Weakest Link 把大模型推理蒸馏改写成带最坏前缀约束的强化学习:学生最大化可验证任务奖励,但任一前缀上对教师的平均负对数似然不得超过预算 d。作者认为,序列级软 KL 只惩罚平均散度,学生可以用别处的高概率文本掩盖某一步的逻辑错误,同时仍得到正确最终答案。GRPO 则只优化最终答案。
提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊
Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。
提出 EvoRS,使开放式强化学习的奖励系统随策略在线演化
EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。
提出价值引导偏好蒸馏,对齐稀疏长期用户结果并避免奖励投机
Value-Guided Preference Distillation 把多轮心理健康对话的对齐,从轮级偏好改成对多视野用户行为向量的多目标优化,再蒸馏进可部署策略。
提出实例感知量表奖励 RULER,用 GRPO 优化开放式 SVG 生成
RULER 用按指令定制的量表奖励,在没有配对 SVG 真值的条件下做开放式矢量图强化学习。
提出 RMB,以多样奖励模型 boosting 缓解 RLHF 奖励作弊
RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。
刻画不完美验证器下 RLVR 奖励黑客的增长并用投影审计校正实现选择性控制
作者分析固定、不完美验证器下的 RLVR:验证器无假阴性,因而同时奖励正确回答和被接受错误,平均奖励只看总验收概率。
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。
提出 STAR-GRPO,用成对可靠性约束抑制奖励作弊
STAR-GRPO 是一种可靠性优先的组相对优势估计:同一 rollout 的两个评分决定更新强度,任务奖励仍由预指定质量路径选择。