防御arXiv 2610.00332
最弱一环:用最坏情况约束强化学习蒸馏 LLM 推理能力
提出最坏情况约束强化学习,抑制推理蒸馏中的奖励投机
- arXiv
- 2610.00332
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-1.5B、Qwen2.5-Math-7B-Instruct、Llama-3.2-3B 等 6 个
摘要最坏前缀教师似然约束让小模型在接近 GRPO 正确率的同时维持更高保真,从而得到最高 RSR。
Weakest Link 把大模型推理蒸馏改写成带最坏前缀约束的强化学习:学生最大化可验证任务奖励,但任一前缀上对教师的平均负对数似然不得超过预算 d。作者认为,序列级软 KL 只惩罚平均散度,学生可以用别处的高概率文本掩盖某一步的逻辑错误,同时仍得到正确最终答案。GRPO 则只优化最终答案。