研究将 on-policy distillation 视为隐式奖励优化,揭示奖励作弊导致的训练崩溃
从强化学习视角研究在策略蒸馏,发现其仅提升采样效率而不扩展解题边界;训练崩溃反映了对教师偏置信号的奖励投机。
- 0AIME24–26 审计后仅 SOPD 解决的问题数(Table 6)
- 99.4%Qwen3-4B 监督 1.7B 时 SOPD 的截断率(Table 2)
- 38.0%Qwen3-4B 监督 1.7B 时 SOPD 的重复率(Table 2)
论文试图解释在策略蒸馏(OPD)提升性能与引发崩溃的内在机制,并验证其是否属于对教师偏置奖励信号的奖励投机。
相关研究涵盖知识蒸馏与能力迁移、OPD 失败模式与稳定化策略、以及在策略后训练中的生成病态与奖励投机缓解。
将 OPD 形式化为隐式奖励强化学习,通过多轮采样与可解性审计剖析能力边界,并提出截断回复损失掩码来抑制偏置反馈。
实验表明成功 OPD 仅提升已有解题采样效率而不扩充题目覆盖;崩溃源于教师对超长重复的偏置优势,掩码可恢复准确率。
作者指出了模型规模与任务领域等局限;实验事实表明评测覆盖竞赛数学基准,审计协议具有单向性。
论文从强化学习视角阐释在策略蒸馏,揭示其提升采样效率而不扩边界,崩溃源于教师奖励偏置引发的奖励投机并可通过掩码缓解。