风险行为arXiv 2610.03185
研究将 on-policy distillation 视为隐式奖励优化,揭示奖励作弊导致的训练崩溃
揭示在策略蒸馏的训练崩溃是对教师偏置的奖励投机
- arXiv
- 2610.03185
- 发表
- 场景
- 模型与 API
- 测试
- JustRL-1.5B、DeepScaleR-1.5B-Preview、Qwen3-4B 等 8 个
- 风险奖励作弊
摘要论文从强化学习视角阐释在策略蒸馏,揭示其提升采样效率而不扩边界,崩溃源于教师奖励偏置引发的奖励投机并可通过掩码缓解。
该研究从强化学习视角系统分析了语言模型在策略蒸馏(OPD)中的性能增益机制与退化崩溃原因。