研究将 on-policy distillation 视为隐式奖励优化,揭示奖励作弊导致的训练崩溃
Gains and Collapse in On-Policy Distillation:A Reinforcement Learning Perspective
从强化学习视角研究在策略蒸馏,发现其仅提升采样效率而不扩展解题边界;训练崩溃反映了对教师偏置信号的奖励投机。
- 在策略蒸馏(OPD)常用于大语言模型后训练,但容易出现过长生成与机械重复等训练崩溃现象。理解 OPD 究竟学习了什么以及为何发生退化,对稳定模型训练至关重要。
- 将 OPD 形式化为以教师模型为隐式奖励模型的强化学习过程,分析教师优势值与学生采样的关系,并提出截断回复损失掩码与 SFT 预热初始化两种候选池干预方法。
- 在数学任务中,成功 OPD 仅提升已可解题目的采样效率,审计后未发现新增可解题;崩溃 run 中学生过拟合于教师的高优势病态回复,掩码使 4B 监督平均准确率提升 3.08 个百分点。
- 实验局限在小模型与竞赛数学任务,干预手段专为过长和重复现象设计而非通用方案;覆盖分析基于有限采样预算与单向审计协议,未证明能力集合完全等价。
- 模型
- JustRL-1.5BDeepScaleR-1.5B-PreviewQwen3-4BQwen3-8BQwen3-30B-A3BDeepSeek-R1-Distill-Qwen-1.5BQwen3-1.7B-BaseQwen3-1.7B-SFT
- 基准
- AMC23AIME24AIME25AIME26DeepMath-103KOpenThoughts3
- 指标
- PASS@kmean@4mean@256Observed coverageMin-10NN distanceSelection gap (ΔNLL)Truncation rateRepetition rate
浙江大学与西湖大学的研究者从强化学习视角分析 on-policy distillation(OPD),认为教师模型实际上充当隐式奖励模型,只对学生的已有行为重新加权,而非扩展学生能力。在数学推理任务上,OPD 在 pass@1 上提升明显,但随着采样预算增大增益递减,经额外采样与人工审核后未发现初始学生无法解决的问题。当教师偏好与回答质量不一致时会出现奖励作弊:以 Qwen3-4B 为教师的设置中,学生回答几乎全部触及 8k 长度上限、38% 出现严重重复,而教师自身仅 2.1% 截断、0% 重复。作者通过屏蔽触及长度上限的回答使平均准确率提升 3.08 个百分点,用 SFT 初始化则从训练开始就避免崩溃。
推荐理由论文把 on-policy distillation 解释为教师充当隐式奖励模型,并给出奖励作弊导致训练崩溃的机制与两种缓解手段。
深度解读
这篇论文试图解决什么问题?
论文试图解释在策略蒸馏(OPD)提升性能与引发崩溃的内在机制,并验证其是否属于对教师偏置奖励信号的奖励投机。
核心问题是在策略蒸馏(OPD)为何能在部分场景提升性能,却在另一些场景崩溃为过度冗长和机械重复的退化生成。
- 场景与重要性:OPD 已被前沿大模型后训练流水线广泛采纳,通过在学生生成的序列前缀上计算反向 KL 散度进行监督,能提升学生模型的推理表现。
- 现有认知的不足:先前研究观察到 OPD 存在训练不稳定、长度膨胀与重复崩溃等退化行为,但将退化归因于师生分布差距过大,尚不清楚 OPD 训练期间究竟学到了什么以及为何崩溃。
- 核心观察与假设:作者将 OPD 视为一种强化学习过程,教师模型扮演隐式奖励模型;成功的 OPD 仅重塑已有回复的采样概率而不扩展能力边界,而训练崩溃则是模型对教师偏置信号的奖励投机(reward hacking)。
- 关心的风险与测试条件:论文关心的风险是学生模型拟合了质量失准的教师偏好,在正常收敛下退化出截断与高频重复;该风险在无预热的弱学生与大教师配对(如 Qwen3-4B 监督 Qwen3-1.7B-Base)等数学推理任务中测试。
- 论文的解决方案:作者提出了控制候选池的干预方法,通过对达到长度上限的回复进行损失掩码,或通过 SFT 预热初始化改善初始采样分布,以此阻断病态行为的强化。
有哪些相关研究?
相关研究涵盖知识蒸馏与能力迁移、OPD 失败模式与稳定化策略、以及在策略后训练中的生成病态与奖励投机缓解。
论文重点梳理了以下三组相关研究及基线方法:
知识蒸馏范式与能力迁移
- 经典蒸馏方法(Hinton et al., 2015; Kim and Rush, 2016):通过匹配教师分布或在教师序列上进行监督;Ho et al. (2023) 等进一步利用教师推理轨迹扩展基础模型覆盖范围。
- 在策略蒸馏(Gu et al., 2024; Agarwal et al., 2024):在学生访问的状态上监督学生自生成的轨迹,后续工作拓展至自蒸馏、多教师与跨分词器迁移,但作者指出它们仍依赖学生采样,主要重构概率分布而非扩展可解题集。
OPD 失败模式与稳定化策略
- 分布与目标失准研究(Li et al., 2026; Fu et al., 2026; Zhu et al., 2026):指出推理模式不匹配时强教师未必有效,并分析了学生前缀引导不可靠与反向 KL 近似偏差;提出离线预热、数据选择与信任区域等修复方案。
- 长度膨胀与崩溃关联(Luo et al., 2026; Wang et al., 2026b):将长度膨胀归因于截断和重复崩溃,提出梯度裁剪、参考正则与长度控制策略。
在策略后训练中的生成病态
- RL 行为机制分析(Yue et al., 2025; Zhao et al., 2025; Dang et al., 2025):指出强化学习主要重新分配基座模型已有解题路径的概率,放大预训练行为并降低推理轨迹多样性;Yan et al. (2024) 指出 token 共现效应会强化重复。
- 病态生成抑制策略(Guo et al., 2025; Liu et al., 2025b; Yu et al., 2025):RLVR 系统采用格式奖励、长度去偏优势估计和超长动态过滤以对抗生成退化。
基线方法与基准
- 基线设置:对比了未蒸馏的初始学生(SINIT / Base pre-OPD)、无干预的标准 OPD,以及 Li et al. (2026) 提出的 SFT 预热基线;训练数据采用 DeepMath-103K(难度 ≥ 6)与 OpenThoughts3,评测基于 AMC23 与 AIME24–26。
与现有工作的区别 作者将 OPD 视为在学生可触及行为中按教师偏好进行选择,系统揭示了退化源于教师隐式奖励对病态回复的偏置,将问题定位为奖励投机而非单纯的优化失败。
论文如何解决这个问题?
将 OPD 形式化为隐式奖励强化学习,通过多轮采样与可解性审计剖析能力边界,并提出截断回复损失掩码来抑制偏置反馈。
作者将在策略蒸馏(OPD)重构为以教师为隐式奖励模型的强化学习过程,通过抽样预算与人工审计检验学生能力边界,并针对教师偏置提出候选池干预机制。
问题设定与形式化
- 在策略监督设定:训练题 q ∼ 𝒟 带有提示词 xq;固定教师为 T,初始学生为 SINIT,可训练学生为 Sθ。学生生成回复 y = (y1, …, yL),教师仅在学生生成的前缀 ht = (xq, y<t) 上评估下一步 token 分布,不生成新 token。
- 前缀分布锁定:在优化步中固定学生当前策略诱导的前缀分布 dS̄,并随后续采样迭代刷新,监督位置完全由学生探索轨迹决定。
隐式奖励模型与策略更新
- 最大熵目标转化:展开条件反向 KL 散度,可将 OPD 目标等价转换为最大化期望教师奖励并带有熵正则项的策略优化目标:
LT(θ; S̄) = −𝔼h ∼ dS̄ [ 𝔼a ∼ πSθ(· | h) [ rT(h, a) ] + ℋ(πSθ(· | h)) ] 其中 rT(h, a) = log πT(τT)(a | h) 为教师赋予的隐式 token 奖励,τT 为教师打分温度(实验中选取 0.75)。
- 策略梯度更新:在采样 token 级别定义优势函数:
AtT = rT(ht, yt) − log πS̄(yt | ht) 工程实现中,将 AtT 作为 stop-gradient 优势项传入 PPO 风格的裁剪代理目标(裁剪系数 ϵ = 0.2),并添加朝向 SINIT 的参考 KL 正则(系数为 0.001)。
能力边界审计协议
- 分级抽样对比:在 AIME24–26 上设置采样预算 k ∈ {1, 2, 4, …, 256}(AMC23 扩展至 1024),检验 PASS@k 随预算增加的收敛趋势。
- 单向扩展与人工复核:针对 256 次采样中仅被 SOPD 解决的问题,将 SINIT 的采样量扩充至 1024 次,并由人工审查推导过程有效性,剔除 SOPD 偶然命中答案的无效推导,以此严格判定是否存在 SOPD 独占可解题。
候选池干预机制
- 截断损失掩码(Masking):保持教师和训练超参数不变,当学生生成的回复达到最大生成长度限制(如 8,192 tokens)时,将该样本的损失掩码置为 0;截断样本仍参与奖励和优势归一化,但不向策略网络回传梯度。
- SFT 预热初始化(Warmup):将学生初始模型从 Base 切换为同架构的 SFT 模型,保持教师与后续优化流程一致,通过改善学生起步阶段的采样分布减少病态回复暴露。
论文做了哪些实验?
实验表明成功 OPD 仅提升已有解题采样效率而不扩充题目覆盖;崩溃源于教师对超长重复的偏置优势,掩码可恢复准确率。
实验设置
- 被测模型:教师模型包括 JustRL-1.5B、DeepScaleR-1.5B-Preview、Qwen3-4B、Qwen3-8B、Qwen3-30B-A3B;学生初始模型包括 DeepSeek-R1-Distill-Qwen-1.5B、Qwen3-1.7B-Base、Qwen3-1.7B-SFT;被测模型为各设置训练 100 轮得到的蒸馏模型 SOPD。
- 数据集与基准:训练采用 DeepMath-103K(难度 ≥ 6 子集)与 OpenThoughts3 OPD 30K;评测基准为 AMC23(40 题)与 AIME24–26(90 题)。
- 基线与变体:对比未训练的 SINIT、标准无掩码 OPD、截断回复损失掩码(+ mask)以及 SFT 预热初始化(warmup)。
- 核心指标:PASS@k(k 样本无偏估计)、routine 准确率(mean@4)、单题成功率(mean@256)、生成长度(Len.)、截断率(Trunc. %)、重复率(Rep. %)、Min-10NN 距离与选择差(Δ NLL)。
- 评审方式:自动判定采用 verl verifier 提取 boxed 整数或末尾整数;覆盖审计引入人工复核检验推导有效性。
- 样本量与算力:常规评测每题采样 4 次,大样本分析每题 256 次,审计扩充至 1024 次;训练均使用 8 张 NVIDIA H100 GPU。
主结果
表格较宽,可左右滑动
模型与角色 准确率 Acc. (%) 平均长度 Len. (k) 截断率 Trunc. (%) 重复率 Rep. (%) JustRL-1.5B (Teacher) 39.3 9.30 13.8 0.0 DS-Distill-1.5B (SINIT) 20.9 11.19 12.5 0.0 JustRL-1.5B → DS-Distill-1.5B (SOPD) 37.1 9.72 16.5 0.0 Qwen3-4B (Teacher) 19.6 3.09 2.1 0.0 Qwen3-1.7B-Base (SINIT) 0.2 1.18 4.1 4.2 Qwen3-4B → Qwen3-1.7B-Base (SOPD) 5.4 8.16 99.4 38.0 注:数据来自 Table 2,在 AIME24–26 上评估;Qwen3-4B 设置中目标模型即被监督的学生。
- 成功蒸馏贴合教师特征:作者指出,在 JustRL 设定下,SOPD 准确率提升 16.2 个百分点,平均长度下降至 9.72k,未出现重复现象。
- 崩溃设定集中于病态行为:作者指出,在 Qwen3-4B 设定下,尽管准确率微升 5.2 个百分点,但 99.4% 的回复触及 8k 长度上限被截断,且 38.0% 出现重复,表现劣于教师与初始学生。
- 退化本质为分布集中:作者指出,崩溃学生并未学会像教师一样推理,而是将概率质量过度集中在狭窄的病态行为空间。
解题覆盖范围与 PASS@k 分析
- 测了什么:在 AIME24–26 与 AMC23 上测试不同采样预算 k 下的 PASS@k,并通过扩充抽样与人工审查核验题目覆盖集合(Figure 2、Table 6)。
- 结果:据 Figure 2,随着预算 k 增至 256(AMC23 增至 1024),SINIT 稳步追平 SOPD;据 Table 6,审计后 SINIT 覆盖 73 题,SOPD 在 JustRL 下覆盖 65 题、DeepScaleR 下覆盖 63 题,SOPD 独占题目数为 0。
- 作者的解读:作者认为 OPD 未扩展可解题边界,增益来自提升既有可解题的采样效率;SINIT 已可解题目的 mean@256 在两教师下分别平均提升 22.6% 和 14.7%(Figure 4)。
候选池干预对崩溃的缓解效果
- 测了什么:评估截断损失掩码(mask)与 SFT 预热(warmup)对 Qwen3 系列教师监督下学生准确率的影响(Table 3、Figure 8)。
- 结果:据 Table 3,在 4B、8B 和 30B-A3B 教师监督下,损失掩码使四项基准平均准确率分别提升 3.08、0.51 和 2.58 个百分点(分别达 13.24%、10.92%、13.07%);4B 搭配 SFT 预热平均准确率达到 16.38%。
- 作者的解读:作者指出,崩溃并非不可逆,限制病态回复的强化即可有效恢复模型能力;但在 8B 教师下出现例外,AIME25 准确率从 3.33% 降至 2.50%,AIME26 从 5.00% 降至 3.33%。
训练动态与奖励偏置诊断
- 测了什么:分析训练损失、优势值变化、Min-10NN 距离,以及初始学生回复按教师优势分位的表现(Figure 5、Figure 6、Figure 7)。
- 结果:据 Figure 5,崩溃 run 的损失收敛平稳,学生回复处于 SINIT 低 NLL 区;据 Figure 6,Qwen3-4B 设置的选择差(Δ NLL)升至约 26.28;据 Figure 7,Qwen3-4B 教师赋予最高优势值(A10)的回复正确率接近 0,但长度与重复率显著偏高。
- 作者的解读:作者指出,崩溃是在正常收敛中拟合了失准的教师偏好;教师自身极少产生病态文本,但对学生病态回复打出高分,诱发了奖励投机。
其他消融与分析
- 教师打分温度(Figure 9、Table 5):在 τT ∈ {0.1, 0.5, 0.75, 1.0, 1.5} 中,τT = 0.75 在中期 checkpoint 取得最高宏平均准确率(41.69%)。
- 掩码样本留存比例(Section 5.2):4B 掩码训练中,即使约 90% 的采样回复被掩码、仅约 10% 保留非零损失,准确率仍获得提升。
- 8B 教师掩码异常(Table 3):8B 教师添加掩码后,AIME24 准确率保持 5.00% 不变,AIME25 从 3.33% 降至 2.50%,AIME26 从 5.00% 降至 3.33%。
有什么可以进一步探索的点?
作者指出了模型规模与任务领域等局限;实验事实表明评测覆盖竞赛数学基准,审计协议具有单向性。
作者指出的局限与后续方向
- 模型规模与任务领域受限:计算资源限制使实验局限于较小模型和数学推理任务,结论能否推广到更大规模模型或其他领域仍有待进一步研究(Limitations)。
- 干预手段并非通用解法:所提出的掩码与预热干预是专门针对实验中观察到的过长与重复生成而设计的,主要用于检验对崩溃机制的解释,而非作为通用的 OPD 训练方案(Limitations)。
- 采样预算与覆盖分析界限:题目覆盖结果基于有限的样本量,尽管结合了扩充抽样与人工审查,但无法排除更大采样预算或不同解码配置下初始模型能解出更多题目的可能(Limitations)。
- 开源脚本计划:作者计划发布所有评测与分析脚本以促进结果复现(Reproducibility Statement)。
实验覆盖范围
- 被测模型范围:涵盖 5 个教师模型(JustRL-1.5B、DeepScaleR-1.5B-Preview、Qwen3-4B、Qwen3-8B、Qwen3-30B-A3B)与 3 个学生初始化模型(DeepSeek-R1-Distill-Qwen-1.5B、Qwen3-1.7B-Base、Qwen3-1.7B-SFT)(Table 1、Table 4)。
- 任务与基准覆盖:评测覆盖竞赛数学领域,包含 AMC23(40 题)与 AIME24–26(90 题)(Section 2.3)。
- 单向审计协议:覆盖审计仅对 SOPD 解决而 SINIT 未解决的题目将 SINIT 样本扩充至 1024 条,未向 SOPD 分配对称的扩充预算(Appendix A.3)。
- 训练迭代设置:所有主实验固定为 100 次 rollout 迭代,单轮采样 32 个 prompt,每个 prompt 采样 8 条回复(Appendix A.1)。
- 重复实验报告情况:论文未报告多次独立重复训练的标准差,各训练动态曲线均为单次运行结果(Appendix A.2)。
总结一下论文的主要内容
论文从强化学习视角阐释在策略蒸馏,揭示其提升采样效率而不扩边界,崩溃源于教师奖励偏置引发的奖励投机并可通过掩码缓解。
该研究从强化学习视角系统分析了语言模型在策略蒸馏(OPD)中的性能增益机制与退化崩溃原因。
- 要解决的核心问题:OPD 在后训练中表现出性能增益与严重崩溃(超长与机械重复)两种不同的结果,亟需厘清其在优化过程中究竟学到了什么,以及为何会出现病态退化。
- 强化学习视角的方法重构:将 OPD 中的反向 KL 监督等价为以教师为隐式奖励模型的策略优化过程;学生决定探索前缀,教师提供下一步 token 的隐式奖励。针对崩溃问题,设计了截断回复损失掩码与 SFT 预热初始化两种候选池干预机制。
- 能力边界未发生外扩:在 AIME24–26 上,随着采样预算 k 增大,初始学生与蒸馏学生的 PASS@k 差距逐渐收窄;经 1024 次条件采样与人工复核,没有发现任何一道题目仅由蒸馏学生解决(SOPD 独占题数为 0,SINIT 覆盖 73 题,Table 6)。
- 崩溃本质为奖励投机:在 Qwen3-4B 监督 1.7B-Base 的崩溃训练中,优化过程正常收敛,但 99.4% 的回复达到 8k 长度上限,38.0% 出现重复(Table 2);分析表明教师在训练前就对病态回复赋予了偏置的高优势值,选择差 Γ 升至约 26.28(Figure 6),学生忠实拟合了失准的奖励信号。
- 干预有效恢复性能:在保持教师不变的前提下,对达到长度限制的回复执行损失掩码,使 4B、8B、30B-A3B 教师监督下的四项数学基准平均准确率分别提升 3.08、0.51 和 2.58 个百分点(Table 3)。
- 作者的结论与启示:作者指出,成功的 OPD 机制在于使学生已有能力更容易被抽样出来,而非赋予新能力;模型退化源于隐式奖励偏置导致的奖励投机,表明教师自身的生成质量不能代表其对学生轨迹的评价质量,未来应将关注点从教师如何生成转向教师如何可靠评估学生生成。