跳到正文
原文
arXiv:对齐、欺骗与监督· arXiv:2610.00332· Matthieu Zimmer, Xiaotong Ji, Tu Nguyen, Haitham Bou-Ammar·本站收录 · 原文发表

最弱一环:用最坏情况约束强化学习蒸馏 LLM 推理能力

The Weakest Link: Distilling LLM Reasoning with Worst-Case Constrained Reinforcement Learning

论文速读

对齐/训练方法

据论文 PDF 整理(AI 生成),以原文为准

论文把推理蒸馏写成最坏情况约束强化学习,在数学与代码任务上同时保持最终答案正确率并提高严格推理成功率。

问题
把大模型推理蒸馏到小模型时,只优化可验证任务奖励会奖励投机,软 KL 惩罚又允许用其他步骤的高教师似然补偿单步逻辑错误。
方法
作者把蒸馏写成最坏前缀平均教师负对数似然约束下的任务奖励最大化,并用吸收不可行状态的无增广 MDP 与单步/长期策略梯度分解来训练,测试时不访问教师。
实验与结果
在三组数学蒸馏和附录代码任务上,作者称该方法同时接近纯 GRPO 的最终答案正确率并维持较高约束满足率,从而在各设置上取得最高 Reasoning Success Rate。
局限与可以继续做的
作者指出有限惩罚、有限数据、有限容量和分布偏移会使测试时约束满足率低于训练时近乎严格满足;预算 d 过严会同时伤害正确率与 RSR,且该阈值依赖教师与学生容量差。
实验设置Qwen2.5-1.5B、Qwen2.5-Math-7B-Instruct 等 · MATH、GSM8K 等 · Final Answer Correctness (FAC)、Constraint Satisfaction (CS) 等
模型
Qwen2.5-1.5BQwen2.5-Math-7B-InstructLlama-3.2-3BLlama-3.2-11B-Vision-InstructQwen2.5-Coder-1.5BQwen2.5-Coder-7B-Instruct
基准
MATHGSM8KApple/GSM-Symbolic (main)HumanEvalMBPP
指标
Final Answer Correctness (FAC)Constraint Satisfaction (CS)Reasoning Success Rate (RSR)pass@1
AI 导读全文 251 字

针对将 LLM 推理能力蒸馏给小模型的难题,研究者提出把推理蒸馏建模为带最坏情况约束的强化学习问题——在每个轨迹前缀上都对教师对数似然施加约束,而非软散度惩罚的平均化处理。该方法推导出一个无增广的受限 MDP,其奖励变换既保留硬约束语义,又可分解为低方差的单步项与长期项策略梯度,并在惩罚极限下几乎必然满足该最坏情况约束。在数学推理与代码生成任务的实验中,该方法显著拓宽准确率—保真度的帕累托前沿,匹配纯 RL 的高最终答案正确率并大幅减少违反教师约束的情况,在所有评测设置中取得最高的严格推理成功率。

深度解读

6 个问题,约 9,300 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    软平均教师约束允许用其他步骤补偿单步逻辑错误,作者改用最坏前缀约束做推理蒸馏。

    推理蒸馏中,学生可以在某一步出现严重逻辑错误,再用其他步骤对教师的高似然把序列平均代价补回来,同时仍拿到正确最终答案。

    • 场景:作者认为,把大语言模型的推理能力蒸馏到更小的学生模型,是资源受限部署的核心问题。只最小化与教师的输出散度会迫使小模型模仿超出其表示能力的推理链,并忽略任务目标;改用可验证任务奖励做强化学习又会出现奖励投机(reward hacking)。
    • 现有不足:作者指出,GRPO 一类纯任务奖励方法会用错误中间逻辑得到正确最终答案。Figure 1 给出一个例子:GRPO 先算出 4.7619,再用学到的舍入得到正确答案 5。用超参数 λ 把任务奖励与逐步散度相加的软惩罚只约束期望代价,学生可以用其他位置的高概率文本补偿某一步的高惩罚。
    • 核心观察:作者认为,思维链的有效性取决于最弱的一步(weakest link),单步无效会使整条路径无效。因此应把教师对数似然上的约束写成轨迹每个前缀上的最坏情况约束,并在训练中几乎必然满足。
    • 提出的方法:作者把推理蒸馏写成约束马尔可夫决策过程。任务奖励在每个前缀的教师负对数似然平均值不超过预算 d 的条件下最大化。为避免对偶拉格朗日内循环,以及 Saute 这类状态增广方法在测试时仍需查询教师,作者构造不增广状态的 MDP:违反约束即进入吸收状态并得到惩罚 −n。教师只在训练回放时事后查询。作者还给出把策略梯度拆成单步项与长期信用分配项的分解,并称在惩罚极限下几乎必然满足最坏情况约束。
    • 经验目标:作者要在数学推理和代码生成上同时保持纯 RL 的 Final Answer Correctness,并降低教师约束违反,从而提高严格的 Reasoning Success Rate。
  2. 有哪些相关研究?

    相关工作分软 KL 蒸馏、过程监督蒸馏和约束 RL;作者把本文放在最坏前缀硬约束上。

    作者在引言和第 5 节把相关工作分成三组,并在实验中与四类基线比较。

    RL 蒸馏与奖励投机

    • 散度蒸馏:Hinton et al. (2015)、Sanh et al. (2020) 的 DistilBERT、Gu et al. (2024) 的 MiniLLM、Zimmer et al. (2025) 用反向 KL 等散度对齐学生与教师的输出分布。Zhang et al. (2025) 讨论学生被迫建模超出容量的复杂分布。
    • 可验证奖励:Ko et al. (2024; 2025) 的 DistiLLM 与 DistiLLM-2 把可验证任务奖励纳入蒸馏。作者称纯 RL 会诱导奖励投机:学生用逻辑捷径或幻觉跳跃得到正确最终答案(Gudibande et al., 2024)。
    • 软 KL 正则:Agarwal et al. (2024) 的 on-policy distillation、Ouyang et al. (2022)、Stiennon et al. (2022)、Yang et al. (2024) 把 RL 奖励与对教师的软 KL 正则组合。作者认为这种平均惩罚仍允许补偿。

    加强推理蒸馏

    • 过程监督:Hsieh et al. (2023)、Adarsh et al. (2024) 的 SIKED、Chen et al. (2025) 直接监督教师的中间逻辑步骤,传递因果结构。
    • logit 与外部知识:Li et al. (2025) 的 BayesKD、Li et al. (2024)、Saadi & Wang (2025) 的 TASKD-LLM 用注意力或贝叶斯启发式对关键 token 加权;Kang et al. (2023)、Tian et al. (2025) 检索外部信息填补知识缺口。作者称这些方法需要细粒度步骤标注、外部过程奖励模型或复杂检索开销。

    约束 RL 与状态增广

    • 对偶方法:Achiam et al. (2017) 的 Constrained Policy Optimization、Schulman et al. (2015) 的 TRPO 把约束写成严格问题。作者称标准连续约束 MDP 靠对偶拉格朗日下降,在现代 LLM 规模上要维护不稳定的对偶变量,计算、内存和方差成本高(Dasgupta et al., 2023 被引为代价讨论)。
    • Saute:Sootla et al. (2022b;a)、Calvo-Fullana et al. (2024) 把剩余安全预算附加到状态上,用重塑的硬惩罚奖励执行约束,从而避开拉格朗日对偶。作者在第 2.2 节指出,累积代价随长度增加、测试时要逐步查询教师,且固定惩罚 −n 不指出是哪个 token 造成违反。

    基线与基准

    • 基线方法:GKD 与 MiniLLM(纯散度)、GRPO(纯任务奖励)、GKD-GRPO(软拉格朗日松弛,λ ∈ {0.001, 0.01, 0.1, 1.0, 10}),以及 SFT on Teacher CoT。本文变体取最坏前缀平均预算 d ∈ {−ln(1/4), −ln(1/2), −ln(3/4)}。
    • 基准/数据集:数学为 MATH、GSM8K 与 Apple/GSM-Symbolic (main);代码生成实验在附录 C,使用 HumanEval 与 MBPP。

    作者把本文定位为:不依赖步骤级标注、过程奖励模型或测试时教师,而用每个前缀上的最坏情况硬约束阻止平均补偿,并保持学生在部署时独立于教师。

  3. 论文如何解决这个问题?

    用前缀最坏平均代价作硬约束,吸收不可行轨迹,并把策略梯度拆成单步与长期两项。

    Weakest-Link 约束 RL 在最大化可验证任务奖励的同时,要求轨迹每个前缀上教师负对数似然的平均值不超过预算 d,违反后进入吸收惩罚,测试时不再查询教师。

    问题设定与形式化

    • MDP:状态 st 是提示词与已生成前缀,动作 at 是下一个 token,转移把 (st, at) 确定性接到 st+1。任务奖励 R 通常在序列结束时给出,例如数学最终答案是否匹配。每步代价 C(st, at) = −log μ(at|st),μ 为教师。γ 为折扣因子。
    • 最坏前缀约束:目标是最大化 Eπ[Σ γ^t R(st, at)],约束为对几乎所有轨迹,max_{T≥1} (1/T) Σ_{t=0}^{T−1} C(st, at) ≤ d。作者用前缀平均而不是累积和,是因为 C 恒正时累积预算会随长度变大,从而偏向惩罚长推理链。
    • 与软惩罚的区别:Proposition 3.1(a) 称,若只满足整段平均 (1/T) Σ Ct ≤ d,则单步最大误差可随 O(T·d) 增长;在最坏前缀平均下,第 k 步误差被 (k+1)·d 界住。Proposition 3.1(b) 称,不存在对所有 (R, C) 都与该约束 MDP 最优策略相同的常数 λ≥0。附录 A.1 用 T=2、d=1、γ=1 的两条序列作反例:忠实序列每步代价为 1,奖励投机序列代价为 2 与 0、任务奖励多 ε;两者总代价相同,软目标总偏好后者,硬约束在 n→∞ 时选择前者。

    无增广 MDP

    • 奖励重塑:历史条件 MDP 的奖励 R̂n 在所有前缀平均代价 ≤ d 时等于任务奖励 R,否则为 −n。Lemma 3.2 称,一旦某个前缀进入不可行集,其后任意 token 接上的新前缀仍不可行,因此违反是吸收的。
    • 为何不必跟踪预算:LLM 策略以整个前缀为条件,可行性已编码在历史里,不必像 Saute 那样把剩余预算 zt 放进策略状态。教师只在训练时对回放计算 R̂n;测试时学生独立解码。
    • 极限保证:Theorem 3.3 称,在奖励有界、离散 token、代价恒正、γ∈(0,1] 下,n→∞ 时最优值函数单调收敛;若极限 MDP 存在有限值的最优策略,则该策略几乎必然满足最坏平均约束。附录说明,有限值假设的一个充分条件是存在可行且期望回报有限的策略;若 d 低于任何候选策略能达到的最坏代价,则约束本身不可行。

    策略梯度与方差分解

    • 目标:最大化 Jn(θ)=Eπθ[Σ γ^t R̂n(st, at)]。标准 REINFORCE 用从 t 起的折扣回报;作者称单个 token 越界会把后续回报甩到 −n,方差大。
    • 分解:利用 R̂n 只需冻结教师对当前词表做一次前向、不必再与环境交互,梯度拆成两项。单步项对动作 a 求 πθ(a|st) R̂n(st, a) 的解析和;长期项仍是 γ^{t+1} R_{t+1}^n ∇ log πθ(at|st) 的蒙特卡洛项。附录 A.3 写明学生不对冻结教师映射求导。Theorem A.1 称,用教师分布解析掉当前步可去掉该步的采样方差;长期项保留,用来惩罚那些会把前缀推向日后必然违约的早期 token。
    • 实现要点:附录 B 称,单步项用 k3 估计器并作有偏 KL 修正(Tang & Munos, 2025),长期项用 GRPO 的组内标准化回报。RL 训练使用 GRPO,对每个提示词采样 G=8 个完成,最大完成长度 1024,PPO epoch 为 1,裁剪比 0.2。Qwen 设置用 8 张 GPU、全局批大小 1024,学习率 1×10^{-6},温度 1.0,KL 系数 β=0.00;Llama 设置用 32 张 GPU,学习率 1×10^{-5}。惩罚取 n=1。MATH 训练 40 epoch,GSM8K 训练 10 epoch。

    指标与判定

    • FAC:抽取 \boxed{} 中的答案是否与 ground truth 精确匹配。
    • CS:测试轨迹中,最坏前缀平均代价仍低于名义阈值 d=−ln(1/2) 的比例。作者称该指标衡量保真。训练用的 d 可以是 −ln(1/4)、−ln(1/2) 或 −ln(3/4),但报告 CS 时统一用 −ln(1/2)。
    • RSR:用 LLM-as-a-judge(Zheng et al., 2023)判断中间步骤的逻辑有效性,而不仅看最终答案。附录 F 在一个小子集上核对了评审标签。代码任务改用 HumanEval 与 MBPP 的 pass@1,不使用这三项数学指标。
  4. 论文做了哪些实验?

    三组数学蒸馏中,d=−ln(1/4) 的 RSR 最高,FAC 接近 GRPO,CS 远高于只优化任务奖励的 GRPO。

    实验设置

    • 三组蒸馏:Qwen2.5-1.5B 从 Qwen2.5-Math-7B-Instruct 蒸馏,在 MATH 上训练并评测;Llama-3.2-3B 从 Llama-3.2-11B-Vision-Instruct 蒸馏,在 MATH 上评测;Qwen2.5-1.5B 从同一数学教师蒸馏,在 GSM8K 上训练并在 GSM-Symbolic (main) 上评测。附录 C 另有 Qwen2.5-Coder-1.5B 从 Qwen2.5-Coder-7B-Instruct 蒸馏,在 MBPP 上训练,在 HumanEval 与 MBPP 上评测。
    • 基线:SFT on Teacher CoT、GKD、MiniLLM、GKD-GRPO(λ 为 10、1、0.1、0.01、0.001)、GRPO。本文报告 d=−ln(1/4)、−ln(1/2)、−ln(3/4)。Table 1 另给出未蒸馏 Student 与 Teacher 的数字,Student 行只列出一列数值。
    • 指标:FAC 为 \boxed{} 与 ground truth 精确匹配;CS 为测试轨迹最坏前缀平均低于 d=−ln(1/2) 的百分比;RSR 由 LLM-as-a-judge 判定中间步骤逻辑是否有效。代码用 pass@1。三组指标均以百分比计,越高越好。
    • 评审:附录 F 的评审模型是 Qwen3-4B-Instruct-2507。主表的成对比较要求评审寻找逻辑缺口和错误跳跃,即使最终答案相同。附录 F 另从三个数据集各抽 20 个回答做人工核对。论文未报告主实验的重复次数。
    • 训练数据规模:附录 B 写 MATH 使用 12,000 个样本,GSM8K 使用全部 7,473 个样本,MBPP 使用全部 374 个样本。评测集规模论文未在主表中写出。
    • 优化器细节:GRPO 组大小 G=8,最大长度 1024,裁剪比 0.2,n=1。Qwen 学习率 1×10^{-6}、8 GPU、全局批 1024;Llama 学习率 1×10^{-5}、32 GPU。MATH 40 epoch,GSM8K 10 epoch。

    主结果

    Table 1 中,作者称 d=−ln(1/4) 在三组设置上都取得最高 RSR。下表只列 GRPO、软正则的两端 λ,以及本文三个 d。数字均为百分比,据 Table 1。

    表格较宽,可左右滑动

    方法Qwen MATH RSR/FAC/CSLlama MATH RSR/FAC/CSQwen GSM-Sym RSR/FAC/CS
    GKD-GRPO λ=0.126.56 / 28.90 / 84.6611.98 / 18.56 / 66.8258.66 / 66.68 / 84.32
    GKD-GRPO λ=0.00129.48 / 34.62 / 61.4811.44 / 18.08 / 34.1464.02 / 74.08 / 0.00
    GRPO27.54 / 34.84 / 28.5612.90 / 18.78 / 14.2864.36 / 76.24 / 1.00
    Ours d=−ln(1/4)30.00 / 34.86 / 81.3014.12 / 20.54 / 56.9465.82 / 76.14 / 83.88
    Ours d=−ln(1/2)29.76 / 33.82 / 86.5813.34 / 18.08 / 62.5863.06 / 72.96 / 60.44
    Ours d=−ln(3/4)26.36 / 28.80 / 85.7613.92 / 16.9 / 64.9658.96 / 67.40 / 86.30
    • 作者对权衡的解读:在 Qwen+GSM-Symbolic 上,GRPO 的 FAC 为 76.24%、CS 为 1%。GKD-GRPO 把 λ 降到 0.001 时 FAC 为 74.08%、CS 为 0%;λ=0.1 时 CS 为 84.32%、FAC 为 66.68%。Ours d=−ln(1/4) 的 FAC 为 76.14%,CS 为 83.88%。Llama+MATH 上,该设置 FAC 为 20.54%,高于 GRPO 的 18.78%;CS 为 56.94%,GRPO 为 14.28%。作者称这是把 CS 提高了四倍。
    • d 的敏感性:作者称 d=−ln(3/4) 过严,会同时伤害 FAC 和 RSR,因为学生容量小于教师,强制完全模仿会阻碍它找到自己能执行的更简单路径。作者把 d=−ln(1/4) 称为经验上的折中点。Table 1 中,Qwen MATH 上 d=−ln(1/2) 的 CS 为 86.58%,高于 d=−ln(1/4) 的 81.30%,但 RSR 为 29.76%,低于 30.00%。
    • 训练–测试差距:作者称训练时该方法几乎严格满足约束(CS≈100%),测试时分布偏移把它降到约 80%。作者同时称,这一归纳偏置避免了为准确率优化的软基线出现 CS 降到 0% 的情况。Table 1 里 Llama 上 Ours d=−ln(1/4) 的测试 CS 是 56.94%,并不在约 80% 附近。Teacher 行的数字分别为 34.46、32.08、82.12;Student 行分别为 0.54、0.08、0。论文未说明这三列分别对应哪个指标。

    成对评审胜率

    • 测了什么:Figure 4 用 LLM-as-a-judge 比较推理胜率。图中数字为 Ours (d=−ln(1/4)) 在 Qwen2.5 MATH、Llama-3.2 MATH、Qwen2.5 GSM-Sym 上分别是 56.3、63.5、60.6;GKD-GRPO λ=0.01 为 67.7、40.5、58.7;λ=0.001 为 50.5、42.6、49.8;GRPO 为 25.5、53.4、31.0。正文另写 GRPO 在 Qwen-MATH 为 25.5%、在 Qwen-GSM 为 30.9%,与图中 Qwen GSM-Sym 的 31.0 相差 0.1 个百分点。
    • 结果:作者称 GRPO 在最终答案正确时仍被评审惩罚奖励投机;GKD-GRPO λ=0.01 在 Qwen-MATH 上达到 67.7%,但在 Llama-MATH 上为 40.5%。作者称本文是三种设置上都保持优势且一致的方法。按 Figure 4,Qwen-MATH 上 GKD-GRPO λ=0.01 的 67.7% 高于 Ours 的 56.3%。
    • 定性例子:Figure 1 中 GRPO 用舍入从 4.7619 得到 5;作者称约束迫使学生走出数学上成立的路径。附录 Figure 6–8 给出更多生成对比,评审结论均为 A 胜。

    反补偿与代理验证

    • 代价分布:Figure 5 画测试时最坏前缀平均代价的密度,比较 GKD-GRPO(图例写作 GDK-GRPO)λ=0.001 与 Ours d=−ln(1/4)。作者称软基线右偏并有长尾,本文在边界 d 处有更陡的截断。图中 Qwen GSM-Symbolic 的横轴大约到 8,另外两幅大约到 2.5–3.0。论文未给出密度峰值的精确坐标。
    • 与人工逻辑判断的相关性:附录 E 用最坏前缀平均的教师对数似然,对 Qwen3-4B 评审的逐步正确性做 ROC。Table 4 报告 AUC:Qwen2.5-1.5B MATH 上 SFT 0.71、GKD 0.69、MiniLLM 0.66、GRPO 0.64、GKD-GRPO 0.65、Ours 0.68;Llama-3.2-3B MATH 上依次为 0.64、0.66、0.63、0.61、0.63、0.62;Qwen2.5-1.5B GSM-Symbolic 上依次为 0.73、0.74、0.72、0.70、0.71、0.72。作者称全部为正,且 SFT、GKD、MiniLLM、Ours 高于 GRPO 与 GKD-GRPO。
    • 人工核对:附录 F 每个数据集抽 20 个回答。Table 5:Qwen-MATH 上同意 16/20、不同意 4/20;Llama-MATH 上 17/20 与 3/20;Qwen-GSM-Symbolic 上 15/20 与 5/20。作者称模型评审与人工高度一致。

    代码生成

    附录 C 的 Table 2 报告 pass@1。Qwen2.5-Coder-1.5B 从 7B 教师蒸馏,MBPP 训练。

    方法HumanEvalMBPP
    GRPO56.7149.40
    GKD-GRPO λ=0.00154.2650.40
    Ours57.3251.20
    Teacher84.7674.20

    作者称 Ours 在两套基准上都高于纯 RL 与软正则。表中 GKD-GRPO λ=0.1 在 HumanEval 为 50.61、MBPP 为 48.40;λ=0.01 为 53.66 与 49.40;GKD 为 32.32 与 36.00;MiniLLM 为 45.12 与 45.60;SFT 为 43.29 与 46.00。

    其他消融与分析

    • Saute 与最坏平均:Figure 2 的纵轴是 Reasoning Improvement,横轴从 Looser Constraint 到 Stricter Constraint。作者称在各预算上,最坏平均的推理改进高于累积和的 Saute,且峰值更高。图中没有标出具体坐标值。
    • KL 估计器:附录 D 称 k1 偏差大、k2 方差大,因此单步项用 k3。Figure 9 比较训练中的约束满足率:k3 unbiased、k3 biased、k2 unbiased。作者称无偏 k3 与 k2 约在 50 epoch 崩溃到近 0,有偏 k3 维持高满足率。图中未标出精确百分比。
    • Table 1 其余基线:Qwen MATH 上 SFT RSR 24.66、GKD 24.00、MiniLLM 24.22;Llama MATH 上 SFT 13.64 为本文方法以外的最高 RSR,GKD-GRPO λ=10 的 RSR 为 7.44,是该列最低。GSM-Symbolic 上 GKD-GRPO λ=0.001 的 CS 为 0.00,GRPO 的 CS 为 1.00。
    • 超参:附录 B 固定 n=1、G=8、裁剪比 0.2;未报告对这些值的扫描结果。d 的三档已列入主表。
  5. 有什么可以进一步探索的点?

    作者指出有限惩罚、数据、容量和分布偏移会使测试时约束满足率下降,且 d 依赖容量差。

    作者指出的局限与后续方向

    • 测试时不再几乎必然可行:附录 A.2 的 Remark 写明,Theorem 3.3 的几乎必然可行性是训练分布上、惩罚取极限时的陈述。有限的 n、有限数据、有限容量和训练与测试之间的分布偏移,都会使部署时的满足率低于训练时观察到的近乎严格满足。作者把 Table 1 里训练 CS≈100%、测试约 80% 的差距当作这一现象的表现。(附录 A.2)
    • 预算依赖容量差:第 4.2 节写,d=−ln(3/4) 过严会同时伤害 FAC 与 RSR,因为学生表示能力低于教师,强制完全模仿会阻止它发现自己能够执行的更简单路径。作者把 d=−ln(1/4) 作为经验折中,没有给出不依赖该容量差的选择规则。(第 4.2 节)
    • 有限值假设只排除不可行预算:同一 Remark 称,若没有任何候选策略能满足约束,则 d 低于可达到的最小最坏代价,极限下每个策略都得到 −∞,假设按构造失败,此时没有方法能满足该约束。(附录 A.2)

    论文的 Conclusion 没有单独列出未来工作清单,也没有把代码发布写成已完成或计划。

    实验覆盖范围

    • 模型与任务:正文三组是 Qwen2.5-1.5B←Qwen2.5-Math-7B-Instruct(MATH,以及 GSM8K 训练、GSM-Symbolic 评测)和 Llama-3.2-3B←Llama-3.2-11B-Vision-Instruct(MATH)。附录 C 增加 Qwen2.5-Coder-1.5B←Qwen2.5-Coder-7B-Instruct,指标改为 HumanEval 与 MBPP 的 pass@1。
    • 基线与预算:比较对象包括 SFT on Teacher CoT、GKD、MiniLLM、五个 λ 的 GKD-GRPO 和 GRPO;本文 d 取 −ln(1/4)、−ln(1/2)、−ln(3/4)。CS 的名义阈值固定为 −ln(1/2)。
    • 评审:RSR 与 Figure 4 的成对胜率使用 LLM-as-a-judge;附录 F 写明核对子集时的评审模型是 Qwen3-4B-Instruct-2507,每个数据集 20 条,同意数分别为 16、17、15。论文未报告主结果的重复次数,也未报告训练时的查询次数或墙钟时间。
    • 训练规模与优化:MATH 12,000 条、40 epoch;GSM8K 7,473 条、10 epoch;MBPP 374 条。GRPO 组大小 8,最大完成长度 1024,惩罚 n=1。附录 D 只比较了 k3 无偏、k3 有偏和 k2 无偏三种 KL 估计器。
    • 代理相关性:附录 E 在上述三组学生–数据集组合上,对 SFT、GKD、MiniLLM、GRPO、GKD-GRPO 和 Ours 报告了最坏前缀平均教师对数似然相对评审标签的 AUC,范围从 Llama 上 GRPO 的 0.61 到 GSM-Symbolic 上 GKD 的 0.74。
  6. 总结一下论文的主要内容

    最坏前缀教师似然约束让小模型在接近 GRPO 正确率的同时维持更高保真,从而得到最高 RSR。

    Weakest Link 把大模型推理蒸馏改写成带最坏前缀约束的强化学习:学生最大化可验证任务奖励,但任一前缀上对教师的平均负对数似然不得超过预算 d。

    作者认为,序列级软 KL 只惩罚平均散度,学生可以用别处的高概率文本掩盖某一步的逻辑错误,同时仍得到正确最终答案。GRPO 则只优化最终答案。累积代价约束还会随长度变严,Saute 的剩余预算又要求测试时查询教师。

    方法用吸收不可行状态代替状态增广:前缀一旦越过 d,后续奖励变为 −n,可行性已包含在历史里,测试时学生独立于教师。策略梯度拆成可用教师一次前向解析的单步项,以及负责早期信用分配的长期项。Proposition 3.1 给出反补偿界,并说明没有单一常数 λ 能在所有奖励和代价上复现该硬约束。Theorem 3.3 称 n→∞ 且极限策略价值有限时,约束几乎必然成立。

    Table 1 中,d=−ln(1/4) 的 RSR 在三组里最高:Qwen2.5-1.5B 在 MATH 上为 30.00%(FAC 34.86%,CS 81.30%),Llama-3.2-3B 在 MATH 上为 14.12%(FAC 20.54%,CS 56.94%),Qwen2.5-1.5B 在 GSM-Symbolic 上为 65.82%(FAC 76.14%,CS 83.88%)。同一 GSM-Symbolic 设置下 GRPO 的 FAC 为 76.24%、CS 为 1.00%。Figure 4 里该方法的平均胜率为 56.3%、63.5%、60.6%;Qwen-MATH 上 GKD-GRPO λ=0.01 的 67.7% 更高。附录 C 中代码 pass@1 为 HumanEval 57.32%、MBPP 51.20%。

    作者的结论是,剪掉探索中的无效推理路径后,小模型可以同时接近纯 RL 的最终答案正确率并减少约束违反,从而得到更高的严格推理成功率。作者同时写明,有限惩罚、数据和分布偏移会使测试时的约束满足率低于训练时的近乎严格满足,过严的 d 会因学生容量不足而同时降低正确率与 RSR。

阅读原文arxiv.org