SCAPO:用反事实稳定性改进 GRPO 的 token 级信用分配
Semifactual Credit-Augmented Policy Optimization
SCAPO 用半事实稳定性下调 GRPO 中相对不稳定 token 的优势。在 Qwen3-4B-Base 上,AIME 2024–2026 准确率比 GRPO 高 5.63 个百分点。
- RLVR 提升了大模型推理,但预测仍受与任务无关的提示特征影响。GRPO 把同一结果优势赋给每个 token,可能同时强化有用推理和潜在虚假依赖。
- SCAPO 在固定回答上测量半事实干预下的 token 概率漂移,组内标准化后只取稳定性分数的负部,以 stop-gradient 加到 GRPO 优势上,且仅在训练早期使用。
- 在 Qwen3-4B-Base 与 1.7B-Base 上,SCAPO 的 AIME 2024–2026 准确率分别比 GRPO 高 5.63 与 4.17 个百分点,并在两个规模的多数数学基准和全部分布外基准上取得比较方法中的最高准确率。
- 训练限于 1.7B 与 4B 的稠密 Qwen3,数据为 DAPO-Math-17K 数学题。作者认为更大模型、MoE 与混合架构以及其他领域仍待评估。GPQA-Diamond 只作为科学推理迁移证据。
- 模型
- Qwen3-4B-BaseQwen3-1.7B-Base
- 基准
- DAPO-Math-17KAIME 2024–2026AMC 2023–2025HMMT 2025–2026BRUMO 2025SMT 2025Omni-MathMinervaOlympiadBenchNoOp-AIME 24–26ThinkBench-AIME 24–26GPQA-Diamond
- 指标
- accuracyPass@kPass@128
研究者提出 Semifactual Credit-Augmented Policy Optimization(SCAPO),一种在 GRPO 基础上引入反事实稳定性的 token 级信用分配方法。作者通过保持问题与答案不变的反事实提示词干预,发现 token 级敏感度差异明显,抑制高漂移 token 候选可在不更新权重的情况下提升推理准确率;而 GRPO 给每个响应 token 分配相同的结果优势,可能同时强化有用的推理与虚假依赖。SCAPO 测量固定响应在反事实干预下的 token 概率漂移,用归一化稳定性分数在训练早期降低相对不稳定 token 的优势,且不为稳定性本身额外加分。代码已公开。
深度解读
这篇论文试图解决什么问题?
GRPO 把同一结果优势给每个 token,可能强化与任务无关的虚假依赖。
RLVR 中的 token 级虚假依赖无法被统一的结果优势区分,SCAPO 用半事实稳定性做更细的信用分配。
场景与重要性:强化学习与可验证奖励(RLVR)已提升大语言模型推理,代表方法如 OpenAI o1 与 DeepSeek-R1。Group Relative Policy Optimization(GRPO)用可自动核验的结果优化,不需要过程监督。作者援引近期证据称,RLVR 可以减弱对虚假相关的依赖并改善分布偏移下的泛化,但鲁棒性评测仍显示模型对无关信息和输入扰动敏感。训练因素如何影响 RLVR 泛化、以及如何进一步改善,作者认为仍探索不足。
现有方法的不足:作者在 token 级研究 RLVR 中的虚假依赖。GRPO 把由结果导出的同一优势赋给回答中每个有效 token,不直接计入 token 级敏感度。作者认为,正向结果信用可能在强化有用推理的同时强化潜在虚假依赖。回答级优势过粗,无法区分单个推理 token。
核心观察:作者用半事实提示干预(semifactual prompt intervention)改变与任务无关的提示特征,同时保留数学问题和答案,并以固定回答的 token 概率漂移作为潜在虚假依赖的代理。在冻结的 Qwen3-4B-Base 上,解码时抑制高漂移候选 token、不更新权重,使 1,000 道数学诊断题的准确率从 15.8% 升至 30.0%(Figure 3)。作者认为这说明模型对 token 级虚假特征高度敏感,且该信号可用于训练时的信用分配。
本文提出的方法:作者提出 Semifactual Credit-Augmented Policy Optimization(SCAPO),一种受因果启发的 GRPO 变体。它测量固定回答在半事实干预下的 token 概率漂移,用组内归一化的稳定性分数,在训练早期降低相对不稳定 token 的优势,且稳定性本身不额外加分。不需要过程监督或外部奖励模型。
有哪些相关研究?
SCAPO 沿用可验证结果奖励,但用固定回答的半事实稳定性修正 token 信用。
RLVR 与可验证奖励
- GRPO 与后续 RLVR:Shao et al. (2024)、Guo et al. (2025)、Zeng et al. (2025) 用无评论家的组相对方法,直接对基座模型做 RL,优化可自动核验的结果。后续工作改进归一化与采样(Liu et al., 2025; Yu et al., 2025),调整重要性加权与截断(Zheng et al., 2025; Gao et al., 2025b),或用熵控制与离策略引导促进探索(Cui et al., 2025; Yan et al., 2025)。作者认为回答级优势仍过粗,无法区分单个推理 token。Yue et al. (2025) 进一步区分采样效率提升与推理 repertoire 的扩展。
推理中的信用分配
- 过程反馈与 rollout 估计:细粒度反馈可从过程标注或结果标签学习(Lightman et al., 2024; Wang et al., 2024; Cui et al., 2026),或用蒙特卡洛 rollout 估计(Kazemnejad et al., 2025)。
- token 选择与归因:token 熵、置信度、资格迹和未来策略散度用于选择与加权 token(Wang et al., 2025b; Xie et al., 2026; Mou et al., 2026; Ma et al., 2026)。基于扰动和梯度的归因估计推理 token 或片段对最终答案的贡献,用于选择性监督微调和重要性加权策略更新(Ruan et al., 2025; Khandoga et al., 2026; Li et al., 2026)。
虚假相关、因果不变性与半事实
- 诊断与扰动:Wang et al. (2022) 与 Fu et al. (2026) 研究虚假特征依赖;Peters et al. (2016) 与 Arjovsky et al. (2019) 讨论因果不变性。作者用半事实提示干预探测 LLM 推理中的因果不变性,概念来自 Goodman (1947)、Lu et al. (2022) 与 Kenny & Keane (2021)。Mirzadeh et al. (2025) 与 Huang et al. (2025) 提供输入扰动下的推理鲁棒性设置,本文的四类扰动沿用这一方向。
基线方法与基准
- 基线:GRPO、GSPO(序列级重要性比与截断)、SAPO(用平滑的、依赖优势的门控替代硬截断)、CF-GRPO(用反事实掩码推理片段估计 token 级信用)、FIPO(用折扣未来 KL 重加权 token 优势)。训练数据为 DAPO-Math-17K;评测包括 AIME、AMC、HMMT、BRUMO、SMT、Omni-Math、Minerva、OlympiadBench,以及 NoOp-AIME、ThinkBench-AIME 与 GPQA-Diamond。
作者称,本文与既有 RLVR 一样优化可验证结果奖励,但用半事实稳定性细化 token 级信用。与既有细粒度信用分配的区别是:负向修正来自固定回答对半事实提示干预的敏感度,使用 teacher-forced token 概率,而不是通过片段掩码或续写再生做输出侧归因。
论文如何解决这个问题?
固定回答测半事实漂移,只把负稳定性以停梯度加到 GRPO 优势上。
SCAPO 在 GRPO 的轨迹级结果优势上,叠加由固定回答半事实稳定性得到的 token 级负向修正,且只在训练早期启用。
半事实扰动与漂移
- 四类扰动:paraphrase、minor typo noise、irrelevant scenario wrapping、appended irrelevant context。用 GPT-5.5 生成,要求保留数量、数学表达式、约束和所求量。每个训练提示预计算 K=4 条扰动。附录 B.1 的 Table 3 给出完整生成提示词。
- 漂移定义:对同一采样 token,原始概率 p_t^(0) 与第 k 个扰动下概率 p_t^(k) 的有界对称距离为
d_t^{(k)}=2\tanh\big(\log p_t^{(0)}-\log p_t^{(k)}\big)/2=|p_t^{(0)}-p_t^{(k)}|/\big((p_t^{(0)}+p_t^{(k)})/2\big)。作者称,用局部均值概率归一化可避免绝对差的尺度偏差,并保留低概率 token 的相对变化;距离落在 [0, 2]。四类扰动取平均得到 d_t。
诊断:抑制高漂移候选
- 设置:冻结 Qwen3-4B-Base,从 DAPO-Math-17K 抽 1,000 题,每题采一条回答(采样细节在附录 B.2)。
- d-filtered 解码:每步对词表中每个候选算漂移,按漂移降序排列非 EOS 候选,掩码累计概率质量不超过 0.8 的最长前缀,始终保留 EOS,再重新归一化。权重不变。该结果用于说明信号可用,训练算法本身不在解码时做这一掩码。
组相对稳定性与信用
- 探测:对原提示 x 采样 G 条回答并固定。用 rollout 策略 π_old 在原提示和 K 个扰动上 teacher-force 同一回答与前缀,得到采样 token 概率,再按式 (6) 算有界对称漂移。探测期间 π_old 固定,随训练更新。
- 组内标准化:对每种扰动,在该提示组全部有效 token 上对负漂移做 z-score,再对 K 类取平均并再次 z-score,得到相对稳定性 u。负值表示相对不稳定。只保留负部 u^−=min(u, 0),因为稳定性本身不意味着正确。
- 优势:Ã_{i,t}=A_i+λ sg(u^−_{i,t})。A_i 是 GRPO 的组相对结果优势,λ≥0,sg 为 stop-gradient,修正在每次策略更新中保持固定。于是 Ã≤A:A>0 时削弱正向强化,A<0 时加强负向学习信号。作者称这不是把稳定性当作 token 级正确性标签。
优化日程与判定
- 目标:把 Ã 代入 GRPO 的 token-mean 截断策略梯度,重要性比、截断和损失归约不变。奖励为可验证二元结果 R∈{0,1}。
- 日程:步 n 满足 1≤n≤N_0 时 λ=λ_0,其后 λ=0,即早期用信用增强塑造轨迹选择,之后用标准 GRPO。实验中 λ_0=0.01;4B 的 N_0=120,1.7B 的 N_0=200。附录 D 在随机梯度模型下给出分析。
- 成功判定:数学回答用 Math-Verify 评分,报告采样回答的平均准确率;Pass@k 用 128 条回答的无偏估计,表示 k 次尝试中至少一次正确的概率。
论文做了哪些实验?
两个 Qwen3 基座上,SCAPO 在多数数学基准和全部分布外基准上最高。
实验设置
- 模型与训练:Qwen3-4B-Base 训练 600 步,Qwen3-1.7B-Base 训练 1,000 步。数据为 DAPO-Math-17K,约 17,000 道整数答案的竞赛数学题。rollout batch 128,update batch 64,每提示 8 条 rollout,最长回答 16,384 token,R1 风格提示模板,二元规则奖励,学习率恒为 10^{-6}。SCAPO 的 λ_0=0.01,信用增强分别用于前 120 与 200 步。
- 基线:GRPO、GSPO、SAPO、CF-GRPO、FIPO,以及 RL 前的 Base。各方法在同一规模上匹配训练数据、奖励、提示模板、优化器、rollout、步数预算和评测协议。
- 评测:分布内为 AIME 2024–2026、AMC 2023–2025、HMMT 2025–2026、BRUMO 2025、SMT 2025、Omni-Math、Minerva、OlympiadBench。分布外为 NoOp 风格 AIME、ThinkBench 扰动 AIME,以及研究生科学问答 GPQA-Diamond。主结果用最终检查点,温度 0.7、top-p 0.9、最长 16,384 token,Math-Verify 评分,报告平均准确率。论文未在正文写明每题采样条数;Pass@k 明确为每题 128 条。
主结果
Table 1 为聚合准确率(%)。AIME 聚合 2024–2026,HMMT 聚合 2025–2026,AMC 聚合 2023–2025。
表格较宽,可左右滑动
基准 4B GRPO 4B SCAPO 1.7B GRPO 1.7B SCAPO AIME 24–26 22.08 27.71 7.71 11.88 AMC 23–25 59.74 65.65 32.97 41.39 HMMT 25–26 11.71 16.17 1.98 4.96 GPQA-Diamond 36.26 42.45 27.42 31.25 分布内 Avg. 34.93 39.65 17.86 23.08 分布外 Avg. 26.48 30.72 13.70 17.22 据 Table 1。4B 上 FIPO 的 AIME 为 25.42,SAPO 的 Minerva 为 41.18、Olympiad 为 54.75,均低于表中对应的 SCAPO 或需对照全文:4B 的 Minerva 上 FIPO 为 44.49、SCAPO 为 43.38;Olympiad 上 FIPO 为 57.57、SCAPO 为 56.82。1.7B 上八项分布内指标 SCAPO 均为最高。
- 数学推理:作者称 SCAPO 在两个规模的八项数学指标上都高于 GRPO。AIME 分别高 5.63 与 4.17 个百分点,HMMT 高 4.46 与 2.98 个百分点。作者称 4B 上八项中六项最高,1.7B 上八项全部最高,两个规模的平均准确率都最高。
- 分布外:作者称两个规模的三项分布外基准都是 SCAPO 最高。GPQA-Diamond 相对 GRPO 从 36.26% 到 42.45%(+6.19 个百分点),以及从 27.42% 到 31.25%(+3.83 个百分点)。NoOp-AIME 上 4B 为 23.61(GRPO 20.56),1.7B 为 8.40(GRPO 6.11);ThinkBench-AIME 上 4B 为 26.11(GRPO 22.64),1.7B 为 12.01(GRPO 7.57)。
- 训练曲线:Figure 1 标注 4B 的 SCAPO 终点为 27.71、FIPO 为 25.42、GRPO 为 22.08;1.7B 为 11.88、7.71 与 7.01。阴影为信用增强阶段。作者称 SCAPO 用不及其一半的策略优化步数达到 GRPO 的最终 AIME 准确率,且两个规模的最终准确率都更高。
诊断与 token 异质性
- 解码过滤:Figure 3 中,同一 1,000 题上标准采样 15.8%,d-filtered 为 30.0%,作者称提高 14.2 个百分点,权重未更新。
- 漂移分布:Figure 2(b) 标注 d_t=0 占 12.82%。Figure 2(c) 中相对整体均值的倍数:reflection markers 2.74×,discourse connectives 2.32×,words 1.53×,punctuation 1.19×,math symbols 0.47×,numbers 0.37×。作者认为与组织、反思相关的 token 比数学符号和数字更敏感。Figure 2(a) 标注约 24.0% 概率不变(图中写 omitted)、约 33.4% 上升、约 42.6% 下降。
消融
Table 2 仅在 Qwen3-1.7B-Base 上比较五类竞赛基准的平均准确率。SCAPO 为 17.65,GRPO 为 12.63。随机打乱 token 对齐后为 13.65,把保答案的半事实换成改答案的反事实后为 11.68。AIME 24–26 上 SCAPO 为 11.88,比这两项对照高 3.55 与 5.56 个百分点。全符号修正平均 15.65,只保留正部为 14.05,负部(SCAPO)最高。作者认为这支持把信用与半事实敏感度对齐,并只降低相对不稳定 token 的信用。
其他消融与分析
- Pass@128:附录 F.2 与 Figure 8 用每题 128 条回答估计 Pass@k。作者称两个规模上 AIME 与 AMC 的 Pass@128 都是 SCAPO 最高;图中未标出端点数值,正文未给出具体百分比。
- 时间:Figure 5 在 4B 实验中,半事实探测与信用构造占测得训练时间的 1.8%,rollout 52.7%,策略更新 18.7%,Other 26.7%。探测复用已采样回答做 teacher forcing,且只在初期增强阶段进行。
- 分年结果:附录 F.1 给出分年数字。4B 上 SCAPO 的若干分项为 AIME 相关 29.17、27.71、26.25,AMC 相关 70.31、63.19、63.84;1.7B 上对应为 14.79、12.92、7.92 与 51.09、37.08、36.76。列标题在文本转换中错位,未与列名对齐的格子不逐项转写。
- 例外:4B 的 Minerva 与 Olympiad 上 FIPO(44.49、57.57)高于 SCAPO(43.38、56.82);4B 的 GPQA-Diamond 上 GSPO 为 41.92,低于 SCAPO 的 42.45,但高于 GRPO。1.7B 分布内八项中 SCAPO 均为表内最高。
有什么可以进一步探索的点?
作者计划在更大模型、更多架构和非数学领域继续检验信用增强。
作者指出的局限与后续方向
- 规模与领域:附录 A 写明,训练实验限于数学推理、1.7B 与 4B 的稠密 Qwen3,数据为 DAPO-Math-17K。尽管 GPQA-Diamond 提供了向科学推理迁移的证据,SCAPO 在更大规模模型和数据、以及更广训练领域上的效果仍待评估。
- 架构:附录 A 写明,后续工作还应考察其他架构,包括 mixture-of-experts(MoE)和 hybrid models。
- 结论中的计划:第 6 节写明,未来工作将在更大模型、更多样的架构以及数学推理以外的领域探索这一信用增强。
实验覆盖范围
- 被测模型:Qwen3-4B-Base 与 Qwen3-1.7B-Base 两个稠密基座,分别训练 600 与 1,000 个策略优化步(第 4.1 节)。
- 比较方法:GRPO、GSPO、SAPO、CF-GRPO、FIPO,以及 RL 前的 Base;主表覆盖八项分布内数学指标和三项分布外指标(Table 1)。
- 消融:信用信号来源(随机打乱、反事实扰动)和修正符号(全符号、只保留正部、只保留负部)只在 Qwen3-1.7B-Base 的五类竞赛基准上报告(Table 2)。
- 诊断:token 漂移与 d-filtered 解码在冻结的 Qwen3-4B-Base、DAPO-Math-17K 中的 1,000 题上进行,不更新权重(第 2 节、Figure 2、Figure 3)。
- 论文未报告:正文未给出主评测每题的采样条数,也未报告与人工评分的一致性;Pass@k 写明每题 128 条。重复次数未在正文给出。
总结一下论文的主要内容
SCAPO 在训练早期下调相对不稳定 token 的 GRPO 优势,两个规模上多数基准更高。
SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。
- 问题:RLVR 提升推理后,预测仍对与任务无关的提示特征敏感。GRPO 把同一结果优势赋给回答中每个有效 token,作者认为可能同时强化有用推理和潜在虚假依赖。
- 方法:四类保答案扰动下,用 teacher forcing 测量采样 token 的有界对称概率漂移,在提示组内标准化后只保留稳定性的负部,以 stop-gradient 加到 GRPO 优势上。稳定性不加分。4B 前 120 步、1.7B 前 200 步使用 λ_0=0.01,之后回到标准 GRPO。不需要过程监督或外部奖励模型。
- 诊断:冻结 Qwen3-4B-Base 上,抑制高漂移候选使 1,000 题准确率从 15.8% 到 30.0%(Figure 3)。反思标记与话语连接词的平均漂移为整体的 2.74× 与 2.32×,数学符号与数字为 0.47× 与 0.37×(Figure 2)。
- 主结果:Qwen3-4B-Base 上 AIME 2024–2026 从 GRPO 的 22.08% 到 27.71%(+5.63 个百分点),Qwen3-1.7B-Base 从 7.71% 到 11.88%(+4.17 个百分点)。作者称两个规模上 SCAPO 均高于 GRPO 的全部已报告指标,并在多数数学基准和全部三项分布外基准上为比较方法中最高。GPQA-Diamond 在 4B 上从 36.26% 到 42.45%。4B 的 Minerva 与 Olympiad 上 FIPO 高于 SCAPO。
- 消融与成本:1.7B 上,打乱对齐或改用改答案扰动都低于负向半事实修正;只奖励稳定 token 的平均准确率也更低(Table 2)。4B 训练中半事实探测占测得时间的 1.8%(Figure 5)。
- 作者结论:作者认为半事实稳定性可以补充结果奖励,用作 RLVR 中更细的信用分配信号;并计划在更大模型、更多架构和非数学领域继续探索。