其他arXiv:2609.40360 · 10月1日SCAPO:用反事实稳定性改进 GRPO 的 token 级信用分配提出 SCAPO,用半事实稳定性改进 GRPO 的 token 级信用分配模型与 API·测试Qwen3-4B-Base、Qwen3-1.7B-Base·训练与数据层摘要SCAPO 在训练早期下调相对不稳定 token 的 GRPO 优势,两个规模上多数基准更高。SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。。完整解读