其他arXiv 2609.40360
SCAPO:用反事实稳定性改进 GRPO 的 token 级信用分配
提出 SCAPO,用半事实稳定性改进 GRPO 的 token 级信用分配
- arXiv
- 2609.40360
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-4B-Base、Qwen3-1.7B-Base
摘要SCAPO 在训练早期下调相对不稳定 token 的 GRPO 优势,两个规模上多数基准更高。
SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。。