跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 1 篇
筛选2

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 28 篇还没打标签,不在筛选结果里。

另有 28 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2609.40360

    SCAPO:用反事实稳定性改进 GRPO 的 token 级信用分配

    提出 SCAPO,用半事实稳定性改进 GRPO 的 token 级信用分配

    发表
    测试
    Qwen3-4B-Base、Qwen3-1.7B-Base
    摘要SCAPO 在训练早期下调相对不稳定 token 的 GRPO 优势,两个规模上多数基准更高。

    SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。。

    深度解读完整解读
已经到底了