跳到正文
10月8日 · 周四

奖励作弊 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 2 篇还没打标签,不在筛选结果里。

另有 2 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv:2610.02015 ·

    研究:RLVR 后训练在全新推理任务上引发语言漂移

    证明RLVR后训练允许无界语言漂移且限制漂移必限制奖励

    测试
    gemma-3-1b-pt、Llama-3.2-1B、Qwen2.5-1.5B 等 6 个训练与数据层
    摘要论文证明并验证了RLVR在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。

    论文从理论与实验两方面研究了大语言模型在RLVR后训练过程中思维链出现的语言漂移现象。

    完整解读
已经到底了