跳到正文
10月8日 · 周四

思维链监控 · 论文

找到 4 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 41 篇还没打标签,不在筛选结果里。

另有 41 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv:2610.03185 ·

    研究将 on-policy distillation 视为隐式奖励优化,揭示奖励作弊导致的训练崩溃

    揭示在策略蒸馏的训练崩溃是对教师偏置的奖励投机

    模型与 API测试JustRL-1.5B、DeepScaleR-1.5B-Preview、Qwen3-4B 等 8 个训练与数据层
    摘要论文从强化学习视角阐释在策略蒸馏,揭示其提升采样效率而不扩边界,崩溃源于教师奖励偏置引发的奖励投机并可通过掩码缓解。

    该研究从强化学习视角系统分析了语言模型在策略蒸馏(OPD)中的性能增益机制与退化崩溃原因。

    完整解读
  2. 风险行为arXiv:2609.33220 ·

    斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定

    揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定

    模型与 API测试Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个训练与数据层

    摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。

    完整解读
  3. 分析与理论arXiv:2610.02015 ·

    研究:RLVR 后训练在全新推理任务上引发语言漂移

    证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励

    模型与 API测试gemma-3-1b-pt、Llama-3.2-1B、Qwen2.5-1.5B 等 6 个训练与数据层
    摘要论文证明并验证了 RLVR 在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。

    论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。

    完整解读
已经到底了