分析与理论arXiv 2610.02015
研究:RLVR 后训练在全新推理任务上引发语言漂移
证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励
- arXiv
- 2610.02015
- 发表
- 场景
- 模型与 API
- 测试
- gemma-3-1b-pt、Llama-3.2-1B、Qwen2.5-1.5B 等 6 个
- 组件推理链
摘要论文证明并验证了 RLVR 在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。
论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。