分析与理论arXiv:2610.02015 · 10月2日研究:RLVR 后训练在全新推理任务上引发语言漂移证明RLVR后训练允许无界语言漂移且限制漂移必限制奖励测试gemma-3-1b-pt、Llama-3.2-1B、Qwen2.5-1.5B 等 6 个·训练与数据层场景模型与 API推理链摘要论文证明并验证了RLVR在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。论文从理论与实验两方面研究了大语言模型在RLVR后训练过程中思维链出现的语言漂移现象。完整解读