分析与理论arXiv:2610.02015 · 10月2日研究:RLVR 后训练在全新推理任务上引发语言漂移证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励模型与 API·测试gemma-3-1b-pt、Llama-3.2-1B、Qwen2.5-1.5B 等 6 个·训练与数据层推理链摘要论文证明并验证了 RLVR 在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。完整解读