研究:RLVR 后训练在全新推理任务上引发语言漂移
On Language Drift during RLVR Post-Training
作者称理论证明RLVR允许无界语言漂移且限制漂移必限制奖励,实验显示新任务RLVR会导致降低互读性的独特语言漂移。
- 前沿大语言模型在通过强化学习(RLVR)增强推理能力的同时,其思维链(CoT)中频繁出现非规范甚至难以理解的语言漂移,降低了推理过程的可监控性。探明语言漂移是否由RLVR优化直接引发及其诱发机制,对维护前沿模型对齐与安全具有重要意义。
- 作者将语言漂移建模为与人类语言分布的KL散度,理论推导SFT与RLVR下的漂移界限及奖励约束。随后在GSM8K上对比Llama、Gemma与Qwen基础模型在RLVR与SFT下的表现,利用三款指令模型及同模型不同种子评测痕迹可读性与自可读性。
- 在GSM8K上,需发现新行为的Llama和Gemma在RLVR下的痕迹可读性与自可读性AUC均低于SFT(如Llama在Best-Perf检查点下AUC差值分别为-0.24与-0.17,Table 2);而主要发生行为锐化的Qwen未表现出明显漂移。
- 受计算资源限制,实验仅使用了1B至1.5B参数规模的小模型以及GSM8K单个数学推理数据集;漂移程度未达到前沿模型内部推理痕迹的不可读水平;实验未对限制漂移会限制奖励的理论结论进行实证检验,作者计划后续扩展更多推理数据集与验证实验。
- 模型
- gemma-3-1b-ptLlama-3.2-1BQwen2.5-1.5BLlama-3.2-1B-InstructQwen2.5-0.5B-InstructOLMo-2-0425-1B-Instruct
- 基准
- GSM8K
- 指标
- GSM8K validation accuracytrace legibilityself-legibilityAUCfinal-answer probability difference
德国萨尔兰大学的 Michael Sullivan 与 Alexander Koller 从理论与实验两方面研究 RLVR 后训练中的语言漂移,即思维链中出现非标准、不合语法甚至难以理解的语言。作者证明 RLVR 的优化压力允许语言漂移无界增长,而监督微调存在固定上界;并进一步证明在 RLVR 中约束语言漂移必然约束期望奖励。实验在 GSM8K 上训练 gemma-3-1b-pt、Llama-3.2-1B 和 Qwen2.5-1.5B 三个基座模型,用思维链可读性作为语言漂移的代理指标。结果显示 Llama 和 Gemma 在 RLVR 下的漂移高于 SFT,而主要靠行为锐化完成任务的 Qwen 几乎不出现漂移;不同随机种子训练出的 RLVR 模型之间互相可读性更低,说明每次训练的语言漂移方向各不相同。
推荐理由论文用定理和实验说明 RLVR 在全新推理任务上会带来语言漂移,为思维链可监控性的边界提供了理论依据。
深度解读
这篇论文试图解决什么问题?
探明RLVR后训练中语言漂移的成因,以及限制漂移对模型性能的理论制约。
探明大语言模型在带可验证奖励的强化学习(RLVR)后训练中思维链语言漂移的发生机制及其与期望奖励的理论权衡。
- 问题场景与重要性:随着前沿大语言模型通过RLVR在复杂推理任务上能力提升,其思维链(CoT)中愈发频繁地出现非标准甚至人类难以理解的语言漂移(Section 1)。作者指出,这种非标准表达会降低思维链的可监控性(CoT monitorability),使模型内部推理过程变得不透明,难以确定意图并预测未来行动。
- 现有认知的不足:尽管既有工作记录了模型在RLHF或多智能体通信下的语言漂移,且有研究推测RLVR可能不再激励可读性,但此前尚不清楚语言漂移是否可纯粹由RLVR的优化压力导致,且缺乏形式化理论证明(Section 1、Section 2)。
- 核心观察与假设:作者假设语言漂移是RLVR在探索新推理任务时发现新行为的副产物(Section 1、Section 4.3)。当目标任务无法通过基础模型的“行为锐化”(behavior sharpening)解决时,缺乏对中间思维链优化的RLVR会促使模型探索新型语言表达。
- 论文提出的核心工作:作者在理论上证明RLVR优化允许无界的语言漂移,而SFT的漂移存在有限上界;证明了限制语言漂移必然限制模型的最大期望奖励;并通过在GSM8K上对三款小模型的实验,实证检验了新任务诱发漂移及单次训练漂移具有独特性的假设(Section 4、Section 5)。
有哪些相关研究?
梳理RL中的语言漂移、前沿模型不可读推理痕迹,以及通过偏好或提示诱导新型语言行为的研究。
强化学习中的语言漂移
- Korbak et al. (2022):发现模型在基于神经情感分类器的RLHF式优化压力下会重复生成相同token;作者称该现象属于狭义的奖励作弊,本文将其排除,专注于具有内部连贯性的新型语言行为(Section 2)。
- Mordatch & Abbeel (2018) 与 Lazaridou et al. (2020):分别在受限动作空间的RNN多智能体RL设置下,以及LSTM模型玩指称博弈中,观察到目标奖励优化驱动智能体发明类似语言的通信代码或发生词义漂移(Section 2)。
不可读的推理痕迹
- Guo et al. (2025):报告DeepSeek-R1-Zero存在可读性差及中英文混杂;作者指出,虽然加入针对特定语言的惩罚提升了可读性,但损害了性能,作者称该现象与其限制漂移必损害期望奖励的理论一致(Section 2)。
- Jose (2025) 与 Panfilov et al. (2026):Jose (2025) 发现前沿推理模型在有效推理轨迹中输出不可读内容,且移除不可读部分使性能下降,作者认为这说明该文本对LLM有用且可读;Panfilov et al. (2026) 同样在前沿模型内部推理痕迹中发现了人类不可读文本(Section 2)。
诱导新型语言行为
- Vaduguru et al. (2026):使用DPO式偏好优化训练LLM在多轮对话中形成临时语言惯例,目标是智能体与人类的沟通效率,其训练方法不导致任意语言漂移(Section 2)。
- Zhu et al. (2026):使用提示词方法将文本压缩为人类不可读但LLM可读的形式以缩减上下文,作者认为这仅通过提示词激发了模型既有的漂移潜力,但也说明LLM并不必然需要运行在人类可读语言上(Section 2)。
对比基线与基准数据集
- 实验对比的基线方法为监督微调(SFT)及其等性能检查点(iso-SFT),使用的基准数据集为数学推理数据集 GSM8K(Section 5.1)。
与既有工作的定位区别
- 作者指出,此前关于语言漂移的研究主要局限于以通信为目标的设定,本文将其拓展到通用推理任务、现代Transformer架构与RLVR算法中,并首次给出了RLVR允许无界语言漂移及漂移必然约束奖励的形式化理论证明(Section 2、Section 4.1)。
论文如何解决这个问题?
建立语言漂移与训练过程的形式化理论,证明RLVR的无界漂移与奖励权衡,并设计片段可读性评测协议。
作者将语言漂移形式化为与人类语言分布的期望KL散度,给出了SFT与RLVR在漂移界限及期望奖励上的理论证明,并设计了痕迹可读性(Trace Legibility)与自可读性(Self-Legibility)实验协议。
语言漂移形式化定义
将大语言模型建模为给定提示词 x 生成思维链 z 与最终答案 y 的条件概率分布 π。参考人类语言分布 P(HL) 为联合分布。语言漂移定义为在人类边际提示分布下的期望KL散度: LD(π) = 𝔼x ∼ P(HL)X [DKL(P(HL)(− ∣ x) ∥ π(− ∣ x))] 该公式量化了模型在其思维链中“灾难性遗忘”生成人类自然语言的程度(Section 3.1)。
训练设定与理论证明
SFT被建模为交叉熵单调非增的检查点族,RLVR被建模为基于最终答案正确性的期望奖励单调非减的检查点族: R(D(RL), π) = 𝔼(x,y) ∼ D(RL) [π(y ∣ x)] 该公式表达了模型在目标分布上生成正确答案的期望奖励(Section 3.2)。
- 定理1(RLVR允许无界漂移):作者证明RLVR仅最大化生成正确答案 y 的概率,对中间思维链 z 的条件分布无优化压力,导致在 z 上的KL漂移可任意发散,因而语言漂移上确界为无穷大(Theorem 1)。
- 定理2(SFT限制语言漂移):作者证明SFT最小化与固定目标分布的交叉熵,其语言漂移存在有限上界 gamma < \infty(Theorem 2)。
- 定理3(限制漂移必限制期望奖励):作者证明对围绕人类分布的任意漂移半径,总存在更大漂移半径能取得更高期望奖励,因此在RLVR后训练中,期望奖励逼近上限时最小可能漂移趋近无穷大(Theorem 3)。
痕迹可读性与自可读性设计
- 痕迹可读性代理评估:人类真实语言分布不可精确计算,作者使用 Llama-3.2-1B-Instruct、Qwen2.5-0.5B-Instruct 和 OLMo-2-0425-1B-Instruct 三款指令模型进行噪声三角测量。将生成的思维链切分为 10 个等距片段(p 取值 0.0 到 0.9),让指令模型仅依据部分痕迹猜测最终答案,以猜测一致率作为可读性指标(Section 5.1.2)。
- 自可读性评估:将读取痕迹的模型替换为相同架构、相同方法但不同随机种子的其他模型,以衡量不同训练运行是否漂向相同语言方向(Section 5.1.2)。
- 等性能检查点对齐:选取验证得分与对照方法最接近的检查点(iso-SFT与iso-RLVR),以排除最终任务性能差异对漂移评估的混淆(Section 5.1.1)。
论文做了哪些实验?
在GSM8K上用三款小模型对比RLVR与SFT,验证新任务下RLVR导致更大漂移且每次漂移方向独特。
实验设置
- 被测模型:基座模型为 gemma-3-1b-pt、Llama-3.2-1B、Qwen2.5-1.5B;痕迹可读性评测模型为 Llama-3.2-1B-Instruct、Qwen2.5-0.5B-Instruct、OLMo-2-0425-1B-Instruct(Section 5、5.1.2)。
- 数据集与规模:数学推理数据集 GSM8K,使用 128 条留出样本作为验证集进行检查点评估与可读性测试(Section 5、5.1.1)。
- 训练方法与基线:RLVR采用GRPO的DAPO变体;基线为SFT;并分别构建得分对齐的等性能检查点 iso-SFT 与 iso-RLVR(Section 5.1.1)。
- 主要指标:GSM8K验证准确率(以 #### 格式提取最后答案判断正确性);痕迹可读性与自可读性得分及其曲线下面积(AUC);思维链有效性概率差(Section 5.1.1、5.1.2、附录 C)。
- 采样与提示配置:生成与读取均为确定性采样;最大生成长度限制为 256 token;提示包含 2 个固定少样本示例(Section 5.1.1、附录 B.2)。
- 实验规模与重复次数:网格搜索确定最优超参数后,每种组合在 5 个随机种子下重复训练,共 30 次运行(Section 5.1.1)。
主结果
表格较宽,可左右滑动
模型 RLVR准确率 (Table 1) SFT准确率 (Table 1) 痕迹可读性AUC差值(Best-Perf, Table 2) 痕迹可读性AUC差值(Iso-Perf, Table 2) 自可读性AUC差值(Best-Perf, Table 2) 自可读性AUC差值(Iso-Perf, Table 2) Llama 0.23±0.04 0.32±0.02 -0.24 -0.28 -0.17 -0.15 Gemma 0.12±0.01 0.24±0.02 -0.17 -0.18 -0.09 -0.14 Qwen 0.79±0.01 0.63±0.02 0.02 0.01 0.56 0.39 - 新任务与行为锐化表现差异:作者指出,需发现新行为的Llama和Gemma在RLVR下的痕迹可读性AUC差值均为负值(Best-Perf分别为-0.24和-0.17),表明其RLVR痕迹可读性低于SFT;而主要进行行为锐化的Qwen差值接近于零(Best-Perf为0.02),未出现明显漂移(Section 5.2)。
- 漂移幅度受任务难度制约:作者指出,Llama的语言漂移程度高于Gemma,原因在于Gemma在GSM8K上准确率较低(0.12±0.01),任务难度导致GRPO梯度稀疏,权重无法偏离基座模型太远(Section 5.2)。
- 等性能控制验证:在消除验证性能差异的等性能检查点下,Llama与Gemma的痕迹可读性AUC差值仍保持为负(分别为-0.28与-0.18),作者认为这说明漂移并非由最终性能差异所致(Section 5.2)。
自可读性与漂移独特性
- 测试方法:使用同模型同方法但由其他 4 个随机种子训练的模型作为读者,测试模型间相互理解思维链的能力(Section 5.1.2)。
- 测试结果:Llama和Gemma在RLVR下的自可读性AUC差值均为负(Best-Perf分别为-0.17与-0.09,Iso-Perf分别为-0.15与-0.14,Table 2);Qwen在RLVR下的自可读性差值为正(Best-Perf为0.56,Iso-Perf为0.39,Table 2)。
- 作者解读:作者指出,RLVR训练的Llama和Gemma不同种子间互读性低于SFT,表明每次RLVR训练的语言漂移方向互不相同,产生了独特的语言行为且难以预测(Section 5.2)。
行为锐化潜力分析
- 测试方法:针对未训练基座模型统计其在未停止生成时的首个与末个答案准确率,以估算其行为锐化空间(Section 5.1.1)。
- 测试结果:基座Qwen的首个答案准确率为0.41,末个答案为0.20,合计约0.61,而RLVR后准确率为0.79±0.01;基座Llama首个为0.06、末个为0.02(RLVR为0.23±0.04);基座Gemma首个为0.02、末个为0.01(RLVR为0.12±0.01)(Table 1)。
- 作者解读:作者计算得出Qwen约三分之二的RLVR增益仅来源于学会生成EOS标记(行为锐化);而Llama与Gemma在RLVR后的准确率达到基座首末合计准确率的近三倍,属于新行为探索(Section 5.2)。
思维链实用性合理性检验
- 测试方法:通过逐步增加前缀片段测试答案概率变化以排查表演性思维链;通过将思维链替换为同长度其他问题的思维链测试答案概率下降以排查隐形推理(附录 C)。
- 测试结果:除Gemma Iso-SFT外,各模型随片段增加答案概率稳步提升(Figure 12);使用原思维链的答案概率均高于替换思维链,配对t检验下所有差值均满足 p < 0.001(Table 4)。
- 作者解读:作者认为这证实了模型在真正利用思维链中的token辅助答题,而非生成事后伪解释或脱离token进行隐层计算(附录 C)。
其他消融与分析
- DAPO网格搜索范围:学习率1e-6至5e-5,Group size为64与128,批大小128与256,轮数1与2(Table 3)。
- SFT网格搜索范围:学习率1e-6至5e-5,批大小4至32,轮数1至3(Table 3)。
- DAPO固定参数:更新迭代次数为1,epsilon_low为0.2,epsilon_high为0.28,学习率warmup比例为0.03(附录 B.1)。
- 替换思维链概率降幅:RLVR下原思维链与替换思维链答案概率差在Llama各组为0.5205至0.6903,Gemma为0.3365至0.4726,Qwen为0.8390至0.9163(Table 4)。
有什么可以进一步探索的点?
作者指出了模型较小、数据集单一及缺少定理3实证等局限,实证范围覆盖到1.5B模型和GSM8K。
作者指出的局限与后续方向
- 模型规模较小:由于计算资源限制,实验仅使用了 1B–1.5B 参数规模的小模型,限制了可训练推理数据集的规模与难度;虽然观察到了语言漂移,但其漂移程度未达到部分前沿模型内部推理痕迹展示的人类完全不可读的水平(Limitations 小节)。
- 数据集范围有限:受限于小模型能力,实验仅采用了一个同时包含标注CoT且三款基座模型均能通过RLVR和SFT学会的数据集(GSM8K);作者计划在后续版本中使用更多推理数据集扩展第5节的实验结果(Limitations 小节)。
- 缺乏定理3的实证验证:第5节的实验主要针对定理1、定理2及新任务假说,并未包含对定理3(限制语言漂移必然限制期望奖励)的实证验证;作者计划在后续版本中补充相关实验(Limitations 小节)。
- 排除多模态模型:为了分析的易处理性,本研究仅关注基于文本的推理大语言模型,明确排除了多模态模型,作者将多模态模型的探讨留作未来工作(Section 3)。
实验覆盖范围
- 被测模型:基座模型包括 gemma-3-1b-pt、Llama-3.2-1B、Qwen2.5-1.5B 共 3 款参数规模在 1B 至 1.5B 的小模型(Section 5)。
- 实验数据集:仅在 GSM8K 一个数学推理数据集上完成了训练与测试,验证集样本量为 128 条(Section 5、5.1.1)。
- 评测读取模型:使用 Llama-3.2-1B-Instruct、Qwen2.5-0.5B-Instruct、OLMo-2-0425-1B-Instruct 共 3 款指令模型进行可读性评测(Section 5.1.2)。
- 训练配置:RLVR算法采用DAPO,生成长度上限限制为 256 token,每组实验使用 5 个随机种子(Section 5.1.1)。
- 未报告的信息:论文未报告人类对生成痕迹的直接人工评估一致性数据,未报告更大参数规模或闭源前沿模型的语言漂移实证数据。
总结一下论文的主要内容
论文证明并验证了RLVR在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。
论文从理论与实验两方面研究了大语言模型在RLVR后训练过程中思维链出现的语言漂移现象。
- 核心定位与问题:前沿推理模型在RLVR后训练后频繁出现非标准语言表达,损害了思维链的可监控性;论文旨在探明语言漂移是否由RLVR优化直接引发,以及能否在不损害性能的前提下对其加以约束。
- 核心理论推导:将语言漂移建模为与人类语言分布的期望KL散度,证明了RLVR优化允许无界语言漂移(Theorem 1),而SFT的漂移存在有限上界(Theorem 2);进一步证明对语言漂移施加任何有限约束都会限制模型所能达到的最大期望奖励(Theorem 3)。
- 核心实验发现:在GSM8K数学推理任务上,需要探索新推理行为的 Llama-3.2-1B 与 Gemma-3-1b-pt 在RLVR下的痕迹可读性AUC差值均低于SFT(Best-Perf分别为-0.24与-0.17,Table 2);而主要依赖行为锐化的 Qwen2.5-1.5B 未出现明显漂移(AUC差值为0.02,Table 2)。
- 漂移的独特性与不可预测性:同模型同任务下不同随机种子训练的RLVR检查点,其相互之间的可读性AUC差值同样低于SFT(Llama与Gemma在Best-Perf下分别为-0.17与-0.09,Table 2),表明各次RLVR运行产生了各自独特的语言表达。
- 作者结论与安全启示:作者指出,在前沿模型征服新任务的场景下,RLVR诱发语言漂移难以避免且无法在不损害性能的情况下加以约束;由于漂移方向不可预测,未来即使使用在相同任务上训练的模型,也可能无法有效理解和监控目标模型的内部推理过程。