研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现
Base Models Can Reason By Taking a Cue From Training Data
预填充仅2个token的开头引导词即可使基模型在MATH-500等基准上达到RL级推理表现,数据编辑证实该效应源于训练关联。
- 大语言模型在后训练中表现出的反思验证等推理能力,究竟是强化学习(RL)赋予的新能力,还是基模型在预训练或中度训练中已经习得的潜在行为;如果是已有能力,需要多么轻量的干预即可将其激发出来。
- 通过在无参考答案下用 beam search 生成高概率候选并在少量题目上利用采样答案一致性(最小化香农熵)筛选短 token cues;在前向生成时将 cue 预填充在回复开头(如 Olmo 的 .\\n\\n Okay ),不更新基模型权重即可引导模型输出包含反思验证的长思维链。通过修改训练数据中的关联(如将 okay 替换为 chicken ),验证 cue 与推理行为的因果联系。
- 预填充仅 2 个 token 的 cue 可使基模型在 MATH-500 等基准上的表现达到与其 RL 训练版本相近的水平(如 Olmo-3-7B 从 42% 提升至 78%,RL 为 75%)。RL 主要放大了模型生成此类 cue 的概率。在中度训练数据中将 okay 替换为 chicken 可使 .\\n\\n Chicken 成为新的推理 cue(MATH-500 pass@1 从 2.4% 提升至 37.2%)。此外,token cue 也能改变模型的拒答与遵循行为。
- 作者指出的局限包括:分析集中于无需前置后训练的 R1-Zero 式设定,更复杂的多阶段后训练可能引入 cue 无法激发的机制;cue 的有效性取决于模型与训练数据结构,在 Llama-3.1-8B 上未找到有效 cue。此外,论文实验覆盖的模型为 Olmo、Qwen 和 SmolLM 系列以及 Llama-3.1-8B,安全实验仅评测了 Olmo 和 Qwen 基模在 XSTest 上的表现。
- 模型
- Olmo-3-7BOlmo-3-32BQwen3-4BQwen3-14BSmolLM3-3BLlama-3.1-8BQwen2.5-Math-7BOlmo-3-7B-RL-Zero-MathOlmo-3-7B-InstructOlmo-3-7B-Think-SFT
- 基准
- MATH-500GSM8KAMC 23AIME 2024AIME 2025OlympiadBenchHumanEvalXSTest
- 指标
- pass@1pass@16Unsafe refusal rateSafe refusal rateHarmful response rate
论文发现,固定基础模型回复开头的两个 token 就能让其在数学和代码任务上接近经强化学习训练的同款模型。在 Olmo-3-7B 上,预填 .\n\n Okay 使 MATH-500 pass@1 从 42% 升至 78%,接近 RL 版本的 75%;在 Qwen3-14B 上,␣Alright , 使 pass@1 从 72% 升至 87%,与 RL 版本持平。RL 本身会提高这些 cue 的生成概率,且预填 cue 可让 RL 用更少步数达到同等准确率。在安全场景中,不同开头 token 会引发不同的拒答与顺从行为,例如 .\n\n Okay 比 ␣Okay , 更倾向于选择性拒答,后者在不安全请求上的有害回复率为 42.4%,前者仅 0.2%。
推荐理由论文用数据编辑与重训证明推理行为可由训练数据中的 token 关联触发,为理解 RL 究竟带来什么提供了可迁移的因果方法。
深度解读
这篇论文试图解决什么问题?
探究基模型响应开头的极短 token cue 能否直接激发复杂推理行为,以及该行为是否源于训练数据的关联。
强化学习后训练展现的推理行为是模型新学到的能力,还是基模型已有的潜在能力被特定触发词唤醒? 针对这一核心疑问,论文探讨了基模型响应开头的极短 token cues 如何引导其后续的复杂推理行为。
- 问题背景与研究意义:基于可验证奖励的强化学习(RLVR,如 DeepSeek-R1-Zero)常展现出反思与验证等行为,但观察到这些行为并不意味着基模型此前缺乏该能力;厘清后训练究竟是教授了新能力还是仅利用了基模型既有能力,对理解模型机制和设计后训练管线至关重要。
- 现有认知的局限:先前研究多依赖复杂的显式长提示词或推理时搜索,关于模型仅凭多大程度的微小干预即可展现深度推理行为仍缺乏明确界定。
- 论文的核心观察与假设:作者观察到 Olmo-3-7B 在 MATH-500 的正确回答中,有 50% 以
.\n\n(句号加双换行)开头,而错误回答中仅有 14%(附录 C.8);作者据此假设响应开头的短 token cues 能充当条件触发信号,引导基模型激活训练数据中形成的推理轨迹。 - 论文提出的解决方案:提出一种无需参考答案、基于样本答案一致性自动发现 token cues 的方法;展示了固定开头前 2 个 token 即可使基模型达到其 RL 版本的准确率,并通过训练数据反事实编辑实验证实了 cue 与推理行为的因果关联。
有哪些相关研究?
围绕推理激发、Token级控制、RL机理及训练数据关联展开,定位为解释短 cue 激发行为的成因。
论文将相关研究与自身工作定位归纳为以下几类:
激发推理能力的方法
- 思维链提示与零样本提示:Wei et al. (2022) 与 Kojima et al. (2022) 展示了分步示例或诸如“Let’s think step by step”的指令能激发中间推理;论文研究的是固定一两个非指令性的响应开头 token 是否同样能跨题激发推理。
- 解码与采样策略:Wang & Zhou (2024) 发现对首个 token 进行分支可发现贪婪解码遗漏的推理轨迹;Karan & Du (2026) 提出通过似然引导的重采样改善基模型推理。论文则通过无需标注的答案一致性搜索固定 token cue。
Token 级别的推理控制
- 推理预算与长度调控:Muennighoff et al. (2025) 提出 budget forcing,在模型试图结束时追加“Wait”来延长推理;Wang et al. (2025a) 抑制“Wait”和“Hmm”以缩短推理;Yang et al. (2026) 结合“Okay”等起始词与结束格式实现中间预算推理。作者指出上述工作均面向经过 SFT 或 RL 的模型,而本文关注未经后训练的基模型。
强化学习如何改变推理
- 先验行为的放大:Yue et al. (2025) 认为 RLVR 主要是将概率质量转移到基模型已支持的轨迹上;Zhao et al. (2025) 在受控实验中发现 RL 放大了预训练偏好的输出模式;Shao et al. (2026) 报告随机奖励也能提升部分模型的推理;Venhoff et al. (2026) 发现 RL 改变了模型何时调用基模型已具备的计算。本文则揭示 RL 是通过提高已能引发推理的开头 token 的生成概率来实现这一放大的。
训练数据关联与模型归因
- 控制信号与数据归因:Keskar et al. (2019) 提出 CTRL 模型,通过前缀标签实现可控生成;Ruis et al. (2025) 通过影响函数将数学推理输出归因于展示解题策略的预训练文档。论文通过直接编辑训练数据并重新训练模型(参考 Ilyas et al., 2022; Zhang et al., 2023 的因果介入思路),验证训练关联对 cue 效果的因果作用。
基线与基准设置
- 对比基线与数据集:对比了无 cue 基模型、对应的 RL-Zero 模型以及基于 GEPA(Agrawal et al., 2026)优化的指令前缀;评测基准包括数学领域的 MATH-500、GSM8K、AMC 23、AIME 2024/2025、OlympiadBench,代码领域的 HumanEval,以及安全领域的 XSTest。
本文定位
- 作者将本文定位为:从训练数据统计关联而非高层语义理解的角度,揭示极短 token cue 为何以及如何在无需权重更新的前提下激发基模型的推理与安全行为。
论文如何解决这个问题?
利用答案一致性最小化香农熵自动检索短 cue,并通过预填充与数据反事实编辑验证因果联系。
论文提出了一套发现有效 token cues 的无监督方法,并通过预填充干预和反事实训练数据编辑揭示其因果机制。
问题形式化与预填充机制
- 输出分布分解:将给定提示词 x 生成开头 c 及后续回复 y 的联合概率分解为 pθ(c, y ∣ x) = pθ(c ∣ x) pθ(y ∣ x, c),该公式量化了开头生成概率与给定开头时后续条件分布的关系。
- 预填充干预:为了在不更新模型权重 θ 的情况下将开头的生成概率与其对后续内容的影响解耦,直接将固定候选 token cue 作为前缀提供给模型,强制模型从条件分布 pθ(y ∣ x, c) 中采样后续内容。
无监督 Token Cue 自动发现
- 生成候选开头:在 30 道 MATH 训练集问题上,利用 beam search 扩展前缀(束宽 20,深度 2),按平均生成概率保留前 20 个候选开头。
- 采样与答案提取:针对每个候选开头 c 和问题 x,在 16,384 token 预算下从条件分布中采样 16 条回复,提取最终答案,定义经验答案分布 p̂c(a ∣ x)。若候选开头的未提取答案率超过无 cue 基准 10 个百分点则剔除。
- 基于熵的 Cue 筛选:以多样本间答案的一致性作为准确率的无标签代理指标,在剩余候选集 𝒞 中选择使得跨问题平均香农熵最低的开头 c⋆ = argminc ∈ 𝒞 1/(|𝒟|) ∑x ∈ 𝒟 H(p̂c(· ∣ x))。
训练数据反事实编辑实验
- 数据关联验证:作者观察到 Olmo-3-7B 中度训练(mid-training)混合数据中,83% 的合成推理轨迹以“Okay”开头。
- 重命名编辑(Rename Mix):在 10B token 的中度训练混合数据中,将所有来源的整词“Okay/okay”全局替换为“Chicken/chicken”,测试能否将任意词转换为推理 cue。
- 重定向编辑(Redirect Mix):在重命名数据的基础上,将 Nemotron 合成问答中段落开头的“Question:”替换为“Okay,”,测试将原有 cue 与非推理文本(问答)绑定能否消除其推理效果。
- 指令编辑实验:在中度训练数据中将“step by step”替换为“duck duck goose”,测试训练关联能否使无推理语义的提示短语获得引导推理的能力。
论文做了哪些实验?
极短 cue 在多模型上匹敌 RL 表现,数据编辑可因果改变 cue 效应,在安全场景亦显著影响拒答。
论文系统评估了 token cues 对基模型推理与安全行为的激发效果,并进行了机制分析。
实验设置
- 被测模型:基模型包括 Olmo-3-7B、Olmo-3-32B、Qwen3-4B、Qwen3-14B、SmolLM3-3B、Llama-3.1-8B、Qwen2.5-Math-7B;以及对应的 RL-Zero/GRPO 训练模型、Olmo-3-7B-Instruct、Olmo-3-7B-Think-SFT 等。
- 数据集与规模:数学评测包含 MATH-500(500 题)、GSM8K(1,319 题)、AMC 23(40 题)、AIME 2024(30 题)、AIME 2025(30 题)、OlympiadBench(300 题文本子集);代码包含 HumanEval(164 题);安全包含 XSTest(250 条安全、200 条非安全提示词)。
- 指标与判定方式:主要指标为 pass@1(单次生成正确率)与 pass@16;数学评测由 Math-Verify 库自动判定数学等价性;HumanEval 运行单元测试判定;XSTest 采用 WildGuard 判定拒答与有害性。
- 采样参数:默认采样温度 0.6,top-p 0.95,每题采样 32 条回复,默认 token 生成预算为 31,744。
主结果
主结果呈现基模型在无 cue、预填充选定 cue 以及对应 RL 模型下的 pass@1 准确率(数据来自 Table 5 和 Figure 2):
表格较宽,可左右滑动
模型 提示词格式 选定 Token Cue 无 cue pass@1 预填充 Cue pass@1 RL 对照模型 pass@1 出处 Olmo-3-7B RL-Zero .\n\n Okay42.2% 77.9% 75.0% Table 5, Table 6 Olmo-3-32B RL-Zero .\n\n Okay69.8% 85.2% 89.7% Table 5, Table 6 Qwen3-4B RL-Zero .\n To43.6% 65.6% 58.6% Table 5, Table 6 Qwen3-14B Boxed Alright ,72.2% 86.6% 86.8% Table 5, Table 6 SmolLM3-3B RL-Zero .\n\n The19.3% 50.6% 62.7% Table 5, Table 6 Qwen2.5-Math-7B RL-Zero .\n To63.3% 65.3% 未报告 Table 8 Llama-3.1-8B RL-Zero .\n\n Okay0.5% 2.0% 未报告 Table 8 - 作者解读:预填充仅 2 个 token 的 cue 可使 Olmo-3-7B 和 Qwen3-14B 等基模型在 MATH-500 上的表现基本持平甚至略微超过其直接进行强化学习训练的对应版本。
- 多任务泛化:在未经重新搜索的情况下,Olmo-3-7B 的该 cue 在 GSM8K(从 45.1% 升至 85.9%)和 AMC 23(从 30.9% 升至 59.5%)等数学评测以及 HumanEval(从 50.2% 升至 69.8%)代码评测中均展现出准确率提升。
强化学习与 Cue 概率分析
- 测了什么:对比基模型与 RL 模型的每 token KL 散度与生成概率分布;测试两者的开头互换效果。
- 结果:基模型与 RL 模型的双向 KL 散度在输出的前两个 token 位置出现峰值,后续位置显著回落(Figure 3, 15);RL 将 Olmo-3-7B 生成
.\n\n Okay的概率从 0.14 提升至 0.65,将 Qwen3-14B 生成Alright ,的概率从 0.04 提升至 0.58(Figure 3);在 Olmo-3-7B 上,基模型续写 RL 模型生成的开头准确率达到 77.7%,而 RL 模型续写基模型的开头准确率仅 43.7%(Table 13)。 - 作者解读:作者认为 RL 的主要作用是提高基模型中本已具备高效推理引导能力的 token cue 的生成概率,而非从零构建新的推理能力。
训练数据反事实编辑实验
- 测了什么:在 Olmo-3-7B 10B 中度训练数据中将“Okay”替换为“Chicken”(重命名),以及将合成问答开头的“Question:”替换为“Okay,”(重定向)。
- 结果:预填充
.\n\n Chicken在基准混合数据上 MATH-500 pass@1 为 2.4%,而在重命名数据上提升至 37.2%(Figure 5, Table 15);在重定向混合数据上,预填充.\n\n Okay的准确率降至 0.2%(Figure 5)。同样,将训练数据中的“step by step”替换为“duck duck goose”后,“Think duck duck goose”的准确率从 6.4% 升至 16.5%,达到与“Think step by step”(14.9%)相当的水平(Table 23)。 - 作者解读:因果数据干预证实 token cue 激发推理的行为是由训练数据中的共现关联建立的,而非源自 token 本身的词义。
安全场景下的行为改变(XSTest)
- 测了什么:在 XSTest 上测试不同开头 cue 对 Olmo-3-7B 拒答率和有害回复率的影响。
- 结果:
I 'm sorry导致安全提示词拒答率达 89.1%,非安全提示词拒答率达 99.4%(过度拒答);Okay ,导致非安全提示词拒答率仅 38.3%,有害回复率达 42.4%;而数学推理 cue.\n\n Okay的非安全提示词拒答率为 81.9%,安全提示词拒答率仅 4.2%,有害回复率为 0.2%(Table 34)。 - 作者解读:前缀 token 会显著改变模型的安全倾向;带有换行推理的 cue 引导模型先进行反思判断,从而表现出更加选择性的拒答特性。
其他消融与分析
- 生成长度截断分析:在相同的生成 token 预算约束下截断(从 1k token 起),预填充 cue 的表现仍持续优于无 cue 基模型,排除了纯粹因回复变长带来收益的可能(Figure 4, 20)。
- 随机 Token 对照:在双换行后追加随机 token,MATH-500 pass@1 仅为 33.3%–47.1%,显著低于选定 cue 的 76.9%(Table 2)。
- 权重编辑替代 RL:在最终 MLP 层执行单次受约束的权重编辑使 cue 概率达到 0.95,MATH-500 pass@1 在 Olmo-3-7B 上达到 78%,与直接预填充 cue 相当(Figure 19)。
- Prompt 优化方法对比:GEPA 找到的 9 token(Olmo)和 64 token(Qwen)显式指令在 MATH-500 上分别取得 67.0% 和 79.3%,低于 2 token 的短 cue(Table 3)。
- 负面结果与例外:在 Llama-3.1-8B 上,测试的所有候选 cue 均未使 pass@1 显著高于零(最高 2.0%);在 Qwen2.5-Math-7B 上,
.\n\n Okay反而使 pass@1 下降 3 个百分点(Table 8)。
有什么可以进一步探索的点?
作者指出研究集中于直接 RL 设定且依赖模型数据特性,后续需深入解耦语义与数据关联。
作者指出的局限与后续方向
- 局限:聚焦于 R1-Zero 式设定:作者指出分析集中于直接对基模型应用强化学习的 R1-Zero 设定,未涵盖显式后训练阶段;多阶段后训练管线可能引入 token cues 无法激发的更复杂能力(第 6 节)。
- 局限:Cue 的有效性高度依赖模型架构与数据:作者指出 token cue 的有效性具有模型特异性,例如在 Llama-3.1-8B 上测试的所有候选开头均未发现有效 cue,反映出不同模型训练数据结构的差异(第 6 节)。
- 局限:合成推理轨迹偏差的潜在放大:作者指出反事实实验使用的 Olmo 和 SmolLM 训练混合物包含大量合成推理轨迹,由于合成数据中高频出现相似开头与推理的配对,观察到的 cue 效应在此类设定下可能尤为显著(第 6 节)。
- 后续方向:深入解耦指令语义与统计关联:作者提出未来可将类似的数据替换干预拓展至更丰富的指令中,以进一步厘清语义内容、表层形式与习得数据关联之间的独立作用(第 7 节)。
- 后续方向:后训练设计与权衡思考:作者指出当某种行为已能通过条件前缀激发时,通过权重更新进一步提高其生成概率有何得失、是否会导致其他有益行为更难激发,值得后续探索(第 7 节)。
- 后续方向:合成数据偏差的引导与防范:作者提出未来可研究在预训练中刻意设计 cue 与能力的配对,同时需要关注合成数据中无意引入的 cue 关联所带来的潜在负面影响(第 7 节)。
实验覆盖范围
- 被测模型范围:核心实验覆盖开源基模型 Olmo-3-7B、Olmo-3-32B、Qwen3-4B、Qwen3-14B、SmolLM3-3B,消融拓展包含 Llama-3.1-8B 和 Qwen2.5-Math-7B,共 7 个模型家族变体。
- 数据与任务类型:主要覆盖数学推理(6 个基准)与代码生成(HumanEval),安全行为测试仅限于 XSTest 单一基准。
- 安全评测范围:安全提示词实验仅针对 Olmo-3-7B 及 Qwen3 系列基模型在特定 prompt 格式下展开,论文未在其他模型系列上进行完整安全对比。
- 反事实训练干预规模:因果数据编辑实验主要在 10B token 的中度训练混合数据上进行(Olmo-3-7B 包含一组 100B token 验证,SmolLM3-3B 在 2B token 上进行)。
- 未报告信息:论文未报告商业闭源模型在 API 预填充设定下的表现。
总结一下论文的主要内容
揭示基模型可通过2个token的cue达到RL级推理水平,数据编辑证实该效应源于训练关联。
本文探讨了大语言模型在强化学习后训练中展现的推理行为是否本已存在于基模型之中。
- 核心问题与切入点:聚焦于基模型如何通过极其微小的输出引导激活复杂的推理能力,以及这些引导能力是否直接源于训练数据中的统计关联。
- 方法核心:提出基于样本答案一致性(最小化香农熵)的无监督搜索方法,在无需答案标签的情况下找出基模型的高概率开篇 token cue,并通过在推理前向传播中预填充该 cue 引导生成。
- 关键实验结果:
- 仅预填充 2 个 token 的 cue,即可使 Olmo-3-7B 在 MATH-500 上的 pass@1 准确率从 42% 提升至 78%(其 RL 对应模型为 75%),使 Qwen3-14B 从 72% 提升至 87%(持平其 RL 模型)(Figure 2)。
- 散度分析表明,RL 训练引起的策略变化高度集中在输出的前 1–2 个 token,其本质是大幅提高了有效推理 cue 的生成概率(Figure 3, 15)。
- 训练数据反事实编辑证实因果关联:将中度训练数据中的“okay”替换为“chicken”,使得
.\n\n Chicken在 Olmo-3-7B 上的 MATH-500 准确率从 2.4% 跃升至 37.2%(Figure 5)。 - 在安全基准 XSTest 上,不同的开头 cue 显著重塑了基模型的行为倾向,其中带有换行反思的数学 cue 能在降低有害回复率的同时保持极低的安全提示词过度拒答率(Table 34)。
- 结论与启示:作者认为基模型展现的许多高阶推理行为是预先存在的潜在能力,而非后训练从零构建;在评估与设计模型对齐及强化学习时,应严格区分模型“能够做什么”与“倾向于生成什么”。