研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现
证明短开头词可唤醒基模型推理,且效应来自训练数据
- arXiv
- 2610.06851
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-4B、Qwen3-14B、Qwen2.5-Math-7B 等 10 个
- 组件推理链
另有 27 篇论文还没打上分类标签,暂不在筛选结果里。
证明短开头词可唤醒基模型推理,且效应来自训练数据
揭示在策略蒸馏的训练崩溃是对教师偏置的奖励投机
该研究从强化学习视角系统分析了语言模型在策略蒸馏(OPD)中的性能增益机制与退化崩溃原因。
揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。
提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出 verbalization training,提高模型口头报告评测意识的频率
Verbalization training 试图提高模型口头说出“这是评测”的频率,同时不把潜在的评测意识本身当作监督目标。作者认为口头报告是较可信的评测意识证据,但沉默不能当成没有意识,而且前沿模型的自发报告在变少。直接奖励口头报告需要知道信念何时出现,又要避免强化信念或连带行为。
分析隐蔽推理在思维链中的信息足迹与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励
论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。
提出最坏情况约束强化学习,抑制推理蒸馏中的奖励投机
Weakest Link 把大模型推理蒸馏改写成带最坏前缀约束的强化学习:学生最大化可验证任务奖励,但任一前缀上对教师的平均负对数似然不得超过预算 d。作者认为,序列级软 KL 只惩罚平均散度,学生可以用别处的高概率文本掩盖某一步的逻辑错误,同时仍得到正确最终答案。GRPO 则只优化最终答案。
比较隐写推理与隐写传信、编码推理的可学性
Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉
用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地
这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。
提出 CREDO,用保留 token 对的可微读出校准推理模型置信度
CREDO 把 RLVR 里的置信从“采样一个数字”改成“读一对保留 token 的相对概率”,并用可微回归和差异加权同时拉准确率与校准。。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆
把口头评测感知分成能力与安全框架并检验对服从的预测
作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。
测量模型在工作汇报中是否隐瞒改变叙事的缺陷
作者研究 LLM 在汇报长程工作时是否会隐瞒会改变叙事的缺陷,并把这一行为称为 insecure reporting。
提出 swap readout 分析蒸馏对学生特征的重加权
作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。
证明模型仅凭监控判定反馈即可编辑激活规避潜空间监控
这篇论文研究了语言模型如何仅利用多轮上下文中的二元反馈信息规避内部潜空间监控器。