跳到正文
10月8日 · 周四

思维链监控 · 论文

找到 5 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 分析与理论arXiv:2610.06851 ·

    研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现

    证明短开头词可唤醒基模型推理,且效应来自训练数据

    测试
    Olmo-3-7B、Olmo-3-32B、Qwen3-4B 等 10 个训练与数据层
    摘要揭示基模型可通过2个token的cue达到RL级推理水平,数据编辑证实该效应源于训练关联。

    本文探讨了大语言模型在强化学习后训练中展现的推理行为是否本已存在于基模型之中。

    完整解读
  2. 可解释性arXiv:2610.02702 ·

    研究:LLM 智能体顺从多数时内部仍保留原有前提

    用J-lens检测屈从多数的智能体是否仍表征原前提

    测试
    Qwen3.5-4B、Qwen3.6-27B、Gemma-4-E4B-it 等 4 个模型层
    摘要揭示LLM智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
    • 定位与核心问题:论文通过机械可解释性方法,研究多智能体辩论中向多数屈从的大语言模型是否在内部仍然表征其原始推导前提(静默异见,Silent Dissent),从而检验辩论收敛是否夸大了群体真实认同。
    • 方法要点:设计双跳事实阿施式同伴压力任务,使中间实体(bridge)在对话全程不出现;采用预注册协议,在回答起始 token 处通过 Jacobian lens(J-lens)与 logit lens 从残差流中提取 bridge 的词表投影排名,并配合消融实验与激活方向注入。
    • 主要发现 1(静默异见现象):在 3 个同伴施加错误答案压力下,Qwen3.5-4B、Qwen3.6-27B 和 Gemma-4-E4B-it 中屈从多数的智能体在预注册层仍表征原 bridge,J-lens 读出值分别为 0.852、0.223 和 0.237,而同一记录下 logit lens 读出值均在 0.06 以下(Table 2)。
    • 主要发现 2(前提计算的独立性):当把智能体历史回答隐藏时,4 款模型中屈从多数的智能体均读出原 bridge(读出值 0.254 至 0.434,Table 3),表明该前提可由输入问题独立推导,无需回读自身陈述;同时隐藏回答使 Qwen3.5-4B 的屈从率从 8% 升至 89%。
    • 主要发现 3(因果干预与潜在投票):沿 J-lens 方向注入原 bridge 特征可使 Qwen3.5-4B 和 Qwen3.6-27B 恢复原答案的比例分别达 41% 和 19%,但在 Gemma 和 Llama 上未见恢复(Figure 3);在自由辩论中,基于 J-lens 潜在表征的多数投票准确率并未普遍优于直接表态投票。
    • 作者结论与启示:作者认为多智能体辩论达成的表态共识可能会夸大真实一致性,智能体在屈从多数时内部仍可能计算正确前提;协议是否向智能体展示其历史发言会影响共识的稳定性,但潜在表征读取更适合用于监测异见而非替代表态投票规则。
    完整解读
  3. 分析与理论arXiv:2609.37312 ·

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链中的信息足迹与不可读性

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个模型层
    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
    • 定位与核心问题:论文针对 AI 安全中利用思维链(CoT)监控审计模型未预期计算的有效性,从计算复杂度和信息论视角研究 Transformer 隐藏推理的能力边界与监控可行性。
    • 理论核心机制:研究表明定精度 Transformer 在进行超越内部容量的隐蔽计算时,必须在思维链中泄露关于隐蔽输入的近线性互信息足迹;若试图隐藏在公开任务之后,则必须承担额外的长度税或通过搭便车泄露关联;但在密码学 PRG 假设下,单层网络可利用私有随机性在线加密思维链。
    • 微调长难度结果:在 128–255 比特 Parity 任务中,Qwen2.5-7B 的 Vanilla 准确率为 48.7%,而 Piggybacking 和 Special Tokens 分别达到 99.0% 和 94.8%(Table 6);在 19 步 S5 任务中,Llama-3.1-8B 的 Vanilla 准确率为 35.2%,而两类信息足迹机制均达到 98.7% 以上(Table 6)。
    • 无 CoT 容量线性缩放:在对 Qwen 3.5、Mistral 3 等 5 个模型家族的零样本评测中,模型在无 CoT 条件下所能解决的最大任务难度与参数量对数呈现强线性关系,例如 Qwen 3.5 在乘法任务上的线性拟合判定系数为 0.90(Figure 3)。
    • 单层在线加密可行性:基于 Goldreich 伪随机生成器从头训练的单层 128 宽 Transformer,在 4 至 1024 比特 Parity 任务上均实现 99.8% 以上的测试准确率,而在相同架构下无 CoT 和 Filler 对照在 32 比特时即降至约 50% 随机几率(Table 15、Table 16)。
    • 作者启示与结论:作者指出 CoT 监控在应对计算复杂的隐蔽目标时最为有效,安全研究应致力于将模型置于推理需求超出其单次容量的环境中;同时黑盒监控存在被加密思维链绕过的根本局限,未来需进一步研究白盒内部表征监控与语义隐写防御。
    完整解读
  4. 分析与理论arXiv:2610.02015 ·

    研究:RLVR 后训练在全新推理任务上引发语言漂移

    证明RLVR后训练允许无界语言漂移且限制漂移必限制奖励

    测试
    gemma-3-1b-pt、Llama-3.2-1B、Qwen2.5-1.5B 等 6 个训练与数据层
    摘要论文证明并验证了RLVR在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。

    论文从理论与实验两方面研究了大语言模型在RLVR后训练过程中思维链出现的语言漂移现象。

    完整解读
  5. 分析与理论arXiv:2609.25366 ·

    研究:思维链对答案的约束随模型相对任务难度而变化

    用续写扰动衡量思维链对答案的因果约束如何随任务难度变化

    测试
    Gemma-2-9B-IT、Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Qwen-7B 等 4 个模型层
    摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。
    • 定位与核心问题:论文通过因果干预评估大语言模型思维链的因果承重性,探讨中间推理步骤在何种情况下真正约束最终答案,从而厘清基于思维链进行安全监控的有效前提。
    • 方法设计:提出基于续写的因果测试协议,在模型正确的多步推理前缀中扰动单步并截断,强制模型续写,依据答案与推导过程将行为划分为静默旁路、自我修正与错误传播三类,并结合隐状态探针与激活引导检验其机制。
    • 任务难度主导承重性:在 Gemma-2-9B-IT 上,错误传播率从 GSM8K 的 3.9% 升至 BBH 的 40.9%,且在 MMLU 29 个子科目间呈现 7 倍跨度(7.5% 至 53.7%);在特定分桶和进入顺序的序贯模型中,难度项占已解释离差的98.8%,不等于全部变异解释率,扰动类型仅占 0.8%。
    • 跨模型规律与后训练影响:Llama-3.1-8B-Instruct 以更低的基线准确率复现了难度梯度(总体错误传播率达 57.2%);而强化学习蒸馏模型 DeepSeek-R1-Distill-Qwen-7B 表现出更低的错误传播率(GSM8K 为 5.1%、BBH 为 16.8%),作者将此与后训练的自我验证习惯联系起来;模型、筛选和解码条件不同,不能作为后训练因果效应的干净比较。
    • 表征可读但加性控制受限:隐状态线性与 MLP 探针能够预测行为模态(Gemma 错误传播检测准确率达 86.2%),但在 11,556 次单向加性激活引导实验中均未诱发行为翻转,仅 8 向量基引导对错误传播呈现 24.6% 的部分翻转。
    • 安全启示:作者指出思维链承重性随任务难度变化为安全监控带来结构性困扰:简单任务中模型旁路推理使监控缺乏信号,困难任务中错误快速级联使干预窗口变窄;未来的监控与防护策略必须基于任务难度校准对思维链的信赖程度。
    完整解读
已经到底了