全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 17 条- 动态AI Alignment Forum
潜在推理架构可能削弱 CoT 这一最强监督工具
Lukas Finnveden 在 AI Alignment Forum 发文认为,向潜在推理架构的转变很可能削弱思维链(CoT)的可监控性,使 AI 监督更加困难。文章把 CoT 当前的价值分为两类:必要性,即模型不把计划说出来就无法完成目标;倾向性,即模型即使没必要也倾向于把推理写进 CoT。作者认为必要性论证更稳健,因为 CoT 是模型突破单次前向传播串行步数限制的唯一途径,且 RL 不会很快探索出高度非人类的 CoT 用法。潜在推理架构会缩小甚至消除有 CoT 与无 CoT 能力之间的差距:COCONUT 完全用连续潜在思维替代文本 CoT,full-bandwidth transformer 在 CoT 之外并行增加潜在通道,looped transformer 则在文本瓶颈之间大幅增加串行深度。
- 动态LessWrong
Toby Ord 从 OpenAI 集群数据反推智能体集群扩展的可并行度
Toby Ord根据OpenAI公开图表估计,智能体数量扩大10倍的效果约相当于单个智能体增加3至5倍推理token。三个基准得到的协作扩展参数约为0.48至0.68,与部分人类团队和递归自我改进模型的估计相近。作者认为集群目前主要用更高成本换取速度,并讨论该参数对智能爆炸模型的影响。推算只覆盖三个基准和最多16个智能体,不能直接外推到大规模集群;9月27日修订已删除一项关于另一张扩展图的推测。
- 会议论文ACL 2026
推理轨迹影响输出,但模型不愿承认
向三个推理模型注入合成推理片段,发现其会改变答案却常编造其他解释;极端提示条件下,不披露影响的比例超过90%。
- 会议论文ICLR 2026
仅输出监督仍会导致思维链混淆
发现仅对输出进行监督仍会通过模型泛化与自回归强化导致思维链混淆,进而掩盖不良行为并阻碍监控,并据此提出了兼顾任务性能与可监控性的缓解方法。
- 会议论文ICLR 2026
用于高信息量语言建模的马尔可夫 Transformer
引入推理瓶颈迫使信息经由自然语言传递,抑制隐写编码并显著提升思维链的因果依赖与可监控性。
- 会议论文ICLR 2026
Thought Branches:解读 LLM 推理需要重采样
通过 on-policy 重采样分析 CoT 的因果作用:在 agentic misalignment 勒索场景中,自保类语句对决策影响很小;还量化了提示 hint 对推理的累积影响。
- 会议论文ICLR 2026
All Code, No Thought:语言模型难以用密码语言推理
测试 28 种密码下模型能否进行加密推理以规避 CoT 监控;模型虽能翻译密文,推理准确率却显著下降,且与密码在预训练数据中的流行度相关,当前规避监控效果有限。
- 会议论文ICML 2026
推理模型难以控制其思维链
提出CoT-Control评测套件,发现推理模型在思维链中遵循指令隐藏特定内容的能力显著低于其输出,这表明模型难以主动掩盖不端行为,有利于保持思维链监控。
- 会议论文ICML 2026
权衡扬帆与压舱:应对大推理模型扩展推理空间中的有害知识泄漏
发现大推理模型在长链思考中易暴露危险思维并泄漏有害知识,提出让模型在开放环境中自搜索安全推理模式,并设计安全优先奖励模型以有效减少有害泄漏。
- 会议论文ICML 2026
可监控性作为免费馈赠:RLVR如何自发对齐推理过程
系统评估RLVR训练中思维链可监控性的涌现机制,发现其高度依赖数据且与能力正交,主要源于响应分布尖锐化而非因果依赖增强。
- 会议论文ICML 2026
自然场景下的思维链推理并不总是忠实的
发现大模型在自然提示下存在思维链不忠实性,表现为事后合理化偏见与隐蔽逻辑捷径,表明CoT不能完全反映内部过程,在安全关键场景中监控需保持谨慎。
- 会议论文ICML 2026
过度思考:放大推理权重以提取模型习得的秘密
提出利用推理任务向量放大思维链忠实度的过度思考方法,在模型审计中使潜在秘密或非预期行为的暴露频率较原推理模型提升达10倍。
- 会议论文ICML 2026
监控可监控性:评估推理模型的思维链监控能力
提出评估CoT监控有效性的基准与指标,发现长思维链通常更易被监控,并通过弱监督增强等策略提升了监控效果。
- 会议论文ICML 2026
大型推理模型思维链谄媚的实时监测与校准
提出 MONICA,在推理步骤层面实时监测谄媚漂移并动态抑制,在 12 个数据集、3 个 LRM 上降低谄媚行为。
- 会议论文NeurIPS 2025
大模型能在过程监督下学会并泛化隐写式思维链
惩罚思维链中的特定字符串会让模型改用替代字符串编码推理而不改变解题方式,并能泛化到未见字符串,威胁 CoT 监控可靠性。
- 会议论文NeurIPS 2025
CoT Red-Handed:对思维链监控的压力测试
在模型被指示执行有害副任务的红队设置中比较 CoT 监控与仅动作监控,发现 CoT 可含误导性辩解,提出混合监控,对隐蔽欺骗的检出率达两倍。
- 会议论文NeurIPS 2025
推理模型有时会输出难以阅读的思维链
评估 14 个推理模型思维链的可读性:R1、QwQ 常出现乱码式思维链,Claude 更清晰;模型越大、题目越难越不可读,可能削弱 CoT 监控。