分析与理论arXiv 2609.04194
研究:思维链推理步骤的可读性不等于可解释性
用 advantage 衡量思维链步骤重要性,检验文本能否解码
- arXiv
- 2609.04194
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3-1.7B、Qwen3-4B、Qwen3-8B 等 6 个
- 组件推理链
摘要advantage 能标出影响答案的步骤,但正确回答的文本更难解码。
作者用强化学习中的 advantage 比较 CoT 步骤“看起来重要”和“实际改变答案概率”是否一致。
用 advantage 衡量思维链步骤重要性,检验文本能否解码
作者用强化学习中的 advantage 比较 CoT 步骤“看起来重要”和“实际改变答案概率”是否一致。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地
这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆