分析与理论arXiv 2609.25366
研究:思维链对答案的约束随模型相对任务难度而变化
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
- arXiv
- 2609.25366
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-2-9B-IT、Gemma-2-9B、Llama-3.1-8B-Instruct 等 4 个
- 组件推理链
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地
这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。