可解释性arXiv 2609.23065
从概念对齐到因果接地:思维链忠实性的干预检验
用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地
- arXiv
- 2609.23065
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Llama-3.1-8B、Gemma-2-2B、Gemma-2-9B 等 5 个
- 组件推理链
摘要共享 SAE 上的概念重叠只标出候选概念,Δp 才度量它们是否因果支撑答案,且该效应随层和架构变化。
这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。