可解释性arXiv 2609.04582
研究:内部探针何时优于读答案,区分阈值失准与行为隐藏知识
用探针与 logit margin 区分阈值失准与行为隐藏知识
- arXiv
- 2609.04582
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3-0.6B、Qwen3-1.7B、Qwen3-4B 等 8 个
摘要验证里结论多在 logit、丢在阈值。
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
用探针与 logit margin 区分阈值失准与行为隐藏知识
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地
这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆
提出 swap readout 分析蒸馏对学生特征的重加权
作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。
比较用于审计提示注入与隐瞒的 token 位置选择信号