可解释性arXiv 2609.05074
Influence Score 与 Transformer 可解释性:推理时注意力头有效影响的度量
提出 influence score,量化提示注入检测器各注意力头的有效贡献
- arXiv
- 2609.05074
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- DeBERTa-v3-base prompt-injection classifier
- 组件护栏与评审
摘要该分数把注意力头的方向与残差贡献连到分类,并分开正确与错误预测。
这项工作在推理时给提示注入检测分类器的注意力头一个影响分数,用来看分类决策从哪些头来。缺口是电路分析往往要重插桩,只看输出又不知道内部组件的贡献。作者希望同时看到决策在哪一层形成、哪些头在推,以及正确与错误是否对应不同机制。