研究质疑电路评估:电路能否解释模型错误
Rethinking Circuit Evaluation: Do Circuits Explain Model Errors?
AI 导读
论文指出,通过消融其余部分验证的电路解释可能只复现模型的正确决策,却无法解释其大部分错误。作者在 IOI、Docstring 以及 Mechanistic Interpretability Benchmark 的六个模型任务设置上,分别测量电路与模型在成功和失败样本上的精确答案一致率,发现许多电路在正确行为上高度吻合,却漏掉多数错误。在 GPT-2 small 的 IOI 任务、均值消融下,手工电路与所测自动电路(包括一个针对模型完整输出分布训练的电路)在模型答对的提示上一致率为 97.3%–99.5%,但在错误上仅为 11.4%–41.7%。