研究揭示机制可解释性中的目标层恢复缺口
Are We Recovering Mechanisms? Objective-Level Recovery Gaps in Mechanistic Interpretability
作者比较同等规模电路的 faithfulness 与固定行为准则,发现 KL 会错排候选,部分恢复完整上下文可修复多数持续性错排。
- 机制可解释性用干预定义的 faithfulness 选择电路,但该分数可能偏好行为复现更差、规模相同的电路,从而产生 objective-level recovery gap。
- 在固定规模下比较验证集 faithfulness 与留出提示上的行为准则 Q。作者先做参考电路的等规模编辑,再评测 EAP、EAP-IG、ACDC、Edge-SP 的输出,并用部分恢复完整模型信号检验 context distortion。
- Resampling 下,四种方法在 human-reference 任务上的候选对 KL 错排率为 9.4%–41.2%。对 100 个持续性 KL 错排,至少一种部分恢复在 96 例中同时修正验证与独立测试排序,电路与原始 Q 不变。
- Q 依赖 ordinary resampling,不能单独确立机制同一性。任务与搜索预算有限,电路对相互依赖。恢复结果只针对选出的持续性 KL 失败,不识别最小因果集,也不确立相对随机恢复的优势,且未说明对其他指标或未入选失败是否有效。成对反转只是局部排序失败。
- 模型
- GPT-2 smallfour-layer attention-only width-512 code modelInterpBench compiled transformers
- 基准
- IOIGreater-ThanDocstringAcronymInterpBench suite(10 tasks: 113, 97, 2, 82, 111, 45, 58, 93, 103, 25)
- 指标
- F_KLF_LDF_PDQmisranking rateΔQΔF
论文指出,机制可解释性中常用的干预式忠实度指标可能偏好一个同等规模但行为复现更差的电路,形成目标层恢复缺口。作者在四个人类参考任务和 InterpBench 上,将验证忠实度与固定普通重采样下留出提示词上的行为表现对比,行为标准为与完整模型一致(包括其错误),Greater-Than 任务改用语义准确率。受控参考编辑在没有任何发现算法的情况下即可暴露错误排序,EAP、EAP-IG、ACDC 和 Edge-SP 的输出也出现同样失败;在重采样下,KL 在人类参考任务上对 9.4%-41.2% 的候选对排序错误。作者用上下文失真解释这一现象:替换被排除的信号会改变保留组件所处理的输入;从接收方完整模型执行中恢复选定信号,可在验证和留出提示词上修复发现池中 100 个持续 KL 错误排序中的 96 个,而电路及其原始行为分数保持不变。
深度解读
这篇论文试图解决什么问题?
Faithfulness 可能偏好规模相同但行为复现更差的电路,形成 objective-level recovery gap。
干预定义的 faithfulness 能否偏好一个规模相同、却更差地复现完整模型行为的电路?
- 场景:机制可解释性要把模型行为对应的内部计算恢复为稀疏子图。自动化电路发现常被表述成搜索问题,默认评测目标能在找到更好电路后识别它。
- 现有做法的不足:作者认为,常用检验是干预定义的 faithfulness,即电路外计算被消融或替换后,输出与模型有多接近。执行电路时要把被排除信号换成 donor activations、均值或零,保留组件因此在改变后的输入上重算,作者称之为 context distortion。
- 核心问题:作者把分数偏好行为更差候选的情况称为 objective-level recovery gap。若目标本身奖励错误候选,更有效的搜索也不能消掉这一偏好。
- 检验方式:在同等规模电路对上做 pairwise misranking:验证分数偏好一方,独立测试上的行为偏好另一方。行为准则 Q 在类别任务上是与完整模型答案的一致,包含模型自己的错误;Greater-Than 改用语义准确率。
- 论文做了什么:在四个有人工参考电路的任务和 InterpBench 上,比较受控编辑与 EAP、EAP-IG、ACDC、Edge-SP 的输出,并检验部分恢复完整计算上下文能否修正错排。
有哪些相关研究?
相关工作分电路发现与恢复基准、以及电路评测的可靠性两类,本文把选择目标的可靠性单独拿出来。
电路发现与恢复基准
- ACDC、EAP、EAP-IG、Edge-SP:Conmy et al. (2023) 用 activation patching 剪枝连接;Syed et al. (2023) 的 EAP 用梯度近似边效应;Hanna et al. (2024) 与 Sundararajan et al. (2017) 的 EAP-IG 用 integrated gradients 改进归因;Edge-SP 通过子网络优化学习边掩码(Conmy et al., 2023; Sanh et al., 2020)。
- 更大规模与特征电路:Bhaskar et al. (2024) 在更大规模上优化稀疏边掩码;Marks et al. (2025) 在可解释特征上发现电路。作者称这些方法解决的是如何找候选。
- 已知计算的基准:Lindner et al. (2023) 的 Tracr 把程序编译成 transformer;Gupta et al. (2024) 的 InterpBench 提供带指定电路的半合成模型;Mueller et al. (2025) 的 MIB 标准化电路与因果变量定位评测。
电路评测的可靠性
- 消融与打分选择:Miller et al. (2024) 指出 faithfulness 测量会随消融方法明显变化;Zhang and Nanda (2024)、Heimersheim and Nanda (2024) 指出 activation patching 的结论依赖 corruption 与打分选择。
- 对抗与统计检验:uit de Bos and Garriga-Alonso (2024) 的 Adversarial Circuit Evaluation 寻找已发表电路与完整模型分歧的输入;Shi et al. (2024) 用统计检验考察保持、定位与极小性。
- 子空间干预:Makelov et al. (2024) 指出干预可能经休眠通路改变输出,使它作为原始计算证据的解释变复杂。
基线方法与基准
- 基线方法:EAP、EAP-IG、ACDC、Edge-SP,用于产生实际发现输出;受控实验则从参考电路做等规模替换。
- 基准/数据集:Human suite 为 IOI(Wang et al., 2023)、Greater-Than(Hanna et al., 2023)、Docstring(Heimersheim and Janiak, 2023)、Acronym(García-Carrasco et al., 2024);InterpBench suite 为十个经 native-closure 核验的半合成任务(Gupta et al., 2024)。
作者用参考电路构造受控候选,用发现方法检验实际相关性,并用独立测量的行为评估选择。作者称本文研究的是这种不可靠性如何影响电路选择:即使更好的候选已经在场,分数仍可能偏好规模相同、留出行为更差的候选。上下文恢复实验检验保留组件的输入被改变是否促成这一偏好,并把选择目标的可靠性当作机制恢复的一项单独要求。
论文如何解决这个问题?
固定 Q 与电路规模,比较 faithfulness 排序,再用部分恢复完整信号检验 context distortion。
作者把问题拆成排序性质:在固定、等规模的电路对里,验证分数 F 是否会偏好行为准则 Q 更差的一方。比较对象先是参考电路的受控编辑,再是发现方法的输出;最后在已有错排上做部分上下文恢复。
问题设定与形式化
- 电路执行:完整模型为 M,可执行掩码为 S。执行 M_{S,a} 保留 S 中的信号,并按干预 a 替换被排除信号。Resampling 用保存的 donor assignment,mean 用冻结的 mean bank,zero 填入零。
- 规模控制:主要比较都要求声明表示中的组件数相同,并在同一任务内比较;发现输出还限制在同一方法内。重复掩码在组对前删除。
- 验证分数:主分数是负的输出分布 KL。对验证提示 V,FKL(S)=−Ex∈ V[DKL(pM(·|x)∥ pS(·|x))],越大越好。先对提示内有效输出位置平均,再对提示平均;resampling 再对三次共享 donor 抽样平均。LD、PD 是任务边际的补充分数,正类集合 P 与其余有效任务类 N 由任务映射规定,不由候选预测决定,概率不重归一化到 P∪N。
- 行为准则与错排:Q 在留出提示 T 上、ordinary resampling 下衡量与完整模型答案的一致,并使用同三次 donor。类别序列任务先在提示内聚合有效位置。Q 在更换验证干预或分数时保持不变。Greater-Than 的 Q 是预测的两位年份结尾严格大于提示起始结尾的比例,不用精确 token 一致。对一对电路,Q 更高者为 B、更低者为 W;当 F(W)>F(B) 且 ΔQ=Q(B)−Q(W)>0 时记为错排。R–C 比较参考与候选,C–C 比较两个候选;哪一方 Q 更高由测量决定,不预设参考更好。绝对与相对容差排除数值平局,Q 平局与分数平局都算非错排。作者也写出规模为 K 的电路族上 F 与 Q 的各自最优可以不同,但实验不计算这些全局最优,只检验固定对上的排序。
受控候选
- 编辑:从参考电路出发,用同样数量的被排除组件替换保留组件。六个编辑带为一组件、以及参考规模的 5%、10%、20%、50%、75%,每个可达到且互异的带用十个种子。相同掩码以及换算成同一编辑数的带会去重。
- 比较:在 resampling、mean、zero 下做 R–C 与 C–C。候选掩码、提示和测试 Q 的顺序在各次评测间固定。InterpBench 参考在使用前对照 native execution 检查。附录 B 给出转换核验;task 25 的 75% 带不可达。
发现输出
- 方法与种子:评测 EAP、EAP-IG、ACDC、Edge-SP。每个任务、每个种子用 100 条发现提示,各方法共享,且与评测提示不相交;共十个发现种子。
- 评测固定:复用第 3 节的全部验证与独立测试提示、mean bank、有效位置掩码和 donor assignment。ACDC 与 Edge-SP 每次运行有 300 秒发现上限。主要比较要求实际可执行规模相等。InterpBench 的参考比较使用已核验的 native-reference closure。
部分上下文恢复
- 样本:从第 4 节发现池中选 100 个等规模的电路对加干预:Human 与 InterpBench 各 50,其中 resampling 50、mean 25、zero 25。每例在验证和独立测试提示上都有严格 KL 错排,且 Q 缺口至少 0.5 个百分点。
- 操作:在选定的被排除入边处,用该接收提示在完整模型执行中缓存的激活替换干预信号;保留连接照常计算。掩码、权重、未恢复的 donor、mean bank、提示和原始 Q 顺序不变。
- 搜索:按接收节点分组被排除入边,在原始合格组数的 80%、40%、20%、10% 上搜索,每级最多五次预定尝试。第一个在验证上成功的子集成为下一级的抽样父集;失败则回到原始全集。合格子集再用独立提示自身的完整信号与原始 donor 测试,测试结果不指导搜索。至少有一个子集把两个排序都改到预定义容差之外才算修复;之后的失败不取消先前成功。搜索在 10% 级结束后停止,总共不超过 20 次尝试。附录 D 给出完整流程。
共享评测细节
- 模型与提示:IOI、Greater-Than、Acronym 使用 GPT-2 small;Docstring 使用其参考电路所研究的四层、仅注意力、宽度 512 的代码模型。IOI、Greater-Than、Docstring 用分解后的注意力/残差边表示,Acronym 用注意力头。InterpBench 每个任务有单独编译的 transformer 与原生真值计算。第 3、4 节共享冻结的 100 条验证提示、100 条独立测试提示、100 条提示的 mean bank 和三次 donor;验证与测试身份不相交。三次 donor 在每个接收提示内先平均,再对提示平均,不是三次独立观测。
- 容差与不确定性:Human 的绝对与相对容差为 10^{-6};修正后的 InterpBench 受控分析为 10^{-12} 与 10^{-9}。第 3、4 节不设 0.5 个百分点的 ΔQ 门槛,该门槛只用于第 5 节队列。Human 受控分析用 1,000 次配对 bootstrap,修正后的 InterpBench 分析用 10,000 次;只在为该比较的 Q 定义和分数方向计算过时报告配对支持。
论文做了哪些实验?
等规模受控编辑、四种发现方法的输出,以及 100 例上下文恢复,都出现 KL 错排或可被修复的错排。
实验设置
- 被测模型:GPT-2 small(IOI、Greater-Than、Acronym);四层仅注意力、宽度 512 的代码模型(Docstring);InterpBench 的十个编译 transformer(任务 113、97、2、82、111、45、58、93、103、25)。
- 任务与参考:Human suite 四个人工电路任务;InterpBench 十个经 outgoing-edge closure 核验的参考。参考规模见附录 Table 8,例如 IOI 963 条边、Greater-Than 235、Docstring 24、Acronym 8 个头。
- 基线/候选来源:受控实验从参考做等规模替换,每带最多十个种子(810–819)。发现实验为 EAP、EAP-IG、ACDC、Edge-SP,十个发现种子,每任务每种子 100 条发现提示。
- 指标:主验证分数为负 KL;补充为 LD、PD。行为 Q 为 ordinary resampling 下与完整模型答案的一致,Greater-Than 为语义准确率。错排率的分母是全部合格对,含 Q 平局与分数平局。
- 提示规模:验证 100、独立测试 100,二者身份不相交;mean bank 为 100 条提示;resampling 平均三次共享 donor。发现提示与两个评测划分都不相交。
- 其他设置:ACDC、Edge-SP 每次发现 300 秒上限。主要比较要求实际可执行规模相同。附录报告配对 bootstrap,Human 受控分析 1,000 次,修正后 InterpBench 分析 10,000 次。
主结果
受控实验的任务级 KL 错排率与错排对的平均 ΔQ(百分点)据 Table 2。下表只列 Human suite 与若干 InterpBench 极端行;其余 InterpBench 任务的完整格子在 Table 2,这里不合并填值。
表格较宽,可左右滑动
任务 Resampling R–C Resampling C–C Zero R–C Zero C–C IOI 6.7% (0.33) 7.3% (3.56) 3.3% (0.50) 21.1% (15.90) Greater-Than 0.0% 3.4% (1.85) 56.7% (28.87) 54.0% (27.20) Docstring 8.0% (0.92) 3.3% (0.99) 32.0% (4.40) 16.0% (6.03) Acronym 5.0% (0.28) 5.8% (3.94) 10.0% (18.36) 29.2% (20.46) InterpBench 97 0.0% 5.2% (10.09) 0.0% 22.0% (21.74) InterpBench 111 3.3% (0.22) 3.4% (0.76) 80.0% (5.24) 72.5% (4.33) InterpBench 93 0.0% 0.6% (2.22) 70.0% (63.55) 68.7% (56.59) 表中省略了 InterpBench 任务 113、2、82、45、58、103、25,以及全部 mean 列;这些数字都在 Table 2。括号内是该格错排的平均 ΔQ,单位为百分点;0.0% 的格子没有错排,Table 2 写为 “–”。
- 作者称干预会改变分数奖励哪个候选:电路与 Q 顺序不变。Greater-Than 的 C–C 从 resampling 的 3.4% 升至 zero 的 54.0%,R–C 从 0 升至 56.7%;IOI 的 R–C 在 mean 下为 33.3%,在 zero 下为 3.3%。
- 行为缺口可以很大,也可以接近平局:task 93 在 zero 下错排 70.0% 的 R–C,被偏好电路平均少 63.55 个百分点 Q;task 113 的 resampling R–C 失败平均只少 0.04 个百分点。InterpBench 参考 Q 为 97.33%–100%,task 97 在三种干预下都没有 R–C KL 错排。
- 换分数不能消除错排:Table 3 在 14 个受控任务的共同对上,resampling 的 C–C 错排率为 KL 3.7%(平均 ΔQ 3.03 pp)、LD 6.2%(2.70 pp)、PD 5.0%(9.16 pp);zero 的 C–C 为 KL 33.3%(28.03 pp)、LD 19.0%(16.37 pp)、PD 25.1%(20.39 pp)。
发现方法的输出
- 四种方法都有错排:Table 4 中,human-reference 任务在 resampling 下的 C–C KL 错排率为 EAP 20.0%(平均 ΔQ 2.18 pp)、EAP-IG 30.4%(1.36 pp)、ACDC 41.2%(1.11 pp)、Edge-SP 9.4%(1.73 pp)。Table 5 中 InterpBench 的 resampling C–C 从 EAP-IG 的 2.9%(0.07 pp)到 Edge-SP 的 18.7%(0.15 pp)。
- 同一池内干预会改变选择:Human 上 EAP-IG 的 C–C 从 resampling 30.4% 到 mean 53.0%。InterpBench 上 ACDC 的 C–C 从 resampling 7.9% 到 zero 46.0%。Human Edge-SP 在 zero 下的 R–C 错排平均 ΔQ 为 34.14 pp;InterpBench EAP-IG 的 resampling C–C 失败平均为 0.07 pp。
- Human 汇总体更高:附录 C.5 把各套件内的共同发现对汇总后,Human 的 C–C KL 错排在 resampling、mean、zero 下为 20.9%、30.9%、38.1%,InterpBench 为 9.8%、16.2%、26.8%。作者称各方法的任务覆盖、重复输出和达到的电路规模不同,汇总体百分比不能直接比较方法;Human ACDC 的主要池包含 Docstring 和 Acronym,其被截断的 IOI 与 Greater-Than 输出属于其他规模层。作者认为 InterpBench 更小的模型与半合成任务可能使候选更容易区分,但该比较没有把这些因素分离为原因。
上下文恢复
- 96/100 得到确认修复:Table 6 中,任意恢复级别下 Human 50/50、InterpBench 46/50。仅名义 10% 级别就有 82 例确认修复。全部 100 例在 80%、40%、20%、10% 与任意级别的确认修复率为 84.0%、88.0%、87.0%、82.0%、96.0%。
- Q 顺序反转而原始 Q 不变:100 例基线的平均 Q(非偏好)−Q(偏好) 为 +10.33 pp;96 个已修复例的修复后均值为 −9.30 pp,这 96 例的基线均值为 +9.30 pp。四个未确认例留在修复率分母中,没有修复后数值。作者称成功不必随恢复比例单调,因为搜索会选择不同子集并可能从原始全集重新开始。
- 分干预的未全修复格子:InterpBench 的 mean R–C 任意级别为 66.7%,修复前/后平均 ΔQ 为 1.90(−2.32)pp;其 zero C–C 任意级别也为 66.7%,前/后为 26.23(−4.82)pp。Table 6 中 Human 各干预、各对类型的任意级别都是 100.0%。
其他消融与分析
- 编辑幅度:Figure 2 与附录 Table 12。Greater-Than 在 zero、50% 带上 R–C 为 10/10;Docstring 的 zero R–C 从最小编辑的 10/10 降到两个最大带的 0。作者称错排不随编辑幅度一致升降。
- 精确计数:附录 Table 11。例如 IOI resampling 为 R–C 4/60、C–C 130/1770;Greater-Than zero 为 R–C 34/60、C–C 956/1770;task 111 zero 为 R–C 48/60、C–C 1284/1770。
- 参考与候选 Q:附录 Table 9–10,均为 ordinary resampling。IOI 参考 Q 99.00%,75% 带候选均值 49.30%(10 个);Docstring 参考 34.00%,75% 带 9.67%;InterpBench task 111 参考 97.33%,75% 带仍有 90.19%;task 113 参考 99.93%,75% 带 3.11%。Greater-Than 参考语义 Q 为 99.67%。
- LD/PD 任务级:附录 Table 13。Docstring 的 PD 在 resampling 下为 R–C 38/50、C–C 598/1225;IOI 的 LD 在 zero 下为 R–C 46/60、C–C 1406/1770。
- 三指标共同失败:附录 Table 30。第 3 节 Human C–C 的三指标共同失败 597 对,ΔQ 中位数 3.67 pp(Q1 1.00,Q3 18.67),其中 ≥5 pp 的有 271;联合支持为 152/472。第 4 节 InterpBench C–C 共同失败 356 对,中位数 0.19 pp。
- 表示核验:附录 Table 7。十个 InterpBench 任务在八条提示、一次 donor 的 resampling 探针上,最大绝对 logit 差为 task 25 的 2.56×10^{-13}。task 113 的投影边 30 条,closure 为 587 条。作者排除了转换仍未解决的 ioi next token,不把它当作真值。
有什么可以进一步探索的点?
作者写明 Q 不能确立机制同一性,恢复实验只覆盖选出的持续性 KL 失败。
作者指出的局限与后续方向
- Q 的含义:Limitations 写明,行为准则 Q 依赖 ordinary resampling,本身不能确立机制同一性。
- 任务、预算与依赖:同一节写明任务和搜索预算有限,电路对相互依赖。
- 恢复队列的范围:恢复结果针对选出的持续性 KL 失败队列;它们既不识别最小因果集,也不确立相对随机恢复的优势。
- 恢复可能带回信息:作者写明恢复可以重新引入有用信息,成功修复并不说明同一做法对其他指标或未入选失败是否有效。
- 局部而非全局:成对反转展示的是局部排序失败,不是全局最优电路之间的差异。
- 评测建议:Discussion 的 Implications 建议把固定行为准则与 faithfulness、干预和电路规模控制一起报告,并同时报告错排率与行为缺口;测试多种指标和干预,以看偏好是否依赖某一种评测选择。作者还把因果抽象、结构恢复和统计电路检验写成输出一致之外的互补证据,没有写成已经完成的实验。
实验覆盖范围
- 任务与模型:受控与发现比较使用 Human suite 的 IOI、Greater-Than、Docstring、Acronym,以及 InterpBench 的十个任务;前三个与 Acronym 的模型见附录 A.1,InterpBench 为每个任务单独的编译 transformer。
- 干预与分数:主要比较覆盖 resampling、mean、zero,以及 KL、LD、PD。Q 固定为 ordinary resampling,Greater-Than 使用语义准确率。
- 发现方法:第 4 节覆盖 EAP、EAP-IG、ACDC、Edge-SP;十个发现种子,每任务每种子 100 条发现提示;ACDC 与 Edge-SP 有 300 秒上限。论文写明各方法的任务覆盖、重复输出和电路规模不同。
- 恢复实验:第 5 节为 100 个等规模、ΔQ 至少 0.5 个百分点、验证与独立测试都严格 KL 错排的例子,Human 与 InterpBench 各 50;搜索级别为合格组数的 80%、40%、20%、10%,每级最多五次尝试,总共不超过 20 次。
- 论文写明未计算或未纳入的量:实验不计算式 (5) 的全局最优。第 3、4 节不设 0.5 个百分点门槛。ioi next token 因适配后的参考 closure 仍未解决而被排除。配对 bootstrap 只在为相应 Q 定义和分数方向计算过时报告;Greater-Than 的语义 Q 区间不提供 LD/PD 的联合不确定性。
总结一下论文的主要内容
同等规模下 faithfulness 会错排行为更好的电路;部分恢复完整上下文可修正 96/100 个持续性 KL 错排。
作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。
- 问题:执行电路时,被排除信号被换成 donor、均值或零,保留组件在改变后的输入上重算。作者把这种计算上下文的变化称为 context distortion,并认为它可以使分数偏向在干预下表现好、而非在固定行为测试下更接近完整模型的电路。
- 做法:行为质量 Q 在留出提示上用 ordinary resampling 衡量与完整模型答案的一致,Greater-Than 改用语义准确率;验证分数更换时 Q 保持不变。主要比较都限制为同等组件数。先从参考电路做等规模编辑,再评测 EAP、EAP-IG、ACDC、Edge-SP 的输出,最后在已有 KL 错排上部分恢复接收提示的完整模型信号。
- 受控结果:Table 2 中,Greater-Than 的 C–C KL 错排从 resampling 的 3.4% 到 zero 的 54.0%;task 93 在 zero 下错排 70.0% 的 R–C,平均少 63.55 个百分点 Q。Table 3 中 KL、LD、PD 都有错排。Figure 2 显示错排不随编辑幅度单调变化。
- 发现结果:在 human-reference 任务、resampling 下,C–C KL 错排为 EAP 20.0%、EAP-IG 30.4%、ACDC 41.2%、Edge-SP 9.4%(Table 4)。附录汇总后,Human 的 C–C 在三种干预下为 20.9%、30.9%、38.1%,InterpBench 为 9.8%、16.2%、26.8%。
- 恢复与结论:100 个持续性 KL 错排中,至少一种部分恢复在 96 例里同时修正验证与独立测试排序,电路和原始 Q 不变(Table 6)。作者认为这表明 context distortion 是错排的一个促成因素,也说明只改进发现并不足以恢复机制,因为评测目标可能偏好更差的候选。作者同时写明,Q 不能确立机制同一性,恢复结果只覆盖选出的持续性 KL 失败。