研究提出 FEGA 框架分析 SAE 特征干预的 logit 变化几何
Sparse Autoencoders Encode Both Concepts and Functions: The Downstream Geometry of Feature Effects
作者用 FEGA 分析 Gemma-2-2B 上 SAE 特征消融后的 logit 效应几何,发现一维可复用方向很少,value-like 更常呈低维结构,pointer-like 多为弥散。
- SAE 特征的激活描述与因果效应经常不一致,转向效果随提示变化,激活筛选也会漏掉能改变输出的特征。作者要测量同一特征在不同上下文中消融后,下游 logit 变化是否形成稳定几何。
- Feature-Effect Geometry Analysis(FEGA)在重建基线上消融同一活跃 SAE 特征,收集 logit 效应云,并用有向射线、轴、方向混合、全局跨度与中心化残差等诊断给出几何标签。特征来自 Gemma-2-2B 第 12 层后残差流上宽度 65k 的 ReLU、TopK 与 Matryoshka Batch TopK SAE,并按 value-like、pointer-like 与混合任务区分。
- 作者称一维可复用效应很少。ICL 任务选出的特征集很小且有跨任务重叠,与 RAVEL 集合不相交;联合消融相对匹配随机对照带来更大准确率下降。作者称 pointer-like 效应以弥散为主,value-like 更常呈低维结构,但通常跨多个方向。
- 作者计划发布代码。几何结论来自 Gemma-2-2B 的 post-layer-12 残差流 SAE、五类任务和三种宽度 65k 的 SAE;RAVEL 几何分析要求至少八个活跃上下文。论文报告了随机对照的 20 次试验,以及 McNemar 与 t 检验。
- 模型
- Gemma-2-2BReLU SAETopK SAEMatryoshka Batch TopK SAE
- 基准
- Literal Sequence CopyingWord ContentPrOntoQAToken TranslationRAVEL (City-Country)
- 指标
- AccuracyIoUCraySspanEresgeometry label fractions
研究者提出 Feature-Effect Geometry Analysis(FEGA)框架,通过在不同上下文中移除同一个活跃 SAE 特征,分析由此产生的 logit 变化云,以研究特征干预对模型输出的影响几何。结果显示,在多种 SAE 变体中,表现出一致一维效应的特征很少,即少有特征能像可复用方向那样起作用。作者据此区分值型特征(关联事实属性等静态信息)与指针型特征(关联依赖上下文的操作):值型特征更常呈现结构化的低维效应,但通常跨越多个方向;指针型特征则主要呈现弥散效应。研究结论是,一个特征可以既可解释又具因果相关性,却未必能提供稳定的引导方向。
深度解读
这篇论文试图解决什么问题?
同一 SAE 特征跨上下文消融后,下游 logit 效应是否形成可复用的稳定几何。
同一 SAE 特征被干预时,下游 logit 效应在不同上下文中是否可比较、是否形成稳定几何。
- 场景与重要性:作者认为 SAE 被广泛用作可解释性工具,但特征与行为的联系不稳定。激活描述清楚的特征可能因果效应弱或出乎意料;转向可随提示变化,甚至与预期方向相反;按激活选特征也可能漏掉能产生目标输出变化的特征。因果主张需要干预特征并测量模型变化。
- 现有方法的不足:作者称已有流程能说明特征“看起来表示什么”,但不能说明修改后如何传到模型其余部分。先前工作研究特征在模型内部被计算处的几何;作者认为缺少可计算的诊断,用来区分可复用效应几何、结构化低维效应空间,以及难以用低秩解释的弥散效应云。
- 核心观察:作者借用程序语义中的 value 与 pointer,区分 value-like(与相对不依赖上下文的静态信息相关,如事实属性)和 pointer-like(与上下文相关的操作相关,如复制或按提示局部规则完成)。作者认为一个特征可以做出连贯的因果贡献,却不对应单一共享 logit 方向。
- 提出的方法:作者提出无监督框架 Feature-Effect Geometry Analysis(FEGA)。它对同一活跃 SAE 特征在多个上下文中做相同消融,分析由此得到的 logit 变化云,而不是把特征当成单一转向向量。分析对象是 Gemma-2-2B 第 12 层后残差流上的 SAE。
有哪些相关研究?
作者把相关工作分成特征几何、SAE 转向和多义性,并称本文转向效应空间几何。
作者把讨论限制在 SAE 特征的几何、转向和语义多重性,并指向 Shu et al. (2025) 与 Sharkey et al. (2025) 作为 SAE 综述。
特征几何
- Hindupur et al. (2025):研究 SAE 架构的结构假设,以及概念如何编码在模型表示中。
- Li et al. (2025) 与 Levinson (2026):前者表明 SAE 在不同尺度上以不同方式组织概念;后者用 SAE 揭示信念状态几何。Bhalla et al. (2026) 表明 SAE 可以全局(一组原子的张成包含流形)或局部(特征铺满受限区域)捕捉流形。
- 与本文的区别:作者称这些工作关注的是模型表示中的几何,而本文关注 SAE 特征在下游 logit 空间中的效应。
SAE 特征转向
- Li et al. (2026) 与 Korznikov et al. (2026):前者观察到很小的对抗输入扰动就能操纵 SAE 中的概念表示;后者研究编码器和解码器冻结(随机初始化)的 SAE,并称其因果编辑和稀疏探测表现可与完全训练的 SAE 相当,从而质疑 SAE 是否学到有意义的特征。
- Wu et al. (2025) 与 Arad et al. (2025):Wu 等人强调 SAE 特征用于转向模型行为并不可靠,且常被更简单的基线超过。Arad 等人表明可转向性取决于特征类型,并区分主要捕捉输入模式的 input features,以及对输出有人类可理解影响的 output features。
- 作者的批评:作者称这些工作揭示了多种成功或失败模式,但没有刻画造成这些特点的特征几何性质。引言还提到 Tan et al. (2024)、Braun et al. (2025)、Durmus et al. (2024) 和 Arad et al. (2025) 关于转向不稳定、干预效应与激活上下文不符、以及仅凭激活会漏掉目标输出效应的结果。
多义性
- Bricken et al. (2023):作者称 SAE 在机制可解释性中的原目标,是从模型的多义表示中抽出单义特征。
- Minegishi et al. (2025)、Cui et al. (2026)、Mencattini et al. (2026):Minegishi 等人用多义词评估 SAE 抽取单义特征的能力,并强调常见架构的局限。Cui 等人的理论分析称,除非特征极度稀疏,SAE 不能完全恢复真实单义特征。Mencattini 等人从率失真角度说明,迫使 SAE 学习单义特征会提高重建误差、降低稀疏性。
- 作者的定位:作者称语义多重性回答的是特征在概念层表示什么,并不回答加强或减弱该特征后会发生什么。
基线方法与基准
- 基线方法:特征发现和消融对照使用 SAEBench 中的 differential binary masking,以及按激活频率和平均激活强度匹配的同等规模随机特征集。几何分析没有把其他转向方法当作对照。
- 基准/数据集:Literal Sequence Copying、Word Content、Token Translation(Niu et al., 2025),PrOntoQA(Saparov & He, 2023),以及 SAEBench 中实现的 RAVEL City-Country(Huang et al., 2024; Karvonen et al., 2025)。SAE 为 SAEBench 的 Gemma-2-2B 套件。
作者称,就其所知,本文是在效应空间刻画 SAE 特征几何性质的工作,并把特征几何、转向和语义多重性连在一起。
论文如何解决这个问题?
FEGA 在重建基线上消融特征,用一组诊断给 logit 效应云贴几何标签。
作者用任务谱分离 value-like、pointer-like 和混合特征,再以 FEGA 把每个特征的消融效应当成 logit 空间中的云,而不是单一转向对象。
问题设定与效应定义
- 干预对象:上下文 c 决定提示和任务位置。设层 ℓ 的 SAE 输入激活为 h_ℓ^(c),编码 z^(c)=E(h_ℓ^(c)),重建 h̄_ℓ^(c)=D(z^(c))。消融特征 j 得到 ĥ_ℓ,j↓^(c)=D(z^(c)−z_j^(c) e_j)。两条路径都经冻结的模型尾部,再读出 logit。
- 为什么用重建作基线:作者用重建 h̄_ℓ^(c) 而不是原激活 h_ℓ^(c) 作基线,使两条路径只差特征 j 是否保留,避免把 SAE 重建误差混进特征移除。
- 效应云:logit 移除效应为 Δ_j^(c)=ϕ_ℓ(ĥ_ℓ,j↓^(c))−ϕ_ℓ(h̄_ℓ^(c))。正坐标表示移除特征 j 后该 token 的 logit 上升;−Δ_j^(c) 描述移除前该特征的贡献。云 E_j 只保留差分为有限且非零的有效上下文。局部解码方向固定为 −z_j^(c) W_{D,:,j},但后续注意力、MLP、残差和最终归一化仍可使 logit 效应依赖上下文。
特征如何被选出
- value-like:在 RAVEL 的 City-Country 上,SAEBench 用 differential binary masking 找支持属性交换干预的最小特征子集。从 5,000 条 base records 出发,选出 ReLU 12,900、TopK 2,828、Matryoshka Batch TopK 3,654 个特征;要求至少八个活跃上下文后,分别余 7,715、1,167、1,750 个进入几何分析。
- pointer-like 与混合:在 LSC、WC、PrOntoQA、TT 上,只保留未修改的 Gemma-2-2B 首 token 预测正确、且目标为单 token 的例子。每个 ICL 任务构造 50,000 个例子,覆盖 1,000 个 prompt family,每个 family 保留 50 个 query。在预测前的最后一个 token 上,激活为正即视为活跃。保留条件是:在全部例子上活跃比例至少 90%,且在至少 90% 的 prompt family 中、每个 family 至少 90% 的 query 上活跃。
- 因果检查:在最后一个提示位置联合消融选出的特征集。先编码原残差,将选中坐标置零,解码后再加回原来的重建误差。随机对照消融同等数量、激活频率和平均强度相近的其他特征,做 20 次。
几何诊断
每个效应拆成幅度 m 和单位方向 v。方向一致性由上下文核 K 的内积描述:正值表示方向相近,负值表示相反,接近零表示几乎不一致。诊断按假设递进。
- 有向射线:Cray 是核的非对角平均相似度。高 Cray 表示多数移除效应指向同一 logit 方向;低分可能来自对跖、多模态、低维或弥散结构,因此只检验“是否反复指向同一方向”。
- 轴或对跖:用核的首特征向量恢复一条轴,再用两侧占用比例 B_axis 判断两端是否都有样本。轴证据同时要求强一维结构、弱有向射线证据,以及两侧都有不可忽略的占用。
- 方向混合:用 von Mises-Fisher 混合拟合单位方向,模式数由 BIC 选择。接受的混合须多于一个模式,每个模式拟合质量 π_r≥0.10,且每个模式至少由两个硬分配上下文估计浓度。Δmix 比较各模式内的 Cray 与整体 Cray。作者称这支持多个方向体制,但不由此确立行为上的多义性。
- 全局跨度与中心化残差:S_span^(k) 是前 k 个成分解释的方向能量比例,并配合成分使用份额 U_span 和谱下降比 D_span。全局跨度检验 k∈{2,3,4,8},取最小被支持的维度。中心化残差先减去平均方向,用 E_res 表示剩余能量比例,再对 k∈{2,3,4} 做严格检验;一维残差只作为描述性回退。长尾由 L_tail 标记。
标签、门槛与计算
- 主标签:Figure 3 展示六类主卡片:Directed Ray、Axis or Antipodal、Directional Mixture、Global Span、Centered Residual、Unresolved Diffuse,另有长尾、幅度异质性和 One Dimensional Diffuse 回退。部分跨度、残差回退和三种非几何终止结果在 Section 5.5 与 Appendix H 定义。
- 证据与置信:上下文数低于 32 时,完整证据且无边界穿越记为 exploratory confidence;出现边界穿越、主角失败或所选维度不一致则记为 unstable。有效上下文过少时报告证据不足,不指定几何族。幅度异质用变异系数等二次标记,例如 Figure 3 中 TopK 特征 37457 的 CV_m=1.31。
- 计算:logit 内积通过反嵌入 Gram 矩阵 G=W_U^⊤ W_U,在最终归一化之后、输出 soft cap 之前的 pre-logit 向量上计算。几何仍是对应 logit 效应的欧氏几何。模型为 Gemma-2-2B,SAE 作用在 post-layer-12 残差流,宽度 2^16,约 65k,变体为 ReLU、TopK、Matryoshka Batch TopK。
论文做了哪些实验?
三种 SAE 上,小集合跨任务复现且因果有效,但稳定一维 logit 方向很少。
实验设置
- 模型与 SAE:全部实验使用 Gemma-2-2B。三种 SAE 都来自 SAEBench,作用在 post-layer-12 残差流,宽度均为 65k:ReLU、TopK、Matryoshka Batch TopK。
- 任务与规模:四个 ICL 任务各 50,000 个例子、1,000 个 prompt family、每族 50 个 query,且只保留单 token 目标、未修改模型首 token 预测正确的例子。LSC、WC、PrOntoQA 为 pointer-like,TT 为混合,RAVEL City-Country 为 value-like。RAVEL 从 5,000 条 base records 出发做特征选择。
- 特征集:Table 1 给出选出的特征数。LSC 为 ReLU 5、TopK 5、Matryoshka 4;WC 为 25、9、14;PrOntoQA 为 78、22、20;TT 为 27、14、16;RAVEL City-Country 为 12,900、2,828、3,654。几何分析进一步要求 RAVEL 特征至少有八个活跃上下文。
- 消融指标:Table 2 在未消融模型已经答对的例子上报告联合消融后的准确率。ptarget 来自单侧精确配对 McNemar 检验,prandom 来自随机试验上的单侧单样本 t 检验。随机对照为 20 次,报告均值±标准差。
- 几何指标:FEGA 的主读数包括 Cray、S_span、U_span、D_span、E_res、B_axis、Δmix,以及主几何标签。Figure 3 的数字是单个代表特征的诊断,不是群体比例。
- 评审方式:任务正确性由目标 token 是否为模型首个预测判定。论文未报告用另一个模型做几何标签评审,也未报告几何分类的人工一致性。
主结果
表格较宽,可左右滑动
任务 SAE k 定向消融准确率 随机对照准确率 出处 LSC ReLU 5 95.7% 98.3±0.4% Table 2 WC ReLU 25 76.5% 93.4±4.0% Table 2 PrOntoQA ReLU 78 71.3% 94.4±1.4% Table 2 TT ReLU 27 89.9% 98.7±0.5% Table 2 LSC TopK 5 65.1% 95.7±1.1% Table 2 WC TopK 9 18.4% 93.6±4.0% Table 2 PrOntoQA TopK 22 47.1% 95.7±1.8% Table 2 TT TopK 14 72.9% 98.2±0.6% Table 2 表中只列了 ReLU 与 TopK 八行;Matryoshka Batch TopK 的四行是 LSC 64.3%(对照 95.8±2.1%)、WC 19.9%(94.7±1.0%)、PrOntoQA 17.9%(92.1±4.6%)、TT 66.0%(97.5±2.4%),k 分别为 4、14、20、16,同样据 Table 2。12 组的 ptarget 都小于 10^−300。
- 作者的解读:作者称 12 个任务–架构组合中,定向消融都降低准确率,降幅从 ReLU 在 LSC 上的 4.3 个百分点到 Matryoshka Batch TopK 在 PrOntoQA 上的 82.1 个百分点。每组定向降幅都大于匹配随机对照的平均降幅。作者举例:消融 9 个 TopK WC 特征使准确率从 100% 降到 18.4%,随机对照平均仍为 93.6%±4.0。
- 作者同时限定:这些结果说明选出的特征集有超出同等活跃集合的特定因果贡献,并不意味着每个被选 latent 都单独必要。
- 跨任务重叠:Figure 2 的 IoU 中,TopK 最大为 LSC 与 WC 的 0.40;Matryoshka Batch TopK 中 WC 与 TT 为 0.36、WC 与 PrOntoQA 为 0.31;ReLU 最大为 WC 与 PrOntoQA 的 0.13。三种架构下,ICL 选出的特征与对应 RAVEL 集合的 IoU 均为 0.00。作者称重叠指向一小群跨任务共享特征,且该结论只适用于被选候选集。
几何标签的代表例子
- 测了什么:Figure 3 给每类几何一张代表卡片,左图是归一化效应方向,右图只作二维可视化。卡片上印刷的是该特征的诊断,不是群体频率。
- 结果:Directed Ray 例子为 ReLU 特征 57176,Cray=0.87,S_span=0.87,E_res=0.13,n=64。Axis 例子为 TopK 特征 62802,Cray=−0.03,S_span=0.81,B_axis=0.42,n=12。Directional Mixture 例子为 ReLU 特征 21437,Δmix=0.45,π_min=0.17,Cray=0.73,n=18。Global span 例子为 Matryoshka 特征 16392,S_span=0.90,U_span=0.36,D_span=0.14,n=13。Centered residual 例子为 TopK 特征 47789,E_res=0.59,S_res=0.83,n=30。Unresolved diffuse 例子为 TopK 特征 58529,Cray=0.03,S_span=0.02,n=64。One Dimensional Diffuse 回退例子为 Matryoshka 特征 623,Cray=0.79,S_span=0.81,B_axis=0,n=18。
- 作者的解读:作者用这些卡片说明严格几何族和未解析结果,并称右图仅用于可视化。幅度异质的例子是 TopK 特征 37457,CV_m=1.31,m_10%=116.70,m_90%=1837.27。
作者对群体几何的概括
- 一维方向少:作者在 Section 6 的预告中称,跨架构和特征群体,多数下游效应云不能归约成上下文不变的 logit 向量,并据此认为简单线性转向是例外。正文给出的可回查群体数字主要在特征计数、IoU 和消融准确率;几何标签的群体比例在所给文本的代表卡片之外没有逐格列出。
- 两类角色:作者称 pointer-like 特征尽管跨成功的任务执行而复现,却很少充当可复用的 logit 方向,效应在输出空间中散开;value-like 的事实属性效应更常呈现低维组织,但这种结构通常跨越多个输出方向,而不是塌缩成单一转向向量。
- 发现规模的限制:作者在 Takeaway 1 中称,没有一种架构在功能特征发现上一致占优。LSC 上三种架构的候选集都很小,ReLU 在 WC、PrOntoQA 和 TT 上选出的候选更多。作者同时称原始计数因激活模式和稀疏性不同,不能直接比较架构优劣。
其他消融与分析
- 随机对照的最小差异:Table 2 中定向准确率最高的是 ReLU–LSC 的 95.7%,对照为 98.3±0.4%,对应作者所说的 4.3 个百分点降幅;最低定向准确率是 Matryoshka–PrOntoQA 的 17.9%,对照 92.1±4.6%。
- prandom:Table 2 的 12 个 prandom 从 ReLU–WC 的 3.0×10^−7 到 Matryoshka–WC 的 6.8×10^−16,TT 的 Matryoshka 为 9.2×10^−5,是表中最大的 prandom。
- RAVEL 过滤:Section 4.1 中,至少八个活跃上下文的过滤使 ReLU 从 12,900 降到 7,715,TopK 从 2,828 降到 1,167,Matryoshka Batch TopK 从 3,654 降到 1,750。
- Figure 3 的小样本:轴例子 n=12,全局跨度例子 n=13,都低于作者所说的 32 这个 exploratory 与 accepted 的分界;射线和未解析弥散例子 n=64。
- Appendix I:Table 11 是说明性谱,不是额外实验。作者用它说明高的小 k 充分性仍可能因长尾而不能得到干净的二维标签,以及有效上下文只剩五个时应报告证据不足。
有什么可以进一步探索的点?
作者把 FEGA 定位为效应侧审计,并计划发布代码;实验停在一种模型和层。
作者指出的局限与后续方向
- 代码尚未作为已完成发布来写:脚注给出项目仓库,按作者的计划表述,代码发布应视为作者计划公开实现,而不是本文已经报告的外部复现结果。若正文未另列 Limitations 专节,这一点只保留计划,不另造局限。(脚注与文末计划表述)
- 选择程序的外推边界:作者在 Section 4.4 明确写,ICL 特征与 RAVEL 特征不相交这一结果只适用于被选候选集,并不意味着整个 SAE 字典能干净地分成 pointer-like 和 value-like 区域。
- 单个特征并非都被证明必要:作者在 Section 4.5 写,联合消融不能推出每个被选 latent 都单独必要。
- 方向混合不等于行为多义:作者在 Section 5.3 写,被接受的混合支持多个方向体制,但模式也可能来自任务体制、提示模板或 token 位置,并不由此确立行为上的多义性。
- 效应云不是全部分布:作者在 Section 5.1 写,E_j 不是所有可能上下文的分布,而是在所选数据、特征规则、目标位置、重建基线和移除取向下的采样有效效应。
- 低维标签有证据门槛:作者在 Section 5.5 和 Appendix I 写,上下文少于可用证据、大量效应被滤成零,或谱是长尾时,不应把结果说成该特征整体一致的低维几何。一维残差只作描述性回退。
实验覆盖范围
- 模型与位置:实验模型为 Gemma-2-2B,SAE 位于 post-layer-12 残差流;三种变体都是宽度 65k 的 ReLU、TopK、Matryoshka Batch TopK(Section 3.1)。
- 任务:覆盖 LSC、WC、PrOntoQA、TT 和 RAVEL 的 city 类、Country 目标属性;非目标控制属性包括 Language 和 Continent(Section 3.2)。
- 对照与检验:ICL 因果结果包含 12 个任务–架构组合,随机对照每组 20 次,并报告 McNemar 与 t 检验(Table 2)。几何诊断的代表数值来自 Figure 3 的单个特征。
- 过滤规则:ICL 特征使用 90% 例子和 90% family 的活跃阈值;RAVEL 几何分析使用至少八个活跃上下文(Section 4.1、4.2)。
- 论文未报告:所给正文没有报告几何标签在全部被选特征上的百分比分布表,也没有报告跨层、跨基座模型的重复。Appendix B 称给出了 Gram 计算的验证检查和失败情形,Appendix I 的表是说明性例子。
总结一下论文的主要内容
FEGA 说明可解释且有因果作用的 SAE 特征,仍常常缺少稳定的单一转向方向。
Feature-Effect Geometry Analysis(FEGA) 把 SAE 特征的下游干预效应当成 logit 空间中的云来分类,用来区分可复用方向、低维结构和弥散效应。
- 问题:激活描述、自动解释和转向基准不能回答同一特征跨上下文的效应是否几何上稳定。作者区分与静态事实信息相关的 value-like 特征,以及与提示局部操作相关的 pointer-like 特征。
- 做法:在 Gemma-2-2B 第 12 层后残差流的三种 65k SAE 上,用 RAVEL City-Country 和四项 ICL 任务选特征。干预相对 SAE 重建消融单个活跃特征,再经冻结尾部比较 logit。FEGA 依次检验有向射线、对跖轴、方向混合、全局低维跨度和中心化残差。
- 因果与重叠:Table 1 中 ICL 候选集为每组 4–78 个特征,RAVEL 则有数千到 12,900 个。Figure 2 中跨 ICL 任务的最大 IoU 为 TopK 上 LSC–WC 的 0.40,三种架构的 ICL 集合与 RAVEL 的 IoU 都是 0。Table 2 的 12 组联合消融都降低准确率,例如 TopK 的 9 个 WC 特征使准确率从 100% 降到 18.4%,匹配随机对照平均为 93.6%±4.0;作者给出的降幅范围是 4.3 到 82.1 个百分点。
- 几何结论:作者称多数效应云不能收成一个上下文不变的 logit 向量。pointer-like 特征的效应以弥散为主;value-like 特征更常有低维组织,但通常跨多个输出方向。Figure 3 用单个特征举例,其中射线例子 Cray=0.87,未解析弥散例子 Cray=0.03、S_span=0.02。
- 作者的结论:一个特征可以可解释且因果上重要,同时缺少稳定的 logit 方向。作者认为特征级解释应分开三件事:特征检测什么、它是否因果上重要、它的效应如何随上下文变化。FEGA 被作者定位为缺失的效应侧审计。