通过稀疏自编码器特征追踪查询扩展效果
研究用稀疏自编码器(SAE)特征追踪查询扩展(QE)对稠密检索器的内部影响,将原始与扩展查询的逐层表示分解为稀疏隐激活,从扩展引发的激活偏移中识别出 QE 相关隐变量。分析显示有效 QE 引发与检索意图和实体属性对齐的层级集中变化,而非仅扰动最终查询嵌入。基于 SAE 的激活引导在四个基准上比随机干预或原始 QE 更稳定地提升检索效果,无需查询改写或检索器微调。
机制可解释性、SAE、探针与 steering:看清模型内部并用于检测和干预。
在这个话题内搜索或按分类筛选研究用稀疏自编码器(SAE)特征追踪查询扩展(QE)对稠密检索器的内部影响,将原始与扩展查询的逐层表示分解为稀疏隐激活,从扩展引发的激活偏移中识别出 QE 相关隐变量。分析显示有效 QE 引发与检索意图和实体属性对齐的层级集中变化,而非仅扰动最终查询嵌入。基于 SAE 的激活引导在四个基准上比随机干预或原始 QE 更稳定地提升检索效果,无需查询改写或检索器微调。
论文提出 Steering Vector Dissection 框架,用于把激活引导中纠缠多个语义与风格概念的复合方向拆解为各自独立的语义一致特征。方法上,作者配对正负激活并取差值生成实例级引导向量,再直接在这些向量上训练专用的 Sparse Autoencoder(SAE)。在 2 个数据集、2 个模型和 2 种干预深度上的定量评估显示,该方法得到的基向量语义一致,且引导效果彼此可区分,从而支持对模型行为更精确的控制。论文共 31 页、5 张图。
PhysSAE 是一个针对物理信息神经网络(PINN)的机制可解释性框架,在 PINN 倒数第二层激活上训练过完备稀疏自编码器(SAE),并通过在原始冻结隐状态中直接做因果干预(h_cf = h - α z_k d_k)评估字典原子,绕过 SAE 解码器。在六类 PDE、各 3 个 PINN 种子和 3 个 SAE 种子上,发现的 SAE 原子与独立定义的物理可观测量对齐(最大 Pearson |r|=0.951),高对齐原子消融的因果足迹比 PCA 或 ICA 干预在空间上集中 1.2–4.2 倍,并在结构化物理概念上优于匹配随机对照(ESF80 优势 0.04–0.44)。
研究从机制可解释性角度逆向出 Mamba 执行联想召回(AR)的内部算法,发现其通过隐式学习线性哈希函数完成召回,并定位了实现该行为的底层电路。受 Johnson-Lindenstrauss 引理等保相似哈希理论启发,作者提出"召回缩放定律"框架,可依据词表规模和上下文中事实数量,预测 Mamba 实现完美召回所需的嵌入与状态维度、给定模型维度下的召回成功概率,并分析多层模型与多头 SSM 模式。实验表明该理论预测准确,揭示了 AR 能力随词表、状态、嵌入规模和架构的缩放规律。
研究在无害的语言切换设定中考察触发式后门的内部机制,固定触发序列会让 1B 和 8B 语言模型把英文提示续写成法语或德语。作者跨层和 Transformer 组件训练稀疏自编码器(SAE),并将触发提示与翻译、预训练对照组比较,以识别与触发相关的特征方向。结果显示 SAE 特征能以接近完美的 F1 区分触发提示与对照组,但能检测触发的特征未必能控制行为:注意力与 MLP 特征常可靠激活却难以通过消融抑制语言切换,而残差流特征被消融时可抑制触发式生成,部分选定特征还能在无触发时诱导目标语言续写。
论文提出 Transformer Layer Correction Mechanism(TLCM),指出相邻 Transformer 层会系统性地抵消彼此的部分贡献,挑战了残差流特征持续累积并被后续层继承的常见解释。TLCM 出现在 7 个主要开源模型家族中的 5 个,并在多样文本的几乎所有 token 上激活;它在预训练阶段出现,对依赖上下文的 token 作用最强,并根据前一层输出自适应校准纠正强度。借助层 Jacobian,作者发现 TLCM 会选择性地纠正特定子空间而强化另一些子空间,并将其解释为“提出与拒绝”框架,即层提出候选特征、后续层选择性移除不合适的部分。
针对 SAE 引导中"大规模引导"因相关性不准和忽略特征交互而引入冗余特征的问题,研究者提出关键路径识别(KPI)方法,通过识别与上下游特征具有强因果依赖的关键引导特征并构建关键路径,以更少的特征修改完成引导。在存在知识冲突的 RAG 任务中,KPI 相比最佳大规模引导基线平均提升 18% 准确率,有效过滤冗余特征并缓解副作用。
研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。三个模型的探针性能峰值均明显早于归因,相差 36-53% 的模型深度。评估的残差流特征中仅 6-18% 具有语言无关效应,且无一具备类别无关效应,说明可解码性、输出影响与跨语言消融效应需分别测量。
癌症分割模型会静默失败,生成看似合理却错误的掩膜。研究用稀疏自编码器(Sparse Autoencoders)将模型内部激活分解为可解释概念,发现失败案例的潜在特征为活跃概念更少、激活幅度更低,据此训练分类器实现失败检测并给出错误解释。在前列腺癌、胰腺癌和脑癌分割实验中,该方法在保持分割质量的同时,失败检测表现优于基于输出的方法。
研究者提出 Training-Free Task Vectors(TFTVs),无需微调即可计算类任务向量方向,仅用前向传播统计将激活引导向量映射为秩一权重空间编辑,并支持加法学习、减法遗忘与多编辑组合。在 LLM 行为控制任务上,TFTVs 能持续放大、抑制和组合目标行为,同时保留通用知识与解题能力,相比其他编辑与引导基线实现了更强的特质控制,效用保持相当或更优。代码已在项目网站公开。
论文提出 SAEScientist-Bench,用于评估 AI 智能体能否像研究者一样使用 SAE 工具自主完成机制可解释性发现。给定目标概念后,智能体需设计对比探针,并在 Gemma-2-9B-IT 的 Gemma Scope 字典中检索 131K+ 个特征,找出最优特征。评测以 Neuronpedia 上经专家整理的参考特征为基准,从激活排名、对比文本上的概念选择性以及因果引导三个维度打分。在 10 种智能体配置和 20 项任务中,前沿智能体展现出真实的发现能力,并在不同评测维度上各有领先,但整体仍明显落后于专家基线:在区分目标概念与对比控制项上接近专家水平,在因果生成引导上差距较大。
研究者将线性可达性建模为压缩感知问题,在次高斯噪声下为固定支撑导出高概率界,证明所需维度随 $d=O_{\varepsilon}(k \log m)$ 线性增长,而非此前最坏情况下的二次上限。工作刻画了活跃与非活跃特征干扰的不对称性,以及干扰预算与观测噪声预算之间的权衡,并通过高斯尾部近似在系统参数上验证了这些界。作者还提出 IHT-SAE,用学习式迭代精修提升特征恢复能力,突破线性可达性限制,为评估稀疏自编码器、组合泛化与神经网络可解释性提供框架。
MonoTM 是一个可解释主题建模框架,将文档-主题混合估计与语义解释解耦:混合估计使用完整的 SAE 特征词袋表示,主题描述符则在固定的混合结果上、从另一套基于语料的语义特征词表中学习。在三个基准语料上,研究发现混合估计与语义解释偏好不同的 SAE 配置和特征子集。该设计在保留全局主题结构的同时,用比单个词更有意义的语义单元表示主题,便于下游语料分析。论文已被 AACL-IJCNLP 2026 接收。
文本到图像扩散模型存在一种"对象依赖概念脆弱性":仅对象不同的少量提示词在相同生成设置下持续无法实现同一目标概念,表现为系统性内部盲点而非随机噪声。研究者提出可解释性框架,在逐步稀疏自编码器(SAE)空间中分析去噪轨迹,比较成功与失败生成,定位证据缺失、减弱或延迟的概念维度,并构建类别级概念原型。基于该审计流程,引入轻量推理时校正策略,将去噪特征向 SAE 空间中的对应原型插值,在多个扩散骨干模型的风格与属性失败案例上显著提升概念一致性、文本保真度与修复成功率。
研究者将 DiscoGP 电路发现框架从文本解码器扩展到语音编码器,在 HuBERT 和 Wav2Vec 2.0 上开展首个现代语音基础模型电路发现研究。发现的电路极为紧凑,却常能匹配甚至超过完整预训练编码器加下游头的性能,消融实验表明其反映的是预训练计算而非随机结构或任务头伪影。团队还提出内存高效变体,将边电路发现的 GPU 显存开销从四次方降至三次方。
作者按 MAIS-O43 开放问题指定的协议实现实验,在 165 个网格单元中的 10 个上评估了 200 次独立初始化的拟合,观察到零次完整字典恢复和零次特征合并。每次运行都收敛到一个可复现的弥散相:重建几乎完美,但学习到的原子通常远离真实特征,最佳余弦中位数为 0.5-0.7,低于 0.95 的恢复判据,且学习到的编码比真实值稠密一个数量级。该行为在稳健性检验中持续存在,并在使用标准 minibatch Adam 的完整 165 单元网格上通过额外 3300 次拟合得到验证。
GeoSteer 是一种基于优化的保范激活引导方法,把激活引导建模为黎曼优化问题,通过在表示流形上连续小步测地线更新激活来控制 LLM,并用学习到的非线性激活空间目标自适应引导每一步,避免固定引导方向。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准上,GeoSteer 一致优于当前最先进的激活引导基线。结果表明,用自适应、几何感知的优化替代预定义的单步编辑,可让保范引导更有效。
研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误的形式化翻译仍能通过求解器并得到预期判定,并证明仅依据判定的结构性验证启发式检测能力在数学上被限制在随机水平。为此提出 Generative Verification(GenV),将离线 Z3 等价性 oracle 蒸馏为无参考的连续参考等价性评分,机制分析显示其可原生提取精确的空间错误坐标。oracle 挖掘的验证器 GenV+HN 在参考等价性验证上达到 0.961 AUROC,零样本泛化到未见翻译器与不同形式风格,并在智能体测试时算力分配上带来 11.3 个百分点的下游准确率提升。
研究以 MLP 更新为切入点,构建残差状态特征与更新特征共同预测目标残差特征的三元组转移图谱,并通过消融解码后的更新特征来验证候选三元组。在 Pythia-160M 的 L7 到 L8、20M token 实验中,共发现 38,125 个强消融效应转移,但其中 88.0% 的状态-目标与更新-目标解码器余弦相似度都低于 0.7。作为跨模型初步检验,Gemma-3-4B 的 L21 到 L22、20M token 实验只对排名前 30,000 的候选三元组做因果验证,强效应三元组中有 53.6% 的两项余弦相似度均低于 0.7。
研究构建两个医学术语评测基准,对比通用版 Llama-3.1 与医学数据微调变体,发现通用模型在两项任务上均优于医学微调模型。机制可解释性分析显示,微调模型未重组参数知识,而是过度依赖少数与术语偏好预测相关的组件,造成系统性校准偏差;对这些组件重新加权可抑制其影响并追平通用基线。部分术语敏感组件还能迁移至材料科学术语任务,提示其编码了部分领域无关的专业术语概念。