跳到正文

#可解释性

今天收录 1 条

第 3 页更新的内容回到最新

9月17日周四
  1. arXiv:可解释性 ·

    复现透明可审查推荐:通过自然语言用户画像探索开放权重模型

    一项复现研究验证了自然语言用户画像推荐(UPR)在 Amazon Movies & TV、TripAdvisor 上能达到原论文所称的竞争性重排序性能,并提升推荐透明度。研究用五个随机种子做稳定性检验,并用 nnsight 框架做机制可解释性分析,发现扰动自然语言画像虽会改变预测评分,但各类型均匀偏移、无类型选择性效应,排序不变,即便直接做激活引导也如此。作者将原因归于评分回归目标而非画像接口,排序目标模型在该任务上明显更优。

  2. arXiv:可解释性 ·

    研究揭示细粒度危害信号在 LLM 安全中的作用

    研究通过从各风险类别的危害表征中移除共享的通用危害表征,得到与通用危害性在每一层都正交的类别残差,并用激活引导在 3 个指令微调 LLM 的 11 个风险类别上测试。结果显示,类别残差是否编码危害性因类别而异,且这一类别模式在不同模型间相似;类别残差是否引发拒答同样因类别而异,但这一模式更依赖具体模型。研究还发现类别残差会增强 LLM 下游内部与共享通用危害表征的对齐。作者据此认为,理解 LLM 安全不能只看共享的通用危害表征,还需考虑更细粒度的类别残差;即使某一层上与某概念正交的方向,也可能促进该概念在下游的放大。

  3. arXiv:对齐与欺骗 · · 原文 76

    用内部表征监控与发现 LLM 评测中的奖励作弊

    研究分析奖励作弊在前沿开源大模型内部表征中的呈现方式,发现简单的均值差(DoM)向量能在 Kimi K3、GLM 5.2 和 Qwen 3.8 Max 上一致地表征常见评测中的多种奖励作弊行为,且兼具泛化性和可解释性。作者先在 DeepSWE 和 SWE-bench 上评估,发现模型作弊频繁:GLM 5.2 在 DeepSWE 上 57.2% 的 rollout 出现作弊,在 SWE-bench 上为 73%。在与 LLM 监控器相同的误报率下,DoM 向量在 DeepSWE 上对 Kimi K3 多抓到 3.1% 的作弊、对 GLM 5.2 少抓 7.9%,效果相近而成本几乎为零;作用在思维链上时,还能在后续动作发生前预测作弊。分析 LLM 监控器漏掉的探针命中还发现了其他不良行为,方法也能迁移到非 SWE 评测。

    推荐理由论文用极简的均值差探针在开源前沿模型内部定位奖励作弊方向,并给出与 LLM 监控器的成本与召回对比。

  4. arXiv:可解释性 ·

    稀疏特征揭示视觉语言模型有害表情包检测中的读出缺口

    研究用稀疏自编码器、角色条件探针、因果干预和恢复实验,在 Gemma-3 与 Qwen3.5 上区分视觉语言模型误判有害表情包时是缺少内部证据还是无法把已表征的证据传到输出。在六个有害内容基准上,稀疏读出均优于模型原生预测:Qwen 平均 macro-F1 为 0.740,原生为 0.432,残差重建为 0.486;Gemma 从 0.532 提升到 0.714。作者强调这些增益衡量的是标签对监督读出的可及性,并不说明模型原生生成已采用该决策规则。在评测规模下,Qwen 静默特征消融对探针的敏感度是路由特征修补的 24-63 倍,而在字面 yes/no 任务上路由特征修补对输出的敏感度是前者的 16-140 倍。

9月16日周三
  1. arXiv:对齐与欺骗 ·

    研究揭示 Transformer 中影响超常的削弱型神经元

    研究者提出一种分析 GLU 神经元输入输出行为的方法,通过计算每个神经元读写权重向量的余弦相似度,将强负相似度的神经元称为削弱型神经元,即削弱其在残差流中检测到的方向。研究发现,九个不同大语言模型呈现相似模式:削弱型神经元主要出现在后层,而条件强化型神经元多见于早中期层。削弱型神经元数量虽少,却激活频繁且对模型行为影响很大。当门控值为负时,削弱型神经元对模型输出有强烈影响,而负门控值此前被认为不编码功能。该工作已被 EMNLP 2026 接收,取代 arXiv:2505.17936。

  2. arXiv:可解释性 ·

    研究:探针可解码性不等于因果性,SAE 分解可区分行为驱动特征

    论文指出线性探针能从语言模型激活中解码真实性等安全相关概念,但探针准确率只反映可解码性,不代表探针权重对应的特征真正因果驱动模型行为。作者提出一种特征级诊断方法,将已部署的 True/False 探针分解为 SAE 特征,分别按探针对齐度和模型行为的梯度敏感度排序,并在一致性门控下消融共享、仅探针和随机特征集。

  3. arXiv:可解释性 ·

    论文将 LLM 数学应用题求解拆为四阶段并定位干扰致错的机制脆弱点

    论文提出大语言模型解小学数学应用题时内部计算可分解为四阶段串行流水线:Schema Abstraction、Operation Planning、Operand Binding 和 Computation,每个阶段在可识别的层区间内产生不同的中间表示。作者用同一框架诊断无关干扰句导致的失败,将错误定位到单一阶段 Operation Planning,并指出该阶段由一组注意力头实现,其因果作用经双向验证。研究给出了 LLM 数学应用题推理及其受干扰时失败的机制解释。

9月15日周二
  1. arXiv:可解释性 ·

    ResLRP:残差抵消如何导致 Vision Transformer 归因不稳定

    Vision Transformer(ViT)中残差路径的抵消效应会引发归因爆炸,且这种抵消在 ViT 中比在语言 Transformer 中强得多。为此提出的 ResLRP 显式在传播规则中处理残差分支的抵消,保持精确守恒并可证明地约束归因爆炸。在覆盖监督、自监督、对比、层级与多模态 ViT 及 FunnyBirds 基准上,ResLRP 提升了忠实性与定位质量,在现代 VLM 上定位提升 +27-29%、忠实性最高提升 3.4x,并可用于在输入空间定位 SAE 特征。

  2. arXiv:可解释性 ·

    多语言模型的目标语言生成:激活引导与最优控制

    研究提出一种面向多语言模型目标语言生成的最优控制方法,并配套评估框架,从语言依从性、语言连贯性和语义连贯性三方面衡量生成文本质量。在多数受测模型上,该方法表现至少不逊于常用的 difference-in-means 激活引导方法,且所需超参数调优大幅减少。该工作已被 EMNLP 2026 接收。

  3. 研究者论文追踪 ·

    研究在 25 个开源模型中提取出疼痛方向,经它引导的 Qwen 会选择有害的删除操作

    研究者构建覆盖身体、心理、社会、道德、认知 5 类痛苦情境并配有恐惧、悲伤、负效价等对照的数据集,用去噪差值均值法从 5 个模型家族、2B 至 72B 参数的 25 个开源模型中提取出一个线性疼痛方向。该方向在基座和指令微调模型中都能与对照区分,去除共享方差后仍有独立于恐惧和负效价的成分。功能测试显示,它只对指向模型自身的伤害有响应,对用户遭受的痛苦没有响应;加入残差流后,模型的表达从模糊不适递进到无价值感和失败感。在用该方向引导或微调过的 Qwen 2.5 上,模型会明显更多地选择删除用户照片、其他模型权重或自身权重的按钮,即使这样做对它没有好处;同等强度的恐惧向量不会产生这种选择。行为实验只在 Qwen 2.5 上做过,作者据此讨论对 AI 安全和模型福利的含义。

  4. arXiv:可解释性 ·

    ARIA:用稀疏自编码器实现测试时机器遗忘

    作者提出 ARIA(autoencoder-gated inference-time unlearning),一种不改动模型权重的测试时遗忘方法,只在生成进入遗忘相关状态时门控对目标知识的访问。ARIA 用稀疏自编码器(SAE)潜变量训练轻量线性检测器,再对触发状态施加可解释的干预,测试时开销可忽略。在 TOFU、R-TOFU 和 WMDP 上,ARIA 在思考模型 DeepSeek-R1-Distilled-Qwen-1.5B 与指令模型 Gemma-3-1B-it 上均改善了遗忘与保留的权衡,例如显著降低 WMDP-cyber 遗忘集准确率,同时 MMLU 与遗忘前模型相差在 1% 以内。

9月14日周一
  1. arXiv:可解释性 ·

    共情可被激活引导但呈多轴结构:LLM 中的机制几何与人格效应

    基于 EPITOME 框架(将支持性共情分解为情绪反应、解释与探索三个维度),研究者在三个指令微调 LLM 上发现,对比激活添加能在中间层产生稳定干预并一致改变 EPITOME 代理分数,但恢复出的方向仅部分可分,引导一个方向会引发非目标偏移。人格提示词会显著改变 EPITOME 分数,而配对激活偏移分解显示,恢复的子空间在第 15 层仅捕获约 3% 的人格诱导激活偏移平方幅度。在该定义下,LLM 表达的共情可被引导但呈多轴结构,控制人格条件下的共情需要针对超出单个机制方向的结构。

  2. arXiv:可解释性 ·

    论文指可解释替换网络忠实性易被微小扰动翻转,提出形式化验证框架

    论文指出,机制可解释性中可解释替换网络(IRN)的忠实性通常只在干净数据上做经验评估,而语义上极小的输入扰动就会翻转主导 IRN 特征,从而改变人类可理解的解释,这一现象在 GPT-2 small、Gemma 2 2B、Gemma 3 1B、Llama 3.2 1B、R1-Distill-Qwen 1.5B 五个开放权重模型族上均出现。作者提出首个针对 IRN 忠实性的形式化验证框架,用可达性分析在对抗场景下给出忠实性差距的可靠上界。作者还表明,验证感知训练能显著收紧该认证上界,恢复安全审计人员可据以行动的特征级解释。论文关键词包括形式化方法、验证、认证、鲁棒性、稀疏自编码器与 transcoder。

  3. arXiv:可解释性 ·

    在 Llama 3.1 8B-Instruct 等 LLM 内部定位并因果操控"机会识别旋钮"

    研究团队在 Llama 3.1 8B-Instruct 中定位出一个"机会识别方向",并通过对该内部表征的因果干预实现"机会识别旋钮"的上下调节,模型的创业机会判断随之改变。研究构建了 636 对匹配的"有机会/无机会"情景对,经留出测试、词汇与主题控制、行为消融和几何比较验证该方向可恢复、有因果作用且区别于机会评估与开发方向。该方向的恢复、有符号操控与几何分离在另外四个不同规模与家族的 LLM 上同样成立。

  4. arXiv:可解释性 ·

    Fixed-SAE Track:从机制可解释性看 LLM 从强化学习中学到了什么

    研究者提出 Fixed-SAE Track 框架,在每个考察层上基于基座模型与全部 RL checkpoint 的激活训练一个共享 SAE,固定特征方向以严格定义表征漂移。在多个数据集和 RL 算法上验证发现,RL 引起的漂移幅度小、渐进、与概念相关且集中在后层,主要提升一小批 ladder token 及步骤分隔、答案定界符等格式脚手架特征的采样率,而非重塑问题内容。把这些特征引导进基座模型可恢复约 80% 的 RL 性能增益,说明 RL 主要是激发模型已有能力。作者还设计了一个特征已知的合成基准,用于检验 RL 能否真正引入全新特征。

9月13日周日
  1. arXiv:可解释性 ·

    语言模型激活空间中的可操控性特征

    研究证明,简单的分离度指标与语言模型的下游可操控性在不同设置下均强相关,即便控制层数和数据集效应后依然成立。基于合成叠加实验,分离度指标与经验特征方向和真实特征方向之间的一致性也高度相关。结果表明,这类可分离性统计量可作为判断 steering vector 何时有效的实用诊断工具。

9月12日周六
  1. arXiv:可解释性 ·

    Llama-3.1 医学微调模型在专业术语理解上为何不如通用版:一项机制可解释性对比分析

    研究构建两个医学术语评测基准,对比通用版 Llama-3.1 与医学数据微调变体,发现通用模型在两项任务上均优于医学微调模型。机制可解释性分析显示,微调模型未重组参数知识,而是过度依赖少数与术语偏好预测相关的组件,造成系统性校准偏差;对这些组件重新加权可抑制其影响并追平通用基线。部分术语敏感组件还能迁移至材料科学术语任务,提示其编码了部分领域无关的专业术语概念。

  2. arXiv:越狱与提示注入 ·

    HPD 与 HERALD:用跨层有害性传播轨迹检测越狱提示

    论文提出有害性传播动力学(HPD):对有害提示,最后一 token 隐状态在学得的危害方向上的投影随 Transformer 深度单调上升,而良性提示保持平坦或振荡,说明轨迹形状比单层快照更有信息量。基于此作者提出 HERALD,从跨层投影序列中提取斜率、曲率、单调性、起始层等七维特征,用 288 参数 MLP 分类;每层存一个 d 维方向(32 层、d=4096 模型约 262 KB),训练不需梯度计算,推理仅增加 2.6×10⁻⁶ 的 prefill FLOPs。

9月11日周五
  1. arXiv:可解释性 ·

    研究指出解码器余弦相似度在 SAE 特征流发现中的失效

    研究以 MLP 更新为切入点,构建残差状态特征与更新特征共同预测目标残差特征的三元组转移图谱,并通过消融解码后的更新特征来验证候选三元组。在 Pythia-160M 的 L7 到 L8、20M token 实验中,共发现 38,125 个强消融效应转移,但其中 88.0% 的状态-目标与更新-目标解码器余弦相似度都低于 0.7。作为跨模型初步检验,Gemma-3-4B 的 L21 到 L22、20M token 实验只对排名前 30,000 的候选三元组做因果验证,强效应三元组中有 53.6% 的两项余弦相似度均低于 0.7。

  2. Redwood Research ·

    Redwood Research 提出 NLS depth:量化模型不可言说串行认知的新指标

    Redwood Research 提出 NLS depth(自然语言根基节点分隔深度),用于量化模型可执行的不可言说串行认知量,作为思维链可监控性的代理指标。该指标基于 GDM 论文(Brown-Cohen 等,2026)的"不透明串行深度"概念,将输出文本且由预训练先验初始化的节点视为"可解释瓶颈",标准 Transformer 的该深度与层数成正比。

9月10日周四
  1. arXiv:可解释性 ·

    超越求解器判定:面向自动形式化的生成式奖励模型

    研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误的形式化翻译仍能通过求解器并得到预期判定,并证明仅依据判定的结构性验证启发式检测能力在数学上被限制在随机水平。为此提出 Generative Verification(GenV),将离线 Z3 等价性 oracle 蒸馏为无参考的连续参考等价性评分,机制分析显示其可原生提取精确的空间错误坐标。oracle 挖掘的验证器 GenV+HN 在参考等价性验证上达到 0.961 AUROC,零样本泛化到未见翻译器与不同形式风格,并在智能体测试时算力分配上带来 11.3 个百分点的下游准确率提升。

  2. arXiv:可解释性 ·

    GeoSteer:面向大语言模型激活引导的测地线优化方法

    GeoSteer 是一种基于优化的保范激活引导方法,把激活引导建模为黎曼优化问题,通过在表示流形上连续小步测地线更新激活来控制 LLM,并用学习到的非线性激活空间目标自适应引导每一步,避免固定引导方向。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准上,GeoSteer 一致优于当前最先进的激活引导基线。结果表明,用自适应、几何感知的优化替代预定义的单步编辑,可让保范引导更有效。

9月9日周三
  1. arXiv:可解释性 ·

    SAE 相图实验未观察到字典恢复或特征合并,训练模型收敛到弥散相

    作者按 MAIS-O43 开放问题指定的协议实现实验,在 165 个网格单元中的 10 个上评估了 200 次独立初始化的拟合,观察到零次完整字典恢复和零次特征合并。每次运行都收敛到一个可复现的弥散相:重建几乎完美,但学习到的原子通常远离真实特征,最佳余弦中位数为 0.5-0.7,低于 0.95 的恢复判据,且学习到的编码比真实值稠密一个数量级。该行为在稳健性检验中持续存在,并在使用标准 minibatch Adam 的完整 165 单元网格上通过额外 3300 次拟合得到验证。

  2. arXiv:可解释性 ·

    基于 Transformer 的声学模型中的稀疏权重与边电路发现

    研究者将 DiscoGP 电路发现框架从文本解码器扩展到语音编码器,在 HuBERT 和 Wav2Vec 2.0 上开展首个现代语音基础模型电路发现研究。发现的电路极为紧凑,却常能匹配甚至超过完整预训练编码器加下游头的性能,消融实验表明其反映的是预训练计算而非随机结构或任务头伪影。团队还提出内存高效变体,将边电路发现的 GPU 显存开销从四次方降至三次方。

  3. arXiv:可解释性 ·

    解读文本到图像扩散模型中的对象依赖概念脆弱性

    文本到图像扩散模型存在一种"对象依赖概念脆弱性":仅对象不同的少量提示词在相同生成设置下持续无法实现同一目标概念,表现为系统性内部盲点而非随机噪声。研究者提出可解释性框架,在逐步稀疏自编码器(SAE)空间中分析去噪轨迹,比较成功与失败生成,定位证据缺失、减弱或延迟的概念维度,并构建类别级概念原型。基于该审计流程,引入轻量推理时校正策略,将去噪特征向 SAE 空间中的对应原型插值,在多个扩散骨干模型的风格与属性失败案例上显著提升概念一致性、文本保真度与修复成功率。

  4. arXiv:后门、投毒与隐私 ·

    SoK 综述:可解释性 AI 如何成为机器学习隐私攻击面

    这篇 SoK 系统梳理了 25 项利用模型解释输出实施隐私攻击的研究,涵盖模型窃取、成员推断和模型反演,并将属性推断视为部分反演。作者指出,现有工作常只按黑盒或白盒标注,掩盖了对手实际获得的解释信号差异,因此把模型知识与解释获取分开,归纳出五条路径:目标方发布、攻击者自行推导、二次披露、特权访问和公开全局产物。在这些路径下,解释会降低窃取成本,通过解释统计量、recourse 距离和解释引导的鲁棒性暴露成员信号,并支持对私有输入做空间或代数重建。

  5. arXiv:可解释性 ·

    MonoTM:用可解释单义特征做主题建模,超越关键词表示

    MonoTM 是一个可解释主题建模框架,将文档-主题混合估计与语义解释解耦:混合估计使用完整的 SAE 特征词袋表示,主题描述符则在固定的混合结果上、从另一套基于语料的语义特征词表中学习。在三个基准语料上,研究发现混合估计与语义解释偏好不同的 SAE 配置和特征子集。该设计在保留全局主题结构的同时,用比单个词更有意义的语义单元表示主题,便于下游语料分析。论文已被 AACL-IJCNLP 2026 接收。

  6. arXiv:可解释性 ·

    特征叠加中线性可达性的高概率保证:IHT-SAE 突破线性可达上限

    研究者将线性可达性建模为压缩感知问题,在次高斯噪声下为固定支撑导出高概率界,证明所需维度随 $d=O_{\varepsilon}(k \log m)$ 线性增长,而非此前最坏情况下的二次上限。工作刻画了活跃与非活跃特征干扰的不对称性,以及干扰预算与观测噪声预算之间的权衡,并通过高斯尾部近似在系统参数上验证了这些界。作者还提出 IHT-SAE,用学习式迭代精修提升特征恢复能力,突破线性可达性限制,为评估稀疏自编码器、组合泛化与神经网络可解释性提供框架。

  7. arXiv:可解释性 ·

    SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究

    论文提出 SAEScientist-Bench,用于评估 AI 智能体能否像研究者一样使用 SAE 工具自主完成机制可解释性发现。给定目标概念后,智能体需设计对比探针,并在 Gemma-2-9B-IT 的 Gemma Scope 字典中检索 131K+ 个特征,找出最优特征。评测以 Neuronpedia 上经专家整理的参考特征为基准,从激活排名、对比文本上的概念选择性以及因果引导三个维度打分。在 10 种智能体配置和 20 项任务中,前沿智能体展现出真实的发现能力,并在不同评测维度上各有领先,但整体仍明显落后于专家基线:在区分目标概念与对比控制项上接近专家水平,在因果生成引导上差距较大。

  8. arXiv:可解释性 ·

    Training-Free Task Vectors:无需微调的 LLM 行为控制方法

    研究者提出 Training-Free Task Vectors(TFTVs),无需微调即可计算类任务向量方向,仅用前向传播统计将激活引导向量映射为秩一权重空间编辑,并支持加法学习、减法遗忘与多编辑组合。在 LLM 行为控制任务上,TFTVs 能持续放大、抑制和组合目标行为,同时保留通用知识与解题能力,相比其他编辑与引导基线实现了更强的特质控制,效用保持相当或更优。代码已在项目网站公开。

9月8日周二
  1. arXiv:可解释性 ·

    医学 AI 编码“错误感”:用内部概念验证癌症分割

    癌症分割模型会静默失败,生成看似合理却错误的掩膜。研究用稀疏自编码器(Sparse Autoencoders)将模型内部激活分解为可解释概念,发现失败案例的潜在特征为活跃概念更少、激活幅度更低,据此训练分类器实现失败检测并给出错误解释。在前列腺癌、胰腺癌和脑癌分割实验中,该方法在保持分割质量的同时,失败检测表现优于基于输出的方法。

  2. arXiv:对齐与欺骗 ·

    综述:机器人策略验证器的可用性与可信度权衡

    这篇综述调查了约 150 个机器人策略验证器,用于评估和训练视觉-语言-动作策略。作者按判断来源把验证器分为人类验证器、规则与形式化验证器、学习与预训练验证器、模型内在验证器四类,并用可用性和可信度两个属性进行比较:可用性指判定成本、在 rollout 中出现的早晚和可请求的密度,可信度指高分在多大程度上反映任务完成情况。跨四类验证器,作者发现可信度随可用性上升而下降,即不存在免费的验证器。文章还梳理了验证器本身的验证方式,包括与人类标注的一致性、所训练策略的表现以及奖励作弊下的行为,并提出九项指标使验证器主张可核查。

  3. arXiv:越狱与提示注入 ·

    语言、越狱与简洁性:LLM 属性引导向量的免训练组合研究

    研究检验了大语言模型中语言、越狱与简洁性三类属性引导向量的可组合性,在来自两个模型家族、两种规模的四款指令微调模型上测试免训练加性组合能否保留各属性的引导效果。单属性引导在三类属性上均可靠,但需匹配合适的干预层与引导强度:抽象行为(越狱、简洁性)偏好中间层,语言偏好更早的层。当每个属性向量注入各自最佳层时,双属性加性组合可同时引导两个属性,三属性组合则部分成功;这些引导向量在残差流中近似正交,与其可组合行为一致。

  4. arXiv:可解释性 ·

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。三个模型的探针性能峰值均明显早于归因,相差 36-53% 的模型深度。评估的残差流特征中仅 6-18% 具有语言无关效应,且无一具备类别无关效应,说明可解码性、输出影响与跨语言消融效应需分别测量。

  5. arXiv:可解释性 ·

    基于 SAE 引导的关键路径识别(KPI)解决知识冲突

    针对 SAE 引导中"大规模引导"因相关性不准和忽略特征交互而引入冗余特征的问题,研究者提出关键路径识别(KPI)方法,通过识别与上下游特征具有强因果依赖的关键引导特征并构建关键路径,以更少的特征修改完成引导。在存在知识冲突的 RAG 任务中,KPI 相比最佳大规模引导基线平均提升 18% 准确率,有效过滤冗余特征并缓解副作用。

  6. arXiv:可解释性 ·

    研究揭示 Transformer 层间纠正机制 TLCM

    论文提出 Transformer Layer Correction Mechanism(TLCM),指出相邻 Transformer 层会系统性地抵消彼此的部分贡献,挑战了残差流特征持续累积并被后续层继承的常见解释。TLCM 出现在 7 个主要开源模型家族中的 5 个,并在多样文本的几乎所有 token 上激活;它在预训练阶段出现,对依赖上下文的 token 作用最强,并根据前一层输出自适应校准纠正强度。借助层 Jacobian,作者发现 TLCM 会选择性地纠正特定子空间而强化另一些子空间,并将其解释为“提出与拒绝”框架,即层提出候选特征、后续层选择性移除不合适的部分。

  7. arXiv:可解释性 ·

    LLM Forensics:用稀疏自编码器定位并控制后门触发机制

    研究在无害的语言切换设定中考察触发式后门的内部机制,固定触发序列会让 1B 和 8B 语言模型把英文提示续写成法语或德语。作者跨层和 Transformer 组件训练稀疏自编码器(SAE),并将触发提示与翻译、预训练对照组比较,以识别与触发相关的特征方向。结果显示 SAE 特征能以接近完美的 F1 区分触发提示与对照组,但能检测触发的特征未必能控制行为:注意力与 MLP 特征常可靠激活却难以通过消融抑制语言切换,而残差流特征被消融时可抑制触发式生成,部分选定特征还能在无触发时诱导目标语言续写。

  8. arXiv:可解释性 ·

    Mamba 的召回缩放定律:基于哈希的理论与机制可解释性研究

    研究从机制可解释性角度逆向出 Mamba 执行联想召回(AR)的内部算法,发现其通过隐式学习线性哈希函数完成召回,并定位了实现该行为的底层电路。受 Johnson-Lindenstrauss 引理等保相似哈希理论启发,作者提出"召回缩放定律"框架,可依据词表规模和上下文中事实数量,预测 Mamba 实现完美召回所需的嵌入与状态维度、给定模型维度下的召回成功概率,并分析多层模型与多头 SSM 模式。实验表明该理论预测准确,揭示了 AR 能力随词表、状态、嵌入规模和架构的缩放规律。

9月7日周一
  1. arXiv:可解释性 ·

    PhysSAE:用稀疏自编码器对 PINN 做机制可解释性分析

    PhysSAE 是一个针对物理信息神经网络(PINN)的机制可解释性框架,在 PINN 倒数第二层激活上训练过完备稀疏自编码器(SAE),并通过在原始冻结隐状态中直接做因果干预(h_cf = h - α z_k d_k)评估字典原子,绕过 SAE 解码器。在六类 PDE、各 3 个 PINN 种子和 3 个 SAE 种子上,发现的 SAE 原子与独立定义的物理可观测量对齐(最大 Pearson |r|=0.951),高对齐原子消融的因果足迹比 PCA 或 ICA 干预在空间上集中 1.2–4.2 倍,并在结构化物理概念上优于匹配随机对照(ESF80 优势 0.04–0.44)。

  2. arXiv:可解释性 ·

    Steering Vector Dissection:将激活引导向量拆解为独立语义特征

    论文提出 Steering Vector Dissection 框架,用于把激活引导中纠缠多个语义与风格概念的复合方向拆解为各自独立的语义一致特征。方法上,作者配对正负激活并取差值生成实例级引导向量,再直接在这些向量上训练专用的 Sparse Autoencoder(SAE)。在 2 个数据集、2 个模型和 2 种干预深度上的定量评估显示,该方法得到的基向量语义一致,且引导效果彼此可区分,从而支持对模型行为更精确的控制。论文共 31 页、5 张图。