跳到正文

可解释性

今天新收录 10 条(含旧文)

第 4 页更新的内容回到最新

10月1日周四
  1. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文12

    跨架构知识蒸馏如何影响模型可解释性:ResNet-152 到 ResNet-34 的视觉解释迁移研究

    研究将 ResNet-152 教师蒸馏到 ResNet-34 学生,在 ImageNet-1K 上以五种温度与软标签损失权重配置检验知识蒸馏能否迁移空间特征归因。学生 top-1 准确率为 71.6%–74.0%;Grad-CAM 的 RMA 为 7.7%–9.7%、RRA 为 7.3%–10.1%,Guided Grad-CAM 的 RMA 为 16.1%–18.6%、RRA 为 15.9%–21.5%。可解释性对软标签权重远比温度敏感,且所有配置下细粒度归因均低于未蒸馏基线;12 组卷积与 Transformer 跨架构组合显示细粒度空间推理的继承受学生固有结构偏置制约。

  2. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文15

    Łukasiewicz 神经网络扩展:残差连接实现任意深度的可解释规则提取

    该论文证明残差连接可将权重取整数、激活函数截断恒等的 Łukasiewicz 网络扩展到任意深度,并构造性地保证合并神经元始终满足神经元的逻辑联结词分类命题,不受内层权重影响。针对结晶化策略,论文分析了修正版 Levenberg-Marquardt、直通估计(STE)和近端正则三种方法的理论保障、失效模式及可解释性权衡,从而突破原有算法仅适用于浅层结构和小规模数据的限制。

  3. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文31

    循环 Transformer 长度泛化的机制与边界:MR-Loop 与 DR-Loop 的机制对比研究

    研究机制性对比了两种循环 Transformer 配置 MR-Loop 与 DR-Loop,在多项式迭代、有限状态组合和知识图谱遍历任务上分析其长度泛化机制。MR-Loop 在固定读出下更新中间状态,通过相邻 token 交互推进关系选择;DR-Loop 则跨关系位置传播中间状态,形成推进式计算前沿。两者在更深层均不可靠:MR-Loop 读出状态与进度线索退化,DR-Loop 状态传播可靠性下降,且有限的自纠正使局部错误持续累积。循环状态还编码内容的计算状态,可迁移的 live-consumed 与 fresh-aged 残差方向因果控制信息能否参与后续计算,且长度泛化不必依赖忠实的逐步推理。

  4. arXiv:可解释性 · 收录 · 原文 论文25

    S^3martCirc:自监督智能电路发现框架

    S^3martCirc 是一个同时发现电路并解释其功能的统一框架,将节点行为抽象为两种可跨任务泛化的计算角色,并定义量化指标进行分配,使重要性与功能角色被联合发现而非分两步进行。该框架针对现有 LLM 机制可解释性方法中电路发现与功能解释相互割裂、功能角色依赖主观解读的问题,在电路发现任务上优于现有方法。

  5. arXiv:可解释性 · 收录 · 原文 论文17

    在文本因果混杂调整中探索稀疏自编码器(SAE)

    研究提出一种基于稀疏自编码器(SAE)的因果调整流程,通过条件独立性检验迭代筛选最小 SAE 特征集,以在保留混杂变量与满足有限样本重叠之间取得平衡。在二元混杂变量的半合成评测中,SAE 表示比替代表示实现更优调整,偏差更低、覆盖率更高,且其可解释性提供了证伪机会。作者还引入以多标签数据作为未观测混杂变量的更真实半合成评测,发现现成调整方法在这类更复杂设定下仍需进一步研究。

  6. arXiv:可解释性 · 收录 · 原文 论文27

    Gemma-3-27B-PT 内部激活中的可解释抑郁症状向量

    研究用机制可解释性方法分析 Gemma-3-27B-PT 的残差流,发现症状描述在第 21 层的几何分离度最高。基于临床量表构建的 Symptom Vectors 在留出自然文本上的逐症状系数,保留了临床医生标注的情绪、躯体与自杀倾向轴排序;第 21 层的单一抑郁向量可区分抑郁与非抑郁文本(AUC = 0.789),并可作为情绪效价门控限制症状投影范围。

  7. arXiv:可解释性 · 收录 · 原文 论文42

    LLM 如何处理上下文知识冲突:ContextConflict 数据集与机制可解释性分析

    论文研究 LLM 如何处理上下文知识内部的冲突,而非模型参数知识与外部上下文之间的冲突,提出包含事实、推断、时间、粒度、视角和歧义六类的分类体系,并构建数据集 ContextConflict。该数据集含 5,781 条样本,覆盖推理与摘要任务,同时包含显式矛盾与需要多步推理的隐式冲突。在九个 LLM 上的实验显示,当前模型在解决上下文知识冲突方面仍有不足。作者进一步从机制可解释性角度分析模型处理冲突的过程,发现模型对冲突存在潜在感知,并刻画了冲突处理的表征几何。分析还发现模型一致偏向较早出现的证据,这种位置偏好是有效解决冲突的主要障碍。

  8. arXiv:可解释性 · 收录 · 原文 论文29

    FailSAE:用稀疏自编码器实现视觉语言模型的可解释失败预测

    研究提出 FailSAE,用稀疏自编码器(SAE)对 CLIP 等视觉语言模型做可解释的失败预测,将失败预测建模为 SAE 稀疏隐激活上的分类任务,并设计三阶段失败感知训练流程。实验显示该框架在失败预测上优于所评估的基线,失败感知训练使 SAE 隐方向捕获更多类别特定概念。分析还发现模型失败时表征从类别特定概念转向更模糊或风格相关概念,并探索了用学到的 SAE 隐方向支持运行时失败恢复。

  9. arXiv:可解释性 · 收录 · 原文 论文15

    LLM 如何表征与检索单复数实体:复指回指的机制可解释性研究

    研究用机制可解释性与注意力模式分析,考察 LLM 预测代词回指前文实体时如何表征和检索单复数实体。通过多种因果干预手段,识别出一组注意力头,分别负责在输入中表征共指信息、识别构成复数指代的实体,以及把信息传递给负责选择先行词并预测代词的组件。研究还发现 LLM 在复数代词偏好上与人类一致:本体上相似、并由 "and" 连接的实体更可能被复数指代。

  10. arXiv:可解释性 · 收录 · 原文 论文43

    SharedSAE:跨语言模型共享一套特征字典的稀疏自编码器

    SharedSAE 提出用一套共享字典加各模型专属编码器-解码器对,替代为每个模型单独训练的稀疏自编码器(SAE)。与丢弃激活幅值、且推理时需要全部模型在场的先前方法不同,SharedSAE 只对选择分数做归一化以保留幅值,并用模型 dropout 支持单模型推理。作者在四个 1B 规模、分属不同模型家族与 tokenizer 的基础语言模型上训练 SharedSAE,其平均解释方差保留了专属 SAE 的 96.6%,潜在激活的跨模型相关性是事后对齐的独立 SAE 的 1.8 倍,潜在特征描述也能跨模型迁移。字典冻结后,新模型可高效适配,在复用共享潜在描述的同时达到接近专属 SAE 的重建质量。

  11. arXiv:可解释性 · 收录 · 原文 论文37

    研究:SAE 特征复现不足以证明跨语言因果作用,Gemma 2 与 3 中各存一个翻译启动方向

    研究者在 Gemma 2 与 Gemma 3 上复现并扩展了 Wu 等人的 SAE 翻译启动特征发现方法,检验跨语言场景下特征是否具有相同因果作用。在两种模型中,虽然能找到 20 多个在所有发现设置下频繁激活的特征,但因果验证显示其中绝大多数影响很小或不一致。相比之下,Gemma 2 的 (L10, 5717) 与 Gemma 3 的 (L20, 2456) 在 23 种语言设置下放大时稳定提升 COMET 分数、消融时使其下降。结果表明特征复现会高估跨语言迁移,同时识别出 Gemma 2 和 Gemma 3 中一个与语言无关的翻译启动方向。该论文被 BlackboxNLP 2026 Special Track 接收。

  12. arXiv:可解释性 · 收录 · 原文 论文41

    Capsule Lens:定位并追踪模型表示中的概念几何

    作者提出 Capsule Lens 框架,用胶囊这一由若干可解释参数定义的几何形式刻画概念在表示空间中占据的区域,参数以闭式解拟合并在留出样本上验证。该框架应用于静态与动态两类表示:在静态表示上定位不同模型中的概念几何,并用跨度与范数曲线揭示几何特征;在动态表示上通过三个案例追踪训练带来的表示漂移,包括 CLIP 预训练、视觉问答的 RL 后训练和数学推理的 RL 后训练。分析显示不同训练设置下的几何动态存在质的差异,从 CLIP 预训练中网络范围的广泛重构,到 RL 后训练中局部且概念特定的变化。作者认为 Capsule Lens 可用于定位、分析和追踪静态与动态表示中的概念几何。

  13. arXiv:可解释性 · 收录 · 原文 论文29

    Spillover-Aware Multi-Value Steering:面向多元对齐的 LLM 激活引导去纠缠方法

    针对多元对齐中同时引导多个价值维度时出现的溢出效应,研究者提出 Spillover-Aware Multi-Value Steering 方法,将溢出归因于引导方向的几何纠缠(由 Gram 矩阵刻画),并从激活范数惩罚目标推导出零成本校正以精确解耦各方向贡献。该流程无需微调、奖励模型或人工提示工程,仅凭领域问题即可自动发现价值维度、提取方向、诊断纠缠并施加校正。在气候议题上,校正将净引导效果从 +5.9% 提升至 +14.0%,经 100,000 次成对判断验证。

  14. arXiv:可解释性 · 收录 · 原文 论文8

    动物重识别模型学到了什么?DINOv3 中线性生物概念及其来源

    基于 DINOv3 骨干、用 triplet-margin loss 微调的西部低地大猩猩重识别模型,其表征中性别与年龄以线性方向存在,对留出个体可达 0.91 AUROC,且每个个体仅需一张图像即可恢复。激活引导显示性别方向被模型因果使用,能显著改变预测性别;对比现成与微调骨干表明重识别训练并未创造这些概念,而是将其在网络中重新分布。数据归因进一步显示该表征反映渐变的生物轴、在群体中冗余编码,并受视觉模糊个体影响。

  15. arXiv:可解释性 · 收录 · 原文 论文35

    LLM 激活引导空间能否反映人类价值几何?EMNLP 2026 研究发布 26K 样本基准

    研究用 Schwartz 基本人类价值理论检验 LLM 激活引导向量是否编码连贯的价值语义结构,构建了覆盖 20 种人类价值的 26K 样本基准。分布驱动方法(CAA、SphericalSteer、ODESteer)恢复的价值拓扑与理论预测一致,Spearman ρ 最高 0.51(p < 10^-13);以行为为中心的方法(COLD-Steer、BiPO)引导性能相当,但与预期价值几何几乎不相关。几何保真度随模型规模提升,却在指令微调后下降;几何对齐更好时,引导某一价值会正确提升相容价值、抑制对立价值。

  16. arXiv:可解释性 · 收录 · 原文 论文29

    量化 LLM 中的激活引导:剂量响应、能力成本与失败不对称性

    研究系统考察了仅权重量化(INT8 与 NF4)下激活引导的表现,覆盖四个 7-9B 开源模型和情感、推理长度两个行为目标。情感引导在量化后基本不受影响,INT8 合并对比为 -0.010(90% CI [-0.026, +0.007]),判定为等效;推理长度则呈不对称剂量响应,缩短仅 12-30% 后即出现不连续失败。Mistral-NF4 在 alpha=0 时 GSM8K 从 0.545 降至 0.365,显示压缩本身可主导引导效果,但引导向量与 FP16 版本仍高度共线(INT8 余弦相似度 0.989-0.998,NF4 为 0.945-0.990)。

  17. arXiv:可解释性 · 收录 · 原文 论文46

    研究:激活引导的干扰反映模型默认倾向而非行为方向

    论文发现激活引导(activation steering)的干扰由模型自身决定,而非被引导的行为方向。作者在 24 种行为和 10 个指令微调模型上得到三项结果,所有效果均由语言模型评判器从生成文本读出,而非探针。第一,一个不含行为内容、仅在与真实引导所加向量大小上匹配的方向,会以与真实引导相同的顺序移动相同的行为,却不产生任何需要特定方向的行为。第二,多数干扰是单向的,因此不能解释为两个方向的重叠:引导脏话会让模型变得有毒,而引导毒性不会影响脏话。第三,完全留出某一行为时,用其他行为测得的几何几乎无法解释它参与的干扰。

  18. arXiv:可解释性 · 收录 · 原文 论文8

    通过稀疏自编码器特征追踪查询扩展效果

    研究用稀疏自编码器(SAE)特征追踪查询扩展(QE)对稠密检索器的内部影响,将原始与扩展查询的逐层表示分解为稀疏隐激活,从扩展引发的激活偏移中识别出 QE 相关隐变量。分析显示有效 QE 引发与检索意图和实体属性对齐的层级集中变化,而非仅扰动最终查询嵌入。基于 SAE 的激活引导在四个基准上比随机干预或原始 QE 更稳定地提升检索效果,无需查询改写或检索器微调。

  19. arXiv:可解释性 · 收录 · 原文 论文39

    Steering Vector Dissection:将激活引导向量拆解为独立语义特征

    论文提出 Steering Vector Dissection 框架,用于把激活引导中纠缠多个语义与风格概念的复合方向拆解为各自独立的语义一致特征。方法上,作者配对正负激活并取差值生成实例级引导向量,再直接在这些向量上训练专用的 Sparse Autoencoder(SAE)。在 2 个数据集、2 个模型和 2 种干预深度上的定量评估显示,该方法得到的基向量语义一致,且引导效果彼此可区分,从而支持对模型行为更精确的控制。论文共 31 页、5 张图。

  20. arXiv:可解释性 · 收录 · 原文 论文19

    PhysSAE:用稀疏自编码器对 PINN 做机制可解释性分析

    PhysSAE 是一个针对物理信息神经网络(PINN)的机制可解释性框架,在 PINN 倒数第二层激活上训练过完备稀疏自编码器(SAE),并通过在原始冻结隐状态中直接做因果干预(h_cf = h - α z_k d_k)评估字典原子,绕过 SAE 解码器。在六类 PDE、各 3 个 PINN 种子和 3 个 SAE 种子上,发现的 SAE 原子与独立定义的物理可观测量对齐(最大 Pearson |r|=0.951),高对齐原子消融的因果足迹比 PCA 或 ICA 干预在空间上集中 1.2–4.2 倍,并在结构化物理概念上优于匹配随机对照(ESF80 优势 0.04–0.44)。

  21. arXiv:可解释性 · 收录 · 原文 论文22

    Mamba 的召回缩放定律:基于哈希的理论与机制可解释性研究

    研究从机制可解释性角度逆向出 Mamba 执行联想召回(AR)的内部算法,发现其通过隐式学习线性哈希函数完成召回,并定位了实现该行为的底层电路。受 Johnson-Lindenstrauss 引理等保相似哈希理论启发,作者提出"召回缩放定律"框架,可依据词表规模和上下文中事实数量,预测 Mamba 实现完美召回所需的嵌入与状态维度、给定模型维度下的召回成功概率,并分析多层模型与多头 SSM 模式。实验表明该理论预测准确,揭示了 AR 能力随词表、状态、嵌入规模和架构的缩放规律。

  22. arXiv:可解释性 · 收录 · 原文 论文43

    LLM Forensics:用稀疏自编码器定位并控制后门触发机制

    研究在无害的语言切换设定中考察触发式后门的内部机制,固定触发序列会让 1B 和 8B 语言模型把英文提示续写成法语或德语。作者跨层和 Transformer 组件训练稀疏自编码器(SAE),并将触发提示与翻译、预训练对照组比较,以识别与触发相关的特征方向。结果显示 SAE 特征能以接近完美的 F1 区分触发提示与对照组,但能检测触发的特征未必能控制行为:注意力与 MLP 特征常可靠激活却难以通过消融抑制语言切换,而残差流特征被消融时可抑制触发式生成,部分选定特征还能在无触发时诱导目标语言续写。

  23. arXiv:可解释性 · 收录 · 原文 论文43

    研究揭示 Transformer 层间纠正机制 TLCM

    论文提出 Transformer Layer Correction Mechanism(TLCM),指出相邻 Transformer 层会系统性地抵消彼此的部分贡献,挑战了残差流特征持续累积并被后续层继承的常见解释。TLCM 出现在 7 个主要开源模型家族中的 5 个,并在多样文本的几乎所有 token 上激活;它在预训练阶段出现,对依赖上下文的 token 作用最强,并根据前一层输出自适应校准纠正强度。借助层 Jacobian,作者发现 TLCM 会选择性地纠正特定子空间而强化另一些子空间,并将其解释为“提出与拒绝”框架,即层提出候选特征、后续层选择性移除不合适的部分。

  24. arXiv:可解释性 · 收录 · 原文 论文27

    基于 SAE 引导的关键路径识别(KPI)解决知识冲突

    针对 SAE 引导中"大规模引导"因相关性不准和忽略特征交互而引入冗余特征的问题,研究者提出关键路径识别(KPI)方法,通过识别与上下游特征具有强因果依赖的关键引导特征并构建关键路径,以更少的特征修改完成引导。在存在知识冲突的 RAG 任务中,KPI 相比最佳大规模引导基线平均提升 18% 准确率,有效过滤冗余特征并缓解副作用。

  25. arXiv:可解释性 · 收录 · 原文 论文35

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。三个模型的探针性能峰值均明显早于归因,相差 36-53% 的模型深度。评估的残差流特征中仅 6-18% 具有语言无关效应,且无一具备类别无关效应,说明可解码性、输出影响与跨语言消融效应需分别测量。

  26. arXiv:可解释性 · 收录 · 原文 论文25

    医学 AI 编码“错误感”:用内部概念验证癌症分割

    癌症分割模型会静默失败,生成看似合理却错误的掩膜。研究用稀疏自编码器(Sparse Autoencoders)将模型内部激活分解为可解释概念,发现失败案例的潜在特征为活跃概念更少、激活幅度更低,据此训练分类器实现失败检测并给出错误解释。在前列腺癌、胰腺癌和脑癌分割实验中,该方法在保持分割质量的同时,失败检测表现优于基于输出的方法。

  27. arXiv:可解释性 · 收录 · 原文 论文34

    Training-Free Task Vectors:无需微调的 LLM 行为控制方法

    研究者提出 Training-Free Task Vectors(TFTVs),无需微调即可计算类任务向量方向,仅用前向传播统计将激活引导向量映射为秩一权重空间编辑,并支持加法学习、减法遗忘与多编辑组合。在 LLM 行为控制任务上,TFTVs 能持续放大、抑制和组合目标行为,同时保留通用知识与解题能力,相比其他编辑与引导基线实现了更强的特质控制,效用保持相当或更优。代码已在项目网站公开。

  28. arXiv:可解释性 · 收录 · 原文 论文31

    特征叠加中线性可达性的高概率保证:IHT-SAE 突破线性可达上限

    研究者将线性可达性建模为压缩感知问题,在次高斯噪声下为固定支撑导出高概率界,证明所需维度随 $d=O_{\varepsilon}(k \log m)$ 线性增长,而非此前最坏情况下的二次上限。工作刻画了活跃与非活跃特征干扰的不对称性,以及干扰预算与观测噪声预算之间的权衡,并通过高斯尾部近似在系统参数上验证了这些界。作者还提出 IHT-SAE,用学习式迭代精修提升特征恢复能力,突破线性可达性限制,为评估稀疏自编码器、组合泛化与神经网络可解释性提供框架。

  29. arXiv:可解释性 · 收录 · 原文 论文6

    MonoTM:用可解释单义特征做主题建模,超越关键词表示

    MonoTM 是一个可解释主题建模框架,将文档-主题混合估计与语义解释解耦:混合估计使用完整的 SAE 特征词袋表示,主题描述符则在固定的混合结果上、从另一套基于语料的语义特征词表中学习。在三个基准语料上,研究发现混合估计与语义解释偏好不同的 SAE 配置和特征子集。该设计在保留全局主题结构的同时,用比单个词更有意义的语义单元表示主题,便于下游语料分析。论文已被 AACL-IJCNLP 2026 接收。

  30. arXiv:可解释性 · 收录 · 原文 论文15

    解读文本到图像扩散模型中的对象依赖概念脆弱性

    文本到图像扩散模型存在一种"对象依赖概念脆弱性":仅对象不同的少量提示词在相同生成设置下持续无法实现同一目标概念,表现为系统性内部盲点而非随机噪声。研究者提出可解释性框架,在逐步稀疏自编码器(SAE)空间中分析去噪轨迹,比较成功与失败生成,定位证据缺失、减弱或延迟的概念维度,并构建类别级概念原型。基于该审计流程,引入轻量推理时校正策略,将去噪特征向 SAE 空间中的对应原型插值,在多个扩散骨干模型的风格与属性失败案例上显著提升概念一致性、文本保真度与修复成功率。

  31. arXiv:可解释性 · 收录 · 原文 论文29

    基于 Transformer 的声学模型中的稀疏权重与边电路发现

    研究者将 DiscoGP 电路发现框架从文本解码器扩展到语音编码器,在 HuBERT 和 Wav2Vec 2.0 上开展首个现代语音基础模型电路发现研究。发现的电路极为紧凑,却常能匹配甚至超过完整预训练编码器加下游头的性能,消融实验表明其反映的是预训练计算而非随机结构或任务头伪影。团队还提出内存高效变体,将边电路发现的 GPU 显存开销从四次方降至三次方。

  32. arXiv:可解释性 · 收录 · 原文 论文43

    SAE 相图实验未观察到字典恢复或特征合并,训练模型收敛到弥散相

    作者按 MAIS-O43 开放问题指定的协议实现实验,在 165 个网格单元中的 10 个上评估了 200 次独立初始化的拟合,观察到零次完整字典恢复和零次特征合并。每次运行都收敛到一个可复现的弥散相:重建几乎完美,但学习到的原子通常远离真实特征,最佳余弦中位数为 0.5-0.7,低于 0.95 的恢复判据,且学习到的编码比真实值稠密一个数量级。该行为在稳健性检验中持续存在,并在使用标准 minibatch Adam 的完整 165 单元网格上通过额外 3300 次拟合得到验证。

  33. arXiv:可解释性 · 收录 · 原文 论文26

    GeoSteer:面向大语言模型激活引导的测地线优化方法

    GeoSteer 是一种基于优化的保范激活引导方法,把激活引导建模为黎曼优化问题,通过在表示流形上连续小步测地线更新激活来控制 LLM,并用学习到的非线性激活空间目标自适应引导每一步,避免固定引导方向。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准上,GeoSteer 一致优于当前最先进的激活引导基线。结果表明,用自适应、几何感知的优化替代预定义的单步编辑,可让保范引导更有效。

  34. arXiv:可解释性 · 收录 · 原文 论文20

    超越求解器判定:面向自动形式化的生成式奖励模型

    研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误的形式化翻译仍能通过求解器并得到预期判定,并证明仅依据判定的结构性验证启发式检测能力在数学上被限制在随机水平。为此提出 Generative Verification(GenV),将离线 Z3 等价性 oracle 蒸馏为无参考的连续参考等价性评分,机制分析显示其可原生提取精确的空间错误坐标。oracle 挖掘的验证器 GenV+HN 在参考等价性验证上达到 0.961 AUROC,零样本泛化到未见翻译器与不同形式风格,并在智能体测试时算力分配上带来 11.3 个百分点的下游准确率提升。

  35. arXiv:可解释性 · 收录 · 原文 论文43

    研究指出解码器余弦相似度在 SAE 特征流发现中的失效

    研究以 MLP 更新为切入点,构建残差状态特征与更新特征共同预测目标残差特征的三元组转移图谱,并通过消融解码后的更新特征来验证候选三元组。在 Pythia-160M 的 L7 到 L8、20M token 实验中,共发现 38,125 个强消融效应转移,但其中 88.0% 的状态-目标与更新-目标解码器余弦相似度都低于 0.7。作为跨模型初步检验,Gemma-3-4B 的 L21 到 L22、20M token 实验只对排名前 30,000 的候选三元组做因果验证,强效应三元组中有 53.6% 的两项余弦相似度均低于 0.7。

  36. arXiv:可解释性 · 收录 · 原文 论文20

    Llama-3.1 医学微调模型在专业术语理解上为何不如通用版:一项机制可解释性对比分析

    研究构建两个医学术语评测基准,对比通用版 Llama-3.1 与医学数据微调变体,发现通用模型在两项任务上均优于医学微调模型。机制可解释性分析显示,微调模型未重组参数知识,而是过度依赖少数与术语偏好预测相关的组件,造成系统性校准偏差;对这些组件重新加权可抑制其影响并追平通用基线。部分术语敏感组件还能迁移至材料科学术语任务,提示其编码了部分领域无关的专业术语概念。

  37. arXiv:可解释性 · 收录 · 原文 论文25

    语言模型激活空间中的可操控性特征

    研究证明,简单的分离度指标与语言模型的下游可操控性在不同设置下均强相关,即便控制层数和数据集效应后依然成立。基于合成叠加实验,分离度指标与经验特征方向和真实特征方向之间的一致性也高度相关。结果表明,这类可分离性统计量可作为判断 steering vector 何时有效的实用诊断工具。

  38. arXiv:可解释性 · 收录 · 原文 论文43

    Fixed-SAE Track:从机制可解释性看 LLM 从强化学习中学到了什么

    研究者提出 Fixed-SAE Track 框架,在每个考察层上基于基座模型与全部 RL checkpoint 的激活训练一个共享 SAE,固定特征方向以严格定义表征漂移。在多个数据集和 RL 算法上验证发现,RL 引起的漂移幅度小、渐进、与概念相关且集中在后层,主要提升一小批 ladder token 及步骤分隔、答案定界符等格式脚手架特征的采样率,而非重塑问题内容。把这些特征引导进基座模型可恢复约 80% 的 RL 性能增益,说明 RL 主要是激发模型已有能力。作者还设计了一个特征已知的合成基准,用于检验 RL 能否真正引入全新特征。

  39. arXiv:可解释性 · 收录 · 原文 论文18

    在 Llama 3.1 8B-Instruct 等 LLM 内部定位并因果操控"机会识别旋钮"

    研究团队在 Llama 3.1 8B-Instruct 中定位出一个"机会识别方向",并通过对该内部表征的因果干预实现"机会识别旋钮"的上下调节,模型的创业机会判断随之改变。研究构建了 636 对匹配的"有机会/无机会"情景对,经留出测试、词汇与主题控制、行为消融和几何比较验证该方向可恢复、有因果作用且区别于机会评估与开发方向。该方向的恢复、有符号操控与几何分离在另外四个不同规模与家族的 LLM 上同样成立。

  40. arXiv:可解释性 · 收录 · 原文 论文50

    论文指可解释替换网络忠实性易被微小扰动翻转,提出形式化验证框架

    论文指出,机制可解释性中可解释替换网络(IRN)的忠实性通常只在干净数据上做经验评估,而语义上极小的输入扰动就会翻转主导 IRN 特征,从而改变人类可理解的解释,这一现象在 GPT-2 small、Gemma 2 2B、Gemma 3 1B、Llama 3.2 1B、R1-Distill-Qwen 1.5B 五个开放权重模型族上均出现。作者提出首个针对 IRN 忠实性的形式化验证框架,用可达性分析在对抗场景下给出忠实性差距的可靠上界。作者还表明,验证感知训练能显著收紧该认证上界,恢复安全审计人员可据以行动的特征级解释。论文关键词包括形式化方法、验证、认证、鲁棒性、稀疏自编码器与 transcoder。