跳到正文
10月8日 · 周四

可解释性 · 论文

找到 56 篇
筛选

模型自身风险

防御类型

系统组件

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 174 篇还没打标签,不在筛选结果里。

另有 104 篇还没有研究类型,暂不在这些分类里。

  1. 分析与理论arXiv:2610.10203 ·

    研究者提出模型生物体多目标验证框架并给出训练建议

    提出模型生物多目标验证与合并训练方法以减少能力损伤

    模型与 API测试gemma-2-2b-it、olmo-2-1b、llama-3.1-8b-it 等 8 个训练与数据层
    摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。

    本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。

    完整解读
  2. 分析与理论arXiv:2609.37312 ·

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链中的信息足迹与不可读性

    模型与 API测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个模型层

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    完整解读
  3. 分析/可解释性arXiv:2609.25518 ·

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    AI 导读作者提出 Matryoshka Attribution(MAttr),把归因问题定义为寻找能最小化下游损失的嵌套内部组件子集,并用可微的 sigmoid top-k 算子参数化掩码。

    测试gpt2-small、Qwen2.5-0.5B、gemma-2-2b 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    完整解读
  4. 分析/可解释性arXiv:2609.28809 ·

    Stream Recursion Model(SRM):面向可扩展机制可解释性的新架构

    AI 导读Stream Recursion Model(SRM)是对 Hierarchical Reasoning Model(HRM)的改进,将计算组织为多个相互作用的潜在流并通过递归精炼更新,以便直接分析流动态、因果贡献与路由行为。

    测试SRM-base、SRM-med、SRM-large 等 5 个
    摘要SRM 用可学习的流间注意力扩展 HRM,语言损失可接近 GPT-2。

    Stream Recursion Model(SRM) 修改 HRM 的多流结构,使流数增加时语言建模仍能扩展,并让路由和流分工可以直接看。

    完整解读
  5. 分析/可解释性arXiv:2609.29362 ·

    SAE 潜空间中词性作为涌现类别:LLM 形态句法信息呈分布式编码

    作者用 LLaMA-3-8B 的 SAE 检验词性是否由单个 latent 编码,发现可从稀疏激活恢复,但由随类别变化的紧凑 latent 组承载。

    测试LLaMA-3-8B、EleutherAI/sae-llama-3-8b-32x
    摘要词性可从 SAE 恢复,由大小随类别变化的 latent 组承载,留出后仍激活但不专属。

    Bondielli、Passaro、Auriemma 和 Lenci 用词性检验 SAE latent 如何组织形态句法信息。。

    完整解读
  6. 分析/可解释性arXiv:2609.18612 ·

    研究揭示 Transformer 中影响超常的削弱型神经元

    作者用权重余弦把 GLU 神经元分成读写功能类,发现晚期 weakening 神经元虽少但激活频繁、消融影响大,负门控值也影响输出。

    测试OLMo-7B-0424、Gemma-2-2B、Gemma-2-9B 等 9 个
    摘要GLU 神经元的读写余弦呈现先加强后削弱的层模式,晚期少量 weakening 神经元对输出影响大。

    这篇分析工作用输入权重与输出权重的余弦,给 GLU 神经元的读写功能分类,并检查这些类的层分布、激活频率和对下一 token 分布的影响。

    完整解读
  7. 分析/可解释性arXiv:2609.33144 ·

    循环 Transformer 长度泛化的机制与边界:MR-Loop 与 DR-Loop 的机制对比研究

    论文比较 MR-Loop 与 DR-Loop 在训练视野外复用循环计算的机制:二者算法不同,但都依赖可迁移的计算状态。超长时状态退化且自我纠正有限,长度泛化也不等于忠实逐步推理。

    测试MR-Loop(Fan et al., 2025 配置)、DR-Loop(Kohli et al., 2026 配置)
    摘要两种循环配置以不同算法外推,都要维持计算状态。

    这篇工作用机制分析比较两种循环 Transformer 配置如何在训练长度之外复用计算。问题来自:循环深度可以随测试加长,但行为准确率看不出复用的是哪套算法、中间状态必须保留什么,以及外推成功是否等于按真实轨迹逐步执行。模型只在最终答案上接受监督。

    完整解读
  8. 分析/可解释性arXiv:2609.00755 ·

    S^3martCirc:自监督智能电路发现框架

    S³martCirc 联合发现电路并分两类角色。

    测试GPT-2、Llama 3.2 1B、Qwen 3 1.7B
    摘要S³martCirc 联合发现电路并分两类角色。

    S³martCirc 把电路成员和节点功能放进同一次优化。。要处理的情况是:先选注意力头或前馈神经元,再人工指定 name mover 一类任务专用角色。

    完整解读
  9. 分析/可解释性arXiv:2609.01322 ·

    在文本因果混杂调整中探索稀疏自编码器(SAE)

    Zhong 等人用 SAE 特征子集调整文本混杂,在 20NG 二值/多类半合成上偏差低于 TIRM 与嵌入,EURLEX 多标签结果则好坏参半。

    摘要SAE 最小子集用于文本混杂调整:20NG 上偏差更低,多标签上匹配与 DoubleML 表现不一致。

    Zhong、Keith 与 Field 提出用稀疏自编码器特征的最小子集,对观测文本中的混杂做因果调整,并在半合成数据上比较 CEM 与 DoubleML。。

    完整解读
  10. 分析/可解释性arXiv:2609.03148 ·

    LLM 如何处理上下文知识冲突:ContextConflict 数据集与机制可解释性分析

    AI 导读论文研究 LLM 如何处理上下文知识内部的冲突,而非模型参数知识与外部上下文之间的冲突,提出包含事实、推断、时间、粒度、视角和歧义六类的分类体系,并构建数据集 ContextConflict。

    测试gpt-5、claude-4.5-sonnet、gemini-2.5-pro 等 7 个
    摘要CONTEXT CONFLICT 显示模型能内部察觉冲突,却偏向靠前证据。

    CONTEXT CONFLICT 把问题从“参数知识对外部语境”转到“语境内部多来源证据互相冲突”,并同时给出数据、机制分析和一种无训练转向。

    完整解读
  11. 分析/可解释性arXiv:2609.05575 ·

    Capsule Lens:定位并追踪模型表示中的概念几何

    Capsule Lens 用闭式拟合的胶囊近似概念在表示空间中的区域,并在静态表示与三种训练动态中跟踪其几何变化。

    测试CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-2B 等 6 个
    摘要胶囊闭式拟合概念区域。

    Capsule Lens 用一个可闭式拟合、可跨 checkpoint 比较的胶囊,定位概念在表示空间中的区域并跟踪训练引起的漂移。

    完整解读
  12. 分析/可解释性arXiv:2609.06020 ·

    动物重识别模型学到了什么?DINOv3 中线性生物概念及其来源

    Nolting 等发现,仅用 triplet-margin 做大猩猩 Re-ID 的 DINOv3 仍把 sex、age 编码为可泛化的线性方向,sex 方向可因果改变检索。

    测试DINOv3-Base ViT(预训练)、DINOv3-Base ViT(gorilla Re-ID fine-tuned,triplet-margin loss)
    摘要metric learning 的大猩猩 Re-ID 表示沿 sex、age 形成可转向的线性轴,微调只重排其位置。

    这篇工作检查只做个体匹配的动物 Re-ID 表示里,有没有可审计的生物学结构。。

    完整解读
  13. 分析/可解释性arXiv:2609.06289 ·

    LLM 激活引导空间能否反映人类价值几何?EMNLP 2026 研究发布 26K 样本基准

    作者检验 LLM steering 向量的几何是否符合人类价值结构,发现 distribution-driven 方法比 behavior-centric 更贴近 Schwartz circumplex。

    测试Qwen3.5-9B-Base、Qwen3.5-9B-Instruct、Llama3.1-8B-Base 等 12 个
    摘要分布驱动的 steering 向量更符合 Schwartz 几何,并带来更可预测的跨价值迁移。

    作者研究推理时 activation steering 的向量,是否在几何上符合人类价值理论,而不只是改变单一目标行为。

    完整解读
  14. 分析/可解释性arXiv:2609.06951 ·

    研究:激活引导的干扰反映模型默认倾向而非行为方向

    AI 导读论文发现激活引导(activation steering)的干扰由模型自身决定,而非被引导的行为方向。

    测试Qwen2.5-1.5B、Qwen2.5-3B、Qwen2.5-7B-Instruct 等 10 个
    摘要Steer 的副作用是模型被扰动后落入的少数默认行为,几何重叠预测不了这些副作用。

    Activation steering 的跨行为干扰由模型的默认集合决定,而不是由行为方向的几何重叠决定。。

    完整解读
  15. 分析/可解释性arXiv:2609.06968 ·

    通过稀疏自编码器特征追踪查询扩展效果

    作者用 SAE 追踪稠密检索中查询扩展引起的稀疏潜变量变化,并在四个基准上用激活转向做干预验证。

    测试Qwen3-Embedding-0.6B(Qwen-Embed)、SimLM
    摘要SAE 追踪稠密检索 QE 的潜变量,转向在四基准上比文本扩展更稳。

    作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。

    完整解读
  16. 分析/可解释性arXiv:2609.07037 ·

    Steering Vector Dissection:将激活引导向量拆解为独立语义特征

    作者提出 Steering Vector Dissection,用 SAE 拆解 DiffMean 转向向量。在两个模型上,基向量语义更一致,去掉拒绝方向后 StrongREJECT 分数上升。

    测试Qwen2.5-7B-Instruct、Llama3.1-8B-Instruct
    摘要用 SAE 把 DiffMean 拆成可区分基向量,并靠去掉拒绝方向改变不安全转向的效果。

    Steering Vector Dissection把激活差构成的复合转向向量拆成语义上更一致、效果可区分的基向量,并用来从不安全 DiffMean 里去掉拒绝方向。

    完整解读