跳到正文
10月8日 · 周四

可解释性 · 论文

找到 69 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 174 篇还没打标签,不在筛选结果里。

另有 104 篇还没有研究类型,暂不在这些分类里。

  1. 可解释性arXiv:2610.04125 ·

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    模型与 API测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个模型层
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    完整解读
  2. 可解释性arXiv:2609.14759 ·

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    模型与 API测试OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个模型层
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    完整解读
  3. 可解释性arXiv:2607.24645 ·

    研究提出 FEGA 框架分析 SAE 特征干预的 logit 变化几何

    提出 FEGA 框架,分析 SAE 特征消融后的 logit 效应几何

    模型与 API测试Gemma-2-2B、ReLU SAE、TopK SAE 等 4 个模型层
    摘要FEGA 说明可解释且有因果作用的 SAE 特征,仍常常缺少稳定的单一转向方向。

    Feature-Effect Geometry Analysis(FEGA) 把 SAE 特征的下游干预效应当成 logit 空间中的云来分类,用来区分可复用方向、低维结构和弥散效应。

    完整解读
  4. 可解释性arXiv:2609.10060 ·

    研究者提出基于参考的隐藏状态相对表示偏见检测方法

    用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变

    模型与 API测试Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Gemma 3-4B-IT模型层
    摘要相对表示上的∆B 在多数微调设置中与三个基准的输出层偏见变化共变。

    Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。

    完整解读
  5. 可解释性arXiv:2610.01864 ·

    从孤立特征到轨道:通过多重 SAE 对齐发现音乐概念

    提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道

    模型与 API测试MuQ、MusicFM模型层
    摘要用移调对齐的多 SAE 恢复和弦、调与旋律轨道,并用少量锚点做下游音乐理解。

    作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。

    完整解读
  6. 可解释性arXiv:2610.02098 ·

    研究揭示机制可解释性中的目标层恢复缺口

    比较等规模电路的忠实度与行为准则,揭示目标层恢复缺口

    模型与 API测试GPT-2 small、four-layer attention-only width-512 code model、InterpBench compiled transformers模型层
    摘要同等规模下 faithfulness 会错排行为更好的电路。

    作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。

    完整解读
  7. 可解释性arXiv:2610.01821 ·

    研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示

    提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构

    模型与 API测试GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B 等 9 个模型层
    摘要NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。

    NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。

    完整解读
  8. 可解释性arXiv:2610.00895 ·

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    模型与 API测试ResNet-18、CLIP ViT-L/14、PLIP 等 8 个模型层
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    完整解读
  9. 分析/可解释性arXiv:2609.25518 ·

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    AI 导读作者提出 Matryoshka Attribution(MAttr),把归因问题定义为寻找能最小化下游损失的嵌套内部组件子集,并用可微的 sigmoid top-k 算子参数化掩码。

    测试gpt2-small、Qwen2.5-0.5B、gemma-2-2b 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    完整解读
  10. 分析/可解释性arXiv:2609.28809 ·

    Stream Recursion Model(SRM):面向可扩展机制可解释性的新架构

    AI 导读Stream Recursion Model(SRM)是对 Hierarchical Reasoning Model(HRM)的改进,将计算组织为多个相互作用的潜在流并通过递归精炼更新,以便直接分析流动态、因果贡献与路由行为。

    测试SRM-base、SRM-med、SRM-large 等 5 个
    摘要SRM 用可学习的流间注意力扩展 HRM,语言损失可接近 GPT-2。

    Stream Recursion Model(SRM) 修改 HRM 的多流结构,使流数增加时语言建模仍能扩展,并让路由和流分工可以直接看。

    完整解读
  11. 分析/可解释性arXiv:2609.29362 ·

    SAE 潜空间中词性作为涌现类别:LLM 形态句法信息呈分布式编码

    作者用 LLaMA-3-8B 的 SAE 检验词性是否由单个 latent 编码,发现可从稀疏激活恢复,但由随类别变化的紧凑 latent 组承载。

    测试LLaMA-3-8B、EleutherAI/sae-llama-3-8b-32x
    摘要词性可从 SAE 恢复,由大小随类别变化的 latent 组承载,留出后仍激活但不专属。

    Bondielli、Passaro、Auriemma 和 Lenci 用词性检验 SAE latent 如何组织形态句法信息。。

    完整解读