跳到正文
10月8日 · 周四

可解释性 · 论文

找到 41 篇

另有 118 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2608.21766

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    发表
    测试
    Gemma4-31B、Qwen3-8B、Qwen3-32B 等 14 个

    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。

    深度解读完整解读
  2. 可解释性arXiv 2607.24645

    研究提出 FEGA 框架分析 SAE 特征干预的 logit 变化几何

    提出 FEGA 框架,分析 SAE 特征消融后的 logit 效应几何

    发表
    测试
    Gemma-2-2B、ReLU SAE、TopK SAE 等 4 个
    摘要FEGA 说明可解释且有因果作用的 SAE 特征,仍常常缺少稳定的单一转向方向。

    Feature-Effect Geometry Analysis(FEGA) 把 SAE 特征的下游干预效应当成 logit 空间中的云来分类,用来区分可复用方向、低维结构和弥散效应。

    深度解读完整解读
  3. 可解释性arXiv 2609.10060

    研究者提出基于参考的隐藏状态相对表示偏见检测方法

    用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变

    发表
    测试
    Gemma 3-4B-IT、Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3
    摘要相对表示上的∆B 在多数微调设置中与三个基准的输出层偏见变化共变。

    Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。

    深度解读完整解读
  4. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    测试
    Gemma-2-9B-IT、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 6 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  5. 可解释性arXiv 2610.00895

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    发表
    测试
    CLIP ViT-L/14、DINOv3 ViT-L/16、ResNet-18 等 8 个
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    深度解读完整解读
  6. 可解释性arXiv 2609.37616

    语言模型中的权威偏差:来源顺从与用户认同并非同一行为

    因果解耦来源依从与用户迎合的内部机制

    发表
    测试
    Gemma-4-26B-A4B、Gemini-3.1-Pro、Qwen3.5-27B 等 8 个

    摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。

    深度解读完整解读
  7. 可解释性arXiv 2609.25518

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    提出 Matryoshka Attribution,把模型输出归因到表示与权重

    发表
    测试
    gemma-2-2b、gpt2-small、Qwen2.5-0.5B 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    深度解读完整解读
  8. 可解释性arXiv 2609.18612

    研究揭示 Transformer 中影响超常的削弱型神经元

    用权重余弦给 GLU 神经元做读写功能分类并检验消融影响

    发表
    测试
    Gemma-2-2B、Gemma-2-9B、OLMo-7B-0424 等 9 个
    摘要GLU 神经元的读写余弦呈现先加强后削弱的层模式,晚期少量 weakening 神经元对输出影响大。

    这篇分析工作用输入权重与输出权重的余弦,给 GLU 神经元的读写功能分类,并检查这些类的层分布、激活频率和对下一 token 分布的影响。

    深度解读完整解读
  9. ObserverBench:用干预与控制任务检验机制可解释性估计

    提出 ObserverBench,比较机制估计精度与动作损失

    发表
    测试
    Gemma-2-9B-it、two-block Transformers、GPT-2-small 等 6 个
    摘要ObserverBench 在固定决策下分开报告估计精度与动作损失,三者可以不一致。

    ObserverBench 评测一个内部观察器是否够格指导某项具体干预、闭环或安全策略,而不是只看平均估计精度。

    深度解读完整解读
  10. 可解释性arXiv 2609.03148

    LLM 如何处理上下文知识冲突:ContextConflict 数据集与机制可解释性分析

    构建 CONTEXT CONFLICT 解释模型如何表征并化解语境知识冲突

    发表
    测试
    gemini-2.5-pro、gpt-5、claude-4.5-sonnet 等 7 个
    摘要CONTEXT CONFLICT 显示模型能内部察觉冲突,却偏向靠前证据。

    CONTEXT CONFLICT 把问题从“参数知识对外部语境”转到“语境内部多来源证据互相冲突”,并同时给出数据、机制分析和一种无训练转向。

    深度解读完整解读
  11. 多语言 LLM 在语义保持结构扰动下的结构敏感性:IndicReStruct 基准与机制可解释性分析

    构建 IndicReStruct,评测保语义结构扰动下的多语言数学推理

    发表
    测试
    Gemma-2-9B-it、Gemma-2-27B-it、Gemma-4-12B-it 等 7 个
    摘要保语义的重排和语态变化会降低印地语与马拉雅拉姆语数学推理准确率,轻量微调未能补上。

    IndicReStruct 用保语义的成分重排和语态变换,检验多语言 LLM 的数学推理是否依赖表层语序。

    深度解读完整解读
  12. 可解释性arXiv 2609.05575

    Capsule Lens:定位并追踪模型表示中的概念几何

    提出 Capsule Lens,用胶囊近似并追踪表示空间的概念几何

    发表
    测试
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-2B 等 6 个
    摘要胶囊闭式拟合概念区域。

    Capsule Lens 用一个可闭式拟合、可跨 checkpoint 比较的胶囊,定位概念在表示空间中的区域并跟踪训练引起的漂移。

    深度解读完整解读
  13. 可解释性arXiv 2609.06020

    动物重识别模型学到了什么?DINOv3 中线性生物概念及其来源

    检验个体身份训练的视觉表示是否线性编码生物概念

    发表
    测试
    DINOv3-Base ViT(预训练)、DINOv3-Base ViT(gorilla Re-ID fine-tuned,triplet-margin loss)
    摘要metric learning 的大猩猩 Re-ID 表示沿 sex、age 形成可转向的线性轴,微调只重排其位置。

    这篇工作检查只做个体匹配的动物 Re-ID 表示里,有没有可审计的生物学结构。。

    深度解读完整解读
  14. 可解释性arXiv 2609.06289

    LLM 激活引导空间能否反映人类价值几何?EMNLP 2026 研究发布 26K 样本基准

    检验激活引导向量的几何是否符合人类价值结构

    发表
    测试
    Gemma-3、Gemma-4、Gemma-4-31B 等 12 个
    摘要分布驱动的 steering 向量更符合 Schwartz 几何,并带来更可预测的跨价值迁移。

    作者研究推理时 activation steering 的向量,是否在几何上符合人类价值理论,而不只是改变单一目标行为。

    深度解读完整解读