跳到正文
10月9日 · 周五

全部论文

找到 47 篇

另有 602 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2608.21766

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    发表
    测试
    Gemma4-31B、Nemotron3-49B、Qwen3-8B 等 14 个

    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。

    深度解读完整解读
  2. 可解释性arXiv 2607.24645

    研究提出 FEGA 框架分析 SAE 特征干预的 logit 变化几何

    提出 FEGA 框架,分析 SAE 特征消融后的 logit 效应几何

    发表
    测试
    Gemma-2-2B、ReLU SAE、TopK SAE 等 4 个
    摘要FEGA 说明可解释且有因果作用的 SAE 特征,仍常常缺少稳定的单一转向方向。

    Feature-Effect Geometry Analysis(FEGA) 把 SAE 特征的下游干预效应当成 logit 空间中的云来分类,用来区分可复用方向、低维结构和弥散效应。

    深度解读完整解读
  3. 可解释性arXiv 2609.10060

    研究者提出基于参考的隐藏状态相对表示偏见检测方法

    用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变

    发表
    测试
    Gemma 3-4B-IT、Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3
    摘要相对表示上的∆B 在多数微调设置中与三个基准的输出层偏见变化共变。

    Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。

    深度解读完整解读
  4. 可解释性arXiv 2610.00895

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    发表
    测试
    CLIP ViT-L/14、DINOv3 ViT-L/16、ResNet-18 等 8 个
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    深度解读完整解读
  5. 可解释性arXiv 2609.38389

    研究揭示多轮攻击中危害性表征的几何演化

    分析多轮攻击中有害性与拒答表征的几何演化

    发表
    测试
    Gemma-2-9B-it、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct
    摘要多轮中 harmfulness 渐可分且与 refusal 弱对齐,单轮静态探针可能因此变差。

    作者刻画多轮攻击里 harmfulness 与 refusal 相关表示如何随对话变化,而不提出新的攻击或防御。

    深度解读完整解读
  6. 可解释性arXiv 2609.37616

    语言模型中的权威偏差:来源顺从与用户认同并非同一行为

    因果解耦来源依从与用户迎合的内部机制

    发表
    测试
    Gemma-4-26B-A4B、Gemini-3.1-Pro、Qwen3.5-27B 等 8 个

    摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。

    深度解读完整解读
  7. 可解释性arXiv 2609.24379

    TopoLoss 训练让 ViT 因果回路更集中,但未提升神经元单义性

    审计 TopoLoss 训练对因果回路集中度与神经元单义性的影响

    发表
    测试
    ViT-S/16、TinyViT (4 layers, d=128, 4 heads)
    摘要TopoLoss 把 ViT-S 的因果权重集中到空间簇,但不改变神经元 Mu。

    这是对既有训练损失 TopoLoss 的机制可解释性审计,不是新的事后分解器。

    深度解读完整解读
  8. 可解释性arXiv 2609.25518

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    提出 Matryoshka Attribution,把模型输出归因到表示与权重

    发表
    测试
    gemma-2-2b、gpt2-small、Qwen2.5-0.5B 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    深度解读完整解读
  9. 可解释性arXiv 2609.29781

    研究检验幻觉神经元是否存在:稀疏探针定位并不唯一

    提出五步诊断协议,检验幻觉神经元定位是否唯一

    发表
    测试
    Gemma 3 4B、MedGemma 4B
    摘要检测和群体因果效应成立,但稀疏选择来自相关簇,不是唯一定位。

    这项工作用诊断协议复查 H-Neurons 的定位主张。问题是:L1 探针在相关激活上可以选出能预测幻觉的少量神经元,但这不等于这些神经元唯一编码该行为。

    深度解读完整解读
  10. 可解释性arXiv 2609.35020

    论文检验线性表示假设:视觉 SAE 的可解释性有多高

    检验视觉 SAE 的可解释性,对照人类判断比较 AIS 与标准指标

    发表
    测试
    ViT、Gemma 3、Gemma 4 等 9 个
    摘要视觉 SAE 重构很好,但 AIS、MS 与字典指标互不对齐,单一代理不足以核验 LRH。

    这篇工作把 NLP 的 AIS 改到视觉 SAE,用来检查 LRH 的结构代理是否等于人类可解释性。。

    深度解读完整解读
  11. 可解释性arXiv 2609.35351

    概念提取中的干扰不止取决于几何结构:稀疏自编码器研究提出有效干扰

    提出 effective interference,分析 SAE 架构如何塑造已实现特征干扰

    发表
    测试
    gemma-2-2b、Pythia-160M-deduped
    摘要干扰取决于几何、使用方式与产生 code 的架构。

    Costa 与 Tolooshams 把概念提取中的干扰从纯几何改写成几何与 code 统计的联合量,并说明 SAE 架构决定这些交互被抵消还是被保留。。

    深度解读完整解读
  12. 可解释性arXiv 2609.35367

    DAFI:面向 SAE 特征双端解释的智能体方法

    提出 DAFI,把 SAE 特征解释为输入、输出与功能三元组

    发表
    场景
    AI Agent
    测试
    Gemma-2-2B、Gemma-2-9B、Qwen3-1.7B-Base 等 6 个
    摘要DAFI 用三项假设和可迁移技能解释 SAE 特征,并发现多数可靠端点语义并不等价。

    DAFI 把单个 SAE 特征解释成输入激活语义、干预输出偏向,以及二者之间的功能映射,并由智能体按分项诊断修订。

    深度解读完整解读
  13. 可解释性arXiv 2609.35599

    大语言模型激活值中的语义搜索特征:J-lens 揭示 LLM 的探索与利用机制

    用 J-lens 与残差流转向分析语义流畅性中的探索与利用表征

    发表
    测试
    Gemma-2-9B、Gemma-2-2B、Llama-3.1-8B 等 5 个
    摘要五个模型的 SFT 中,探索与利用有可检测、部分可转向的残差流特征。

    这篇工作用机制可解释性方法,考察开源 LLM 做动物语义流畅性时,聚类(利用)和切换(探索)是否对应不同内部状态。五个指令微调模型(Gemma-2-9B/2B、Llama-3.1-8B、Llama-3.2-3B、Qwen2.5-7B)按固定提示列出动物。切换定义为相邻概念没有共同的扩展 Troyer 类别。

    深度解读完整解读
  14. 可解释性arXiv 2609.18612

    研究揭示 Transformer 中影响超常的削弱型神经元

    用权重余弦给 GLU 神经元做读写功能分类并检验消融影响

    发表
    测试
    Gemma-2-2B、Gemma-2-9B、OLMo-7B-0424 等 9 个
    摘要GLU 神经元的读写余弦呈现先加强后削弱的层模式,晚期少量 weakening 神经元对输出影响大。

    这篇分析工作用输入权重与输出权重的余弦,给 GLU 神经元的读写功能分类,并检查这些类的层分布、激活频率和对下一 token 分布的影响。

    深度解读完整解读