跳到正文
10月9日 · 周五

全部论文

找到 7 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 648 篇还没打标签,不在筛选结果里。

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.00895

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    发表
    测试
    CLIP ViT-L/14、DINOv3 ViT-L/16、ResNet-18 等 8 个
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    深度解读完整解读
  2. 可解释性arXiv 2609.35020

    论文检验线性表示假设:视觉 SAE 的可解释性有多高

    检验视觉 SAE 的可解释性,对照人类判断比较 AIS 与标准指标

    发表
    测试
    ViT、Gemma 3、Gemma 4 等 9 个
    摘要视觉 SAE 重构很好,但 AIS、MS 与字典指标互不对齐,单一代理不足以核验 LRH。

    这篇工作把 NLP 的 AIS 改到视觉 SAE,用来检查 LRH 的结构代理是否等于人类可解释性。。

    深度解读完整解读
  3. 可解释性arXiv 2609.05575

    Capsule Lens:定位并追踪模型表示中的概念几何

    提出 Capsule Lens,用胶囊近似并追踪表示空间的概念几何

    发表
    测试
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-2B 等 6 个
    摘要胶囊闭式拟合概念区域。

    Capsule Lens 用一个可闭式拟合、可跨 checkpoint 比较的胶囊,定位概念在表示空间中的区域并跟踪训练引起的漂移。

    深度解读完整解读
  4. 可解释性arXiv 2609.06020

    动物重识别模型学到了什么?DINOv3 中线性生物概念及其来源

    检验个体身份训练的视觉表示是否线性编码生物概念

    发表
    测试
    DINOv3-Base ViT(预训练)、DINOv3-Base ViT(gorilla Re-ID fine-tuned,triplet-margin loss)
    摘要metric learning 的大猩猩 Re-ID 表示沿 sex、age 形成可转向的线性轴,微调只重排其位置。

    这篇工作检查只做个体匹配的动物 Re-ID 表示里,有没有可审计的生物学结构。。

    深度解读完整解读
  5. 可解释性arXiv 2609.09575

    MonoTM:用可解释单义特征做主题建模,超越关键词表示

    提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述

    发表
    测试
    Gemma-3-27B-IT、Gemma-3-12B-IT、llama-embed-nemotron-8b
    摘要MonoTM 分开估计混合与解释主题,三套基准上二者偏好的 SAE 配置不同。

    MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。

    深度解读完整解读
  6. 可解释性arXiv 2609.17152

    ResLRP:残差抵消如何导致 Vision Transformer 归因不稳定

    提出 ResLRP,抑制视觉 Transformer 残差抵消引起的归因不稳定

    发表
    测试
    ViT-B/16、ViT-L/14、ViT-H/14 等 11 个
    摘要ResLRP 用残差 γ 规则限制 ViT 相关性爆炸,VLM 上忠实性与定位提升最大。

    Berend 等人针对 ViT 上 LRP 热图嘈杂、不忠实的问题,把原因放在残差加法而不是注意力规则:前向抵消留下很小的 zout,标准 LRP 用它作分母,放大成不稳定的正负相关性。

    深度解读完整解读
已经到底了