跳到正文
10月8日 · 周四

可解释性 · 论文

找到 8 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 106 篇还没打标签,不在筛选结果里。

另有 106 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.01864

    从孤立特征到轨道:通过多重 SAE 对齐发现音乐概念

    提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道

    发表
    测试
    MuQ、MusicFM
    摘要用移调对齐的多 SAE 恢复和弦、调与旋律轨道,并用少量锚点做下游音乐理解。

    作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。

    深度解读完整解读
  2. 可解释性arXiv 2610.00895

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    发表
    测试
    ResNet-18、CLIP ViT-L/14、PLIP 等 8 个
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    深度解读完整解读
  3. 防御arXiv 2609.03629

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    提出 EraseSAE,在文生视频模型中局部擦除指定概念

    发表
    测试
    CogVideoX-5B、HunyuanVideo、Flux.1 [dev]
    摘要EraseSAE 用单义特征局部擦除。

    EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。

    深度解读完整解读
  4. 可解释性arXiv 2609.05575

    Capsule Lens:定位并追踪模型表示中的概念几何

    提出 Capsule Lens,用胶囊近似并追踪表示空间的概念几何

    发表
    测试
    CLIP ViT-B/32、CLIP ViT-L/14、LLaVA-1.5-7B 等 6 个
    摘要胶囊闭式拟合概念区域。

    Capsule Lens 用一个可闭式拟合、可跨 checkpoint 比较的胶囊,定位概念在表示空间中的区域并跟踪训练引起的漂移。

    深度解读完整解读
  5. 可解释性arXiv 2609.06020

    动物重识别模型学到了什么?DINOv3 中线性生物概念及其来源

    检验个体身份训练的视觉表示是否线性编码生物概念

    发表
    测试
    DINOv3-Base ViT(预训练)、DINOv3-Base ViT(gorilla Re-ID fine-tuned,triplet-margin loss)
    摘要metric learning 的大猩猩 Re-ID 表示沿 sex、age 形成可转向的线性轴,微调只重排其位置。

    这篇工作检查只做个体匹配的动物 Re-ID 表示里,有没有可审计的生物学结构。。

    深度解读完整解读
  6. 可解释性arXiv 2609.09909

    解读文本到图像扩散模型中的对象依赖概念脆弱性

    用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值

    发表
    测试
    PixArt-Alpha、SD 1.5、SD 3.5 等 5 个
    摘要逐步 SAE 诊断物体依赖的概念脆性,早期向类原型插值可在五骨干上提高风格与属性指标。

    作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。

    深度解读完整解读
  7. 可解释性arXiv 2609.17152

    ResLRP:残差抵消如何导致 Vision Transformer 归因不稳定

    提出 ResLRP,抑制视觉 Transformer 残差抵消引起的归因不稳定

    发表
    测试
    ViT-B/16、ViT-L/14、ViT-H/14 等 11 个
    摘要ResLRP 用残差 γ 规则限制 ViT 相关性爆炸,VLM 上忠实性与定位提升最大。

    Berend 等人针对 ViT 上 LRP 热图嘈杂、不忠实的问题,把原因放在残差加法而不是注意力规则:前向抵消留下很小的 zout,标准 LRP 用它作分母,放大成不稳定的正负相关性。

    深度解读完整解读
已经到底了