跳到正文
10月8日 · 周四

全部论文

找到 7 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 789 篇还没打标签,不在筛选结果里。

另有 789 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角

    发表
    测试
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B 等 6 个
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链中的信息足迹与不可读性

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  3. 可解释性arXiv 2610.00895

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    发表
    测试
    ResNet-18、CLIP ViT-L/14、PLIP 等 8 个
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    深度解读完整解读
  4. 可解释性arXiv 2609.05575

    Capsule Lens:定位并追踪模型表示中的概念几何

    提出 Capsule Lens,用胶囊近似并追踪表示空间的概念几何

    发表
    测试
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-2B 等 6 个
    摘要胶囊闭式拟合概念区域。

    Capsule Lens 用一个可闭式拟合、可跨 checkpoint 比较的胶囊,定位概念在表示空间中的区域并跟踪训练引起的漂移。

    深度解读完整解读
  5. 可解释性arXiv 2609.06020

    动物重识别模型学到了什么?DINOv3 中线性生物概念及其来源

    检验个体身份训练的视觉表示是否线性编码生物概念

    发表
    测试
    DINOv3-Base ViT(预训练)、DINOv3-Base ViT(gorilla Re-ID fine-tuned,triplet-margin loss)
    摘要metric learning 的大猩猩 Re-ID 表示沿 sex、age 形成可转向的线性轴,微调只重排其位置。

    这篇工作检查只做个体匹配的动物 Re-ID 表示里,有没有可审计的生物学结构。。

    深度解读完整解读
  6. 可解释性arXiv 2609.17152

    ResLRP:残差抵消如何导致 Vision Transformer 归因不稳定

    提出 ResLRP,抑制视觉 Transformer 残差抵消引起的归因不稳定

    发表
    测试
    ViT-B/16、ViT-L/14、ViT-H/14 等 11 个
    摘要ResLRP 用残差 γ 规则限制 ViT 相关性爆炸,VLM 上忠实性与定位提升最大。

    Berend 等人针对 ViT 上 LRP 热图嘈杂、不忠实的问题,把原因放在残差加法而不是注意力规则:前向抵消留下很小的 zout,标准 LRP 用它作分母,放大成不稳定的正负相关性。

    深度解读完整解读
  7. 可解释性arXiv 2608.30480

    VisER:面向 LVLM 物体幻觉检测的视觉证据与视觉依赖双面指标

    提出 VisER,用内部视觉证据检测 LVLM 物体幻觉

    发表
    测试
    LLaVA-1.5-7B、LLaVA-NeXT-7B、InstructBLIP 等 8 个
    摘要VisER 用证据门与图像–前缀比给物体提及打落地分。

    VisER 是面向 LVLM 开放式图像描述的免训练物体级幻觉检测分数,用来处理内部支持的来源混淆。

    深度解读完整解读
已经到底了