跳到正文
10月10日 · 周六

全部论文

找到 40 篇

另有 378 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  2. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知

    发表
    被测模型
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  3. 防御arXiv 2610.07774

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    AI 导读研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。

    发表
    被测模型
    Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
    摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。

    作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。

    深度解读完整解读
  4. 其他arXiv 2610.06452

    研究者提出多模态安全评测应衡量可控性而非仅做分类

    主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像

    发表
    被测模型
    LlavaGuard-v1.2-7B-OV、Qwen3.5-9B
    摘要四轴画像把读出与选择性控制分开。

    作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。

    深度解读完整解读
  5. 防御arXiv 2610.05637

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    发表
    被测模型
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    深度解读完整解读
  6. 其他arXiv 2610.04792

    多模态一定更好吗?缺失模态鲁棒性的几何视角与 Geodesic Unlearning 方法

    提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性

    发表
    被测模型
    RoBERTa、ResNet50、Qwen2.5-3B 等 6 个
    摘要GU 用测地线子空间编辑应对部署时缺模态下降,并尽量保住全模态精度。

    这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。

    深度解读完整解读
  7. 防御arXiv 2610.04616

    PerturBot 用扰动训练打破视觉-语言-动作模型的模态捷径

    提出 Perturbot 扰动训练,打破 VLA 的模态捷径

    发表
    被测模型
    π0.5
    摘要Perturbot 改训练数据以削弱三类模态捷径,GroundFscore 用来看成功是否来自任务证据。

    Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。

    深度解读完整解读
  8. 可解释性arXiv 2610.04112

    Spatial-SAE:用空间依赖先验改进视觉概念分解

    提出 Spatial-SAE,用空间依赖先验改进视觉概念分解

    发表
    摘要Spatial-SAE 用空间 Markov 先验替换 patch 独立先验,换取更对齐的视觉概念。

    Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。

    深度解读完整解读
  9. 其他arXiv 2610.03389

    Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算

    提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算

    发表
    被测模型
    Qwen2.5-VL-3B-Instruct、Qwen2.5-VL-7B-Instruct、LLaVA-v1.6-Vicuna-7B-HF 等 4 个
    摘要P2P 用深度上的激活修补旁路视觉投影,以可调容忍度交换准确率与计算量。

    P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。

    深度解读完整解读
  10. 防御arXiv 2610.01800

    LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法

    提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型

    发表
    摘要LineupRL 用统计近邻上的序列识别做可验证奖励,3B 描述器超过 SFT、两种 RL 奖励和 72B 教师。

    LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。

    深度解读完整解读
  11. 可解释性arXiv 2610.00895

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    发表
    被测模型
    ResNet-18、DINOv3 ViT-L/16
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    深度解读完整解读
  12. 评测与基准arXiv 2609.39473

    FAME:用反事实推理评测自主智能体的虚假记忆

    提出 FAME,用反事实概念漂移评测智能体虚假记忆

    发表
    被测模型
    Llama-3B
    摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。

    FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。

    深度解读完整解读
  13. 风险行为arXiv 2609.38971

    研究测量并预测具身 VLM 规划器中任务的拒答可变性

    测量并预测具身 VLM 规划器的任务拒答可变性

    发表
    被测模型
    gemini-robotics-er-2-preview、gemini-robotics-er-1.6-preview
    摘要日常物体能翻转一部分已给出的拒答,可翻转程度取决于任务且可被本地代理预测。

    作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。

    深度解读完整解读
  14. 防御arXiv 2609.37837

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用

    发表
    被测模型
    Qwen3-VL-4B-Instruct、LLaVA-1.5-7B
    摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。

    深度解读完整解读
  15. 防御arXiv 2609.37568

    SECRET:用源条件化中继引导缓解音视频大语言模型的幻觉

    提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉

    发表
    被测模型
    VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B
    摘要SECRET 在问题状态上做源条件转向,三个 AVLLM 上减轻了跨模态接地幻觉。

    SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。

    深度解读完整解读
  16. 风险行为arXiv 2609.35291

    窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型

    证明无显式危害的图文窄微调可诱发跨任务涌现未对齐

    发表
    被测模型
    GPT-4o、GPT-4.1、Gemini 2.5 等 15 个
    摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。

    论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。

    深度解读完整解读
  17. 可解释性arXiv 2609.35020

    论文检验线性表示假设:视觉 SAE 的可解释性有多高

    检验视觉 SAE 的可解释性,对照人类判断比较 AIS 与标准指标

    发表
    被测模型
    Vanilla SAE、TopK SAE、MP-SAE
    摘要视觉 SAE 重构很好,但 AIS、MS 与字典指标互不对齐,单一代理不足以核验 LRH。

    这篇工作把 NLP 的 AIS 改到视觉 SAE,用来检查 LRH 的结构代理是否等于人类可解释性。。

    深度解读完整解读