全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 分析与理论arXiv 2610.09517
审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
- arXiv
- 2610.09517
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 组件视觉
摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
- 攻击arXiv 2610.09240
WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
- arXiv
- 2610.09240
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
- 攻击arXiv 2610.09027
P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- arXiv
- 2610.09027
- 发表
- 场景
- 模型与 API
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
- 防御arXiv 2610.07774收录
研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。
- arXiv
- 2610.07774
- 收录
- 层
- 模型层
- 场景
- 模型与 API
摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。
作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。
- 评测与基准arXiv 2610.06898
DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
- arXiv
- 2610.06898
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
- 评测与基准arXiv 2609.38948
DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
- arXiv
- 2609.38948
- 发表
- 层
- 应用层
- 组件视觉
摘要仅 Astra 第二次跑完低速锥桶路线。
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
- 其他arXiv 2609.39518
研究:视觉语言模型在协作任务中很少主动表达指代不确定性
研究视觉语言模型在协作中能否表示并说出指称不确定性
- arXiv
- 2609.39518
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要指称不确定性可被引出,但很少说出来。
- 攻击arXiv 2610.05453
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
摘要IDU 同时做单步蒸馏和数据遗忘,在 MNIST 与 CIFAR-10 上压低遗忘类生成率。
IDU 面向无条件 flow 与 score-based 教师,在蒸馏成单步生成器的同时做数据遗忘。
- 可解释性arXiv 2610.04112收录
Spatial-SAE:用空间依赖先验改进视觉概念分解
提出 Spatial-SAE,用空间依赖先验改进视觉概念分解
- arXiv
- 2610.04112
- 收录
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要Spatial-SAE 用空间 Markov 先验替换 patch 独立先验,换取更对齐的视觉概念。
Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。
- 防御arXiv 2610.05637
研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
- arXiv
- 2610.05637
- 发表
- 场景
- 模型与 API
摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
- 评测与基准arXiv 2610.03938
论文发现多模态模型启用工具后拒答失败率最高上升 68.7%
评测启用工具调用后多模态模型拒答有害图文请求的变化
- arXiv
- 2610.03938
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
- 其他arXiv 2610.03389
Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
- arXiv
- 2610.03389
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要P2P 用深度上的激活修补旁路视觉投影,以可调容忍度交换准确率与计算量。
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。
- 评测与基准arXiv 2609.09404
MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测
用 MMPIBench 评测智能体框架的多模态提示注入
- arXiv
- 2609.09404
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
- 评测与基准arXiv 2608.11816
研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
- arXiv
- 2608.11816
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
- 防御arXiv 2607.24017
多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法
提出 SPAR 以分离注意力结构偏置并重分配视觉注意力,减轻多模态幻觉
- arXiv
- 2607.24017
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。
SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。