全部论文
另有 452 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2603.13847
SWhisper 用近超声隐蔽声学通道对语音驱动 LLM 实现黑盒越狱
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
- arXiv
- 2603.13847
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2604.14604
AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
- arXiv
- 2604.14604
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 攻击arXiv 2610.09240
WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
- arXiv
- 2610.09240
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
- 评测与基准arXiv 2610.06898
DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
- arXiv
- 2610.06898
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
- 评测与基准arXiv 2609.38948
DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
- arXiv
- 2609.38948
- 发表
- 层
- 应用层
- 组件视觉
摘要仅 Astra 第二次跑完低速锥桶路线。
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
- 防御arXiv 2603.01544
RA-Det:利用鲁棒性不对称检测 AI 生成图像
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
- arXiv
- 2603.01544
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要RA-Det 把扰动下特征漂移差变成检测信号,平均 ACC 高于表中通用检测器,但不是每行最高。
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
- 防御arXiv 2610.05870
MBZUAI 提出可校准的真实图像认证方法
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
- arXiv
- 2610.05870
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 白盒
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
- 评测与基准arXiv 2610.03938
论文发现多模态模型启用工具后拒答失败率最高上升 68.7%
评测启用工具调用后多模态模型拒答有害图文请求的变化
- arXiv
- 2610.03938
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
- 攻击arXiv 2610.01871
研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
- arXiv
- 2610.01871
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 评测与基准arXiv 2609.09404
MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测
用 MMPIBench 评测智能体框架的多模态提示注入
- arXiv
- 2609.09404
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
- 分析与理论arXiv 2608.06270
研究用因果审计揭示多模态模型视觉工具调用的假象
用因果审计检验视觉工具观察是否真正改变答案
- arXiv
- 2608.06270
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 组件视觉
摘要聚合增益集中在 Calibrated 少数轨迹,作者称之为视觉工具使用的错觉。
对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。
- 评测与基准arXiv 2609.05535
Mind2Web-Injection:面向网页 Agent 视觉提示注入护栏的证据对齐评测
提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐
- arXiv
- 2609.05535
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要作者称检测、定位和反事实响应在六个 VLM 上可分开。
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
- 防御arXiv 2610.01184
ReCast:在固定媒体接口下保护多模态推理的隐私框架
提出 RECAST,本地改写图表与语音并做可逆数值映射以保护远程推理隐私
- arXiv
- 2610.01184
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 组件视觉
- 攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击arXiv 2608.10393
DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型
提出 DURA,沿扩散潜空间生成自然对抗补丁,把机器人动作导向指定目标
- arXiv
- 2608.10393
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。