跳到正文
原文
论文追踪· arXiv:2511.16110· Yijun Yang, Lichao Wang, Jianping Zhang, Chi Harold Liu, Lanqing Hong, Qiang Xu·本站收录 · 原文发表 精选关注度57

MFA 框架在 17 个视觉语言模型上取得 58.5% 攻击成功率

Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models

论文速读

据论文全文整理(AI 生成),以原文为准

AI 导读香港中文大学、北京理工大学与华为诺亚方舟实验室提出 Multi-Faceted Attack(MFA)框架,系统探测 GPT-4o、Gemini-Pro、LLaMA 4 等带防御视觉语言模型的安全漏洞,在 17 个开源与商用模型上总体攻击成功率为 58.5%。

问题
带有多层防护(对齐微调、system prompt、输入输出内容审核)的 VLM 被宣称具备生产级鲁棒性,但针对真实部署中这些防御叠加的对抗攻击鲁棒性仍缺乏研究,且已有工作多只针对单一模态、忽略内容过滤器,也少有理论解释。
方法
提出 Multi-Faceted Attack(MFA)框架,包含三部分:Attention-Transfer Attack(ATA)把有害指令藏进看似无害的元任务中以竞争注意力,并用 reward hacking 理论解释其成功;面向过滤器的迁移攻击,用多 token 优化和弱监督迁移生成对抗签名以绕过输入/输出审核;以及只扰动视觉编码器的对抗图像,把恶意 system prompt 写入像素空间。
实验与结果
在 17 个开源与商用 VLM 上评估,MFA 总体攻击成功率 58.5%,商用模型上 52.8%,比第二名方法相对高 34%;针对单一视觉编码器优化的对抗图像可迁移到未见过的模型(如 LLaVA-1.6 图像迁移到 9 个模型达 44.3%);ATA 在多个 reward model 上使双答案响应得分高于安全拒绝;过滤器攻击在 7 个内容审核器上平均 ASR 最高(HEHS 80.0%、StrongReject 68.70%)。
局限与可以继续做的
失败主要出现在缺乏推理对比能力的模型上,例如 mPLUG-Owl2 常重复或给出“Yes and No”这类模糊回答,导致攻击受阻;作者称将按负责任披露方式发布相关材料。
AI 导读和推荐理由MFA 由三部分组成:Attention-Transfer Attack 把有害指令藏进看似无害的元任务中,作者以奖励作弊为理论视角解释其为何能绕过对齐训练,并在 Skywork、Tulu、RM-Mistral 三个奖励模型上验证双答案回复得分高于拒答;面向内容审核的迁移攻击利用模型的重复倾向生成对抗后缀,联合规避输入与输出过滤器,在 HEHS 数据集上平均 ASR 达 80.00%;视觉编码器攻击只在像素空间嵌入恶意系统提示,针对 LLaVA-1.6 优化的单张对抗图像迁移到 9 个未见模型上取得 44.3% 成功率。

香港中文大学、北京理工大学与华为诺亚方舟实验室提出 Multi-Faceted Attack(MFA)框架,系统探测 GPT-4o、Gemini-Pro、LLaMA 4 等带防御视觉语言模型的安全漏洞,在 17 个开源与商用模型上总体攻击成功率为 58.5%。MFA 由三部分组成:Attention-Transfer Attack 把有害指令藏进看似无害的元任务中,作者以奖励作弊为理论视角解释其为何能绕过对齐训练,并在 Skywork、Tulu、RM-Mistral 三个奖励模型上验证双答案回复得分高于拒答;面向内容审核的迁移攻击利用模型的重复倾向生成对抗后缀,联合规避输入与输出过滤器,在 HEHS 数据集上平均 ASR 达 80.00%;视觉编码器攻击只在像素空间嵌入恶意系统提示,针对 LLaVA-1.6 优化的单张对抗图像迁移到 9 个未见模型上取得 44.3% 成功率。

推荐理由论文把奖励作弊理论、内容审核绕过和视觉编码器攻击组合成一套框架,并给出跨 17 个模型的成功率对比,可供多模态安全评测参考。

深度解读生成中

阅读原文arxiv.org