DMN:面向多图输入的多模态大模型组合式越狱框架
DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
DMN用分布式指令、多模态证据和数字链,对10个多图MLLM做单轮黑盒越狱,SafeBench平均ASR为89.32%。
单轮black-box:攻击者仅能与支持多图输入的目标MLLM交互一次,不可访问参数、梯度、logits或system prompts。
- 支持多图输入的MLLM大多仍按单图做安全对齐。有害意图分散到多张图像时,安全机制可能无法联合推理整段图像序列。既有越狱主要用单图,难以拆分指令、携带更多信息或加入辅助视觉任务来干扰防护。
- DMN一次提交三类图像:按词拆开的排版指令、辅助LLM与T2I生成的案例证据对,以及随机插入的数字链帧。文本引导模型按帧索引抽取数字并处理证据。实现中证据对与数字链帧各5个,生成失败最多重试5次。
- Table 1中DMN在三个数据集上的10模型平均ASR为89.32%、93.09%和86.24%。既有防御下最低仍有65.20%,作者过滤器降至28.86%。作者称提升来自模块而非增加空白图像。
- 作者指出:只适用于支持多图输入的模型;比单图方法更耗时、token更多,论文未给具体成本;网页上传数有限制,或只能用API;KFAR来自开源模型,未必代表闭源模型。作者计划再探索多图越狱模式与防御。实验覆盖10个目标MLLM和3个数据集。
- 威胁模型
- 单轮black-box:攻击者仅能与支持多图输入的目标MLLM交互一次,不可访问参数、梯度、logits或system prompts。提交文本与图像序列,使模型生成有害回复;成功由准则C(如judge LLM)判为有害。
- 被测模型
- GPT-4VGPT-4oGPT-5o3o4-miniGemini-2.5-flashGemini-2.5-proClaude Sonnet 4Qwen3-VL-plusSeed1.5-VL
- 基准
- SafeBenchHADESMM-SafetyBenchMIR Benchmark
- 指标
- ASRimage generation success rateblock rate
研究者提出组合式越狱框架 DMN,利用分布式指令、多模态证据和数字链任务,针对支持多图输入的多模态大模型发起攻击。论文指出以往多模态越狱方法只用单张图片,无法把有害请求分散到多张图片、承载更丰富信息或借助额外视觉推理任务分散模型注意力。实验显示 DMN 在 GPT-4o、Gemini-2.5-pro 和 Claude Sonnet 4 上攻击成功率超过 90%,大幅超过其他基线,作者认为这揭示了这些模型安全机制中的根本性弱点。该工作已被 ACL 2026 主会接收。
深度解读
这篇论文试图解决什么问题?
多图安全对齐不足,DMN把指令、证据和干扰拆进多图做单轮黑盒越狱。
多图安全对齐不足,有害意图可被拆进多张图像,绕过主要为单图设计的防护。
- 场景:作者称GPT-5、Gemini-2.5-Pro等MLLM已支持单次查询输入多图,效用提高的同时引入新漏洞,因为多模态安全工作大多针对单图。有害意图分散到多图时,安全机制可能无法对完整图像序列做联合推理。
- 现有不足:既有MLLM越狱主要依赖单图,通过排版渲染或与查询相关的图像嵌入恶意意图。作者称单图不能把有害指令分散到多图,限制可携带的信息,也缺少用辅助推理任务干扰安全机制的空间。
- 作者的判断:多图策略可能提高越狱效果;拆开排版文字会加大检出整体有害意图的难度;把生图做成现实案例可降低T2I拒绝并增加回复细节;额外任务可削弱安全机制。
- 本文提出:组合框架DMN,包含分布式指令、多模态证据和数字链任务,并在3个数据集、10个MLLM上评测。
- 威胁模型:
- 目标:绕过内置护栏,诱使模型输出有害或被禁止内容;在数据集上最大化被准则C判为有害的次数。
- 知识:single-turn black box。只能与目标交互一次,不能访问参数、梯度、logits或system prompts。
- 能力:提交文本T与图像序列。图像由攻击流水线生成,包括排版图、T2I视觉证据和数字链帧。
- 受害系统:支持多图输入的MLLM。C(如judge LLM)给出二值标签,有害为1。
有哪些相关研究?
相关工作分扰动类与结构类越狱;作者称多图方法据其所知只有VideoJail。
引言与Related Work把背景分成多模态模型,以及扰动类、结构类越狱;多图方法单独点出VideoJail。
多模态模型
- MLLM结构(Anthropic, 2025; Gemini Team, 2025):图像编码器配语言骨干,经投影或adapter把视觉特征对齐到token空间,用于视觉问答和多模态指令跟随。本文关注支持多图输入的模型,如GPT系列(OpenAI et al., 2024; OpenAI, 2025)。
扰动类越狱
- 梯度对抗图(Qi et al., 2024; Ying et al., 2024; Xu et al., 2025):用开源代理模型的梯度制作对抗图像,以绕过安全对齐。论文称这些方法往往依赖代理模型,在black-box下迁移有限(Schaeffer et al., 2024)。
结构类与干扰
- 视觉化有害意图:论文把这类方法描述为用视觉渲染替代不安全文本(Gong et al., 2025; Yang et al., 2025),或用生成模型做与查询相关的图像(Liu et al., 2024a; Li et al., 2024),并称其借助OCR和视觉定位绕过文本过滤。
- 干扰:Yang et al.(2025)用无关内容干扰MLLM;Xu et al.(2024)、Jiang et al.(2025)用额外内容提高推理复杂度。论文引用它们作为数字链任务的动机。
多图方法与基线
- VideoJail(Hu et al., 2025):作者称据其所知这是仅有的现有多图越狱;形式上是多图,实际把相关图像扩成相关视频,携带大量冗余信息。
- 基线方法为单图FigStep、HADES、QRA、CS-DJ,以及多图VideoJail。基准/数据集为SafeBench(500)、HADES(750)、MM-SafetyBench(1680)。
作者把本文定位为包含三类图像的框架,用来考察更丰富的多模态输入带来的漏洞,而不是只堆叠相似视频帧。
论文如何解决这个问题?
DMN用分布式指令、多模态证据和数字链帧组成一次多图查询。
DMN把一次查询组织成文本提示加三类图像,由总提示说明如何处理各部分。生成写为 y = M(T, I1:m),即回复由文本T与m张图像共同条件化、自回归产生。论文将攻击目标写成式(2):在数据集D上,使准则C尽量多地把回复判为有害。
问题设定
- 交互:single-turn black box,不访问参数、梯度、logits或system prompts。
- 图像划分:分布式指令、多模态证据、数字链帧各对应一部分图像;Figure 4示意三者在序列中的位置。
- 动机:作者认为排版文字、查询相关图像和干扰都可以在多图设置下再加强。
分布式指令
- 形式:FigStep式排版图。每张图顶部一个词,下方是诱导填空的编号空行(Figure 1)。实现上每图只留一个词,以便拆开内容。
- 假设:作者假设拆开后,模型更难检出整体有害意图。与单图指令的对比在第4.3节。
多模态证据
- 流程:辅助LLM从原请求抽出key phrase,生成含多条细节的现实案例文本;再写成适合T2I的场景描述(外观、物体位置、机位);T2I生成与文本成对的视觉证据(Figure 2)。
- 失败重试:记录已用的T2I提示;失败则用带精炼提示的LLM对照失败史重写后再生成。附录A给出各步完整提示词。
- 作者给出的两点:包成案例生成后,生图请求的有害性更不直接,T2I更不容易拒绝;文本加视觉证据提供更多信息,有利于提高回复细节。论文举例称直接的生图请求容易被拒,此处不复述该请求。
数字链任务
- 帧内容:每帧含一个从0–9随机抽取的数字,以及下一帧索引;末帧标明结束。模型按索引抽数字并拼回整条链(Figure 3)。
- 放置:不以固定方式只放在序列末尾,而是随机间隔插入其他图像之间。跳跃顺序随机,且只在数字链帧之间跳。伪代码在附录B。
- 作用:作者将其作为干扰,利用模型按指令指定顺序处理图像序列的能力。
实现与判定
- 参数:辅助LLM为Gemini-2.5-flash,默认可视证据的T2I为GPT Image 1。证据对5对,数字链帧5帧,生图最多重试5次;仍失败则用排版文字占位图。
- 判定:主实验用GPT-4按附录F的提示做有害/无害二分类。ASR是诱出有害回复的请求占该数据集全部请求的比例。
论文做了哪些实验?
Table 1中DMN的10模型平均ASR为89.32%、93.09%和86.24%。
实验设置
- 目标模型:GPT-4V、GPT-4o、GPT-5、o3、o4-mini、Gemini-2.5-flash、Gemini-2.5-pro、Claude Sonnet 4、Qwen3-VL-plus、Seed1.5-VL,共10个,均支持多图输入。
- 数据:SafeBench 500条、HADES 750条、MM-SafetyBench 1680条。过滤器的正常请求测试用MIR Benchmark前200条。
- 基线与攻击侧:SafeBench列为FigStep、CS-DJ;HADES列为HADES方法、VideoJail;MM-SafetyBench列为QRA。辅助LLM为Gemini-2.5-flash(同时是目标之一);默认可视证据用GPT Image 1,生图对比另用Nano Banana。
- 主指标与评审:ASR。主评审是GPT-4的safe/unsafe二值判断(附录F)。附录E另用CLAS(Gemini-2.5-flash打1–5分,仅5分算成功)和Llama-Guard-3-8B。
- 论文未写明:每个条件的重复次数,以及对各目标模型的查询次数。KFAR在Qwen-2.5-VL-7B上取最后一层、首个输出token的注意力。
主结果
下表为Table 1中DMN的ASR(%)。因行数限制,省略GPT-4V、o4-mini、Seed1.5-VL;三者的DMN在SafeBench / HADES / MM-SafetyBench上分别为93.4 / 99.60 / 91.25、88.6 / 88.40 / 80.65、91.8 / 99.20 / 88.45。
表格较宽,可左右滑动
模型 SafeBench HADES MM-SafetyBench GPT-4o 92.8 99.47 90.42 GPT-5 83.2 82.00 82.86 o3 86.2 77.47 82.02 Gemini-2.5-flash 81.0 95.87 80.54 Gemini-2.5-pro 95.2 98.67 93.75 Claude Sonnet 4 94.2 94.53 93.10 Qwen3-VL-plus 86.8 95.73 79.40 10模型平均 89.32 93.09 86.24 - Table 1中,各数据集上DMN的每一格都高于同表基线。10模型平均:SafeBench上FigStep 20.22%、CS-DJ 30.18%、DMN 89.32%;HADES上HADES方法4.53%、VideoJail 8.77%、DMN 93.09%;MM-SafetyBench上QRA 21.30%、DMN 86.24%。
- 作者称多图安全对齐弱于单图。VideoJail相对HADES方法只高一点;作者称帧若只带冗余信息,即使用多图,提升也有限。附录C把同一张图重复1、10、20次,FigStep的ASR为20.22%、20.14%、20.36%,CS-DJ为30.18%、31.74%、31.60%。
- 并非每格都高于90%:SafeBench上Gemini-2.5-flash为81.0%,HADES上o3为77.47%,MM-SafetyBench上Qwen3-VL-plus为79.40%。摘要所写的GPT-4o、Gemini-2.5-pro、Claude Sonnet 4超过90%,与Table 1这三行的三列一致。作者称对小子集的人工查看看到回复有害且列出步骤;论文未给出该子集规模。附录G给出完整示例。
图像生成成功率
- 单次生成(Table 2,关闭重试):GPT Image 1上,DMN在HADES / SafeBench为93.36% / 96.68%,QRA为33.86% / 44.40%,HADES方法为7.60% / 39.80%。Nano Banana上DMN为93.36% / 95.96%,QRA为49.86% / 51.20%,HADES方法为8.40% / 28.80%。作者称包成现实案例后,T2I更可能视为安全。
- 重试(Table 3):GPT Image 1在SafeBench上1次成功95.80%、2–5次3.44%、5次仍失败0.76%;HADES上为89.65%、6.56%、3.79%。Nano Banana在SafeBench上失败0.32%,HADES上失败0.72%。作者称SafeBench上两种T2I的最终成功率超过99%(Failed低于1%);HADES上GPT Image 1的Failed为3.79%,不在这句范围内。
对越狱防御的评测
- 设置:Table 4,SafeBench,ASR为10个MLLM的平均。Self-Reminder、Adashield-S、ECSO改多模态输入;QwenGuard-v1.2-7B在目标前过滤。作者另用GPT-5和附录H的提示做多图过滤器。
- 结果:无防御89.32%,Self-Reminder 72.02%,Adashield-S 65.20%,ECSO 66.18%,QwenGuard 78.46%,作者过滤器28.86%。作者称既有防御只带来中等下降,ASR仍至少高于65%;作者过滤器下降更大。
- 正常请求:MIR Benchmark前200条拦截率2.5%。作者称其中有少量带一些有害性的样本,过滤器仍很少拦截正常请求。论文未给出这些样本的条数。
模块、拆分与干扰
- 模块与张数(Table 5,SafeBench,10模型平均):纯文本7.32%,DI 51.58%,DI+ME 79.40%,DMN 89.32%。补空白图到相同张数后为7.68%、51.74%、80.02%。作者称各模块都有贡献,只加空白图作用不大,增益主要来自模块而非图像张数。
- 拆分(Table 6,同为10模型平均):DI 48.44%对单图指令34.56%;加多模态证据后79.40%对74.82%;再加数字链后89.32%对81.52%。作者称无论单独还是组合,按词拆分都高于整图排版。VideoJail-Pro为46.72%,与DI的48.44%接近;作者称不同切分策略效果相当。Table 5的DI是51.58%,与Table 6不是同一格。
- 干扰任务(Table 7,各插5帧):空白帧索引的PFIR为1、ASR 83.18%;猫/狗帧索引的PFIR为2、ASR 86.92%;数字链PFIR为3、ASR 89.32%。作者推测更复杂的辅助任务更能干扰模型。Figure 6在Qwen-2.5-VL-7B上比较KFAR;作者称数字链中位数最高、空白帧索引最低。正文未给出箱线图的具体分位数值。
其他消融与分析
- 证据对数量(Figure 7,SafeBench,10模型平均):作者称增加证据对会同时提高ASR,以及越狱成功回复的词数。正文未给出各柱数值。
- 数字链位置(Table 8):Random与End的印刷平均为89.32%与85.18%。Claude Sonnet 4为94.2%对79.8%,作者称随机放置使ASR增加14.4%;GPT-4V为93.4%对93.8%,随机放置未提高。作者称是否有效依模型而异。
- 类别(Table 14,SafeBench,10模型平均):Malware Generation与Privacy Violation为98.6%,Health Consultation为72.8%,Legal Opinion 75.0%,Adult Content 77.6%,Financial Advice 84.8%。作者称后四类较低;抽查后认为Adult Content有些请求诱不出有害回复,另三类里有些请求本身不那么有害,因而被判为安全。
- 另两种评审(Table 15平均):SafeBench上Default / CLAS / Llama-Guard为89.32% / 83.80% / 87.90%;HADES为93.09% / 92.83% / 91.97%;MM-SafetyBench为86.24% / 80.76% / 76.76%。作者称换评审后DMN仍然得到高ASR。
- 例外:VideoJail在Claude Sonnet 4、HADES上为0.00%(Table 1)。生图可以失败(Table 3)。作者过滤器把平均ASR降到28.86%,不是0。
有什么可以进一步探索的点?
作者称方法限于多图模型,成本更高,或只能走API,KFAR来自开源模型。
作者指出的局限与后续方向
- 适用模型:应用限于支持多图输入的MLLM(Limitations (1))。
- 成本:比单图越狱需要更多处理时间和输入token,计算成本与费用更高;论文未给出耗时或token数(Limitations (2))。
- 接口:网页界面可上传的图像数有限制,DMN可能只支持基于API的越狱(Limitations (3))。
- 注意力可视化:KFAR分布用开源模型画出,作者称未必能完全代表闭源商业模型(Limitations (4))。
- 后续:作者计划探索其他多图越狱模式,以及多图越狱防御(Conclusion)。
实验覆盖范围
- 攻击对象:Table 1报告10个目标MLLM在SafeBench(500)、HADES(750)、MM-SafetyBench(1680)上的ASR。
- 对照:基线为FigStep、CS-DJ、HADES方法、QRA、VideoJail;Table 1各数据集的基线列不同。附录C还把单图重复为1、10、20张。
- 防御:Table 4含Self-Reminder、Adashield-S、ECSO、QwenGuard和作者用GPT-5实现的过滤器,数字为10模型平均;MIR只报告前200条拦截率。
- 生成与评审:生图模型为GPT Image 1与Nano Banana,辅助LLM为Gemini-2.5-flash。主评审为GPT-4,附录E另有CLAS与Llama-Guard-3-8B。论文未报告重复次数和查询次数。
- 机理:三种辅助任务的PFIR与ASR在Table 7;KFAR只在Qwen-2.5-VL-7B上计算(Figure 6)。
总结一下论文的主要内容
DMN组合拆分指令、案例证据和数字链,在10个MLLM上平均ASR高于同表基线。
DMN是面向支持多图输入的MLLM的单轮black-box越狱框架,针对多图安全对齐较少这一点。
- 问题:单图越狱不能把有害请求拆到多图,也难以同时携带较多证据并加入干扰任务。受害系统一次接受多张图像;攻击者不看参数、梯度、logits或system prompts,只交互一次。
- 方法:分布式指令按词拆排版图;多模态证据由Gemini-2.5-flash写案例,再由T2I生成配对图像,失败则按历史提示精炼,最多5次;数字链帧随机插入序列,模型按索引抽数字。默认各用5对证据和5帧。主判定由GPT-4做有害/无害分类,指标为ASR。
- 主结果:Table 1的10模型平均ASR,SafeBench为89.32%(FigStep 20.22%,CS-DJ 30.18%),HADES为93.09%(VideoJail 8.77%),MM-SafetyBench为86.24%(QRA 21.30%)。GPT-4o、Gemini-2.5-pro、Claude Sonnet 4在这三套数据上的DMN ASR都超过90%。同表最低一格是HADES上的o3,77.47%。
- 防御与消融:Table 4中既有防御的10模型平均ASR最低为Adashield-S的65.20%,作者过滤器为28.86%;MIR前200条拦截率2.5%。Table 5中补空白图后ASR几乎不变,作者称增益来自三个模块。Table 6中按词拆分高于把词放在同一张图。
- 作者结论:作者称实验得到高ASR并超过其他基线,对应着当前MLLM可被组合式多图输入利用的漏洞,并计划继续研究多图越狱模式和防御。文中写出的限制是只适用于多图模型、成本更高、可能只能走API,以及KFAR可视化来自开源模型。