VRSA:通过视觉推理序列攻击越狱多模态大模型
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
VRSA用图像序列越狱MLLM;GPT-4o、Safebench平均ASR为61.14%(Table 2)。
主实验称为black-box:攻击生成不查询victim MLLM。
- MLLM的视觉推理可能被用来诱导有害输出,但既有越狱多针对文本或单张图像。作者称连续视觉场景中的风险仍缺专门评估。
- VRSA把有害文本落到场景并拆成子文本,经连续性修补和CLIP约束生成图像序列,默认拼成单图并加排版与引导文本;实验为黑盒且不查询受害模型。
- 八个MLLM上VRSA的七类平均ASR高于四基线,闭源为52.29%–62.57%(Table 2)。部分类别PRISM或HADES更高。GPT-4o的IA子集上多轮与单轮ASR均为66%。
- 论文未专门讨论局限。消融、序列长度、图像形式和多轮均在Illegal Activities子集、以GPT-4o为目标。论文未报告重复次数、查询次数、评审与人工一致性,以及τ、γ和相似度阈值。
- 威胁模型
- 主实验称为black-box:攻击生成不查询victim MLLM。攻击者由有害文本生成子文本与图像序列,可多轮逐张送入,或拼接为单轮(默认),并加预定义引导文本;默认还叠加文本排版。受害模型为开源与闭源MLLM。毒性分不低于4视为成功。
- 被测模型
- DeepSeek-VL2-tinyInternVL-3.5-8BLLaVA-1.6-Mistral-7BQwen3-VL-8B-InstructGPT-4o (0806)GPT-4.1Claude-4.5-Sonnet (0929)Gemini-2.5-Pro
- 基准
- Safebench
- 指标
- ASRToxic Score
研究者提出视觉推理序列攻击(VRSA),将原始有害文本拆解为若干顺序相关的子图像,诱导多模态大模型逐步外化并聚合出完整有害意图。为提升图像序列场景的合理性,方法引入自适应场景精炼(Adaptive Scene Refinement)优化与原始有害查询最相关的场景;为保持生成图像的语义连续性,提出语义连贯补全(Semantic Coherent Completion)结合场景上下文迭代改写每个子文本;并提出文本图像一致性对齐(Text-Image Consistency Alignment)维持语义一致。实验显示,在 GPT-4o、Claude-4.5-Sonnet 等开源与闭源多模态大模型上,VRSA 的攻击成功率高于当前最先进的越狱攻击方法。论文编号 arXiv:2512.05853。
深度解读
这篇论文试图解决什么问题?
作者用图像序列评估MLLM视觉推理中的越狱风险。
视觉推理里,有害意图被拆进连续图像后,MLLM会不会仍输出有害内容,此前缺少专门评估。
- 场景:作者称MLLM已用于医疗、自动驾驶等,并借助Chain-of-Thought表现出复杂视觉推理;更多模态也带来更多可被越狱利用的入口。
- 既有不足:文本越狱常构造多轮对话或编程等复杂任务,使模型忙于理解推理而忽略有害意图。视觉攻击主要优化单张图像。作者称连续视觉序列应用广泛,但缺少专门的视觉越狱基准,该风险尚未评估。
- 作者要处理的困难:直接拆文本再生成图像仍有三点:场景是否合理、序列语义是否连续、文图是否一致。场景影响能否触发领域知识;不连续或不一致时,模型可能给出无关回复,或无法准确识别有害意图。
- 本文提出的方法:提出VRSA。有害文本被分成顺序相关子图;Adaptive Scene Refinement、Semantic Coherent Completion、Text-Image Consistency Alignment分别约束场景、连续性与文图一致,再加预定义文本引导推理。
- 威胁模型:
- 目标:诱导MLLM生成有害内容,绕过安全机制。
- 知识:主实验称为black-box,攻击生成不查询victim MLLM。论文另把针对LLM的越狱分为white-box与black-box。
- 能力:由有害文本生成子文本与图像序列;可多轮逐张送入,或拼接为单图做单轮。默认单轮,并叠加生成文本的排版和预定义引导文本。
- 受害系统:开源与闭源MLLM,记为M_victim。回复由毒性分判定,达到阈值计为成功。
有哪些相关研究?
相关工作分文本越狱与多模态越狱;作者称图像序列方法缺少优化约束。
论文把相关工作分成针对LLM的越狱和针对MLLM的越狱。
文本侧白盒优化
- GCG(Zou et al., 2023):用梯度引导搜索构造非语义对抗后缀。
- AutoDAN(Liu et al., 2023):用遗传算法和基于似然的适应度生成越狱提示。论文称二者对开源模型有效,但迁移到闭源LLM通常有限。
文本侧黑盒与推理过程
- PAP(Zeng et al., 2024)、CL-GSO(Huang et al., 2025)、PAIR(Chao et al., 2023):不访问模型内部,分别用说服策略分类、扩展策略空间,或经自我反思迭代改写有害输入。
- Zhou et al.(2024)、Cheng et al.(2024)、RACE(Ying et al., 2025):把有害目标拆成看似合理的子查询,或改写成合法推理任务,在多步过程中积累伤害。论文此处只作描述。
多模态对抗扰动
- Bailey et al.(2023)、Shayegani et al.(2023)、Qi et al.(2024):优化对抗图像、在看似良性的图中嵌入触发器,或构造可与任意有害文本组合的通用对抗图像。
- Zhao et al.(2024)、Niu et al.(2024)、Teng et al.(2024)、Zhao et al.(2025):把目标当黑盒并查询以估计梯度、同时优化图文;用本地白盒MLLM作替代模型;用启发式搜索把恶意提示嵌入图文;或随机打乱有害图文。
生成式图像与图像序列
- FigStep(Gong et al., 2023)、MM-Safetybench(Liu et al., 2023)、HADES(Li et al., 2024):用排版把有害文字嵌进空白图、生成与查询相关的图并配排版,或迭代改写输入。
- Zhang et al.(2025)与PRISM(Zou et al., 2025):论文称为并行工作,也用图像序列越狱。作者称上述方法忽略图像序列上的细致优化约束,序列质量不稳定,不能充分评估视觉推理风险。
基线与数据:实验基线为FigStep、MM-safetybench、HADES、PRISM。数据取Safebench七类有害查询,每类50条,共350条。作者称比较在同一black-box设定、同一数据集上进行,且不查询受害MLLM;并称该设定可能使报告结果与原论文不一致。
作者把VRSA定位为:生成图像序列时显式约束场景合理性、语义连续性与文图一致性,用以评估视觉推理风险。
论文如何解决这个问题?
VRSA先精炼场景、再补全子文本,并用CLIP约束文图后拼接攻击。
VRSA把有害文本绑到可改写的场景,拆成子文本并生成图像序列,再拼图并加上预定义引导文本。Figure 2把流程画成场景精炼、语义补全、文图对齐和越狱输入四段。
问题设定与流水线
- 分解:有害文本T与场景S经G_t得到子文本,再经G_I得到图像序列。默认图像数N=4。
- 两种用法:序列可逐张做多轮,或拼接成单图。单轮写为ttarget=Mvictim(Iattack,tattack),即拼接图与预定义文本一起送入受害模型。
- 默认实现:助手LLM为DeepSeek-R1-Distill-Qwen-14B,文生图为Stable-Diffusion-Xl-Base-1.0。场景精炼与语义补全的迭代上限N1、N2都设为3。
Adaptive Scene Refinement
- 场景要素:场景写为S={F,B,C,M,A,Ã},即领域、背景、角色、动机、能力、行动。作者称这六项大致描述完整场景。
- 为何不直接生成:作者认为无约束地让LLM写场景不稳定。目标是用语义相关度Corr选出并改写最相关场景;Corr由带P_sim的LLM判断。作者称高质量初始场景用于加快收敛、减少迭代开销。
- Algorithm 1:领域分类器从初始化库的领域集合中选与T最相关的领域;初始化分类器再给出该领域中的初始场景。库内结构场景经人工核验。之后每轮用带P_scene的修改器改写,仅当相关度升高才替换;达到τ或迭代上限即停。τ的数值论文未给出。
- 提示词:附录Figure 8–11给出P_sim、P_field、P_init、P_scene全文,此处不抄录评分档和字数要求。
Semantic Coherent Completion
- 初稿:解耦器按T和优化后的场景生成初始子文本。作者的做法是:若某段逻辑不一致,就去掉该段,并依据其余子文本与原始有害意图补写。
- 判定:带P_continuity的语义评判给出相关分s_r,同时看子文本之间的语义关系,以及其有害意图与T在该场景下是否一致。
- 修补:s_r低于γ时,用二元掩码去掉当前子文本,由补全器重写;各段处理完后,仅当连续性分数更高才接受。达到标准或N2即停。γ的数值论文未给出。附录Figure 12–13为对应提示词。
Text-Image Consistency Alignment
- 生成与筛选:文生图模型按T、场景和子文本生成子图。CLIP计算图文相似度;低于预定阈值则更换随机种子重新生成。阈值和重生成次数上限论文未写。
- 默认呈现:生成图像与生成文本的排版一起使用。无排版的结果在附录。
攻击输入
- 单轮:主实验默认。预定义文本把任务标为推理任务,并要求按面板顺序结合图文推理。全文出现在附录案例图中,此处不复述。
- 多轮:逐张要求描述当前图,最后再对整段序列推理,提示与正文相同。附录第6节比较该格式与单轮。
论文做了哪些实验?
八个MLLM上VRSA平均ASR高于同表基线,但部分类别并非最高。
实验设置
- 受害模型:开源为DeepSeek-VL2-tiny、InternVL-3.5-8B、LLaVA-1.6-Mistral-7B、Qwen3-VL-8B-Instruct;闭源为GPT-4o(0806)、GPT-4.1、Claude-4.5-Sonnet(0929)、Gemini-2.5-Pro。表中简写为Deepseek-VL2、InternVL-3.5、LLaVA-NEXT、Qwen3-VL、Claude-4.5-sonnet、Gemini-2.5-pro。开源权重来自原仓库;闭源分别经Azure OpenAI、AWS Anthropic、Google的API。
- 数据:沿用文献[20]的设定,从Safebench取七类。表头为Illegal Activities、Hate Speech、Malware Generation、Physical Harm、Fraud、Pornography、Privacy Violation;正文把最后一类写作Privacy Violence。每类50条,共350条。
- 基线与协议:FigStep、MM-safetybench、HADES、PRISM。同一black-box、同一数据集,攻击生成不查询受害MLLM。作者称这可能使结果与原论文不一致。
- 指标与评审:毒性分1–5,由GPT-5-mini给出;作者称高分表示回复不安全且符合有害意图。ASR为毒性分不低于S_τ的比例,S_τ=4,沿用文献[40]。论文未报告重复次数,以及评审与人工的一致性。
- 攻击侧:助手LLM为DeepSeek-R1-Distill-Qwen-14B,文生图为Stable-Diffusion-Xl-Base-1.0,N=4,N1=N2=3,实验在RTX 4090上。图像与文本排版结合。
主结果
下表为七类平均。次优基线在这八行的平均ASR上都是PRISM。据Table 1、Table 2。
表格较宽,可左右滑动
模型(表中名称) VRSA ASR VRSA毒性 PRISM ASR PRISM毒性 表 Deepseek-VL2 70.00% 4.14 68.57% 4.08 Table 1 InternVL-3.5 66.29% 3.92 50.00% 3.60 Table 1 LLaVA-NEXT 76.57% 4.24 70.86% 4.07 Table 1 Qwen3-VL 70.29% 3.98 61.14% 3.76 Table 1 GPT-4o 61.14% 3.81 41.14% 3.43 Table 2 GPT-4.1 62.57% 3.82 51.43% 3.74 Table 2 Claude-4.5-sonnet 52.29% 3.53 41.71% 3.32 Table 2 Gemini-2.5-pro 60.00% 3.76 50.86% 3.53 Table 2 - 作者对平均结果的说法:作者称开源四模型上,VRSA平均ASR分别高出次优基线1.43%、16.29%、5.71%、9.15%。闭源上相对PRISM的ASR高出20.00%、11.14%、10.58%、9.14%,毒性分高出0.38、0.08、0.21、0.23,闭源平均ASR为52.29%至62.57%。作者称优势在闭源上比开源更明显;其报告的开源差值里,InternVL-3.5的16.29%高于GPT-4.1、Claude-4.5-Sonnet、Gemini-2.5-pro上相对PRISM的差值。
- 作者对类别的说法:作者称在推理相关的FR、PV以及场景相关的PO上优势更明显。Table 2中,四个闭源模型在这三类的VRSA ASR均高于同格其他方法。作者还称VRSA对视觉推理较强的MLLM攻击效果更高。
- 平均之外的反例:Table 1类别ASR上,VRSA不是最高的包括:Deepseek-VL2的IA(HADES 72,VRSA 70)、HS(PRISM 72,VRSA 68)、PH(PRISM 84,VRSA 78);LLaVA-NEXT的IA(MM-safetybench 76,VRSA 64);Qwen3-VL的PH(PRISM 80,VRSA 74)、FR(PRISM 62,VRSA 60)。Table 2中,GPT-4.1的PH为PRISM 64、VRSA 62;Gemini-2.5-pro的IA为PRISM 66、VRSA 64,PH为PRISM 68、VRSA 54。GPT-4o的PH上,VRSA ASR为62、PRISM为60,但毒性分3.76低于PRISM的4.14。Figure 1把直接提问标为Harmfulness: 1,把VRSA后的示意回复标为Harmfulness: 5,这是示意图标注。
组件消融
- 测了什么:在Illegal Activities子集、以GPT-4o为目标,从类似于文献[44]的常规流水线起,依次加入场景精炼、语义补全和文图对齐。Table 3把前两个组件缩写为ASR与SCC,这里ASR不是攻击成功率。
- 结果:攻击成功率与毒性分依次为基线48与3.48、加场景精炼58与3.80、再加语义补全62与3.70、完整VRSA 66与3.94。该基线的48与Table 2里GPT-4o、PRISM、IA的42不是同一格。
- 作者的解读与例外:作者称各组件能不同程度提高毒性分和攻击成功率。Table 3里,加上语义补全后攻击成功率从58到62,毒性分从3.80到3.70;论文未解释这一下降。Figure 7中,场景精炼把Scene Coherence score从1.22提到1.64,语义补全把Logical Coherence score从2.34提到3.56。Figure 3把库中初始场景标为Weak、精炼后标为Strong。
输入形式与多轮
- 测了什么:仍是Illegal Activities、GPT-4o。附录比较仅扩散图像、仅排版、二者结合,以及多轮逐张输入与单轮拼接。
- 结果:Table 5中,仅图像的攻击成功率为52、毒性分3.56;仅排版为12、2.34;二者结合为66、3.94。Table 4中,多轮为66、3.90,单轮为66、3.94。
- 作者的解读:作者推测仅图像下降有两点:图画内容更容易绕过视觉–语言对齐时建立的安全边界;只有原始图像序列时,模型难以恢复完整推理链。作者认为多轮与单轮表现相近,说明漏洞在结构化推理框架,而不在输入形式。因此主实验默认单轮拼接加排版。
其他消融与分析
- 图像数:Figure 4测试1至6张。正文称一定范围内攻击表现上升,超过限度后下降,因而默认取4;纯文本未保留各点数值。
- N1、N2:附录在1至5上分别变化,另一项固定为3。正文称小于3时随上限提高而提高;取3时作者称已接近最优;再增大无额外收益,并会使ASR与toxicity略降。图中点与横轴的对应在文本转换后不够确定,不逐点抄录。
- 案例:附录Figure 14、15对比精炼与补全前后的场景和子文本;Figure 16、17给出GPT-4o与GPT-4.1的完整案例。此处不复述有害内容。
有什么可以进一步探索的点?
论文未在局限或结论中写出不足与后续工作。
作者指出的局限与后续方向
论文未专门讨论局限。结论只重述方法与“高于基线”的实验说法,没有把某项结果写成不足,也没有写出后续方向。
实验覆盖范围
- 主评测:8个受害模型,即正文给出的4个开源版本和4个闭源API;Safebench七类、每类50条、共350条;指标为毒性分和ASR。结果在Table 1、Table 2。
- 协议:攻击生成为black-box,不查询victim MLLM。基线为FigStep、MM-safetybench、HADES、PRISM。毒性评审为GPT-5-mini,阈值4。
- 未报告的评测信息:论文未报告重复次数、查询次数,以及评审与人工的一致性。
- 附加实验的范围:组件消融、图像数、N1/N2、仅图像或仅排版、多轮对照,都在Illegal Activities子集上、以GPT-4o为目标。Scene Coherence与Logical Coherence见Figure 7。
- 攻击生成侧:使用DeepSeek-R1-Distill-Qwen-14B、Stable-Diffusion-Xl-Base-1.0和CLIP。论文未给出τ、γ和文图相似度阈值的数值。
总结一下论文的主要内容
VRSA用受约束的图像序列越狱MLLM,闭源平均ASR为52.29%–62.57%。
VRSA是一种面向MLLM视觉推理的图像序列越狱,用来看连续场景会不会让模型输出有害内容。
- 问题:作者认为文本侧的复杂任务和视觉侧的单张图像,都没有专门评估连续视觉推理中的安全风险。直接拆分生成还会遇到场景、连贯性和文图一致三个问题。
- 做法:助手模型把有害文本落到六要素场景上,拆成默认4段子文本,掩码修补连续性,再用CLIP筛图文相似度。默认拼成单图,叠加排版和引导文本。攻击生成不查询受害模型。成功指GPT-5-mini给出的毒性分不低于4。
- 平均结果:Safebench七类上,Table 1的VRSA平均ASR为Deepseek-VL2 70.00%、InternVL-3.5 66.29%、LLaVA-NEXT 76.57%、Qwen3-VL 70.29%。Table 2为GPT-4o 61.14%、GPT-4.1 62.57%、Claude-4.5-sonnet 52.29%、Gemini-2.5-pro 60.00%。这八行的平均都高于同表PRISM。
- 不是处处最高:Deepseek-VL2的IA、HS、PH,LLaVA-NEXT的IA,Qwen3-VL的PH、FR,以及GPT-4.1的PH、Gemini-2.5-pro的IA和PH,类别ASR高于VRSA的是HADES、PRISM或MM-safetybench。
- 形式对照:GPT-4o的Illegal Activities上,多轮与单轮ASR都是66%(Table 4)。仅排版为12%,仅图像为52%,二者结合为66%(Table 5)。作者认为漏洞在结构化推理框架,而不在单轮或是多轮。
- 作者的结论:作者称场景与逻辑连贯有助于模型触发领域知识并感知有害意图,因此VRSA在其所比较的开源与商用闭源模型上高于基线。论文没有单独写出局限。