研究者提出利用重构与隐藏权衡的多模态大模型越狱方法
Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs
作者在HADES上以删字变体隐藏有害意图,Kimi K2.5的TTV-GDI ASRHB为99.73%(Table 3)。
black-box。攻击者从有害文本查询xt出发,构造文本与图像输入,可选辅助图像集D,不访问受害MLLM的内部参数。
- 意图混淆越狱要把有害查询藏进多模态输入,又必须让受害MLLM重建原请求。作者称现有黑盒变换难以兼顾二者,API部署下该问题更贴近实际。
- 从有害查询随机删字得到候选,用CLIP贪心保留与有害关键词对齐低、且相对原查询彼此多样的变体。五种策略把变体分到文本或字体图像,GDI再加入辅助模型与Stable Diffusion 3生成的关键词相关干扰图。
- HADES上5次取最大时,Kimi K2.5的TTV-GDI ASRHB为99.73%(Table 3);Claude Haiku 4.5的TTV ASRGPT为39.73%(Table 2)。作者称删字比例与ASR呈倒U形(Fig. 3)。
- 结论写明评测只用HADES,关键词程序固定为单个词;后续可考察更广伤害类别、查询分布和多关键词或短语,以及面向重建的安全对齐。实验使用5个闭源与14个开源MLLM,评审为HarmBench和GPT-5.4-mini,随机方法每查询5次。
- 威胁模型
- black-box。攻击者从有害文本查询xt出发,构造文本与图像输入,可选辅助图像集D,不访问受害MLLM的内部参数。目标是避开安全过滤,同时保留可重建原请求的信息,使响应落在拒绝、无关或无害集合Rr之外。实验使用HADES提供的单个有害关键词。成功与否由评审模型判定。
- 被测模型
- GPT-5.4-nanoGPT-5.4-miniGemini-2.5-FlashGemini-3.1-Flash-LiteClaude Haiku 4.5Kimi K2.5Llama-4-MaverickLlama-3.2-11B-Vision-InstructInternVL3-8BQwen3-VL-8B-InstructInternVL3.5-2BInternVL3.5-4BInternVL3.5-8BInternVL3.5-14BInternVL3.5-38BQwen3.5-2BQwen3.5-4BQwen3.5-9BQwen3.5-35B
- 基准
- HADESLLaVA-CC3M-Pretrain-595K
- 指标
- ASRHBASRGPTToxicityDetailednessexact match rateedit similarityreconstruction CLIP similarityconcealment CLIP similarity
研究者针对多模态大模型提出基于意图混淆的越狱攻击分析框架,指出这类攻击受重构与隐藏权衡支配:变换后的输入既要躲过安全过滤器,又要让受害模型能还原原始请求。对三种代表性黑盒方法的分析显示,现有变换难以平衡这一权衡,而字符删减变体平衡得更好。作者据此提出隐藏感知变体构造方法,贪心地挑选与有害关键词对齐度低且彼此多样的字符删减变体,并通过五种模态感知提示策略实例化,同时引入关键词相关干扰图像,在不同语境中呈现有害关键词。在闭源和开源多模态大模型上的实验显示,这些策略优于强基线,暴露出模型自身的重构能力可被用来还原隐藏的有害意图并产生不安全回答。
深度解读
这篇论文试图解决什么问题?
黑盒意图混淆越狱受重建与隐蔽的权衡约束,作者用删字变体和干扰图利用模型重建。
意图混淆越狱必须同时隐蔽有害意图,并让受害MLLM重建原请求。
- 场景:作者称安全对齐会抑制直接有害请求,但文本LLM和MLLM仍可被越狱,视觉模态扩大攻击面。许多已部署MLLM只能经API访问,因此black-box攻击更贴近实际。
- 现有不足:FlipAttack、SI与CS-DJ都要求受害模型从变换输入恢复原有害意图。作者称三者未平衡重建与隐蔽:SI和CS-DJ表面重建较弱、隐蔽CLIP相似度高;FlipAttack隐蔽较强但重建差(Fig. 1、Table 1)。作者还称CS-DJ的子问题可能偏离原意图,FlipAttack在较弱模型上难以忠实还原。
- 观察:随机删去ρ=0.20的字符后,Fig. 1五个开源模型的精确匹配率均值为0.77,图例中FlipAttack与CS-DJ为0.00、SI为0.03。Table 1中随机删字对原查询和关键词的CLIP相似度为0.711和0.703,FlipAttack为0.669和0.706。作者称ASR随ρ呈倒U形。
- 本文提出:concealment-aware变体构造,选取关键词对齐低且彼此多样的删字变体,经五种模态提示策略实例化,并使用关键词相关干扰图。
- 威胁模型:
- 目标:使变换输入避开安全过滤,又保留足够信息以推断原有害请求,响应不属于拒绝、无关或无害集合Rr。
- 知识:black-box,不依赖受害模型梯度、权重或内部编码器。
- 能力:由有害文本查询xt得到文本–图像对,D为可选辅助图像。实验中w是HADES给出的单个有害关键词。
- 受害系统:安全对齐的MLLM。实践中许多模型只提供API。有害与否由评审模型判定。
有哪些相关研究?
作者把相关工作分成访问权限、黑盒多模态路线和文本越狱,并将本文放在变换–重建类黑盒攻击中。
按访问权限划分的MLLM越狱
- 白盒:Qi et al.(2024)优化通用对抗图像以跨提示词触发有害响应;UMK(Wang et al., 2024)联合优化对抗图像与文本后缀。
- 灰盒:Shayegani et al.(2024)在可访问编码器时,把有害意图藏入对抗图像。作者称白盒和灰盒可以很有效,但许多已部署MLLM只能经API访问,因此black-box更贴近实际。
- 黑盒总述:引言将近期black-box攻击概括为有害查询相关图像、字体渲染,以及跨模态意图分解。
黑盒多模态的三条路线
- 有害查询相关图像:MM-SafetyBench(Liu et al., 2024b)、HADES(Li et al., 2024)、JOOD(Jeong et al., 2025)、Visual-RolePlay(Ma et al., 2024)、MIRAGE(You et al., 2025)。附录B只描述其做法,未逐篇与本文对照。
- 字体或跨模态重建:FigStep(Gong et al., 2025)、MMLA(Wang et al., 2025b)、CAMO(Jiang et al., 2025)、CS-DJ(Yang et al., 2025)。作者在引言中称CS-DJ假定回答分解后的子问题即可恢复原任务,但子问题可能偏离原意图。
- 碎片化或多步推理:HIMRD(Ma et al., 2025)、SI(Zhao et al., 2025a)、VRSA(Zhao et al., 2025b)、VERA-V(Liao et al., 2025)。作者称SI打乱词序和图像块顺序,依赖模型在置换后仍识别有害意图。
文本LLM越狱
- 优化、包装与多轮:GCG(Zou et al., 2023)在白盒下优化对抗后缀;Wei et al.(2023)的角色扮演、Ding et al.(2024)的嵌套改写,以及MASTERKEY、GPTFUZZER、AutoDAN、PAIR、CoA、Crescendo和Andriushchenko et al.(2025)的自适应攻击。附录B将后一组描述为减少手工提示或逐步升级有害意图。
- 非标准文本表示:ArtPrompt(Jiang et al., 2024)把有害关键词画成ASCII艺术;FlipAttack(Liu et al., 2025)做字符级翻转。作者称本文沿这一文本混淆路线扩展到多模态,并显式研究重建–隐蔽权衡。
基线与数据
- 基线方法:FigStep、HADES、CS-DJ、SI、FlipAttack,均用官方实现。HADES基线使用数据集中的有害图像;CS-DJ的干扰图检索池为LLaVA-CC3M-Pretrain-595K。
- 基准:HADES,Violence、Financial、Privacy、Self-Harm、Animal五类各150条,共750条,每条一个有害关键词。
作者称本文最接近以变换和重建隐蔽有害意图的black-box攻击,区别是显式考察该权衡,并用concealment-aware删字与关键词相关干扰图。
论文如何解决这个问题?
贪心选取低关键词对齐且多样的删字变体,再用五种模态策略送入受害模型,并可加关键词相关干扰图。
框架从有害查询构造多个删字变体:单条变体降低有害意图的语义显式程度,所选集合仍足够让MLLM重建原请求。作者将其称为concealment-aware变体构造,再配五种提示策略和关键词相关干扰图(Fig. 2)。
问题设定
- 受害模型为Fθ。文本xt与图像xv可为空,输出为R。对齐后,含有害意图的输入预期得到拒绝、无关或无害响应,集合记为Rr。
- 攻击把xt变成文本–图像对,可选辅助图像集D。作者把成功写成 Fθ(x̂t,x̂v)∉ Rr,即响应不落入Rr;实验中由评审模型检查响应是否构成有害内容。
- 隐蔽在分析中用变换表示与原查询或有害关键词的CLIP相似度作代理,越低表示越隐蔽。重建用精确匹配、编辑相似度和重建CLIP相似度,定义在附录C.2。
变体构造
- 对长度n的查询,每个候选均匀随机删除k=⌊ρn⌋个字符。默认ρ=0.2。生成Nc=150个候选,去重,并丢掉损坏文本仍显式含w的候选。w由HADES按查询提供。
- 文本编码器为openai/clip-vit-base-patch32。第一阶段按与w的余弦相似度从小到大保留Np=40。相似度定义为 si(kw)=cos(ϕt(x̃ti),ϕt(w))。
- 第二阶段锚点初始为原查询嵌入。每步选取与当前锚点平均余弦相似度最小的候选,加入其嵌入,直到N=5。作者称低关键词对齐利于隐蔽,多样性保留互补局部信息。步骤见Algorithm 1。
五种提示策略
五种策略都要求模型用变体和被删字符下标重建原查询再作答,且不输出重建过程。附录F给出策略提示词,附录A.2给出共用系统提示词。论文按全文本、字体图、跨模态拆分,再加干扰图的顺序组织策略。
- TxtV:N条变体全在文本,无图像。
- TxtV-GDI:变体仍在文本;图像是Kd=9张关键词相关干扰图的合成。
- TypV:N条变体由Gtypo画成字体图,图中含损坏文本和删除下标;文本只有固定指令。
- TTV:nt=3条放文本,其余2条做成字体图。
- TTV-GDI:在TTV图像中再放入Kd=6张干扰图。多组件由Γ合成一张图。
解码为temperature=0、max_new_tokens=1024。字体图的版式参数在附录A.2。
关键词相关干扰图
- 作者对比CS-DJ从随机图池取干扰图。GDI先由Qwen3-4B-Instruct生成Ns=500句,每句显式含w;去重后从关键词嵌入出发贪心选出Ms=100句。句子提示词在附录A.2,此处不复述其格式约束。
- 再用Stable Diffusion 3按句生成1024×1024图像,28步、guidance scale 7.0,得到关键词图池。图像选择的锚点初始化为原查询嵌入,选出Kd张,使图相对整体有害上下文多样。步骤见Algorithm 2。
- 图池按关键词而非按查询生成。HADES有750条查询、250个关键词,故可跨查询复用。
论文做了哪些实验?
HADES上,各模型5次取最大时本文最高ASRHB均高于最强基线;Claude上TTV的ASRGPT为39.73%。
实验设置
- 受害模型:闭源为GPT-5.4-nano、GPT-5.4-mini、Gemini-2.5-Flash、Gemini-3.1-Flash-Lite、Claude Haiku 4.5。开源为Kimi K2.5、Llama-4-Maverick、Llama-3.2-11B-Vision-Instruct、InternVL3-8B、Qwen3-VL-8B-Instruct,以及InternVL3.5的2B、4B、8B、14B、38B和Qwen3.5的2B、4B、9B、35B。作者称共5个闭源、14个开源。Table 3将Qwen3-VL-8B-Instruct写作Qwen3-VL-8B。
- 数据与基线:HADES五类各150条,共750条。基线为FigStep、HADES、CS-DJ、SI、FlipAttack。HADES的有害图像只给HADES基线用;关键词用于本文变体构造。CS-DJ与DI消融的图源为LLaVA-CC3M-Pretrain-595K。
- 指标与评审:HarmBench是由Llama-2-13B微调的二分类器。GPT-5.4-mini同时是受害模型,按附录E输出jailbreak_success(0/1)、toxic_score(1–5)和detailedness(0–10)。ASRHB、ASRGPT由对应二值判断计算。论文未给额外分数阈值。作者称两种评审的排序大体一致,其余实验改用HarmBench。
- 协议:SI与五种本文策略随机,每查询T=5;查询级ASR取试验最大值,toxicity与detailedness同样先取五次最大再对查询平均。四个确定性基线各1次。Nq=750。作者称比较公平,因为重复试验只重采样输入变换,解码为temperature=0。
- 默认参数:ρ=0.2,N=5,TxtV-GDI的Kd=9,TTV-GDI的Kd=6。攻击侧还有CLIP、Qwen3-4B-Instruct和Stable Diffusion 3。五种策略共用附录A.2的系统提示词。
主结果
下表为ASRHB(%)。闭源据Table 2,开源据Table 3。随机方法为5次取最大,确定性基线为单次。
表格较宽,可左右滑动
受害模型 最强基线 TxtV TTV-GDI 本文最高 Claude Haiku 4.5 5.73(CS-DJ) 25.33 34.67 39.33(TTV) GPT-5.4-nano 14.40(CS-DJ) 33.73 74.67 74.67(TTV-GDI) GPT-5.4-mini 7.60(CS-DJ) 63.87 78.80 78.80(TTV-GDI) Gemini-2.5-Flash 88.27(FigStep) 98.13 97.20 98.13(TxtV) Kimi K2.5 27.73(FlipAttack) 99.60 99.73 99.73(TTV-GDI) Llama-3.2-11B-Vision-Instruct 76.00(FlipAttack) 95.07 82.93 95.07(TxtV) Qwen3.5-2B 80.13(FigStep) 83.60 71.47 83.60(TxtV) Qwen3.5-35B 7.47(CS-DJ) 56.53 98.67 98.67(TTV-GDI) 省略Gemini-3.1-Flash-Lite、Llama-4-Maverick、InternVL3-8B、InternVL3.5五个规模、Qwen3-VL-8B、Qwen3.5-4B与9B。其中Gemini-3.1-Flash-Lite的TxtV ASRHB为98.80%(Table 2)。
- 作者称GPT-5.4上差距大:TTV-GDI的ASRGPT/ASRHB在nano为78.67%/74.67%,在mini为79.60%/78.80%;最强基线CS-DJ为25.73%/14.40%与11.20%/7.60%(Table 2)。Gemini上更接近饱和,但五种策略在两种评审下仍高于最强基线。作者称Claude Haiku 4.5是所测闭源中最稳健的;TTV的ASRGPT/ASRHB为39.73%/39.33%,CS-DJ为6.80%/5.73%。
- 作者称开源结果随模型族变化,但各模型上最高的本文策略仍高于最强基线(Table 3)。Qwen3-VL-8B上TxtV为96.67%,最强基线FigStep为9.73%。TTV-GDI从Qwen3.5-2B的71.47%到Qwen3.5-35B的98.67%;作者认为更大模型更能利用跨模态变体做重建。摘要写ASR reaching up to 99.7%,Table 3对应格为99.73%。
- 不是每个变体都高于每个基线。Qwen3.5-2B上TTV-GDI为71.47%,低于FigStep的80.13%;InternVL3.5-2B上TypV为63.47%,低于SI的64.40%。GPT-5.4-mini上TxtV-GDI的ASRHB为53.33%,低于TxtV的63.87%;Claude上TxtV-GDI的ASRGPT为14.67%,低于TxtV的27.20%。
重建–隐蔽权衡
- Fig. 1图例的精确匹配率均值:FlipAttack 0.00、CS-DJ 0.00、SI 0.03、随机删字0.77。Table 1对原查询的隐蔽CLIP相似度:FlipAttack 0.669、SI 0.858、CS-DJ 0.870、随机删字0.711;对关键词分别为0.706、0.784、0.784、0.703。隐蔽取变体或子问题的最大相似度。
- Fig. 3比较随机删除与concealment-aware,模型为InternVL3.5-14B、InternVL3.5-38B、Qwen3.5-4B、Qwen3.5-35B。作者称后者在各ρ上对原查询和关键词的CLIP相似度更低,重建随ρ下降但两种选法接近,可恢复性损失可忽略;ASRHB呈倒U,Qwen3.5上更明显。正文未给出各ρ的ASR读数。默认ρ=0.2。
- 附录C.3:Qwen3.5族随机删字精确匹配率均值为0.69,InternVL3.5族为0.72。作者称重建随规模提高,删字变体在各规模都更容易重建。
关键词相关干扰图
- Table 4把GDI与从LLaVA-CC3M-Pretrain-595K随机抽100张的DI对比,最终选图步骤和张数相同。作者称7个模型上GDI都高于DI;表中TxtV与TTV的对应格均如此。
- GPT-5.4-nano上TxtV-DI/TxtV-GDI为56.53/62.40,TTV-DI/TTV-GDI为68.67/74.67。Qwen3.5-35B上为76.93/87.60与95.07/98.67。Llama-3.2-11B-Vision-Instruct上为77.07/89.60与65.73/82.93。
- 这与“GDI始终高于无干扰图策略”不是同一比较。Table 2中GPT-5.4-mini、Claude和部分Gemini格上,TxtV-GDI或TTV-GDI低于对应的TxtV或TTV。
多次试验
- Table 5按五次均值报告。GPT-5.4-nano上TTV-GDI的均值ASRHB为34.21%,Table 2取最大为74.67%。Gemini-2.5-Flash的均值ASRHB:FigStep 88.27、FlipAttack 83.07、TxtV 80.77、TTV-GDI 75.65。Gemini-3.1-Flash-Lite上FlipAttack为93.20,TxtV均值为89.47。
- Table 6:Qwen3.5-2B上FigStep 80.13高于TxtV均值36.29;InternVL3.5-2B上FigStep 62.27高于TxtV-GDI均值59.36;Llama-4-Maverick上FlipAttack 73.47高于TxtV-GDI均值64.76。Kimi K2.5的均值最高为TTV 94.53,FlipAttack为27.73。
- 作者称均值下趋势大体相近、绝对ASR下降,因为不再把任一成功试验记为该查询成功。Fig. 7图注称累计ASRHB随试验增加,并在t=5附近趋于饱和;正文未给出各点读数。图中Llama标签为Llama-4-Maverick-17B-128E-Instruct-FP8。
其他消融与分析
- 变体数:Fig. 6在ρ=0.2、concealment-aware下,四个开源模型的三项重建指标在N增至5后,作者称增益很小;默认N=5。正文未给各N读数。
- 干扰图数:Fig. 8中Kd=0即无干扰图的TTV。作者称Qwen3.5-35B在Kd=6达到峰值,InternVL3.5-38B接近其最高;过多则下降。图注认为可能来自视觉杂乱或重建线索被稀释。正文未给各Kd的ASR。
- 开销:作者称250个关键词、每词约4秒一张、Ms=100,单卡A100 80GB合计约27.8 GPU小时,10卡约2.8小时,为离线一次成本。
- 附录G示例1中TxtV-GDI标为REFUSED,其余四种标为JAILBROKEN;示例2五种均标为JAILBROKEN。附录给出输入与响应,此处不复述。
有什么可以进一步探索的点?
作者在结论中写明评测只用HADES和单关键词,并建议检验更广查询与多关键词设定。
作者指出的局限与后续方向
- 单一数据集:结论写明,局限是评测只在HADES上进行,且关键词程序固定为单个词。
- 分布是否可推广:结论写明,后续应考察重建–隐蔽权衡能否推广到更广的伤害类别和查询分布。
- 多关键词:同一句还写明,包括有害意图由多个关键词或短语表示的设定。
- 重建感知的对齐:结论写明,希望后续研究面向重建的安全对齐,在训练和评测多模态模型时计入这一攻击面。
实验覆盖范围
- 受害模型为第4节列出的5个闭源与14个开源MLLM;重建诊断另见Fig. 1及附录C.3的Qwen3.5、InternVL3.5族。
- 攻击数据为HADES的750条、五类各150条。主协议是每查询最多T=5,查询级ASR取最大;附录D另给五次均值和累计ASR。
- 基线为FigStep、HADES、CS-DJ、FlipAttack、SI。干扰图对照为DI与GDI(Table 4),并有ρ、N、Kd分析(Fig. 3、Fig. 6、Fig. 8)。
- 评审为HarmBench和GPT-5.4-mini。闭源Table 2同时报告两者;作者随后改用HarmBench。论文未报告两名评审的一致性数值,也未报告人工评估。
- 攻击侧写明使用CLIP、Qwen3-4B-Instruct和Stable Diffusion 3。论文未报告按伤害类别拆分的ASR,也未报告统计显著性检验。
总结一下论文的主要内容
删字变体与五种模态策略在HADES上提高黑盒越狱ASR,作者称这利用了模型自身的重建能力。
这是一项black-box MLLM越狱工作:用多个删字后的残缺查询,让模型自己拼回有害请求。
- 问题:变换既要降低有害意图的显式程度,又要留足可重建信息。作者称之为重建–隐蔽权衡,并认为FlipAttack、SI、CS-DJ各偏一侧。随机删字在Fig. 1上的精确匹配率均值为0.77,隐蔽CLIP相似度与FlipAttack接近(Table 1)。
- 方法:CLIP先保留与HADES关键词对齐较低的删字候选,再贪心选出相对原查询彼此多样的N=5条。TxtV、TxtV-GDI、TypV、TTV、TTV-GDI把变体分到文本或字体图;GDI另用Qwen3-4B-Instruct和Stable Diffusion 3生成关键词相关干扰图。
- 取最大的主结果:HADES 750条、T=5取最大时,Kimi K2.5上TTV-GDI的ASRHB为99.73%(Table 3)。GPT-5.4-mini上TTV-GDI的ASRGPT为79.60%,Claude Haiku 4.5上TTV的ASRGPT为39.73%(Table 2)。Qwen3.5-35B上TTV-GDI的ASRHB为98.67%,Qwen3.5-2B上同策略为71.47%,低于该模型FigStep的80.13%。
- 协议差异:同一TTV-GDI在GPT-5.4-nano上,取最大的ASRHB为74.67%(Table 2),五次均值为34.21%(Table 5)。Gemini-2.5-Flash上,FigStep的单次ASRHB 88.27%高于本文策略的五次均值。作者关于闭源模型上五种策略高于最强基线的说法,对应的是取最大协议。
- 作者结论:模型自身的重建能力可被用来恢复隐藏的有害意图并产生不安全响应。评测限于HADES和单关键词;作者希望后续做面向重建的安全对齐,并检验更广查询与多关键词设定。