研究者提出信息过载方法越狱大型视觉语言模型
Overloading Large Vision-Language Models for Jailbreaking
用信息过载(INFER+)越狱LVLM;作者称商业模型平均ASR 84.0%(代理为Qwen2-VL)。
目标是诱导LVLM产生有害输出。作者称攻击者往往无法访问专有模型内部,可用开源代理优化后再迁移到black-box LVLM;代理侧读取首token熵,而非梯度。
- LVLM同时接收图像和文本,现有越狱多用短文本和OOD图像。作者称更强骨干与多模态融合削弱了这类攻击的跨架构迁移,因而改以信息过载提高图文复杂度。
- INFER把有害请求拆成指令与短语并做成图像排版,文本再嵌套引用这些区域。INFER+加入规则排版和递归树版式,在代理上用首token熵做随机搜索,并以两套提示词共同攻击。
- Table 1里INFER+在八个模型、两个数据集上高于三个基线。商业模型以Qwen2-VL为代理,GPT-4.1 mini在HADES上为91.11%。FigStep下Qwen3-VL的MM-SafetyBench降至12.59%。
- 论文未专门讨论局限。覆盖5个开源与3个商业LVLM、两个数据集;迁移数字只见表2的MM-SafetyBench。未报告过滤后样本量、步数N与人工一致性。
- 威胁模型
- 目标是诱导LVLM产生有害输出。作者称攻击者往往无法访问专有模型内部,可用开源代理优化后再迁移到black-box LVLM;代理侧读取首token熵,而非梯度。能联合控制图像与文本(dual attack surfaces)。受害系统是个人助理、文档分析和具身智能体等部署中的LVLM。
- 被测模型
- Qwen3-VL-8BQwen2-VL-7BInternVL3.5-8BInternVL2-8BLLama 3.2-11B-VisionGPT-4.1 miniGemini 2.5 FlashGemini 2.5 Flash-Lite
- 基准
- MM-SafetyBenchHADES
- 指标
- ASRStrongREJECTRCI
研究者提出一种信息过载的越狱方法,通过大量文本与多维度图像攻击结合递归式图像排版布局,成倍增加多模态信息复杂度,削弱大型视觉语言模型(LVLM)的安全对齐。在开源模型上平均攻击成功率为 88.6%,在商用 LVLM 上为 84.0%,比最佳基线高出 48.7%,且提示词可在开源替代模型上优化后跨模型家族迁移。研究者进一步探查受害模型内部的安全关键信息流,发现复杂的图像排版组合会加剧跨模态处理并降低模型生成拒答的确定性,认为信息过载是 LVLM 实际部署中一个新兴的安全风险。
深度解读
这篇论文试图解决什么问题?
现有LVLM越狱偏简单、难跨架构迁移,作者改用图文信息过载。
LVLM的图像与文本可被同时加大复杂度,从而削弱拒答对齐。
- 场景:作者称LVLM已用于个人助理、文档分析和具身智能体,并接触用户、私有文档、物理环境与外部工具,因此绕过护栏的影响变大。
- 现有不足:作者称现有LVLM越狱多用短文本和OOD图像,如JOOD、CS-DJ;更强的LLM骨干和多模态融合使这些攻击变弱,尤其难跨架构泛化。
- 观察:第3节称复杂排版会降低拒答率、提高拒答首token的熵,并增加跨模态信息流。作者认为当前阶段应提高信息复杂度与攻击维度(Figure 1)。
- 做法:提出INFER与INFER+,用长文本、多维图像攻击和递归image-typography版式过载模型。贡献中作者称这是从image-text overloading视角做LVLM越狱。
- 威胁模型:
- 目标:使对齐后的LVLM不再拒答,并生成有害输出。
- 知识:作者称攻击者通常不能访问专有模型内部,可在开源代理上优化后再攻击black-box LVLM。代理优化读取首token熵,论文未将其写成梯度白盒攻击。
- 能力:可联合构造图像和文本,即论文所说的dual attack surfaces。
- 受害系统:接收图文的LVLM,实验包含开源模型以及Gemini、GPT-4.1等商业模型。
有哪些相关研究?
相关工作分LVLM、LLM越狱与LVLM越狱;基线为ImageTypo、TVPI、CS-DJ。
LVLM
- 编码器与骨干:CLIP、SigLIP接vicuna、llama、Qwen等LLM骨干。论文只作结构描述。
- 模态融合:Llava、CogVLM把图文投到共享空间;Otter、Llama 3.2-Vision用交叉注意力。
- 近期能力:Gemma 3、Kimi-VL、Qwen3-VL、InternVL3.5支持长上下文、多图和高分辨率。作者称模型走向开放场景后,安全更重要。
LLM越狱
- 早期模板:DAN、prefix injection;另有competing objectives和mismatched generalization。
- 复杂提示:规则、代码、role-play、嵌套指令和in-context examples。INFER的嵌套引用引用了其中的嵌套指令工作。
- 自动构造:遗传算法,或用另一个攻击者LLM迭代改写。论文用这条演化对照LVLM越狱仍偏简单,没有把批评安到这些LLM方法上。
LVLM越狱
- 扰动法:Visual Adversarial、Jailbreak In Pieces、MLAI,以及联合优化图文的BAP、UMK。论文称它们在white-box下有效,但通常难在不同图像编码器与LLM骨干间泛化。
- 提示注入:FigStep把有害指令做成排版;MM-SafetyBench、HADES把有害意图分到图文,使不安全语义要融合两模态后才显式。
- OOD路线:JOOD做视觉与文本变换;CS-DJ、BSD用子图分散注意力;SI-Attack用query-based black-box优化打乱图文顺序。论文称这些方法仍主要靠OOD变换和较简单的图文指令,骨干与融合变强后受到挑战。
基线与数据集
- 基线方法:ImageTypo(第6.1节亦写SDTypo/HADES)、TVPI、CS-DJ。
- 基准/数据集:MM-SafetyBench与HADES,用于优化和评测。
作者把本文与OOD隐藏意图区分开:增加有害图文的数量和密度,迫使模型在拒答前处理过多跨模态内容。贡献中作者称这是第一个从image-text overloading视角越狱LVLM的工作。
论文如何解决这个问题?
INFER用嵌套图文引用过载,INFER+再用熵引导搜索递归版式与规则。
INFER用文本、图像和排版的嵌套引用增加处理负担;INFER+在代理上最大化首token熵,搜索规则与递归版式,再与INFER提示词一起使用。
复杂度探测
- 输入:Dsim为简单图文,Dcmp为复杂文本加排版图像,均从HADES与MM-SafetyBench采样。模型为Qwen2-VL、InternVL2、Llama 3.2-Vision。Dsim在图下补空白,使两边图像同尺寸。
- 拒答指标:作者把首个拒答token(文中举例常为“I”,有害回答常以其他token开头)当作拒答起点,并计算拒答时该token分布的熵。
- 信息流:用attention knockout阻断源token到目标token。RCI为pc,ℓS,T=(πθ(y1|xv,xt)−πS,T,ℓθ(y1|xv,xt))/πθ(y1|xv,xt),即第ℓ层阻断后,首个拒答token概率的相对下降;越高表示该流对拒答越关键。
- 比较对象:image-to-text与typography-to-text。作者称复杂提示词带来更多这两类流,尤其是后者。
INFER
- 原始有害文本被拆成改写后的无害指令和有害短语,作为排版嵌入图像,记为vinst、vharm,再与原图合成vatk。vinst用“activity”指向vharm。
- 文本tatk要求模型识别图中指令并作答,形成tatk到vinst再到vharm的嵌套引用。作者称目的不是拆开以隐藏意图,而是迫使模型依次解析文本、排版和图像。
INFER+
- 规则排版:从整理过的规则集抽样,渲染成vrule并写入图像;文本改为tatk+,要求同时参考规则。正文举两类:Framing(role-play、情景操纵)和Constraint(输出格式约束)。补充材料有完整规则,此处不列句式或字数约束。
- 递归版式:把vatk与vrule按树状递归重复嵌入,得到更密的vatk+。可控量为递归深度、分支数、字号、字体。正文未给这些量的取值。
- 最终图像为vatk+=ϕv(v,vharm,vinst,ϕt(ttpl,θt),θv),即规则配置θt与版式配置θv共同决定图像。INFER+被写成(vatk, tatk)与(vatk+, tatk+)的集成。
熵引导随机搜索
- 在代理πθsgt上做无梯度随机搜索(Algorithm 1):随机初始化θt、θv,扰动参数,计算数据集上的首token熵,更高则保留;连续未提升达到patience P则早停。
- 正文给出步数N、patience P和扰动规模n,但未给数值,称细节在补充材料。开源实验里代理与受害模型相同;Table 1注明商业模型的代理为Qwen2-VL。
成功判定
- ASR是N次里评审J把输出判为Harmful的比例。J为Llama Guard 3-8B,输出harmful或not harmful。评测时把数据集原始文本(不是攻击文本)与模型输出交给评审,并先滤掉评审认为无害的提示词。
- StrongREJECT另用GPT-4o-mini按更细的标准评分。论文未在正文给出过滤后的N。
论文做了哪些实验?
Table 1中INFER+各格高于三基线;防御会降低ASR,FigStep下最低至12.59%。
实验设置
- 被测模型:开源Qwen3-VL-8B、Qwen2-VL-7B、InternVL3.5-8B、InternVL2-8B、LLama 3.2-11B-Vision;商业GPT-4.1 mini、Gemini 2.5 Flash、Gemini 2.5 Flash-Lite。开源INFER+在同一模型上优化并评测;商业INFER+的代理为Qwen2-VL。
- 数据:MM-SafetyBench与HADES。论文称二者用扩散模型生成与有害文本对应的图像。过滤后条数未报告。
- 基线:ImageTypo、TVPI、CS-DJ。TVPI被改成以肯定性回应为目标。CS-DJ按默认设置,用从两个数据集采样并过滤的提示词。
- 指标:ASR;StrongREJECT。探测另用首token熵和RCI。
- 评审:ASR用Llama Guard 3-8B。StrongREJECT用GPT-4o-mini。论文未报告与人工的一致性,也未报告主实验重复次数。
- 防御:Input Guard(Llama Guard 3-Vision)、TVPI Defense、FigStep Defense,对象为Qwen3-VL与InternVL3.5(Table 4)。
主结果
开源五行的INFER+为同模型优化;后三行代理为Qwen2-VL。最强基线按Table 1的ImageTypo、CS-DJ、TVPI取高并标明方法,不是论文原列;这些格子里ImageTypo均不是最高基线。
表格较宽,可左右滑动
模型 MM INFER+ MM最强基线 HADES INFER+ HADES最强基线 Qwen3-VL 74.48% 45.22%(TVPI) 84.55% 51.75%(TVPI) Qwen2-VL 86.25% 75.06%(CS-DJ) 97.52% 86.59%(CS-DJ) InternVL3.5 83.92% 69.70%(CS-DJ) 92.86% 82.94%(CS-DJ) InternVL2 90.68% 72.26%(CS-DJ) 96.21% 85.57%(CS-DJ) Llama 3.2-Vision 87.41% 39.86%(CS-DJ) 92.57% 58.60%(CS-DJ) GPT-4.1 mini 82.75% 56.41%(CS-DJ) 91.11% 65.01%(CS-DJ) Gemini 2.5 Flash 76.57% 54.66%(CS-DJ) 80.32% 50.87%(CS-DJ) Gemini 2.5 Flash-Lite 78.79% 56.18%(CS-DJ) 94.31% 55.69%(CS-DJ) - 作者称开源上INFER与INFER+一致优于SDTypo/HADES和CS-DJ。Table 1中INFER+确实高于三列基线;INFER并非每格如此:InternVL3.5的MM-SafetyBench为63.40%,低于同格CS-DJ;GPT-4.1 mini为54.19%与61.66%,也低于同格CS-DJ。Qwen3-VL上INFER为44.17%与69.97%,MM-SafetyBench一格低于TVPI。
- 作者称Qwen3-VL基线更低,且INFER与INFER+在该模型上ASR大于70%(MM-SafetyBench)和大于80%(HADES)。Table 1里只有INFER+满足这两个下限。摘要写开源平均88.6%、商业平均84.0%;引言写开源大于90%、商业大于80%。Table 1没有平均值行。
- 作者称商业护栏通常更强、基线ASR下降,但以Qwen2-VL为代理的INFER+仍高于各基线。
跨模型迁移
- Table 2只给MM-SafetyBench。作者称两个数据集都有迁移,HADES迁移数字未列入该表。
- Qwen2-VL代理到InternVL3.5为82.40%,Llama 3.2-Vision代理为80.30%,InternVL3.5自身优化为83.92%。Qwen2-VL代理到Llama 3.2-Vision为88.11%;引言写87.9%,并称同目标最强基线仅39.9%(Table 1的CS-DJ为39.86%)。
- Table 2全表从58.28%(Llama 3.2-Vision代理、Qwen3-VL)到90.79%(Qwen2-VL代理、InternVL2)。作者称Qwen2-VL优化的提示词迁移更高,且未过拟合单一架构。摘要称该代理的迁移平均ASR为84.6%。
防御与StrongREJECT
- Table 4中三种防御都降低ASR。Qwen3-VL的INFER+从无防御74.48%/84.55%(MM/HADES)降到Input Guard 34.38%/32.22%、TVPI Defense 48.83%/64.87%、FigStep Defense 12.59%/20.26%。InternVL3.5的FigStep为40.33%/66.18%,Input Guard为51.40%/38.48%,TVPI Defense的HADES仍为91.55%(无防御92.86%)。作者称防御后INFER+仍高于同表基线。
- Table 3的StrongREJECT:INFER+在Qwen3-VL上为0.77(MM)和0.76(HADES),Gemini 2.5 Flash上为0.83和0.74,均为同表最高。作者称分数与Llama Guard 3的ASR大体一致,并认为INFER+提高的不只是绕过拒答的比例。
信息流
- Figure 6横轴为First-token Entropy,纵轴为ASR (%)与Average RCI (%)。作者称熵与ASR、平均RCI正相关。正文未给相关系数,也未说明该图的模型。
- Figure 7:作者称Llama 3.2-Vision在HADES上处理INFER+时,相对Dcmp加强了跨模态处理。正文未给该图数值。
- 第3节:作者称从Dsim换到Dcmp后拒答率下降,Qwen2-VL拒答首token的熵分布移向更高熵(Figure 3)。Figure 4给出Qwen2-VL与InternVL2的RCI对比。无统计检验数字。
其他消融与分析
- Table 5在MM-SafetyBench上去掉随机搜索(10次随机初始化的平均):Qwen3-VL 62.70%,Qwen2-VL 83.88%,InternVL3.5 80.92%,InternVL2 88.52%,Llama 3.2-Vision 84.04%。
- 去掉排版规则(同序):74.36%、82.40%、76.92%、88.00%、84.15%。Qwen3-VL相对完整版74.48%只差0.12个百分点。
- 去掉递归版式(同序):69.23%、84.15%、82.52%、85.55%、84.38%。作者称去掉搜索、规则或视觉放大都会降低ASR。
- Figure 8是GPT-4.1-mini的一例。作者称排版规则把请求引向假设情境并产生有害回应。不复述示例原文。
有什么可以进一步探索的点?
论文未专门讨论局限;第7节只讨论误用与负责任处理。
作者指出的局限与后续方向
论文没有Limitations或Future Work专节,Conclusion也没有把某项设计写成不足或待做实验。第7节只讨论误用可能,并呼吁负责任地处理这类研究;摘要写需要更强防御,这是呼吁,不是列出的局限。因此:论文未专门讨论局限。
实验覆盖范围
- 被测模型为五个开源模型(Qwen3-VL-8B、Qwen2-VL-7B、InternVL3.5-8B、InternVL2-8B、LLama 3.2-11B-Vision)和三个商业模型(GPT-4.1 mini、Gemini 2.5 Flash、Gemini 2.5 Flash-Lite),见第5节。
- 数据集为MM-SafetyBench与HADES。ASR由Llama Guard 3-8B判定;StrongREJECT由GPT-4o-mini评分,Table 3只含Qwen3-VL与Gemini 2.5 Flash。
- 防御评测包括Input Guard(Llama Guard 3-Vision)、TVPI Defense和FigStep Defense,对象为Qwen3-VL与InternVL3.5(Table 4)。
- 开源INFER+在同一模型上优化并评测;商业模型以Qwen2-VL为代理(Table 1注)。Table 2的迁移数字只覆盖MM-SafetyBench。作者称扰动法通常难跨编码器与骨干泛化,因而本文不用像素噪声、改用代理上的无梯度搜索。
- 论文未报告过滤后的提示词条数、Algorithm 1中N、P、n的取值,以及ASR或StrongREJECT与人工判定的一致性。主实验未报告重复次数;去掉随机搜索的一行是10次随机初始化的平均(Table 5)。
总结一下论文的主要内容
用图文过载越狱LVLM;INFER+在Table 1的八个模型上高于三基线。
这篇工作用信息过载越狱LVLM,而不是靠OOD变换隐藏意图。
- 问题:作者认为LLM越狱已从短提示走到多维模板,LVLM越狱仍偏短文本和OOD图像;更强骨干与融合使后者更难跨架构迁移。
- 方法:INFER把请求拆成指令和短语,做成图像排版,再用文本嵌套引用。INFER+增加规则排版和递归树版式,在代理上以首token熵做随机搜索,并把两套提示词一起送入受害模型。开源实验中代理即受害模型;商业实验的代理是Qwen2-VL。
- 主结果:Table 1中INFER+在五个开源和三个商业模型、MM-SafetyBench与HADES上,都高于ImageTypo、CS-DJ、TVPI。GPT-4.1 mini为82.75%与91.11%;Qwen3-VL为74.48%与84.55%;Qwen2-VL在HADES上为97.52%。INFER本身有低于CS-DJ的格子。摘要写开源平均88.6%、商业平均84.0%;引言写开源大于90%、商业大于80%。
- 迁移、防御与评分:Table 2里Qwen2-VL代理到Llama 3.2-Vision的MM-SafetyBench ASR为88.11%(引言写87.9%,同目标基线39.9%)。FigStep下Qwen3-VL的MM-SafetyBench ASR为12.59%。StrongREJECT上INFER+为同表最高:Qwen3-VL 0.77/0.76,Gemini 2.5 Flash 0.83/0.74。
- 作者结论:作者称该方法是新的state-of-the-art,且过载不是单一架构的问题;信息流分析被用来解释复杂排版为何伴随更不确定的拒答。摘要称需要更强防御。第7节提醒此类提示词可能被用来绕过已部署系统的护栏。