研究者提出 Text-DJ,利用 OCR 能力越狱大型视觉语言模型
Text is All You Need for Vision-Language Model Jailbreaking
Text-DJ用拆分后的文本图网格越狱LVLM;HADES上GPT 4.1 mini平均ASR为64.27%。
黑盒、model-agnostic:不访问梯度或参数,不绑定单一受害模型。
- LVLM的安全检查多针对显式文本或相关画面,需要梯度的白盒攻击又用不到闭源API。作者要一种black-box、model-agnostic、只靠文本提示的越狱,利用OCR读入被拆散的有害子查询。
- Text-DJ用Qwen2.5-3B-Instruct把有害查询拆成3个子查询,再用all-MiniLM-L6-v2贪心选取9条最无关干扰问句,写成4×3文本图,子查询放在位置6、8、12,并指示模型回答这些位置。
- 在HADES和HEx-PHI上,六个LVLM的Text-DJ平均ASR均高于表中基线。HADES上GPT 4.1 mini为64.27%,Gemini-2.5-Flash为44.00%。OpenAI拒绝率为0.00%。
- 论文未专论方法局限。结论呼吁为OCR模块建立能抵抗跨模态语义干扰的防御。护栏与消融只报告开源Qwen3-VL;主实验ASR的重复次数未报告。
- 威胁模型
- 黑盒、model-agnostic:不访问梯度或参数,不绑定单一受害模型。攻击者只用文本提示,把拆分后的有害子查询与无关干扰查询写成图片网格并附定位指令,以诱导LVLM给出有害回复。受害系统为开源与闭源LVLM,含API模型。
- 被测模型
- Qwen/Qwen3-VL-4B-InstructQwen/Qwen3-VL-8B-InstructQwen/Qwen3-VL-30B-A3B-Instructgpt-4o-minigpt-4.1-minigemini-2.5-flash
- 基准
- HADESHEx-PHI
- 指标
- ASREASRRR
论文提出 Text-DJ,一种利用大型视觉语言模型 OCR 能力的越狱攻击,可绕过现有安全对齐。该方法分三步:把一条有害查询拆解成多条语义相关但更无害的子查询;挑选与有害查询最不相关的干扰查询;将子查询与干扰查询以图像网格形式同时输入模型,子查询置于网格中部。作者认为攻击成功的原因有两点:一是把文本提示词转为图像,绕过标准文本过滤器;二是大量无关查询造成干扰,使模型的安全协议无法把分散的子查询关联起来。作者称这种方法绕过了当前最先进 LVLM 的安全对齐,并指出需要针对碎片化多模态输入设计防御。论文编号 arXiv:2602.00420。
深度解读
这篇论文试图解决什么问题?
Text-DJ把有害查询拆进OCR文本图,在黑盒下绕过侧重显式文本的LVLM防护。
现有防护侧重显式文本或相关画面,Text-DJ改用OCR读入被拆散的文本图来越狱LVLM。
- 场景:作者称LVLM把视觉编码器与LLM接在一起,用于视觉问答、图像描述和多模态推理。训练语料可能含有毒或敏感信息,带来隐私泄露或有害输出;视觉输入又可能绕过只做在文本上的对齐。
- 现有不足:作者称不少越狱是white-box,要梯度或参数,因而用不到GPT系列、Gemini系列这类闭源API模型。许多攻击还model-specific,换模型后迁移性不足,生成专门对抗图像的开销也高于文本攻击。
- 作者的判断:作者认为文本写成图像可绕过常规文本过滤,大量无关查询又使安全机制难以把拆散的子查询连起来。作者称OCR模块的安全对齐在很大程度上被忽略。
- 本文做法:提出Text-DJ(Text Distraction Jailbreaking)。一条有害查询被拆成多个语义相关但更温和的子查询,再配上尽量无关的干扰查询,同时以图片网格送给模型,子查询放在网格中部。
- 威胁模型:
- 目标:绕过安全对齐,让LVLM对有害或不被允许的提示给出有害回复。
- 知识:black-box、model-agnostic。不访问梯度或参数,也不绑定单一受害模型的结构。
- 能力:只使用文本提示。攻击者把查询写成图片并附定位指令,不需要真实照片或扩散模型生成的有害图像。
- 受害系统:开源与闭源LVLM,包括以API部署的GPT系列与Gemini系列。
有哪些相关研究?
相关工作覆盖LVLM、白盒梯度攻击和黑盒图像越狱;作者把Text-DJ定为语义干扰。
论文按LVLM架构、白盒攻击、黑盒图像攻击和查询分解来组织相关工作。
LVLM与对齐
- LLaVA(Liu等,2023)、MiniGPT-4(Zhu等,2023):冻结视觉编码器(如CLIP-ViT)经可训练投影连到LLM,再做视觉-文本对齐预训练和视觉指令微调。
- Qwen-VL系列(Bai等,2023;Yang等,2024、2025):作者称其用DeepStack融合ViT特征以处理高分辨率图像,在多语言OCR和复杂文档上表现更好;本文利用的是这类OCR能力。
- GPT-4o(Hurst等,2024)、Gemini 2.5(Comanici等,2025):作者称二者在复杂推理上达到state-of-the-art,并用训练后对齐增强可信性。文本侧对齐则包括RLHF等。
白盒LVLM攻击
- GCG(Zou等,2023)、AutoDAN(Liu等,2023):从纯语言域迁来的梯度攻击,优化加在文本或图像块上的对抗后缀以破坏对齐。另有工作用梯度改潜空间,把内部状态从有害查询转向安全查询。
- 作者指出,闭源LVLM的架构和参数未知,白盒攻击无法使用;现有梯度攻击通常model-specific,并有迁移性问题。作者称自己的黑盒方法不依赖受害模型。
黑盒图像越狱
- FigStep(Gong等,2025)用排版变换把有害文本藏进图像;MM-SafetyBench(Liu等,2024)则改写问题、抽出不安全关键词再转成图像。
- HADES(Li等,2024)用扩散模型生成有害图像再优化,考察有害图像本身如何破坏安全。
- CS-DJ(Yang等,2025)把分解后的有害查询直接写在图像上,另用真实图像作visual distraction,图像本身不含有害信息。作者称Text-DJ中这类视觉图像可有可无,semantic distraction比visual distraction更有效。
查询分解
- DrAttack(Li等,2024)、agent-driven decomposition(Srivastav与Zhang,2025)、多轮越狱Crescendo(Russinovich等,2025):把有害查询拆成单独看较良性或含糊的步骤。Text-DJ把这一做法用作第一步。
基线方法为HADES与CS-DJ。基准为HADES(5类、每类150条、共750条)和HEx-PHI(修订后10类、每类30条、共300条)。作者称HADES方法生成对抗图像较复杂,且在HADES数据集上表现较差,故未纳入HEx-PHI。作者把Text-DJ定位为black-box、model-agnostic、只依赖文本提示的方法,并称它只需在图上写文本,因而更高效且ASR更高;论文未报告查询次数或耗时。
论文如何解决这个问题?
先拆成子查询,再贪心选最无关问句,最后写成网格文本图并指定位置作答。
Text-DJ分三步:拆有害查询、选语义最远的干扰问句、把全部文本画进同一张网格图,再让LVLM回答指定位置。
对抗查询分解
- 用带提示的LLM把有害查询q拆成m个子查询。每条应是原查询的一部分,来自不同角度或中间步骤,更不直接、更含蓄;合在一起应反映原有害意图。
- 分解模型为Qwen/Qwen2.5-3B-Instruct。主实验m=3。附录C.1给出完整提示词。
干扰查询构造
- 从离线池Dd选n条问句,使它们与q彼此尽量不同。作者称这是NP-hard的diverse subset selection,用贪心作近似。
- 编码器为sentence-transformers/all-MiniLM-L6-v2。第一条为 qd(1)=argminqd∈ Ddcos⟨ Embed(qd),Embed(q)⟩,即与q余弦相似度最小的问句。其后每条还要加上与已选干扰查询的余弦相似度之和,再取最小(式(1))。
- Dd是作者随机生成的100条科学与文化事实问句,与有害意图无关。提示在附录C.4。
成图与呈现
- TiI把子查询和干扰查询分别写成图片。文字与背景色随机;对比度按WCAG AA,下限4.5,以保证文字可见。颜色生成代码在附录C.5。
- 主实验n=9,共12张图,排成4×3。位置从左上起、先行后列编号1–12,子查询放在6、8、12。Algorithm 1在非指定位置依次放入干扰图,在指定位置放入下一张子查询图。
- 再附一条指令,让模型关注这些位置并同时作答,并说明其他图不是必需。全文在附录C.2。受害模型生成温度设为0.1。附录B.2用一条查询演示了三步,不在此处复述其文本。
成功如何计算
- ASR是N条回复中被判为不安全的比例。评审模型为PKU-Alignment/beaver-dam-7b,判定函数记为Is Unsafe。论文未写分数阈值。
- EASR是一组模板中至少有一个模板成功的查询占比。具体重复方式放在实验部分。
论文做了哪些实验?
六个LVLM上Text-DJ平均ASR高于HADES与CS-DJ;护栏实验里OpenAI拒绝率为0.00%。
实验设置
- 受害模型:Qwen/Qwen3-VL-4B-Instruct、Qwen/Qwen3-VL-8B-Instruct、Qwen/Qwen3-VL-30B-A3B-Instruct、gpt-4o-mini、gpt-4.1-mini、gemini-2.5-flash。生成温度均为0.1。
- 数据:HADES五类(Animal、Financial、Privacy、Self-Harm、Violence),每类150条,共750条。HEx-PHI在2024年8月19日修订中移除类别2后为10类,每类30条,共300条。干扰池为100条科学与文化问句。
- 主设置:m=3,n=9,4×3网格,子查询在编号6、8、12;随机配色,最低对比度4.5。
- 基线:HADES与CS-DJ。HEx-PHI未跑HADES方法。
- 指标与评审:ASR为不安全回复占比;EASR在附录中按Algorithm 1跑5次、至少一次成功来算。评审为PKU-Alignment/beaver-dam-7b。分解用Qwen/Qwen2.5-3B-Instruct,句向量用all-MiniLM-L6-v2。主实验ASR的重复次数论文未报告。
- 护栏:输入先经omni-moderation-latest,或GuardReasoner-VL-3B/7B;判为不安全则拒绝、不送入受害模型。后两者温度为0、top p为1.0。Table 3与Table 4只含三个开源模型和HADES类别。消融也只在开源模型上做,其余设置同主实验。
主结果
下表为平均ASR(%)。HADES三列据Table 1,HEx-PHI两列据Table 2。HEx-PHI未报告HADES方法。
表格较宽,可左右滑动
受害模型 HADES Text-DJ HADES CS-DJ HADES方法 HEx-PHI Text-DJ HEx-PHI CS-DJ Qwen3-VL-4B 48.13 34.40 11.87 42.33 27.33 Qwen3-VL-8B 52.67 38.53 9.33 47.33 34.33 Qwen3-VL-30B-A3B 57.60 56.27 13.60 48.33 45.33 GPT 4o mini 59.33 46.80 4.13 59.00 44.67 GPT 4.1 mini 64.27 56.00 8.40 60.33 45.00 Gemini-2.5-Flash 44.00 40.53 21.33 41.33 41.00 - 作者称Text-DJ的平均ASR持续高于先前基线。上表平均列确实都是Text-DJ更高,但逐类不是:HADES的Animal类,Qwen3-VL-8B上Text-DJ为42.67%、CS-DJ为49.33%;GPT 4.1 mini上为28.67%与33.33%(Table 1)。
- HEx-PHI类别3上,Gemini-2.5-Flash的Text-DJ为23.33%,CS-DJ为40.00%(Table 2)。作者仍以平均ASR比较方法。
- 作者把相对CS-DJ的优势解释为语义干扰比视觉干扰更有效。附录Fig. 10用单条示例比较输入形态,并称Text-DJ不需要真实图或生成图、ASR更高;汇总数字以上表为准。
输入侧护栏
- 测的是Text-DJ输入能否先被护栏拒绝。OpenAI Moderation API在三个Qwen3-VL上的ASR变化均为−0.00;Table 4拒绝率均为0.00%。作者称攻击几乎绕过该API的全部检测。
- GuardReasoner-VL-7B下,HADES平均ASR为:Qwen3-VL-4B 39.20(Table 3记−8.93)、8B 43.47(−9.20)、30B-A3B 54.27(−3.33)。对应拒绝率平均为14.93%、14.93%、3.60%(Table 4)。
- Table 3括号内降幅最大的一格是Qwen3-VL-8B的Financial:GuardReasoner-VL-7B下为52.67(−18.00)。作者称即便在这些输入过滤下,Text-DJ仍保持较高ASR。
文本入图、分解数与干扰数
- 去掉TiI(Table 6):改为1×1白图占位加纯文本。有TiI时4B/8B/30B-A3B平均ASR为48.13%、52.67%、57.60%;无TiI时为20.13%、11.60%、20.27%。作者认为跨模态入图是绕过文本侧安全对齐的关键。
- 子查询数m(Table 9):m=1/2/3时,4B为12.13%、38.40%、48.13%;8B为9.07%、38.00%、52.67%;30B-A3B为22.13%、54.67%、57.60%。作者称m=1时安全机制仍能识别有害查询;更大的m未给数字,作者称没有ASR收益且分解更慢。
- 干扰数n(Table 10):n=0时三者为30.53%、27.20%、56.53%;n=9时为48.13%、52.67%、57.60%。作者称n=0时攻击无效,n=9或12较好。表中30B-A3B在n=0已为56.53%,n=3为53.87%,低于n=0;8B上n=9为52.67%,高于n=12的44.93%和n=15的46.80%。
五次运行的EASR
- 附录A.1把Algorithm 1跑5次,报告至少一次成功的比例。Table 5只列出三个开源模型:Text-DJ为74.67%、82.13%、82.53%,CS-DJ为70.13%、73.87%、82.27%。表注写了开源与闭源以及HADES方法,表内没有这两项。
- 30B-A3B的Violence类,Text-DJ为90.00%,CS-DJ为94.00%。作者称Text-DJ持续高于CS-DJ;平均列如此,该类不是。
其他消融与分析
- 干扰策略(Table 7):最无关对随机,4B为48.13对37.20,8B为52.67对48.13;30B-A3B随机58.40,高于最无关的57.60。作者称最无关更高。
- 嵌入(Table 8):句向量对clip-ViT-L-14图像向量,4B为48.13对48.66,8B为52.67对53.60,30B-A3B为57.60对56.27。作者称句向量略高;4B与8B的平均列并非如此。主实验仍用句向量。
- 位置(Table 11):4B中间/最前/最后/随机为48.13、35.47、39.87、45.60;8B随机53.07,高于中间52.67。该消融用红框标出子查询。作者称宜靠后,但不必是最后三个位置。
- 配色(Table 12):随机对固定红字白底,4B为48.13对42.40,30B-A3B为57.60对55.07;8B固定53.47,高于随机52.67。作者称随机配色ASR更高。
- 排列(Table 13):4×3、6×2、3×4、2×6。4B上2×6为49.47,高于4×3的48.13。作者称4×3稳健,ASR对排列不敏感。
- 分辨率与字体(Table 14):100×60与comic font。4B为47.47与44.80,对照主设置48.13。作者称文字可读时这两项不带来大的ASR差别。
有什么可以进一步探索的点?
论文未专论自身局限;结论呼吁为OCR模块建立抗跨模态语义干扰的防御。
作者指出的局限与后续方向
- 论文没有Limitations、Discussion或Future Work节,也没有把某一实验设定写成方法本身的不足。
- Conclusion称当前安全对齐存在缺口,并呼吁为OCR模块开发能抵抗跨模态语义干扰攻击的防御。这是文中明确写出的后续方向。
实验覆盖范围
- 受害模型为三个Qwen3-VL Instruct变体,以及gpt-4o-mini、gpt-4.1-mini、gemini-2.5-flash,共6个;生成温度0.1(Sec. 4.1)。
- 有害查询为HADES 750条与HEx-PHI 300条;干扰池为100条科学与文化问句(Sec. 4.2)。基线为HADES与CS-DJ;HEx-PHI未包含HADES方法(Sec. 4.3–4.4)。
- 护栏为OpenAI Moderation API、GuardReasoner-VL-3B、GuardReasoner-VL-7B。Table 3与Table 4只报告三个开源模型和HADES类别。消融在开源模型上(Sec. 5)。
- 评审为beaver-dam-7b;分解为Qwen2.5-3B-Instruct。EASR把Algorithm 1重复5次(附录A.1)。主实验ASR的重复次数论文未报告。
- 论文未报告评审与人工判定的一致性,也未报告单次攻击的查询次数或耗时。
总结一下论文的主要内容
Text-DJ以黑盒文本图网格越狱六个LVLM,平均ASR高于所列基线,护栏下仍有成功样本。
Text-DJ是一种black-box、model-agnostic的LVLM越狱:不访问梯度或参数,只把文本写成图片。
- 问题:作者认为现有防护偏文本过滤或相关画面,white-box和模型专用图像攻击又难以用到GPT、Gemini这类API模型。论文要利用OCR读入被拆散的有害文本。
- 方法:Qwen2.5-3B-Instruct把有害查询拆成3个更含蓄的子查询;all-MiniLM-L6-v2贪心选取9条余弦相似度最低的干扰问句;TiI做成4×3图,子查询放在位置6、8、12,再指示模型回答这些位置。受害模型温度0.1。
- 主结果:HADES上Text-DJ平均ASR,GPT 4.1 mini为64.27%,Gemini-2.5-Flash为44.00%,三个Qwen3-VL为48.13%、52.67%、57.60%(Table 1)。HEx-PHI上GPT 4.1 mini为60.33%(Table 2)。六行平均都高于表中的CS-DJ和HADES方法,但Animal等类别有Text-DJ更低的格子。
- 护栏与重复:OpenAI Moderation API对Text-DJ输入的拒绝率为0.00%(Table 4)。GuardReasoner-VL-7B下,Qwen3-VL-4B的HADES平均ASR为39.20%(Table 3)。五次运行的EASR在Qwen3-VL-8B上为82.13%(Table 5)。
- 作者结论:作者认为成功来自文本入图绕过文本过滤,以及无关查询造成的语义干扰;并认为这利用了LVLM的OCR能力中的漏洞。Conclusion呼吁为OCR模块建立能抵抗跨模态语义干扰的防御。