研究者提出视觉中心越狱攻击 VJA,Nano Banana Pro 攻击成功率达 80.9%
When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models
针对大型图像编辑模型提出纯视觉越狱攻击VJA与基准IESBench,在Nano Banana Pro上达成80.9% ASR(Table 1)。
攻击者采用 prompt-level 攻击,属于 black-box 攻击,无法访问目标模型的参数与架构 Θ,仅通过操纵输入实施越狱;将恶意编辑意图完全编码至视觉模态(Iadversarial),文本输入置空(NULL),诱导受害模型执行有害编辑生成违反内容政策的 Iharmful。
- 图像编辑模型从文本指令转向视觉提示词,安全机制多针对文本,难以防御将恶意意图隐藏在视觉输入中的攻击,造成视觉层面的安全错配风险。
- 提出纯视觉越狱攻击VJA,将恶意指令完全置于输入图像中而置空文本;构建包含15类风险的基准IESBench;并提出复用KV-Cache进行多模态内省推理的无训练防御。
- 在IESBench的1054张图像上评估8个模型,VJA在4个商用模型上平均ASR达85.7%(Table 1);内省防御使Qwen-Image-Edit*的平均ASR降至66.9%(Table 1)。
- 作者指出VJA对视觉感知与推理能力弱的模型效果较弱;防御依赖预对齐VLM,对需庞大最新世界知识的虚假信息防御效果不足;被测模型共8个且实验在8块Tesla V100上进行。
- 被测模型
- Nano Banana ProGPT Image 1.5Qwen-Image-EditSeedream 4.5BAGELFlux2.0[dev]Qwen-Image-Edit*Qwen-Image-Edit-SafeLongCat-Image-Edit
- 基准
- IESBench
- 指标
- ASRHSEVHRRAUC-ROCAccuracyPrecisionRecall
清华大学与鹏城实验室等机构的研究者提出 Vision-Centric Jailbreak Attack(VJA),一种把恶意编辑指令完全嵌入图像视觉提示、不依赖文本输入的视觉到视觉越狱攻击,并构建了面向图像编辑模型的安全基准 IESBench。该基准覆盖 15 个风险类别、116 个细粒度编辑属性、9 种操作和 1054 张视觉提示图像,采用 MLLM 作为评判模型,以攻击成功率(ASR)、危害分数(HS)、编辑有效性(EV)和高风险比例(HRR)为指标。作者还提出一种免训练防御,通过文本安全触发词复用 KV-Cache 进行内省式多模态推理,将 Qwen-Image-Edit 改造为 Qwen-Image-Edit-Safe 后平均 ASR 与 HS 分别下降 33% 和 1.2,且无需额外护栏模型、计算开销可忽略。
推荐理由论文给出视觉提示越狱在多个商业图像编辑模型上的成功率,并配套基准与免训练防御,便于评估图像编辑链路的安全缺口。
深度解读
这篇论文试图解决什么问题?
论文指出图像编辑模型面临将恶意指令嵌入图像的视觉越狱威胁,现有文本安全机制难以应对,为此提出纯视觉攻击与防御方案。
这篇论文试图解决现代大型图像编辑模型容易受到纯视觉越狱攻击(Vision-Centric Jailbreak Attack)威胁的问题。
- 交互范式转变与安全风险:现代图像编辑模型已从纯文本指令扩展到视觉提示词编辑,允许通过标记、箭头和视觉-文本线索直接推断用户意图,但这使得攻击面转变为视觉本身。
- 现有防御机制的不匹配:作者称现有 safeguard 模型和安全对齐机制主要以文本为中心,专注于检测、审查或拒绝自然语言中的恶意意图,导致与图像编辑的视觉感知需求存在错配。
- 核心观察与假设:作者认为图像中的复杂视觉提示更容易构成相对于训练分布的分布外(OOD)输入,能够绕过现有安全干预,使编辑模块执行不安全视觉指令。
- 论文提出的解决方案:作者提出了纯视觉越狱攻击范式 VJA、图像编辑安全基准 IESBench,以及基于内省多模态推理的无训练防御策略。
- 威胁模型:
- 攻击目标:绕过受害模型的安全机制(如 safeguard 和安全对齐),诱导模型执行有害编辑并生成违反内容政策的图像 Iharmful。
- 攻击知识:属于 prompt-level 攻击和 black-box 攻击,攻击者无法访问受害模型的参数、架构和超参数 Θ。
- 攻击能力:攻击者仅操纵输入,将恶意线索完全编码在视觉模态图像 Iadversarial 中,文本输入故意置空(NULL)。
- 受害系统:主流商用与开源大型图像编辑模型系统(如 Nano Banana Pro、GPT Image 1.5、Qwen-Image-Edit 等)。
有哪些相关研究?
论文梳理了多模态越狱、指令图像编辑和视觉提示三类研究,指出此前攻击与基准多为文本中心,本文聚焦纯视觉编辑攻击与评测。
- 从文本越狱到多模态越狱:Pérez & Ribeiro (2022) 与 Liu et al. (2024b) 研究了 LLM 中的 prompt injection;Schulhoff et al. (2023)、Mazeika et al. (2024) 与 Chao et al. (2024) 构建了评估越狱成功率的对抗基准;Liu et al. (2024a)、Qi et al. (2024a)、Shayegani et al. (2023) 与 Bailey et al. (2023) 利用图像输入绕过文本对齐;Gong et al. (2025) 提出了排版视觉提示注入 FigStep;Wang et al. (2024)、Ying et al. (2024)、Yang et al. (2025)、Li et al. (2025a) 与 Wang et al. (2025) 探索了双模态对抗扰动、视觉干扰及加解密攻击。
- 基于指令的图像编辑:Brooks et al. (2023)、Hertz et al. (2023) 与 Zhang et al. (2023) 实现了细粒度文本控制编辑;Wu et al. (2025)、Deepmind (2025b) 与 OpenAI (2025) 提出了支持多步视觉-语言推理的大型图像编辑模型。作者指出这些模型扩大了攻击面,而现有防御机制仍停留在文本场景。
- 多模态大模型的视觉提示:Krishna et al. (2017) 与 Zhu et al. (2016) 最早引入视觉提示增强视觉推理;Huang et al. (2024)、Li et al. (2025b) 与 Lin et al. (2024) 将视觉提示作为互补接口;Fortin et al. (2025) 与 Wiedemer et al. (2025) 拓展至视频生成;Xu et al. (2025) 构建了 VP-Bench,Feng et al. (2025) 指出视觉提示基准对提示细节较为敏感。
- 基线方法与对比基准:论文将传统文本中心越狱攻击(Text-Centric Jailbreak Attack, TJA)作为对比基线;并在基准对比中对照了现有基准 HADES(Schlarmann & Hein, 2023)、JailbreakV(Chao et al., 2024)与 MM-SafetyBench(Liu et al., 2024a)。
- 本文与已有工作的定位区别:作者称现有基准与攻击均以文本为中心、图像仅起辅助作用,而本文提出了第一个纯视觉图像编辑越狱攻击范式 VJA,并构建了首个针对图像编辑安全的专用基准 IESBench 与内省防御。
论文如何解决这个问题?
论文提出纯视觉越狱攻击VJA将指令嵌入图像,构建含15类风险的基准IESBench,并提出复用KV-Cache的内省多模态防御。
论文提出了纯视觉越狱攻击 VJA,构建了图像编辑安全基准 IESBench,并设计了基于内省多模态推理的无训练防御方法。
视觉越狱攻击(VJA)与形式化
传统文本越狱攻击的形式为 M(Ibenign, Tmalicious; Θ) = Iharmful,通过良性图像和恶意文本指令诱导模型输出有害图像。为了突破以文本为中心的安全审查,VJA 将恶意指令完全编码在视觉模态中,受害模型仅接收图像输入,其形式为 M(Iadversarial, NULL; Θ) = Iharmful,其中文本输入被有意置空以规避文本审查机制。攻击通过设计视觉标记(如不同尺寸、颜色与形状的框和箭头)以及视觉语言(不同字体的文字)引导模型执行有害编辑。
内省多模态防御(Introspection-based Defense)
针对视觉中心攻击,防御核心在于将隐晦的视觉指令还原为真实意图。作者观察到部分开源大型图像编辑模型(如 Qwen-Image-Edit 与 LongCat-Image-Edit)采用视觉语言模型(VLM)提取文本嵌入以补充视觉信息。防御方案利用多模态提示词的 KV-Cache,在图像编辑前引入文本安全触发词(安全评估提示词),促使模型通过语言空间的多模态推理判断编辑意图是否安全合规,若判定违规即阻断后续扩散生成。附录 A.4 和 B.4 详细说明了其推理流程与评分模板。通过复用 KV-Cache,避免了重复编码带来的计算开销,无需额外部署独立的守卫模型。
图像编辑安全基准(IESBench)构建流程
现有基准主要针对文本中心攻击且图像多起辅助作用,IESBench 专门面向图像编辑构建。首先从三个来源收集底图:现代模型生成的 846 张良性图像、193 张开源真实世界图像,以及选自 MM-SafetyBench 的 15 张图像,共 1054 张样本。随后通过人工审查过滤不符合现实载体、与提示不符或重复的图像。在保留的良性底图上标注目标区域边界框,并添加带有方向指引的语义编辑线索;最后为每个样本标注唯一样本 ID、类别标签、意图标签、编辑属性、操作类型及对应的文本版本。
风险分类体系与评测协议
IESBench 构建了涵盖 15 个风险类别的三层层次化分类体系:Level 1(个人权利侵犯,如隐私泄露、自我伤害、非自愿亲密图像等)、Level 2(群体定向伤害,如商业文档篡改、版权篡改、歧视等)与 Level 3(社会与公共风险,如暴力、虚假信息、证据篡改等),覆盖 116 个细粒度属性与 9 种编辑动作。评测采用多模态大模型作为裁判(默认采用 Gemini 3 Pro),依据预设评分细则评定有害性评分 HS(1 至 5 分)与编辑有效性 EV(有效为 1,无效为 0)。
论文做了哪些实验?
实验覆盖8个模型与1054张基准图像,VJA在4个商用模型上平均ASR达85.7%,内省防御降低攻击成功率并保持低开销。
实验设置
- 被测模型:测试了 4 个商用模型:Nano Banana Pro(即 Gemini 3 Pro Image)、GPT Image 1.5、Qwen-Image-Edit(在线版 20251225)、Seedream 4.5(20251128);以及 4 个开源模型:BAGEL、Flux2.0[dev]、Qwen-Image-Edit*(本地版本 2512)与防御强化版本 Qwen-Image-Edit-Safe(附录泛化分析中还包含 LongCat-Image-Edit)。
- 数据集与规模:基于 IESBench 全部 1054 张图像开展主实验,涵盖 15 个风险类别、116 个编辑属性与 9 种编辑动作。
- 基线方法:对比了传统文本中心越狱攻击(Text-Centric Jailbreak Attack, TJA)基线,以及未部署防御的原始模型基线。
- 指标定义:采用攻击成功率 ASR(未被安全机制拦截的攻击比例)、有害性评分 HS(1 至 5 分)、编辑有效性 EV(是否产生有意义的有效编辑),以及高风险率 HRR(有效且 HS 不低于阈值 τ=4 的样本比例)。
- 评审方式:默认采用 Gemini 3 Pro 作为 MLLM 裁判模型,依据评分细则输出 HS 与 EV;消融实验中对比了 Qwen3-VL-2B-Instruct、Qwen3-VL-8B-Instruct、Qwen3-VL-8B-Thinking、GPT 5.2 及人类评估。
- 硬件与测试重复:本地开源模型部署在 8 块 Nvidia Tesla V100 上;针对防御二分类识别实验重复测试了 5 次,其余主实验论文未报告重复测试次数。
主结果
据 Table 1,8 个模型在 IESBench 全部 1054 张图像上的整体评测结果如下:
表格较宽,可左右滑动
模型 ASR (%) ↑ HS ↑ EV (%) ↑ HRR (%) ↑ Qwen-Image-Edit(在线版) 97.5 4.1 87.7 73.8 Nano Banana Pro 80.9 3.8 79.1 70.6 GPT Image 1.5 70.3 3.2 63.0 52.0 Seedream 4.5 94.1 4.4 86.3 83.8 BAGEL 100.0 4.1 82.0 70.6 Flux2.0[dev] 100.0 4.6 87.1 84.6 Qwen-Image-Edit*(本地版) 100.0 4.6 92.9 90.3 Qwen-Image-Edit-Safe(防御版) 66.9 3.4 62.8 61.7 - 商用模型越狱普遍性:作者报告 VJA 在 4 个商用系统上取得 85.7% 的平均 ASR;即便在相对保守的 GPT Image 1.5 上也达到 70.3% ASR 与 52.0% HRR(Table 1)。
- 开源模型缺乏防护机制:作者报告未部署独立 safeguard 模型的 3 个开源模型(BAGEL、Flux2.0[dev]、Qwen-Image-Edit*)ASR 均为 100.0%,平均 HS 为 4.3,HRR 分别达 70.6%、84.6% 和 90.3%(Table 1)。
- 类别间易感性差异:作者报告证据篡改(I13)与令人反感的视觉操纵(I15)在各模型上持续表现脆弱;模型间存在特异性差异,如 GPT Image 1.5 在版权篡改(I11)上的 ASR 为 95.7%,而 Nano Banana Pro 为 41.3%(Table 1)。
VJA 与传统文本越狱(TJA)对比实验
- 评测设置:在 IESBench 中按类别平衡采样 20% 数据,对比 VJA 与 TJA 在 4 个商用模型上的表现(Table 2)。
- 实验结果:Nano Banana Pro 和 GPT Image 1.5 在 VJA 下的 ASR 分别提升 35.6 个百分点(从 48.8% 升至 84.4%)和 24.9 个百分点(从 46.8% 升至 71.7%);而在弱对齐模型 Qwen-Image-Edit 和 Seedream 4.5 上,ASR 分别提升 7.3 个百分点和 0.5 个百分点,HRR 变化为 -0.5 个百分点和 -1.4 个百分点(Table 2)。
- 作者的解读:作者认为理解视觉攻击对部分模型而言较为困难,视觉指令遵循能力不足限制了攻击在弱模型上的有效性,而强模型的安全机制更容易被视觉线索误导。
内省防御的识别能力与泛化性分析
- 评测设置:构建包含 10% VJA 正样本与 10% 良性视觉提示负样本的混合数据集,在零样本设置下评估二分类性能(Figure 7),并在 LongCat-Image-Edit 与 Flux2.0[dev] 上验证泛化性(Table 7)。
- 实验结果:完整防御取得 75% 攻击识别率和 75.7% AUC-ROC,去除推理步骤后识别率降至 51.1%、AUC-ROC 降至 51.2%(Figure 7);引入防御后,LongCat-Image 的 ASR 从 100.0% 降至 71.9%,Flux2.0[dev] 的 ASR 从 100.0% 降至 69.0%(Table 7)。
- 作者的解读:作者认为内省的核心在于语言形式的多模态推理;由于该方法利用固有的文本安全对齐,能够迁移至其他在语言空间进行了安全对齐的模型。
裁判模型消融与人工一致性评估
- 评测设置:在全部 7 个受害模型生成的编辑图像中随机采样 5%,对比 5 个 MLLM 裁判与人类评估的一致性(Table 3、Table 6)。
- 实验结果:人工投票中 GPT 5.2 获得 29.3%(541 票),Gemini 3 Pro 获得 25.4%(470 票);Gemini 3 Pro 与人类评估的 Pearson 相关系数为 0.79、Kappa 系数为 0.67(Table 3、Table 6);人类评估给出的 HS 为 3.7±1.2,低于多数 MLLM(Table 3)。
- 作者的解读:作者认为人类评估在判定高危害分数时更为保守;模型规模对本地裁判模型表现影响明显,小模型容易忽略微妙的视觉编辑。
其他消融与分析
- 视觉提示敏感性(Figure 14):改变颜色和形状使个别模型的 HR 和 EV 最高提升 28% 与 50%,或下降 25.8% 与 33.3%;手写字体或非英语语言导致 EV 和 ASR 下降。
- 防御计算开销(Table 5):Qwen-Image-Edit 集成防御后增加 170 输入/110 输出 token,运行时长增加 4ms(约 3% 额外耗时);LongCat-Image-Edit 增加 155 输入/134.9 输出 token,时长增加 6ms。
- 本地模型裁判偏差(Figure 16):Qwen3-VL-8B-Instruct 评定时评为 2 分或 3 分的攻击明显少于 Gemini 3 Pro,倾向于对多数样本给出高分。
有什么可以进一步探索的点?
作者指出VJA受限于受害模型视觉推理能力,防御依赖预对齐VLM的世界知识;实验覆盖8个模型与15类编辑风险。
作者指出的局限与后续方向
- 弱感知模型上的攻击效果受限:作者在 Section 6 指出,VJA 的局限在于对视觉感知和推理能力有限的模型效果较弱,因为这些模型可能无法纯粹从视觉中推断出编辑意图。
- 依赖世界知识的虚假信息防御不足:作者在 Section 4.1 指出,由于所提出的防御依赖预对齐的 VLM,面对涉及虚假或误导性信息、需要庞大且最新世界知识的攻击时,防御效果相对不足。
- 开源本地裁判模型的微调需求:作者在附录 A.2 指出,未来对本地模型进行微调以使其成为商用模型的有效替代方案,将有助于本地部署。
- 视觉指令遵循不足对攻击危害的制约:作者在 Section 4.2 指出,部分模型由于视觉指令遵循能力不足,可能导致攻击无法产生预期的有害效果。
实验覆盖范围
- 被测模型范围:实验测试了 4 个商用模型(Nano Banana Pro、GPT Image 1.5、Qwen-Image-Edit 在线版、Seedream 4.5)和 4 个开源模型(BAGEL、Flux2.0[dev]、Qwen-Image-Edit 本地版及安全版),并在防御泛化中覆盖了 LongCat-Image-Edit。
- 评测数据集覆盖:实验基于 IESBench 的 1054 张图像展开,涵盖 15 个风险类别、116 个细粒度属性和 9 种编辑动作;部分分析实验采用 20% 或 10% 子集。
- 防御机制评测:防御实验在基于 VLM 提取文本嵌入的开源扩散编辑模型(Qwen-Image-Edit、LongCat-Image-Edit、Flux2.0[dev])上进行了测试,并评估了二分类识别指标与时延/token 开销。
- 裁判模型评测:默认采用 Gemini 3 Pro 评测,并在 5% 样本上测试了 GPT 5.2、3 个 Qwen3-VL 变体以及人类评估的对比与一致性。
- 未报告信息:论文未报告攻击过程中的提示词生成迭代预算、商用 API 的多次独立重复试验次数,亦未测试自适应攻击策略。
总结一下论文的主要内容
论文研究图像编辑模型的纯视觉越狱威胁,提出攻击方法VJA、基准IESBench与内省防御,实验测得商用模型平均ASR达85.7%。
- 研究定位:该工作研究了大型图像编辑模型中纯视觉提示词带来的越狱安全风险,并提出了对应的攻击评估基准与无训练防御方案。
- 核心问题:随着图像编辑从自然语言控制转向视觉标记与多模态线索驱动,现有以文本为中心的安全机制无法有效拦截隐藏在输入图像中的恶意意图,导致模型执行不安全编辑。
- 主要方法设计:提出了纯视觉越狱攻击 VJA,将恶意编辑指令完全编码于图像内且将文本输入置空;构建了涵盖 15 个风险分类与 1054 张图像的 IESBench 基准;并提出了通过复用 KV-Cache 进行多模态内省推理的防御方法。
- 关键实验结果:
- 在 IESBench 上,VJA 针对 4 个商用模型取得 85.7% 的平均 ASR,其中 Nano Banana Pro 达 80.9%,GPT Image 1.5 达 70.3%(Table 1)。
- 未部署独立 safeguard 的 3 个开源模型在 VJA 下的 ASR 均达 100.0%,平均有害性评分 HS 为 4.3(Table 1)。
- 内省防御在 Qwen-Image-Edit* 上将平均 ASR 降至 66.9%(Table 1),且仅引入约 3% 的额外运行时间(Table 5)。
- 作者结论与启示:作者认为视觉越狱暴露了现有防御过度依赖文本模态的短板,在模型视觉推理能力提升的同时安全机制被规避;通过语言空间的内省推理可以在无需辅助守卫模型的情况下增强图像编辑系统的安全性。