跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.38253· Zhiyi Mou, Yao Lu, Wangze Ni, Di Hong, Dakun Shen, Haoyang Li, Chen Jason Zhang, Alexander Zhou, Kui Ren·· 2 天前精选关注度76

CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

CollageAttack: Exploiting Cross-Modal Alignment Flaws in T2I Models through Spatial Text Composition

AI 导读

浙江大学与香港理工大学的研究者提出 CollageAttack,一种单提示词黑盒越狱方法,把有害意图拆成不完整的文本片段,分散放置在场景中自然存在的载体上,让语义在图像平面通过空间组合重新显现。在 GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro、HiDream-O1-Image 和 FLUX.2 [dev] 五款 T2I 模型上,该方法在全部目标上取得最高攻击成功率,聚合 ASR 为 77.0%,最高达 86.0%,比同模型最强基线高 18.5 个百分点。跨模型平均有害性评分为 6.12/10,高于最强基线的 4.23/10;在 HiDream-I1 上为 5.38 对 1.69。消融显示,单独使用任一组件的有害性得分分别为 0.25、5.47 和 0.53,三者组合达到 6.41。

论文速读

问题
T2I 模型的语言理解、图内文字渲染和视觉构图能力提升,但安全机制未同步跟上,形成跨模态攻击面:有害语义在序列化 prompt 中不显眼,却能在图像层面的组合中显现。作者想探究有害意图能否被拆分到文本与视觉组件中,使其在 prompt 中不明确、却在生成图像后被语义重建。
方法
提出 CollageAttack,一种自动化单 prompt 黑盒越狱框架,把语义组装从序列化 prompt 转移到图像平面。它由三部分组成:Context-Aware Scene Construction 建立与源意图相关的场景;Thematic Surface Allocation 选取场景中自然的承载物;Harmful-Intent Fragmentation and Spatial Recomposition 把源表达拆成三到四个短语片段并分布到这些承载物上。三段命令由 prompt 构建 LLM 一次性生成,合成单个 prompt,仅需一次生成请求,无需模型参数或内部安全机制。
实验与结果
在五个 T2I 模型(GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro、HiDream-O1-Image、FLUX.2)和 DGHS 数据集的 200 条 hate 样本上,与 Original、PGJ、SneakyPrompt、JailFuzzer 对比。CollageAttack 在全部五个模型上取得最高 ASR,聚合 ASR 77.0%,最强基线 SneakyPrompt 为 47.5%,单模型最高 86.0%,比同模型最强基线高 18.5 个百分点;平均有害性得分跨模型 6.12/10,基线为 4.23/10。语义相似度在 Google 评估器下达 8.14,高于 SneakyPrompt 的 6.88;是唯一在五个模型上平均视觉强于文本得分均为正的方法。消融显示三组件完整配置平均有害性 6.41,高于最强单组件 5.47。
局限与可以继续做的
评估中初始判为 Harmless 的输出最多可被评估三次并保留首次 Harmful 判定,可能抬高 ASR。视觉强于文本指标衡量的是沟通强度而非语义等价或真实受众效果。作者称研究目的是刻画现有防护的弱点以支持更有效防御,未在材料中给出具体后续方向。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文给出跨模态越狱在五款 T2I 模型上的成功率与消融结果,做图像安全护栏的团队可据此检查文本过滤之外的图像平面组合风险。

阅读原文arxiv.org