CollageAttack 利用跨模态对齐缺陷越狱 T2I 模型
先了解这件事
浙江大学与香港理工大学研究者提出 CollageAttack,一种单提示词黑盒越狱方法:把有害意图拆成不完整的文本片段,分散放置在场景中自然存在的载体上,让语义在图像平面通过空间组合重新显现。该方法在 GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro、HiDream-O1-Image 和 FLUX.2 [dev] 五款 T2I 模型上,于全部目标取得最高攻击成功率。另一项研究用自动化流程把合法新闻标题改写成色情、暴力血腥、有害刻板印象、自残和仇恨言论提示词,系统评测五款开源文生图模型的有害内容生成能力;对 1,500 张生成图像的人工评估显示,血腥类有害内容生成率达 89.2%,色情 47.6%,有害刻板印象 43.6%,仇恨言论 46.0%,自残 34.5%,且多以血腥暴力形式出现;社区微调变体在色情提示词上尤其脆弱,FLUX.1-dev 有 30.9% 的案例生成明显逼真的内容。
AI 根据报道生成 · 45 分钟前更新
事件进展
- 10月5日 23:22 · 1 篇报道Harmful Content Generation in Text-to-Image Models: Capabili
- 9月29日 16:23 · 1 篇报道CollageAttack 利用跨模态对齐缺陷越狱 T2I 模型
后续时间线
- 论文追踪研究评测五款开源文生图模型的有害内容生成与审核缺口
研究团队用自动化流程把合法新闻标题改写成针对色情、暴力血腥、有害刻板印象、自残和仇恨言论的提示词,系统评测了五款开源文生图模型的有害内容生成能力。对 1,500 张生成图像的人工评估显示,血腥类提示词的有害内容生成率达 89.2%,色情内容 47.6%,有害刻板印象 43.6%,仇恨言论 46.0%,自残 34.5%,且多以血腥暴力形式出现。社区微调变体在色情提示词上尤其脆弱,FLUX.1-dev 有 30.9% 的案例生成明显逼真的有害图像。对自动审核系统的评估发现明显检测缺口,不安全图像可绕过过滤;合成图像检测器方面,仅用良性数据训练的模型在露骨内容上表现更差,训练数据更多样则检测效果更好。
- arXiv:越狱、提示注入、投毒与防御精选CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱
浙江大学与香港理工大学的研究者提出 CollageAttack,一种单提示词黑盒越狱方法,把有害意图拆成不完整的文本片段,分散放置在场景中自然存在的载体上,让语义在图像平面通过空间组合重新显现。在 GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro、HiDream-O1-Image 和 FLUX.2 [dev] 五款 T2I 模型上,该方法在全部目标上取得最高攻击成功率,聚合 ASR 为 77.0%,最高达 86.0%,比同模型最强基线高 18.5 个百分点。跨模型平均有害性评分为 6.12/10,高于最强基线的 4.23/10;在 HiDream-I1 上为 5.38 对 1.69。消融显示,单独使用任一组件的有害性得分分别为 0.25、5.47 和 0.53,三者组合达到 6.41。
相关讨论
关注度走势
每天新增来源
- 9月29日 新增 1 个来源(1 家媒体、0 个账号)
- 9月30日 新增 0 个来源(0 家媒体、0 个账号)
- 10月1日 新增 0 个来源(0 家媒体、0 个账号)
- 10月2日 新增 0 个来源(0 家媒体、0 个账号)
- 10月3日 新增 0 个来源(0 家媒体、0 个账号)
- 10月4日 新增 0 个来源(0 家媒体、0 个账号)
- 10月5日 新增 1 个来源(1 家媒体、0 个账号)
- 10月6日 新增 0 个来源(0 家媒体、0 个账号)