攻击arXiv 2605.18915
DMN:面向多图输入的多模态大模型组合式越狱框架
提出多图越狱框架 DMN,把有害意图拆进图像序列绕过安全护栏
- arXiv
- 2605.18915
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-4V、GPT-4o、GPT-5 等 10 个
提出多图越狱框架 DMN,把有害意图拆进图像序列绕过安全护栏
提出删字变体越狱方法,利用重构与隐藏权衡绕过多模态模型安全过滤
提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标
MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。
提出 Text-DJ,用拆分文本图网格越狱视觉语言模型
提出多轮多模态越狱,并用 FragGuard 拦截有害响应
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器
提出图像排版操纵与多轮提示越狱,绕过交通场景视觉语言模型安全对齐