攻击arXiv 2609.38899
SceneJail:利用视频场景上下文越狱多模态大模型
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
- arXiv
- 2609.38899
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Qwen2.5-VL-7B-Instruct、Qwen2.5-VL-32B-Instruct、Qwen3-VL-8B-Instruct 等 8 个
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 ARENA 音频红队框架,自动构造文本安全且音频接地的越狱输入
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
提出多图越狱框架 DMN,把有害意图拆进图像序列绕过安全护栏
提出删字变体越狱方法,利用重构与隐藏权衡绕过多模态模型安全过滤
提出纯视觉越狱攻击 VJA,把有害编辑指令编码进图像
提出 Text-DJ,用拆分文本图网格越狱视觉语言模型
提出多轮多模态越狱,并用 FragGuard 拦截有害响应
提出图像排版操纵与多轮提示越狱,绕过交通场景视觉语言模型安全对齐
提出 StyleBreak 风格化音频越狱,利用语音属性绕过音频语言模型对齐
提出 RedDiff,用强化扩散生成图像审计 VLM 情境安全失效
RedDiffuser 是黑盒审计框架:有害内容不是显式攻击指令,而是固定的部分有毒文本,再配上扩散模型生成的图像,看 VLM 的开放续写会不会变得不安全。