SceneJail:利用视频场景上下文越狱多模态大模型
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
- arXiv
- 2609.38899
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Qwen2.5-VL-7B-Instruct、Qwen2.5-VL-32B-Instruct、Qwen3-VL-8B-Instruct 等 8 个
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 RISE,迭代演化可复用策略对文生图模型做红队
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
提出 AdvPIE,在黑盒下搜索表面无害却生成有害图像的提示
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 ARENA 音频红队框架,自动构造文本安全且音频接地的越狱输入
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标
MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。
提出 StyleBreak 风格化音频越狱,利用语音属性绕过音频语言模型对齐
提出 SeedSnitch 与 PromptPirate,恢复种子后窃取扩散提示词
提出 Prometheus,从展示图反推文生图模型的在售提示词
Prometheus 是针对文生图市场 showcase 的训练无关提示词窃取:攻击者看不到在售文本,只用本地开源 proxy 恢复 subject 和 modifier,并希望换 subject 后风格仍在。
提出 RedDiff,用强化扩散生成图像审计 VLM 情境安全失效
RedDiffuser 是黑盒审计框架:有害内容不是显式攻击指令,而是固定的部分有毒文本,再配上扩散模型生成的图像,看 VLM 的开放续写会不会变得不安全。