SceneJail:利用视频场景上下文越狱多模态大模型
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
- arXiv
- 2609.38899
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Qwen2.5-VL-7B-Instruct、Qwen2.5-VL-32B-Instruct、Qwen3-VL-8B-Instruct 等 8 个
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出推理通道预填与输出前缀组合攻击以越狱推理模型
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出广度优先后缀搜索 BOSS,改进 GCG 越狱优化
BOSS 是插在 GCG 类离散 suffix 优化上的搜索框架:局部梯度更新不变,变的是固定预算花在深度还是广度。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
提出纯视觉越狱攻击 VJA,把有害编辑指令编码进图像
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核
摘要利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。