SceneJail:利用视频场景上下文越狱多模态大模型
提出SceneJail,利用视频情境上下文越狱视频多模态模型
- 研究定位:论文针对 Video-MLLM 的安全对齐脆弱性,首次系统性研究了视频情境上下文作为越狱攻击面的可行性。
- 核心问题:现有视频越狱主要将视频作为承载文本的载体,忽略了周围视频情境对模型判断的影响;实验发现同一有害查询在不同视频情境下会触发不同的安全响应。
- 方法设计:提出自适应黑盒越狱框架 SceneJail,在不改变原始恶意查询的前提下,通过自适应情境构建动态匹配并生成适配视频情境,并通过情境感知提示词搜索机制在黑盒反馈下优化文本引导。
- 核心实验结果:在 HADES 基准上,SceneJail-F 与 SceneJail-S 在 8 个目标模型上的平均 ASR 分别达 91.47% 与 89.42%,超过最强基线 SPTV(62.38%);在 SafeBench 上平均 ASR 达 78.90% 与 76.63%,超过最强基线 MCV(43.95%);在图像过滤防御下,分帧变体 SceneJail-S 仍保持 72.25% 的平均 ASR。
- 作者结论与启示:作者指出,视频模型的安全评估必须将视觉情境、文本内容及时序展示综合考量,现有针对单帧图像的防护手段无法有效抵御情境化与时序分散的多模态攻击,亟需开发针对视频特性的原生安全防护机制。