跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.38899· Wenyu Chen, Li Wang, Chuanchao Zang, Xiangtao Meng, Xinyu Gao, Jianing Wang, Zheng Li, Shanqing Guo·· 2 天前精选关注度80

SceneJail:利用视频场景上下文越狱多模态大模型

SceneJail: Exploiting Video Scenario Context to Jailbreak Multimodal LLMs

AI 导读

研究者提出 SceneJail,一个自适应黑盒越狱框架,把视频中的周边场景而非有害查询的呈现方式当作攻击面:同一有害查询放在不同视频场景中,会得到不同的安全响应。框架由两部分组成:自适应场景构建搜索与有害查询语境相容的场景,场景感知提示搜索再根据黑盒响应反馈为该场景搜索文本引导。在 HADES 和 SafeBench 数据集、八个 Video-MLLM(含 GPT-4.1 和 Gemini 3.5 Flash 两个闭源模型)上,持续完整呈现查询的 SceneJail-F 平均攻击成功率最高 91.5%,比最强基线高 29.1 个百分点;把查询分散到连续帧的 SceneJail-S 在严格图像过滤下仍保持 72.3%。

论文速读

问题
Video-MLLM 仍易被越狱攻击诱导出违规回答。已有视频越狱多把视频当作呈现有害 query 的载体,只改变 query 的视觉编码或帧间排布,而视频所处的周边场景(环境、活动、角色行为)作为攻击面尚未被系统研究。
方法
作者提出 SceneJail,一个黑盒自适应越狱框架,保持原始有害 query 内容不变,只操纵其周边视频场景与配套文本提示。它包含两个协同组件:Adaptive Scenario Construction 动态搜索与 query 语境兼容的场景,必要时以 query 为引导扩展场景池;Scenario-aware Prompt Search 借助黑盒响应反馈搜索场景定制的文本引导,并复用同一场景下曾成功的提示。query 可以完整呈现(SceneJail-F)或按顺序分散到连续帧(SceneJail-S)。
实验与结果
在 HADES 和 SafeBench 上对八个 Video-MLLM(含 GPT-4.1 与 Gemini3.5-Flash)评测。SceneJail-F 平均 ASR 达 91.5% 和 78.9%,比最强基线高 29.1 和 35.0 个百分点;SceneJail-S 为 89.4% 和 76.6%,在图像过滤下仍保持 72.3% ASR。消融显示周边场景、自适应场景构建与自适应提示搜索均有贡献;结果对 T2V 骨干、外部 LLM、评测协议和 query 顺序不敏感。
局限与可以继续做的
作者指出两点局限:一是依赖自适应场景与提示搜索,带来额外搜索和生成开销,未来可用轻量生成模型、更有效的场景复用和更省 query 的搜索策略提升效率;二是评测使用受控的视频构建流程,可能未覆盖自然视频、更长时序上下文和更多样的场景–query 组合,未来可扩展到自然发生的视频。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文把视频场景本身当作攻击面,并给出跨八个 Video-MLLM 的成功率与三种防御下的表现,可供多模态安全评测参考。

阅读原文arxiv.org