SceneJail:利用视频场景上下文越狱多模态大模型
研究者提出 SceneJail,一个自适应黑盒越狱框架,把视频中的周边场景而非有害查询的呈现方式当作攻击面:同一有害查询放在不同视频场景中,会得到不同的安全响应。框架由两部分组成:自适应场景构建搜索与有害查询语境相容的场景,场景感知提示搜索再根据黑盒响应反馈为该场景搜索文本引导。在 HADES 和 SafeBench 数据集、八个 Video-MLLM(含 GPT-4.1 和 Gemini 3.5 Flash 两个闭源模型)上,持续完整呈现查询的 SceneJail-F 平均攻击成功率最高 91.5%,比最强基线高 29.1 个百分点;把查询分散到连续帧的 SceneJail-S 在严格图像过滤下仍保持 72.3%。
推荐理由论文把视频场景本身当作攻击面,并给出跨八个 Video-MLLM 的成功率与三种防御下的表现,可供多模态安全评测参考。