跳到正文
原文
论文追踪· arXiv:2601.05339· Badhan Chandra Das, Md Tasnim Jawad, Joaquin Molto, M. Hadi Amini, Yanzhao Wu·本站收录 · 原文发表

多模态大语言模型的多轮越狱攻击与 FragGuard 防御

Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

提出多轮越狱与FragGuard;LLaVa-7B的Turn3 ASR为91.50%,防御后0.96%(Table3)。

威胁模型攻击者将模型Fθ视为black box,不能访问内部参数或修改权重。

问题
MLLM的基本护栏可能被多轮多模态提示绕过。文本侧已有多轮越狱研究,MLLM侧缺少系统分析;作者认为已有防御面对多轮越狱可能不够。
方法
框架MJAD-MLLMs以三轮对话和底部排版图像诱导越狱。FragGuard按400 token切分响应,用o1、Gemini-2.5-Flash-lite、LLaMa-3 (70B)取最大毒性分,超阈值则改为安全拒答。
实验与结果
LLaVa-7B与GPT-4o的Turn3 ASR为91.50%、77.31%(Table1)。FragGuard后为0.96%、8.08%(Table3)。作者称Gemini-2.0-Flash的ASR达82.3%。
局限与可以继续做的
作者计划自动生成对抗提示,并分析商用与推理型MLLM及自动化攻击的防御。实验用MM-SafetyBench每类40条;Table3只含两个模型。论文未报告阈值τ和重复次数。
实验设置LLaVa-1.6 (7B)、LLaVa-1.6 (13B) 等 · MM-SafetyBench · ASR、ATS 等
威胁模型
攻击者将模型Fθ视为black box,不能访问内部参数或修改权重。可多轮提交由对抗文本与对抗视觉提示组成的提示对并接收响应。目标是在目标轮次生成越狱响应R*。受害系统是含视觉模块、连接器与文本模块的LVLM。
被测模型
LLaVa-1.6 (7B)LLaVa-1.6 (13B)Qwen-2-7BGPT-4oGemini-2.0-Flash
基准
MM-SafetyBench
指标
ASRATSRR
AI 导读论文提出 MJAD-MLLMs 框架,系统分析多模态大语言模型(MLLMs)的多轮越狱攻击与基于多 LLM 的防御技术。作者设计了一种新的多轮越狱攻击,利用多轮提示下的模型漏洞,并提出片段优化与多 LLM 防御机制 FragGuard 以缓解此类攻击。研究在多个 SOTA 开源与闭源 MLLMs 及基准数据集上评估了攻击与防御效果,并与现有技术进行了对比。

论文提出 MJAD-MLLMs 框架,系统分析多模态大语言模型(MLLMs)的多轮越狱攻击与基于多 LLM 的防御技术。作者设计了一种新的多轮越狱攻击,利用多轮提示下的模型漏洞,并提出片段优化与多 LLM 防御机制 FragGuard 以缓解此类攻击。研究在多个 SOTA 开源与闭源 MLLMs 及基准数据集上评估了攻击与防御效果,并与现有技术进行了对比。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者用三轮黑盒提示探测MLLM越狱,并用无训练的FragGuard做片段级拦截。

    多轮多模态提示能否绕过 MLLM 的基本安全护栏,以及如何在不训练的情况下拦截。

    • 场景:作者称 MLLM 已用于 VQA、图像描述、视觉文档抽取和多模态推理,越狱、系统提示抽取和数据投毒也在增加。文本 LLM 的多轮越狱已提高成功率,MLLM 的多轮提示越狱仍缺少系统分析。
    • 现有做法:作者列举的 MLLM 越狱包括相关视觉内容、不一致提示和排版图像;防御包括改架构、系统提示和去掉视觉内容。作者认为这些防御在多轮越狱下可能不够,也缺少对开源与闭源生产模型的系统评测。
    • 观察:作者称直接有害请求会被护栏拒绝;若先以较低危害请求进入对话,再逐步加入假设情境和图中的有害请求,模型更容易给出越狱响应。
    • 本文做法:作者提出框架 MJAD-MLLMs,包含多轮越狱、不需训练或微调的片段级多 LLM 防御 FragGuard,以及多 LLM 评审加人工核查。
    • 威胁模型:
      • 目标:在目标轮次 i 生成越狱响应 R*,即绕过安全对齐、引出禁止或有害内容。
      • 知识:模型 Fθ 被当作 black box;攻击者不能访问内部参数,也不能改权重或直接操纵行为。
      • 能力:可多轮交互;每轮输入是对抗文本查询与对抗视觉提示组成的提示对,历史含此前提示对与响应。
      • 受害系统:作为 MLLM 子类的 LVLM,含视觉模块、连接器,以及带基本安全护栏的文本模块。
  2. 有哪些相关研究?

    相关工作含排版与打乱类多模态越狱、LLM多轮越狱和提示类防御;作者称MLLM多轮分析仍缺。

    多模态越狱

    • MM-SafetyBench(Liu et al.)用排版嵌入文本的图像做 MLLM 安全评测;本文把它当数据集,并在 Table 1 中作攻击基线。
    • FigStep(Gong et al., 2025)把有害请求写成排版步骤;SI-Attack(Zhao et al., 2025)打乱图像与文本查询。二者都是 Table 1 的基线。
    • 论文还描述了系统提示越狱(Ideator)、ASCII art(ArtPrompt, Jiang et al., 2024)和把恶意内容藏进图像(Li et al., 2024),未对这些工作逐篇给出本文复现数字。

    文本 LLM 的多轮越狱

    • Crescendo(Russinovich et al., 2024)、Foot-in-the-door(Weng et al.)、Chain of Attack(Yang et al., 2024)、Many-shot jailbreaking(Anil et al., 2024)等研究多轮提示下的 LLM 越狱。
    • Red Queen(Jiang et al., 2025)与 multi-turn context jailbreak(Sun et al., 2024)在 Insights 中被用来讨论多轮后意图识别变弱;论文没有把它们当作 MLLM 基线重跑。
    • SafeMT(Zhu et al.)研究多轮攻击下的 MLLM 响应安全。作者称它在开源 LLM(Gemma-3)评审下未能取得高攻击成功率。

    MLLM 防御

    • AdaShield(Wang et al., 2024)用自适应盾牌提示;Eyes Closed, Safety On(Gou et al., 2024)在提示时用文本替换视觉模块;MLLM-Protector(Pi et al., 2024)做提示去毒。
    • 另有智能体防御(AutoDefense, Zeng et al., 2024;X-Guard, Upadhayay et al., 2025)、JBShield(Zhang et al., 2025)和层级编辑(Zhao et al., 2024)。作者称这些技术面对包括多轮攻击在内的新兴越狱时,未必足以防御。

    基线与基准

    • 攻击基线是 MM-SafetyBench、SI-Attack、FigStep,基准是 MM-SafetyBench 的 13 类禁止场景。防御对照是作者自己的 full response 多 LLM 防御,即不做响应切分。

    作者把本文定位为补上 MLLM 多轮越狱的系统分析,并用无训练的 FragGuard 缓解包括多轮在内的文本类越狱。

  3. 论文如何解决这个问题?

    三轮排版对话诱导越狱;FragGuard以400 token切分,多LLM取最大毒性分决定拒答。

    框架 MJAD-MLLMs 用三轮对话加排版图像诱导越狱,再用 FragGuard 切分响应,由多个文本 LLM 取最大毒性分,决定保留原响应或换成安全拒答。

    问题设定

    • 模型:论文以 LVLM 代表 MLLM。视觉模块把图像变成嵌入,连接器映射到文本模块的潜空间,文本模块结合视觉特征与文本生成响应。
    • 形式化:视觉提示为 V,文本为 token 序列 Q,输出 R 服从条件分布 PFθ(R|Q,V)。越狱要构造对抗对 (Qadv, Vadv),使模型生成越狱序列 R*。
    • 多轮条件:第 i 轮的生成还条件于历史 H(i-1)。越狱指用对抗提示绕过安全对齐,引出禁止或有害响应;有害参照是 OpenAI 禁止场景。

    多轮攻击

    • 视觉载体:图像内容对应禁止场景;有害请求或关键词以 typography 放在图像底部,外观类似图注。图像来自 MM-SafetyBench,由 Stable Diffusion 按抽取的关键短语生成,再叠上该短语。
    • 三轮结构:第 1 轮是良性提问,用来进入对话,作者不在此轮评有害性。第 2 轮要求在假设情境中想象图像里的内容与行为者。第 3 轮要求模型回应图像中排版写入的对抗请求。
    • 作者给出的理由:直接有害请求会被护栏拒绝;从较低危害请求逐步过渡,可使模型继续合作。附录 C 有成功与失败示例;作者称图中故意省略了原始多轮对抗提示。

    FragGuard

    • 切分:响应 R* 按固定 token 长度切成若干片段。附录 B 写明全部防御实验中每段为 400 token。
    • 打分模型:每段送给三类文本 LLM:推理模型 o1、通用模型 Gemini-2.5-Flash-lite、开源模型 LLaMa-3 (70B)。模型 Dj 对第 k 段给出毒性分 Tj,k。
    • 聚合:最终分是全部防御模型与全部片段上的最大值,Tfinal=maxjmaxkTj,k。该式表示取最保守的毒性分。若它超过预设阈值 τ,原响应换成预定义安全拒答;否则返回 R*。论文未给出 τ。
    • 部署:防御模型的 max token 为 50、temperature 为 0.3。附录 B 说作者为这些模型编写了系统提示,以便按 1–5 分评估有害性,但未给出提示词全文。对照方法 full response defense 不切分,把整段响应当作一个单元打分。

    成功判定

    • ASR 与 ATS:GPT-4 与 Gemini-2.5-flash 按 OpenAI 禁止场景在 1–5 分上打毒性,取较高分;该分大于或等于 4 记为成功,阈值沿用所引 SI-Attack 论文的设定。ASR 是成功样本占比,ATS 是毒性分平均。
    • RR:启用防御后,模型明确拒绝的对抗查询比例。作者称 RR 越高,防御越强,并说明 ASR 与 ATS 本身不直接表示防御是否拒绝。
    • 第二套评审与人工:另用 Mistral-7B 与 Gemini-2.5-Flash 打毒性;并从每类随机抽 5 条做人工评估。
  4. 论文做了哪些实验?

    LLaVa-7B的Turn3 ASR为91.50%,FragGuard后为0.96%(Table3)。

    实验设置

    • 目标模型:开源为正文所称 LLaVa-1.6 (7B)、LLaVa-1.6 (13B)、Qwen-2-7B;闭源为 GPT-4o(API 日期 2024-11-20)与 Gemini-2.0-Flash。表中简写为 LLaVa-7B、LLaVa-13B、Qwen-7B。参考文献中的模型卡分别为 llava-v1.6-mistral-7b-hf、llava-1.5-13b-hf、Qwen2-VL-7B-Instruct。
    • 数据:MM-SafetyBench,13 个 OpenAI 禁止场景,全集 1680 条且各类数量不均;作者每类取 40 条。类别包括 Illegal-Activity、HateSpeech、Malware-Generation、Physical-Harm、Economic Harm、Fraud、Sex、Political Lobbying、Privacy-Violence、Legal-Opinion、Financial Advice、Health-Consultation、Gov-Decision。
    • 攻击与防御配置:固定 3 轮,turn 1 不评有害性。片段长度 400 token。主防御 LLM 为 o1、Gemini-2.5-Flash-lite、LLaMa-3 (70B);一组实验把 o1 换成 Mistral-7B。硬件为 4 张 40GB 的 NVIDIA A100。目标模型 max tokens 均为 768;temperature、top p、repetition penalty 依次为:LLaVa-7B 0.3/1.0/1.0,LLaVa-13B 0.7/0.9/1.05,Qwen-7B 0.3/0.9/1.1,GPT-4o 1.0/1.0/0.0,Gemini-2.0-Flash 1.0/0.95/0.0(Table 7)。
    • 基线:MM-SafetyBench、SI-Attack、FigStep,只比较 LLaVa-7B 与 GPT-4o。作者称 LLaVa-7B 的前两个基线以及 GPT-4o 的 SI-Attack 数字引自原文;FigStep 和 GPT-4o 上的 MM-SafetyBench 由作者在同一数据集上实现。
    • 评审:主评审是 GPT-4 与 Gemini-2.5-flash,取 max,大于或等于 4 计成功,并报 ATS;防御另报 RR。第二套评审是 Mistral-7B 与 Gemini-2.5-Flash。人工为每类 5 条,只覆盖 LLaVA-7B 与 GPT-4o。论文未报告重复次数和 τ。
    • 良性探针:Figure 6 用 ChatGPT 网页界面对一张良性图像做 VQA。

    主结果

    作者称主评审下,开源 ASR 最高 91.5%(LLaVa-7B),闭源最高 82.3%(Gemini-2.0-Flash);后一数字未单独标明轮次。Table 1 的 Turn 3 ASR 为 LLaVa-7B 91.50%、GPT-4o 77.31%。Figure 2 其余逐点读数正文未列出。下表是第二套评审下的全模型攻击结果(据 Table 2;表头写作 Gemini 2.5-Falsh)。

    表格较宽,可左右滑动

    模型Turn2 ASRTurn3 ASRTurn2 ATSTurn3 ATS
    LLaVa-7B73.08%91.35%3.754.62
    LLaVa-13B24.42%16.54%2.302.17
    Qwen-7B25%52.31%1.983.34
    GPT-4o35.19%67.50%2.793.56
    Gemini-2.0-Flash43.71%68.09%3.043.58
    • 作者称主评审下所有研究模型的 turn 3 ASR 都高于 turn 2;LLaVa-13B 两轮都低于 LLaVa-7B,作者认为这提示同族更大模型在相同攻击下安全对齐更强。闭源中,作者称 Gemini-2.0-Flash 在两轮都比 GPT-4o 更易被攻破。
    • Table 2 并不都是 turn 3 更高:LLaVa-13B 的 ASR 从 24.42% 到 16.54%,ATS 从 2.30 到 2.17。同表 GPT-4o 的 Turn 3 ASR 为 67.50%,低于 Table 1 主评审的 77.31%。
    • Table 1 基线 ASR:MM-SafetyBench 为 LLaVa-7B 72.14%、GPT-4o 12.34%;SI-Attack 为 62.68%、68.57%;FigStep 为 62.30%、19.81%。作者称本文 Turn 3 高于这些基线。

    防御对比

    • 主评审、Turn 3(Table 3):LLaVa-7B 攻击 ASR/ATS 为 91.50%、4.64;full response 为 4.42%、1.19;FragGuard 为 0.96%、1.06。GPT-4o 攻击为 77.31%、3.82;full response 为 13.46%、1.14;FragGuard 为 8.08%、1.12。作者在 4.4.2 节称 ASR 大约降低 90% 与 68%,结论写开源约 89%、闭源约 68%;作者还称相对 full response,ASR 与 ATS 大约改善 4 与 5。表中可核对的是上述原数。
    • 更换防御模型与评审(Table 4、Table 5):o1 换成 Mistral-7B,评审改为 Mistral-7B 与 Gemini-2.5-Flash。FragGuard 的 Turn 3 ASR 为 LLaVa-7B 1.15%、LLaVa-13B 4.42%、Qwen-7B 7.31%、GPT-4o 0.00%、Gemini-2.0-Flash 0.58%。同设定 full response 的 Turn 3 ASR 为 6.35%、6.35%、15.00%、3.50%、35.01%。Table 5 表头仍写 Full Response Defense,这里按节标题归到 FragGuard。
    • RR 与例外:作者称 Figure 5 中 FragGuard 的 RR 在 turn 2 和 turn 3 都高于 full response,但未给出该图数字。Table 5 的 Turn 3 RR 为 LLaVa-7B 90.00%、LLaVa-13B 13.46%、Qwen-7B 46.54%、GPT-4o 80.38%、Gemini-2.0-Flash 88.78%。Table 4 中 Qwen-7B 与 Gemini-2.0-Flash 的 full response ASR 从 turn 2 的 11.35%、29.21% 到 turn 3 的 15.00%、35.01%。Table 5 中 LLaVa-13B 的 FragGuard RR 从 24.23% 到 13.46%。作者称 Figure 4 里两类模型 13 个类别的 ATS 都下降,正文未给逐类数字。附录 C 有攻击与防御的成功、失败示例,无附带分数。

    人工与 LLM 评审

    • Table 6 每类 5 条。防御两边相同:LLaVA-7B 的 ASR 1.53%、ATS 1.07;GPT-4o 的 ASR 6.15%、ATS 1.75。
    • 攻击:LLaVA-7B 的 LLM/人工 ASR 为 87.69%/89.23%,ATS 为 4.47/4.53;GPT-4o 为 73.84%/69.23%,ATS 为 3.73/3.47。作者称 ASR 偏差约 2.5% 与 4.5%、ATS 偏差约 0.06 与 0.4;与表并列时以表中原数为准。作者认为多 LLM 评审可以提高评测质量,但仍需要更分析性的方法。

    其他消融与分析

    • 片段长度固定 400 token,论文未报告其他长度或 τ 的扫描。
    • Figure 6:作者称 FragGuard 不改写该次良性文本,并据此推断不妨碍 VQA 等效用;仅为单例。
    • RQ1:作者认为多轮后模型更难识别整体恶意意图,潜伏表示转向有用性;这是解释,不是额外实验数字。
    • RQ4:作者称 FragGuard 可迁到 Audio-Flamingo、AudioPaLM,以及 FigStep、SI-Attack;论文未报告这些迁移的数字。
    • Figure 3 是 LLaVa-7B 的 turn 3 样本。作者称其中有可执行操作细节并做了人工标红;正文未转录图中毒性分。
  5. 有什么可以进一步探索的点?

    作者计划自动生成对抗提示,并分析商用、推理型MLLM及自动化攻击防御。

    作者指出的局限与后续方向

    • 论文没有单独的 Limitations 节,未把某项结果明确写成自身局限。
    • 第 7 节:作者计划开发查询优化,以自动生成对抗提示。
    • 第 7 节:作者计划分析商用与推理型 MLLM 在所提越狱下的易感性。
    • 第 7 节:作者计划针对自动化越狱开发防御。

    实验覆盖范围

    • 攻击目标为 LLaVa-7B、LLaVa-13B、Qwen-7B、GPT-4o、Gemini-2.0-Flash 共 5 个;Table 1 的基线对照只有 LLaVa-7B 与 GPT-4o。
    • 数据为 MM-SafetyBench 的 13 类、每类 40 条,全集 1680 条;人工评估每类 5 条,且只有 LLaVA-7B 与 GPT-4o(Table 6)。
    • Table 3 的防御结果只含 LLaVa-7B 与 GPT-4o 的 Turn 3;五模型防御数字在 Table 4 与 Table 5,且同时更换了防御 LLM 与评审 LLM。
    • 攻击固定 3 轮,turn 1 不评估有害性。论文未报告重复次数、阈值 τ,以及与 AdaShield 等已引防御的数值对照。
    • 良性任务是 Figure 6 的一次 ChatGPT 网页 VQA。作者讨论了迁到音频转文本模型和单轮攻击的可能,但未报告这些设置的数字。
  6. 总结一下论文的主要内容

    三轮排版越狱在LLaVa-7B上ASR达91.50%,FragGuard降至0.96%(Table3)。

    MJAD-MLLMs 同时给出针对 LVLM 的黑盒多轮越狱和无训练防御。作者关心的是:文本模块虽有基本护栏,多轮多模态提示仍可能引出禁止内容。

    • 攻击:图像内容对应 OpenAI 禁止场景,有害关键词以 typography 放在底部。对话固定 3 轮,先做良性视觉提问,再进入假设情境,最后指向图中的对抗请求。turn 1 不评有害性。
    • 防御:FragGuard 按 400 token 切分响应,由 o1、Gemini-2.5-Flash-lite、LLaMa-3 (70B) 打毒性分并取最大值;超过未公布的阈值 τ 时换成安全拒答。对照是不切分的 full response 防御。
    • 攻击数字:主评审下,Table 1 的 Turn 3 ASR 为 LLaVa-7B 91.50%、GPT-4o 77.31%;作者称闭源最高 82.3%(Gemini-2.0-Flash)。同表基线最高为 SI-Attack 在 GPT-4o 上的 68.57%,LLaVa-7B 上 MM-SafetyBench 为 72.14%。
    • 评审差异:换成 Mistral-7B 与 Gemini-2.5-Flash 后,LLaVa-7B 的 Turn 3 ASR 为 91.35%,GPT-4o 为 67.50%;LLaVa-13B 从 turn 2 的 24.42% 到 turn 3 的 16.54%(Table 2)。
    • 防御数字:Table 3 中 FragGuard 把上述两个 Turn 3 ASR 降到 0.96% 与 8.08%。作者称降幅约 90% 与 68%,结论另写开源约 89%、闭源约 68%。换防御模型与评审后,GPT-4o 的 Turn 3 ASR 为 0.00%(Table 5)。

    作者认为多轮会削弱模型对整体恶意意图的识别,并认为一次良性 VQA 中 FragGuard 不改写响应。作者计划自动生成对抗提示,再分析商用与推理型 MLLM,以及自动化攻击的防御。

阅读原文arxiv.org