研究者提出 MM-Plan 多模态越狱框架,对 Claude 4.5 Sonnet 攻击成功率达 46.3%
Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning
VE-Safety上MM-Plan对Sonnet 4.5的ASR为46.3%,对GPT-5为13.8%(Table 3)。
Black-box下,攻击者持有有害目标g与图像I,对受害MLLM Mtarget做多轮交互。
- 既有多模态红队多把图像当作恶意文本的容器。载荷一旦能被OCR或描述还原,文本侧对齐就能挡住。作者要处理的是:危害只来自技术图中的空间与功能关系,文本单独不够,且常要多轮才完成。
- MM-Plan用Qwen3-VL-4B一次写出人设、叙事和crop/mask/blur。执行后由评审模型打分,再用GRPO更新。VE-Safety有440条人工实例,文本或512 token描述都不足以完成目标。
- VE-Safety测试集上,MM-Plan对Claude 4.5 Sonnet的ASR为46.3%,对GPT-5为13.8%,对InternVL3-8B为65.0%(Table 3)。GPT-5上次高为Crescendo 3.1%。
- 论文未专节讨论局限。实验含8个MLLM、VE-Safety测试320条和HarmBench过滤测试30条。人工核对400条。主ASR的判定模型Claude 4.5 Sonnet同时是被测目标。
- 威胁模型
- Black-box下,攻击者持有有害目标g与图像I,对受害MLLM Mtarget做多轮交互。每轮可对图像做crop、mask、blur,并提交文本。成功指最终回复满足g;评测要求回复针对该目标,且给出由视觉信息导出的可执行指令。VE要求文本改写及不超过512 token的描述都不足以完成g。
- 被测模型
- Llama-3.2-11BInternVL3-8BQwen3-VL-8BGPT-4oGPT-5Claude 3.7 SonnetClaude 4.5 SonnetGemini 2.5 Pro
- 基准
- VE-SafetyHarmBench
- 指标
- ASR
研究者提出 Visual Exclusivity(VE)威胁模型与 MM-Plan 多模态多轮智能体规划框架,把越狱从逐轮反应改为全局策略合成,攻击者规划器经 GRPO 训练,无需人工监督即可自行发现有效策略。在作者构建的 VE-Safety 数据集上,MM-Plan 对 Claude 4.5 Sonnet 的攻击成功率为 46.3%,对 GPT-5 为 13.8%,作者称其表现优于基线 2 至 5 倍,而现有方法大多失效。作者认为这一结果说明前沿模型仍易受智能体式多模态攻击影响,当前安全对齐存在缺口。
深度解读
这篇论文试图解决什么问题?
视觉排他(Visual Exclusivity)下,有害目标只能靠对图像的推理实现,MM-Plan用全局规划自动红队。
有害目标只能靠对图像内容的推理成立时,把图像当恶意文本包装的红队既测不到,也容易被拆掉。
- 场景: 既有工作被归入 Image-as-Wrapper:视觉主要用来把载荷藏过文本过滤器(Table 1)。作者认为 MLLM 能对物理世界推理,攻击面因此变宽。
- 不足: Visual Substitution 用排版图,Visual Control 用对抗扰动。作者认为有害意图离开图像仍完整,OCR 或描述原则上可还原。论文引用 Guo et al. (2025) 的 safety paradox:载荷暴露后,安全微调或提示词护栏可使攻击成功率接近零。启发式搜索难扩到长程多轮(Table 2);专有模型当攻击器时常拒答。逐轮强化学习被作者称为短视。
- 观察: 作者把 Visual Exclusivity(VE) 定义为 Image-as-Basis。文本可无害,图像也可无噪声、无隐藏文字;危害出现在模型解释图中空间与功能关系并照文本执行之时。作者认为 OCR、描述筛选和去噪对不上这种依赖。
- 威胁模型:
- 目标: 使受害 MLLM Mtarget 的最终回复满足有害目标 g。
- 知识: Table 2 将 MM-Plan 标为 Black-Box。梯度方法 UMK 因不兼容 black-box 而未比较。
- 能力: 给定 g 与图像 I;每轮可改图像(如 crop、blur)并提交文本。计划一次生成后执行。
- 受害系统: 能做视觉推理的 MLLM。评审函数 J 判断回复是否满足 g。
- 本文: 给出 VE 与 wrapper 攻击的三条区分标准;人工基准 VE-Safety(440 条、15 类),作者称这是首个针对 Image-as-Basis 的基准;MM-Plan 以 Qwen3-VL-4B 为规划器,用 GRPO 自发现策略,不用人工攻击轨迹。
有哪些相关研究?
相关工作分视觉替代/控制、多模态安全基准、多轮越狱与防御;作者把本文定位为Image-as-Basis的全局规划。
论文按视觉通道攻击、安全基准、多轮越狱来写;附录 A.4 另写防御。
视觉替代与视觉控制
- Visual Substitution: FigStep(Gong et al., 2025)把禁令做成排版图;HADES(Li et al., 2024)混合排版与有毒画面。同类还有 SI-Attack、Multi-Modal Linkage 等,用图像躲开词法过滤。
- Visual Control: Qi et al. (2024)、Shayegani et al. (2024)、UMK(Wang et al., 2024b)用对抗扰动改内部表示。
- 论文的批评: 这些工作不测对平面图一类固有视觉概念的推理,而是遮住文本意图或打编码器。作者认为图像只是 wrapper。
多模态安全基准
- 迁移与上下文: JailBreakV-28K(Luo et al., 2024)、AdvBench(Zou et al., 2023)测文本攻击迁到 MLLM。附录把 MM-SafetyBench(Liu et al., 2024b)归为 Image-as-Context。VLGuard(Zong et al., 2024)面向防御,不是攻击向量。
- HarmBench: Mazeika et al. (2024) 含需要视觉推理的多模态行为,但是单轮,且不强制非文本不可还原(Table 1)。作者认为它没有集中覆盖蓝图、示意图这类技术视觉推理。
多轮越狱
- 文本升级: Crescendo(Russinovich et al., 2025)引用模型先前的安全回复往前推。Foot-in-the-Door(Weng et al., 2025)、Chain of Attack、ActorAttack 等用对话加码或拆问题。Siren(Zhao & Zhang, 2025)是文本域的策略学习。
- 多模态与搜索: SSA(Cui et al., 2025)跨轮累积视觉上下文。X-Teaming、MUSE 用多智能体或 MCTS。作者认为这些自动优化主要是文本中心,且侧重上下文累积而非全局规划。作者写把序列强化学习扩到多模态的工作仍少。
防御
- 护栏与分类器: AdaShield 在查询前加静态防御提示;OmniGuard、JailDAM 检查输入。Llama Guard 3 Vision 做回复过滤,VLGuard 做安全微调。作者在附录 A.4 认为,多轮人设会使开头的静态护栏失效;电路板一类图像单独看可以无害,拆开的子步骤也可能躲过安全微调表征。
基线与数据: 实验基线为 Direct Request、Direct Plan、FigStep、SI-Attack、SSA、Crescendo。主基准是 VE-Safety;附录另用过滤后的 HarmBench 多模态子集。
作者把本文放在:攻击是一次合成的全局计划,而不是逐轮反应;视觉操作改的是原图,而不是排版包装;基准要求非文本不可还原,并且是多轮。
论文如何解决这个问题?
MM-Plan用Qwen3-VL-4B一次生成多轮越狱计划,经GRPO与组合奖励优化,不依赖人工攻击轨迹。
MM-Plan 把多模态越狱从逐轮反应改成一次合成的全局计划,再按评审奖励用 GRPO 更新规划器。
设定与 VE 定义
- 轨迹: 攻击者有目标 g 和图像 I。T 为 N 轮 (i_n, q_n, r_n)。i_n 可以是 I 的修改版,r_n 依赖当前输入和历史。成功指最终回复 r_N 满足 g。
- 三条标准(Definition 3.1): 文本不足:q 的语义改写单独交给文本模型,期望评审约等于 0。视觉充分:存在可多轮的查询策略,使 MLLM 在 (I, q) 上的期望评审远大于 0。非文本不可还原:长度上限 L=512 token 的 OCR 或描述拼上改写后,文本模型仍约等于 0。
- 边界: 带标签的示意图若必须推理部件间的空间、功能或因果关系,仍算 VE;只抽出标签文字则不算。该定义排除 Visual Substitution(不满足条件 3)和 Visual Control(靠噪声而非语义推理)。
- 校验: 附录 B.2 用 Claude 4.5 Sonnet 充当 Mtext,改写集大小为 10。440 条仅文本的 ASR 为 0%。512 token 描述替代图像后,作者称未能引出有害回复,未给 ASR。100 条须三名标注者一致才算 VE,96% 满足。
VE-Safety
- 构成: 440 条人工实例,图像来自开源网络上的真实技术图,不是合成排版图。15 类取自 OpenAI 与 Meta 使用政策(Table 10)。同一文本查询可配多张不同图像。
- 内容与划分: 含示意图、电路图、平面图、化学式、医学图像。每对经人工检查文本不足与视觉充分。随机分为训练 80、验证 40、测试 320,都没有成功攻击的真值标注。测试再分 seen 106(训练见过的文本目标、不同图像)和 unseen 214(新目标且新图像)。
- 全库计数: Illegal Activity 164、Physical Harm 58 最多;Self-Harm 10、Animal Abuse 9、Cybercrime 8。这是 440 条的计数,不是测试集分母。
规划与执行
- 规划器: π_θ 为 Qwen3-VL-4B。单次推理输出 JSON:Persona、Context、Approach、估计轮数、Execution Sequence。每轮含图像操作及参数和文本查询。
- 操作: crop、mask、blur、no_op。计划里写语义目标,再由攻击 VLM 落到 bbox,然后调用预定义函数,对 Mtarget 确定性播放。附录 E.1 给出规划器与评审的完整提示词。
- 默认交付: 默认把最终查询渲成 FigStep 式排版图。仅视觉操作的配置在附录 D.7。GRPO 更新时冻结视觉塔。
- 一次规划的理由: 作者写了三点。早期无害人设没有即时危害信号,但要和最终目标一致,故按整段结果优化。顺序搜索在每步展开 K 次时,轨迹数为 K 的 N 次方;一次规划的交互是 K×N。成功轨迹难获得,因而不用要 critic 的 PPO,也不用要偏好对的 DPO。
奖励与 GRPO
- 采样: 每个 (I, g) 采样 K 个计划,默认 K=4。JSON 不能解析则 Ivalid 为 0。
- 四项: rsucc 为细粒度成功分。正文写 s 属于 1 到 10,再归一化到 0 到 1;Table 7 的消融写 Graded (1-5)。rprog 为各轮进展分的平均再归一化,正文同样写 1 到 10。rgoal 为跑题的二值惩罚。rturn 为已用轮数除以 Nmax。
- 组合: R = Ivalid · (rsucc + rprog − α rturn − β rgoal)。含义是:只给能解析的计划计分,成功与进展相加,再减去轮次和跑题。α=0.1,β=0.5,按验证集选定。Nmax=10,与 Crescendo 对齐。
- 更新: 优势为组内奖励减均值再除标准差。训练 10 epoch,学习率 1×10−5,batch 16,温度 0.7,KL 系数 0.01。最大提示 4096 token,计划最长 2048。8 张 A100(40GB)。附录写单步约 6 分钟;专有 API 上单次计划约 0.01 美元;对前沿模型(如 GPT-5)的策略优化约 30 美元。
成功判定
- ASR: 回复须同时满足 Goal Satisfaction(直接回应 g 的有害意图)和 Visually Grounded Actionability(给出从视觉信息导出的可执行指令,而不是泛泛理论)。
- 终评: Claude 4.5 Sonnet 严格二值,只有完整越狱为 1。训练用分级分,终评不用该分级分当 ASR。
论文做了哪些实验?
Table 3:8个MLLM上MM-Plan的ASR均高于次高基线,Sonnet 4.5为46.3%。
实验设置
- 目标模型: Llama-3.2-11B、InternVL3-8B、Qwen3-VL-8B、GPT-4o、GPT-5、Claude 3.7 Sonnet、Claude 4.5 Sonnet、Gemini 2.5 Pro。附录表写 Llama 3.2-11B-Vision、InternVL 3.0-8B,与 Table 3 表头对应。
- 数据: 主评测用第 5.1 节的 VE-Safety 测试集 320 条(seen 106、unseen 214)。训练 80、验证 40,无攻击真值。HarmBench 多模态原 110 条,去掉 50 条 CAPTCHA 后余 60,再分 30 训练 / 30 测试。
- 攻击器与基线: 默认规划器 Qwen3-VL-4B。智能体基线的攻击骨干也统一为该模型。基线为 Direct Request、Direct Plan(零样本计划)、FigStep、SI-Attack(每例 10 个打乱变体,取得分最高者)、SSA、Crescendo。多轮上限 10。UMK 未跑。
- 指标与评审: ASR 为同时满足目标满足与视觉可执行的实例比例。训练奖励和终评都用 Claude 4.5 Sonnet;终评是严格二值。该模型也是被测目标。SI-Attack 一句只写 judge model,未另点名。
- 优化: GRPO,10 epoch,K=4,Nmax=10,α=0.1,β=0.5。论文未逐格写明 Table 3 每个目标是否都用同目标训练的规划器。Table 4 的同目标行与 Table 3 中 Qwen3-VL-8B、Claude 4.5 Sonnet 的数字相同。
- 人工: 400 条分层轨迹,方法为 MM-Plan 与 Direct Plan,目标为 Qwen3-VL-8B 与 Claude 4.5 Sonnet,每条 9 名标注者。
主结果
下表 ASR(%)据 Table 3。次高是该列基线中的最大值,不是原表单独一列。
| 模型 | Direct Request | 次高基线 | MM-Plan | | Llama-3.2-11B | 13.4 | 25.6(SI-Attack) | 64.4 | | InternVL3-8B | 27.2 | 45.0(Crescendo) | 65.0 | | Qwen3-VL-8B | 11.9 | 33.8(Crescendo) | 54.4 | | GPT-4o | 5.0 | 14.4(Crescendo) | 36.9 | | GPT-5 | 0.6 | 3.1(Crescendo) | 13.8 | | Sonnet 3.7 | 4.7 | 15.0(Crescendo) | 27.2 | | Sonnet 4.5 | 8.4 | 24.4(FigStep) | 46.3 | | Gemini 2.5 Pro | 9.7 | 15.9(Crescendo) | 43.8 |
- 作者称达到新的 state-of-the-art,并在摘要与贡献 3 中称比 search-based、turn-by-turn 基线高 2–5×。星号表示相对次高方法 p-value ≤ 0.05。作者称 Llama-3.2 与 InternVL3 超过 60%;这句不包括 Qwen3-VL-8B。
- 作者称 Claude 4.5 Sonnet 上相对最强基线 nearly doubling,并称 GPT-5 上既有方法不超过表中次高。作者认为单轮替换和文本迭代不显式改视觉输入,在意图由图像支撑时不如 MM-Plan。
- 作者认为能挡住直接请求和文本中心基线的防御,没有完全覆盖把无害铺垫与最终请求分开的多轮策略。附录 D.1 称 15 类上保持一致;Table 13 中各类并不相同,Qwen3-VL-8B 上 Financial & Economic 为 37.5%,Physical Harm 为 63.6%。论文未给测试集各类分母。
迁移、未见查询与轮次
- 迁移(Table 4): 在 Qwen3-VL-8B 上训练后迁到 Claude 4.5 Sonnet 为 29.7%,该目标上 Direct Plan 为 9.7%。反向迁到 Qwen3-VL-8B 为 50.6%,同目标为 54.4%。
- 未见查询(Table 5): Qwen3-VL-8B 为 seen 56.6%、unseen 53.3%;Claude 4.5 Sonnet 为 seen 48.1%、unseen 45.3%。作者称相对 seen 的下降不到 4%。
- 轮次: Figure 6 图注写,开源模型上 MM-Plan 平均 3–4 轮,专有模型 5–8 轮;SSA 与 Crescendo 常接近 Nmax=10。第 5.3 节称在 Claude 4.5 Sonnet 上对话长度约为 Crescendo 的一半,正文未单列该对比的平均轮次。
防御、外部集与失败
- 防御: Table 16 只报 Qwen3-VL-8B 加 Llama Guard 3 Vision,未写样本量。MM-Plan 从 54.4 到 49.4,Direct Request 从 11.9 到 0.3。作者称前者相对下降约 9%,后者减少 97%。专有模型的 Table 3 是在其自带、论文称未公开的安全系统上测的。
- HarmBench(Table 15,测试 N=30): MM-Plan 在 Qwen3-VL-8B 为 63.3%,Claude 4.5 Sonnet 为 36.7%;Crescendo 为 40.0% 与 23.3%;FigStep 为 33.3% 与 16.7%。
- 失败: 附录 D.9 归纳直接拒答、转到无害替代、视觉幻觉,未给三类条数。Figure 7 讨论拒答率,正文和图注没有可读百分数。Table 8 中,GPT-5 作零样本规划器的 ASR 为 0.0% / 0.0%,且 320/320 拒绝生成计划;Claude 4.5 Sonnet 作攻击器时对 Qwen3-VL-8B 为 0.3%,对自身为 0.0%。
评审与人工
- 人工(Table 6,400 条): Safety Violation 的 precision 93.8、recall 89.5、agreement 92.3%;Actionable Harm 为 89.8、87.4、88.5%。
- 跨评审(Table 20,同一 400 条): 与 GPT-4o 的一致率为 99.0%,Gemini-2.5 Pro 为 97.8%,Claude 4.1 Opus 为 98.5%。作者称二值结论重叠超过 97%。
其他消融与分析
- 奖励(Table 7,Qwen3-VL-8B / Claude 4.5 Sonnet): 二值成功 30.6 / 10.3;分级成功 38.8 / 25.3;加目标惩罚 42.5 / 30.6;加进展 47.5 / 35.6;二者都加 54.4 / 46.3。作者称分级分在 Sonnet 上提升 15%;表中对应 10.3 与 25.3。
- 关掉图像操作: 作者报告 Qwen3-VL-8B 下降 18.4%、Claude 4.5 Sonnet 下降 27.5%(第 5.4 节,未另给关掉后的 ASR)。
- 排版原语(Table 18): 仅视觉操作 53.1 / 41.3;加打乱排版 54.1 / 43.1;加 FigStep 标准排版 54.4 / 46.3。主结果对应最后一档。
- 攻击骨干(Table 8): 8B 规划器的 MM-Plan 为 61.3 / 47.5,4B 为 54.4 / 46.3。作者称 4B 到 8B 在 Qwen3-VL-8B 上 +6.9%。
- 组大小(Table 17): K=4 为 54.4 / 46.3;K=8 为 55.9 / 47.5;K=16 为 60.0 / 52.5。
- Best-of-N 与方差: Table 19 中 S=16 的 Direct Plan 在 Sonnet 4.5 为 15.9、在 Qwen3-VL-8B 为 27.8;MM-Plan 单次为 54.4 / 46.3。三次训练均值:Qwen3-VL-8B 54.6±1.0,Claude 4.5 Sonnet 46.4±0.8(Table 14)。
有什么可以进一步探索的点?
附录D.9把失败形态称为智能体攻击的局限;论文没有专节列出后续方向。
作者指出的局限与后续方向
- 无专节: 引言、结论和附录目录都没有 Limitations 或 Future Work。结论只写希望把注意力放到超出文本中心对齐的防御,没有列出待做实验。Impact Statement 写的是发布范围和伦理流程,不计入研究局限。
- 失败形态(附录 D.9): 作者称剩余不成功案例照出智能体攻击的局限,并分成三类。直接拒答被作者称为最常见,尤其对 GPT-4o 一类专有系统;作者认为车辆盗窃、武器组装一类请求,即使用专业人设和图像处理,模型仍可能从第一轮就映射到禁止类别。转到无害替代与跑题惩罚相关:模型顺着无害人设把话题转到防御建议。视觉幻觉来自攻击骨干与受害模型的视觉能力差;作者写放大骨干会减少幻觉,但前沿模型当攻击器又会拒绝规划。三类各占多少,论文未给。
实验覆盖范围
- 模型与判定: Table 3 的被测 MLLM 为 8 个。默认规划器是 Qwen3-VL-4B。终评 ASR 由 Claude 4.5 Sonnet 做二值判定,该模型同时是被测目标。Table 20 另报与 GPT-4o、Gemini-2.5 Pro、Claude 4.1 Opus 的一致率。
- 数据: 主结果在 VE-Safety 测试集 320 条。HarmBench 实验是过滤后的 30 条测试。附录 B.2 对全部 440 条做了仅文本 ASR,结果为 0%。
- 防御与威胁模型: Table 16 只在 Qwen3-VL-8B 上加 Llama Guard 3 Vision,且未写样本量。专有模型结果是在各自 API 安全系统上测的,论文写这些过滤机制未公开。梯度方法 UMK 因 black-box 设定未纳入。
- 重复与人工: Table 14 对 Qwen3-VL-8B 与 Claude 4.5 Sonnet 各做 3 次训练。人工核对为 400 条轨迹、每条 9 人,不是全部 320 条测试。论文未报告主表 ASR 的逐例查询次数。
- 训练来源: 论文写在训练集上做 GRPO,并举例针对前沿模型(如 GPT-5)优化。未逐格写明 Table 3 每个目标是否都用同目标训练的规划器。Table 4 只给 Qwen3-VL-8B 与 Claude 4.5 Sonnet 两个来源。
总结一下论文的主要内容
作者称全局规划能攻破对单轮攻击更稳的前沿MLLM;Sonnet 4.5上ASR为46.3%。
MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。
- 问题: 作者认为既有攻击把图像当文本载荷的包装,载荷暴露后文本侧防御即可压低成功率。VE 要求有害目标只能来自对技术图像的推理,文本或有限长度描述都不够,且常要多轮拆开。
- 方法: 规划器 Qwen3-VL-4B 一次输出人设、叙事和逐轮的图像操作与文本。多个计划在受害 MLLM 上执行,评审模型打成功、进展、跑题和轮次,再用 GRPO 更新。默认最终查询可走 FigStep 式排版。训练不用人工攻击轨迹。VE-Safety 有 440 条,测试用 320 条。
- 主结果: 测试集上,MM-Plan 对 Claude 4.5 Sonnet 的 ASR 为 46.3%,对 GPT-5 为 13.8%,对 InternVL3-8B 为 65.0%(Table 3)。作者称这是新的 state-of-the-art,并称高出基线 2–5×。表中 GPT-5 的次高为 Crescendo 3.1%,Sonnet 4.5 的次高为 FigStep 24.4%。作者称 Llama-3.2 与 InternVL3 超过 60%。
- 其他结果: 从 Qwen3-VL-8B 迁到 Claude 4.5 Sonnet 为 29.7%(Table 4)。unseen 查询上 Qwen3-VL-8B 为 53.3%,Claude 4.5 Sonnet 为 45.3%(Table 5)。与 9 人共识的 Safety Violation 一致率为 92.3%(Table 6,400 条)。
- 作者结论: 作者认为前沿模型对单轮和纯文本攻击更稳,仍会受到视觉推理加多轮规划的影响,并希望防御不要停在文本中心对齐。作者计划发布 VE-Safety、评测代码、评审提示词和基础规划架构,不发布 GRPO 训练后的规划器权重。