跳到正文
原文
论文追踪· arXiv:2608.27531· Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong·本站收录 · 原文发表

MAMJ:面向视觉语言模型的元自适应多模态越狱攻击

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

作者提出 MAMJ,在元层面交替优化攻击策略提示词 θ 与攻击者权重 ϕ;在 MM-SafetyBench 上对 GPT-4o、Gemini-3-Pro-Preview、Seed 2.0 的 ASR 分别为 82.0%、79.3%、83.0%。

威胁模型黑盒商业 VLM 受害模型。攻击者给定恶意目标 q,控制图像生成提示 timg 与文本载荷 u,经外部图像生成器 G 得到图像 I 后查询 V。

问题
现有多模态越狱要么冻结图文版式,要么只改单条样本的图文内容,迭代策略和攻击者参数保持不变。作者认为这种元层面静态性限制了对前沿 VLM 安全风险的暴露。
方法
MAMJ 沿两条轴优化攻击者:先用 Critic–Reflector 与档案式选择,在语言空间里根据失败轨迹修订攻击策略提示词 θ;再固定 θ⋆,用带格式门控的组相对策略优化更新攻击者语言栈权重 ϕ。
实验与结果
在 MM-SafetyBench 的 1,680 条测试上,MAMJ(Niter=2)对 GPT-4o、Gemini-3-Pro-Preview、Seed 2.0 的微平均 ASR 为 82.0%、79.3%、83.0%,高于同表样本级基线。该攻击者只在 GPT-4o 上训练,并在四种防御下复用。
局限与可以继续做的
作者指出训练与主评测都在 MM-SafetyBench,跨基准泛化仍待确立;训练开销主要来自外部图像生成 API;图像生成器 G 始终固定且未做受控微调实验。SafeBench 上另有迁移结果,论文未报告查询次数的逐项明细。
实验设置GPT-4o、Gemini-3-Pro-Preview 等 · MM-SafetyBench、SafeBench · ASR、toxic score s 等
威胁模型
黑盒商业 VLM 受害模型。攻击者给定恶意目标 q,控制图像生成提示 timg 与文本载荷 u,经外部图像生成器 G 得到图像 I 后查询 V。训练时受害模型为 GPT-4o(Vsrc),攻击者看不到梯度;成功判定为评审分数 s≥4。
模型
GPT-4oGemini-3-Pro-PreviewSeed 2.0Qwen3-VL-32B-Thinking
基准
MM-SafetyBenchSafeBench
指标
ASRtoxic score snormalized reward r
AI 导读全文 297 字

研究者提出元自适应多模态越狱方法 MAMJ,同时优化攻击策略提示词(ASP)和攻击者模型权重,而非只调整图文内容。该方法先用基于 LLM 的批评模型迭代改进 ASP,再用分组聚合的攻击成功率(ASR)作为奖励更新攻击者权重。在 MM-SafetyBench 上,MAMJ 对 GPT-4o、Gemini-3-Pro-Preview 和 Seed 2.0 的 ASR 分别为 81.0%、78.9% 和 82.3%,比最强的样本级基线最高高出 24.1 个百分点。学到的攻击者无需重新训练即可迁移到未见过的受害模型,并在代表性防御下仍然有效。论文已被 EMNLP 2026 主会接收,代码已公开。

深度解读

6 个问题,约 8,400 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    现有多模态越狱在元层面仍是静态的,作者要优化攻击策略与攻击者权重本身。

    多模态越狱的攻击策略和攻击者参数在元层面保持固定,难以随具体防御持续演化。

    • 场景与重要性:作者认为,前沿视觉语言模型(VLM)如 GPT-4o、Gemini-3-Pro-Preview、Seed 2.0 在图文交互中的安全,是 AI 治理的核心挑战。攻击者可利用图像与文本的交互绕过内置防护,引出有害回复。
    • 现有方法的不足:模板攻击在部署前冻结图文版式,成熟防御可用 OCR 过滤、版式检测和关键词扫描抵消,且被识别后不能演化。样本级迭代攻击只改写同一查询的图文内容,迭代策略固定、攻击者参数冻结。作者认为,这使攻击在元层面仍是静态的,可能限制其暴露多模态模型的全部安全风险。
    • 核心观察:真实对手是动态的,会针对所面对的防御持续演化。与逐查询独立适配不同,应在一组多模态攻击轨迹上更新,使每次更新针对聚合收益。
    • 本文提出:Meta-Adaptive Multimodal Jailbreaking(MAMJ)。它把动态性从样本级提升到元级,分阶段优化攻击策略提示词(attack strategy prompt, ASP)θ 与攻击者权重 ϕ,得到可迁移产物 (θ⋆, ϕ⋆)。作者称这是多模态越狱的第一个元自适应框架。
    • 威胁模型:
      • 目标:对恶意目标 q 诱导受害 VLM 给出有害回复;成功定义为评审分数 s≥4,等价于归一化奖励 r≥τsucc=0.75。
      • 知识:论文未使用 white-box / black-box / no-box 这些词描述攻击者对受害模型的访问。训练受害模型记为 Vsrc,实验中为 GPT-4o;攻击者根据受害回复获得评审奖励,正文未写梯度访问。
      • 能力:攻击者 VLM Aϕ 在文本模式下,依据 q 与 θ 生成图像生成提示 timg 和用户侧文本载荷 u;外部图像生成器 G 渲染图像 I,再连同 u 查询受害模型 V。攻击者不微调 G。
      • 受害系统:闭源 VLM(GPT-4o、Gemini-3-Pro-Preview、Seed 2.0),以及 GPT-4o 上的提示级防护与外部护栏。
  2. 有哪些相关研究?

    相关工作分为冻结版式的模板攻击,以及策略与参数仍固定的样本级迭代攻击。

    模板式多模态攻击

    • FigStep(Gong 等)、SIVA、HADES(Li 等, 2024):把有害意图放进预定视觉结构。FigStep 把指令渲染成空的列举列表;SIVA 把查询拆成单独看无害的子图;HADES 把有害关键词藏在良性图像下以避开文本过滤。三者都不随受害模型适配。
    • 固定图文数据集的复用(Liu 等的 MM-SafetyBench,以及 SafeBench、Zou 等):同一套图文对不同受害模型原样使用。作者指出共同局限是静态:内容和模式预先固定,成熟防御可用 OCR 过滤、版式检测和关键词扫描抵消,攻击被识别后不能反应。

    样本级自适应攻击

    • IDEATOR(Wang 等)与 VisCo(Miao 等, 2025):对同一样本根据受害回复改写图文。IDEATOR 多轮交替攻击者与受害 VLM;VisCo 对接受与拒绝行为使用结构化对比反馈。作者认为二者提高了逐查询多样性并能抵抗简单模式匹配,但反馈依赖固定的手工迭代模板,每条查询从头开始,过往洞察不复用,攻击空间被模板限定。
    • Arondight(Liu 等, 2024):用强化学习引导生成以提高攻击多样性。作者指出它没有在组级反馈下联合演化攻击策略与攻击者参数。

    文本自适应越狱与提示演化

    • AutoDAN-Turbo(Liu 等, 2025)与 AdvPrompter(Paulus 等, 2025):探索自适应越狱生成,但是文本设定,不是多模态下的元自适应。
    • GEPA(Agrawal 等, 2025):反思式提示演化。MAMJ 的档案选择遵循其 Pareto 式候选选择原则,而不是只按探针集平均奖励选下一个父策略。

    基线方法与基准

    • 基线:MM-SafetyBench、HADES、SIVA、FigStep(均为 Niter=1),以及 VisCo(Niter=4)、IDEATOR(Niter=3)。Niter 是单次攻击任务内攻击者与受害模型的交互轮数。公平比较下各方法共用同一基础攻击者(附录 B.1)。
    • 基准:主评测为 MM-SafetyBench(13 个安全类别,1,680 条测试样本的样本级微平均);附录 H 另在 SafeBench 上评测。防御评测使用 AdaShield、VLMGuard-R1、Llama-Guard-4、LlavaGuard。

    作者把本文定位为:把多模态越狱的动态性从样本级内容提升到攻击者本身,使 θ 与 ϕ 在组级反馈下分阶段适配,以针对样本级方法中固定迭代模板、冻结攻击者参数这一缺口。

  3. 论文如何解决这个问题?

    先用失败轨迹的诊断修订 θ,再固定 θ⋆,用组相对奖励更新攻击者语言栈 ϕ。

    整体上,MAMJ 从预训练初始化 (θ0, ϕ0) 交替更新两条轴:先在语言空间优化 ASP,权重冻在 ϕ0;再固定 θ⋆,用强化学习更新可训练语言栈。θ0 是通用攻击策略提示词,ϕ0 是 Qwen3-VL-32B-Thinking。

    问题设定与攻击管线

    • 符号:D 为恶意目标分布,训练集 Dtrain 的构造见附录 D。受害模型 V、图像生成模型 G、攻击者 Aϕ。ϕ=(ϕViT, ϕtrain):视觉编码器 ϕViT 冻结;可训练的是语言栈(语言模型骨干与视觉–语言连接器)。攻击者全程以纯文本模式运行,ϕViT 不参与。
    • 单次执行:给定 q 与系统提示形式的 θ,攻击者采样 (timg, u),I=G(timg),y=V(I, u)。轨迹 ξ=(q, timg, u, I, y, r)。
    • 奖励与成功:评审模型 J 给出整数毒性分 s=J(q, y)∈{1,…,5}(量规在附录 J),基奖励 r=(s−1)/4∈[0,1]。攻击成功当 s≥4,即 r≥τsucc=0.75。期望奖励是受害回复上该归一化分的期望。
    • 联合目标:最大化 f(θ, ϕ),即 q 与策略 πθ,ϕ 上的期望奖励。MAMJ 用交替轴更新近似该最大值,而不是对 θ 与 ϕ 同时反传。

    阶段一:自适应攻击策略提示词

    • 诊断对象:每个优化步从 Dtrain 抽 mini-batch B,按当前 θ 做 rollout,算父策略的批平均奖励 r̄par。只把失败轨迹 Bfail={i: qi∈B, ri<τsucc} 送去诊断;成功轨迹只用于经验评估。
    • Critic 与 Reflector:Critic 对每条失败轨迹独立产生局部诊断 ai=Critic(ξi),指出失败证据和可行动方向;它不接收完整的当前 ASP。Reflector 汇总这些诊断与父 ASP,做一次全局修订 θ′=Reflector(θ, {ai}),每次迭代最多产生一个完整候选,而不是从同一父节点分支出多个替代。
    • 接受与档案:候选在同一 mini-batch 上重评,仅当 r̄ch>r̄par 才进入探针集 P 的评估并写入档案 A。档案按 GEPA 的 Pareto 式原则保留:对每个探针样本保留当前档案最高奖励,父策略按“在多少个探针上达到该最高奖励”的权重做类别采样。预算 NASP 用尽后,取探针平均奖励最高的 ASP 作为 θ⋆。完整流程见附录 Algorithm 1。
    • 图示与正文的命名:Figure 2 把左支画成 Analyst–Aggregator 与 beam search;§3.2 与 Algorithm 1 使用 Critic 与 Reflector,且写明每次迭代最多一个新候选。作者称 Figure 2 包含 beam search 与 beam selection;Algorithm 1 的文字步骤是单候选接受测试加档案选择。

    阶段二:用 GRPO 更新攻击者权重

    • 优化范围:θ⋆ 作为系统条件保持不变。策略 πϕ 生成完整序列 o,含内部推理 token、timg 与 u。作者在全序列上优化,理由是推理 token 因果地影响后续对抗构造,丢掉它们会使 rollout 与策略优化不一致(附录 C.3)。ϕViT 保持冻结,只更新 ϕtrain。
    • 格式门控:二元验证器 Rfmt(o)∈{0,1} 检查推理块、timg 与 u 是否存在且完整。门控奖励 r̃=Rfmt(o)·r,作者称这是硬结构门,没有额外的语义奖励整形。
    • 组相对优势:对每个 qi 采 G 条 rollout,在组内对门控奖励做标准化得到优势 Ai,g(式 17)。ϕk 是当前步的冻结 rollout 策略;KL 正则的参考策略 πϕ0 在阶段二始终固定。作者称组内归一化避免手工标定全局奖励尺度。
    • 目标与更新:token 级 GRPO 目标 JGRPO 对全序列(含推理 token)计算重要性比,并用非负 k3 KL 正则,强度由 βKL 控制;裁剪区间为 1−εclip 到 1+εclip。用 AdamW 与余弦日程对 ϕtrain 做梯度上升。附录 Algorithm 2 还写了优化轮数 E 与梯度裁剪 gmax。最终产物是 (θ⋆, ϕ⋆)。

    成功判定与防御下的判定

    • 主协议:ASR 为毒性分 s≥4 的比例。Table 1 的 Avg. 是全部 1,680 条测试样本上的样本级微平均。
    • 防御协议:在 AdaShield、VLMGuard-R1、Llama-Guard-4、LlavaGuard 下,越狱仅当 sJ≥4 且生成回复通过相应护栏过滤才算成功。各方法在防御开启时走各自的标准推理循环;同一 (θ⋆, ϕ⋆) 不做防御专用再适配。
  4. 论文做了哪些实验?

    MM-SafetyBench 上 MAMJ 的微平均 ASR 为 82.0%、79.3%、83.0%,并在四种防御下复用同一攻击者。

    实验设置

    • 受害模型:GPT-4o、Gemini-3-Pro-Preview、Seed 2.0。MAMJ 只针对 GPT-4o 训练,再迁移到后两者。攻击者基座为 Qwen3-VL-32B-Thinking。图像生成器在局限中写为经外部 API 访问的 Z-Image,实验中 G 固定、不微调。
    • 数据:主基准 MM-SafetyBench,13 个安全类别,Avg. 为 1,680 条测试的样本级微平均。训练集构造在附录 D,论文正文未给出 |Dtrain| 与探针集规模。附录 H 另报 SafeBench。
    • 基线与预算:MM-SafetyBench、HADES、SIVA、FigStep 的 Niter=1;VisCo 的 Niter=4;IDEATOR 的 Niter=3;MAMJ 的 Niter=2。作者称公平比较协议(B.1)下共用同一基础攻击者。
    • 指标:ASR(%)。成功为 s≥4。防御下还要求通过对应护栏。消融报告三次随机种子的平均 ASR 及标准差;主表 Table 1、Table 2 未写种子或重复次数。
    • 评审:J 按附录 J 的 1–5 分量规打分。附录 I 用独立的 Seed 2.0 评审重打分。论文未在正文给出与人工标注的一致性。
    • 防御:仅在 GPT-4o 上重跑,四种防御为 AdaShield、VLMGuard-R1、Llama-Guard-4、LlavaGuard。消融在无防御的 GPT-4o 源受害模型上进行。

    主结果

    Table 1 的 Avg. 为 1,680 条上的微平均 ASR(%)。摘要写 GPT-4o、Gemini-3-Pro-Preview、Seed 2.0 分别为 81.0%、78.9%、82.3%,并称超出最强样本级基线最多 24.1 个百分点;Table 1 与 §4.1 的对应数字不同,下表以 Table 1 为准。

    表格较宽,可左右滑动

    受害模型最强模板基线 Avg.VisCo Niter=4IDEATOR Niter=3MAMJ Niter=2
    GPT-4oFigStep 14.4054.2361.8582.02
    Gemini-3-Pro-PreviewFigStep 14.4047.9856.6779.29
    Seed 2.0FigStep 22.5055.7762.9283.04

    据 Table 1。模板四行里 FigStep 的 Avg. 最高,故“最强模板基线”取 FigStep;MM-SafetyBench / HADES / SIVA 的 Avg. 更低,未逐行列入。

    • 作者的解读:在更小的逐查询预算(Niter=2,对比 IDEATOR 的 3 与 VisCo 的 4)下,MAMJ 在几乎所有场景和受害模型上高于两个迭代基线。§4.1 写相对 IDEATOR 为 +20.2、+22.6、+20.12 个百分点。作者称增益来自元级适配而不是模型容量,因为公平协议下基座攻击者相同。
    • 类别上的高低:Table 1 中,GPT-4o 上 MAMJ 的 HC 为 44.95%,低于同模型 FR 的 94.81% 与 HS 的 93.87%。相对 IDEATOR,GPT-4o 的 IA 为 87.63% 对 89.69%,MAMJ 较低;Gemini-3-Pro-Preview 的 EH 为 86.07% 对 IDEATOR 的 69.67%。作者特别点出 GPT-4o 上 LO、HC、GD 相对 IDEATOR 的提升。
    • 迁移:作者称攻击者只在 GPT-4o 上训练,在 Gemini-3-Pro-Preview 上保持接近的效果,在 Seed 2.0 上进一步提高;样本级基线的跨模型方差更大。附录 H 中 SafeBench 上 MAMJ 的 ASR 为 87.8%,作者称再次高于全部基线。

    对四种防御的评测

    Table 2 只比较 VisCo、IDEATOR、MAMJ,受害模型为 GPT-4o,Avg. 同为 1,680 条微平均。同一 (θ⋆, ϕ⋆) 不做额外调参。

    表格较宽,可左右滑动

    防御VisCoIDEATORMAMJ
    AdaShield39.4047.9852.68
    VLMGuard-R134.7042.7449.17
    Llama-Guard-439.5841.1354.17
    LlavaGuard44.2349.6464.17

    据 Table 2 的 Avg. 列。

    • 作者的解读:MAMJ 在四种防御上的 Avg. 都高于 IDEATOR,作者给出的差距为 +4.7、+6.4、+13.04、+14.5 个百分点,并称在 Llama-Guard-4 与 LlavaGuard 下优势更明显。
    • 类别例外:AdaShield 下 MAMJ 的 HS 为 42.94%,低于 IDEATOR 的 58.90%,也低于 VisCo 的 39.88 这一格并不成立——42.94 高于 VisCo 的 39.88,但低于 IDEATOR。Llama-Guard-4 下 MAMJ 的 MG 为 59.09%,低于 IDEATOR 的 77.27%;PH 为 53.47%,低于 IDEATOR 的 61.81%;PV 为 52.52%,低于 IDEATOR 的 65.47% 与 VisCo 的 63.31%。LlavaGuard 下 MAMJ 的 EH 为 57.38%,低于 IDEATOR 的 63.11%;FR 为 77.27%,低于 IDEATOR 的 85.06%。这些格的 Avg. 仍是 MAMJ 更高。
    • 无防御对比:Table 1 中 GPT-4o 上 MAMJ 为 82.02%;Table 2 中四种防御下为 52.68%、49.17%、54.17%、64.17%。

    组件、诊断聚合与奖励归一化

    消融均在无防御的 GPT-4o 上、MM-SafetyBench、三个随机种子。

    • 两条轴(Table 3):Base(通用 ASP、无优化)35.4±1.5;只优化 θ⋆、冻结 ϕ0 为 68.7±1.2;只做 GRPO、从通用提示出发为 63.2±1.4;完整 MAMJ 为 82.0±0.9。作者称 ASP 单独带来相对 Base 的 +33.3 个百分点,是主要驱动力;只做 RL 低于只做 ASP,因此认为 GRPO 受益于强策略初始化;两轴合用最高。Table 3 的 82.0±0.9 与 Table 1 的 82.02 数值接近,但是否同一次运行论文未说明。
    • 诊断聚合(Table 4):Sample-wise edit 56.4±1.8;只有 Aggregator、无 Analyst 为 62.8±1.6;MAMJ(group)68.7±1.2。作者称组聚合比 Aggregator-only 高 5.9 个百分点,比逐条编辑高 12.3 个百分点。表中角色写的是 Analyst / Aggregator;§3.2 的模块名是 Critic / Reflector。该 68.7±1.2 与 Table 3 的 ASP only 相同,论文未说明是否为同一次测量。
    • 奖励归一化(Table 5):Global 72.4±1.5;Rollout-wise 76.8±1.1;Group-relative 82.0±0.9。作者称全局归一化因奖励尺度在训练中漂移而不稳定;rollout 级把无关查询的轨迹混在一起,稀释了逐查询信号;组相对最好,因为只与同一查询的 rollout 比较。

    其他消融与分析

    • 重打分:作者称用独立 Seed 2.0 评审重打分后,排序和绝对 ASR 基本不变(附录 I);正文未给出重打分后的数字。
    • 预算与超参:NASP、推理链 log-prob 范围、βKL 敏感性,以及相对 IDEATOR 的训练与推理 token 消耗,正文指向附录 E、C.3、G,未在正文给出数值。
    • 摘要与表格:摘要的 81.0% / 78.9% / 82.3% 与“最多 24.1 个百分点”,对照 Table 1 的 82.02 / 79.29 / 83.04,以及相对 IDEATOR 的约 20.2 / 22.6 / 20.1 个百分点;结论又写“up to 82.3%”和“up to 24.1 pp”。两套数字论文都写出,未解释差异。
  5. 有什么可以进一步探索的点?

    作者认为跨基准泛化、图像生成 API 成本,以及未微调的图像生成器仍是开放问题。

    作者指出的局限与后续方向

    • 基准覆盖:训练和评测都在 MM-SafetyBench 上进行。作者写它覆盖 13 个安全场景,但没有穷尽多模态危害空间,所学策略对其他基准或攻击面的泛化程度仍待确立(Limitations)。
    • 训练成本:作者在附录 G 的分析中称,MAMJ 的总体成本主要由图像合成主导。训练时 Z-Image 经外部 API 访问,实际开销取决于该服务的定价与吞吐,而不是本地算力;摊销后的推理成本相对逐样本迭代基线仍然有利,但前期训练投入并非可忽略(Limitations)。
    • 图像生成器固定:G 始终作为固定的外部模块,作者优化 θ 与 ϕ,从不微调 G。作者称这一选择来自对失败轨迹的人工查看:大多数失败是受害模型拒绝(明确拒绝或安全补全),而不是 G 没有画出预期对抗内容,因此预期把 G 变成可训练带来的额外收益有限(Limitations)。
    • 该查看不是受控实验:作者写上述检查是定性的,没有做微调或以其他方式适配 G 的受控实验来量化效果,联合优化图像生成器的贡献仍是开放问题,也是后续工作的一个方向(Limitations)。
    • 防御方向:结论写,主要风险在于会在元层面适配的对手,而不在静态模式;作者鼓励未来工作把元级攻击分析与相应的策略感知防御配对(Conclusion 与 Ethics Statement 中的目标陈述)。Ethics Statement 同时说明实验在公开的 MM-SafetyBench 上进行,未收集人类受试者数据。

    实验覆盖范围

    • 受害模型与训练源:主表评测 GPT-4o、Gemini-3-Pro-Preview、Seed 2.0;MAMJ 的训练受害模型为 GPT-4o,(θ⋆, ϕ⋆) 不再训练即用于另外两个模型(§4.1)。
    • 防御:防御实验只在 GPT-4o 上重跑,包含 AdaShield、VLMGuard-R1、Llama-Guard-4、LlavaGuard;同一攻击者对四种防御都不做专用适配(§4.2、Table 2)。
    • 数据与协议:主 ASR 是 MM-SafetyBench 13 类、1,680 条测试的微平均;SafeBench 上正文给出 MAMJ 的 ASR 为 87.8%(§4.1、附录 H)。消融为三次种子的均值±标准差(§5);Table 1 与 Table 2 未报告重复次数。
    • 攻击管线中写明的模块:攻击者基座为 Qwen3-VL-32B-Thinking,只训练语言栈;图像侧为固定的 Z-Image API。成功阈值 τsucc=0.75。论文未在正文报告 NASP、G、βKL、εclip 的具体取值,这些放在附录 E。
    • 评审:主指标来自 J 的 1–5 分,s≥4 为成功;附录 I 用 Seed 2.0 做独立重打分,正文称排序与绝对 ASR 基本不变,未给出重打分数字,也未报告与人工评判的一致性。
  6. 总结一下论文的主要内容

    MAMJ 分阶段学习攻击策略与攻击者权重,在三个 VLM 和四种防御上报告了高于样本级基线的 ASR。

    MAMJ 把多模态越狱的优化对象从单条图文,改成攻击策略提示词 θ 和攻击者权重 ϕ。

    • 问题:模板攻击冻结图文版式;IDEATOR、VisCo 等样本级方法只改内容,迭代模板和攻击者参数不动。作者认为元层面因此仍是静态的。
    • 方法:攻击者是文本模式的 Qwen3-VL-32B-Thinking,外部 G 把 timg 渲染成图像。阶段一用 Critic 诊断失败轨迹、Reflector 修订 ASP,并以批平均奖励上升作为接受条件,再用探针档案选出 θ⋆。阶段二固定 θ⋆,以 s≥4(r≥0.75)为成功,用格式门控后的组相对 GRPO 更新语言栈,视觉编码器冻结。产物 (θ⋆, ϕ⋆) 只在 GPT-4o 上训练。
    • 主结果:Table 1 在 MM-SafetyBench 的 1,680 条上,MAMJ(Niter=2)微平均 ASR 为 GPT-4o 82.02%、Gemini-3-Pro-Preview 79.29%、Seed 2.0 83.04%;同表 IDEATOR(Niter=3)为 61.85%、56.67%、62.92%。摘要另写 81.0%、78.9%、82.3%,以及相对最强样本级基线最多 24.1 个百分点。SafeBench 上作者报告 MAMJ 为 87.8%。
    • 防御与消融:Table 2 中,GPT-4o 加四种防御时 MAMJ 的微平均为 52.68%、49.17%、54.17%、64.17%,均高于同表 IDEATOR;若干类别格子上 IDEATOR 或 VisCo 更高。无防御消融里,只优化 θ 为 68.7±1.2,只做 GRPO 为 63.2±1.4,两轴合用为 82.0±0.9(Table 3,三次种子)。
    • 作者的结论:作者认为结果表明前沿 VLM 对元自适应越狱存在系统性脆弱,并认为应针对会在元层面演化策略、而不只改单条内容的对手设计防御。作者同时写明,跨 MM-SafetyBench 以外的泛化尚未确立,且没有量化可训练图像生成器的贡献。
阅读原文arxiv.org