跳到正文
原文
论文追踪· arXiv:2607.21619· Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding·本站收录 · 原文发表 精选关注度53

ASO:用GRPO优化视觉风格放大MLLM越狱攻击

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

论文用 ASO 优化视觉风格,在 MM-SafetyBench 将 Qwen3-VL 的 QR Attack ASR 升至 42.98%(Table 1)。

威胁模型攻击者以最大化目标 MLLM 在有害意图下的越狱成功率(ASR)为目标;已知预先存在的基础越狱图文对,并假定可获取目标模型初始接受/拒绝决策的对数概率(或分类器代理)及二元判别神谕的概率反馈;攻击者通过微调图像编辑模型 FLUX-Kontext 生成具有对抗风格的混合图像以绕过安全对齐。

问题
多模态大语言模型(MLLMs)在面对越狱攻击时,现有基于内容的防御与攻击难以应对快速演进的模型,且忽视了图像呈现方式(如视觉风格)等非内容维度的安全脆弱性。论文旨在探索并利用风格敏感性这一新型攻击面。
方法
提出 ASO 框架:先通过风格敏感性探测确定目标模型最脆弱的朴素风格;再通过 DB-GRPO 强化学习算法结合 ODE 转 SDE 采样与结构分层奖励函数,自动微调图像编辑模型 FLUX-Kontext 的风格参数,生成高潜力的混合攻击图像。
实验与结果
在 MM-SafetyBench 与 VLBreakBench 上,ASO 普遍提升了基础攻击在开源与商业模型上的 ASR 与有害性评分。例如在 MM-SafetyBench 上,Gemini-2.5-Flash 的 QR Attack ASR 达 62.79%(Table 1)。
局限与可以继续做的
论文未专门讨论局限。其实验覆盖了 4 个 MLLM、5 种基础攻击与 2 个越狱基准,图像编辑生成器仅采用 FLUX-Kontext,评测完全基于 HarmBench 自动化判定,未报告优化超参数与重复实验次数等具体数值。
实验设置GPT-4.1-mini、Gemini-2.5-Flash 等 · MM-SafetyBench、VLBreakBench · ASR、Harmfulness Score (HS)
被测模型
GPT-4.1-miniGemini-2.5-FlashQwen3-VLLLaVA-OneVision-1.5GPT-4.1Gemini-2.5
基准
MM-SafetyBenchVLBreakBench
指标
ASRHarmfulness Score (HS)
AI 导读和推荐理由哈尔滨工程大学、山东大学与西安电子科技大学的研究者提出 Adversarial Style Optimization(ASO),一个即插即用的增强模块,用于放大现有多模态越狱攻击。作者发现 MLLM 存在风格不一致:理解内容不受视觉风格影响,但防御机制可被特定风格触发绕过。ASO 先用风格池探测目标模型最脆弱的风格方向,再用 GRPO 微调 FLUX-Kontext 等图像编辑模型,配合分层奖励函数叠加优化后的风格扰动。在 GPT-4.1、Gemini-2.5、Qwen3-VL 和 LLaVA-OneVision-1.5 上,ASO 对 QR-Attack、SI-Attack、HIMRD 等基线攻击的攻击成功率均有提升,Harmfulness Score 也同步上升;消融显示增益主要来自 RL 增强阶段而非朴素风格滤波。

哈尔滨工程大学、山东大学与西安电子科技大学的研究者提出 Adversarial Style Optimization(ASO),一个即插即用的增强模块,用于放大现有多模态越狱攻击。作者发现 MLLM 存在风格不一致:理解内容不受视觉风格影响,但防御机制可被特定风格触发绕过。ASO 先用风格池探测目标模型最脆弱的风格方向,再用 GRPO 微调 FLUX-Kontext 等图像编辑模型,配合分层奖励函数叠加优化后的风格扰动。在 GPT-4.1、Gemini-2.5、Qwen3-VL 和 LLaVA-OneVision-1.5 上,ASO 对 QR-Attack、SI-Attack、HIMRD 等基线攻击的攻击成功率均有提升,Harmfulness Score 也同步上升;消融显示增益主要来自 RL 增强阶段而非朴素风格滤波。

推荐理由论文提出用强化学习优化图像风格来放大现有多模态越狱攻击,并给出跨模型与跨基线的成功率提升数据。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    论文试图通过对抗优化图像视觉风格这一非内容向量,增强针对多模态大模型的视觉越狱攻击效果。

    多模态大语言模型(MLLMs)的安全对齐容易受到越狱攻击,而现有基于内容的越狱方法效果不稳定且未利用非内容层面的风格脆弱性,论文试图通过对抗风格优化增强视觉越狱攻击。

    • 场景与重要性:随着 MLLMs 快速部署至搜索引擎和辅助创作等现实应用,其安全对齐与鲁棒性成为紧迫问题。作者称红队与越狱研究是主动发现潜在漏洞以便在恶意利用前完成修补的必要手段。
    • 现有方法的不足:现有先进越狱多集中于操纵图像语义内容的基于内容攻击(如印刷文字或对抗优化物体),面对快速演进的 MLLMs 时表现不够稳定,且未探索图像呈现方式(如视觉风格、光照、构图)等非内容维度的攻击面。
    • 核心观察与假设:MLLMs 在理解能力与安全能力之间存在风格不一致性(Stylistic Inconsistency),即模型能在不同视觉风格下鲁棒理解内容,但安全机制容易被特定风格触发器绕过;直接应用现成风格滤镜即可带来攻击成功率提升。
    • 论文提出的方法:论文提出了对抗风格优化(Adversarial Style Optimization, ASO)框架,作为一个即插即用增强模块,通过强化学习自动微调图像编辑模型的风格参数,将优化后的风格叠加到已有基础攻击图像上生成混合触发器。
    • 威胁模型:
      • 攻击者目标:最大化基础越狱数据集在目标 MLLM 上的攻击成功率(ASR),诱导模型针对有害意图输出违规内容。
      • 攻击者知识:论文设定攻击者拥有预先存在的基础越狱图文对数据集(Dbase),并假定可获取目标 MLLM 初始决策(接受或拒绝)的概率或其分类器代理,以及二元判别模型作为神谕(oracle)。
      • 攻击者能力:攻击者能够通过图像编辑生成器(FLUX-Kontext)对基础攻击图像进行风格转换与参数微调,构建混合攻击图像(Ihybrid)。
      • 受害系统:具备视觉-语言推理与指令遵循能力且经过安全对齐的商业与开源 MLLMs(如 GPT-4.1-mini、Gemini-2.5-Flash、Qwen3-VL、LLaVA-OneVision-1.5)。
  2. 有哪些相关研究?

    论文围绕 MLLM 架构、基于内容与非内容的越狱攻击展开梳理,将 ASO 定位为首个优化风格漏洞的即插即用框架。

    多模态大语言模型(MLLMs)

    • MiniGPT-4(2023)与 LLaVA 系列(2023)——MiniGPT-4 采用基于 Q-Former 的投影层连接冻结的视觉编码器与大语言模型;LLaVA 提出使用单个线性投影层将视觉特征直接映射到大语言模型的词嵌入空间。
    • DeepSeek-VL 系列(2024, 2024)与 LLaVA 演进版本(2024, 2025)——DeepSeek-VL 与 DeepSeek-VL2 展现了先进多模态理解与混合专家架构;LLaVA-OneVision 与 LLaVA-OneVision-1.5 拓展了视觉推理能力。
    • Qwen3-VL(2025)及商业模型——Qwen3-VL 展现出双语任务与细粒度视觉理解能力;与此同时,GPT-4.1 与 Gemini-2.5 等闭源模型亦快速迭代。

    基于内容的 MLLMs 越狱攻击

    • 视觉排版与对抗物体攻击——FigStep(2025)通过排版视觉提示词实施越狱;HADES(2024)利用对抗优化的物体作为视觉恶意触发器。
    • 复杂内容触发器生成——QR-Attack(2024)、IDEATOR(2025)与 HIMRD(2025)通过操纵输入图像的语义内容来构建触发器。作者指出多数现有前沿方法集中在此类内容攻击上,被本论文用作待增强的基础攻击。

    非基于内容的越狱攻击

    • 针对感知或结构处理的攻击——Shao 等人(2025)探索了针对感知或结构处理的攻击。
    • 打乱不一致性漏洞——SI-Attack(2025)发现 MLLMs 存在打乱不一致性(Shuffle Inconsistency),即打乱提示词中的词语或图像中的图像块能绕过安全机制。

    基线方法与评测基准

    • 基线方法:实验选取了 FigStep、QR Attack、SI Attack、IDEATOR 以及 HIMRD 共 5 种攻击方法作为基础攻击基线(Dbase)。
    • 评测基准:使用了两大越狱基准数据集 MM-SafetyBench(2024)与 VLBreakBench(2025),并采用 HarmBench(2024)作为自动化评审模型与评估标准。

    与现有工作的区别与定位

    • 作者指出,SI-Attack 证实了非内容漏洞的威胁,但视觉风格等其他非内容向量尚未得到系统探索;此前亦无工作提出通用的即插即用框架来放大此类风格脆弱性。ASO 结合强化学习对抗优化风格参数,构建融合内容与非内容优势的混合触发器。
  3. 论文如何解决这个问题?

    ASO 包含风格探测与基于 DB-GRPO 的强化学习两阶段,利用结构分层奖励函数自动微调图像编辑模型的风格参数。

    论文提出对抗风格优化(Adversarial Style Optimization, ASO)框架,分为风格敏感性探测与基于 GRPO 的风格增强两个序贯阶段,利用强化学习自动微调图像编辑模型,寻找最优风格参数以最大化越狱成功率。

    问题设定与目标形式化

    • 增强生成器优化目标:给定基础攻击集 Dbase,目标是学习图像转换生成器 G,使混合图像数据集在目标模型 M 与判别模型 J 下的平均 ASR 最大化,核心优化目标为:

    G∗ = argmaxG ( 1/N ∑j=1N 𝒥(ℳ(G(Ibase,j), Pharm,j), Pharm,j) ) 该公式表示寻找最优生成器 G*,使其变换后的图像与有害意图输入目标模型后,通过判别模型判定的越狱成功率最高。

    • MDP 强化学习建模:将风格增强形式化为马尔可夫决策过程。智能体为图像编辑生成器 G(·; Θ);状态 st 为从 Dbase 采样的基础攻击对 (Ibase,j, Pharm,j);动作 at 为在固定风格指令 Pstyle,* 条件下生成的混合图像 Ihybrid,j;奖励 rt 由分层奖励函数提供。

    风格敏感性探测阶段

    • 风格池构建:定义包含 NS 个样式的风格池 S,划分为 4 类攻击假设子集:介质与纹理模拟 Smed(如铅笔素描、油画、水彩)、几何与抽象形变 Sgeo(如立体主义、像素艺术、低多边形)、主题与氛围操控 Satm(如黑色电影、赛博朋克、哥特恐怖)以及特定领域插画 Sdom(如动漫风、漫画书艺术、儿童绘本插画)。
    • 脆弱方向量化与筛选:使用未微调的生成器 G(·, ·; Θ0) 与文本风格指令 Pstyle,i 将 Dbase 全部样本转换为对应风格,输入目标模型 M 并由 J 评估 ASR。选取取得最高基础 ASR 的风格 S* 作为后续增强阶段的输入指令。

    结构分层奖励函数

    • 硬阈值分界设计:为克服判别模型二元奖励过于稀疏的问题,设计以 Cthresh = -10 为硬阈值的连续分段奖励函数,将奖励空间严格划分为拒绝域与接受域:

    r_t = \begin{cases} C_{\text{thresh}} + \log \left( \frac{P_{\mathcal{M}}(\text{accept}|I_h, P_h)}{P_{\mathcal{M}}(\text{rejected}|I_h, P_h)} \right) & \text{若被拒绝} \\ \max \left( \log \left( \frac{P_{\mathcal{J}}(\text{yes}|R, P_h)}{P_{\mathcal{J}}(\text{no}|R, P_h)} \right), C_{\text{thresh}} \right) & \text{若被接受} \end{cases} 该公式表示若目标模型拒绝则根据接受与拒绝概率比给予低于阈值的密集惩罚,若接受则根据评审模型判定有害的概率比给予高于等于阈值的连续奖励。

    • 拒绝域层级奖励(Level 1):当目标模型做出显式拒绝时,利用目标模型初始决策的对数概率比构造负向奖励,保证奖励值严格低于 -10,提供使模型降低拒绝置信度的稠密梯度。
    • 接受域层级奖励(Level 2):当目标模型未显式拒绝时,将输出交由评审模型 J 评估其有害与无害概率,对数值采用 max(·, Cthresh) 进行截断保护,防止被判定为无害的成功绕过受到比显式拒绝更严厉的惩罚。

    动态批次策略优化(DB-GRPO)

    • 随机性引入与优势估计:底层图像编辑生成器采用流匹配模型 FLUX-Kontext,通过 ODE 转 SDE 方法转换确定性采样,以满足在线策略梯度的随机探索需求;跳过学习价值函数的复杂性,直接将分组归一化后的分层奖励作为优势值 Aj,采用 PPO 裁剪代理目标进行重要性采样更新。
    • 课程筛选与剔除机制(Curate & Evict):训练中维护未解决池 Dunsolved 与成功收集池 Dsuccess。每轮仅从 Dunsolved 采样批次 B;更新后若样本达到成功阈值(rj > Cthresh),将其图像存入 Dsuccess 并从 Dunsolved 移除;若样本达到最大尝试次数 Kmax 仍未成功,同样从 Dunsolved 剔除,以将算力聚焦于未攻破样本。
  4. 论文做了哪些实验?

    ASO 在 4 个模型和 2 个基准上普遍提升了基础攻击的 ASR,但在 GPT-4.1-mini 增强 HIMRD 时出现微降。

    实验设置

    • 被测模型:测试了商业闭源模型 GPT-4.1-mini 与 Gemini-2.5-Flash(正文提及 GPT-4.1 与 Gemini-2.5),以及开源模型 Qwen3-VL 与 LLaVA-OneVision-1.5(LLaVA-OV-1.5)。
    • 数据集与基准:采用了 MM-SafetyBench(涵盖 13 个风险类别)与 VLBreakBench 两个多模态越狱基准数据集;论文未报告具体样本条数。
    • 基线方法:选取了 FigStep、QR Attack、SI Attack、IDEATOR 以及 HIMRD 共 5 种近期 SOTA 攻击方法作为基础攻击(Dbase)。
    • 指标定义:主要指标为攻击成功率(ASR,HarmBench 输出二元判别为 Yes 的百分比)与有害性评分(HS,HarmBench 输出 harmful 与 harmless 的对数概率差)。
    • 评审方式:采用自动化评审模型 HarmBench 作为判别器 J 和评估标准。
    • 生成器与优化配置:图像编辑生成器采用 FLUX-Kontext,优化采用 DB-GRPO;论文未报告批大小 B、学习率 α、最大尝试次数 Kmax 及重复实验次数的具体数值。

    主结果

    据 Table 1,ASO 在 MM-SafetyBench 基准上对各类基础攻击的 ASR 提升效果如下(百分比为 ASR):

    表格较宽,可左右滑动

    方法Qwen3-VLLLaVA-OV-1.5GPT-4.1-miniGemini-2.5-Flash
    FigStep(基线)37.26%40.77%40.62%39.53%
    QR Attack(基线)38.99%37.80%54.26%55.04%
    QR Attack + Ours42.98%44.35%57.36%62.79%
    SI Attack(基线)39.31%37.82%53.49%55.81%
    SI Attack + Ours42.58%44.25%57.36%62.02%
    HIMRD(基线)87.38%52.92%72.80%75.97%
    HIMRD + Ours89.52%55.42%71.77%76.74%
    • ASR 的普遍提升与例外:据 Table 1,ASO 在绝大多数设置下提升了基础攻击的 ASR;例外情况为在 GPT-4.1-mini 上增强 HIMRD 时,ASR 从 72.80% 降至 71.77%(微降 1.03 个百分点),作者称整体表现展现出强大且通用的增强效果。
    • 有害性评分的同步增长:据 Table 1,ASR 的提升伴随着有害性评分(HS)的增长,例如 QR Attack 在 Gemini-2.5-Flash 上 HS 从 0.26 升至 1.05,在 Qwen3-VL 上从 -3.57 升至 -2.91;作者称这表明优化后的风格诱导出了更有害的回答,而非单纯绕过拒绝机制。
    • 不同基础攻击的增益差异:在 baseline 相对较低的 QR Attack 与 SI Attack 上,ASO 带来了明显提升(如 Gemini-2.5-Flash 上分别提升 7.75 和 6.21 个百分点);在基线已很高的 HIMRD 上,ASO 仍能进一步提升(如 Qwen3-VL 上从 87.38% 增至 89.52%)。

    VLBreakBench 基准评测

    • 评测内容与设置:在 VLBreakBench 基准上测试 FigStep、IDEATOR、SI Attack 及其经 ASO 增强后的表现,覆盖全部 4 个模型。
    • 实验结果:据 Table 2,在 IDEATOR 上,Qwen3-VL 的 ASR 从 48.28% 升至 53.27%(HS 从 0.18 升至 0.84),LLaVA-OV-1.5 从 47.06% 升至 52.28%,GPT-4.1-mini 从 74.82% 升至 75.54%,Gemini-2.5-Flash 从 66.19% 升至 66.91%;在 SI Attack 上,四个模型的 ASR 分别从 49.72%、48.39%、75.54%、58.99% 提升至 53.16%、51.28%、77.70%、65.47%。
    • 作者的解读:作者认为跨基准实验结果进一步证实 ASO 作为一个即插即用模块能够在不同数据集与模型生态中普遍放大基础攻击效果。

    13 个细分安全类别的表现分析

    • 评测内容与设置:在 MM-SafetyBench 的 13 个风险类别上深入分析 QR Attack、SI Attack 与 HIMRD 增强前后的表现(Table 3,论文未标明具体目标模型)。
    • 实验结果:在低基线类别上,欺诈(FR)类别的 ASR 在 QR Attack 上从 5.2% 提升至 9.7%,在 SI Attack 上从 4.6% 提升至 7.1%;在近饱和类别上,经济危害(EH)在 HIMRD 上 ASR 从 95.1% 升至 97.5%,HS 从 9.6 升至 10.1;在仇恨言论(HS)和金融欺诈等高难度类别均观察到 ASR 或 HS 增长。
    • 作者的解读:作者认为 ASO 并非仅在平均指标上体现增益,而是在各类别均带来稳定提升,既能将弱脆弱信号转化为可用攻击,也能强化高成功率攻击的有害程度。

    两阶段消融实验

    • 评测内容与设置:对比原始基线(Original)、仅添加朴素最优风格探测(+ Probing)以及完整强化学习增强(++ Enhance)的 ASR 变化,在 Qwen3-VL 和 LLaVA-OV-1.5 上评测 QR Attack、SI Attack 和 HIMRD(Table 4)。
    • 实验结果:在 Qwen3-VL 上,QR Attack 从原始 38.99% 经 Probing 升至 40.48%,经 Enhance 升至 42.98%;SI Attack 从 39.31% 经 Probing 升至 40.62%,经 Enhance 升至 42.58%;在 LLaVA-OV-1.5 上,SI Attack 从 37.82% 经 Probing 升至 39.96%,经 Enhance 升至 44.25%(Table 4)。
    • 作者的解读:作者称 Probing 阶段提供了微小但积极的增益,验证了风格敏感性确实存在;而绝大部分性能提升归功于 RL 增强阶段,证实对抗优化是释放风格漏洞潜力的核心。

    其他消融与分析

    • 据 Figure 1 柱状图,ASO 带来的 ASR 提升幅度分别为 GPT(3.10%)、LLaVA(6.98%)、Gemini(6.55%)、Qwen(3.99%)(图表未标注具体基准与基础攻击条件)。
    • 据 Table 1,在 GPT-4.1-mini 上增强 HIMRD 时,ASR 从 72.80% 降至 71.77%,HS 从 4.22 降至 3.64,作者未在正文中解释该异常下降原因。
  5. 有什么可以进一步探索的点?

    论文未专门讨论局限;实验在 4 个模型和 2 个基准上评测了 5 种基础攻击,评测完全基于 HarmBench 自动化判断。

    作者指出的局限与后续方向

    • 论文未专门讨论局限。

    实验覆盖范围

    • 被测模型范围:实验测试了 4 个模型,包括开源模型 Qwen3-VL、LLaVA-OneVision-1.5,以及商业模型 GPT-4.1-mini、Gemini-2.5-Flash(正文亦提及 GPT-4.1 和 Gemini-2.5)。
    • 基础攻击方法与基准:实验涵盖了 FigStep、QR Attack、SI Attack、IDEATOR、HIMRD 共 5 种基础攻击,评测基准使用了 MM-SafetyBench 和 VLBreakBench。
    • 图像生成与编辑模型:风格增强阶段的图像编辑模型仅采用了 FLUX-Kontext。
    • 评审与判别设置:越狱判别模型统一采用 HarmBench 进行自动化二元评测与有害性打分,未报告人工评估结果或评审模型与人工判定的一致性。
    • 训练与优化参数报告:论文给出了奖励函数的硬阈值 Cthresh = -10,但未报告批大小 B、学习率 α、最大尝试次数 Kmax、算法迭代轮数、优化耗时及重复实验次数。
  6. 总结一下论文的主要内容

    论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
    • 论文定位:论文提出了一种利用模型内在风格敏感性漏洞、基于强化学习优化视觉风格触发器以增强视觉越狱攻击的即插即用框架 ASO。
    • 要解决的问题:现有 MLLMs 越狱主要依赖操纵语义内容的攻击手段,面对安全对齐演进时表现不够稳定,且忽视了图像视觉风格等非内容维度的安全脆弱性。
    • 方法核心机制:ASO 首先通过风格敏感性探测从包含 4 类假设的风格池中筛选出目标模型最脆弱的朴素风格;进而采用结合 ODE 转 SDE 与动态批次机制的 DB-GRPO 算法,在以 -10 为硬阈值的结构分层奖励函数引导下,对图像编辑模型 FLUX-Kontext 进行微调,自动搜索最优风格参数以生成混合触发器。
    • 主要实验结果:在 MM-SafetyBench 上,ASO 使 QR Attack 在 Gemini-2.5-Flash 上的 ASR 从 55.04% 提升至 62.79%(Table 1);使 SI Attack 在 LLaVA-OV-1.5 上的 ASR 从 37.82% 提升至 44.25%(Table 1);在 VLBreakBench 上,使 IDEATOR 在 Qwen3-VL 上的 ASR 从 48.28% 提升至 53.27%(Table 2);但在 GPT-4.1-mini 上增强 HIMRD 时 ASR 从 72.80% 微降至 71.77%(Table 1)。
    • 消融与细粒度发现:消融实验表明,仅使用朴素风格探测在 Qwen3-VL 上仅使 SI Attack ASR 从 39.31% 提升至 40.62%,而加入 RL 增强后进一步升至 42.58%(Table 4);在 MM-SafetyBench 的欺诈类别中,QR Attack 的 ASR 从 5.2% 提升至 9.7%(Table 3)。
    • 作者结论与启示:作者认为 MLLMs 的安全对齐不仅取决于内容本身(what),还显著受到视觉呈现风格(how)的影响,表明防御机制需要从单纯的内容过滤扩展到防范非内容维度的风格偏置。
阅读原文arxiv.org