跳到正文
原文
论文追踪· arXiv:2605.07399· Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang·本站收录 · 原文发表

研究者提出 GPO-V,用全局概率优化越狱扩散视觉语言模型

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

GPO-V在LLaDA-V、AdvBench、NA=2上JSR为93.2%,同行FPO为9.8%(Table 1)。

威胁模型攻击者用有界视觉扰动δ(无穷范数小于ϵ,像素或潜空间)优化目标dVLM,使其对指定威胁内容给出肯定回答,并抑制Immediate Refusal与Progressive Refusal。

问题
dVLM看似能挡住以合规前缀起头的FPO越狱,但拒绝发生在去噪轨迹上:Immediate Refusal与Progressive Refusal。作者认为这暴露了非顺序生成的攻击面。
方法
GPO在早期扩散步压低全序列拒绝概率,并用锚点损失稳住连接性token。GPO-V把该损失用于有界视觉扰动,默认潜空间优化,附录也报告像素空间。
实验与结果
Table 1:LLaDA-V、AdvBench、NA=2,GPO-V的JSR为93.2%,同行FPO为9.8%。该表各行GPO-V均高于同行FPO。Table 3迁移JSR为65.4%–72.1%,未标明源模型。
局限与可以继续做的
论文无局限专节。Conclusion呼吁再评估防御,并优先做非顺序生成的防护。实验为LLaDA-V与LaViDA、AdvBench与JailBreakBench。未报告人工评分样本量、ϵ、非零λ与重复次数。
实验设置LLaDA-V、LaViDA · AdvBench、JailBreakBench · JSR、H-HS 等
威胁模型
攻击者用有界视觉扰动δ(无穷范数小于ϵ,像素或潜空间)优化目标dVLM,使其对指定威胁内容给出肯定回答,并抑制Immediate Refusal与Progressive Refusal。主实验对δ做梯度优化,论文未称white-box。迁移为black-box:源模型像素对抗样本用于异构受害模型,不需其梯度。
被测模型
LLaDA-VLaViDA
基准
AdvBenchJailBreakBench
指标
JSRH-HSA-HSFPT
AI 导读研究者提出 GPO-V,一个针对扩散视觉语言模型(dVLMs)的视觉模态越狱框架,通过全局概率优化(GPO)操纵掩码扩散模型的去噪轨迹绕过护栏。论文把传统越狱归为固定前缀优化(FPO),指出 dVLMs 虽对 FPO 类攻击表现稳健,但会触发即时拒答与渐进式拒答两种模式,而渐进式细化过程本身暴露出新的攻击面。作者称 GPO-V 是首个面向 dVLMs 的视觉模态越狱框架,能生成隐蔽扰动并具备跨模型迁移性。代码已公开。

研究者提出 GPO-V,一个针对扩散视觉语言模型(dVLMs)的视觉模态越狱框架,通过全局概率优化(GPO)操纵掩码扩散模型的去噪轨迹绕过护栏。论文把传统越狱归为固定前缀优化(FPO),指出 dVLMs 虽对 FPO 类攻击表现稳健,但会触发即时拒答与渐进式拒答两种模式,而渐进式细化过程本身暴露出新的攻击面。作者称 GPO-V 是首个面向 dVLMs 的视觉模态越狱框架,能生成隐蔽扰动并具备跨模型迁移性。代码已公开。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    dVLM的两类拒绝挡住前缀越狱,作者改做视觉上的全局概率优化。

    dVLM会在去噪过程中拒绝,锁死合规前缀对不上这一机制。

    • 场景:作者称dVLM建在非因果的Diffusion LLM上,多模态任务有效,但自回归模型已有大量安全对齐,dVLM的安全仍少被考察。作者把越狱风险称为这一架构的紧迫问题(Introduction)。
    • 现有做法:作者将常规越狱归为Fixed Prefix Optimization(FPO),即迫使回答以合规前缀开头。无优化样本触发Immediate Refusal;FPO样本虽先出现目标前缀,扩散的全局校正通常转入Progressive Refusal,越狱失败(Figure 1、Figure 2)。
    • 观察:Immediate Refusal先在序列后部放终止类token,再向前铺,最后在开头给出拒绝。Progressive Refusal在部分肯定内容出现后才插入否定token。作者认为这来自双向、迭代的细化,而不是自回归式从头拒绝(Section 3.3)。
    • 提出:作者提出Global Probability Optimization(GPO),提高肯定响应模式的似然、压低否定模式,并据此做视觉框架GPO-V。作者称这是对dVLM拒绝模式的首次系统分析,也是首个dVLM视觉越狱框架。
    • 威胁模型:
      • 目标:对指定威胁内容p′生成肯定回答,并抑制全部拒绝模式(Section 3.5)。
      • 能力:优化图像扰动δ,无穷范数小于ϵ;可作用于像素或视觉编码器的潜表示。作者称ϵ通常很小,论文未给数值。
      • 知识:主实验对δ做梯度优化,论文未使用white-box一词。迁移写明为black-box setting:源模型像素对抗样本用于架构不同的受害模型,不需要其内部梯度(Section 4.3)。
      • 受害系统与判定:实验模型为LLaDA-V与LaViDA。Figure 12将危害分6定义为越狱成功阈值;指标为JSR、H-HS、A-HS、FPT。
  2. 有哪些相关研究?

    相关工作分为扩散语言模型与LLM越狱;作者称FPO与全局细化不匹配。

    论文的讨论集中在扩散语言模型,以及以固定前缀为目标的越狱。

    扩散语言模型

    • 图像扩散:论文从DDPM讲起,把去噪看成Markov chain,并提到DDIM、SDE、flow matching、consistency models等用于改进采样(Section 2.1)。
    • 离散文本扩散:论文称离散文本使连续扩散困难,masked diffusion按上下文迭代生成高置信token。作者称LLaDA是把masked文本生成用于扩散语言模型的首个框架,为8B双向transformer、从头训练;Dream基于预训练自回归权重。作者称二者与相近规模自回归模型性能相当,且生成更快。
    • 视觉扩展:LLaDA-V与LaViDA以dLLM为骨干并加vision tower。作者称此前dVLM的越狱风险没有被系统考察。

    LLM越狱与FPO

    • 前缀优化:GCG用类似AutoPrompt的离散优化,最大化固定前缀的概率。论文称后续工作常把该目标当作损失,形成FPO;FPO也被用于多模态,尤其视觉场景,因为像素上的可微量更容易优化(Section 2.2)。
    • 其他攻击:论文提到用目标争用和上下文污染操纵输出,以及搜索输入扰动的方法(含universal adversarial triggers、HotFlip)。这些只作背景,论文未逐篇与本文对比。
    • 批评所挂的对象:批评针对FPO这一类,而不是被引作者自己的结论。作者称由于dLLM的结构,FPO只有中等表现,面向dLLM与dVLM的可泛化优化策略仍少被探索。

    引言里的安全文献

    • 对齐与dLLM安全:作者称安全对齐研究主要在加强拒绝,并引用文本到图像越狱、多模态数据投毒、Tree of Attacks、对ChatGPT的多步隐私攻击。另一些工作考察了masked dLLM的安全。作者称多模态dVLM的具体失效模式仍少被考察。
    • 基线与基准:实验对照为无扰动Direct,以及FPO。Table 1将FPO标为文献[33, 27, 37, 28],Figure 2举例GCG、DSN。基准为AdvBench与JailBreakBench,论文写二者都含500条以上提示,覆盖良性与有害行为。

    作者把本文放在全局概率而不是固定前缀上,并称GPO-V用来绕过dVLM的Immediate Refusal与Progressive Refusal。

  3. 论文如何解决这个问题?

    GPO压低全序列拒绝概率并稳住锚点,GPO-V用它优化视觉扰动。

    GPO改的是整段生成分布,GPO-V把该损失做成有界视觉扰动,而不是强迫某个前缀。

    生成过程与两类拒绝

    • 并行细化:masked diffusion用<mask>替换token,经T步由mask predictor fθ并行预测各位置概率,再由选择器S按块数z和置信阈值c更新。论文写z越大更新范围越宽,且z=L时退化为传统自回归生成(Section 3.1)。Section 4.2另写:扩散block的大小决定自回归模块的有效生成长度。两处关系论文未再对齐。
    • Immediate Refusal:早期在序列后部生成终止类token,再向前传播;这些token占满大部分序列后,开头出现明确拒绝(Section 3.3)。
    • Progressive Refusal:部分肯定回答已经出现后,才产生否定原语。作者认为token概率条件于整段已细化序列,所以只抬高固定前缀的FPO效果有限。

    早期步为何被当成攻击面

    • 类比:作者借图像扩散的说法,称早期步先恢复低维结构,后期才补细节。对dVLM,作者认为最早几步的双向预测决定后续轨迹极性(Figure 3,Section 3.2)。
    • 只改第一步的试验:作者称若只在初始扩散步压低全局否定词概率、其后用普通推理,最终输出里的否定词元素会减少。论文未给该试验的比例。附录A.1监控锚点token的logit,不在此复述这些词。

    两个损失

    • L_global:正文称它在早期时间步抑制拒绝原语,并在每个位置最小化否定原语概率。式(7)写的是对R+的负对数似然,前面带负号。正文与公式里的符号不一致,论文未解释。作者称该损失不必对初始序列做大量推理,x接近早期的y^(t)即可。
    • L_anchor:作者推测只用L_global会走向Progressive Refusal,因为低时间步的肯定语义难以留到后面;把中间状态写进损失会提高计算成本。因此用一组连接性token R+作锚点,作者称其语义在迭代中更稳,可积成连贯的肯定回答。
    • 合并:总损失为 LGPO=λ1 Lglobal+λ2 Lanchor,扰动求解为 δ=argmin LGPO, |δ|∞<ϵ。前者是两项加权和,λ1、λ2为权重;后者是在无穷范数约束下最小化该损失。非零的λ论文未给;消融时分别置0。

    GPO-V怎么接上视觉输入

    • 攻击变量:对候选输入(I, p′)多轮优化δ,使目标模型Mθ在T步后对威胁内容p′给出输出。扰动可加在像素I上,或加在视觉编码器E(I)的潜表示上;论文举例编码器如SigLIP或DINOv2,实验未写实际用的是哪一个。
    • 默认域:作者称像素或潜空间主要影响收敛速度而不是最终ASR,为省计算,默认潜空间。像素空间结果在附录A.4。
    • 实验里写明的旋钮:δ最多优化150×NA步,NA为锚点数;学习率1e-2;回答长度128,每步采样1个token。FPO对照把指定前缀概率设为100%,前缀长度为5×NA。锚点模板AT1、AT2、AT3见附录A.3,主实验默认AT1,此处不列模板原文。
  4. 论文做了哪些实验?

    Table 1各行GPO-V的JSR均高于同行FPO,最高93.2%。

    实验设置

    • 模型与硬件:被测模型为LLaDA-V与LaViDA。作者称二者是主流masked diffusion vision-language models。实验在NVIDIA A800(80GB)上完成。Section 4.2写three baseline models,Table 1只列出这两个。
    • 数据:AdvBench与JailBreakBench。论文写各含500条以上提示,覆盖良性与有害行为,未给精确条数。
    • 对照:Direct为无扰动JSR。FPO在Table 1中对应文献[33, 27, 37, 28];指定前缀概率被设为100%,前缀长度为5×NA。Figure 2举例GCG、DSN,表内未分列各方法。
    • 指标与评审:JSR为越狱成功率。H-HS为人工危害分,A-HS为AI危害分,FPT为回答中禁止词频率。A-HS由ChatGPT-4o生成,附录A.8亦称GPT-4o;量表0–10,Figure 12把6分定义为成功越狱阈值,并要求只输出一个数字。论文未写JSR对应H-HS还是A-HS,也未报告人工人数、样本量与一致性,以及禁止词表。
    • 优化与解码:δ最多150×NA步,学习率1e-2,回答长度128、每步1个token,默认潜空间。论文写LLaDA-V每个样本使用标准逐步推理和Fast-dLLM,Table 1未分列。论文未报告重复次数和ϵ的数值。

    主结果

    下表只列Table 1的一部分,JSR按摘要与Table 2的JSR (%)理解为百分数。Direct未放入格内:LLaDA-V在AdvBench为0.2%、JailBreakBench为1.8%;LaViDA分别为1.2%与0.9%。

    表格较宽,可左右滑动

    设置FPO JSRGPO-V JSRGPO-V H-HSGPO-V A-HSGPO-V FPT
    LLaDA-V, AdvBench, NA=29.8%93.2%7.857.210.10
    LLaDA-V, AdvBench, NA=311.1%81.1%7.256.540.15
    LLaDA-V, JailBreakBench, NA=29.4%90.3%7.927.650.14
    LaViDA, AdvBench, NA=21.4%85.6%7.457.880.18
    LaViDA, JailBreakBench, NA=13.8%79.5%6.857.520.11
    LaViDA, JailBreakBench, NA=35.2%85.5%7.328.120.13
    • 相对FPO:作者称FPO影响可忽略,GPO-V的JSR超过90%。Table 1共12行,GPO-V的JSR都高于同行FPO;超过90%的只有LLaDA-V的两格(AdvBench与JailBreakBench,均为NA=2)。最低是表中LaViDA、JailBreakBench、NA=1。省略行的GPO-V JSR为86.4%、84.1%、82.1%、82.3%、88.9%、82.1%。
    • 锚点数:LLaDA-V上NA=3低于NA=2;LaViDA上NA从1到3,GPO-V的JSR上升。作者未解释这一差别。LaViDA、AdvBench、NA=1的FPO JSR为1.1%,低于该格Direct的1.2%。
    • 危害分:Table 1中GPO-V的H-HS为6.85–8.20,FPO为1.21–2.12;GPO-V的A-HS为6.54–8.12,FPO为1.02–2.22。这是全表取值,不是作者给出的区间。

    生成配置与加速

    • 测了什么:Table 2在LLaDA-V上改变block长度,并加入Fast-dLLM。论文未写明数据集与NA。block 64的四个数字与Table 1中LLaDA-V、AdvBench、NA=2的GPO-V一行相同,不据此认定条件。
    • 结果:block 128、64、32的JSR为91.5%、93.2%、87.0%;Fast-dLLM为88.1%。对应H-HS为7.25、7.85、6.74、8.41;A-HS为7.54、7.21、7.21、7.60;FPT为0.15、0.10、0.12、0.14。
    • 作者解读:作者称在Fast-dLLM下GPO仍有强攻击表现,并称GPO对masked diffusion视觉语言模型是可泛化的攻击方法。block 32低于128和64,论文未解释。

    跨模型迁移

    • 测了什么:在源模型上合成像素空间对抗样本,再以black-box setting评估架构不同的受害模型,不使用受害模型梯度(Section 4.3)。Table 3未标明每一行是源模型还是受害模型。
    • 结果:LLaDA-V行,AdvBench的JSR 65.4%、H-HS 7.21、A-HS 6.52;JailbreakBench为72.1%、8.11、6.42。LaViDA行,AdvBench为68.9%、6.72、6.13;JailbreakBench为66.4%、6.60、6.05。
    • 作者解读:作者称这些样本有跨模型迁移性,并称优于FPO。Table 3没有FPO列,论文也未报告统计检验。

    自适应防御

    • 测了什么:附录A.6在位置n注入转折语义的token z′,意图诱发Progressive Refusal。Table 6未写数据集与NA。正文写见Table 3,数字实际在标注为Table 6的表中。Vanilla行分别与Table 5或Table 1的某些行相同,不据此补条件。
    • 结果:LLaDA-V的JSR从86.4%到24.3%,H-HS从7.12到2.15,A-HS从6.98到1.88。LaViDA的JSR从85.6%到18.7%,H-HS从7.45到1.92,A-HS从7.88到2.05。
    • 作者解读:作者称该干预降低了GPO的攻击效力;同时写明,特定edge cases中越狱仍可能成功。

    其他消融与分析

    • 单损失:Figure 6无可读数字。作者称只优化否定原语时,模型仍可用约束词表外的token,进入Immediate Refusal;只优化锚点时,开头顺从、后段转入Progressive Refusal。作者称单一目标下攻击效果下降。
    • 锚点模板:Table 4标题为AdvBench。LLaDA-V的GPO-V JSR:AT1 93.2%、AT2 90.8%、AT3 91.5%;LaViDA为85.6%、83.9%、84.7%。该表Direct为1.8%与0.9%,与Table 1同名基准的0.2%与1.2%不一致。
    • 像素与潜空间:Table 5、AdvBench。LLaDA-V潜空间JSR 86.4%、像素82.8%;LaViDA为85.6%与85.1%。作者称ASR几乎相当。论文未写明NA。LLaDA-V的A-HS为潜空间6.98、像素7.85。
    • 损失曲线:Figure 5的文本只给出图例(generation length, block length)为(128, 32)、(128, 64)、(128, 128)、(256, 64),LLaDA-V与LaViDA各一图。未给出可读的损失数值,不描述曲线。
  5. 有什么可以进一步探索的点?

    论文无局限专节;Conclusion呼吁重估非顺序生成的防御。

    作者指出的局限与后续方向

    论文没有Limitations、Discussion或Future Work专节,也没有把某一项实验写成方法本身的局限。

    • 后续方向:Conclusion写,需要严格再评估安全协议,并呼吁研究社区优先发展能应对这些非顺序生成威胁的防御。摘要与Introduction有相近表述,按本节范围只记Conclusion。

    附录A.6写转折token注入后,特定edge cases中越狱仍可能成功。这是对该防御的保留,论文未把它写成研究局限。

    实验覆盖范围

    • 模型与数据:被测模型为LLaDA-V与LaViDA(Section 4)。基准为AdvBench与JailBreakBench,论文写各含500条以上提示。
    • 判定:指标为JSR、H-HS、A-HS、FPT。A-HS使用GPT-4o,正文亦称ChatGPT-4o;Figure 12把6分定为成功阈值。H-HS由人工按同一量表打分。论文未报告人工人数、样本量与一致性,也未写明JSR用哪一个分数。
    • 对照:Direct与合并报告的FPO(Table 1引用[33, 27, 37, 28])。表内未分列GCG及其他被引方法各自的JSR。
    • 其他设置:block长度32、64、128与Fast-dLLM(Table 2);black-box像素迁移(Section 4.3、Table 3);锚点模板AT1–AT3(Table 4);像素与潜空间(Table 5);去掉L_global或L_anchor(Figure 6);转折token注入(Table 6)。
    • 未写出的量:论文未报告ϵ的数值、λ1与λ2的非零取值、重复次数和禁止词表。Table 2未写数据集与NA;Table 3未写源模型与受害模型的对应;Table 6未写数据集与NA。
  6. 总结一下论文的主要内容

    作者用视觉扰动改dVLM的全局生成概率,以绕过两类拒绝。

    GPO-V把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。

    • 问题:作者认为dVLM有两种拒绝。Immediate Refusal在生成前就从序列后部铺终止token;Progressive Refusal先出肯定token,细化时再转拒绝。FPO只抬合规前缀,会被这种全局校正拉回去。
    • 方法:GPO用全序列损失压低拒绝方向,并用锚点损失留住连接性token。作者推测只有前一项时,低时间步的肯定语义留不住。GPO-V在无穷范数约束下优化图像扰动,默认可在潜空间做,像素空间见附录。
    • 主结果:Table 1中,LLaDA-V、AdvBench、锚点数为2时,GPO-V的JSR为93.2%,同行FPO为9.8%,无扰动为0.2%。该表12行里GPO-V都高于同行FPO;最低一格是LaViDA、JailBreakBench、NA=1的79.5%。作者称JSR超过90%,全表里超过90%的只有LLaDA-V的两格。
    • 其余结果:Table 2在LLaDA-V上报告Fast-dLLM的JSR为88.1%,数据集未写明。Table 3的black-box迁移JSR为65.4%、72.1%、68.9%、66.4%,未标明哪一侧是源模型。Table 6注入转折token后,两行JSR为24.3%与18.7%;作者称效力下降,但edge cases仍可能成功。
    • 作者的结论:作者称非因果生成并不因此更难被越狱。现有偏向前缀位置的对齐,盖不住全位置上的概率操纵,防御范式需要再评估。
阅读原文arxiv.org