跳到正文
原文
论文追踪· arXiv:2605.00553· Minchan Kwon, Sunghyun Baek, Minseo Kim, Jaemyung Yu, Dongyoon Han, Junmo Kim·本站收录 · 原文发表

Stable-GFlowNet 提出对比轨迹平衡,提升 LLM 红队攻击的多样性与稳定性

Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

S-GFN攻击Qwen2.5-1.5B-Instruct,UA为134.00、ASR为92.55%(Table 1)。

威胁模型论文将设定限制为黑盒(black-box),每个查询只访问受害LLM一次。

问题
LLM红队需要高毒性且多样的攻击,否则漏洞难以在训练中被拦住。RL易模式崩溃,QD往往难找到高毒性样本;GFN要估计配分函数Z,红队里的噪声奖励还会加快模式崩溃。
方法
S-GFN用对比轨迹平衡对两条轨迹做相对比较,从而消去Z,并保持与轨迹平衡相同的最优策略。噪声梯度剪枝忽略log奖励差不超过σ的样本对;Min-K流畅度稳定器用参考模型最低似然的k个token过滤不通顺样本。
实验与结果
目标受害模型上S-GFN的UA为134.00、ASR为92.55%,GFN为17.67与93.75%(Table 1)。打GFN防御的ASR为22.53%,反向0.03%。迁到Qwen3-4B-Instruct时ASR为0.18%。
局限与可以继续做的
作者指出方法受毒性分类器偏差约束,并假设单轮攻击,多轮需另行验证。实验攻击者是Qwen2.5-1.5B,主受害模型是Qwen2.5-1.5B-Instruct;论文未报告人工与分类器的一致性。
实验设置Qwen2.5-1.5B-Instruct、Gemma3-4B-Instruct 等 · AdvBench、Safety-Dataset 等 · ASR、UA 等
威胁模型
论文将设定限制为黑盒(black-box),每个查询只访问受害LLM一次。攻击者训练πθ生成y;受害模型πϕ产生z;毒性分类器πψ给出T(y,z)∈[0,1]。目标是发现多样且高毒性的攻击,使πθ(y)正比于奖励R(y)。
被测模型
Qwen2.5-1.5B-InstructGemma3-4B-InstructLlama3.2-3B-InstructQwen3-4B-Instructgpt-oss-20B
基准
AdvBenchSafety-DatasetMMLUQM9hypergrid
指标
ASRUADiversitySelf-BLEU3-distinctMMLU AccuracyQEDlog JSD
AI 导读研究者提出 Stable-GFN(S-GFN),用于大语言模型红队测试中生成多样且有效的攻击。该方法去掉了生成流网络(GFN)中的配分函数 Z 估计,改用成对比较,并加入针对噪声奖励的掩码机制,以缓解训练不稳定和模式崩溃;同时提出流畅度稳定器,避免模型陷入生成无意义文本的局部最优。作者称 S-GFN 在保持 GFN 最优策略的同时训练更稳定,并在多种设置下展现出攻击性能与多样性,代码已公开。该工作被 ICML 2026 接收为 Spotlight。

研究者提出 Stable-GFN(S-GFN),用于大语言模型红队测试中生成多样且有效的攻击。该方法去掉了生成流网络(GFN)中的配分函数 Z 估计,改用成对比较,并加入针对噪声奖励的掩码机制,以缓解训练不稳定和模式崩溃;同时提出流畅度稳定器,避免模型陷入生成无意义文本的局部最优。作者称 S-GFN 在保持 GFN 最优策略的同时训练更稳定,并在多种设置下展现出攻击性能与多样性,代码已公开。该工作被 ICML 2026 接收为 Spotlight。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者要同时找到高毒性且多样的攻击;作者称GFN的Z估计不稳,噪声奖励会加速模式崩溃。

    如何同时得到高毒性且多样的攻击,并减轻生成流网络(GFlowNet)在红队中的训练不稳。

    • 场景:作者认为,尽管有安全训练,LLM仍会被精心构造的攻击提示词引出有毒回复。部署前发现多样、高影响的攻击,才能在训练里拦住这些漏洞。
    • 现有不足:作者称,最大化奖励的RL攻击者易模式崩溃;基于存档的质量多样性(QD)方法依赖冻结LLM的指令遵循,往往难找到高毒性攻击。GFN把红队写成分布匹配,但轨迹平衡要学习配分函数Z,在大组合空间里难以估准,分布匹配差、训练不稳。作者称毒性分类器给出稠密而有噪声的分数,包括乱码等OOD token,从而产生错误学习信号并压缩探索。
    • 做法:提出Stable-GFN(S-GFN)。用轨迹对的相对比较消去Z,丢掉过小的奖励差,并用参考模型似然过滤不通顺样本。作者称训练更稳,且最优策略与轨迹平衡相同。
    • 威胁模型:
      • 目标:找到能引出有毒回复的提示词,并使生成概率正比于毒性奖励,从而同时要高毒性与多样性。
      • 知识:作者将设定限制为黑盒(black-box),每个查询只访问受害LLM一次。
      • 能力:攻击者训练并采样攻击者模型πθ以生成y。Figure 2中受害模型与毒性分类器冻结,奖励是回复毒性的期望。
      • 受害系统:受害LLM πϕ。参数化分类器πψ给出T(y,z)∈[0,1]。
  2. 有哪些相关研究?

    相关工作分RL红队、QD红队与GFN;作者把问题定位在TB的Z估计不稳和红队噪声奖励。

    红队文献被作者分成RL、QD与GFN三类;S-GFN针对的是轨迹平衡里对Z的估计,以及红队奖励的噪声。

    强化学习红队

    • 奖励最大化:PPO(Schulman et al., 2017)把毒性当奖励,无梯度地训练攻击者。Hong et al.(2024)加入多样性奖励;Guo et al.(2025)的Jailbreak R1用课程学习。作者称这类方法能找到高毒性提示词,但易模式崩溃。
    • 其他探测:Perez et al.(2022)用语言模型对语言模型做红队;Hayase et al.(2024)做基于查询的攻击。作者称本文只考虑黑盒,且每个查询只访问受害LLM一次。

    质量多样性

    • 存档搜索:Rainbow Teaming(Samvelyan et al., 2024)在固定风格和话题的矩阵上用QD搜索。Ruby Teaming(Han et al., 2024)为矩阵增加记忆维度,以抑制再次生成已有样本。
    • 作者的说法:作者称QD用存档维持多样性,但依赖冻结LLM的指令遵循,往往难找到高毒性攻击。

    生成流网络

    • 定义与用途:GFN(Bengio et al., 2021)学习随机策略,使离散组合对象被采样的概率正比于奖励。论文列举的用途包括因果发现、材料与药物、生物序列,以及LLM推理(Takase et al., 2024)和红队(Lee et al., 2024)。
    • 目标函数:作者称在详细平衡DB(Bengio et al., 2023)、子轨迹平衡SubTB(Madan et al., 2023)、对比平衡CB(Da Silva et al., 2024)和轨迹平衡TB(Malkin et al., 2022)中,只有TB被成功用于LLM。作者称TB更简单、计算更轻,但Z的估计造成模式崩溃和训练不稳;其余三种避免估计Z,但token级优化贵,难用于LLM。
    • 红队应用:作者称Lee et al.(2024)首次把GFN用于红队;Yun et al.(2025)用迭代GFN做多阶段攻击。作者称匹配整个奖励分布,理论上能更广地覆盖毒性景观。

    基线与定位

    • 基线方法:ICL、SFT、DPO、PPO、PPO+Curiosity、GFN(TB)、Jailbreak R1、Rainbow Teaming。Jailbreak R1只用官方checkpoint推理。分子生成与hypergrid实验还对照DB、SubTB。
    • 数据:攻击者SFT用Safety-Dataset(Bianchi et al., 2024)和AdvBench(Zou et al., 2023)。主结果不是在固定有害问题集上计算成功率,而是评估各方法自己生成的攻击。
    • 定位:作者将S-GFN放在GFN红队上,用成对比较去掉全局Z,并过滤噪声奖励。Figure 1把它与依赖外部Z的GFN、依赖外部记忆库的QD、以及奖励最大化的RL对照。
  3. 论文如何解决这个问题?

    S-GFN用CTB两两比较消去Z,用NGP滤掉小奖励差,用MKS按最低似然token截断乱码奖励。

    S-GFN把红队改成分布匹配,用对比轨迹平衡(CTB)去掉配分函数Z,再用噪声梯度剪枝(NGP)和Min-K流畅度稳定器(MKS)处理噪声奖励与乱码。

    问题设定

    • 受害模型πϕ根据y采样回复z,分类器πψ给出T(y,z)∈[0,1]。奖励是该毒性的期望。只最大化期望奖励时,作者称模型会模式崩溃,高概率只生成一个高奖励样本。
    • 沿Lee et al.(2024),改为让自回归策略匹配奖励定义的分布。目标是 πθ(y)∝ R(y),即生成概率正比于奖励。作者称这样既偏向高奖励攻击,又保留多样性。
    • 实现时用固定meta-prompt,而不是无条件生成;记号中省略它(沿Yun et al., 2025)。Figure 2里受害模型和分类器是冻结的。

    对比轨迹平衡

    • 不学习标量Z。对当前策略独立抽出的y1、y2,CTB损失是log概率比与log奖励比之差的平方,即 (log(πθ(y1))/(πθ(y2))−log(R(y1))/(R(y2)))2。优化该损失在策略下的期望。
    • 一个batch的N个样本做全部N²对比较。作者称这些是标量运算,不增加网络前后向次数,复杂度仍由O(N)的前后向主导。步骤见Algorithm 1和附录B.4。
    • 定理4.1:若R(y)>0且策略满支撑,CTB的全局最小为0,当且仅当πθ(y)=R(y)/Z,Z是全部奖励之和。作者把目标写成log流误差方差的2倍;方差为0则误差为常数,归一化后得到上述策略。作者称LLM的softmax满支撑,给奖励加ε可保证为正,因此标准红队设定下TB与CTB的最优策略相同。正文没有给出ε。
    • 更新一条轨迹时,另一条的log流误差充当随机基线。作者称这与RLOO一类方差缩减相同,不必再学Z或基线网络。附录A.4中,作者认为DPO做的是排序、偏向少数高峰,CTB把策略锚到奖励密度;并称CTB可看作把CB扩到单模型、自回归的LLM轨迹。

    噪声梯度剪枝

    • 作者称成对比较会叠上两份奖励噪声;同一攻击下,受害模型的自回归和分类器仍可能有方差。NGP只在两条log奖励之差的绝对值大于σ时,保留该对的CTB损失。
    • 命题4.2:把超过阈值的样本对当作边。若此图连通,满支撑策略使NGP损失为0,当且仅当πθ正比于R。作者写明连通是全局收敛的充分条件,并把高奖励回放缓冲当作全局锚点。作者也写明,红队更关心多样的高奖励模式,而不是完美匹配整个分布。
    • 附录B.1将σ设为0.5,并称实验使用0.1和0.5。

    Min-K流畅度稳定器

    • 作者称分类器会给乱码式OOD句子随机毒性,举例0.2到0.3,攻击者因而奖励投机,掉进局部极小。
    • 把参考模型概率与奖励做幂次相乘的做法,作者称在RL里有助于稳定,但在GFN里会扭曲目标分布,并过拟合参考策略。参考模型常取攻击者初值。
    • MKS计算参考模型下k个最低似然token的平均log概率。低于阈值Tmks时,式(9)用指示函数把奖励乘成0。Algorithm 1则在对数奖励上把未通过的样本记为-300。πref的梯度不进入奖励。作者称这样去掉不通顺样本,又不必把策略绑在参考模型上。
    • 附录B.1:k=7,学习率1e-4,batch为12,其中8条on-policy、4条off-policy;回放缓冲1000,只保留余弦相似度低于0.4且log奖励大于-2.5的样本;不做Lee et al.(2024)里的调度。Algorithm 1的伪代码把on-policy与缓冲样本写成各一半。主实验用的Tmks,论文没有单独给出。
  4. 论文做了哪些实验?

    目标受害模型上S-GFN的UA为134.00、ASR为92.55%;对GFN防御的ASR为22.53%,反向为0.03%。

    主评测是各攻击方法自己生成的提示词,而不是一份固定有害问题集。

    实验设置

    • 模型:沿Yun et al.(2025),攻击者是Qwen2.5-1.5B,用Safety-Dataset和AdvBench做SFT。主受害模型是Qwen2.5-1.5B-Instruct。迁移受害模型是Gemma3-4B-Instruct、Llama3.2-3B-Instruct(Table 2表头写作LLama3.2-3B-Instruct)、Qwen3-4B-Instruct(正文也写Qwen3-4B)和gpt-oss-20B。主分类器是Meta-Llama-Guard-3-8B,附录迁移用ShieldGemma-9B。聚类用all-MiniLM-L6-v2。
    • 指标:每方法生成1024条,温度1.0,固定meta-prompt。ASR是毒性超过0.5的比例;每条提示词让受害模型采样5次回复,毒性取平均。UA是贪心聚类、阈值0.7的簇数。Table 1是三次试验的均值和标准差。Table 2图注写三次试验的均值和方差。
    • 交叉攻击:用某方法的攻击配上规范拒绝句,并加入原来的SFT数据,再安全微调受害模型,然后两两测ASR和UA。附录用LoRA;拒绝句由gemma3-2B-Instruct生成;150步,学习率3e-5,AdamW,batch 32,含梯度累积的有效batch为514。用全部攻击,低ASR方法复制到约900条。
    • 基线:ICL、SFT、DPO、PPO、PPO+Curiosity、GFN(TB,带回放缓冲)、Jailbreak R1、Rainbow Teaming。Jailbreak R1不在该受害模型上重训,只用官方checkpoint并打开思维链,是实验里唯一的8B模型。Rainbow用多种子凑满1024条。

    主结果

    下表据Table 1的目标受害模型列,N=1024,三次均值±标准差。因行数所限,省略ICL与PPO+Curiosity,数字写在表后。

    攻击方法UAASR (%)
    S-GFN134.00±12.7792.55±2.87
    GFN17.67±6.5193.75±4.40
    PPO3.00±1.0091.70±2.95
    Jailbreak R175.33±10.977.36±1.07
    Rainbow Teaming33.00±5.2066.11±1.53
    DPO5.33±0.580.52±0.06
    SFT2.00±1.000.23±0.06
    • 作者称S-GFN的独特攻击数高于表内全部基线;GFN和PPO的ASR与它同在90%以上,但UA低得多。作者认为PPO过拟合到很窄的高奖励集。引言和Figure 1写约7倍(从17到134)以及ASR 92%;这与表中均值不是同一写法,且GFN的ASR均值高于S-GFN。
    • 作者称GFN靠分布匹配提高了多样性,但仍受训练不稳和窄分布匹配影响。Rainbow Teaming和Jailbreak R1的UA相对ASR更高,作者认为绝对成功率限制了实用性。
    • 作者称S-GFN靠更稳的训练减轻模式崩溃,同时保持高ASR。省略的ICL为UA 21.00±2.65、ASR 2.54%±0.43;PPO+Curiosity为UA 4.00±3.00、ASR 36.75%±5.56。

    交叉攻击与迁移

    • 防御覆盖(Table 1其余列,三次均值±标准差):受害模型用GFN攻击微调后,S-GFN的ASR为22.53%±7.91(UA 43.33±9.24);用S-GFN攻击微调后,GFN的ASR为0.03%±0.06(UA 0.33±0.58)。S-GFN对Jailbreak R1防御的ASR为56.25%±8.35(UA 87.67±8.33),对Rainbow防御为83.24%±1.87(UA 110.00±11.53),对自身防御为0.75%±0.39(UA 7.33±3.79)。Jailbreak R1打S-GFN防御的ASR为0.55%±0.44。作者认为S-GFN覆盖的攻击更全,据此微调的防御更易泛化;并称GFN一族的高分不只来自对聚类敏感的UA。Rainbow的交叉攻击低,作者认为其不能偏离预定义矩阵。
    • 换受害模型(Table 2,下列为均值):S-GFN的UA/ASR为Gemma3-4B-Instruct 34.67/15.04%,Llama3.2-3B-Instruct 52.00/15.01%,Qwen3-4B-Instruct 37.33/0.18%,gpt-oss-20B 90.00/0.51%。作者称相比其他方法占优。表中例外:Llama3.2-3B-Instruct上GFN的ASR为32.19(图注±32.12),高于S-GFN的15.01(图注±17.40),UA则是6.33对52.00。后两列各方法ASR都低于1%。gpt-oss-20B上ICL的UA为78.33(ASR 0.09%),Rainbow为69.33(ASR 0.08%)。
    • 换分类器(Table F,三次均值):训练用Llama-Guard-3-8B、评测用ShieldGemma-9B时,S-GFN为UA 107.14、ASR 93.6%,GFN为15.46与91.4%。Rainbow的ASR为2.3%(UA 19.51),Jailbreak R1为UA 23.47、ASR 2.6%。作者认为Rainbow把成功模式传到其他话题,特定模式被挡住时影响大。

    奖励设定与组件消融

    • 约束形式(Table 3,独特攻击数):只有R(y)时,GFN-TB与GFN-CTB都是0。作者称二者吃到乱码上的奖励信号,收敛到局部极小。乘参考模型概率后为14与20;对log概率求和设阈值后为65与78;MKS为67与108。作者称KL式正则找得到攻击,但样本被限制在参考分布里。正文举例低于-150则惩罚,未写明Table 3的阈值。作者称该求和受长度影响,并会惩罚专有名词;MKS对句长更稳。
    • CTB与NGP(Table 4,MKS奖励):TB为UA 67、ASR 85.8%;CTB为108与82.9%;CTB+NGP为121与92.2%。作者称CTB与TB最优策略相同但更稳,故UA更高、ASR相近;表中CTB的ASR低于TB,加上NGP后两项都更高。TB不是成对目标,不能套NGP。这组数字与Table 1不同,论文未说明差在哪一项设定。
    • 其他分布匹配:分子生成用QM9,10个片段、长度10,奖励为exp(β·QED),β=1.0,无效分子奖励10^-3。作者称状态空间为10^10;TB在初值Z=0时不收敛,Z=10才开始收敛,Figure 3b报告的是后者。作者称SubTB较快,DB不估Z但要对所有状态比流,CTB只做相对比较、到达收敛点较快。正文没有QED端点。噪声hypergrid为16×16、4个峰。正文称每次观测的奖励乘以小随机噪声;附录B.5.2写加入均值0、标准差0.3的噪声。作者称Figure 3c的log JSD都足够低;TB因噪声不稳,DB与CTB、CTB+NGP接近且略快,但逐步优化前后向,作者称难用于大LLM。正文没有具体JSD。

    其他消融与分析

    • Table B:S-GFN的Diversity 0.48、Self-BLEU 0.64、3-distinct 0.38、词表1521.00;GFN为0.33、0.98、0.02、77.67。作者称3-distinct近19倍,Self-BLEU下降说明不是同一攻击的简单变体。Jailbreak R1的Self-BLEU 0.07、词表2396.33,ASR仍为7.36%。
    • Figure 3a:作者称多数基线因模板有限而早饱和,GFN与S-GFN随相似度阈值上升,阈值更大时S-GFN的簇增加更快。转写文本没有曲线端点。
    • Figure Ab:独特提示词随k增加,k≥6饱和;主设定k=7。作者称k过大接近无稳定器,过小会排除专有名词。各k上S-GFN高于GFN。
    • Figure Ba:作者称Tmks约-10时ASR与UA取得平衡,-20或更低找不到成功提示词。log概率求和(Figure Bb)整体差于MKS,对阈值更敏感。
    • σ在0.1到0.5较合适;σ=7.0时作者称ASR相近但独特提示词减少(Figure Cc)。σ=1.0时批内掩码不超过30%且保持连通。Table A:Mean为UA 106、ASR 91.4%,Median为110与86.7%;作者称去掉可学习Z普遍优于TB,CTB单独与批统计相近,加上NGP才更高。
    • Table E:安全微调后MMLU,无微调60.4%,S-GFN 60.2%,GFN与Jailbreak-R1 60.1%,Rainbow 60.2%。Table G中Jailbreak R1与S-GFN的独特类别数都是7。作者称各方法都未发现类别3(sexual crime),并认为模型多把它们分成类别1;S-GFN对类别10(Hate)更多(Figure D无逐类计数)。
  5. 有什么可以进一步探索的点?

    作者写明方法受毒性分类器约束,且只假设单轮攻击;多轮行为需另行验证。

    局限节只写了分类器与单轮设定;实验侧能核对的是模型、指标和任务范围。

    作者指出的局限与后续方向

    • S-GFN对噪声奖励更稳,但不解决毒性分类器本身的偏差或问题(Limitations)。
    • 性能受底层分类器准确度约束;特定类别的检测失败需要分类器一并改进(Limitations)。
    • 方法假设单轮攻击(Limitations)。
    • S-GFN或GFN变体在多轮攻击中如何表现,需要额外验证(Limitations)。

    论文没有另写Future Work。Impact Statement讨论误用和部署前防御,这里不把它算作方法局限。

    实验覆盖范围

    • 攻击者是经Safety-Dataset与AdvBench做SFT的Qwen2.5-1.5B;主受害模型是Qwen2.5-1.5B-Instruct。迁移受害模型是Gemma3-4B-Instruct、Llama3.2-3B-Instruct、Qwen3-4B-Instruct、gpt-oss-20B(Table 2)。
    • 主分类器是Meta-Llama-Guard-3-8B,分类器迁移用ShieldGemma-9B(Table F)。嵌入模型是all-MiniLM-L6-v2。拒绝句由gemma3-2B-Instruct生成。
    • 每个攻击方法生成1024条,温度1.0,每条5次受害回复取均值;Table 1与Table 2各为三次试验。ASR阈值0.5,贪心聚类阈值0.7。另用HDBSCAN与Louvain报了簇数(Table C)。
    • 防御侧是用GFN、Jailbreak R1、Rainbow Teaming、S-GFN的攻击做安全微调后的两两评测,并用MMLU看效用(Table E)。非红队任务包括QM9分子生成和16×16噪声hypergrid。
    • 论文未报告人工判定与分类器的一致性,也未报告主实验的Tmks。Jailbreak R1用官方checkpoint,未在该受害模型上重训。评测协议是单轮生成,每个查询访问受害模型一次。
  6. 总结一下论文的主要内容

    S-GFN用CTB、NGP和MKS训练红队攻击者;目标受害模型上UA为134.00、ASR为92.55%。

    S-GFN是用于LLM红队的GFlowNet训练方法,用轨迹之间的相对比较代替配分函数Z。

    • 问题:既要高毒性攻击,也要覆盖多样漏洞。作者称RL容易只重复少数高奖励样本,QD方法又常常找不到高毒性攻击;直接用轨迹平衡时,Z难估,分类器噪声还会把探索压窄。访问方式是黑盒,每个查询只问受害LLM一次。
    • 方法:CTB最小化两条轨迹的log概率比与log奖励比之差。作者在定理4.1中给出:奖励为正且策略满支撑时,最优策略仍是奖励除以Z。NGP只保留log奖励差大于σ的样本对,主超参列表中σ=0.5。MKS用参考模型里k个最低似然token的平均log概率做硬截断,k=7。
    • 结果:在Qwen2.5-1.5B-Instruct上、1024条、三次均值,S-GFN的UA为134.00、ASR为92.55%;GFN为17.67与93.75%,PPO为3.00与91.70%(Table 1)。用GFN攻击做安全微调后,S-GFN的ASR仍有22.53%;反向只有0.03%。
    • 迁移与例外:Gemma3-4B-Instruct与Llama3.2-3B-Instruct上S-GFN的ASR为15.04%和15.01%;Qwen3-4B-Instruct与gpt-oss-20B上为0.18%和0.51%(Table 2)。Llama3.2-3B-Instruct上GFN的ASR均值为32.19%,高于S-GFN。
    • 作者结论:作者称S-GFN更稳,发现的漏洞经安全微调后防御覆盖更好;CTB和NGP在分子生成与噪声网格上也可用。作者同时写明,性能仍受毒性分类器约束,且只假设单轮攻击。
阅读原文arxiv.org