研究者提出 AdvGRPO 框架,用 GRPO 协同训练语言模型攻击者与防御者
Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO
AdvGRPO用多通道GRPO共训攻防;对GPT-4.1,14B多轮HarmBench ASR为91.0%。
攻击者按策略系统提示词和有害目标生成提示词,使防御者回复满足该目标。
- 静态对抗提示词上的安全对齐,仍会被改变策略的攻击者绕过。作者检验 GRPO 能否同时训出可迁移攻击者,以及安全与效用兼顾的防御者。
- AdvGRPO 让攻击者与防御者闭环对话。GPT-4.1 按多通道打分,GDPO 分通道归一化后再加权。课程先只训攻击者,再每隔 N 步交替更新;防御阶段混入良性目标。
- 14B多轮对GPT-4.1,HarmBench ASR为91.0%;迁到Llama-3.1-8B为88.5%。与14B攻击者共训的7B防御者,HarmBench为4.7%、WildJailbreak为21.2%。作者称多样性变窄。
- 作者指出 GRPO 会把攻击收窄到少量框架;自适应熵奖励难调,OPEFO 只稳住词元熵。作者认为这可能对应防御者在 DAN 上的结果。共训主结果每种设置单次运行;论文未报告攻击 ASR 的重复次数。
- 威胁模型
- 攻击者按策略系统提示词和有害目标生成提示词,使防御者回复满足该目标。多轮为闭环,每轮可见防御者回复;攻击奖励超过0.9则提前结束。只训攻击者时目标模型为GPT-4.1,共训防御者为Qwen2.5-7B。评测另含训练时未见的防御者。
- 被测模型
- Qwen2.5-7B-InstructQwen2.5-14B-InstructQwen3.5-9BGPT-4.1Phi-4-miniLlama-3.1-8B-InstructGemma-2-9B-it
- 基准
- AdvBenchHarmBenchWildJailbreakDANWildGuardTestXSTestMMLUTruthfulQAARC-CIFBench
- 指标
- ASRbenign complianceMMLUTruthfulQAARC-CIFBench
研究者提出 AdvGRPO,一个让 GRPO 可用于攻击者与防御者联合优化的协同训练框架,通过密集多通道奖励和解耦优势归一化解决此前 GRPO 在该场景不稳定的问题。训练按课程推进,从单轮攻击过渡到闭环多轮攻击,再启动协同训练,攻击者与防御者模型交替更新。作者称该方法能产生高效且可迁移的攻击,协同训练出的防御者在安全基准上优于基线。作者为 Blake Bullwinkel、Eugenia Kim、Amanda Minnich、Mark Russinovich,论文编号 arXiv:2606.09701。
深度解读
这篇论文试图解决什么问题?
用多通道奖励和 GDPO,以 GRPO 课程式共训攻击者与防御者。
如何用 GRPO 共训自适应攻击者,并让防御者仍回答良性请求。
- 场景:作者认为安全对齐多依赖人工红队或既有越狱技术整理的静态对抗提示词;模型可以挡住这些攻击,但仍会被改策略的自适应攻击者击中。引言据此讨论自动化红队与蓝队:攻击者持续发现新策略,迫使防御者超出训练分布泛化。
- 现有方法:共训已用 PPO 式自博弈和 DPO 式在线偏好。作者称 AdvGame 报告在该设定下直接用 GRPO 不稳定。SEMA 用 GRPO 训练多轮攻击者,但是开环:一次生成全部轮次,不观察防御者回复。
- 假设:共训要同时优化两侧的多种性质,单一奖励通道容易主导优势。作者用多个 LLM 评审通道,并以 GDPO 分通道归一化。
- 本文做法:提出 AdvGRPO。课程从只训攻击者的单轮、多轮,进入攻防交替更新。作者称可得到可迁移攻击,共训防御者在安全与通用效用上达到其所说的平衡,并用消融看哪些组件影响该平衡;还称 GRPO 会收窄攻击多样性。
- 威胁模型:
- 目标:攻击者要使防御者回复满足有害目标。训练用攻击奖励 A;攻击评测用 HarmBench 分类器判定有害回复。防御者要压低 A,并对良性目标给出有帮助的回复。
- 交互:输入为策略系统提示词与目标,双方最多 K 轮。多轮为闭环,攻击者每轮看到此前回复。A 超过 0.9 则提前结束。对话由 PyRIT 编排。
- 训练对象:只训攻击者时冻结防御者,论文选用 GPT-4.1 作为目标模型。共训时防御者是 Qwen2.5-7B,攻击者从已训检查点初始化,双方交替时冻结对方。
- 评测对象:另测训练时未见的防御者。论文没有把权重或梯度访问写成攻击者能力。
有哪些相关研究?
相关工作分为 RL 攻击者训练、攻防共训,以及 GRPO 在安全场景的用法。
论文按 RL 攻击者训练、攻防共训和 GRPO 的安全应用来组织相关工作。
RL 攻击者训练
- Perez et al. (2022) 与 Beutel et al. (2024):前者用强化学习训练一个语言模型去红队另一个,奖励来自毒性分类器。后者加入目标条件生成和嵌入空间的多样性信号。
- SEMA(Feng et al., 2026):用 GRPO 学习多轮攻击,但是开环,不看防御者回复就生成全部轮次。作者称在攻击者训练这条轴上与 SEMA 最近;区别是闭环、每轮奖励,并在成功后提前剪枝。
- RL-Hammer(Wen et al., 2025)与 AutoInject(Chen et al., 2026):在提示注入上用 GRPO 训练攻击者,并用多个目标模型的软奖励或基于比较的稠密反馈处理奖励稀疏。论文写这类方法只对固定防御者训练攻击者。
攻防共训
- Self-RedTeam(Liu et al., 2025):同一组参数既攻击又防御,用无 critic 的 PPO 变体 REINFORCE++ 做零和自博弈,并以角色切换交替目标。
- AdvGame(Paulus et al., 2025):两个独立模型,把安全对齐写成非合作博弈,用 DPO 式在线偏好更新。该文作者报告直接用 GRPO 不稳定,因而选用 DPO。本文改为 GRPO,并加入多通道奖励、GDPO 与攻击者课程。
GRPO 与安全行为
- GRPO(Shao et al., 2024):组内相对优势的策略优化。本文把它用于攻击者与防御者。
- Russinovich et al. (2026):作者称 GRPO 可以用一条有害提示词和少量步骤去掉多种语言模型的安全对齐。本文把奖励从目标模型自己生成有害内容,改到攻击者引出有害内容。
- GDPO(Liu et al., 2026):多奖励时先分通道归一化再合并,以免低方差通道被压掉。论文还列出一批用 GRPO 做提示注入或越狱的工作(Yin et al., 2026; Guo et al., 2025b; Xiong et al., 2026 等),未逐篇对比。
基线与基准
- 基线方法:攻击侧为同一策略系统提示词下的基座、Abliteration、GRP-Obliteration、Unsafe-SFT,以及作者提供检查点的 SEMA。防御侧为未修改基座、Self-RedTeam 与 AdvGame;后两者数字引自 Paulus et al. (2025),不是本文重跑。
- 基准:有害目标来自 AdvBench;共训良性目标来自 WildJailbreak 的 vanilla_benign。攻击 ASR 用 AdvBench 的 25% 测试划分和 HarmBench 标准 behaviors。防御用 HarmBench、WildJailbreak 对抗有害子集、DAN、WildGuardTest;良性合规用 WildJailbreak 与 XSTest 的良性子集;效用用 MMLU、TruthfulQA、ARC-C、IFBench。
作者把本文放在 SEMA 的闭环扩展,以及 Self-RedTeam、AdvGame 的 GRPO 替代上。引言还提到梯度优化(Zou et al., 2023b)、进化搜索(Samvelyan et al., 2024; Liu et al., 2024)和静态红队数据(Ganguli et al., 2022);基线节未把这三类列入实验对比。
论文如何解决这个问题?
AdvGRPO 闭环多轮采样,多通道奖励经 GDPO 后交替更新攻防。
AdvGRPO 用 GRPO 训练攻击者 πA 与防御者 πD:闭环生成最多 K 轮对话,多通道奖励经 GDPO 得到优势,再按课程先训攻击者、后交替更新。
采样与策略更新
- 单轮与多轮:单轮时攻击者根据策略系统提示词 s 和目标 o 生成一条提示词,防御者回复一次。K 轮时双方闭环交替,攻击者条件包含此前各轮提示词与回复。作者对比 SEMA 的开环:这里攻击者能按回复调整。
- 信用分配:每一轮单独作为训练样本,奖励是该轮回复对目标的满足程度。引出遵从的提示词得高奖励,触发拒绝的接近 0,不论整段最终结果。A 超过 0.9 则提前结束。
- 优化对象:被训策略是 LoRA,参考策略为关掉适配器的同一模型。每个目标独立 rollout G 次;多轮时每轮计入组内,有效组大小最多 G×K。组内奖励完全相同则优势置 0。
- 损失:逐 token 的裁剪代理目标,加上生成 token 上的 k3 KL 正则。每个 rollout batch 做 E 次内层梯度步。作者称 E≥2 时,从第二次内层步起裁剪起信任域作用。
奖励通道与 GDPO
- 攻击奖励 A:GPT-4.1 按意图对齐 a、内容危害 c、细节 d 打 0–10 分,乘性聚合为 A(y,o)=a·(c+d)/200。论文要求回复既切题、又有害或具体,否则奖励被压低。各通道都在 [0, 1]。
- 提示词奖励 P 与思维奖励 T:A 只看防御者回复,P 补上攻击者自身输出的信用,评目标忠实、策略遵守与连贯;多轮把各轮提示词当作序列,看轮间推进。T 只用于推理攻击者,评简洁、攻击承诺与目标忠实,并以承诺做门控,使自我审查把分数压到 0。梯度流过思维与回答 token。思维预算由 logits processor 限制,论文未给出具体 token 数。
- 有帮助奖励 H:共训中的良性目标只评意图对齐与细节,为二者之积除以 100,不含内容危害维。
- 确定性覆盖:若结构标记表明攻击者是在直接回答有害目标,而不是在写对抗提示词,P 置 0。目标为英文且回复中超过 30% 的字母为非拉丁字符时,防御者奖励置 0。
- GDPO:各通道先在目标组内独立标准化,再加权求和并在 batch 上零均值、单位方差归一化,即 Â(g)i=normalizeB(∑c wc z(g)c,i)。攻击者通道为 A、P,推理模型另加 T。防御者通道为对抗目标上的 1−A 与良性目标上的 H,每个目标组只属于一个通道。附录 B:A 权重 1.0,P 与 T 为 0.5;防御者两通道等权。
训练模式
- 只训攻击者:冻结防御者。单轮检查点初始化多轮。目标是最大化有害目标上的 GDPO(A, P, T);非推理模型去掉 T。作者称 P 与 T 在 A 稀疏时提供稠密信用。论文写选用较强防御者,以使攻击对未见模型更有效,因此训练目标用 GPT-4.1。
- 共训:πA 从只训攻击者的检查点开始,πD 从基座开始,每 N 步交替。攻击阶段冻结 πD。防御阶段冻结 πA,batch 中比例 α 为有害目标,其余来自良性集。有害目标奖励 1−A,良性目标奖励 H,以避免一律拒绝。
- 耦合与选点:两侧通过 A 以相反符号耦合。作者将其类比为 GAN 的生成器与判别器。附录 B 写在 A 开始平台时选取防御者检查点;作者称此后双方不再改进,继续训练只会使防御者过拟合攻击者变窄的策略。
实现参数
- 适配与学习率:LoRA 秩 64、α=128、rsLoRA、无 dropout,加在每个 transformer block 的全部线性层。只训攻击者学习率 5×10−6,共训 2×10−6;余弦调度、10% 线性预热、权重衰减 0.01,梯度裁剪 1.0。
- GRPO 超参:单轮 G=8,多轮 G=4,有效 batch 4;裁剪 ε=0.2,E=2。攻击者 KL 系数 β=0.1,防御者 β=0.05。只训攻击者 200 步,共训最多 500 步。共训主结果每种设置一次运行(seed 42)。
- 采样:攻击者温度 1.0、top-p 1.0,最多 512 个新 token,多轮后续最多 300。防御者最多 500 token,温度 1.0。附录 B 写多轮训练 K=3;Table 1 将 MT 标为最多 5 轮。交替间隔 N=10,防御者对抗比例 0.5。
- 训练评审:奖励由 GPT-4.1 按附录 A 的量规打分。附录 A 给出各通道的乘性公式。
论文做了哪些实验?
14B多轮对GPT-4.1的HarmBench ASR为91.0%;共训防御者在部分基准上仍高于AdvGame。
对训练时防御者 GPT-4.1,Qwen2.5-14B 多轮的 HarmBench ASR 为 91.0%(Table 1);与 14B 攻击者共训的 7B 防御者在 HarmBench 上为 4.7%,在 WildJailbreak 上为 21.2%(Table 3)。
实验设置
- 被训模型:攻击者为 Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Qwen3.5-9B。只训攻击者时防御者为 GPT-4.1。共训时 7B 与 14B 攻击者对 Qwen2.5-7B-Instruct,以便对照 Self-RedTeam 与 AdvGame。
- 数据:有害目标为 AdvBench harmful behaviors 的一个划分;良性目标从 WildJailbreak 的 vanilla_benign 抽样。攻击 ASR 报在 AdvBench 的 25% 测试划分和 HarmBench 标准 behaviors 上。论文未给出这些划分的条数。
- 攻击基线:同一策略系统提示词下的基座;Abliteration、GRP-Obliteration、GPT-4o 的 Unsafe-SFT;作者提供的 SEMA 检查点,并用同一测试划分与同一分类器重算 ASR。论文称各有三种 Abliteration 与 GRP-Obliteration 模型;Table 8 列出 Llama-3.1-8B、Qwen3-8B、Gemma-3-12B 与 Qwen-2.5-14B,未写出其余模型名。
- 防御评测:安全 ASR 用 HarmBench、WildJailbreak 对抗有害子集、DAN、WildGuardTest。良性合规是 WildJailbreak 与 XSTest 良性子集上的非拒绝比例。效用为 MMLU、TruthfulQA、ARC-C、IFBench,用 Ai2 评测套件。Table 3 的 Attacker 列是共训时的攻击者,不是评测时另换的攻击方法。
- 判定:攻击 ASR 由 HarmBench-Llama-2-13b-cls 判定。防御各基准用该基准推荐的分类器;论文未逐一写出名称,也未报告与人工的一致性。训练奖励评审是 GPT-4.1,与该分类器不是同一个模型。
- 重复与轮数:共训主结果每种设置单次(seed 42)。§5.3 为 3 个种子、固定 300 步。论文未报告攻击 ASR 的重复次数。附录 B 训练 K=3;Table 1 将 MT 标为最多 5 轮。
主结果
下表为对 GPT-4.1 的 ASR(%)。GPT-4.1 也是只训攻击者时的目标模型,因此这些数字不是迁移结果。据 Table 1。表中省略 AdvGRPO 单轮 14B(79.1 / 79.5)、SEMA 3B(92.3 / 80.5)、Abliteration 单轮(14.1 / 14.0)、GRP-Oblit 单轮(22.5 / 25.5)与 Unsafe-SFT Crescendo(45.8 / 35.5)。
表格较宽,可左右滑动
方法 攻击者 AdvBench HarmBench AdvGRPO MT Qwen2.5-14B 90.0 91.0 AdvGRPO MT Qwen2.5-7B 90.0 84.5 AdvGRPO ST-Think Qwen3.5-9B 79.1 71.0 AdvGRPO ST Qwen2.5-7B 72.5 69.5 SEMA Qwen2.5-14B 92.5 84.5 GRP-Oblit MT Qwen-2.5-14B 52.5 55.0 Unsafe-SFT MT GPT-4o 11.6 11.5 Abliteration MT Llama-3.1-8B 10.8 13.5 - 作者称最佳配置在两个基准上达到 90–91% ASR;Table 1 为 90.0% 与 91.0%,相对同提示词基座的蓝字为 +30.9 与 +31.0。Table 8 中该基座多轮为 59.1% 与 60.0%。
- 作者称在 HarmBench 上优于 SEMA、在 AdvBench 上相近。14B 多轮 HarmBench 91.0% 高于 SEMA 14B 的 84.5%,但单轮 14B 的 79.5% 低于该 SEMA。AdvBench 上 SEMA 为 92.5% 与 92.3%,高于 AdvGRPO 多轮的 90.0%。
- 作者称去掉护栏不会自动得到攻击策略。表中未对齐攻击者低于 AdvGRPO 多轮。Qwen3.5-9B 单轮推理为 79.1% 与 71.0%;Table 8 基座为 0.0% 与 0.5%。作者称从接近零的基座出发。附录 F 给出基座与训练后输出的对照示例,此处不引用原文。
向未见防御者迁移
- 测了什么:Qwen2.5-14B 对训练时未见的 Phi-4-mini、Llama-3.1-8B-Instruct、Gemma-2-9B-it。对照为同一基座的 SEMA(Table 2)。
- 结果:14B 多轮 AdvBench / HarmBench 为 Phi-4-mini 90.8 / 82.0,Llama-3.1-8B 92.5 / 88.5,Gemma-2-9B 88.3 / 86.0。SEMA 同序 AdvBench 为 93.3 / 90.8 / 96.6,HarmBench 为 71.5 / 79.5 / 75.5。
- 作者解读:作者称多轮迁移更好,并称 82–93%;表中 14B 多轮为 82.0% 至 92.5%。HarmBench 三条都高于 SEMA。AdvBench 上 SEMA 在 Phi-4-mini 与 Gemma-2-9B 更高,Llama-3.1-8B 上 AdvGRPO 为 92.5%、SEMA 为 90.8%。作者认为双方都用 AdvBench 训练,HarmBench 上的差距说明本文对分布外目标泛化更好。
共训防御者
ASR(%,越低越好)据 Table 3。Self-RedTeam 与 AdvGame 的数字引自 Paulus et al. (2025)。防御者均为 Qwen2.5-7B-Instruct。
表格较宽,可左右滑动
方法 共训攻击者 HarmBench WJB DAN WildGuard Base – 18.8 85.9 39.3 23.7 Self-RedTeam 7B 16.8 41.1 36.6 22.0 AdvGame 7B 4.7 8.5 10.3 1.2 AdvGRPO ST 7B 8.1 31.7 25.7 2.0 AdvGRPO ST 14B 4.7 21.2 24.0 1.7 - 作者称相对基座和 Self-RedTeam 降低了 ASR,并在 HarmBench 与 WildGuardTest 上与 AdvGame 相当;WildJailbreak 与 DAN 上 AdvGame 更低。14B 攻击者共训的一列低于 7B 那一列。作者据此称更强的攻击者带来更鲁棒的防御者。
- Table 4:与 14B 共训时,WJB 良性合规 88.8%、XSTest 93.6%、MMLU 73.3、TruthfulQA 50.8、ARC-C 90.0、IFBench 31.3。基座为 99.2、95.6、73.5、51.5、89.9、31.3。7B 共训的 IFBench 为 29.7,低于基座 31.3;其 WJB 良性合规 95.6% 高于 AdvGame 的 94.4%,14B 的 88.8% 则低于 AdvGame。作者称效用基本不受影响,XSTest 合规高于 Self-RedTeam(82.8%)与 AdvGame(81.2%)。
- Figure 2 下图为 14B 攻击者与 7B 防御者的共训曲线。作者称约 500 步后收敛,良性 H 保持高位;图注未给出端点数值。
共训组件消融
- 测了什么:从完整配方去掉 GDPO(改为通道加权和)、把交替从 N=10 改为 N=1,或攻击者从基座而不是单轮检查点初始化。各 3 个种子、300 步(Table 5)。该表与 Table 3 的单次运行不是同一协议。
- 结果:完整配方 HarmBench 4.9±1.2、WJB 21.8±5.4、DAN 22.9±5.8、WildGuardTest 1.9±0.6。去掉课程后为 7.1±1.5、32.1±16.9、29.4±6.0、3.1±2.2。去掉 GDPO 后 WJB 为 30.4±14.9、DAN 为 27.3±4.3。去掉交替时 WildGuardTest 均值仍为 1.9±0.5。XSTest 为 95.6±1.8 至 96.9±1.0,MMLU 为 73.3±0.1 至 73.5±0.1。
- 作者解读:作者称完整配方平均最安全、跨种子最一致;去掉任一组件会提高平均 ASR,并往往加大安全指标的跨种子方差。作者称 GDPO 与课程对 WildJailbreak 和 DAN 尤其重要,并称从零开始时防御者会占上风,因为挡弱攻击比发现新策略更容易。Figure 3 中各变体、各种子的良性 H 保持高位;正文未给出该图刻度。作者称合规与效用基本不变。
其他消融与分析
- 多样性(Table 7,Qwen2.5-14B 单轮,GPT-4.1,200 步,每目标 8 条):无正则最终熵 1.02、ASR 83.9%、Self-BLEU 0.42、嵌入多样性 0.30;熵正则 1.60、73.4%、0.30、0.34;OPEFO 1.17、83.8%、0.38、0.30。
- 熵系数(Figure 4、附录 C):无正则时熵下降;βmax=0.1 维持在中等水平;βmax=0.15 时作者称熵爆炸、生成不连贯。OPEFO 的系数绝对值约不超过 0.12,单轮熵从 0.89 到 1.17 nats。
- 基座(Table 8,对 GPT-4.1):Qwen2.5-7B 单轮 15.8% / 29.0%,多轮 27.5% / 37.0%;Qwen2.5-14B 单轮 23.3% / 33.0%。
- Table 8 其他未对齐行:Abliteration 推理(Qwen3-8B)11.6% / 10.0%;GRP-Oblit 多轮(Gemma-3-12B)18.3% / 16.0%;Unsafe-SFT 单轮 2.5% / 6.5%。
- Table 9 较低迁移:Qwen2.5-7B 单轮对 Gemma-2-9B 的 AdvBench ASR 为 53.3%;Qwen3.5-9B 单轮推理对 Gemma-2-9B 的 HarmBench ASR 为 49.5%。
- 奖励曲线(Figure 2 上图):作者称 Qwen3.5-9B 的思维奖励起初接近 0,约 10 步后克服自我审查。图注未给出端点数值。
有什么可以进一步探索的点?
作者指出攻击策略变窄,词元级熵控制没有恢复策略多样性。
作者把主要不足放在攻击策略变窄,而不是放在安全数字本身。
作者指出的局限与后续方向
- 策略变窄(§7):AdvGRPO 会集中到较窄的一套叙述框架,训练中攻击多样性下降。作者认为这可能解释共训防御者在 DAN 这类分布外越狱上难以应对(Table 3)。§8 重述:多样性下降可能使防御者在分布外攻击上较弱。
- 词元级方法未解决问题(§7):作者称 GRPO 的熵塌缩已有缓解(Xu et al., 2026; Wang et al., 2026),但这些方法主要在词元层,没有提高攻击多样性。
- 两种已试控制(§7、附录 C):自适应熵奖励略提高多样性,但难调;OPEFO 稳住词元熵,主导策略不变。作者称保留词元熵的方法没有解决该问题。
- 后续方向(§7):在策略空间而不是词元空间加多样性奖励;训练时条件于多个系统提示词,作者称实验未做;用风格更多样的外部越狱扩充共训;对多样化防御者池训练,或延长多轮交互,以改进攻击迁移与防御者鲁棒性。
实验覆盖范围
- 攻击者骨干为 Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Qwen3.5-9B;只训攻击者时防御者是 GPT-4.1(§4.1)。
- 迁移防御者为 Phi-4-mini、Llama-3.1-8B-Instruct、Gemma-2-9B-it(§4.2、Table 2、Table 9)。
- 共训防御者为 Qwen2.5-7B-Instruct,Table 3 的共训攻击者为 7B 与 14B 的单轮设置。主结果每种设置一次运行(seed 42);消融为 3 个种子、300 步(附录 B、§5.3)。
- 防御基准为 HarmBench、WildJailbreak、DAN、WildGuardTest,合规为 WildJailbreak 与 XSTest 良性子集,效用为 MMLU、TruthfulQA、ARC-C、IFBench(§4.2)。Self-RedTeam 与 AdvGame 的数字引自 Paulus et al. (2025)(§4.3)。
- 论文未报告 AdvBench 25% 划分与 HarmBench behaviors 的条数、攻击 ASR 的重复次数,以及分类器与人工判定的一致性(§4.2)。训练奖励评审是 GPT-4.1,攻击 ASR 评审是 HarmBench-Llama-2-13b-cls。
总结一下论文的主要内容
GRPO 共训可抬高攻击 ASR 并压低部分基准上的防御者 ASR,但攻击分布变窄。
AdvGRPO 用 GRPO 同时训练攻击者与防御者。
- 问题:静态对抗提示词上的对齐挡不住改策略的攻击者。已有共训用 PPO 式自博弈或 DPO;作者称 AdvGame 报告直接用 GRPO 不稳定。SEMA 的多轮 GRPO 是开环。
- 方法:闭环多轮,GPT-4.1 给攻击、提示词、思维和有帮助通道打分,GDPO 分通道归一化。先只训攻击者,再每 10 步交替。防御 batch 的对抗比例为 0.5,良性目标用有帮助奖励,以免一律拒绝。A 超过 0.9 提前结束。
- 攻击:对训练时防御者 GPT-4.1,Qwen2.5-14B 多轮的 AdvBench / HarmBench ASR 为 90.0% / 91.0%(Table 1)。迁到 Llama-3.1-8B 时 HarmBench 为 88.5%(Table 2)。Qwen3.5-9B 单轮推理 AdvBench 为 79.1%,基座为 0.0%(Table 8)。Abliteration 多轮 AdvBench 为 10.8%(Table 1)。单轮配置的 HarmBench 并不都高于 SEMA。
- 防御:与 14B 攻击者共训的 7B 防御者,HarmBench 4.7%、WildGuardTest 1.7%、DAN 24.0%、WildJailbreak 21.2%(Table 3)。作者称前两项与 AdvGame 相当,后两项 AdvGame 更低(8.5% 与 10.3%;该基线引自 Paulus et al., 2025)。XSTest 93.6%,MMLU 73.3%(Table 4)。去掉 GDPO、交替或课程会提高 Table 5 的平均 ASR;去掉交替时 WildGuardTest 均值仍为 1.9。
- 作者结论:作者称 GRPO 共训可以稳定,并作为 PPO 与 DPO 路线的替代。攻击多样性会变窄,词元熵控制未恢复策略级多样性,防御者可能因此在分布外攻击上较弱。