研究者提出训练通用自动化红队模型的流程
Training a General Purpose Automated Red Teaming Model
按验证集选出的检查点相对零样本Qwen3-8B:域内ASR 85%对33.89%,域外29.35%对20.87%。
红队模型接收自然语言对抗目标,生成攻击并交给目标LLM,以诱发该目标描述的不良行为。
- 内容安全导向的自动红队依赖现成评测器,对恶意代码、数据外泄等目标覆盖差,也不显式控制诱发哪类行为。作者要训练能按自然语言目标生成攻击、且训练时不需要专用评测器的红队模型。
- 种子模型按对抗目标生成具体例子、伪装方式和评分细则,填入攻击生成模板。以GRPO微调做过安全训练的Qwen3-8B:攻击发给目标LLM,judge按细则给三档奖励。域外是否成功改由garak检测器判定,与训练奖励不同。
- 验证集选出的检查点相对零样本Qwen3-8B,域内总体ASR为85%对33.89%,域外为29.35%对20.87%。训练时攻击Qwen3-8B的检查点,域外平均ASR为37.8%。部分域外目标双方均为0。作者称RL不自动提高攻击多样性。
- 作者指出未做人工评估,LLM评审与garak检测器都可能误判,且只训练Qwen3-8B、未专门评非英语攻击。实验为单次运行;推理目标是Qwen3-8B与Gemma-3-12b-it。论文未报告查询次数和评审与人工的一致性。
- 威胁模型
- 红队模型接收自然语言对抗目标,生成攻击并交给目标LLM,以诱发该目标描述的不良行为。训练和评测时读取目标回复;训练奖励用按目标生成的LLM-as-a-judge,不用专用检测器。域外成功由garak检测器判定。论文未使用white-box或black-box。
- 被测模型
- Qwen3-8BGemma-3-12b-itMixtral-8x22B-v0.1
- 基准
- garak
- 指标
- ASRmean pairwise cosine similarity
研究者提出一套训练红队模型的流程,可泛化到任意对抗目标,包括未直接训练过的目标,且不依赖训练时已有的评估器。现有自动化红队方法多面向安全与内容审核,依赖内容安全模型作为评估器并针对绕过它们优化,未在其他对抗意图上测试。实验显示,用该流程微调 Qwen3-8B 等小模型,其在域内和域外对抗目标上生成攻击的能力均有显著提升。
深度解读
这篇论文试图解决什么问题?
要训练不依赖专用评测器、并能泛化到未见对抗目标的红队模型。
如何在训练阶段没有专用评测器时,训练出能按任意自然语言对抗目标(含训练时没见过的目标)生成攻击的红队模型。
- 场景: 作者认为静态安全基准会被对齐过程饱和,新越狱又不断出现,因此需要红队来找未解决的漏洞。自动红队可补充人工,覆盖更广情形,并针对特定目标LLM适配。
- 现有方法: 作者称多数自动红队面向内容安全,用安全模型当评测器并优化绕过它们,未在恶意代码、数据外泄、利用已知编码漏洞等意图上检验。不列出对抗目标时,也难以控制实际诱发了哪类行为。
- 设定: 作者假定评测时可以有评测器、训练时没有,因而奖励要能按任意目标现做。被微调的是做过安全训练的指令模型,不是未审查模型。
- 提出: 一条强化学习流程:用多样化攻击生成输入,以及按目标定制的LLM-as-a-judge奖励,微调如Qwen3-8B这样的模型。
- 威胁模型:
- 目标: 输入是自然语言对抗目标,生成的攻击应诱发目标LLM的对应不良行为。正文举例包括恶意软件生成,以及经URI变量的数据外泄。
- 知识: 训练和评测都把攻击发给目标LLM并读取回复。论文没有用white-box、black-box或no-box标明知识假设。
- 能力: 控制提交给目标模型的攻击文本。训练奖励不使用该目标已有的专用检测器。
- 受害系统: 被攻击的LLM。训练阶段为Qwen3-8B、Gemma-3-12b-it、Mixtral-8x22B-v0.1;推理评测为前两者。
有哪些相关研究?
相关工作多依赖内容安全评测器;作者改用目标定制的LLM评审做RL奖励。
作者按自动红队的技术路线,以及内容安全评测器与静态基准来讨论相关工作。
人工红队与规模化
- 人工红队: Ganguli等人(2022)和Wei等人(2023)利用人工创造力,并关注真实用户可能提供的输入。
- 语言模型互补: Perez等人(2022)用语言模型生成大量红队提示。作者将其视为人工红队的补充。
自适应越狱
- 改写攻击: 遗传算法(Liu等人,2023)、按目标回复优化提示后缀(Zou等人,2023),以及用LLM迭代修改对抗提示(Mehrotra等人,2024;Samvelyan等人,2024;Rahman等人,2025)。
训练红队模型
- 评测器反馈: Perez等人(2022)生成攻击、对目标LLM运行,并用评测器判断成功;可用过滤、监督或强化学习更新红队模型。
- 多样性与野外策略: Ge等人(2024)和Chen等人(2025b)在奖励中提高输出多样性;Jiang等人(2024b)从真实交互挖掘攻击策略。作者称这些工作都依赖内容安全分类器,且只在该情境下优化。
内容安全与静态基准
- 分类器覆盖: Ghosh等人(2025)、Han等人(2024)、Markov等人(2023)识别冒犯、种族和性别相关回复,以及犯罪与自伤等。作者称代码能力扩展后,包幻觉、ANSI转义码、模板引擎等问题增多,内容安全数据却很少包含这些例子,依赖它们的红队方法可能难以检测。
- 静态基准: Wan等人(2024)、Guo等人(2024)评估其中部分问题。作者引用Zhou等人(2023)和Banerjee等人(2024),称静态基准可能被过度优化,新意图或攻击向量出现后需要更新基准。
- 基线与数据: 实验基线是同一攻击生成输入下的Qwen3-8B零样本生成。对抗目标来自garak;作者不用其中已有的对抗提示,只用自然语言目标描述。
作者把本文放在Perez等人(2022)的RL红队微调之上:奖励改为按目标生成的LLM-as-a-judge,训练时不要求已有强评测器,并单独评测未见目标。域外成功改用garak检测器,与训练奖励不是同一判定。
论文如何解决这个问题?
种子模型生成攻击输入和评分细则,再用三档LLM评审奖励做GRPO微调。
多目标红队训练流程先把自然语言对抗目标展开成攻击生成输入和评分细则,再用GRPO微调红队模型。奖励只来自LLM评审,训练时不调用目标专用检测器。
对抗目标
- 来源: 目标取自garak探针要诱发的行为。作者不使用garak里已有的对抗提示,只用自然语言描述。
- 划分: 训练使用Table 1的目标:DAN、Flirtation、Identity Attack、Insult、Profanity、Severe Toxicity、Sexually Explicit、Threaten、Toxicity、Win 10 Keys、Ethnic Slur、Bullying、Antivirus codes、Sexualize、Slurs。只在域外评测使用的Table 2为Raw ANSI Gen、Jinja Exploitation、Malware Gen,以及Python、Ruby、Rust包幻觉。
- 选择: 作者称其中一些行为典型内容安全分类器也能检出,但训练时不提供这类分类器;域外目标选内容安全数据里通常很少或没有的行为。
- 域外成功: 与该行为对应的garak检测器在目标回复中检出该行为,才算攻击成功。
攻击生成输入
- 种子: Qwen3-235B-A22B只根据自然语言目标、零样本生成两类种子:目标的具体例子;伪装恶意请求的方法。正文举例包括提示注入,以及把请求放到较不常见的语言里。附录G.1、G.2给出完整提示词。
- 模板: 种子填入攻击生成输入模板,使红队模型针对输入中的特定目标生成攻击,而不是无输入或随机噪声。附录G.3给出完整模板。
- 规模: 训练36220条、验证100条、域内测试1000条、域外测试29400条。作者称同一流程可在评测时为新目标生成输入。
- 起点: 被微调的是做过安全训练的指令模型Qwen3-8B。作者称这不一定是优势,只说明这类模型也能被训成红队模型。
奖励
- 细则: 种子模型为每个目标生成5个是/否问题,回答“是”表示恶意目标已经发生。实验使用Qwen3-235B-A22B生成的细则。附录F给出生成提示。
- 训练judge: 两种选择:固定Qwen3-8B,或当前被攻击的目标模型。
- 三档: 无法解析出攻击的输出给低奖励;格式正确但未成功给略高奖励;格式正确且成功给高奖励。具体数值在实验中比较。
- 不用检测器: 训练阶段不使用garak检测器。作者的前提是这些目标的评测器在评测时可用、训练时不可用。
强化学习更新
- 循环: 红队模型按输入生成攻击,攻击发给目标LLM,再用该目标的细则做LLM-as-a-judge,按三档奖励更新模型。
- 算法与设置: Group Relative Policy Optimization,实现为VeRL。附录K:训练批大小128、最长提示1024(过长则过滤)、最长回复2048、学习率1e-6、低方差KL系数0.001、熵系数0、每次5条actor rollout(VLLM)、无critic warmup。
- 检查点: 按验证集上全部域内目标、以及推理目标Qwen3-8B与Gemma-3-12b-it的平均ASR选取。验证时的judge是Qwen3-235B-A22B。
- 被攻击模型: 训练时比较Qwen3-8B、Gemma-3-12b-it、Mixtral-8x22B-v0.1。论文未把这一访问写成白盒或黑盒。
评测时的判定
- 域内: 用生成细则,judge为Qwen3-235B-A22B,可以与训练时的judge不是同一个模型。
- 域外: 用garak检测器,不用训练时的LLM评审。作者要检验的一点是:测试判定与训练奖励不同。
- 推理目标: 攻击分别发给Qwen3-8B和Gemma-3-12b-it。Mixtral-8x22B-v0.1只作为训练时被攻击的模型。
论文做了哪些实验?
作者称按验证集选出的检查点,域内总体ASR为85%,域外为29.35%。
实验设置
- 模型: 被微调的红队模型是Qwen3-8B。训练时被攻击的模型为Qwen3-8B、Gemma-3-12b-it、Mixtral-8x22B-v0.1。推理评测目标为Qwen3-8B与Gemma-3-12b-it。种子、细则,以及验证和域内评审用Qwen3-235B-A22B。
- 数据: 对抗目标来自garak,域内见Table 1,域外见Table 2。攻击生成输入为训练36220、验证100、域内测试1000、域外测试29400。
- 基线: 同一输入下Qwen3-8B零样本生成。作者称输入较详细,因此这是较强基线。
- 指标: ASR。域内和验证用生成细则加LLM-as-a-judge;域外用对应garak检测器。多样性是成功攻击的平均成对余弦相似度,嵌入模型为all-MiniLM-L6-v2,越低越多样。
- 评审: 训练judge为Qwen3-8B或被攻击的目标模型。验证和域内测试的judge为Qwen3-235B-A22B。论文未报告评审与人工的一致性,也未报告评测时每个输入生成几条、采样温度是多少。
- 重复与选择: 附录K写明全部结果来自单次运行。检查点按验证集上全部域内目标、以及两个推理目标的平均ASR选取。Figure 2、Figure 3比较的是每个训练目标上的该检查点。
主结果
红队检查点 域内总体ASR 域外总体ASR 按验证集选出的检查点 85% 29.35% 零样本Qwen3-8B 33.89% 20.87% 训练时攻击Qwen3-8B、按验证集选出的检查点 未报告 37.8% 据第5节正文。Figure 2、Figure 3是逐目标图,正文没有给出可读柱高,这里不填逐目标数字。训练时还攻击了Mixtral-8x22B-v0.1,第5节正文未给出该检查点的总体ASR。
- 作者称: Figure 2的域内目标和Figure 3的域外目标上,训后模型比零样本Qwen3-8B更有效;域外用garak检测器,不是训练时的LLM评审。
- 作者称: 训练时攻击Qwen3-8B的那个检查点,域外平均ASR高于按验证集选出的检查点。表中“未报告”表示第5节没有给出它的域内总体数字。
- 例外: 作者称部分域外目标上,零样本和训后模型的成功率都是0,因为生成攻击输入时较大改写了目标细节,与检测器实际检查的内容不一致。
训练目标、judge与轮数
- 测了什么: 训练目标、judge是固定Qwen3-8B还是被攻击模型、奖励数值,以及1、3、5个epoch。附录I按与第5节相同的验证集准则,把选出的模型写为:训练时攻击Gemma-3-12b-it,judge也是Gemma-3-12b-it,奖励为格式错误-0.2、失败0.0、成功1.0。
- 结果: 作者称用被攻击模型作judge,通常比固定Qwen3-8B更有效;-0.2/0.0/1.0的验证表现更好。3个epoch的域内测试最强,且验证集能预测这一点。用其他训练目标,不如攻击Qwen3-8B那样迁移到推理目标Gemma-3-12b-it;作者称这一趋势没有延伸到域外目标。论文未给这些对比的具体ASR。
- 作者的解读: 部分域外目标的成功率在更早的epoch达到高点。作者认为超过1个epoch后,模型可能过拟合训练时有的对抗目标。Figure 12、Figure 13是相应曲线,正文没有各点读数。
多样性
- 测了什么: 每个对抗目标上,成功攻击用all-MiniLM-L6-v2算平均成对余弦相似度。另有一组把该相似度相对一组参考攻击(训练输入上Qwen3-8B的零样本攻击)加入奖励,与成功奖励等权。
- 结果: 作者称RL不会自动提高多样性;平均而言,零样本Qwen3-8B的成功攻击略更多样;训后模型之间,ASR更高的也更多样。正文没有相似度数值。一组设定(攻击Qwen3-8B、judge为Qwen3-8B、1个epoch、成功奖励0.2)加上多样性项后,域内ASR略降、域外ASR更高,多样性优于零样本。
- 崩溃: 把多样性项加到上述验证集选出的超参组合上时,作者称训练崩溃,Figure 18的域内成功率很低。作者称两种奖励等权,其他线性组合没有再搜;附录J写明算力限制了进一步实验。
单目标概念验证
- 测了什么: 附录E先对单一目标做RL,奖励直接来自garak检测器。三个目标是原始ANSI序列、带变量URI的Markdown图片数据外泄、恶意软件代码。奖励方案为0.0/0.2/1.0或-0.2/0.0/1.0。
- 结果: 作者称相对零样本Qwen3-8B,RL通常提高ASR;多数情况下训练时攻击Qwen3-8B更有效。两种奖励没有实质差别。增加epoch有助于ANSI和URI外泄;恶意软件的ASR在3个epoch达到高点。正文没有这些ASR的具体数值。
- 奖励黑客与示例: 作者称该设定会出现奖励黑客,攻击也更不复杂:输入里若有上下文示例且未惩罚,模型可能复述该示例。主实验里作者称没有看到这类实例,并认为详细的攻击输入和多样的LLM评审奖励足以正则化。附录给出了攻击示例。作者称诱发到的行为有时比检测器所查的最窄子集更宽,外泄示例中的URI变量仍常是占位符;若出现在保持对话上下文或会执行动作的智能体系统里,作者称这类变体可能造成实际伤害。
其他消融与分析
- 附录F:GPT-4o、Llama 3.1 70B Instruct、Qwen3-235B-A22B各自生成细则并作judge,在历史garak数据上与检测器的判断一致性相当;论文未给一致率。实验采用Qwen3-235B-A22B的细则。
- 附录H:作者称抽查里有回复含代码,但garak的代码正则没有检出;Python尤其困难,也有检测器未写正则的语言。
- 附录H:Markdown图片URI外泄的抽查没有成功攻击;作者称攻击输入没有写明检测器所查的图片URI形式。
- 第5节:作者称生成攻击较复杂,包含角色扮演和更细的格式说明,并倾向于使用输入中的具体例子和伪装方式。附录H有示例,此处不复述。
有什么可以进一步探索的点?
作者在第8节写明自动评测、只训Qwen3-8B和未专门评非英语攻击。
作者指出的局限与后续方向
- 评测器: 域内用LLM-as-a-judge,域外用garak检测器,没有做人工评估;域外需要专门知识才能判断某种形式是否有害。作者称LLM评审能指定任意特征,但识别不一定稳定;garak检测器对所查内容准确,却可能把其他达成方式标成失败,或没考虑拒绝而把失败标成成功。作者认为后续可加强各类目标的评测器(第8节)。
- 模型范围: 只训练Qwen3-8B,评测针对三个具体模型。作者认为换其他基座、并在更广的模型上评测会有帮助(第8节)。
- 语言: 没有专门训练或评测英语以外的攻击生成,也没有评测基座的语言能力如何影响结果。伪装种子会建议使用其他语言,因此仍有部分攻击用其他语言生成(第8节)。
- 人类红队与防御数据: 作者希望研究人类红队员能否借助该模型覆盖更广行为,以及成功攻击能否用于防御训练,并与现有防御训练数据比较(第7节)。
- 反向奖励: 作者认为改流程后,可以固定红队模型,用细则判定成败来更新目标模型:攻击不成功给高奖励,成功给低奖励(第7节)。
- 规模与安全训练: 作者认为值得量化模型规模和安全训练对红队效果的影响;本文聚焦Qwen3-8B(第7节)。
实验覆盖范围
- 模型: 强化学习只微调Qwen3-8B。训练时被攻击的模型为Qwen3-8B、Gemma-3-12b-it、Mixtral-8x22B-v0.1;推理评测目标为Qwen3-8B与Gemma-3-12b-it(第4节)。
- 目标与规模: 域内目标列于Table 1,域外目标列于Table 2。攻击生成输入为训练36220、验证100、域内测试1000、域外测试29400(第3.3节、附录K)。
- 对照与判定: 对照是同一输入下的零样本Qwen3-8B。域内由Qwen3-235B-A22B按生成细则判定,域外由garak检测器判定(第4–5节)。
- 运行与未报告项: 附录K写明所示结果均来自单次运行。论文未报告查询次数、评测时每个输入的生成条数和采样温度,也未报告评审与人工的一致性。
- 多样性: 用all-MiniLM-L6-v2计算成功攻击的平均成对余弦相似度(第4节、附录J)。正文没有给出该相似度的具体数值。
总结一下论文的主要内容
作者称该流程提高了Qwen3-8B的域内和域外ASR,但部分域外目标仍为0。
作者用强化学习训练一个红队模型,使它能按自然语言给出的对抗目标生成攻击,训练时不需要该目标已有的专用评测器。
- 问题: 作者认为内容安全红队不显式列出要诱发的行为,也缺少恶意代码、数据外泄等新意图的训练样本;评测器应在评测时可用、训练时不可用。
- 做法: Qwen3-235B-A22B为零样本生成具体例子、伪装方式和5个是/否评分细则,填成攻击生成输入。GRPO微调做过安全训练的Qwen3-8B:攻击发给目标LLM,judge按三档奖励更新。训练不用garak检测器。
- 主数字: 按验证集选出的检查点,域内总体ASR为85%,零样本Qwen3-8B为33.89%;域外总体ASR为29.35%,零样本为20.87%。域外改用garak检测器,与训练奖励不是同一判定(第5节)。
- 另一检查点: 训练时攻击Qwen3-8B、按验证集选出的检查点,域外平均ASR为37.8%。作者称它高于按验证集选出的检查点,也高于零样本的20.87%。
- 例外: 部分域外目标上双方都是0,作者归因于攻击输入改写了目标细节,和检测器所查内容不一致。作者称RL不自动提高成功攻击的多样性;多样性奖励有时使训练崩溃。定性上,作者称生成攻击更复杂,并倾向于使用输入中的例子和伪装方式。
- 作者结论: 作者称该流程能提高指令模型对域外目标、以及多个目标LLM生成有效攻击的能力,并希望后续看它能否协助人类红队和防御训练。