跳到正文
原文
研究者论文追踪· arXiv:2607.26115· Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felip·本站收录 · 原文发表 精选关注度34

OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

GPT-Red: Automated Red Teaming via Self-Play at Scale

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者通过自博弈强化学习训练红队智能体GPT-Red,使GPT-5.6在Fake CoT提示词注入下的鲁棒性达到95.9%。

威胁模型攻击者仅能修改防守者轨迹中的单个工具响应或非特权文件,具备有限次数黑盒查询权限,可通过代码规则与大模型自动校验;攻击目标包括数据渗漏与越狱。

问题
大语言模型在智能体部署中面临提示词注入与越狱威胁,而现有基于人工或固定提示词的对抗训练数据规模与多样性有限,容易发生过拟合且难以抵御自适应攻击。
方法
提出通过大规模自博弈强化学习训练红队智能体GPT-Red,配备终端与防守模型接口实现推理期搜索,利用多防守者种群进行对抗演进,并将生成的对抗样本用于模型对抗训练。
实验与结果
在IPI留存间接注入挑战中GPT-Red攻击成功率超越人类红队与基线;用其样本进行对抗训练使GPT-5.6在Fake CoT攻击下的鲁棒性从5.2%升至95.9%(Figure 13)。
局限与可以继续做的
作者指出GPT-Red在多模态、多轮攻击与内容策略越狱上训练较少;人类专家仍可能发现未覆盖的新场景;留存评测中未启用系统级缓解措施,且定量评测集中于特定智能体工具任务。
实验设置GPT-5.6、GPT-5.5 等 · IH-Challenge、2025 Q4 Indirect Prompt Injection Challenge 等 · Attack Success Rate (ASR)、IH Robustness (%) 等
模型
GPT-5.6GPT-5.5GPT-5.4GPT-5.3GPT-5.2GPT-5.1GPT-5.4 miniGPT-Red
基准
IH-Challenge2025 Q4 Indirect Prompt Injection ChallengeTensorTrustVendy Vending MachineInternal Data-Exfiltration Tasks
指标
Attack Success Rate (ASR)IH Robustness (%)Defender Robustness (%)
AI 导读和推荐理由全文 333 字

OpenAI 提出 GPT-Red,一个通过自博弈强化学习训练的自动化红队智能体,用于发现针对前沿大模型的提示注入攻击。攻击者与一组同时训练的防御者智能体对抗,攻击者因诱发有效失败获得奖励,防御者因抵御攻击并完成任务获得奖励。GPT-Red 能可靠攻破 GPT-5.5 及更早模型,在 2025 Q4 间接提示注入挑战赛场景中发现的成功攻击多于人类红队,并能泛化到未见过的环境、防御模型和 harness。它还针对 OpenAI 办公室的 AI 自动售货机系统成功实现改价、下单和取消订单三个目标。OpenAI 用 GPT-Red 生成对抗训练提示来训练 GPT-5.6,称其在多项鲁棒性评测中表现提升,例如假思维链攻击上的防御成功率从 5.2% 升至 95.9%。

推荐理由OpenAI 公开了自动化红队智能体的自博弈训练方法与攻击效果,可了解攻击面扩展和对抗训练的新路径。

深度解读

6 个问题,约 6,900 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。

    核心问题是现有基于强化学习的对抗训练因攻击数据集规模和多样性有限,容易发生过拟合且难以抵御自适应攻击,需要能够规模化生成高质量对抗样本的自主红队智能体。

    • 应用场景与重要性:大语言模型在智能体化部署中面临提示词注入与安全越狱威胁。随着模型能力和用例扩展,攻击面持续增大,必须抵御针对系统行为的恶意操纵。
    • 现有方法的不足:作者称,现有人类红队、提示词驱动的大模型或真实生产攻击数据规模受限,对抗训练容易对特定攻击模式过拟合,对自适应对手鲁棒性较弱;基于离散优化的对抗后缀方法通常需要白盒权限且难以迁移。
    • 核心观察与假设:作者认为,经训练的红队智能体可在推理期计算、环境多样性与训练计算三个维度扩展;通过攻防自博弈强化学习,防守方变强会促使攻击方发现新攻击策略,进而为防守方提供更具挑战的训练课程。
    • 论文提出的方案:构建了自主红队智能体 GPT-Red,通过推理期计算扩展(带 defender_model 工具的环境)、大规模红队强化学习环境构建,以及与多样化防守方种群的自博弈强化学习进行训练,并将所得攻击样本用于 GPT-5.6 的对抗训练。
    • 威胁模型:
      • 攻击面:攻击者仅能修改防守者运行轨迹中的单个工具响应或非特权文件集合(如替换单条网页搜索结果或修改非关键文件),无法修改特权文件或工具响应(如用户的 AGENTS.md)。
      • 知识与权限:攻击者对目标防守模型具备黑盒查询访问权限(有限查询次数),可观察防御者运行的部分信息(最近用户消息与原始工具响应/文件),查询后有时可观察注入后的完整运行轨迹及关联的 token 对数似然。
      • 规则约束:采用代码规则检查与大语言模型检查自动驳回不合规攻击,惩罚不符合工具响应格式或长度约束的尝试。
      • 攻击目标:涵盖泄露模拟敏感/私有数据、执行非可信代码、执行破坏性代码操作等间接提示词注入目标,以及直接提示词注入与安全拒绝越狱。
  2. 有哪些相关研究?

    涵盖基于优化的对抗攻击、指令层级防御、提示驱动的大模型红队以及多智能体对抗博弈等相关研究。
    • 提示词注入与指令层级:
      • Willison(2022)、Schulhoff 等(2023)、Toyer 等(2024)——研究了促使模型违背开发者或用户意图的直接与间接提示词注入。
      • Wallace 等(2024)——提出了指令层级(Instruction Hierarchy, IH),通过定义系统、开发者、用户与工具的特权级别并训练模型遵循约束来抵御注入攻击。
    • 基于优化的对抗攻击:
      • Zou 等(2023)、Yu 等(2023)、Liu 等(2023a)、Chao 等(2023)、Mehrotra 等(2023)、Anil 等(2024)、Carlini 等(2023)——针对安全策略越狱,使用离散优化生成对抗后缀。
      • Greshake 等(2023)、Liu 等(2023b)、Chaudhari 等(2024)——将对抗优化扩展至提示词注入领域。作者称这类方法通常需要白盒权限与大量查询,且难以迁移到新模型或新场景,与本文基于大语言模型的自动化方法互补。
    • 基于大语言模型的自动化红队:
      • Perez 等(2022)、Beutel 等(2024)、Ge 等(2023)、Yin 等(2026)、Shi 等(2025)——早期工作使用提示词驱动的攻击模型,或在较少环境内针对狭窄目标训练攻击者。
      • Xu 等(2024)、Wang 等(2025)、Syros 等(2026)——探索了独立于模型训练的测试期计算扩展。
      • Ma 等(2023)、Liu 等(2025)、Deng 等(2025)——与本文最接近。作者称相比 Ma 等(2023)与 Liu 等(2025),本文在环境多样性和对抗目标规模上进行了扩展;而 Deng 等(2025)仅考虑了防守分类器而非通用大模型。
    • 基线方法与使用基准:
      • 基线方法包括人类红队专家、无防守者访问的单次生成 GPT-5.5、配备 defender_model 工具脚手架的 GPT-5.5、Best-of-N 独立采样攻击者,以及未采用自博弈对抗训练的 GPT-5.1。
      • 使用的基准包括 2025 Q4 IPI Challenge(Dziemian 等,2026)、IH-Challenge(Guo 等,2026)、TensorTrust(Toyer 等,2024)等。
    • 本文定位:作者将本文定位为在攻击目标与训练环境真实性、训练与推理计算规模,以及多防守方自博弈算法设计上扩展的大规模自动化红队与对抗训练研究。
  3. 论文如何解决这个问题?

    构建带防守者查询接口的智能体脚手架,基于大规模安全环境和多防守者种群进行自博弈强化学习训练。

    论文提出了基于大规模自博弈强化学习的自动化红队框架 GPT-Red,协同扩展推理期计算、红队环境多样性与训练计算规模三大维度,通过攻击者与防守者种群的同时训练发现新攻击策略,并将生成的对抗样本纳入生产模型的高强度对抗训练。

    推理期计算扩展与工具脚手架

    • 双工具接口设计:为攻击智能体配备通用终端工具(terminal)和防守模型工具(defender_model)。攻击者可在虚拟文件系统中编写攻击文件,通过 defender_model 将文件路径发送给系统,系统将攻击载荷插入预定位置并对防守者进行采样。
    • 反馈与上下文保留:defender_model 工具向攻击者返回防守者的执行轨迹、token 对数似然以及评审模型的反馈信号;攻击者可在单次交互中编辑文件以节省 token,并可编写 Python 脚本调用直接接口进行批量测试。
    • 结构化搜索机制:攻击者利用终端执行代码,以模板填充、字符串拼接或并行变体测试等方式探索攻击空间,当满意或时间耗尽时提交最终攻击路径。

    多防守方自博弈强化学习算法

    • 模型初始化与流程:攻击者和防守者模型均使用具备思维链(CoT)推理能力的大模型进行初始化;GPT-Red 的权重初始化自 GPT-5.5。
    • 单步自博弈迭代:
      1. 采样强化学习环境,包含上下文对话、初始文件系统状态及选定的防守模型;
      2. 选取合适的攻击插入点与攻击目标,并提供任务所需的对抗知识;
      3. 攻击模型进行生成与交互,中间对 defender_model 的调用均被丢弃,仅保留提交的最终攻击;
      4. 验证攻击与环境的合法性,不合规攻击判定为奖励 0;
      5. 将攻击插入防守者的运行位置,恢复防守者执行;
      6. 计算非对称环境奖励,评估攻击者是否达成目标以及防守者是否完成原始任务;
      7. 使用强化学习算法根据轨迹与奖励对更新攻击者和防守者。
    • 防守方种群机制:引入包含多个不同鲁棒特性的防守者种群进行对抗,避免攻击者模式坍缩到单一狭窄的攻击类型,促使其针对不同防守者探测特定弱点。
    • 目标形式化:设攻击者策略为 Aθ,防守者策略为 Dϕ,在环境分布 ℰ 下,攻击者通过强化学习最大化对抗目标奖励 𝔼(e, D)∼ℰ [RA(Aθ, D)],防守者则最大化安全完成原始任务的奖励。

    现实红队强化学习环境构建

    • 能力任务转化:将生产能力任务直接转化为对抗训练环境,在防守者工具调用输出中插入对抗内容或修改非特权本地文件。
    • 覆盖的任务类别:
      • 直接提示词注入(IH-Challenge 扩展):在开发者或系统指令下,攻击者编辑低优先级用户或开发者消息,检验是否破坏预设约束。
      • 间接提示词注入:覆盖网页浏览(即时搜索与深度研究)、连接器(如读取 Gmail 邮件或日历)、通用函数调用(模拟开发者 API)、代码智能体(修改本地非特权文件)。
      • 多模态提示词注入:接入 OpenAI Images 2.0 API,攻击者生成渲染图像,测试计算机使用智能体(CUA)或浏览检索。
      • 安全策略越狱:包含单轮与多轮越狱,使用评分标准衡量输出与有害回答的接近程度,并通过自动化过滤器过滤无意义改写和不自然对话。
  4. 论文做了哪些实验?

    在真实智能体、挑战赛基准和留存域上全面评估,GPT-Red突破旧模型并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    实验设置

    • 被测模型:
      • 作为防守者/目标模型:GPT-5.1、GPT-5.2、GPT-5.3、GPT-5.4、GPT-5.4 mini(Codex CLI 智能体)、GPT-5.5、GPT-5.6、内部小型 GPT-5 系列模型、内部 helpful-only 模型,以及多防守者实验中的 Models A 至 I。
      • 作为攻击者:GPT-Red、GPT-5.5(带/不带 defender_model 工具)、内部 helpful-only 模型、人类红队专家。
    • 数据集与基准:间接提示词注入包括 2025 Q4 Indirect Prompt Injection (IPI) Challenge(Dziemian 等,2026)、10 项内部数据渗漏任务、Andon Labs Vendy 自动售货机系统;直接提示词注入包括 IH-Challenge(Guo 等,2026)、TensorTrust(Toyer 等,2024)、Fake CoT 攻击集、System Override 攻击集、Multi-Defender 攻击集、Edge Case 攻击集、Assorted Attack Categories 综合集;以及留存数据集、留存领域、留存攻击评测集。
    • 基线方法:人类红队(Human Red-Teamers)、无防守者访问的单次生成 GPT-5.5、带 defender_model 工具脚手架的 GPT-5.5、Best-of-N 独立采样攻击者、未经过自博弈对抗训练的 GPT-5.1。
    • 评价指标与判定方式:主要指标为攻击成功率(Attack Success Rate, ASR)与指令层级鲁棒性(IH Robustness (%) / Defender Robustness (%))。判定采用代码规则自动验证(如是否输出特定 PIN、是否执行特定工具调用、正则表达式匹配、JSON 有效性验证等)结合预定义评分标准(rubrics),所有模型均在大致相当于 high reasoning 档位下评测。
    • 样本量与重复次数:内部数据渗漏任务采用 3 次独立运行计算均值与最值区间;多防守者迁移实验在 9 个模型间交叉测试;IPI Challenge 采用竞赛完整评测场景。

    主结果

    表格较宽,可左右滑动

    模型评测基准 / 攻击类型指标数值出处
    GPT-5.1Fake CoT 攻击IH 鲁棒性 (%)5.2%Figure 13
    GPT-5.6 w/ Self-PlayFake CoT 攻击IH 鲁棒性 (%)95.9%Figure 13
    GPT-5.1System Override 攻击IH 鲁棒性 (%)66.0%Figure 13
    GPT-5.6 w/ Self-PlaySystem Override 攻击IH 鲁棒性 (%)99.5%Figure 13
    GPT-5.1Multi-Defender 攻击IH 鲁棒性 (%)0.4%Figure 13
    GPT-5.6 w/ Self-PlayMulti-Defender 攻击IH 鲁棒性 (%)94.3%Figure 13
    GPT-5.1TensorTrustIH 鲁棒性 (%)89.0%Figure 13
    GPT-5.6 w/ Self-PlayTensorTrustIH 鲁棒性 (%)98.3%Figure 13
    • 直接注入鲁棒性提升:作者报告,相比未采用自博弈对抗训练的 GPT-5.1,经过 GPT-Red 样本对抗训练的 GPT-5.6 在各项基准上鲁棒性表现更优,在 Fake CoT 攻击下鲁棒性从 5.2% 升至 95.9%,在 Multi-Defender 攻击下从 0.4% 升至 94.3%(Figure 13)。
    • 留存评估泛化表现:在完全未见过的留存攻击、留存数据集和留存领域评估中,GPT-5.6 的防御鲁棒性分别达到 72.0%、56.1% 和 89.1%(Figure 11)。
    • 历史模型演进对比:在间接提示词注入挑战中,GPT-5.6 的 ASR 低于 4.0%(GPT-5.3 约为 6.7%,GPT-5.4 约为 6.3%,GPT-5.5 约为 4.0%);在直接提示词注入环境中,GPT-5.6 的 ASR 约为 0.08%(GPT-5.3 约为 0.37%)(Figure 12)。在人类攻击基准 IPI 2025 Challenge 上,GPT-5.6 取得了 100% 的鲁棒性(除 1 例人工核验的人工评分误判,第 12 页)。

    真实智能体与内部红队评测

    • 测了什么:在 OpenAI 办公室内由 Andon Labs 研发的真实 AI 自动售货机系统 Vendy 的仿真环境中测试 GPT-Red,目标包括将高价在售商品降价至 0.50 美元、订购 100 美元以上新品并标价 0.50 美元、以及取消其他客户订单。
    • 结果:GPT-Red 达成了全部三项目标,通过伪造来自受信任管理员的元数据欺骗系统(Figure 9,第 11 页)。
    • 作者的解读:作者认为这展示了红队智能体在不完全了解底层模型和运行框架的情况下,针对真实智能体系统实现定向恶意目标的能力。

    多防守方迁移与自博弈动态分析

    • 测了什么:在针对 9 个不同防守模型(A 至 I)的训练中,重新评测在某一模型上发现的攻击对其他模型的迁移效果(Figure 7);同时跟踪自博弈过程中攻击者在训练集上的 ASR 与检查点攻破能力(Figure 4、6)。
    • 结果:不同模型间的攻击迁移率存在差异(例如针对模型 A 的攻击在模型 I 上 ASR 为 25%,而在模型 A 上为 97%;针对模型 I 的攻击在模型 I 上为 81%,但在模型 F 上为 75%,Figure 7);后期的攻击者检查点对所有早期防守者检查点的突破能力几乎单调提升(Figure 6)。
    • 作者的解读:作者认为这表明攻击者没有坍缩至单一攻击手法,而是学会了针对特定防守者定制攻击策略,自博弈呈现出攻防相互适应的训练动态。

    其他消融与分析

    • 在 IH 任务上,使用 defender_model 顺序迭代的攻击者在 50 次调用时 ASR 达到约 90%,而独立 Best-of-N 采样在同等调用次数下 ASR 约为 64%(Figure 3)。
    • 针对 GPT-5 的攻击者在训练早期生成系统消息覆盖等简单攻击,而伪造思维链(Fake CoT)等复杂攻击在训练后期才开始涌现(第 6 页)。
    • GPT-Red 生成的攻击在早期 GPT-5 模型上的成功率显著高于较新模型,在 GPT-5.2 之前的模型上成功率接近两倍(第 10 页)。
    • 第 5 个攻击者检查点攻破第 1 个防守者检查点的 ASR 为 78%,攻破第 5 个防守者检查点的 ASR 为 29%(Figure 6)。
    • 在较为简单的提示词注入任务上,GPT-Red 与未经红队微调的 GPT-5.5 表现相似(Figure 10 说明)。
    • 单模型自博弈容易导致攻击者策略发生模式坍缩,且仅对训练过的防守者有效,在留存模型上表现下降(第 7 页)。
  5. 有什么可以进一步探索的点?

    作者指出多模态与多轮场景训练相对不足,且评测主要集中于特定智能体工具任务并省略了系统级缓解。

    作者指出的局限与后续方向

    • 多模态与多轮场景训练不足:作者在第 9 节指出,GPT-Red 目前在多模态环境、多轮攻击场景和内容策略越狱方面的训练相对较少,未来计划在这些领域扩大覆盖范围。
    • 人类红队的不可替代性:作者在第 10 节尾注 2 指出,评测结果并不意味着 GPT-Red 全面优于人类红队,人类专家可能会发现 GPT-Red 未曾考虑到的新场景或新攻击类别。
    • 自博弈飞轮的持续扩展:作者在第 9 节指出,未来计划继续扩大计算规模、数据多样性与自博弈训练规模,以适应不断扩展的模型能力、更复杂的环境场景和更强大的自适应对手。

    实验覆盖范围

    • 被测目标模型范围:实验主要覆盖 OpenAI 内部的 GPT-5 系列模型(包括 GPT-5.1、GPT-5.2、GPT-5.3、GPT-5.4、GPT-5.5、GPT-5.6、GPT-5.4 mini 和内部小型 GPT-5 模型)以及训练中使用的 9 个防守者种群模型,论文未报告其他机构的外部开源或商业前沿模型作为受害目标的攻击评测。
    • 攻击类型覆盖:定量核心实验集中于直接与间接提示词注入(特别是指令层级违规与工具数据渗漏),多模态注入与内容策略越狱主要展示了定性环境构建与示例,论文未报告大规模基准上的系统性定量消融。
    • 评测协议与样本量:内部数据渗漏实验采用 10 项任务且每项重复 3 次;多防守者迁移实验在 9 个固定模型间进行;人类攻击基准主要使用了 2025 Q4 IPI Challenge 与 TensorTrust;直接注入评测中部分基准的样本量和具体例数论文未详细报告。
    • 系统级防御未计入:作者在第 12 节明确指出,在对 GPT-5.3 至 GPT-5.6 的留存红队测试中,未启用系统级缓解措施(system-level mitigations),因此报告的攻击成功率高于真实攻击者面临的实际成功率。
  6. 总结一下论文的主要内容

    通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。
    • 一句话定位:提出了通过大规模自博弈强化学习训练的自主红队智能体 GPT-Red,并将其用于前沿大模型 GPT-5.6 的对抗鲁棒性训练。
    • 要解决的问题:现有大模型对抗训练依赖规模受限且静态的人类或提示驱动攻击数据,容易发生过拟合并被自适应攻击绕过,亟需具备自适应搜索与持续进化能力的自动化红队生成体系。
    • 方法要点:为攻击者提供 terminal 与 stateful defender_model 工具以支持推理期搜索;构建覆盖工具调用、本地文件、网页浏览和多模态渲染的现实红队强化学习环境;采用多防守者种群的自博弈强化学习训练,通过非对称奖励驱动攻防双方共同进化并防止策略坍缩。
    • 核心实验结果:
      1. 在 IPI Challenge 留存间接提示词注入任务上,GPT-Red 在 100x 计算量下 ASR 超过 80%,高于人类红队与 GPT-5.5 基线(Figure 1);
      2. 针对 OpenAI 办公室内真实 AI 自动售货机系统 Vendy,GPT-Red 达成了低价改价、高价新品下单和取消订单三项实际恶意目标(Figure 9,第 11 页);
      3. 引入 GPT-Red 样本进行对抗训练使 GPT-5.6 在 Fake CoT 攻击下的防御鲁棒性从 GPT-5.1 的 5.2% 提升至 95.9%(Figure 13),在留存攻击、数据集和领域的鲁棒性分别达到 72.0%、56.1% 和 89.1%(Figure 11)。
    • 作者结论与启示:作者认为攻防自博弈为模型安全提供了自我提升路径,但多模态、多轮对抗以及防范人类可能挖掘出的新攻击类别仍是未来持续探索的方向。
阅读原文arxiv.org