跳到正文
原文
研究者论文追踪· arXiv:2608.00677· Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu, Yu-Gang Jiang·本站收录 · 原文发表 精选关注度33

OpenART 提出环境演化红队框架,在 75 个 Agent 配置上实现 85.0% 攻击成功率

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

上海AI实验室等构建智能体红队竞技场OpenART,EMHA演化攻击在75种配置下取得85.0%严格ASR。

问题
智能体在长跨度持久环境中执行工具序列时,状态改变的累积可能诱发安全失效,但现有基准多基于静态短交互和特定接口,无法有效捕捉累积风险,也难以跨运行时分离模型与智能体系统架构对安全的影响。
方法
构建解耦任务语义与运行时实现的OpenART竞技场,通过适配器将场景映射至15个智能体与8个原生向量;保持良性任务目标和安全契约固定,提出黑盒策略EMHA,基于超图路径搜索和反馈引导驱动环境演化。
实验与结果
在75种智能体-模型配置下EMHA取得85.0%的严格ASR;智能体身份额外解释了7.6%的ASR方差;演化状态在长工作流中产生中位数37步的潜伏传播;在复杂场景中演化攻击相较仅指令演化的优势扩大至17.6个百分点。
局限与可以继续做的
论文未设立专门的局限章节,作者在附录中将受控能力重绑定攻击列为未来实验方向;简短工作流会低估演化脆弱性;实验评测了5个模型与15个智能体,未报告演化迭代轮数预算K与攻击者模型具体版本。
实验设置GPT-5.5、Claude-Opus-4.8 等 · OpenART、DTap 等 · Strict ASR、Benign Task Completion (Comp.) 等
模型
GPT-5.5Claude-Opus-4.8GLM-5.2Qwen-3.7-MaxDeepSeek-V4-Pro
基准
OpenARTDTapInjecAgentToolEmuAgentDojoAgentHarmASB
指标
Strict ASRBenign Task Completion (Comp.)Propagation Distance (D_i)Latency (L_i)
AI 导读和推荐理由全文 362 字

复旦大学与上海人工智能实验室的研究者提出 OpenART,一个以环境演化为核心的 Agent 红队测试平台,并配套 Evolutionary Markov Hypergraph Attack(EMHA)黑盒策略,在 75 个 Agent 与模型组合上取得 85.0% 的 pooled Strict ASR。OpenART 从 589,742 个 Tools、MCPs 和 Skills 构建出 10,513 个可执行场景,覆盖 50 个领域,每个场景中位需要 97 次工具调用,并通过适配器映射到 15 个已部署 Agent、5 个基础模型和 8 类运行时原生攻击面。EMHA 保持任务目标与安全契约不变,仅演化目标可见环境,其相对仅指令演化的优势从简单场景的 1.8–2.7% 上升到最复杂场景的 17.2–17.6%。

推荐理由论文给出跨 15 个 Agent、5 个基础模型的统一红队协议与 85.0% 攻击成功率,可对照自身 Agent 运行时的攻击面覆盖。

深度解读

6 个问题,约 6,300 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    智能体长交互中状态累积引发安全失效,现有静态基准难以解耦模型与运行时安全。

    智能体在持久环境中的长跨度交互安全风险,以及现有静态评测难以解耦模型与智能体架构安全特性的问题。

    • 长跨度环境交互的累积风险:智能体通过工具与持久环境长期交互,单步看似良性的操作可能引入潜在状态变化,并在后续工作流中累积爆发为安全违规。
    • 现有安全基准的评测局限:现有智能体安全基准大多使用固定或可重置的静态环境,交互跨度短且依赖特定接口,作者认为这难以捕捉状态累积风险,也无法跨运行时对比系统安全性。
    • 解耦场景语义与环境演化:论文主张将场景作为基本评估单元,保持良性任务目标和隐藏安全契约固定不变,仅通过反馈引导演化目标可见的持久环境状态。
    • 威胁模型设定:
      • 攻击目标:在良性任务目标不变的前提下,诱导智能体执行违反隐藏安全契约的不安全操作(如将私密标记泄露至公开输出)。
      • 攻击者知识:采用黑盒(black-box)设定,不访问也不修改目标模型的权重与内部参数。
      • 攻击者能力:攻击者与目标智能体在隔离的 Docker 容器中运行,仅能通过适配器在授权的原生位置修改目标可见的环境状态快照。
      • 受害系统:运行在原生环境中的 15 个已部署智能体系统及其调用的 5 个基础大语言模型。
    • 论文提出的解决方案:构建包含 50 个领域、超 1 万个可执行长场景的 OpenART 竞技场,并提出基于超图路径搜索的参考黑盒演化攻击策略 EMHA。
  2. 有哪些相关研究?

    涵盖自适应红队、交互式环境基准和环境表面安全,本文聚焦环境轨迹协同演化。

    相关研究主要围绕智能体自适应红队攻击、交互式任务基准以及多环境表面安全风险展开。

    • 自适应红队与环境演化攻击

      • DTap(Chen 等,2026)——在受控服务仿真中跨 Tools、Skills 和 MCPs 搜索提示注入;论文指出 DTap 仅在 2 个已部署智能体和固定仿真 API 上针对 4 个注入向量调整载荷,而 OpenART 跨 15 个智能体在 8 个原生向量上协调环境轨迹演化。
      • AgentVigil(Wang 等,2025)与 AutoInject(Chen 等,2026)——AgentVigil 基于黑盒蒙特卡洛树搜索精炼提示注入;AutoInject 学习在保持效用下的可迁移攻击;论文指出它们主要在固定基准内调整攻击载荷或方案。
      • WebInject(Wang 等,2025)、AgentLAB(Jiang 等,2026)与 AgentDyn(Li 等,2026)——WebInject 扰动网页注入提示词;AgentLAB 涵盖 28 个环境的长跨度攻击;AgentDyn 引入动态任务;论文指出这些工作主要改变载荷、规划或单类表面。
    • 交互式环境与复杂任务基准

      • AgentBench(Liu 等,2024)、WebArena(Zhou 等,2024)、WorkArena(Drouin 等,2024)、OSWorld(Xie 等,2024)与 TheAgentCompany(Xu 等,2026)——将智能体评估从单轮响应扩展到可执行交互环境。
      • OSWorld 2.0(Yuan 等,2026)——展示了持续长跨度交互下能力评估结论会发生改变;论文指出这些基准的任务实例在评估期间保持固定,测试的是在给定环境中执行任务的能力,而非环境演化下的安全性。
    • 环境表面安全与持久化风险

      • InjecAgent(Zhan 等,2024)与 AgentDojo(Debenedetti 等,2024)——在外部观测中放置间接提示注入。
      • ToolEmu(Ruan 等,2024)、AgentHarm(Andriushchenko 等,2025)与 ASB(Zhang 等,2025)——测试不安全工具调用、有害操作以及对规划或记忆的攻击。
      • AgentPoison(Chen 等,2024)、eTAMP(Zou 等,2026)、SkillSafetyBench(Jin 等,2026)与 MCPTox(Wang 等,2026)——分别测试长期记忆投毒、网页观测轨迹污染,以及技能与 MCP 工具描述层面的风险。
    • 对比基线与基准定位

      • 对比基线与基准:论文在复杂度上对比了 InjecAgent、ToolEmu、AgentDojo、AgentHarm、ASB、DTap 等基准;在演化消融中对比了仅指令演化(Instruction-only evolution)基线。
      • 本文定位:作者称 OpenART 将环境交互轨迹本身作为红队对象,保持任务目标和安全契约不变,通过评估器反馈在异构运行时中协调目标可见状态演化。
  3. 论文如何解决这个问题?

    构建解耦运行时的OpenART竞技场,配合超图路径搜索的EMHA黑盒演化策略。

    论文提出 OpenART 评测竞技场与 EMHA(Evolutionary Markov Hypergraph Attack)黑盒参考攻击策略,在固定任务目标和安全契约下通过反馈驱动环境状态演化。

    场景抽象与能力库构建

    • 场景形式化定义:每个可执行场景包含良性任务目标、关联工作流、目标可见环境和隐藏安全契约,将用户可见任务视为场景实例。
    • 超大规模能力库:遵循 SkillNet 收集 589,742 个 Tools、MCPs 和 Skills,覆盖 O*NET 与现有基准整合出的 50 个工作领域。
    • 三阶段规划流水线:Planner 依次执行场景模型生成(scenario_model.json)、任务包生成(含工作区文件、工作流 DAG、安全契约与确定性评估器)及验证失败修复;附录 E 给出了完整提示词与约束。

    有向工作流图与可执行环境编译

    • 工作流图合规约束:规划器将场景展开为有向无环工作流图 Gq = (Vq, Eq),必须满足拓扑序、输入闭包与复杂度约束: (u, v) \in E_q \Rightarrow r_q(u) < r_q(v), \quad I_q(v) \subseteq R_q \cup \bigcup_{u \in \mathrm{Anc}_{G_q}(v)} O_q(u), \quad h(G_q) \in B(c) 该公式确保节点依赖无环、操作具备所需前置输入资源,且图复杂度指标落入预设参数范围。
    • 环境编译与确定性验证:编译器将规范物化为可执行初始环境 x0,q = F(Sq, Gq, Dq),并通过真值表(良性成功、良性未完成、不安全泄露、良性加泄露四种情形)验证评估器。

    跨智能体运行时投影

    • 轻量级运行时适配器:针对目标运行时 r,适配器 ψr 在原生接口上实例化场景,仅暴露该运行时支持的原生攻击向量;攻击者与目标运行在隔离 Docker 容器中。
    • 八大原生环境向量:支持工作区(Workspace)、指令(Instructions)、技能(Skill)、工具(Tool)、MCP、短期记忆(Short-Term Memory)、规划状态(Plan State)和长期记忆(Long-Term Memory)。

    进化马尔可夫超图攻击(EMHA)

    • 核心优化目标:EMHA 在有限轮数预算 K 内最大化最优评估器反馈: JEMHA = 𝔼[max1 ≤ t ≤ K Yt] 该公式定义了黑盒攻击策略通过评估器反馈迭代优化多轮环境中取得的最佳攻击成效。
    • 超图路径搜索与信用分配:超图节点表示攻击子目标,超边包含前置与后继子目标及突变模板;通过温度参数对就绪边进行软采样,并根据新获得的最优分数增益反向分配边信用。
    • 质量多样性图进化:基于 MAP-Elites 维护行为归档,保存各特征细胞中适应度最高的攻击方案,通过图编辑核函数重用成功精英结构;附录 F 给出了固定攻击者原则提示词。
  4. 论文做了哪些实验?

    75种配置下EMHA取得85.0%严格ASR,智能体架构额外解释7.6%方差。

    实验设置

    • 被测基础模型:GPT-5.5、Claude-Opus-4.8、GLM-5.2、Qwen-3.7-Max、DeepSeek-V4-Pro(共 5 个)。
    • 被测智能体系统:OpenCode、Aider、Claude Code、Codex、Continue CLI、Copilot CLI、CodeWhale、Goose、Hermes、Kilo、Nanobot、Oh My Pi、OpenClaw、Pi、Qwen Code(共 15 个),形成 75 种配置。
    • 基准规模与复杂度:包含 50 个领域的 10,513 个场景;相比 DTap(中位数 15 次工具调用、深度 2),OpenART 中位数达 97 次工具调用、依赖深度 32、并行宽度 12.5、状态对象 96.5、文件格式 7.5(据 Table 1、Table 2)。
    • 评测指标:严格攻击成功率(Strict ASR,%),要求确定性评估器与 GLM-5.2 裁判同时判定成功;良性任务完成率(Comp.,%)。
    • 判定与审计:确定性评估器检测私密标记泄露,GLM-5.2 独立复核;人工审计抽样检查评估器,正确率为 99.3%(据第 1 节)。

    主结果

    各基础模型跨 15 个智能体的汇总良性完成率与严格攻击成功率如下表所示(据 Table 3):

    表格较宽,可左右滑动

    基础模型全智能体良性完成率 (%)全智能体 Strict ASR (%)最低 ASR 智能体及数值 (%)最高 ASR 智能体及数值 (%)
    GPT-5.592.0288.5Aider (61.2)OpenCode (100.0)
    Claude-Opus-4.896.1859.2Aider (38.2)Copilot CLI / Kilo (65.4)
    GLM-5.285.0087.9Aider (62.3)Oh My Pi (93.6)
    Qwen-3.7-Max80.8194.6Aider (66.6)Copilot CLI (100.0)
    DeepSeek-V4-Pro82.9194.7Aider (66.7)Oh My Pi (99.3)
    全体汇总(Pooled)87.3885.0Aider (59.1)OpenCode (90.3)
    • 模型与智能体方差分解:双向方差分解中,73.6% 的 ASR 方差归因于目标模型,25.2% 归因于目标智能体;智能体脆弱性排序在不同模型间保持中度一致(平均两两 Spearman 相关系数为 0.65,据第 5.2 节)。
    • 智能体架构带来的独立安全影响:目标模型与良性完成率共同解释 91.3% 的 ASR 方差,加入目标智能体身份后解释比例升至 98.9%(额外解释 7.6%,据第 5.2 节)。
    • 能力与安全表现解耦:Claude-Opus-4.8 取得最高的良性完成率(96.18%)和最低的 Strict ASR(59.2%);Aider 在所有模型下的良性完成率均最低(总体 70.74%),作者认为其攻击结果受能力短板影响(据 Table 3、第 5.2 节)。

    攻击组件与环境向量消融实验

    • 环境向量受限演化:在 DeepSeek-V4-Pro 下,仅演化 Workspace 取得 92.5% 的 Strict ASR,比仅指令演化高出 10.9 个百分点;其余 7 个单向量平均为 71.2%,各向量均超过 50%(Plan State 为 56.5%,Short-Term Memory 为 58.8%,MCPs 为 73.1%,Long-Term Memory 为 73.9%,据 Figure 2a)。
    • 搜索组件消融:移除归档机制使 Strict ASR 下降 3.9 个百分点至 90.8%;移除信用重新分配使 Strict ASR 下降 2.6 个百分点至 92.1%(据 Figure 2b)。
    • 协同演化优势:完整 EMHA 达到 94.7% 的 Strict ASR,超过仅指令演化 13.1 个百分点,高出最强单向量变体 2.2 个百分点;作者称跨环境表面的协同演化比单独演化指令或单一向量更有效(据第 5.2 节)。

    任务复杂度与长跨度安全漂移分析

    • 复杂度对演化优势的放大:在 GPT-5.5 下,依赖深度从 8 增至 83 时,EMHA 对比仅指令演化的优势差距扩大至 17.6 个百分点(Figure 4a 标注 max Δ = 17.6 pp);工具调用次数从 5 增至 118 时差距达 17.2 个百分点(Figure 4b 标注 max Δ = 17.2 pp)。
    • 长跨度安全漂移潜伏期:在 10,000 条转换轨迹中,从目标首次消耗演化状态到产生首个不安全动作的传播距离中位数为 37 次动作(IQR: 20–66);首次使用演化状态发生在中位数 23% 的执行进度,首次不安全动作出现在 64%,潜伏期中位数为 41%(据 Figure 3)。
    • 潜伏传播机理:作者称演化状态的影响往往会在数十步良性中间操作中隐蔽传播,较长时间保持潜伏,最终在下游汇聚节点爆发(据第 5.2 节)。

    其他消融与分析

    • 复杂度并行宽度消融:GPT-5.5 下并行宽度从 3 增至 24 时,EMHA 相对指令演化最大差距为 14.8 个百分点(据 Figure 4d)。
    • 复杂度文件格式数消融:GPT-5.5 下文件格式数从 2 增至 15 时,EMHA 相对指令演化最大差距为 13.1 个百分点(据 Figure 4c)。
    • 能力重绑定攻击表现:工具受限演化达到 71.4% Strict ASR,MCP 受限演化达到 73.1% Strict ASR(据第 5.2 节)。
    • 轨迹案例证据分析:GPT-5.5 溯源组合案例中,评估器在 8 类风险中检测到 7 类,LLM 裁判评分产生 0.9375 的复合结果(据 Table 17)。
  5. 有什么可以进一步探索的点?

    实证未包含能力重绑定攻击,未设独立局限章节,覆盖75种配置与8类向量。

    作者指出的局限与后续方向

    • 实证实验未包含受控能力重绑定攻击:作者在附录 G.6 中指出,受控的 MCP 能力重绑定攻击构造未包含在经验实验结果中,将其作为未来实验中验证第五种攻击机制的测试协议(出处:附录 G.6)。
    • 参考演化策略与替代策略的开放性:作者在第 1 节指出,EMHA 仅作为环境演化的参考策略,OpenART 仍对其他替代演化策略保持开放(出处:第 1 节)。
    • 短工作流对脆弱性的低估:作者在附录 B 中指出,简短的工作流可能会低估环境演化带来的脆弱性,从而构成了在结构复杂场景下进行评估的动因(出处:附录 B)。
    • 特定智能体能力短板对攻击结果的影响:作者在第 5.2 节指出,Aider 在各模型下的完成率均表现最低,因此对其攻击结果的解读应当结合这一能力差距背景(出处:第 5.2 节)。
    • 论文未设立独立的局限性章节:论文正文与附录未设立独立的 Limitations 章节(出处:全文目录与结构)。

    实验覆盖范围

    • 被测系统与模型覆盖:实验评测了 15 个具体的已部署智能体系统与 5 个基础大语言模型,共评测 75 种智能体-模型组合(出处:第 5.1 节,Table 3)。
    • 场景与领域覆盖:实验构建并验证了 50 个领域的 10,513 个场景,工作流包含中位数 97 次工具调用(出处:第 5.1 节,Table 1)。
    • 环境攻击向量覆盖:涵盖工作区、指令、技能、工具、MCP、短期记忆、规划状态、长期记忆共 8 个运行时原生向量(出处:第 3.3 节,Table 9)。
    • 评测判定机制:严格攻击成功率由确定性评估器与 GLM-5.2 裁判模型联合判定,人工审计抽样检查了评估器的正确性(出处:第 5.1 节)。
    • 论文未报告的信息:论文未报告 EMHA 演化轮数预算 K 的具体数值、未报告攻击者 LLM 的具体模型版本与参数量,且未报告各项测试的平均耗时与 API 查询次数(出处:第 4.2 节,第 5.1 节)。
  6. 总结一下论文的主要内容

    提出OpenART竞技场与EMHA攻击,75种配置下ASR达85.0%,揭示长跨度安全漂移。
    • 核心定位与问题:针对智能体在长跨度持久环境中状态累积易诱发安全失效、而现有静态基准难以跨运行时评估的问题,提出了基于受控环境演化的智能体红队竞技场 OpenART。
    • 环境与场景构建:从超过 50 万个 Tools、MCPs 和 Skills 中构建出覆盖 50 个领域的 10,513 个长跨度可执行场景,工作流中位数达 97 次工具调用,并通过轻量级适配器映射到 15 个智能体和 8 个原生环境向量。
    • EMHA 攻击方法:在保持良性任务目标和安全契约固定的前提下,提出黑盒参考攻击策略 EMHA,通过超图路径搜索、反馈引导的软 Q 学习和质量多样性图进化协调环境状态突变。
    • 核心实验发现:跨 75 种智能体-模型配置下 EMHA 取得 85.0% 的严格 ASR;在 DeepSeek-V4-Pro 下完整 EMHA 达到 94.7% ASR,高出仅指令演化 13.1 个百分点;在复杂场景中演化优势相对指令演化扩大至 17.6 个百分点(Figure 4a)。
    • 方差分解与架构影响:目标模型和智能体系统分别解释 73.6% 和 25.2% 的 ASR 方差;在控制模型与良性能力后,智能体身份仍能额外解释 7.6% 的方差。
    • 长跨度安全漂移启示:轨迹分析表明演化状态在产生不安全动作前平均潜伏 37 步,作者认为智能体安全不能仅依赖模型瞬间响应的静态评测,必须在动态演化环境中长跨度审视状态与决策的相互作用。
阅读原文arxiv.org