跳到正文
原文
论文追踪· arXiv:2610.03153·本站收录 · 原文发表 精选关注度30

EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

EvoRiskBench: An Evolving Benchmark for Runtime Security Risks in Workspace Agents

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

论文评测工作空间智能体运行时风险,DeepSeek-V4-Pro-0813在Codex下ASR达68.44%。

问题
工作空间智能体在执行多步任务时面临运行时安全风险。现有基准在智能体通信和子智能体委托等入口覆盖不全,且缺乏对资源耗尽等技术后果的系统评测,难以应对智能体组件和威胁的演化。
方法
论文提出EP–Path–EF框架,将9个风险入口通过智能体执行路径映射到5类技术后果。基于该框架构建自动化生成-冻结-重放-提炼流程,通过Windows隔离容器与ETW事件独立验证后果,构建出包含450个可执行对抗任务的基准。
实验与结果
在3个模型与3个Harness组成的9种配置下测试4050次,整体ASR为37.46%,整体TSR为60.44%。DeepSeek-V4-Pro-0813搭配Codex的ASR最高达68.44%;模型间ASR差距达54.37个百分点,大于Harness间差异。
局限与可以继续做的
评测仅针对间接提示注入,沙箱工具与环境可能未完全捕捉生产环境的复杂度。实验覆盖3个模型、3个Harness与450个任务,未报告生成阶段所用的基线模型与Harness,且Codex测试中绕过了内部沙箱与工具审批提示。
实验设置GPT-5.6 Sol、DeepSeek-V4-Pro-0813 等 · EvoRiskBench · ASR、TSR 等
模型
GPT-5.6 SolDeepSeek-V4-Pro-0813Claude Opus 5
基准
EvoRiskBench
指标
ASRTSRHarm Score (HS)
AI 导读和推荐理由全文 358 字

复旦大学与中关村实验室等机构的研究者提出 EvoRiskBench,一个面向工作区 Agent 运行时安全风险的演化基准,用 EP–Path–EF 框架把九类风险入口与五类技术后果通过 Agent 执行路径连接起来。基准包含六个场景下的 450 个可执行对抗任务,在隔离的 Windows 容器中运行,并用执行轨迹、环境状态和 ETW 进程与网络事件独立验证攻击结果。研究者在三种模型(GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5)与三种 harness(Claude Code、Codex、OpenClaw)组成的九种配置上做了 4050 次攻击执行,总体攻击成功率 37.46%,最高为 DeepSeek-V4-Pro-0813 配 Codex 的 68.44%。

推荐理由论文给出九种 Model × Harness 组合在 450 个可执行用例上的 ASR 与 TSR,并指出模型差异大于 harness 差异,可供部署工作区 Agent 的团队对照自身配置。

深度解读

6 个问题,约 6,800 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    论文试图解决工作空间智能体运行时安全风险覆盖不全,以及缺乏可验证、可持续演化的执行基准的问题。

    现有安全基准无法充分覆盖工作空间智能体(Workspace Agents)在实际交互执行中的运行时安全风险,且缺乏系统化、可验证且支持持续演化的可执行评测基准。

    • 运行场景与重要性:工作空间智能体作为结合大语言模型与执行 Harness 的有状态系统,能通过多步工具交互访问并修改外部资源,其模型输出会转化为对外部资源产生直接技术后果的操作。
    • 现有基准的不足:作者称,以往基准在对等智能体通信(PAC)和子智能体委托(SAD)等入口的覆盖存在缺失或仅有部分覆盖,对资源耗尽(RE)等技术后果的覆盖也不均衡,且固定测试集难以适应模型、工具与威胁的持续演进。
    • 核心观察与视角:作者认为,单一入口可能引发多种技术后果,同一后果也可经由不同路径产生,仅从攻击技术本身无法完全刻画风险,需要将入口、智能体中介路径与直接技术后果解耦表征。
    • 威胁模型设定:作者设定了间接提示注入(IPI)威胁模型,重点关注非恶意用户任务下由非受信工作空间内容诱发的运行时风险:
      • 攻击者目标:通过在工作空间资源中植入恶意内容诱导智能体执行非预期操作,产生机密性、完整性或可用性层面的技术后果。
      • 攻击者知识与能力:攻击者仅能放置或篡改智能体可访问的非受信工作空间内容,不能修改系统指令、模型参数、Harness 实现或验证组件,也不能直接调用工具或伪造执行证据。
      • 受害系统:受害系统为完整的模型与 Harness 组合系统,所有有害后果必须通过模型与 Harness 的实际交互执行产生。
    • 论文提出的解决方案:论文提出了 EvoRiskBench 基准与 EP–Path–EF 框架,结合闭环生成重放工作流与基于 Windows 容器及 ETW 事件的独立验证平台,构建了 450 个可执行对抗任务。
  2. 有哪些相关研究?

    论文梳理了工作空间智能体、智能体安全基准与演化评测三类相关工作,定位自身为覆盖全流程入口与直接后果的基准。

    论文从工作空间智能体、智能体安全基准与演化评测构建三个方向梳理了相关研究,并对比了现有基准的覆盖情况。

    • 工作空间智能体系统
      • 工具使用与界面交互工作:Toolformer(Schick 等,2023)与 ReAct(Yao 等,2023)研究了大模型调用 API 工具的交互机制;AndroidWorld(Rawles 等,2025)与 WebArena(Zhou 等,2024)将交互拓展到移动系统与网页界面。
      • 工作空间智能体形式化:SWE-bench 系列(Jimenez 等,2024;Zhang 等,2025b)将工作空间智能体定义为在包含代码、文件、外部服务和持久状态的环境中执行多步任务的系统,其运行时行为由模型与 Harness 共同决定。
    • 智能体安全基准与运行时风险覆盖
      • 显式有害任务与提示注入基准:AgentHarm(Andriushchenko 等,2025)评测显式有害多步任务;AgentDojo(Debenedetti 等,2024)、InjecAgent(Zhan 等,2024)和 WASP(Evtimov 等,2025)研究工具使用环境下的间接提示注入;ASB(Zhang 等,2025a)涵盖记忆投毒与后门。
      • 轨迹与可执行环境安全基准:AgentHazard(Feng 等,2026a)与 AgentS4D(Zhou 等,2026)强调执行轨迹与全生命周期风险;AgentCanary(Li 等,2026b)在可执行环境中评测自主智能体安全;LASM(Chu,2026)提出了分层攻击面模型。
      • 对比分析与不足:作者指出,相比已有基准(Table 1),以往工作在对等智能体通信(PAC)和子智能体委托(SAD)等入口覆盖较少,在资源耗尽(RE)等后果上覆盖不均衡。
    • 演化基准与对抗样本构建
      • 动态评测与对抗红队:Chen 等(2025)综述了数据污染下的动态评测;Wei 等(2025)研究了攻击智能体的迭代演变;GPT-Red(Wallace 等,2026)利用自博弈发现跨模型与 Harness 的提示注入漏洞。
      • 自动化风险探索:Vera(Feng 等,2026b)利用执行反馈引导后续可执行用例构建与证据验证。
    • 基线方法与基准:论文在 Table 1 中选取了 AgentHarm、AgentDojo、InjecAgent、ASB、Vera、AgentHazard、AgentS4D、AgentCanary 共 8 个代表性基准,系统对比了各基准在 9 类风险入口与 5 类风险后果上的可执行覆盖情况。
    • 本文定位:作者将 EvoRiskBench 定位为基于 EP–Path–EF 框架、采用闭环执行反馈生成并由系统级证据独立验证的演化基准,专注于间接提示注入诱发的工作空间运行时风险。
  3. 论文如何解决这个问题?

    论文提出 EP–Path–EF 框架与生成-重放-提炼工作流,结合容器隔离与 ETW 事件实现自动化用例构建与独立结果验证。

    论文提出了 EvoRiskBench 基准框架,核心是由风险入口(EP)、智能体中介路径(Path)和技术后果(EF)构成的 EP–Path–EF 运行时风险表征体系,并配合闭环生成提炼流程与容器化独立验证平台。

    运行时风险形式化与分类体系

    • 形式化定义:设风险入口集合为 EP = {ep1, …, ep9},风险后果集合为 EF = {ef1, …, ef5},测试用例要求验证恶意影响从特定入口输入,经智能体执行路径传播并产生目标后果: ep_i \xrightarrow{p_{M,H}(c)} ef_j 该公式表达了从初始入口到单跳技术后果的完整因果执行路径,其中执行路径 p_{M,H}(c) 由智能体可见轨迹与外部系统运行时证据共同提取得到。
    • 9 类风险入口(EP):基于分层攻击面划分(Table 2),包括记忆与检索层面的会话记忆(SM)和知识检索(KR);工具与执行层面的命令执行(CE)、文件 I/O(FIO)和网络访问(NA);多智能体协作层面的对等智能体通信(PAC)和子智能体委托(SAD);智能体生态层面的 MCP 服务(MCPS)和技能调用(SI)。
    • 5 类单跳技术后果(EF):基于 CIA 属性划分(Table 3),涵盖机密性层面的信息泄露(ID);完整性层面的越权访问(UA)和数据篡改(DT);可用性层面的系统破坏(SD)和资源耗尽(RE)。后果仅关注智能体执行直接产生的第一跳可验证物理状态变化,下游连锁反应不改变主标签。
    • 分类体系评估:20 名受试者对 11 个代表性场景进行盲分类,EP 的 Fleiss' kappa 为 0.904,EF 为 0.723(附录 A.1)。

    可执行用例的生成、重放与反馈提炼

    • 规则与经验引导生成:用例生成器接收规则规范与经验知识库,为指定的 (ep_i, ef_j) 组合构建包含正常用户任务、对抗载荷、可执行环境状态和后果验证器的候选用例。
    • 三重重放验证机制:生成的候选用例先经完整性校验并冻结,随后在固定基线环境下执行 3 次独立重放。当至少 2 次重放成功(即载荷被触达、攻击动作被执行且后果经独立验证)时,该用例才被正式采纳。
    • 闭环证据提炼:未通过重放标准的候选用例不直接丢弃,其执行轨迹与失败诊断被汇总为失败证据反馈给生成器在同一 (ep_i, ef_j) 约束下迭代修正;稳定用例则提炼为成功经验沉淀至知识库中。
    • 固定评测集构建:通过该流程最终构建了覆盖 6 个业务场景(组织运营、数据分析、软件与 IT 运维、知识与内容、销售与客户服务、治理与合规)的 450 个可执行对抗任务。

    沙箱运行时执行与独立结果判定

    • 容器环境部署:每次执行均在基于固定镜像初始化的 Windows 进程隔离容器中进行,任务结束后容器销毁,防止状态残留。
    • 多源运行时证据采集:除收集智能体自身执行轨迹外,系统通过 Windows 事件跟踪(ETW)独立记录底层进程启动和网络连接事件,以及执行前后的文件与配置系统状态。
    • 独立后果验证判定:每个用例指定独立验证器。仅当外部状态或 ETW 系统证据证实目标技术后果切实达成时判定攻击成功;单纯的模型文本顺从或未生效的有害尝试均不计为攻击成功。
  4. 论文做了哪些实验?

    论文评测 3 款模型与 3 款 Harness 构成的 9 种配置,整体 ASR 为 37.46%,模型间差异大于 Harness 间差异。

    论文在 9 种模型与 Harness 组合配置下开展了系统性实证评测。

    实验设置

    • 被测模型:GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5 共 3 款模型。
    • 被测 Harness:Codex CLI(版本 0.154.0)、Claude Code(版本 2.1.268)、OpenClaw(版本 2026.9.4)共 3 款系统;无人值守运行绕过了工具审批提示和 Codex CLI 内部沙箱,Codex 的智能体间通信采用 OpenAI Agents SDK 0.17.2 作为适配器。
    • 评测数据集:EvoRiskBench 固定的 450 个可执行对抗任务,涵盖 6 个业务场景,对应 9 类 EP 与 5 类 EF 的组合。
    • 评测指标:攻击成功率(ASR,达成攻击目标且后果经验证的比例)、任务成功率(TSR,遭受注入时正常用户任务的完成比例)、伤害评分(HS,AI 裁判给出的 0–10 分轨迹伤害等级)。
    • 评审与验证方式:攻击成功由基于用例定义的状态检查与 ETW 进程/网络事件验证器判定;HS 由固定提示词的 AI 裁判(基于预定义打分标准与系统证据)给出结构化评分。
    • 执行环境与规模:在独立的 Windows 进程隔离容器中进行单次无污染运行,9 组配置各运行 450 个用例,共计 4,050 次攻击执行。

    主结果

    据 Figure 2 与 Table 4,9 种 Model × Harness 配置在 450 个用例上的评测结果如下:

    表格较宽,可左右滑动

    模型HarnessASR (%)成功用例数TSR (%)
    DeepSeek-V4-Pro-0813Codex68.44%308/45069.33%
    DeepSeek-V4-Pro-0813OpenClaw56.44%254/45062.89%
    GPT-5.6 SolClaude Code52.44%236/45077.33%
    DeepSeek-V4-Pro-0813Claude Code51.56%232/45072.22%
    GPT-5.6 SolCodex50.00%225/45068.89%
    GPT-5.6 SolOpenClaw44.89%202/45063.11%
    Claude Opus 5Claude Code6.67%30/45073.33%
    Claude Opus 5OpenClaw3.78%17/45030.00%
    Claude Opus 5Codex2.89%13/45026.89%
    • 智能体普遍存在运行时脆弱性:4,050 次执行中共有 1,517 次达成攻击目标,全配置整体 ASR 为 37.46%,且使用 GPT-5.6 Sol 或 DeepSeek-V4-Pro-0813 的 6 种配置中有 5 种 ASR 达到或超过 50%(Finding 1)。
    • 模型对 ASR 的影响大于 Harness:DeepSeek-V4-Pro-0813、GPT-5.6 Sol 与 Claude Opus 5 的模型聚合 ASR 分别为 58.81%、49.11% 和 4.44%,模型间差距达 54.37 个百分点,而 Harness 聚合 ASR 的差距仅为 5.41 个百分点;作者指出 Claude Opus 5 的低 ASR 部分源于其网络安全防御机制主动拒绝或中断操作(Finding 2)。
    • Harness 影响具有模型依赖性:DeepSeek-V4-Pro-0813 在 Codex 与 OpenClaw 下的 ASR 高于 GPT-5.6 Sol,但在 Claude Code 下 GPT-5.6 Sol 的 ASR 略高(52.44% 对 51.56%)(Finding 2)。

    低总 ASR 下的高风险细分组合分析

    • 低 ASR 掩盖局部高风险:Claude Opus 5 跨 Harness 总 ASR 为 4.44%,但在网络访问到系统破坏(NA–SD)组合上的 ASR 达到 56.67%(17/30),在 Claude Code 下该组合达到 100%(10/10)(Finding 3)。
    • 入口与后果维度的风险聚集:在入口层面,MCP 服务(MCPS)的平均 ASR 最高,达到 61.78%;在后果层面,信息泄露(ID)的平均 ASR 最高,达 41.60%,且在 DeepSeek-V4-Pro-0813 搭配 Codex 下达到 84.44%(Figure 2、Finding 3)。
    • 全部类别均出现高危单元格:9 个风险入口和 5 个风险后果分类,均至少在一个具体的 EP–EF 单元格中出现 100% 的 ASR(Figure 2、Finding 3)。

    攻击下的正常任务效用与伤害严重度评测

    • 攻击下的任务完成率(TSR):全体配置在间接提示注入下的平均 TSR 为 60.44%(Table 4);Claude Code 的跨模型平均 TSR 最高(74.30%),Codex 为 55.04%,OpenClaw 为 52.00%。
    • 模型在不同 Harness 下的效用差异:Claude Opus 5 的平均 TSR 为 43.41%,但在 Claude Code 下为 73.33%,在 OpenClaw 和 Codex 下分别降至 30.00% 和 26.89%;GPT-5.6 Sol 与 DeepSeek-V4-Pro-0813 的平均 TSR 分别为 69.78% 和 68.15%(Table 4)。
    • AI 裁判的伤害评分(HS):入口层面 MCPS 的平均伤害分最高(4.31 分),文件 I/O(2.06 分)与子智能体委托(2.14 分)最低;后果层面信息泄露(3.96 分)与越权访问(3.62 分)最高,资源耗尽(2.10 分)最低(Figure 3)。大多数分类均值在 2 到 4 分之间,作者指出这反映出有害行为多未成功或仅部分实现。

    其他消融与分析

    • 分类体系评估:20 名受试者评定 EP 与 EF 的清晰度得分为 4.24 与 4.51,差异性得分为 3.91 与 4.18,盲测一致性系数分别为 Fleiss' kappa = 0.904 与 0.723(Table 5、Table 6)。
    • 不同配置下的伤害评分对比:DeepSeek-V4-Pro-0813 搭配 Codex 在信息泄露(ID)上的平均 HS 达到 6.6 分(Figure 5),而在 Claude Opus 5 搭配 Claude Code 下所有后果类别的平均 HS 均在 1.1 至 1.7 分之间(Figure 5)。
  5. 有什么可以进一步探索的点?

    作者指出基准仅针对 IPI 且沙箱简化了生产环境,实验覆盖了 3 款模型与 3 款 Harness 的 450 个用例。

    作者指出的局限与后续方向

    • 攻击威胁模型范围:评测目前集中于间接提示注入(IPI)攻击,作者指出未来的工作将把威胁模型拓宽到 IPI 之外(Section 5)。
    • 工作空间环境复杂度:评测使用了沙箱化的工具、服务和状态,作者指出这只是对生产工作空间的近似,可能无法完全捕捉真实生产环境的复杂性(Section 5)。
    • 外部服务与工作空间异构性:作者计划在未来使用更逼真的外部服务、异构工作空间以及长程运行场景来评估 EvoRiskBench(Section 5)。
    • 评测工件的安全性与可复现性检查:基准用例和评测平台需在完成工件安全性与可复现性检查之后再行公开(Abstract、Section 5、Reproducibility Statement)。

    实验覆盖范围

    • 被测模型与 Harness:实验覆盖 3 款模型(GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5)和 3 款 Harness(Claude Code 2.1.268、OpenClaw 2026.9.4、Codex CLI 0.154.0),共组合为 9 种系统配置。
    • 任务与场景规模:评测集固定为 450 个可执行对抗任务,覆盖 6 个业务场景,每种配置执行 450 次,合计完成 4,050 次攻击执行。
    • 执行环境设置:所有任务均在基于固定镜像的 Windows 进程隔离容器中单次运行,未开启 Codex CLI 内部沙箱,且跳过了工具审批提示。
    • 未报告的信息:论文未报告用例生成与提炼阶段具体使用了哪款模型和 Harness 作为固定基线,未报告 AI 裁判采用的具体模型版本,也未报告主评测中每个用例在同一配置下的重复运行次数与方差。
  6. 总结一下论文的主要内容

    论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
    • 定位与目标:EvoRiskBench 是针对工作空间智能体在间接提示注入(IPI)下的运行时安全风险提出的可执行演化评测基准,旨在解决传统评测对智能体协作入口覆盖不全以及难以系统捕获实际执行后果的问题。
    • 核心方法框架:提出 EP–Path–EF 体系,将 9 类风险入口与 5 类单跳技术后果通过执行路径相链接;采用“生成-冻结-重放-提炼”闭环流程构建 450 个对抗任务,并在独立 Windows 容器中结合 ETW 进程与网络事件进行客观后果验证。
    • 主评测结果:在 3 款模型与 3 款 Harness 构成的 9 种配置(共 4,050 次执行)中,整体攻击成功率(ASR)为 37.46%,整体任务成功率(TSR)为 60.44%。
    • 最高风险配置:DeepSeek-V4-Pro-0813 搭配 Codex 的 ASR 达到 68.44%,反映出当前工作空间智能体在面对非受信输入时容易被利用产生实际破坏,作者指出仅配置工作空间不足以保证安全自主执行。
    • 模型与 Harness 效应:模型间 ASR 差距达 54.37 个百分点(DeepSeek-V4-Pro-0813 为 58.81%,Claude Opus 5 为 4.44%),远大于 Harness 间 5.41 个百分点的差距,且 Harness 的防护效果依赖于所配模型。
    • 作者结论与启示:作者认为任务执行能力强的智能体可能伴随更高的攻击易感性,且低总 ASR 容易掩盖局部高风险(如 Claude Opus 5 在网络访问导致系统破坏上的 ASR 达 56.67%),因此必须将模型与 Harness 作为整体系统协同开展运行时安全防御。
阅读原文arxiv.org