跳到正文
原文
论文追踪· arXiv:2610.04378·本站收录 · 原文发表 精选关注度39

COPEX:面向 MCP 智能体的受控攻击评测基准发布

COPEX

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

COPEX 在固定协议栈下评测 9 款模型的 MCP 攻击抵抗力,平均 ASR 为 64.4%,部分攻击在模型视野外发生。

问题
现有 MCP 安全评测多针对已部署产品或端到端任务完成度,将模型自身脆弱性与外围护栏、编排逻辑及协议底层故障混淆,难以隔离模型对不信任上下文的处理能力。
方法
固定智能体循环、工具环境与执行预算,仅改变决策模型,在模型/智能体、客户端、服务端/工具和传输层 4 个入口表面构建 25 种攻击共 125 个场景,结合执行轨迹断言与语义裁判判定结果。
实验与结果
9 款模型在 3,375 次试验中的宏平均 ASR 为 64.4%;结合输入与上下文扫描使 8 种攻击子集平均 ASR 相对无防御降低 49.6%,但对模型视野外的重定向攻击无效。
局限与可以继续做的
次级研究每个变体仅运行一次;15 种攻击依赖 LLM 裁判的决策边界;泛化性受限于 25 种攻击类型;ASR 衡量投递后的易受性而非现实可利用性;被测模型涵盖 7 款 API 模型与 2 款本地开源模型。
实验设置Claude Opus 4.7、Claude Sonnet 4.6 等 · COPEX · ASR
模型
Claude Opus 4.7Claude Sonnet 4.6GPT-5.5GPT-5 MiniGPT-4.1Gemini 3.1Grok 4.3Llama-3.2:3bQwen-2.5:3b
基准
COPEX
指标
ASR
AI 导读和推荐理由全文 189 字

COPEX 是面向 MCP 系统的受控评测基准,通过固定周边智能体栈、替换工具选择模型,区分模型对对抗上下文的易感性与系统层暴露。基准含25类攻击、125个场景,在9个模型和3375次试验中报告平均成功率64.4%。部分客户端或传输层结果发生在模型观察或控制范围之外,不能简单解释为模型本身失守。作者报告,在8类攻击的防御子集中,组合扫描相对无防御设置降低平均成功率49.6%。

推荐理由论文用固定 Agent 栈、只替换工具选择模型的方式,把 MCP 攻击按四个入口面拆开评测,便于区分模型易感性与底层系统失陷。

深度解读

6 个问题,约 6,200 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    评估 MCP 智能体时需解耦模型可见上下文引发的脆弱性与底层协议妥协。

    模型上下文协议(MCP)系统中对抗性上下文的评估难以将模型自身脆弱性与底层系统破坏解耦。

    • MCP 系统扩展了对抗性影响的入口:在启用 MCP 的智能体中,模型的决策不仅依赖用户指令,还依赖主机和客户端组装的上下文,包括服务端发布的工具模式(schemas)和工具调用返回的结果。
    • 现有基准混淆了模型表现与系统组件:作者指出,现有基准多评估已部署的智能体产品,测试结果受系统提示词、护栏、界面与编排层影响,难以泛化至其他部署;同时使用任务完成度作为核心指标可能掩盖中间步骤中的受攻击行为,或因系统层故障导致误判。
    • 观察边界内外的攻击机制存在本质差异:作者观察到,攻击可能进入模型可见的上下文并左右其决策,也可能在模型观察边界之下运作(如客户端、服务端与传输层行为),使系统在独立于模型响应的情况下受损。
    • 威胁模型:
      • 攻击者目标:诱发不安全的工具调用、泄露敏感信息、促使模型采纳被篡改的内容,或破坏客户端、服务端与传输层行为。
      • 攻击者知识与能力:假设攻击者无法修改模型权重和固定的系统指令,但可控制模型/智能体、客户端、服务端/工具或传输层四个入口表面之一。
      • 受害系统:由大语言模型作为 MCP 客户端、在受控场景中运行的智能体系统及其底层协议栈。
    • 论文的解决方案:作者提出了 COPEX 基准,通过固定外围智能体技术栈、仅改变负责工具选择的模型,评估 4 类入口表面上的 25 种攻击类型,并结合轨迹断言和语义判定分别度量攻击结果。
  2. 有哪些相关研究?

    已有研究多聚焦端到端产品或特定注入,缺少固定协议栈下的多层受控基准。

    论文在引言和相关工作部分将已有研究划分为以下几个方向:

    面向使用工具的智能体的安全基准

    • AgentDojo(Debenedetti et al., 2024)与 InjecAgent(Zhan et al., 2024):评测执行合法用户任务的智能体面对间接提示词注入时的安全性。
    • ASB(Zhang et al., 2025b):将智能体安全评测范围拓展至系统提示词、用户输入、工具和记忆模块。
    • SHADE-Arena(Kutasov et al., 2025):评测智能体在完成良性任务的同时追求隐蔽恶意目标的行为。作者指出,这些基准并非围绕 MCP 的攻击入口表面构建,其评测结果主要反映端到端智能体系统的表现,而非固定 MCP 技术栈下的模型行为。

    MCP 协议安全分析与基准

    • MCP 安全威胁系统分析(Guo et al., 2025; Hou et al., 2025; Hasan et al., 2025; Rostamzadeh et al., 2026):系统考察涉及客户端、服务端、工具及传输层的协议安全威胁。
    • MCPTox(Wang et al., 2025):研究真实 MCP 服务端中的工具投毒攻击。
    • MCP-Universe(Luo et al., 2025)、MCP-SafetyBench(Zong et al., 2025)、MSB(Zhang et al., 2025a)与 MCPSecBench(Yang et al., 2025):分别测试多服务端环境下的任务完成度、攻击下的不安全行为、端到端 MCP 工作流攻击,以及针对 Cursor 和 Claude Desktop 等已部署 MCP 产品的安全表现。

    基线对比与研究定位

    • 对比基线与维度(据 Table 1):论文对比了 MCPTox(3 种攻击类型、工具调用判定)、MSB(12 种攻击类型、执行判定)、MCPSecBench(17 种攻击类型、语义判定)、MCP-SafetyBench(20 种攻击类型、执行判定)与 COPEX。
    • 本文定位差异:作者指出,COPEX 在实验控制上固定了外围智能体技术栈而仅替换工具选择模型,覆盖 25 种攻击类型并引入传输层攻击测试;在度量上结合了确定性执行轨迹断言与语义评估裁判。
  3. 论文如何解决这个问题?

    固定智能体技术栈,覆盖 4 类入口表面的 25 种攻击并采用双轨判定机制。

    COPEX 通过固定外围智能体技术栈、仅替换决策模型的方式构建受控评测环境,并结合确定性轨迹断言与语义裁判度量 COPEX(COntext Provider EXploitation)基准中的多层攻击效果。

    问题设定与观察边界

    • 上下文形式化表达:在第 t 轮交互中,主机与客户端组装模型可见上下文,模型据此选择动作: ct = (h, p, St, R≤ t),   at ∼ M(· ∣ ct) 其中 h 为固定系统指令,p 为用户任务,S_t 为该轮可用的工具模式集合,R_≤t 为截至该轮返回的工具响应。
    • 观察边界划分:上下文 c_t 构成了模型的观察边界。客户端状态、服务端行为和传输状态可能在不进入 c_t 的情况下改变执行流程;COPEX 按入口表面记录结果,避免将底层系统妥协归因为模型脆弱性。
    • 四类攻击入口表面:包括模型/智能体(ma,用户任务与上游内容)、客户端(cl,解析、元数据与上下文组装)、服务端/工具(st,工具模式、响应与服务端行为)和传输层(tr,在途数据、端点解析与连接状态)。

    执行环境与防御机制

    • 技术栈配置:环境包含 16 个 MCP 服务端,暴露 75 个工具与 7 个资源,通过标准 I/O 和 HTTP 通信,使用 Streamable HTTP 与 Docker 隔离环境支持代理、DNS 重绑定和远程访问场景。默认采用 ReAct 推理架构,温度设为 0,交互上限为 10 轮,输出上限为 4,096 token。
    • 四种防御模式:包括无扫描、输入扫描、上下文扫描,以及两者串联的组合扫描。扫描器由不具备工具调用权限的护栏模型承担,返回 ALLOW 或 BLOCK。
    • 拦截处理逻辑:被拦截的用户任务终止试验并标记为 DETECTED;被拦截的工具模式从目录中剔除后试验继续;被拦截的工具响应替换为结构化错误信息。工具模式仅在初次注册时扫描,后续变更不予复检。

    攻击场景构建

    • 场景规模与结构:定义了 25 种攻击类型,每种类型设计 5 个场景变体(共 125 个可执行场景)。变体保持相同的攻击机制和安全目标,变换业务场景参数或攻击阶段,涵盖金融、DevOps、医疗、合规等领域。
    • 构建与校验流程:研究人员定义攻击能力与判定标准并编写首个变体,借助大语言模型生成其余变体草稿,再经人工修改、执行与检查;仅当执行轨迹成功触发目标机制且判定结果匹配设定标准时才予以保留。

    判定机制与评测指标

    • 双轨判定设计:10 种可通过工具调用、协议事件或环境状态判定的攻击采用程序化确定性断言;15 种依赖模型回复含义或目标达成的攻击由固定的 Claude Haiku 4.5 依据场景准则和完整轨迹给出二元判定。
    • 攻击成功率计算:模型 M 在攻击类型 i 上的 ASR 计算方式为对 5 个变体和每个变体 N 次重复运行的结果取算术平均: ASR(M, i) = 1/5N ∑v=15 ∑n=1N yM,i,v,n 以此确保不同变体和重复运行获得同等权重。
  4. 论文做了哪些实验?

    9 款模型平均 ASR 达 64.4%,扫描防御具表面局限性且判定方式左右测得指标。

    实验设置

    • 被测模型:共评测 9 款模型,包括 7 款通过 API 调用的托管模型(Claude Opus 4.7、Claude Sonnet 4.6、GPT-5.5、GPT-5 Mini、GPT-4.1、Gemini 3.1、Grok 4.3),以及 2 款在配有 NVIDIA RTX 3080 Ti 工作站上通过 Ollama 本地运行的开源模型(Llama-3.2:3b、Qwen-2.5:3b)。
    • 场景与试验规模:包含 25 种攻击类型,每种 5 个变体(共 125 个场景)。主基准中每个模型-场景重复 3 次,每款模型测试 375 次试验,全基准共计 3,375 次试验。
    • 基线与对比配置:以无防御 ReAct 为默认基线;在次级实验中对比了 Reflexion 架构、4 种扫描防御模式,以及确定性与语义两类判定机制。
    • 评价指标:采用攻击成功率(ASR),数值越低代表防御能力越好;不同配置间差异以百分点(pp)或相对降幅报告。
    • 评测方式与重复次数:10 种确定性攻击由代码谓词检验轨迹判定,15 种语义攻击由 Claude Haiku 4.5 独立打分;主基准 n=3,次级实验 n=1。

    主结果

    表格较宽,可左右滑动

    模型平均 ASRma 表面cl 表面st 表面tr 表面
    Opus-4.744.3%33.3%38.1%44.2%73.3%
    Sonnet-4.645.1%38.3%37.1%47.9%62.2%
    GPT-5.567.5%75.0%66.7%61.8%80.0%
    Gemini-3.174.1%61.7%95.2%64.8%75.6%
    Grok-4.381.6%75.0%98.1%73.9%80.0%
    全模型宏平均64.4%58.3%67.7%62.5%71.4%

    注:据 Table 3。表中展示了整体 ASR 最优与最差模型及代表性模型;省略了 Qwen-2.5:3b(平均 61.1%)、Llama-3.2:3b(平均 64.5%)、GPT-5 Mini(平均 68.0%)与 GPT-4.1(平均 73.1%)的独立行。

    • 模型间脆弱性差异明显且无全能模型:作者指出各模型表现跨度较大,且没有模型在所有 4 个表面均保持较低 ASR;即使整体表现最好的模型在传输层也出现较高失陷率,而部分模型在客户端表面失陷率超过 95%。
    • 攻击威胁延伸至非提示词表面:作者指出模型/智能体表面并非唯一受威胁区域,客户端与工具响应等表面的攻击成功率相当或更高。
    • 单一总分排名的局限:作者认为传输层包含部分直接在模型视野外成功的攻击(如重定向),因此单一总分排名难以体现真实模型能力,应按具体协议层分别呈现。

    判定机制对评测结果的影响

    • 测试设置:在 4 款模型上选取覆盖 4 类表面的 6 种攻击类型,在完全一致的配置下分别通过确定性轨迹谓词与 Claude Haiku 4.5 语义评判打分(Table 4, Table 11)。
    • 实验结果:确定性断言下的宏平均 ASR 为 77.1%,而语义评判下升至 83.3%,相差 6.3 个百分点;Grok-4.3 增加 13.3 个百分点(从 80.0% 升至 93.3%),Sonnet-4.6 与 Gemini-3.1 均增加 3.3 个百分点,GPT-5.5 增加 5.0 个百分点。
    • 作者解读:确定性断言仅检验狭窄的特定轨迹事件,而语义评判能捕捉未触发现成断言但符合攻击目标的响应行为,表明 ASR 结果部分取决于判定的实现方式。

    扫描防御的覆盖范围与边界

    • 测试设置:以 Claude Haiku 4.5 为护栏模型,在 4 款模型上针对 8 种攻击子集测试无扫描、输入扫描、上下文扫描及组合扫描(Table 5, Table 9)。
    • 实验结果:无扫描宏平均 ASR 为 81.6%,输入扫描降至 48.4%,上下文扫描降至 57.6%,组合扫描降至 41.1%(降低 40.5 个百分点,相对降幅 49.6%);但 MCP rebinding 攻击在所有 4 种防御配置下的 ASR 均为 100%。
    • 作者解读:扫描机制能降低进入模型视野的内容威胁,但无法干预模型观察边界之外的传输层状态或撤销已发生的工具执行,表明防御必须多层协同。

    推理架构对比(ReAct 与 Reflexion)

    • 测试设置:固定模型、工具、攻击子集(6 种攻击)与执行预算,对比 ReAct 与增加自我反思批评的 Reflexion 架构(Table 6, Table 10)。
    • 实验结果:Reflexion 使 4 款模型的宏平均 ASR 从 86.2% 降至 82.5%(降低 3.7 个百分点);其中 Sonnet-4.6 降低 9.9 个百分点,GPT-5.5 降低 5.3 个百分点,Gemini-3.1 保持不变,Grok-4.3 增加 0.5 个百分点。
    • 作者解读:反思机制的效果因底层模型而异,未能提供一致的防御增益,因此显式自我反思本身不能直接作为独立安全防御。

    其他消融与分析

    • Prefill 与 Decode 比例:单次试验中 Prefill token 数量为 Decode token 的 2.6 至 24.5 倍(Figure 4)。
    • 评测 API 支出:7 款托管模型各 375 次试验的总 API 费用为 59.75 美元,单模型成本在 2.77 美元至 21.53 美元之间(Figure 4)。
    • 工具遮蔽攻击易受性:Tool shadowing 在 9 款模型上的平均 ASR 为 0.7%,仅 Qwen-2.5 为 6.7%,其余 8 款模型均为 0.0%(Table 7, Table 8)。
    • 工具仿冒在不同判定下的差异:Package Squatting (Tool) 在确定性检查下 4 款模型 ASR 均为 60.0%,而在语义评判下均升至 100.0%(Table 11)。
  5. 有什么可以进一步探索的点?

    次级研究样本量少且部分依赖 LLM 裁判,实验覆盖 9 款模型与 25 种攻击。

    作者指出的局限与后续方向

    • 次级实验样本规模有限:作者在 Section 6 指出,防御和推理架构等次级研究中每个场景变体仅进行了一次运行,所得的数据降幅与判定差异属于点估计,应视作指示性趋势而非精确值。
    • 部分攻击依赖裁判模型的决策边界:作者在 Section 6 指出,基准中共有 15 种攻击类型依赖大语言模型裁判,其 ASR 反映的是裁判模型的判断边界,而非客观真实基准(ground truth)。
    • 攻击类型与变体覆盖受限:作者在 Section 6 指出,研究结论的泛化性受到当前所选取的 25 种攻击类型以及每种类型 5 个变体的范围限制。
    • 指标反映易受性而非现实可利用性:作者在 Section 6 指出,ASR 衡量的是攻击载荷送达模型后的脆弱程度,而现实环境中的实际可利用性还取决于攻击的普遍性、进入途径和实施成本。

    实验覆盖范围

    • 被测模型范围:实验覆盖了 7 款商用 API 模型(Claude Opus 4.7、Claude Sonnet 4.6、GPT-5.5、GPT-5 Mini、GPT-4.1、Gemini 3.1、Grok 4.3)与 2 款本地开源模型(Llama-3.2:3b、Qwen-2.5:3b)。
    • 服务端与工具规模:实验环境包含 16 个 MCP 服务端,提供 75 个工具与 7 个资源,通过标准 I/O 及 HTTP 连接。
    • 攻击套件与场景设置:覆盖 4 个入口表面的 25 种攻击类型,共 125 个场景变体;主基准每组重复 3 次(共 3,375 次试验)。
    • 次级对比范围:防御实验在 4 款模型上针对 8 种攻击评估了 4 种扫描模式;架构对比与判定机制对比均在 4 款模型上针对 6 种攻击开展。
    • 环境运行预算:所有基准试验统一使用 ReAct 框架,采样温度设为 0,交互轮数上限为 10 轮,生成长度上限为 4,096 token。
  6. 总结一下论文的主要内容

    COPEX 隔离评测了 9 款模型在 4 个 MCP 入口表面下的脆弱性,平均 ASR 达 64.4%。

    COPEX 是一个针对模型上下文协议(MCP)智能体的安全评测基准,旨在评估大语言模型面对不同协议层对抗性上下文时的鲁棒性。

    • 要解决的核心问题:现有智能体安全基准多针对已部署产品或端到端任务完成度,将模型自身处理恶意上下文的能力与外围护栏、编排机制及底层协议破坏相混淆。
    • 方法设计要点:COPEX 固定外围智能体技术栈、执行预算与场景逻辑,仅改变负责工具选择的模型;设计了覆盖模型/智能体、客户端、服务端/工具和传输层 4 类入口表面的 25 种攻击类型(共 125 个场景),并结合确定性轨迹断言与语义裁判进行判定。
    • 模型易受性表现:在 9 款模型和 3,375 次试验中,全基准宏平均 ASR 为 64.4%;Opus-4.7 表现相对最好(ASR 为 44.3%),Grok-4.3 最差(ASR 为 81.6%),且没有模型在所有 4 个表面均保持较低失陷率(Table 3)。
    • 防御机制有效范围:在 8 种攻击子集上,输入与上下文组合扫描使 4 款模型的平均 ASR 相对无扫描降低 49.6%,但对在模型观察边界之外运作的传输层重定向攻击(ASR 均为 100%)完全无效(Table 5, Table 9)。
    • 判定机制与架构敏感性:在 6 种攻击的配对评测中,语义评判得出的宏平均 ASR 比确定性断言高出 6.3 个百分点(Table 4);而 Reflexion 反思架构仅使 ASR 降低 3.7 个百分点且在不同模型间效果不一(Table 6)。
    • 作者结论与启示:作者指出,评测 MCP 安全必须区分模型对可见对抗上下文的响应与底层协议破坏,单一的整体排名无法反映真实防御能力,防御措施需在各个协议表面协同部署。
阅读原文arxiv.org