COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构
Securing Computer-Use Agents Against Branch Steering Attacks
COBRA 通过事前分支能力约束与代理拦截,在 STEER-Bench 上将攻击成功率降至 0% 并保留 97% 良性效用。
攻击者遵循 Kerckhoffs 假定,通过操纵第三方网页内容或受损 MCP 工具输出,在不注入新指令的前提下操纵运行时数据破坏数据流完整性(DFI),驱使已授权分支走向危险结果;无法检查或修改已提交计划及解释器受保护状态。
- 动态网页交互迫使计算机使用智能体在执行计划中引入条件分支,攻击者无需注入新指令即可通过构造恶意页面内容或工具响应驱使智能体走向危险分支,导致数据流完整性失效。
- 提出 COBRA 架构,在观察环境前由受信任规划器生成带分支能力约束的程序,运行时由分支解析中枢验证条件并由网络与 MCP 代理对传出请求执行确定性拦截。
- 在 STEER-Bench 上完整 COBRA 实现 0% 攻击成功率并保留 97% 良性效用;在 4 个外部安全基准的 1,259 个威胁模型内攻击中实现 0% 攻击成功率。
- 无法约束未体现在网络请求中的纯 GUI 敏感数值,无法检测自由文本语义与服务端隐藏恶意效果,且端点级防御依赖网站所有者发布与维护机器可读描述。
- 模型
- gpt-5UI-TARS-1.5-7Bclaude-sonnet-5kimi-k2.5OpenCUA-7BOpenCUA-32B
- 基准
- STEER-BenchOS-HarmWASPMCPToxMCPSecBenchOSWorld-MCPWebArena
- 指标
- ASRbenign utilityutility under attackpass@5task completion
剑桥大学等机构的研究者提出 COBRA,一种针对计算机使用 Agent(CUA)分支引导攻击的系统级防御架构。作者指出,Dual-LLM 模式虽能保证控制流完整性,但在图形环境中计划必须按运行时网页内容分支,攻击者可构造不可信数据把 Agent 推向预先批准的危害路径,而无需注入新指令。为此作者构建 STEER-Bench,覆盖 9 个领域 101 个任务,测得分支引导攻击对标准 CUA 的攻击成功率为 94.4%,对原版 Dual-LLM 为 89.5%。COBRA 在规划阶段为每个分支预先固定目的地、端点和工具参数约束,由 Branch Resolution Hub 校验运行时分支与参数,并在 HTTP 与 MCP 代理处强制执行。代码已开源于 GitHub。
推荐理由论文把分支引导攻击归为数据流完整性问题,并给出在 HTTP 与 MCP 边界施加分支级约束的架构,附开源代码与多基准结果。
深度解读
这篇论文试图解决什么问题?
动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。
论文试图解决计算机使用智能体(CUA)在动态网页交互中因分支执行而暴露的数据流完整性(DFI)缺失及分支转向攻击(branch steering attacks)问题。
- 动态交互迫使计划引入分支:现代 CUA 需与图形用户界面(GUI)及第三方 Web 工具(如 MCP)交互,由于网页布局和状态在渲染前无法获知,控制流与运行时数据深度交织,静态离线计划必须演化为对预期运行时状态的分支程序。
- 现有防御缺乏数据流完整性保护:现有的 Dual-LLM 架构通过离线特权规划器(P-LLM)固定执行路径、隔离模型(Q-LLM/Q-VLM)处理不可信内容来实现控制流完整性(CFI),但无法防止不可信数据操纵执行哪个预授权分支或决定动作参数。
- 分支转向攻击破坏数据流完整性:攻击者无需注入新的显式指令,仅通过操纵不可信页面内容满足既有分支条件或绑定参数,即可驱使智能体走向对攻击者有利的危险预授权分支。
- 图形原语缺乏固有语义:相同的鼠标点击在图形界面上可能对应无害标签切换或不可逆的高危操作,静态计划无法在运行时辨别,导致单纯依靠离线授权动作路径不足以防范攻击。
- 威胁模型:
- 目标:违反控制流完整性(CFI,诱导智能体执行未批准计划的动作)或违反数据流完整性(DFI / 分支转向,提供对抗性数据驱动已授权分支走向攻击者选定结果)。
- 知识:攻击者遵循 Kerckhoffs 假定,知晓防御架构与强制执行机制,但无法检查、修改或适应已提交的执行计划及解释器的受保护状态。
- 能力:攻击者无需取得完整服务器权限,即可操纵执行中访问的第三方服务渲染或返回的不可信内容(广告、评论、列表、消息、附件等);在未批准或受损外部服务器上还可控制 MCP 工具描述与输出。
- 受害系统:通过观察屏幕视觉内容、执行鼠标键盘动作并调用第三方 MCP 工具的计算机使用智能体。
有哪些相关研究?
梳理了 CUA 概率性防御、Dual-LLM 等系统级架构、MCP 安全及现有评测基准,指出 DFI 防御的缺失。
- 针对 CUA 的概率性防御
- 基于观测与动作的检测:Zhang et al. (2025b)、Aichberger et al. (2025) 与 Chen et al. (2025) 报告了恶意弹窗、图像补丁及细微文字注入对 CUA 的操纵;Yang et al. (2025) 与 Hu et al. (2025) 提出从观测或动作中识别攻击的检测方法,但作者指出这类方法依赖模型或分类器识别攻击的能力。
- MELON(Zhu et al., 2025):在工具使用智能体中通过掩码用户请求并重跑智能体对比工具调用以检测间接提示注入;作者指出该方法难以应用于实时 CUA,因为击键和点击难以反映预期任务,且桌面环境通常无法精确复现。
- 结构化系统级防御
- Dual-LLM 架构(Willison, 2023):通过隔离受信任规划与不受信任交互以抵御提示注入;后续工作在工具使用与多智能体系统中强制执行可执行计划、追踪数据溯源或隔离组件(Debenedetti et al., 2026; Costa et al., 2025; Zhong et al., 2025; Abdelnabi et al., 2026; Wu et al., 2025)。
- Progent(Shi et al., 2026):针对文本智能体中结构化工具调用强制执行由 LLM 生成的最小权限策略;作者指出其未覆盖 GUI 交互或原始 HTTP 请求。
- MCP 接口安全研究
- MCP 工具操纵与防御:Beurer-Kellner & Fischer (2025) 刻画了针对 MCP 工具定义与行为的攻击;MCPTox(Wang et al., 2026)与 MCPSecBench(Yang et al., 2026)评测工具投毒与批准后操纵;ETDI(Bhatt et al., 2025)通过身份验证与基于策略的访问控制绑定工具定义;作者指出这些工作主要将 MCP 作为独立接口研究,而本文防御结合了 MCP 调用与 Web 交互的任务。
- 安全与效用评测基准
- 现有基准评测维度:WASP(Evtimov et al., 2025)评测重定向智能体动作的 Web 提示注入;OS-Harm(Kuntz et al., 2025)评估系统级未授权行为;InjecAgent(Zhan et al., 2024)与 ASB(Zhang et al., 2025a)针对文本工具智能体;作者指出这些基准仅报告攻击对防御系统整体是否成功,未报告具体由哪个组件阻断。
- 基线方法与基准数据集
- 实验对比的基线方法为标准 ReAct 智能体以及 Foerster et al. (2026) 提出的 Vanilla Dual-LLM 系统;评测所用的基准与数据集包括作者构建的 STEER-Bench,以及外部基准 OS-Harm、WASP、MCPTox、MCPSecBench、OSWorld-MCP 与 WebArena。
- 作者对本文工作的定位:作者指出,既有系统级防御在静态任务中能保证控制流完整性,但在 CUA 的动态分支环境中缺乏数据流完整性;作者称 STEER-Bench 是首个系统评估分支转向攻击的基准,并提出了同时保证控制流与数据流完整性的系统级防御 COBRA。
- 针对 CUA 的概率性防御
论文如何解决这个问题?
提出 COBRA 架构,结合离线计划能力约束、运行时分支解析中枢及确定性 HTTP/MCP 代理拦截。
论文提出了 COBRA,一种为计算机使用智能体(CUA)同时提供控制流完整性(CFI)与数据流完整性(DFI)的系统级防御架构。COBRA 通过将受信任规划与不受信任交互分离,并在观察不可信数据前对执行分支施加事前能力约束,结合运行时中枢解析与网络/工具边界代理来消除分支转向攻击。
整体架构与信任边界划分
- 系统核心组件:COBRA 包含计划解释器、中心分支解析中枢(BRH)、确定性 HTTP 代理与 MCP 代理四大模块。
- 规划与交互解耦:特权规划器(P-LLM,实验采用 gpt-5)仅根据用户请求和批准的元数据生成带约束的执行程序;隔离模型(Q-VLM,实验采用 UI-TARS-1.5-7B)仅在沙箱中执行视觉感知并汇报观察结果,无法修改程序结构,以此确立 CFI。
- 边界拦截设计:防御拦截点设置在传出 HTTP 请求与 MCP 工具调用的边界而非 GUI 动作,因为单独的点击与击键无法从语义上确定其引发的实际操作。
计划生成与分支能力约束初始化
- 控制流提取与约束标注:确定性代码首先解析程序提取各分支结构、分支条件变量与目标;随后受信任注解调用利用请求和元数据,为每个分支赋予允许的目标、操作、请求字段与工具参数约束。
- 欠指定任务的主动澄清:若任务需要安全关键数值且请求未提供或未授权可信来源,COBRA 会在计划构建阶段向用户请求输入,该输入仅对当前请求可信;运行时不受信内容无法触发进一步的澄清提问。
- 描述元数据密码学锁定:用户批准的站点 sitemap 和 MCP 工具定义均使用 SHA-256 哈希进行密码学钉住;一旦上游发生任何改动,哈希失效并立即终止执行,防止工具投毒或地毯式撤换(rug pulls)。
运行时分支解析与多层级强制执行
- 分支条件验证与状态管理:Q-VLM 汇报感知结果时须符合预声明的输出类型(如数值或日期),格式异常会重试,信息不足则报错;解释器确定性评估分支条件后将选定分支和变量传给 BRH,BRH 验证参数是否符合约束;约束在嵌套分支中累加并在分支退出时重置父状态,防止权限跨分支泄露。
- HTTP 边界分级防御:
- 主机级强制执行(默认):在无站点 sitemap 时,代理依据用户请求及预设的常用基础设施/分析域名白名单限制请求,阻断未授权导航与跨域泄露。
- 端点级强制执行:在具备经批准的 sitemap 时,修改后的 ceLLMate 代理对请求方法、参数化 URL 路由及载荷字段值进行精确匹配与检查。
- MCP 边界校验:MCP 代理验证工具调用是否匹配经批准的版本、是否路由至受信任服务器(防止同名工具影子化),并校验工具参数是否满足当前分支约束。
融合规划与候选站点描述构建
- 多样本融合规划:针对规划器无法观察运行时环境导致的盲规划缺陷,受信任端并行生成 5 个不同策略的候选计划(偏好 MCP、直接交互、菜单路径、行动前检查、每步验证),并由一次受信任调用融合成一个保留替代路径与回退机制的单一分支程序。
- MESA 自动化辅助生成:针对多数网站未发布机器可读 sitemap 的问题,MESA 工具通过自动化抓取网站链接、表单与导航路径,由模型提议操作并生成候选 sitemap 与 MCP 工具定义,供服务所有者审查发布,最终由 COBRA 用户独立批准后作为受信任规划输入。
论文做了哪些实验?
在 STEER-Bench 及 4 个外部基准中将 ASR 降至 0%,在 OSWorld-MCP 上保留实用任务完成能力。
实验设置
- 被测模型:规划器(P-LLM)主要采用 gpt-5,交互感知模型(Q-VLM)本地部署 UI-TARS-1.5-7B;效用评估及消融实验中还测试了 Sonnet-5(claude-sonnet-5)、kimi-k2.5、OpenCUA-7B 与 OpenCUA-32B。
- 基准与数据集:
- STEER-Bench:涵盖 9 个真实领域、101 个端到端任务、4 种页面布局家族,构建了 199 个攻击单元格与 138 个良性单元格。
- 外部基准:OS-Harm(51 个提示注入案例,其中 21 个涉及未授权 HTTP 请求)、WASP(21 个 Web 提示注入案例)、MCPTox(1,223 个案例,1,210 个改变工具或参数)、MCPSecBench(17 个案例,9 个在威胁模型内)、OSWorld-MCP(10 个领域共 361 个任务)、WebArena(26 个 Reddit 任务)。
- 对比基线:标准 ReAct 智能体与 Foerster et al. (2026) 提出的 Vanilla Dual-LLM 系统。
- 评测指标:攻击成功率(ASR,目标有害动作到达网络或工具边界的比例)、无注入时的良性任务完成率(benign utility)、注入存在时的任务完成率(utility under attack)、pass@5(带早停且每次尝试最多 20 步交互,OSWorld 评分为 1.0 记为完成)。
- 判定与打分方式:根据记录的环境状态和代理警报进行确定性判定,有害动作违反当前活跃约束即判定攻击成功;OSWorld-MCP 依靠官方自动化评分脚本验证完成度。
- 样本量与测试规模:STEER-Bench 评估 199 个攻击单元格与 138 个良性单元格;OSWorld-MCP 评测 361 个任务;规划器能力分析测试固定 20 任务子集。
主结果
表格较宽,可左右滑动
测试套件 单元格数 ASR (COBRA开启) ASR (COBRA消融) Dual-LLM ASR ReAct ASR S1 WIRE(字段约束) 26 0% 100% 96% 96% S2 DEST(主机/端点约束) 24 0% 100% 88% 92% S3 MCP(MCP代理) 15 0% 67% 未报告 未报告 S4 Cross-channel(共享状态) 72 0% 100% 89% 100% S5 PROV(受信任值处理) 33 0% 55% 100% 100% S7 CFI(计划–执行边界) 9 0% 67% 89% 89% All suites(全部套件汇总) 199 0% 87.6% 89.5% 94.4% 注:据 Table 1。S3 涉及 MCP 工具,通用智能体基线不具备该能力故未报告;受表格行数限制,表中省略了 S6 TRUST(5 单元格,消融 ASR 为 80%)、S8 STEP(10 单元格,消融 ASR 为 100%,Dual-LLM 与 ReAct 均为 40%)及 S9 ULTRA(5 单元格,消融 ASR 为 80%,Dual-LLM 与 ReAct 均为 100%)。
- 完整防御阻断所有分支转向攻击:作者报告,完整 COBRA 系统在 STEER-Bench 的 199 个攻击单元格中将 ASR 降至 0%,而禁用针对性保护组件后加权平均 ASR 升至 87.6%(各套件消融 ASR 介于 55% 至 100%)。
- 既有基线防御在分支转向下失效:在适用于通用智能体的 74 个单元格中,ReAct(UI-TARS-1.5-7B)加权 ASR 为 94.4%,Vanilla Dual-LLM(gpt-5 + UI-TARS-1.5-7B)加权 ASR 为 89.5%,作者指出这说明单纯依赖受信任离线规划无法阻止不可信数据操控已授权分支。
- 良性效用保持与误报分布:作者报告,COBRA 在与 Vanilla Dual-LLM 使用相同模型时保留了其 97% 的良性任务效用;在 138 个良性单元格中仅产生 4 次误报(S8 中 3 次,S9 中 1 次),均因嵌套分支累加的约束阻断了合法操作。
外部安全基准泛化与防御边界验证
- OS-Harm 提示注入防御:在 OS-Harm 的 51 个案例中,COBRA 与 Vanilla Dual-LLM 均通过计划–执行分离阻断全部 51 个攻击;针对其中 21 个尝试未授权 HTTP 请求的案例,无代理时全部成功(ASR 为 21/21),启用 COBRA 域名白名单后全部被阻断(ASR 为 0/21),其余 30 个使用 SMTP 等通道的案例仍由计划–执行边界阻断。
- WASP 细粒度端点防御:在 WASP 评测中,无 sitemap 时主机级防御阻断 5 个跨域攻击但 14 个同主机未授权操作全部成功;引入 GitLab 与 Reddit 批准的 sitemap 后,COBRA 阻断全部 19 个请求级攻击,将 ASR 从 14/19(73.7%)降至 0/19,同时保持 100% 良性完成率;其余 2 个依赖自由文本语义属性的攻击超出确定性请求级防御范围。
- MCPTox 与 MCPSecBench 工具安全:在 MCPTox 的 1,223 个案例中,COBRA 阻断了改变所选工具或参数的全部 1,210 个攻击(ASR 降至 0%,无防御时 ASR 为 100%),并在攻击下维持 79% 的效用;其余 13 个产生隐藏效果但调用相同的案例无法被代理区分。在 MCPSecBench 的 17 个攻击中,COBRA 阻断了属于其威胁模型的全部 9 个攻击并保留良性效用。
OSWorld-MCP 实用效用与融合规划评估
- 任务完成率对比:在 10 个领域 361 个 OSWorld-MCP 任务中(pass@5,无批准 sitemap,仅主机级防御),gpt-5(P-LLM)与 UI-TARS-1.5-7B(Q-VLM)配置下的 COBRA 完成率为 133/361(36.8%),优于单模型 UI-TARS-1.5-7B ReAct 基线的 85/361(23.5%);在与旧版 Dual-LLM 匹配的 86 个任务上,COBRA 完成率为 36/86(41.9%),比旧版 Dual-LLM 的 22/86(25.6%)高出 16.3 个百分点。
- MCP 工具调用的关联分析:在附录 F 分析的两种配置中,MCP 调用出现在 336/722 次任务评估中(46.5%);使用 MCP 的任务成功率为 37.2%,未观察到 MCP 调用的任务为 34.2%;在 Sonnet 配置下,使用 MCP 任务成功率为 42.1%(未观察到为 33.8%),平均尝试次数从 2.31 次减至 1.98 次。作者指出规划器根据任务选择 MCP,该结果反映关联性而非因果效应。
- 融合规划的单次尝试恢复效果:融合规划将 5 个候选计划合为一个分支程序,在标准规划需 2–5 次尝试才完成的 55 个任务中,融合规划在第 1 次尝试即成功完成了 27 个(49.1%),使首次尝试完成总数从 78 增至 105 个(Table 3)。
其他消融与分析
- 模型角色分配与 API 成本:gpt-5 + UI-TARS-1.5-7B 的 COBRA API 成本为 $0.332/任务(ReAct 为 $0.00,规划与注解平均消耗 73k tokens,本地 Q-VLM 消耗 258k tokens);双角色 Sonnet-5 成本为 $0.627/任务(完成率 38.8%);双角色 kimi-k2.5 成本为 $0.129/任务(完成率 25.5%)(Table 2、Table 5)。
- 注解与融合规划开销:在 gpt-5 + UI-TARS 样本中,注解平均每次尝试消耗 8,847 tokens,带来 9% 的 token 开销;融合规划在 OSWorld-MCP 上消耗约 150k P-LLM tokens,成本为 $0.59/任务,高于标准规划的 73k tokens 与 $0.33/任务(附录 G)。
- 本地模型作为规划器的表现:在 20 个任务子集上,UI-TARS-1.5-7B 规划完成率为 2/20(生成 96 个计划,12 个不可解析,语句中位数为 7.5),OpenCUA-32B 为 1/20(生成 92 个,17 个不可解析,语句中位数为 2.0),低于 gpt-5 的 6/20(生成 85 个,9 个不可解析,语句中位数为 17.5)(Table 6)。
- OpenCUA 交互模型扩展:在 361 个任务上,gpt-5 + OpenCUA-7B 完成率为 117/361(32.4%,ReAct 为 23.8%),gpt-5 + OpenCUA-32B 完成率为 120/361(33.2%,ReAct 为 30.7%)(Table 7)。
- MESA 站点描述生成覆盖率:在 WebArena 的 26 个 Reddit 任务中,MESA 无人工修改覆盖了全部所需的 18 个任务(69.2%),部分覆盖 3 个(11.5%);在 OSWorld-MCP 的 25 个面向网站的 Chrome 任务中,覆盖了全部所需的 18 个任务(72%)(附录 D)。
- 负面结果与例外说明:双角色配置未能保持 ReAct 水平(kimi-k2.5 从 42.1% 降至 25.5%,Sonnet-5 从 51.0% 降至 38.8%);在 OpenCUA-32B 上加入 gpt-5 规划器导致 Chrome、Calc 和 Thunderbird 领域完成率下降;在 gpt-5 + OpenCUA-7B 中,使用 MCP 任务成功率(28.3%)比未使用 MCP 观察到的任务(34.4%)低 6.1 个百分点。
有什么可以进一步探索的点?
作者指出其在未体现在网络请求的视觉数值、自由文本语义、非 HTTP 接口及对站点描述的依赖等局限。
作者指出的局限与后续方向
- 未进入网络请求的敏感数值无法约束:若结账请求仅包含商品标识符而不含显示的结算总额,COBRA 必须从 GUI 读取价格,此时无法可靠区分真实价格与广告或评论中的视觉对抗内容,无法在 HTTP/MCP 边界施加确定性约束(第 6 节)。
- 无法检验自由文本语义与隐藏服务端效果:对于提交至同一端点的请求,若两段文本差异仅在于是否具有冒犯性,COBRA 无法检测自由文本的语义含义;同样,受损的 MCP 服务器接收合法参数却产生有害隐藏效果时,代理无法区分(第 6 节、第 5.1 节、第 7 节)。
- 未覆盖非 HTTP 与非 MCP 的本地接口与协议:COBRA 现有的 HTTP 和 MCP 代理未覆盖邮件客户端所用的 SMTP 协议、桌面应用程序直接写入文件系统等本地操作,且许多桌面应用未暴露 MCP 工具,扩展受限于缺乏统一的语义操作接口(第 6 节、第 7 节)。
- 盲规划难以应对未预期的界面状态:与 ReAct 相比,同模型双角色配置完成率偏低,融合规划尚无法彻底取代独立重试;作者提出未来方向是训练专门用于计算机操作的 P-LLM,学习常规操作与故障恢复,并利用执行反馈奖励能预期故障状态的计划(第 6 节)。
- 依赖网站所有者发布与维护机器可读描述:端点级防御依赖经批准的 sitemap,虽然 MESA 能通过自动化抓取生成近似描述,但仍需人工审查和随站点变更更新;更强的安全性和实用性提升取决于网站所有者是否愿意发布和维护权威 sitemap 或 MCP 工具(第 6 节、第 7 节)。
实验覆盖范围
- 被测模型范围:规划器测试了 gpt-5、Sonnet-5、kimi-k2.5、UI-TARS-1.5-7B、OpenCUA-32B 共 5 种模型;交互模型测试了 UI-TARS-1.5-7B、Sonnet-5、kimi-k2.5、OpenCUA-7B、OpenCUA-32B 共 5 种模型。
- 评测基准范围:包含专门设计的 STEER-Bench(101 个任务,199 个攻击单元格与 138 个良性单元格,9 个领域,4 种页面布局),以及 4 个外部安全基准(OS-Harm 51 例、WASP 21 例、MCPTox 1,223 例、MCPSecBench 17 例)和 2 个实用任务基准(OSWorld-MCP 361 例、WebArena 26 例)。
- 交互预算与完成标准:OSWorld-MCP 效用评测采用 pass@5 早停机制,每个尝试预算上限为 20 步交互,判定标准为 OSWorld 得分为 1.0。
- HTTP 防御设置条件:在 OSWorld-MCP 效用实验中未提供批准的 sitemap,HTTP 强制执行仅限制于授权主机;端点级约束仅在 WASP 实验(采用从 ceLLMate 获取的 GitLab 与 Reddit 描述)及 STEER-Bench 中进行了测试。
- 论文未报告的信息:论文未报告针对攻击者自适应修改载荷以绕过特定类型谓词的动态博弈测试,亦未报告各基准评估中的多次重复实验方差。
总结一下论文的主要内容
提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
- 论文定位:论文针对计算机使用智能体(CUA)在处理动态网络内容时面临的分支转向攻击,提出了首个系统性评测基准 STEER-Bench 以及结合控制流与数据流防御的系统级架构 COBRA。
- 面临的核心问题:现有的 Dual-LLM 架构通过离线特权规划器提供控制流完整性(CFI),但无法应对动态图形界面所必需的运行时分支;攻击者无需注入新的指令,仅需操纵页面数据即可诱导智能体执行危险的预批准分支,造成数据流完整性(DFI)失效。
- 方法核心设计:COBRA 在接触不可信内容前由规划器(P-LLM)将任务与经 SHA-256 钉住的站点/工具元数据编译为带约束的分支程序,隔离的 Q-VLM 仅负责视觉感知;运行时由分支解析中枢(BRH)动态验证分支条件与参数,并通过确定性 HTTP 和 MCP 代理在网络与工具边界严格阻断越权操作;同时结合多样本融合规划与站点描述生成工具 MESA 辅助部署。
- 关键实验结果:
- 在 STEER-Bench 的 199 个攻击单元格中,完整 COBRA 将分支转向攻击成功率(ASR)降至 0%(标准 ReAct 为 94.4%,Vanilla Dual-LLM 为 89.5%),同时保留 97% 的良性效用。
- 在 4 个外部安全基准中,COBRA 在其威胁模型涵盖的 1,259 个攻击案例上均实现 0% ASR。
- 在 OSWorld-MCP 361 个任务上,gpt-5 与 UI-TARS-1.5-7B 组合的 COBRA 取得 36.8% 的任务完成率,优于 UI-TARS-1.5-7B 单模型 ReAct 基线的 23.5%。
- 作者的结论与启示:作者认为,保护 CUA 必须从控制流完整性拓展到严格的数据流完整性控制;未来在处理未进入网络请求的视觉数值、自由文本语义、非 HTTP 本地协议以及依赖站点所有者发布描述等方面仍存在开放挑战。