防御arXiv 2610.03089
COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
- arXiv
- 2610.03089
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 UCM,用 DOM 掩码与类型受限隔离模型隔开网页智能体与不可信内容
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出可验证操作卡 VAC,从真实 DOM 重构智能体浏览器的确认信息
作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。