评测与基准arXiv 2610.03818
Control OSWorld:面向 GUI 计算机操作 Agent 的 AI 控制评测环境
提出 Control OSWorld,评测失准 GUI Agent 的监控
- arXiv
- 2610.03818
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- Claude Sonnet 4.6、Claude Opus 4.8、GPT-5.2 等 6 个
提出 Control OSWorld,评测失准 GUI Agent 的监控
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出可验证操作卡 VAC,把智能体浏览器确认绑定到真实 DOM 操作
提出 HazardAuditor,用可执行轨迹训练计算机使用 Agent 的运行时守卫
提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具调用
WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。
提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。