Control OSWorld:面向 GUI 计算机操作 Agent 的 AI 控制评测环境
提出 Control OSWorld,评测失准 GUI Agent 的监控
- arXiv
- 2610.03818
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- Claude Sonnet 4.6、Claude Opus 4.8、GPT-5.2 等 6 个
另有 440 篇论文还没打上分类标签,暂不在筛选结果里。
提出 Control OSWorld,评测失准 GUI Agent 的监控
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 OSWorld-Science 基准,评测计算机使用智能体完成科学软件工作流的能力
提出 EngiWorld 基准,评测 Agent 在专业工程软件中走完设计闭环的能力
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
证明无显式危害的图文窄微调可诱发跨任务涌现未对齐
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
提出 OSWorld-Pro,用顺序子目标过程评测计算机使用智能体
OSWorld-Pro 是一套计算机使用智能体的过程评测,用来补充只核对最终交付物的 OSWorld。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 HazardAuditor,用可执行轨迹训练计算机使用 Agent 的运行时守卫
提出 ConflictGuard,引导 GUI Agent 在冲突指令下终止执行
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出 SCOPE,联合后训练计算机使用智能体的任务能力与安全决策
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。