评测与基准arXiv 2610.03818
Control OSWorld:面向 GUI 计算机操作 Agent 的 AI 控制评测环境
提出 Control OSWorld,评测失准 GUI Agent 的监控
- arXiv
- 2610.03818
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- Claude Sonnet 4.6、Claude Opus 4.8、GPT-5.2 等 6 个
提出 Control OSWorld,评测失准 GUI Agent 的监控
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
证明无显式危害的图文窄微调可诱发跨任务涌现未对齐
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 HazardAuditor,用可执行轨迹训练计算机使用 Agent 的运行时守卫