评测与基准arXiv 2609.32915
AgentTell:浏览器 Agent 的行为侧信道泄漏基准
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
- arXiv
- 2609.32915
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- Claude Sonnet 5、Gemini 3.7 Flash、GPT-5.6 Luna 等 6 个
摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。