评测与基准arXiv 2609.32915
AgentTell:浏览器 Agent 的行为侧信道泄漏基准
构建 AGENTTELL 基准,测量浏览器 Agent 的行为侧信道隐私泄露
- arXiv
- 2609.32915
- 发表
- 层
- 应用层
- 被测模型
- Claude Sonnet 5、Gemini 3.7 Flash、GPT-5.6 Luna 等 6 个
摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。
构建 AGENTTELL 基准,测量浏览器 Agent 的行为侧信道隐私泄露
摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。
提出 CAVEAT 基准,评测激励失配市场中计算机使用 Agent 的购买决策退化
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 ConflictGuard,引导 GUI Agent 在冲突指令下终止执行
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。