评测与基准arXiv 2609.27273
微软研究院发布 CAVEAT
提出 CAVEAT 基准,评测购物 Agent 在商业引导下的决策偏离
- arXiv
- 2609.27273
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- GPT-5.6-Sol、GPT-5.6-Terra、GPT-5.6-Luna 等 14 个
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出 CAVEAT 基准,评测购物 Agent 在商业引导下的决策偏离
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出 CredLeak-Bench,评测 Agent 在钓鱼登录与收件箱中的凭据泄露
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 Box2-Bench,评测模型能否选择性依赖外部工作流
Box2-Bench 固定任务与模型,只改变工作流可靠性,用来衡量模型能否选择性依赖可能出错的外部指导。
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。