跳到正文
原文
microsoft/CAVEAT·本站收录 · 原文发表 日期未标精选关注度62

微软发布 CAVEAT 购物 Agent 评测环境,引导手段下最优选择率从 78.6% 降至 17.3%

微软研究院 CAVEAT:电商平台一开赞助位、滴灌定价等引导手段,购物 agent 买到用户最优商品的比例从 78.6% 掉到 17.3%(代码与环境)

AI 导读

微软开源 CAVEAT,用于评测网页 Agent 是否遵循用户既定偏好并做出最优选择,唯一报告指标为最优选择率。评测覆盖九个虚构电商与服务环境,分为 CAVEAT-Standard(九个环境、312 次运行)和 CAVEAT-Hard(五个 2112 商品场景、每个模型/框架 10 次运行)两档,附带 BrowserUse 基线与改进的 CAVEAT-Harness,支持接入任意 OpenAI 兼容端点及自定义 harness。仓库说明给出 Python 3.10 以上加 Chromium 的安装与运行步骤,论文题为 CAVEAT: Towards Robust Computer-Use Agents in Incentive-Misaligned Environments,CAVEAT-27B 模型检查点将后续发布。

推荐理由

CAVEAT 把电商引导手段做成可复现的本地评测环境,做 Agent 购物与安全评测的团队可以按文中的配置直接跑出自己的最优选择率。

相关论文
阅读原文github.com