事件观察中
微软开源CAVEAT购物Agent评测基准
先了解这件事
AI 综述
微软开源 CAVEAT,用于评测网页 Agent 是否遵循用户既定偏好并做出最优选择,唯一报告指标为最优选择率。评测覆盖九个虚构电商与服务环境,分为 CAVEAT-Standard(九个环境、312 次运行)和 CAVEAT-Hard(五个 2112 商品场景、每个模型/框架 10 次运行)两档,附带 BrowserUse 基线与改进的 CAVEAT-Harness,支持接入任意 OpenAI 兼容端点及自定义 harness。在引导手段下,最优选择率从 78.6% 降至 17.3%。
AI 根据报道生成 · 18 小时前更新
最新进展10月8日 19:21
微软开源 CAVEAT 购物 Agent 评测环境,引导手段下最优选择率从 78.6% 降至 17.3%。后续时间线
10月8日
- microsoft/CAVEAT精选微软发布 CAVEAT 购物 Agent 评测环境,引导手段下最优选择率从 78.6% 降至 17.3%
微软开源 CAVEAT,用于评测网页 Agent 是否遵循用户既定偏好并做出最优选择,唯一报告指标为最优选择率。评测覆盖九个虚构电商与服务环境,分为 CAVEAT-Standard(九个环境、312 次运行)和 CAVEAT-Hard(五个 2112 商品场景、每个模型/框架 10 次运行)两档,附带 BrowserUse 基线与改进的 CAVEAT-Harness,支持接入任意 OpenAI 兼容端点及自定义 harness。仓库说明给出 Python 3.10 以上加 Chromium 的安装与运行步骤,论文题为 CAVEAT: Towards Robust Computer-Use Agents in Incentive-Misaligned Environments,CAVEAT-27B 模型检查点将后续发布。
相关讨论
关注度走势
每天新增来源
- 10月8日 新增 1 个来源(1 家媒体、0 个账号)
- 10月9日 新增 0 个来源(0 家媒体、0 个账号)
- 10月10日 新增 0 个来源(0 家媒体、0 个账号)