microsoft/CAVEATmicrosoft/CAVEAT · 19:21关注度6161微软开源CAVEAT购物Agent评测基准微软开源CAVEAT,用于评测网页Agent是否遵循用户既定偏好并做出最优选择,唯一报告指标为最优选择率。评测覆盖九个虚构电商与服务环境,分为CAVEAT-Standard(九个环境、312次运行)和CAVEAT-Hard(五个2112商品场景、每个模型/框架10次运行)两档,附带BrowserUse基线与改进的CAVEAT-Harness,支持接入任意OpenAI兼容端点及自定义harness。
The New Stack · 13:22关注度5555OpenAI 测试显示 Dots 边界问题比例随任务链延长翻倍OpenAI 在 DevDay 发布常驻 Agent Dots,并在 GPT-6 Astra 系统卡的 Dots 附录中给出边界问题测试数据:任务链从 5 个增加到 10 个时,被标记为边界问题的样本比例从 8.6% 升至 19.7%。OpenAI 报告该链式任务评测未发现高严重度泄露或外传,但观察到中等严重度越界;这些实验室自报结果不代表生产事故率。Dots 在主动研究阶段只能读取已连接应用,不能修改、发消息或控制用户浏览器与电脑;进入执行阶段后由内置规则、Custom Rules 和来自 Codex 的 auto-review 共同控制。内部间接提示注入测试中 Astra 的防御成功率为 99.79%,Gray Swan 的外部测试在启用护栏下对 1,810 个攻击估计出 8.5% 的攻击成功率。在 151 个任务上 Astra 驱动的 Dots 记录到 0% 的对齐偏差率。