跳到正文
原文
Scale AI Research / SEAL· Veronica Chatrath†, Bryan Zhu†, Jingxuan Fan†, George Pu, Soham Dinesh Tiwari, Soham Dan, Ryan Young, Yuan (Christy) Li, Yuang Yao, Apaar Shanker, Minglai Yang , Daniel Yue Zhang, Yunzhong He, Ying Liu, Chenguang Wang, Zhijun Yin, Yuan (Emily) Xue·本站收录 · 原文发表 精选关注度26

Scale AI 推出 READY 企业 Agent 部署评测框架

READY or Not: Reliable Enterprise Agent Deployment

AI 导读

Scale AI 研究团队发布 Reliable Enterprise Agent Deployment(READY)评测框架,用于判断 AI Agent 能否在具体企业工作流中部署。该框架在保留各工作流自身成功定义的前提下,测量人机系统的可靠性与运行成本,从候选监督策略中选出满足指定可靠性目标的最低成本策略,并在留出案例上做统计资格认定,输出包含可靠性、人工监督负担和成本的部署画像。READY 以开源测试床实现,将工作流定义、执行、评测与部署资格认定解耦,可运行在现有 Agent 评测基础设施上。在覆盖 16 个 Agent 系统、750 个案例的临床审计端到端案例中,两个自主准确率仅差 0.3 个百分点(72.8% 与 72.5%)的系统,在同一 76% 可靠性目标下分别需要 39.2% 和 29.6% 的人工复核。

推荐理由

READY 把评测从自主准确率转向可靠性、人工监督与成本的部署资格,企业选型团队可据此比较不同 Agent 系统。

阅读原文labs.scale.com