Scale AI 发布 READY 基准,衡量 AI 智能体部署可靠性、人工监督与成本
Introducing READY: What It Takes to Deploy an AI Agent
AI 导读
Scale AI 推出 READY(Reliable Enterprise Agent Deployment)基准套件,用于按企业实际使用方式评估 AI 智能体,同时衡量可靠性、人工监督量和运行成本三项指标,输出的是部署画像而非单一分数。评测分三阶段:先让智能体处理真实工作流案例并记录工具调用、证据与置信度,再在给定可靠性目标下搜索成本最低的人机分工策略,最后在未见过的案例上独立验证。首批上线 CliniCARE-Bench 和 PSEBench 两个医疗基准,金融服务等行业基准将陆续发布,测试平台基于 Inspect AI 构建并已开放。
相关论文