跳到正文
原文
AI as Normal Technology· Sayash Kapoor·· 2026-02-24

新论文《迈向 AI Agent 可靠性的科学》:18 个月内能力大涨但可靠性提升有限

New Paper: Towards a science of AI agent reliability

AI 导读

Stephan Rabanser、Sayash Kapoor 与 Arvind Narayanan 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴核能与航空安全领域的经验,把 AI Agent 的可靠性拆解为一致性、鲁棒性、可预测性和安全四个维度、共 12 项指标。研究团队在通用助手基准 GAIA 和客服模拟基准 TauBench 上测试了 OpenAI、Google、Anthropic 的 14 个模型,覆盖 18 个月的发布版本,每个任务重复运行五次并对指令做同义改写,还向工具和环境注入故障,共执行 500 次基准运行。

阅读原文normaltech.ai