Scale AI Research Blog·本站收录 2026-10-05 00:06· 原文发表 7月23日TERMINAL-BENCH 3.0 发布:面向更强智能体的更难任务TERMINAL-BENCH 3.0: Harder Tasks for Better AgentsAI 导读Scale AI 参与发布开源基准 TERMINAL-BENCH 3.0,任务难度较 2.0 提升,前沿模型在其上的解决率不足 40%。该基准在隔离 Docker 沙箱中让 AI 智能体操作真实 shell,按最终结果而非自述评分,覆盖约 16 个类别,Scale 是单一机构中贡献任务最多的一方。阅读原文labs.scale.com#安全评测#工具/开源#Agent 安全