UndoBench 发布:分离工具型 Agent 的任务能力与故障恢复能力
发布UndoBench,分离工具型智能体的任务能力与故障恢复能力
- 定位与核心问题:UndoBench 是一个面向工具型 AI 智能体运维故障恢复的评测基准,旨在解决现有评测主要在标称无扰动环境下进行、从而混淆基线规划能力与运维恢复能力的问题。
- 评测设计:基准涵盖 8 个企业领域的 36 个工作流,通过相同随机种子下的成对反事实运行机制,定义了以名义成功为条件的条件恢复成功率(CRSR),并结合物理环境状态与线路级效应日志双预言机,严密监测重复、缺失和精确一次外部副作用。
- 能力与恢复解耦结果:在 12 个 TEST 工作流和丢失确认故障下,开源 Llama 模型名义成功率达到 83.54%,但 CRSR 降至 46.72%,朴素重试导致 53.33% 的重复外部效应;商业 API 模型同样展现出超过 55 个百分点的标称成功与条件恢复差距。
- 阶段依赖性发现:故障恢复并非单一标量能力,在变异前阶段重试表现接近且无重复;在变异中阶段,朴素重试、单调用幂等和零特权日志对 4 个复合任务的 CRSR 全部降至 0.00%;在丢失确认阶段,重试前验证与服务端幂等能显著降低重复变异风险。
- 机制隔离结果:部署全基准服务端幂等(B2-K)可使商业模型 CRSR 升至 97.24% 并消除重复副作用,但仍存在第 0 轮 API 异常与去重后多轮规划错误等非恢复失效。
- 作者结论:作者指出,单看标称完成率会掩盖关键的阶段依赖性恢复漏洞,智能体容错恢复不仅取决于模型推理,还需要系统级基础设施与端点协议的协同支持。