微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性
One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows
作者在507个业务任务上评测智能体,Claude Opus 5从66.50% pass@1降至47.53% passˆ20。
- 现有多轮工具评测多关注代码生成或单次API语法正确性,难以检验智能体在真实复杂业务流中能否持续遵循策略、协调多工具并正确变更后端持久化状态,且容易将单次偶发成功误判为具备稳定执行能力。
- 构建包含模拟用户、MCP工具会话与可执行判题器的沙箱THINKINGBOX,并在5个业务领域设计507个多轮状态化任务,以终端数据库状态、副作用提取与必要对话规范进行严格的合取判题,并支持多次重复试验与强化学习训练。
- 评测18个模型,Claude Opus 5在THINKINGBOX-BENCH上pass@1为66.50%,passˆ20降至47.53%;Kimi-K3从57.37%降至17.60%;80.88%的失败尝试仍能正常终止并调用写工具。
- 477个任务仅比对终端状态与副作用而不检验最终回复文本;任务为合成重构且每题仅设单一黄金状态;统一采用GPT-5.4-mini作为具有10轮上限的配合型模拟用户与部分题目的裁判,未测试用户记错、目标变更等不配合行为。
- 模型
- Claude Opus 5GPT-5.4GPT-5.6-solClaude Sonnet 4.6GPT-6 AstraClaude Opus 4.6o3-proGrok-4.3Kimi-K3Qwen3.8-27BDeepSeek-V4-ProGLM-5.1Qwen3.5-9BMistral-Large-3
- 基准
- THINKINGBOX-BENCHHumanEval+
- 指标
- pass@1passˆ20pass@20all-20 success
微软等机构的研究者发布 Thinkingbox 沙盒与 Thinkingbox-bench 基准,用于评估 Agent 在有状态业务流程中的可靠性。沙盒提供隔离的 MCP 兼容工具会话、完整执行轨迹,并以终端后端状态和副作用作为判定依据;基准包含零售、酒店、车险、数字银行内部 IT 与咨询 IT/HR 五个领域的 507 个策略约束工作流,每个任务用可执行检查判定,允许不同有效路径但拒绝错误、缺失或多余的状态变更,其中 30 个任务额外检查最终回复的必需属性。研究者在 18 个闭源与开源模型上每任务重复 20 次试验,发现可靠性明显下降:Claude Opus 5 从 66.50% pass@1 降至 47.53% pass^20,Kimi-K3 从 57.37% 降至 17.60%;Qwen3.8-27B 的 pass@20 达 89.35%,但 pass^20 仅 10.93%。
推荐理由论文给出 507 个有状态业务流程任务与 18 个模型的重复试验结果,可看到 pass@1 与 pass^20 之间的可靠性落差。
深度解读
这篇论文试图解决什么问题?
现有工具评测难以衡量智能体在多轮状态化业务中的完成度与状态变更副作用。
这篇论文试图解决大语言模型智能体在多轮、有状态业务工作流中缺乏端到端可执行评测与重复执行稳定性检验的问题。
- 现有工具评测与真实工作流脱节:现有工具使用评测大多局限于代码修复、网页浏览或单次函数调用的语法解析与接口执行,难以检验智能体在实际业务中是否真正达成了工作目标(如退款、改签、理赔)。
- 表层响应容易掩盖执行失败:在多轮业务场景中,智能体可能生成表面合理的回复甚至成功调用了写入工具,但实际上修改了错误记录、未按策略获取必要确认或引入了未授权的附带状态变更。
- 单次成功无法反映执行稳定性:单次尝试的成功率(pass@1)难以区分智能体是具备稳定执行能力,还是仅在单次非确定性采样中碰巧发现了一条可行轨迹。
- 提出的核心方案:作者提出了交互沙箱 THINKINGBOX 与包含 507 个多轮业务任务的评测基准 THINKINGBOX-BENCH,基于持久化状态变更与副作用提取对多轮任务进行端到端检验。
有哪些相关研究?
相关研究涵盖交互沙箱、工具调用基准与专业工作流评测,本文聚焦状态化业务。
相关研究主要分布在交互沙箱、工具调用评测以及专业工作流基准三个方向:
交互沙箱与对话式工具使用
- 交互环境与世界模型:TextWorld(Côté et al., 2018)、ALFWorld(Shridhar et al., 2020)与 WebShop(Yao et al., 2022)构建了用于语言智能体训练和评估的交互环境;AgentGym(Xi et al., 2025)统一了异构环境交互;Agent World Model(Wang et al., 2026a)为智能体生成基于数据库的可执行 MCP 环境。
- 工具调用与接口规范:ToolBench(Qin et al., 2024)、API-Bank(Li et al., 2023)、Gorilla(Patil et al., 2024)和 BFCL(Patil et al., 2025)重点评估模型在 API 选择、参数生成和可执行调用上的能力;MRKL(Karpas et al., 2022)、ReAct(Yao et al., 2023)与 Toolformer(Schick et al., 2023)研究模块化工具使用与推理行动范式。
- 有状态对话与策略交互:ToolSandbox(Lu et al., 2025)将有状态工具与策略内用户模拟器相结合;tau-bench(Yao et al., 2024)通过终端数据库状态和重复执行评估策略引导的对话;tau^2-bench(Barres et al., 2025)支持用户和智能体在共享环境中共同行动。
可执行与专业工作流基准
- 代码、网页与桌面控制:SWE-bench(Jimenez et al., 2024)针对真实代码修复;AgentBench(Liu et al., 2024)、WebArena(Zhou et al., 2024)、VisualWebArena(Koh et al., 2024)与 OSWorld(Xie et al., 2024)评估网页与操作系统桌面的控制能力。
- 应用环境与副作用检测:AppWorld(Trivedi et al., 2024)在应用 API 和代码智能体场景中支持替代解法并检测附带状态变更;AgentDojo(Debenedetti et al., 2024)在不受信任的工具输出下评估效用与安全性。
- 企业与协议基准:WorkArena++(Boisvert et al., 2024)针对企业软件工作流;CRMArena(Huang et al., 2025)与 CRMArena-Pro(Huang et al., 2026)评估多轮真实 CRM 交互;APEX-Agents(Vidgen et al., 2026)涵盖金融、咨询与法律场景;MCP-Bench(Wang et al., 2026b)、MCPMark(Wu et al., 2026)与 MCP-Atlas(Bandi et al., 2026)基于 MCP 协议评估真实工具协调与调用。
对比基线与基准
- 基准特性对比:论文在 Table 1 中与 SWE-bench、BFCL、ToolBench/API-Bank、WebArena/OSWorld、AppWorld、MCP-Atlas、tau-bench/tau^2-bench 以及 APEX-Agents 进行了对比;实验评估了包括 Claude Opus 5、GPT-5.4、Kimi-K3、Qwen3.8-27B 等 18 个专有及开源模型。
本文定位
- 作者表示,THINKINGBOX 将策略约束下的用户交互、可重置的业务工具世界、基于最终状态与副作用的判题机制以及多次重复测试的稳定性评估整合进统一沙箱。
论文如何解决这个问题?
构建基于MCP协议的THINKINGBOX沙箱,通过状态比对与副作用提取进行合取判题。
作者提出了 THINKINGBOX 交互沙箱与 THINKINGBOX-BENCH 基准,通过隔离工具会话、模拟用户协同交互以及端到端状态与副作用校验,构建了面向业务工作流的闭环评测与强化学习环境。
问题设定与形式化
- 任务形式化表示:每个任务定义为 x = (b0, g, T, U, C),其中 b0 为初始后端状态,g 为用户目标,T 为可用领域工具集,U 为模拟用户策略,C 为包含 m 个隐藏可执行检查项的集合。
- 诱导 POMDP 模型:任务诱导出有限时域部分可观测马尔可夫决策过程。隐藏状态包含后端状态、模拟用户私有状态、评测事件日志和轮次状态;智能体基于历史观测在每轮输出对话消息、工具调用或终止标记。
沙箱架构与会话隔离
- 环境隔离与确定性重置:每次评测尝试前均将后端状态完全重置为 b0。不同尝试之间完全隔离,不共享任何数据库记录、工具缓存或副作用,保证多次试验统计与强化学习奖励的独立可复现。
- 协议与接口规范:通过模型上下文协议(MCP)向智能体暴露领域工具接口,覆盖读写操作与策略检索;智能体超时设为 600 秒,MCP 代理超时设为 300 秒,最多允许 5 次网络重试。
- 模拟用户策略约束:模拟用户由固定的 GPT-5.4-mini 扮演,输入仅包含可见对话历史、用户目标规范和最新助手消息;设定严格约束,禁止虚构实体,仅在智能体提问时提供未公开细节,最多交互 10 轮。
判定机制与副作用提取
- 合取式结果判题:评测针对任务结束后的世界状态而非工具调用表面序列,综合判定式定义为 V(x, ρ) = ∏i=1m ci(sT, e, ρ),仅当所有关于终端状态 sT、提取的副作用 e 及特定对话要求的检查项全部通过时才判定为成功。
- 副作用与附带损伤拦截:通过提取初始状态与终止状态差异,自动比对数据库哈希值、字段数值与集合长度,识别实体混淆、未授权修改或遗漏必要业务记录等错误。
- 选择性回复规则:在 507 个任务中,477 个仅基于后端持久化状态判题;另有 30 个任务针对必要信息告知或保密要求引入 GPT-5.4-mini 二元打分规则,作为终端状态的补充。
基准构建与任务设计
- 真实工作流三阶段构建:第一阶段基于企业支持案例提炼工作流模板;第二阶段将模板实例化为具备初始状态、领域策略与验证代码的具体任务世界;第三阶段在沙箱中对任务进行可执行验证与过滤,剔除工具故障、目标模糊或缺乏可行解的样本。
- 五大多轮业务领域:覆盖零售与电商(98 题)、旅行与酒店(104 题)、汽车保险(100 题)、数字银行内部 IT(104 题)以及咨询 IT/HR 支持(101 题),任务中包含多步事务处理、权限核实与信息澄清。
论文做了哪些实验?
在507个任务上评测18个模型,Claude Opus 5在pass@1领先但多次试验稳定率下降。
实验设置
- 被测模型:评测覆盖 18 个专有与开源模型,包括 Claude Opus 5、GPT-5.4、GPT-5.6-sol、Claude Sonnet 4.6、GPT-6 Astra、Claude Opus 4.6、o3-pro、Grok-4.3、Kimi-K3、Qwen3.8-27B、DeepSeek-V4-Pro、GLM-5.1、Qwen3.5-9B、Mistral-Large-3,以及强化学习微调的 Qwen 变体。
- 评测基准与规模:THINKINGBOX-BENCH 包含 5 个领域的 507 个多轮业务任务,每模型每任务独立运行 N = 20 次,各模型评测总量达 10,140 次完整试验。
- 主要指标定义:采用微观平均的单次通过率 pass@1、衡量重复稳定性的 passˆ20(20 次均成功的插值估计)以及衡量探索上限的 pass@20(20 次中至少成功 1 次的概率)。
- 评审与裁判方式:477 个任务采用确定性数据库哈希与字段断言比对;30 个任务由固定的 GPT-5.4-mini 对最终回复进行二元规则评审。
- 推理与超参数设置:智能体温度设为 1.0(支持时),最大生成 token 上限为 4096,模拟用户与回复评审固定采用 GPT-5.4-mini(温度分别为 0.3 和 0.0)。
主结果
主结果呈现部分代表性模型在多次独立试验下的探索与稳定执行表现(据 Table 15):
表格较宽,可左右滑动
模型 pass@1 (%) passˆ20 (%) pass@20 (%) 0/20 任务数 20/20 任务数 Claude Opus 5 66.50 47.53 79.09 106 241 GPT-5.4 65.36 30.62 91.12 45 128 GPT-6 Astra 58.31 46.89 71.01 147 231 Kimi-K3 57.37 17.60 93.89 31 68 Qwen3.8-27B 51.70 10.93 89.35 54 38 o3-pro 19.31 1.25 61.54 195 4 MiniMax-M2.5 0.19 0.00 0.59 504 0 (注:据 Table 15,表中仅列出部分代表性模型,包含结果最低的 MiniMax-M2.5;省略了 GPT-5.6-sol、Claude Sonnet 4.6、GPT-5.2、DeepSeek-V4-Pro、Claude Opus 4.6、Kimi-K2.6、GLM-5.1、Qwen3.6-27B、Grok-4.3、Qwen3.5-9B、Mistral-Large-3 等模型)
- 发现与重复执行差距显著:作者称,各模型在多次尝试中探索到成功路径的能力明显高于重复执行稳定性,例如 Kimi-K3 拥有最高的 pass@20,但 passˆ20 显著偏低。
- 各领域表现缺乏统一主导者:作者称,Claude Opus 5 在汽保、银行和咨询领域领先,但在酒店落后;GPT-5.4 在酒店领先,Kimi-K3 在零售领先(据 Table 4)。
- 模型参数不单独决定表现:作者称,开源模型表现高度分化,Qwen3.8-27B 优于部分更大规模的开源模型,说明智能体后训练与交互鲁棒性同样关键。
发现-可靠性差距分析
- 测了什么:对比各模型在 20 次独立重复试验下的 pass@1、pass@20 与 passˆ20 指标分布(据 Table 15)。
- 实验结果:Kimi-K3 的 pass@20 达到 93.89%,但 passˆ20 仅为 17.60%;Claude Opus 5 的 pass@20 为 79.09%,passˆ20 为 47.53%;GPT-6 Astra 在 pass@1 为 58.31%,但在 passˆ20 达到 46.89%。
- 作者的解读:作者指出这一现象为发现-可靠性差距(discovery-reliability gap),模型通过重试能够探索到可行路径,但难以在重复执行中稳定达成相同结果。
失败模式与弱评估器消融
- 测了什么:分析 79,853 次失败轨迹的主导错误类型,并对比基于表层行为的弱评估指标与可执行数据库校验的差异(据 Table 5、Table 16)。
- 实验结果:失败轨迹中工具使用错误占 79.9%、错误状态更新占 10.3%、未完成用户诉求占 7.0%、未执行写操作占 2.9%;弱评估器显示,80.88% 的失败试验仍能正常退出且调用了写操作工具,67.24% 的失败试验最终工具调用无任何报错。
- 作者的解读:作者认为表层响应和工具调用语法成功无法作为端到端完成的代理信号,必须通过终端状态与副作用提取暴露潜在的数据破坏。
强化学习训练与外部基准对比
- 测了什么:使用沙箱奖励对 Qwen 模型进行 GRPO 强化学习微调,并在 HumanEval+ 上验证沙箱复现与能力差异(据 Table 4、Table 21)。
- 实验结果:全参数微调的 Qwen3.8-27B pass@1 达到 60.78%,超过专有模型 GPT-6 Astra(58.31%);在 HumanEval+(无解释器)上,8 个模型的 pass@1 紧缩在 90.73%–95.24% 之间(相差仅 4.51 个百分点),而在 THINKINGBOX-BENCH 上极差达 47.19 个百分点。
- 作者的解读:作者认为沙箱的确定性判定可有效转化为强化学习信号;单轮代码基准因接近天花板无法体现复杂业务工作流所需的多轮信息搜集与状态更新差异。
其他消融与分析
- 模拟用户真实性审计:审计 19,390 轮生成式用户回复,93.38% 判定为有根据,6.33% 无根据,0.29% 有争议(据 Table 14)。
- 人工验证一致性:两位人类评审在 120 轮样本上初审一致率为 95.0%(Cohen's kappa = 0.870),对自动标注 Grounded 的确认率为 100%,对 Ungrounded 的确认率仅 50.0%–53.3%(据 Table 12、Table 13)。
- 代码解释器增益消融:在 HumanEval+ 上添加解释器后,各模型 pass@1 变化在 -0.98 至 +1.71 个百分点之间,仅 o3-pro 置信区间排除零但仅在 25/820 次中使用了该工具(据 Table 22)。
- 帕累托成本前沿:GPT-5.6-sol 成功单次成本最低(0.127 美元),GPT-5.4 在全部 20 次均成功任务上的单任务成本最低(6.80 美元)(据 Table 23)。
有什么可以进一步探索的点?
作者指出判题未覆盖回复文本保真度且依赖单一模拟器,实验覆盖5个领域507个任务。
作者指出的局限与后续方向
- 判题覆盖范围不对称:在 507 个任务中,477 个仅依据终端数据库状态与副作用判题,若智能体完成正确状态转移但对用户传达了错误信息仍被判定为成功,当前指标衡量的是后端状态的合规性而非前端交互保真度(附录 A)。
- 任务单一黄金状态约束:任务由非公开私有企业案例合成重构,不代表全部企业工作分布;且每个任务构建时排除了存在多种合理处置结果的工作流,仅保留具有单一黄金终端状态的场景(附录 A、附录 B.1、附录 B.5–B.6)。
- 交互协议与预算上限限制:实验评测结果受到固定测试框架约定的制约,包括必须包含特定终止标记、10 轮交互轮次上限以及 token 数量限制(附录 A)。
- 模拟用户多样性与行为局限:所有评测均采用单一的 GPT-5.4-mini 扮演配合型模拟用户,未模拟用户记错细节、中途更改目标或面对多次失败时不配合的行为;且模拟器与部分被测模型同属一个家族,可能存在交互风格效应,未来需测试不同模拟器模型与行为的敏感性(附录 A)。
实验覆盖范围
- 评测领域与任务规模:实际评测覆盖零售与电商、旅行与酒店、汽车保险、数字银行内部 IT 以及咨询 IT/HR 支持共 5 个业务领域,总计 507 个可执行任务。
- 被测模型数量与轮次:主榜单评估了 14 个未经过本文 RLFT 微调的专有与开源模型,加上微调变体共 18 个模型,每个模型在每个任务上独立采样 20 次试验。
- 判题形式分布:507 个任务中,477 个为纯数据库状态与副作用比对,30 个任务额外增加了基于大模型的最终回复二元规则评审。
- 用户模拟器单一设定:所有对话试验均由固定参数的 GPT-5.4-mini 充当单一模拟用户,交互上限为 10 轮后续回复。
- 论文未报告事项:论文未在主要指标中包含真实人类用户的在线交互评测,且未在基准中包含需要用户在外部世界中实际采取操作的双向控制任务。
总结一下论文的主要内容
论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。
- 研究定位:该研究提出了面向多轮有状态业务工作流的智能体交互沙箱 THINKINGBOX 及包含 507 个任务的评测基准 THINKINGBOX-BENCH。
- 解决的核心问题:针对现有工具调用评测偏向代码与单次 API 语法正确性、忽视真实业务持久化状态变更与附带破坏的问题,构建了端到端可验证的闭环环境。
- 方法设计要点:基于 MCP 协议实现任务级别的独立会话隔离与确定性重置,由受限的模拟用户配合多轮澄清,结合终端数据库状态比较与副作用提取实施严格的合取式判题。
- 重要实验结果:评测 18 个模型展示出探索上限与重复执行稳定性的显著落差,Claude Opus 5 的 pass@1 为 66.50%,而在 20 次重复试验中全部成功的 passˆ20 降至 47.53%;Kimi-K3 的 pass@20 达 93.89%,但 passˆ20 仅为 17.60%;在 79,853 次失败轨迹中,工具使用错误占比达 79.9%,且 80.88% 的失败试验仍能正常终止并调用写工具。
- 强化学习与基准价值:基于沙箱确定性奖励使用 GRPO 算法对 Qwen3.8-27B 进行全参数微调,其 pass@1 达 60.78%,超过专有模型 GPT-6 Astra(58.31%);相比 HumanEval+ 狭窄的分数区间,该基准有效拉开了不同智能体在复杂流程下的能力区分度。
- 作者结论与启示:作者认为智能体偶然找到单次成功路径并不等同于具备稳定的业务执行能力,在面向高影响业务流程时,评测必须深入到底层持久化状态与附带损伤,而非仅依赖表层回复文本或工具调用格式。