评测与基准arXiv:2608.19741 · 8月20日微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性AI Agent·测试Claude Opus 5、GPT-5.4、GPT-5.6-sol 等 14 个·应用层摘要论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。完整解读