AgentGym2 发布:在去理想化真实环境中评测 LLM 智能体
AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
AgentGym2 在去理想化环境评测 15 个模型,GPT-5 的 Overall Avg@3 为 46.15,开源最高为 Nex-N1-671B 的 32.19。
- 现有智能体基准多提供预置工具、跳过必要中间步骤并假设输入干净完整,因而低估真实部署难度。AgentGym2 要在去理想化环境中评测端到端执行、工具发现与组合,以及对噪声和欠指定输入的稳健性。
- 基准含 437 个任务、27 个领域,分 Complex Tool Use(182)、Data Analysis(57)和 Deep Search(198)。智能体只获得可组合的基础工具箱,需自行发现工具;答案为短字符串或数字,由 Qwen3-235B-A22B-Instruct-2507 做语义等价判定。
- Table 3 中 GPT-5 的 Overall Avg@3 为 46.15,Claude-4.5-Sonnet 为 37.17,开源最高的 Nex-N1-671B 为 32.19。作者称模型规模与成本上升时成绩上升,交互轮数没有同样的缩放效应;incorrect analysis 与 insufficient exploration 是主要失败模式。
- 作者在 Conclusion 中称后续可扩展领域、改进工具发现与组合,并研究降低交互成本的方法。实验覆盖 15 个模型、三场景和三类去理想化因素消融;论文未报告各模型的总费用数值。
- 模型
- GPT-5Claude-4.5-SonnetGemini-2.5-ProKimi-K2Qwen3-8BQwen3-32BQwen3-235B-A22B-InstructQwen3-235B-A22B-ThinkNex-N1-32BNex-N1-671BGLM-4.6DeepSeek-V3.1DeepSeek-V3.2-Exp
- 基准
- AgentGym2Complex Tool UseData AnalysisDeep Search
- 指标
- Avg@3Pass@3Pass@kPass^kdiscovery ratio
研究者提出 AgentGym2,一个面向真实端到端工作需求的 LLM 智能体评测框架,用于弥补现有基准依赖预打包工具接口、忽略关键步骤、假设输入干净且完整等理想化设定的不足。除推理与规划外,它还衡量智能体执行端到端流程、通过探索发现工具、为未见任务组合工具,以及对噪声和不完整信息的鲁棒性。在 15 个闭源与开源模型上的实验显示,即便是 Gemini 和 GPT-5 等 SOTA 系统在 AgentGym2 上也表现吃力,反映出当前智能体能力与真实应用需求之间存在明显差距。该论文已被 ACL 2026 接收为主会论文。
深度解读
这篇论文试图解决什么问题?
现有智能体基准偏理想化,AgentGym2 要测真实环境中的端到端执行与稳健性。
现有智能体基准把环境理想化,因而低估真实部署难度;AgentGym2 要在去理想化环境里评测端到端完成任务的能力。
- 场景与重要性:作者称语言模型正从对话系统走向可做深度检索和数据分析的自主智能体,并越来越多进入生产环境,因此需要严格、贴近真实的评测。
- 现有方法的不足:作者称多数基准提供预打包工具接口、预先解决必要中间步骤,并假设输入干净且充分指定;真实请求常欠指定或含糊,信息源可能不完整或误导,必要工具也可能事先不可用。
- 核心观察:作者认为可靠部署还依赖主动澄清目标、通过交互发现工具、把工具组合成新流程、执行完整流程,以及在噪声、歧义和欠指定输入下保持稳健,这些能力评测不足。
- 本文提出什么:作者提出评测框架 AgentGym2,任务来自真实端到端工作需求,覆盖数据分析、深度检索和复杂工具使用,跨 27 个以上领域;系统层只给基础、可组合的工具箱,而不是按查询预选工具。
有哪些相关研究?
相关工作分智能体发展与评测基准两类,作者用 Table 1 定位去理想化评测缺口。
论文把相关工作分成智能体发展与评测基准两组,并用 Table 1 比较核心维度。
智能体发展
- 早期对话到交互式智能体:早期大语言模型主要被当作对话系统;ReAct(Yao et al., 2023)让智能体通过动作与反馈迭代地与复杂环境交互。
- 领域专用智能体:后续工作覆盖软件工程(Wang et al., 2025a; Yang et al., 2024)、网页导航与信息搜寻(Jin et al., 2025; Li et al., 2025a; Zheng et al., 2025),以及数据分析流程(Guo et al., 2025a; Hong et al., 2025; Zhu et al., 2025)。作者称这些架构在精选基准上表现强,但仍依赖预指定工具的理想化封闭世界假设。
评测基准
- 模拟环境与统一平台:网页导航与购物(Yao et al., 2022)、具身与家务(Shridhar et al., 2021)、科学发现(Wang et al., 2022)、文本游戏(Prasad et al., 2024)和工具使用(Barres et al., 2025; Patil et al., 2025; Yao et al., 2025)。AgentBench(Liu et al., 2024)与 AgentGym(Xi et al., 2025a)把异构任务放在统一交互接口和评测协议下。
- 领域专用基准:软件工程(Deng et al., 2025; Terminal-Bench, 2025; Yang et al., 2025b; Zan et al., 2025)、数据科学流程(Egg et al., 2025; Lai et al., 2023; Lei et al., 2025; Wang et al., 2025c),以及组合格式良好的真实 MCP 工具(Guo et al., 2025b; Mo et al., 2025; Wang et al., 2025b)。作者称现有环境常是沙箱、工具经筛选、指令指定清楚,因而难以评测开放式工具发现和稳健性。
基线方法与基准
- Table 1 对比的基准:BrowseComp、DA-Code、τ-Bench、AgentBoard、AgentBench、AgentGym。对比维度包括 Non-Simulated Environment、Realistic Action Space、Tool discovery、E2E Data Analysis、Inserted Distractors。作者称 AgentGym2 是其中唯一同时落在真实环境与真实动作空间、并覆盖后三个维度的基准。
作者把本文定位为面向端到端执行和动态工具获取的非理想化评测套件,用来补上述开放式工具发现与稳健性评测的缺口。
论文如何解决这个问题?
AgentGym2 用可组合基础工具箱和三类去理想化任务,评测端到端完成与工具发现。
作者用 AgentGym2 把智能体与工具、环境解耦,只提供基础可组合工具,并在三类真实场景中要求智能体自己发现工具、完成端到端流程。
框架与环境
- 四组件:Figure 3 将架构分为 Environment(提供基础设施的数字运行时)、Tools(通用、基础、可组合接口)、Agent(根据轨迹推理并输出动作,一步可同时调用多个工具)、Configurations(用户请求、初始状态和验证机制)。输入含文本和图像,一个场景可涉及多个环境。
- 相对 AgentGym 的扩展:在模拟环境之上加入真实数字环境,并实现隔离与并行调用。五类基础设施为代码执行、文件系统、搜索引擎、网页浏览器和互联网。
- 工具箱:五类核心能力为 web browsing、information retrieval、file processing、multimodal understanding、code execution,支持 27 种以上动作(Table 2 记 Basic Tool Types 为 27)。作者称收集真实工具、修复缺陷并接入隔离运行时,且给予整个互联网的访问,而不是限制在预选网站。
- 工程设计:文件管理避免读写冲突,隔离浏览器实例以防止基于历史的作弊,代码在沙箱中执行;异步执行支持单步并行工具调用。
任务构建
- 规模:共 437 个任务、27 个领域(Figure 2 给出领域占比,正文写明 Econ. & Ind. 为 Economy & Industry,Math & Tech. 为 Math & Technology)。Table 2:Complex Tool Use 182、Data Analysis 57、Deep Search 198;语言为 ZH/EN;附件 652 个,模态含 Text、Image、Audio、Video。
- Complex Tool Use:先收集学术、日常生活和娱乐中的高频网页工具,再构造 tool discovery(57)与 tool composition(125)。来源包括改编志愿者的真实讨论,以及用 CSV/JSON 或人工整理的图像替换 BrowseComp 等基准中的关键实体,附件可含干扰项。验证要求任务能用所给基础工具解决,且必须处理附件并得到唯一可验证答案。
- Data Analysis:作者称以往基准常给预处理后的高质量数据、只看最终结果。本文基于 GitHub、Kaggle 等来源,通过充实真实问题、注入目标挑战和从零手工建任务得到 57 个实例,覆盖 EDA、数据处理和深入分析。
- Deep Search:Ambiguity-only 114 个,用 Wikipedia 答案实体递归采样关系、合并成多跳问题并核验难度与答案唯一性;Ambiguity-with-bias 84 个,来自带记忆偏差的社交媒体查询,或向 Ambiguity-only 注入带模糊措辞的噪声属性,并人工确认唯一答案不变。
交互协议与判定
- 智能体循环:采用 ReAct 风格,工具以 OpenAI tool schema 提供。交互轮数上限 100;智能体把答案放进指定的 final_answer 标记后任务结束。主结果每题跑 3 次,temperature 为 0.6,每轮最大生成长度 8192 tokens。
- 成功判定:参考答案都是短字符串或数字。评审模型为 Qwen3-235B-A22B-Instruct-2507,判断预测与参考答案是否语义等价。附录 C 给出评审细节;正文未在此处展开提示词。
评测所针对的能力
- 超出常规智能体技能:除推理、规划、编码、搜索外,还评测主动澄清与解释目标、交互中发现工具、把工具组合成新流程、端到端执行完整流程,以及对噪声、歧义和欠指定输入的稳健性。
- 质量流程:作者称全部任务经过模型检查与人工复核的级联验证,检查任务有效性、清晰度和预期结果。
论文做了哪些实验?
15 个模型的 Overall Avg@3 最高为 GPT-5 的 46.15,数据分析普遍更难。
实验设置
- 被测模型:专有模型为 GPT-5、Claude-4.5-Sonnet、Gemini-2.5-Pro。开源模型为 Kimi-K2,Qwen3-8B、Qwen3-32B、Qwen3-235B-A22B-2507(Instruct 与 Thinking),Nex-N1-32B、Nex-N1-671B,GLM-4.6,DeepSeek-V3.1、DeepSeek-V3.2-Exp。Table 3 共 15 行设置(部分 Qwen3 分 thinking 与非 thinking)。
- 基准规模:AgentGym2 共 437 题:Complex Tool Use 182、Data Analysis 57、Deep Search 198(Table 2)。
- 指标:主表报告 Avg@3 与 Pass@3。后文另用 Pass@k(k 条轨迹中至少一条正确的概率)和 Pass^k(k 条全部正确的一致性),以及 discovery ratio(成功发现相关在线工具的任务比例)。
- 协议:ReAct,轮数上限 100,每题 3 次,temperature 0.6,每轮最长 8192 tokens。LLM judge 为 Qwen3-235B-A22B-Instruct-2507,判语义等价。
- 人工一致率样本:人工检查 Gemini-2.5-Pro、GPT-5、Claude-4.5-Sonnet、Nex-N1-671B 的全部输出。Pass@k 实验用 AgentGym2 的 100 个实例子集和 Nex-N1 系列。
主结果
据 Table 3,Overall 与三场景的 Avg@3 如下(Pass@3 见表,此处不重复)。
表格较宽,可左右滑动
模型 Tool Avg@3 Data Avg@3 Search Avg@3 Overall Avg@3 Qwen3-8B(非 think) 2.75 0.00 6.57 4.12 Nex-N1-32B 14.65 9.36 18.52 15.71 Qwen3-235B Instruct 12.27 9.94 16.84 14.04 Qwen3-235B Think 7.33 2.92 13.97 9.76 DeepSeek-V3.1 23.26 20.47 20.54 21.66 Nex-N1-671B 29.30 29.82 35.53 32.19 Claude-4.5-Sonnet 42.38 39.77 31.63 37.17 GPT-5 48.72 39.18 45.80 46.15 表中省略 Qwen3-8B(think,Overall 5.49)、Qwen3-32B(非 think 6.55,think 7.40)、Kimi-K2(20.90)、DeepSeek-V3.2-Exp(20.98)、GLM-4.6(20.52)、Gemini-2.5-Pro(20.67),数字均来自 Table 3。
- 作者解读:作者称即便 GPT-5 的 Avg@3 也只有 46.15,开源最高的 Nex-N1-671B 与 DeepSeek-V3.1 分别为 32.19 和 21.66,现有智能体与真实部署需求之间仍有差距。
- 场景差异:作者称多数模型在 Data Analysis 上低于其他场景。GLM-4.6 的 Complex Tool Use 为 22.16、Data Analysis 为 8.19,相差 13.97。作者把 Claude-4.5-Sonnet 与 Nex-N1 系列在数据分析上更稳定归因于智能体编程能力。
- 后训练:作者称 Nex-N1-32B(基于 Qwen3-32B)和 Nex-N1-671B(基于 DeepSeek-V3.1)的 Avg@3 分别比对应基座约高 9.16 和 10.5;引言另写约 9.16% 与 10.53%。
规模、轮数与成本
- 测了什么:Figure 1 比较参数规模、平均交互轮数和总成本(美元)与成绩的关系。正文给出 Qwen3 非 thinking 的 8B、32B、235B 分数为 8.70、10.53、25.40;这些数字与 Table 3 的 Pass@3 相同,论文未说明 Figure 1 纵轴是 Avg@3 还是 Pass@3。
- 结果:作者称参数规模上升时成绩上升。GPT-5、Claude-4.5-Sonnet、Nex-N1-671B 通常每题 20–30 轮。Qwen3-235B-A22B-Thinking-2507 交互最少,但比 instruct 版低 5.31(与 Table 3 Overall Avg@3 的 14.04 对 9.76 之差一致)。
- 作者解读:作者认为思考模式更依赖内部推理、较少外部工具调用;需要平衡推理与交互。作者称高性能模型通常成本高,当前智能体在性能与成本效率上仍达不到生产需求。Figure 1 横轴标到 1024$,正文未给出各模型的具体美元数。
失败模式、噪声与去理想化消融
- 工具发现:Figure 6 以 discovery ratio 为横轴、Performance 为纵轴。作者称发现比例与成绩强相关,但找到工具后成绩仍然有限,工具组合与正确调用同样关键。图中具体点的坐标论文未以数字列出。
- 数据分析阶段:Figure 7 左图为按阶段的错误分布,右图为流水线存活率,模型含 Nex-N1-671B、DeepSeek-V3.1、GLM-4.6、Claude-4.5-Sonnet、Gemini-2.5-Pro、GPT-5。作者称数据整理是主要瓶颈,存活率在整理之后下降最明显。图中柱高论文未以数字写出。
- 噪声与失败类型:Figure 8 中,加入噪声后 Claude-4.5-Sonnet 下降 6.4%,GPT-5 下降 7.4%;图上标注的部分成绩包括 GPT-5 无噪声 48.15、有噪声 40.74,Claude-4.5-Sonnet 为 37.04 与 30.56。Figure 9:incorrect analysis 平均 24.0%,insufficient exploration 平均 22.8%。分场景:复杂工具使用中 confirmation bias 为 24.7%;数据分析中 instruction misinterpretation 为 27.0%;深度检索中 insufficient exploration 为 35.2%。分类由 GPT-5 按附录 E.1 的 Table 6 完成。
其他消融与分析
- LLM judge:四个代表模型的全部输出上,与人工核验的一致率为 98.9%(Section 6)。
- Pass@k / Pass^k:在 100 题子集上,作者称增大采样预算会提高 Pass@k;Nex-N1-671B 最高约增加 30%。Pass^k 下降,作者将其解读为稳定性有限。Figure 5 横轴为尝试次数 k(约 20–24),正文未逐点列出。
- Table 4(Avg@3):Hidden-information retrieval 上,Gemini-2.5-Pro 理想化 33.33、去理想化 18.67,GPT-5 为 61.67 与 49.60。Tool Discovery:Gemini 33.33 与 26.90,GPT-5 53.57 与 46.78。Ambiguity/noise with bias:Gemini 27.78 与 25.00,GPT-5 48.15 与 40.74。作者称去掉这些因素后成绩明显提高。
- 案例:Figure 10–11 为数据分析失败案例,作者归因为探索不足和指令误解;Figure 20–21 为复杂工具使用案例,作者归因为错误分析、探索不足和确认偏误。附录 E.2 的 Figure 16–21 给出其他失败模式案例。
有什么可以进一步探索的点?
作者建议扩展领域并改进工具发现、组合与交互成本;实验覆盖 15 个模型与三类消融。
作者指出的局限与后续方向
- 能力差距:作者在引言和 Section 5.2 称,即便是 GPT-5 与 Claude Sonnet 4.5,今天的智能体在可靠部署到生产环境之前仍需要明显进展(引言;Section 5.2)。
- 交互与推理的平衡:作者在 Section 5.3 称,思考模式交互更少但 Qwen3-235B 思考版低于指令版 5.31,平衡推理与交互对真实任务很关键。
- 端到端能力:作者在 Section 6 称,工具发现之后,组合与正确调用仍然关键,需要端到端能力;数据分析应考虑复杂真实环境与完整流程。
- 稳健性:作者称当前智能体对真实查询中的噪声仍然不够稳健,多轮决策和对环境反馈的利用仍是部署瓶颈(Section 6,Figure 8、Figure 9 的讨论)。
- 成本:作者在 Section 5.3 称,实践者必须在性能、效率与预算之间权衡,当前智能体在高性能与成本效率上仍达不到生产需求。
论文未单独设立 Limitations 小节。上述条目是作者在结果与分析中明确写成仍不足、仍需改进的方向;正文在贡献总结中称实验分析旨在支持后续研究、开发与部署,未列出更具体的未来工作清单。
实验覆盖范围
- 模型与协议:主实验为 Table 3 的 15 个模型设置,AgentGym2 共 437 题,每题 3 次,temperature 0.6,轮数上限 100,评审模型为 Qwen3-235B-A22B-Instruct-2507。
- 场景:Complex Tool Use 182、Data Analysis 57、Deep Search 198;语言为 ZH/EN(Table 2)。Deep Search 再分 Ambiguity-only 114 与 Ambiguity-with-bias 84。
- 分析子集:人工一致率覆盖四个模型的全部输出;Pass@k 使用 100 个实例和 Nex-N1 系列;Table 4 的去理想化消融报告 Gemini-2.5-Pro 与 GPT-5。
- 失败分析:Figure 9 覆盖三个场景,错误类型由 GPT-5 按附录 Table 6 分类;Figure 7 的阶段分析包含六个模型。
- 未报告项:Figure 1 给出成本轴但论文未报告各模型的具体美元花费;论文未报告评审与人工一致率的分母题数,只给出 98.9% 这一总体数字。
总结一下论文的主要内容
AgentGym2 用 437 个去理想化任务评测 15 个模型,最高 Overall Avg@3 为 46.15。
AgentGym2 是面向去理想化真实环境的语言模型智能体评测框架,用来衡量端到端执行、工具发现与组合,以及对噪声和欠指定输入的稳健性。
- 问题:作者认为现有基准常预置工具、省去必要中间步骤并假设输入干净,因此低估真实部署难度。用户请求经常含糊,信息可能不完整或有误导,所需工具也可能要在交互中发现。
- 做法:框架把智能体与环境解耦,提供网页浏览、检索、文件处理、多模态理解和代码执行五类基础工具,并开放整个互联网。437 个任务分属 Complex Tool Use(182)、Data Analysis(57)和 Deep Search(198),跨 27 个领域、中英双语。参考答案为短字符串或数字,由 Qwen3-235B-A22B-Instruct-2507 判断语义等价。主实验用 ReAct,每题 3 次,温度 0.6,最多 100 轮。
- 主结果:Table 3 中 GPT-5 的 Overall Avg@3 为 46.15(Pass@3 为 65.68),Claude-4.5-Sonnet 为 37.17,开源最高的 Nex-N1-671B 为 32.19。多数模型在 Data Analysis 上更低,例如 GLM-4.6 从工具使用的 22.16 降到数据分析的 8.19。
- 其他发现:作者称 Nex-N1-32B 与 Nex-N1-671B 相对基座的 Avg@3 大约高 9.16 和 10.5。参数规模与成本上升时成绩上升,单纯增加交互轮数没有同样效应。去掉隐藏信息、工具发现或噪声后,GPT-5 与 Gemini-2.5-Pro 的 Avg@3 上升(Table 4)。失败里 incorrect analysis 平均占 24.0%,insufficient exploration 平均占 22.8%。四模型上 LLM judge 与人工的一致率为 98.9%。
- 作者结论:作者认为当前智能体与生产部署需求之间仍有差距,工具发现之后的组合与调用、对噪声的稳健性,以及性能与成本的权衡,都仍需要推进。