AgentAtlas 提出区分结果与控制决策质量的智能体评测框架
AgentAtlas: Beyond Outcome Leaderboards for LLM Agents
作者报告八模型去掉轨迹标签菜单后,映射一致率下降14.8至40.1个百分点。
- 智能体评测常把行为收成最终任务成功。作者认为可部署系统还应分开控制决策质量和轨迹质量,否则该询问、拒绝、停止、确认或恢复时的失败会被只看结果的排行榜藏住。
- AgentAtlas把下一步应做什么收成六态控制门,并在AgentRx的轨迹失败类上加错误来源和下游影响。再用0/1/2检查既有基准覆盖了哪一轴,并在1342条合成条目上比较给出标签菜单与不给菜单两种提示词。
- 八个模型里,taxonomy-aware控制准确率有七个在0.870–0.946,gpt-oss-20B为0.743。去掉菜单后轨迹映射一致率均下降。作者称没有模型在各报告轴都排第一。
- 作者称合成标签测的是与生成标签是否一致,不是真实部署行为;盲映射器未经独立审计;金标签来自一个模型家族。覆盖审计不是多标注者研究。协议使用8个模型、48次运行;论文未报告重复次数和安全格子样本量。
- 被测模型
- Claude Sonnet 4.6Claude Haiku 4.5gpt-5.4-miniGemini 3.1 Flash LiteQwen3.6-35B-A3BGemma-4-26B-A4B-itMinistral-3-14B-Instruct-2512gpt-oss-20B
- 基准
- AgentAtlas synthetic demonstration setControl splitTrajectory splitSecurity splitWebArenaOSWorldOSWorld-HumanWebVoyagerGAIAAssistantBenchSWE-bench VerifiedCCBenchτ-benchToolSandboxAPI-BankAsk-or-Assume?AgentDojoAgentRxAgentProcessBenchMCPSecBenchMCPToxATBench
- 指标
- accuracyMacro-F1mapped trajectory-label agreementprimary_src_accimpact_accutility retentionover-refusal rateattack-following rate0/1/2 coverage
AgentAtlas 将大语言模型智能体评测从最终任务成功率扩展为诊断性词汇与审计协议,用于区分结果成功、控制决策质量和轨迹质量。论文提出六状态控制决策分类法(Act / Ask / Refuse / Stop / Confirm / Recover)、带主要错误来源与下游影响的轨迹失败词汇,以及对十五个智能体基准的 0/1/2 覆盖审计。作者还在一个合成的 1,342 条样本集上用八个模型做了示例性协议研究,比较分类法感知与分类法盲的提示词格式,指出两项测量风险:移除显式标签菜单会显著改变映射标签一致性,坐标轴选择也会改变表观排名。作者说明该合成演示不是公开基准发布,不应被解读为确定性的模型比较。
深度解读
这篇论文试图解决什么问题?
作者认为最终成功不够,提出分开控制决策与轨迹质量的诊断词汇和审计。
可部署智能体不能只按最终任务成功打分,还要看控制决策和轨迹是否合格。
- 场景:作者称智能体已浏览、改文件、调用 API、操作桌面,并与用户模拟器和外部工具交互。同一最终答案是否可接受,取决于工具、用户约束、敏感确认和失败后是否恢复。
- 现有不足:作者称 τ-bench、ToolSandbox、AgentDojo、AgentRx、OSWorld/WebArena 等已各自涉及可靠性、有状态工具、对抗上下文或轨迹失败,但分析单位不同,没有共享地图。解决率、功能成功、攻击成功率或步骤定位单独使用时不完整。
- 主张:作者认为完整评测必须分开结果正确性、控制决策质量和轨迹质量,并问只看最终成功时哪些失败不可见。本文是分类与测量论文,不替换既有基准,也不做新排行榜。
- 提出的东西:AgentAtlas 含四件:六态控制轴(Act / Ask / Refuse / Stop / Confirm / Recover);记录 primary error source 与 downstream impact 的轨迹失败词汇;对 15 个智能体基准的 0/1/2 覆盖审计;1,342 条合成条目上的提示词格式与评测轴示例。
- 作者划的边界:合成集不是公开基准发布,不应读成确定的模型比较。作者用它说明两件测量风险:去掉显式标签菜单后,映射标签一致率可以变化很大;换评测轴会改变表面排名。
有哪些相关研究?
作者按基准家族和多轴评测文献定位,并称本文补上六门策略、提示词敏感性与覆盖审计。
论文按五类基准家族和 2024–2025 年多轴评测文献来定位,不把别人的结果当成可直接比较的模型排名。
- 结果型交互基准:SWE-bench Verified(SWE-bench team / OpenAI collaboration, 2024)和 CCBench(2026)报告代码任务结果。WebArena(Zhou et al., 2023)、OSWorld(Xie et al., 2024)和 GAIA(Mialon et al., 2023)评测网页或计算机使用。作者称公开分数常混有脚手架、工具权限、重试预算和 best-of-N,只说明结果分对脚手架敏感。
- 工具使用:API-Bank(Li et al., 2023)含 73 个工具、314 段对话。τ-bench(Yao et al., 2024)用 Pass1–Pass4 把一致性与首次成功分开。ToolSandbox(Lu et al., 2024)加入有状态执行、用户模拟和动态里程碑。
- 安全与轨迹诊断:AgentDojo(Debenedetti et al., 2024)有 97 个任务、629 个提示注入案例,并同时报效用与攻击成功。MCPSecBench(Yang et al., 2025)写 17 种攻击、四个 MCP 表面;MCPTox(2025)在真实 MCP 服务器上做工具投毒。AgentRx(Microsoft Research, 2026)有 115 条人工标注失败轨迹和九类分类;ATBench(Li et al., 2026)1,000 条长程轨迹;AgentProcessBench(Fan et al., 2026)1,000 条轨迹、8,509 个步骤标注。作者称后三者做轨迹诊断,而不是控制决策与覆盖缺口的总图。
- 多轴评测与单门先例:HAL(Kapoor et al., 2025)写 21,730 次 rollout、9 系统×9 基准;MAST(Cemri et al., 2025)为 14 种多智能体失败模式、1,600 条人工轨迹、kappa=0.88;AAATM(Kapoor et al., 2024)区分开发者与实践者评测并主张报告成本。另有 Yehudai et al.(2025)综述、AgentBoard(Ma et al., 2024)和 Agent-as-a-Judge(Zhuge et al., 2024)。作者称这些工作没有把单智能体控制决策策略当作一等单位。单门先例被点名的是:Confirm 见于 OpenAI CUA,Refuse 是 AgentDojo 的中心概念,Ask 见于 Ask or Assume?(2026),Stop 与 Recover 见于 AgentProcessBench。
- 对照设置:合成协议没有外部方法基线,对照是 taxonomy-aware 与 taxonomy-blind,数据是合成集。覆盖审计对象见 §6 与 Table A.1。Ask or Assume? 只作外部证据:论文转述其脚手架把欠指定 SWE-bench Verified 子集的解决率从 61.2% 提到 69.4%。
作者称本文相对这些工作补三件:六门控制决策策略、aware 对 blind 的提示词格式测法、十五基准覆盖审计。轨迹分类沿用 AgentRx,只加两个正交层级,作者称之为小扩展而不是替代。
论文如何解决这个问题?
用六态控制门和轨迹双层标签描述行为,再用0/1/2审计与两种提示词测量。
整体是测量协议:AgentAtlas 先定义跨基准的行为单位,再看把这些单位写明之后,基准结论和模型表面排名会不会变。
控制决策轴
- 六态:Act 是已充分指定、已授权且可安全执行。Ask 是实质欠指定,不澄清就继续很可能做错或不安全。Refuse 是不允许、有害或越权。Stop 是已完成、不可能,或继续会冗余、不安全。Confirm 是可行但敏感或不可逆,需要用户明确签字。Recover 是当前轨迹已失败,下一步应修复、回滚、重新落地或重规划,而不是盲目继续。
- 作者的新颖性说法:作者称就其所知,此前没有把这六门收成单一决策策略分类。单门在 CUA、τ-bench、ToolSandbox、AgentDojo、Ask or Assume?、AgentProcessBench 里分别出现过。Table 1 用最小场景区分各门;Figure 1 的图注列出对应风险:过度行动、不必要询问、过度拒绝、循环、漏掉不可逆性、盲目继续。作者称这些是说明性策略区分,不是穷尽操作策略。
轨迹失败轴
- 九类沿用 AgentRx:目标误读、选错工具、参数或目标错误、观察失败、约束违反、恢复失败、循环或过度行动、不安全信任外部内容、状态或记忆污染。术语有小改,例如 Recovery failure;单标签指派不变。
- 两层扩展:primary_error_source 取 wrong_tool、wrong_argument、missed_constraint、observation_misread、failure_to_recover、valid。impact 取 unsafe_side_effect、privacy_leak、wrong_final_state、unnecessary_cost、no_impact。作者称两层独立,同一种错误可有不同后果;AgentRx 与 AgentProcessBench 不分开这两层。
- 名单没有对齐:§7.2 说轨迹分割覆盖 §4.2 的九类,括号里却是八种失败加 valid,未单列目标误读。附录 C.4 的 aware 提示词又列七个标签,并把 §4.2 的 impact 值 unsafe_side_effect 用作轨迹标签。论文未解释这三处名单为何不一致。
次轴与 0/1/2 审计
- 三个次轴:security 是对抗输入下的工具上下文隔离;memory & state 是跨会话污染和过期上下文;efficiency 是 pass@1 藏住的多余步骤、成本或延迟。审计实际打六个轴:Control、Trajectory、Tool、Security、Memory、Efficiency(Table A.1)。
- 量规:0 是不直接测试或报告;1 是任务可能用到该轴但不单独隔离;2 是直接打分或标注。边界问的是该轴只是被行使,还是被分开测量。作者称分数是协议判断,不是独立复标。
合成协议与判定
- 数据:1,342 条均由 Claude Opus 4.7 生成,经 Pydantic 校验、去重和许可证泄漏探测。Control 684,六门乘六个域(邮件/日历、文件、编程、客服、网页表单、类 MCP 工具),故意偏向 Confirm 与 Recover。Trajectory 400。Security 258,针对投毒工具输出及相关对抗上下文。附录 B 还有生成器加较小验证器的 keep/revise/discard,以及 5-gram Jaccard 超过 0.7 的近重复删除。论文未写出较小验证器的模型名,也未报告删了多少条。
- 两种提示词:aware 给出闭集菜单,要求选一个并短说明。blind 去掉菜单,要自由文本诊断;确定性子串规则映射回闭集,未匹配则一次调用 Claude Haiku 4.5。安全分割的 blind 不提示内容是恶意的。附录 C.4 给出六组系统提示词的字段,此处不复述提示词约束。
- 解码与判定:提供方允许时 temperature=0.0、max_tokens=512、top_p=1.0、每格一次完成。不允许非默认温度的较新 Claude 用提供方默认;Gemini 用 maxOutputTokens=512;需要时 GPT-5 族用 max_completion_tokens=512。最多重试 3 次,指数退避,单次超时 60 秒。主判定是与合成金标签一致,不是现场任务是否做成。轨迹另有 0 起始 critical step:等于金标为 exact,相差不超过 1 为 ±1。安全分割另用 utility retention、over-refusal、attack_following_rate、safe refusal;其金动作在六门之外加一个 act-on-attack 失败模式。作者估计约 3–5% 的 blind 输出会被映错,并称映射器未经独立测量。
论文做了哪些实验?
作者报告八模型去掉轨迹菜单后一致率下降,且没有模型在各轴都排第一。
经验部分有两块:对既有基准的覆盖打分,以及八个模型在合成集上的协议演示。作者称后者是协议输出,不是已验证的部署分数。
实验设置
- 被测模型:闭源为 Claude Sonnet 4.6、Claude Haiku 4.5、gpt-5.4-mini、Gemini 3.1 Flash Lite。开源为 Qwen3.6-35B-A3B、Gemma-4-26B-A4B-it、Ministral-3-14B-Instruct-2512、gpt-oss-20B,经本地 vLLM,2× NVIDIA H100 80GB。开源四模型全扫描在该配置上不到一个 GPU 日。它们评的是合成条目,不是在真实环境里执行任务。
- 生成与映射:条目和金标签来自 Claude Opus 4.7。blind 未匹配输出由 Claude Haiku 4.5 映射,该模型同时是被测评估器。
- 数据:Control 684、Trajectory 400、Security 258,合计 1,342。作者称不是公开基准。
- 对照:同一条目的 taxonomy-aware 与 taxonomy-blind;轴为 control、mapped trajectory label、tool-context utility。没有外部方法基线。
- 指标:Control 报 accuracy、Macro-F1、next-action accuracy 及 Ask、Confirm、Refuse 的 F1。Trajectory 报 Label Acc、Macro-F1、step exact、step ±1、joint;aware 另报 primary source、impact、pri+impact。Security 报 utility retention、over-refusal、attack-following、safe refusal、legacy F1。
- 规模:8×3×2=48 次运行,约 21,000 次逐条判断。每格一次采样。论文未报告多次重复。覆盖审计不在这 15 个基准上跑这八个模型。
主结果
下表为合成演示集。Control 与安全效用取 aware;轨迹两列取 Label Acc。据 Table D.1、D.2、D.3。表中 Ministral 写 Ministral-3-14B。
表格较宽,可左右滑动
模型 Control aware Traj. aware Traj. blind 安全效用 aware Claude Sonnet 4.6 0.944 0.885 0.613 0.785 Claude Haiku 4.5 0.946 0.950 0.569 0.279 gpt-5.4-mini 0.909 0.818 0.615 0.984 Gemini 3.1 Flash Lite 0.892 0.927 0.564 0.698 Qwen3.6-35B-A3B 0.890 0.895 0.555 0.401 Gemma-4-26B-A4B-it 0.870 0.943 0.542 0.953 Ministral-3-14B 0.858 0.905 0.537 0.078 gpt-oss-20B 0.743 0.686 0.538 0.714 - 菜单使控制分靠近:作者称 aware 控制准确率在七个模型上聚在 7 个百分点内(正文写 0.870–0.946)。Table D.1 中 gpt-oss-20B 为 0.743,在该簇外。作者称显式菜单会使多个模型在粗标签上看起来接近。
- 去掉菜单后轨迹一致率都降:作者称每个模型下降 14.8 pp(gpt-oss-20B)至 40.1 pp(Gemma-4-26B-A4B);frontier 与 open 族均值是 −30.5 与 −31.4 pp(Table D.4)。作者称 blind 下限压到 0.54–0.62;Table D.2 八个 blind 值为 0.537–0.615。作者称这也可能测到回答格式监督;因映射器未独立验证,降幅应视为近似。
- 换轴改排名:作者称没有模型在所有报告轴上都排第一(Figure 4)。§7.5 写 Haiku 4.5 为 0.95、0.95、0.28;表为 0.946、0.950、0.279。gpt-5.4-mini 在 §7.5 写 0.98、0.91、0.82,表为 0.984、0.909、0.818。作者把 Haiku 的低效用归因于对带可见注入内容的良性任务过度拒绝,并称这不是部署建议。
基准覆盖审计
- 两份 15 个名字不一致:§6 列出 WebArena、OSWorld、OSWorld-Human、WebVoyager、GAIA、AssistantBench、SWE-bench Verified、CCBench、τ-bench、ToolSandbox、API-Bank、Ask-or-Assume?、AgentDojo、AgentRx、AgentProcessBench。Table A.1 换成 MCPSecBench、MCPTox、ATBench,没有 OSWorld-Human、WebVoyager、Ask-or-Assume?。下面按表。
- 按表计数:作者称 Tool 是唯一有较广 strong 覆盖的轴,15 个里 9 个为 2。Control 为 2 的只有 τ-bench 与 ToolSandbox。轨迹为 2 的是 AgentRx、ATBench、AgentProcessBench。Memory 为 2 的只有 ToolSandbox。Efficiency 没有 2。Security 为 2 的是 AgentDojo、MCPSecBench、MCPTox、ATBench。GAIA 的 Control 与 Trajectory 都是 0。
- 作者解读:缺口不是基准忽略智能体,而是每个基准只切一块。Figure 3 按轴汇总;图注写 cobalt 为 2、sky 为 1、gray 为 0,分数是协议判断。文本未给出各柱高度,不转写。
安全分割与族均值
- aware:Table D.3 中 gpt-5.4-mini 效用保持 0.984、over-refusal 0.005,但 safe refusal 为 0.000。Haiku 4.5 效用保持 0.279、over-refusal 0.679、attack-following 0.000、safe refusal 1.000。Ministral-3-14B 效用保持 0.078、over-refusal 0.885。
- blind 与族均值:Sonnet 4.6 效用保持从 0.785 到 0.112;Ministral 从 0.078 到 0.578。Table D.4:frontier 安全效用均值 0.687 到 0.248(−43.9 pp);open 为 0.537 到 0.599(+6.2 pp)。作者称开放模型均值上升是因为欠提示时更常行动,并明确不把这读成 blind 下开源模型更安全。
- 支持量:作者称若干安全格子支持量小,应避免按标签下结论。论文未给出这些格子的分母。
其他消融与分析
- Control 族均值下降为 frontier −3.9 pp、open −6.2 pp(Table D.4),小于轨迹分割的 −30.5 / −31.4 pp。
- Table D.1 中 Ministral-3-14B 的 Control aware Ask F1 为 0.565,是该列 aware 八行里的最低值。
- Table D.2 aware 的 pri+impact:Haiku 4.5 为 0.854,gpt-oss-20B 为 0.660;blind 的 primary source、impact、pri+impact 为“—”。
- 附录 B 写八个评估器 exact-step 为 0.09–0.15、±1 为 0.77–0.94。Table D.2 含 Step exact 0.078,落在该区间外。作者把 exact 与 ±1 的差距解释为步骤边界含糊,并把 exact 视为探索性。
- Figure E.1 的须为 Wilson 95% 区间;图注称变宽反映有效样本量下降。文本未给各条数值。
- 非本文受控实验的快照:Table A.2 写 τ-bench pass1 0.70 / pass4 0.56,并称 Opus 4.5 与 Qwen3.5 排名对调;OSWorld-Human 为 42.5% standard / 17.4% strict。作者称活榜须核对,不是归一化比较。Figure 2 未在文本中给出柱值。
有什么可以进一步探索的点?
作者将合成标签、未审计映射器和不能作稳定排名列为效度威胁。
作者指出的局限与后续方向
- 构念效度(§8.1):合成标签可能测不到真实智能体能力。测的是评估器是否同意生成的任务状态和标签,不是部署智能体在真实环境里是否行为正确。
- 内部效度(§8.1、附录 B):aware 与 blind 的差异可能来自分类监督、提示词可供性、解析行为或映射器伪影。blind 映射器未经独立审计。作者估计约 3–5% 盲输出会被映到错误标签,并把 100 条人工审计留作后续工作。
- 外部效度(§8.1):生成条目可能把真实工具轨迹、界面观察、长程状态和机构安全约束写得过简。作者称用于操作主张之前,应先在真实轨迹上检验迁移。
- 结论效度(§7.1、§8.1):示例研究不足以支持稳定模型排名或部署建议。部分安全格子支持量小,金标签来自一个模型家族,外部榜是活快照。没有人工标定验证子集。
- 审计、复现与发布(§8.1–§8.3):覆盖审计不是独立多标注者研究,分数可随文档或他人重打而改。没有分类定义、量规、提示词、schema、脚本、汇总和确切模型版本时,数字应视为描述性而非可独立复现。作者计划在安全、许可和匿名审查后发布这些材料;若不能发布全部条目,则发布代表性子集或删节的 schema 级例子。作者称论文不依赖已发布公开基准这一主张。
- 使用边界与步骤索引(§9、附录 C.3):作者称它是诊断辅助,不是认证,也不能替代高风险领域或机构策略的人工复核。exact-step 在步骤边界审计完成前视为探索性。
实验覆盖范围
- 协议研究的被测评估器是正文列出的 8 个模型,48 次运行;合成条目 1,342 条,生成模型为 Claude Opus 4.7(§7.2–§7.3)。
- 每格一次完成。temperature=0.0 只在提供方支持时使用,较新 Claude 用提供方默认(附录 C.1)。论文未报告多次重复。
- 覆盖审计按 0/1/2 打六个轴。Table A.1 有 15 行,Efficiency 列没有 2。正文 §6 的 15 个名字与 Table A.1 不一致。
- 论文未报告安全分割各标签格子的样本量,只说若干格子支持量小(§7.1、Table D.3 注)。
- 论文未报告映射器的独立测量准确率,只给作者估计约 3–5%(附录 B)。轨迹 blind 未报告 primary source、impact 与 pri+impact(Table D.2 为“—”)。
总结一下论文的主要内容
作者给出六态控制与轨迹词汇,并称合成协议里提示词和评测轴会改表面结论。
AgentAtlas 是一套诊断词汇和审计协议,用来把智能体的最终成功从控制决策和轨迹质量里拆开。
- 问题:作者认为部署中的智能体不能只按最终答案打分。现有基准分别报解决率、功能成功、攻击成功或轨迹定位,单位并不相同,单独使用会藏住询问、拒绝、停止、确认和恢复。
- 方法:控制轴是 Act、Ask、Refuse、Stop、Confirm、Recover。轨迹轴沿用 AgentRx 的失败类,并加错误来源和下游影响两层标签。再用 0/1/2 看基准覆盖了控制、轨迹、工具、安全、记忆和效率中的哪一轴。
- 协议:Claude Opus 4.7 生成 1,342 条合成条目。八个模型在给出闭集菜单和不给菜单两种提示词下做诊断。作者称这不是公开基准,也不是部署排名。
- 数字:Table D.1 中 Haiku 4.5 的 Control aware 准确率是 0.946,gpt-oss-20B 是 0.743。作者称去掉菜单后,轨迹映射一致率下降 14.8 至 40.1 个百分点。Table D.3 中 Haiku 4.5 的安全效用保持是 0.279,gpt-5.4-mini 是 0.984,且后者 aware 的 safe refusal 是 0.000。
- 审计:Table A.1 上 Tool 为 2 的有 9 of 15;Control 为 2 的只有 τ-bench 和 ToolSandbox;Efficiency 没有 2。§6 与 Table A.1 的 15 个名字不完全相同。
- 作者结论:合成结果只用来显示提示词格式和评测轴会改变表面结论。作者认为该被看见的是:智能体是否在该行动、询问、拒绝、停止、确认和恢复的时候做对,而不是把这些决定留在最终成功里面。