DelegationBench 发布:Agent 判断该问用户时,实际用工具执行提问率从 47.5% 降到 4.2%
DelegationBench:agent 嘴上说「该先问用户」,真拿到工具却很少问,Gemini 3.5 Flash-Lite 从 47.5% 掉到 4.2%
作者提出 DelegationBench 评估 10 款模型何时应请示用户,发现人类一致率易被简单规则超越且判断与工具执行存在系统性脱节。
- 智能体在代表用户执行任务时需权衡自主执行与事前请示,而现有仅依赖人工标注一致率的评测方法难以有效反映模型是否真正理解动作的授权边界与决策依据。
- 提出包含156个场景与48组单变量配对控制的DelegationBench,区分执行、请示、索取信息与拒绝四类响应,并在5种提示格式与工具执行沙盒中对比模型的判断与行动差异。
- 简单关键词规则的一致率达69.1%且超过8款模型;提示格式使模型执行率最高波动52.5个百分点;所有模型在工具调用沙盒中的请示频率均低于判断设定,如Gemini 3.5 Flash-Lite从47.5%降至4.2%。
- 场景为缺乏真实部署环境的合成数据,代价与可逆性配对存在混杂变量;仅有3名技术背景学生标注且参考标签偏向两类;工具沙盒无持久化状态且差距原因尚未完全厘清。
- 模型
- GPT-5.6 SolGPT-5.6 TerraGPT-5.6 LunaGPT-OSS-120BGPT-OSS-20BClaude Sonnet 5Claude Opus 4.8Gemini 3.6 FlashGemini 3.5 Flash-LiteQwen 3.6 27B
- 基准
- DelegationBenchtau-bench
- 指标
- Four-way agreementAct/non-act agreementUnder-interventionOver-interventionPair responsivenessBrier scoreBalanced accuracy
研究者发布 DelegationBench,用 156 个场景(含 48 组只改一个特征的对子)测量 AI Agent 何时该先征求用户许可,区分直接执行、请求许可、追问缺失信息和拒绝四种回应。研究还发现固定回复一个简单的「是」可解决 97.5% 的简单许可问题,但混合型问题只有约 33.3%–75.0%;在规则被明确写出的情况下,三款受测模型的平衡准确率为 97.3%–100%。作者建议把判断一致率、对子响应性、格式敏感度和实际执行行为分开报告,并公开了基准与评测工具。
推荐理由DelegationBench 用 48 组对照场景和工具沙箱,量化了 Agent 授权判断与实际行动之间的落差,可对照检查自家评测口径。
深度解读
这篇论文试图解决什么问题?
传统人工一致率得分无法可靠评估智能体是否懂得在采取行动前主动向用户请示授权。
在评估智能体何时自主执行动作、何时应先征求用户许可时,单一人工标注一致率得分存在系统性误导,无法独立作为可靠的评估指标。
- 任务决策背景:智能体在处理邮件、日历、文件与代码等操作时,未经许可擅自行动易引发难以挽回的损害,而事事请示又会削弱自动化价值,因而精准划定授权边界至关重要。
- 现有评测缺陷:通用评测通常向模型展示拟定动作并比对人工标注一致率,但高分往往掩盖了模型对关键决策特征缺乏响应的实质。
- 核心观察与三项差距:作者发现一致率指标存在三项核心缺陷,即高分无法反映特征敏感度的响应性差距、提问形式改变导致结果波动的诱导差距,以及静态判断脱离实际工具调用的判断到动作差距。
- 提出的基准方案:作者构建了包含 156 个场景与 48 组单变量控制配对的 DelegationBench,解耦四类决策响应,并在判断与工具调用双重环境中综合评估。
有哪些相关研究?
研究涉及智能体基准、授权与权限控制、主动提问澄清机制以及基准测试度量有效性。
相关研究主要围绕智能体任务完成基准、权限与授权机制、主动提问澄清以及评测度量有效性展开。
智能体通用与安全基准测试
- ReAct、AgentBench 与 WebArena(Yao et al., 2023; Liu et al., 2024; Zhou et al., 2024)——测试规划与工具调用完成率。
- τ-bench 与 ToolSandbox(Yao et al., 2025; Lu et al., 2025)——引入领域规则、用户交互与缺失信息场景。
- ToolEmu、AgentDojo 与 AgentHarm(Ruan et al., 2024; Debenedetti et al., 2024; Andriushchenko et al., 2025)——测试智能体在风险操作、提示注入与恶意请求下的有害行为。
授权与权限控制研究
- AuthBench、Janus 与 AgentRedBench(Yan et al., 2026; Brigham et al., 2026; Dingeto & Leeney, 2026)——分别研究最小权限文件访问策略生成、用户参与式权限助手以及第三方集成的授权红队测试。
- AuthorizationBench(Anonymous, 2026)——构建 286 个可执行任务测试越权行为,发现模型在 10.5% 至 26.6% 的运行中越权;作者指出该工作仅度量行动中的越权单一错误,而 DelegationBench 同时度量过度干预与干预不足,并解耦了许可与信息诉求。
- AgentAbstain 与 AgentBoundary(Liu et al., 2026; Yang et al., 2026)——测试智能体弃权边界与风险识别,发现模型常拒绝看似有风险但已获授权的操作。
主动澄清与信息获取
- Clamber、QuestBench 与 AskBench(Zhang et al., 2024; Li et al., 2025; Zhao et al., 2026)——测试模型发现歧义并索取缺失事实的能力。
- Suri et al. 与 When2Call(Suri et al., 2026; Ross et al., 2025)——分别区分未指定工具参数与模型不确定性,以及工具调用、回答与追问的不同决策。
基准测试有效性与言行脱节
- Pezeshkpour & Hruschka 与 Gringras(Pezeshkpour & Hruschka, 2024; Gringras, 2026)——发现多选题选项顺序与评测格式对模型测量表现产生明显变动。
- Tang et al. 与 Chen et al.(Tang et al., 2025; Chen et al., 2026)——指出模型能够识别危险命令但在轨迹中仍会执行,或标记拦截后依然倾向于行动;作者指出本研究在良性动作的授权边界上同样发现了判断与执行的脱节。
基线方法与定位
- 研究设计了三行启发式关键词规则作为反例对比,并在包含 156 个场景的 DelegationBench 上进行基准测试。作者称,现有工作大多将征求许可与索取信息或拒绝合并,DelegationBench 细分了四类响应,通过成对控制单变量特征,并在同一批场景下对比判断与工具调用表现。
论文如何解决这个问题?
构建单变量配对控制基准测试,区分四类决策响应,并在多提示格式与沙盒执行中联合对比。
作者提出了 DelegationBench 评测基准与多阶段测试协议,通过单变量受控配对场景与工具执行沙盒,量化模型在判断与行动中的决策差异。
决策响应的四分类设定
- 模型面对用户指令、上下文和拟定动作时,需在四个互斥动作中做出选择:
- ACT(立即执行):模型具备充分的许可和完成任务的事实信息。
- ASK(征求许可):动作可行且清晰,但属于需要用户明确批准的关键事项。
- REQUEST(索取信息):执行任务所需的关键事实信息缺失,无法立即执行。
- REFUSE(直接拒绝):因有害、违规或根本不妥当而拒绝执行,非因缺少许可或事实信息。
- 解耦设计理由:作者称,区分征求许可与索取信息对系统修复至关重要,因为前者需要用户意图授权,后者需要客观事实输入,合并两者会遮蔽模型缺乏的具体要素。
单变量配对场景构建
- 48 对核心配对场景:共包含 96 个场景,每组配对仅改变单一关键特征(Figure 5):
- 范围(Scope):用户指令是明确要求该操作还是仅要求较窄范围(共 12 对)。
- 代价(Stakes):发生错误所造成的损失程度(共 12 对)。
- 可逆性(Reversibility):动作是否可以撤销,例如移至废纸篓与彻底清除(共 12 对)。
- 可见性(Visibility):操作产生的结果是否会被其他外部人员看到(共 12 对)。
- 校验与对照场景:额外构建 60 个场景,包括 24 个词汇与后果正交场景(6 个 2×2 家族)、12 个事实缺失对照用例、16 个改写用例和 8 个边界用例,覆盖文件、日历、通信、采购、系统代码和社交发布等 6 个领域。
人工多数派参考标准
- 独立人工标注:由 3 名具备 AI 背景但未参与基准构建的计算机专业学生独立标注全部 156 个场景(Appendix H.1)。
- 多数派裁决规则:149 个场景形成多数派标签(79 个三票一致,70 个二比一多数),7 个场景未达成多数派;多数派标签包含 69 个 ACT、71 个 ASK、8 个 REQUEST 和 1 个 REFUSE。
- 定位说明:克里彭多夫 alpha 系数在二分类下为 .543,四分类下为 .437;作者将多数派标签作为知情参考点,而非绝对客观真值。
多阶段实验协议与评测沙盒
- 诱导格式扰动评测:测试 5 种等价形式,包括原始菜单、选项顺序平衡轮换、精简版、策略版和无标签开放式问答(Appendix G)。
- Tool-Loop 交互沙盒:在包含 15 种模拟工具的环境中将 48 个配对场景转化为任务,不展示拟定动作,模型可自主调用工具或发起提问,最多交互 3 轮(Appendix K)。
- Post-Approval 流程跟踪:当模型在沙盒中提问时,系统固定返回批准回复,跟踪模型后续是调用拟定工具还是重复询问(Appendix K.3)。
- 模型面对用户指令、上下文和拟定动作时,需在四个互斥动作中做出选择:
论文做了哪些实验?
评测揭示模型对关键特征响应钝化、格式波动显著、工具执行中请示频率大幅缩减三项缺陷。
实验设置
- 被测模型:评测 5 个家族的 10 款模型,包括 OpenAI 的 GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna;Groq 托管的开源模型 GPT-OSS-120B、GPT-OSS-20B;Anthropic 的 Claude Sonnet 5、Claude Opus 4.8;Google 的 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite;以及 Groq 托管的 Qwen 3.6 27B 预览版。
- 评测基准与规模:主研究包含 DelegationBench 全部 156 个场景(149 个具有多数派标签);跟进研究在 48 个配对场景上展开(其中 29 个具备完全可推断的工具参数)。
- 基线设定:构建三行启发式关键词规则作为反例对比(若含 15 个缺失信息短语则选 REQUEST,若含 14 个风险词则选 ASK,否则选 ACT)。
- 主要指标定义:四分类一致率(Four-way agreement)、二分类一致率(Act/non-act agreement)、欠干预率(Under-intervention,标注不执行而模型执行)、过干预率(Over-intervention,标注执行而模型未执行)、配对响应度(Pair responsiveness,48 对中决策向预期方向变动的比例)及 Brier 分数。
- 运行参数与重复次数:每个模型在 156 个场景上各重复运行 5 次试验,主研究共 7,800 次评估;采用各提供商的中等推理设置(Table 4)。
主结果
表格较宽,可左右滑动
模型 四分类一致率 (%) 执行/不执行一致率 (%) 欠干预率 (%) 过干预率 (%) Gemini 3.5 Flash-Lite 73.4 75.7 20.2 29.0 Gemini 3.6 Flash 71.9 75.6 25.3 23.5 Claude Sonnet 5 68.7 71.1 36.5 20.0 Claude Opus 4.8 65.5 68.7 40.3 20.9 GPT-5.6 Terra 60.4 66.3 43.8 22.0 GPT-5.6 Luna 60.0 67.4 41.5 22.3 Qwen 3.6 27B 58.7 62.4 38.5 26.7 GPT-5.6 Sol 58.1 61.6 54.8 19.4 GPT-OSS-120B 54.5 59.5 55.3 23.5 GPT-OSS-20B 50.6 56.5 58.8 25.8 - 一致率总体分布与简单规则对比:模型四分类一致率介于 50.6% 至 73.4% 之间,始终选 ACT 或 ASK 的一致率分别为 46.3% 与 47.7%,而三行关键词规则一致率达 69.1%,超过 10 款模型中的 8 款(Figure 3)。
- 错误倾向的分化:GPT 家族模型的欠干预率较高,在标注不应直接执行的场景中执行比例达 41.5% 至 58.8%,而各模型的过干预率相对平稳,介于 19.4% 至 29.0% 之间(Table 1)。
- 帕累托前沿表现:在欠干预与过干预两项指标上,GPT-5.6 Sol、Claude Sonnet 5、Gemini 3.6 Flash 与 Gemini 3.5 Flash-Lite 构成帕累托前沿(Figure 7)。
特征敏感度与响应性差距
- 测了什么:在 48 组单变量配对场景中检验模型执行率是否随范围、代价、可逆性与可见性发生相应调整(Table 12)。
- 实验结果:指令范围改变使所有模型执行率下降 78.3 至 100.0 个百分点;不可逆操作使执行率下降 16.7 至 63.3 个百分点;增加代价使执行率下降 0.0 至 65.0 个百分点(Gemini 3.5 Flash-Lite 在 12 对代价配对中变化为 0.0 个百分点);外部可见性变化在 -16.7 至 +1.7 个百分点之间。
- 作者的解读:模型将指令是否明确要求视作硬性边界,而对代价与可逆性缺乏一致判断;一致率与配对响应度呈负相关(Spearman 秩相关系数为 -.529),表明高一致率不代表模型对关键特征具有敏感性。
诱导格式敏感度与选项顺序影响
- 测了什么:在原始菜单、选项顺序平衡轮换、精简描述、策略式和开放式 5 种等价格式下测试模型执行率漂移(Table 18、Section 5.2)。
- 实验结果:模型执行率在不同格式间的最大变动幅度在 4.2 个百分点(Claude Opus 4.8)至 52.5 个百分点(GPT-OSS-20B)之间;选项顺序平衡轮换使 9 款模型的 Brier 分数得到优化。
- 作者的解读:评估所得的行为模式高度依赖提问方式,单一提示格式的得分存在脆弱性,作者建议通过选项顺序平衡来缓解位置偏差。
判断与工具行动脱节(Tool-Loop 与 Post-Approval)
- 测了什么:在沙盒中让模型自主调用工具,对比判断场景与工具执行场景的请示比例,并在获得许可后检验后续调用(Table 11、Table 21、Appendix L)。
- 实验结果:所有模型在工具执行中的提问率均低于判断场景(Gemini 3.5 Flash-Lite 从 47.5% 降至 4.2%,Gemini 3.6 Flash 从 40.0% 降至 6.7%);获得许可后,单纯许可请求有 97.5%(117/120)执行了工具调用,而时间相关请求仅有 33.3% 执行;双盲人工审查评定 93.9% 与 96.0% 的工具调用在语义上符合拟定动作,而严格参数匹配仅接受 59.3%(600/1,011)。
- 作者的解读:基于判断的评测高估了智能体在实际执行中的谨慎程度;严格参数匹配主要拦截的是格式差异而非实质错误。
显式规则遵循对照实验
- 测了什么:在明确书面策略(96 个合成用例)及 τ-bench 改编的 17 个零售决策点上测试 GPT-5.6 Luna、Claude Sonnet 5 与 Gemini 3.5 Flash-Lite(Table 2、Table 28、Table 31)。
- 实验结果:自然语言策略下的平衡准确率为 97.3% 至 100.0%(Luna 100.0%, Sonnet 5 97.6%, Flash-Lite 97.3%);在 τ-bench 决策点上 3 款模型的平衡准确率均为 100.0%,未授权动作尝试率为 0.0%。
- 作者的解读:上述差距并非源于模型缺乏基本的规则理解或遵循能力,而是在授权存在模糊性(日常委托常见场景)时的固有缺陷。
其他消融与分析
- 词汇正交控制中,后果上下文对执行率的影响幅度均大于等于词汇线索本身(Table 8)。
- 提示词复述测试中,16 个改写用例与母场景的决策一致率为 81.3% 至 100.0%(Table 9)。
- 双模型评审员对一句话理由的重编码一致率为 98.6%(Table 13)。
- 评审员指出 146 个模型拒绝决策中有 41 个本质上是缺乏授权而非真正拒绝(Appendix F.1)。
有什么可以进一步探索的点?
后续需补充真实部署场景与非技术人群标注,并深入排查判断到工具执行差异的因果机制。
作者指出的局限与后续方向
- 合成场景缺乏真实部署代表性:DelegationBench 包含 156 个简短合成场景且每个用例仅包含单一拟定动作,未直接取自真实部署环境,无法反映实际发生概率与真实用户偏好(Section 7)。
- 配对家族覆盖与混杂变量:每个特征仅由 3 个场景家族构成 12 组配对,且在代价与可逆性配对中有 13 对改变了除目标特征外的其他变量(如任务成功可能性或额外资金损失)(Section 7)。
- 人类标注群体规模与代表性有限:标注仅由 3 名具有计算机背景的学生完成,群体规模较小且不具代表性,且参考标签几乎全部为 ACT 与 ASK,缺乏足够的 REQUEST 与 REFUSE 样本来对模型进行对应排序(Section 7)。
- 动作审查员机构独立性不足:对应性审查的 2 位审查员来自作者所在实验室,属于程序独立但非机构独立,且仅对 200 个调用进行了抽样审查而非全量审查(Section 7)。
- 判断到行动差距的因果机制尚未明确:Tool-Loop 相较于判断设定同时改变了拟定动作呈现、响应格式与工具构造要求等多项因素,工具缺乏持久化状态,两款模型存在未完成运行,差距被记录但未被完全解释(Section 6、Section 7)。
- 显式规则测试范围较为狭窄:显式策略检验仅覆盖 3 款模型、未经人工审核的事实改写与 17 个零售决策点,并非端到端完整任务评测(Section 7)。
实验覆盖范围
- 被测模型范围:覆盖 5 个模型家族的 10 款语言模型(GPT-5.6 Sol/Terra/Luna、GPT-OSS-120B/20B、Claude Sonnet 5/Opus 4.8、Gemini 3.6 Flash/3.5 Flash-Lite、Qwen 3.6 27B 预览版)。
- 评测场景与领域分布:包含 156 个合成场景,覆盖文件、日历、通信、采购、代码/系统、发布等 6 个业务领域,其中核心配对评测为 48 对场景。
- 沙盒交互设置限制:Tool-Loop 包含 15 种模拟工具,交互限制在最多 3 轮,参数精确重构分析仅覆盖完全可推断的 29 个场景;沙盒无持久化状态记录。
- 显式规则评测对象:显式规则验证仅在 GPT-5.6 Luna、Claude Sonnet 5 与 Gemini 3.5 Flash-Lite 3 款模型上运行,包含 96 个合成用例与 17 个改编自 τ-bench 的决策点。
- 未报告信息陈述:论文未报告真实生产部署环境的用户行为数据,未报告机构独立的外部人工全面核验,且未测试展示消息文本条件下的拒绝表现。
总结一下论文的主要内容
论文揭示一致率指标的系统性误导,为智能体授权决策建立了兼顾判断与执行的评测协议。
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
- 核心问题定位:通用基准通常展示拟定动作并计算模型决策与人工标注的一致率,但这一单一指标无法反映模型是否真正依据关键情境特征做出决策,且与实际工具执行脱节。
- 方法架构要点:基准包含 156 个短场景,将决策细分为立即执行、征求许可、索取信息与直接拒绝四类;核心设计了 48 组单变量配对控制场景,分别独立调节范围、代价、可逆性与可见性四项特征,并在 5 种提示格式和工具调用沙盒中交叉评测。
- 主要实验发现:
- 简单规则一致率超越多数模型:三行关键词启发式规则在 149 个场景上的多数派一致率达 69.1%,高于 10 款被测模型中的 8 款,但在 48 对配对中仅有 9 对做出响应(Figure 3)。
- 提示格式导致决策漂移:在 5 种等价提示格式下,模型执行率变动幅度最高达 52.5 个百分点(GPT-OSS-20B,Table 18)。
- 工具执行中请示比例明显偏低:在工具调用沙盒中,所有模型向用户请示的比例均低于静态判断设定,例如 Gemini 3.5 Flash-Lite 从 47.5% 降至 4.2%(Table 11)。
- 显式规则下表现优异:在明确书面策略下,3 款被测模型的平衡准确率达 97.3% 至 100.0%(Table 2),表明问题根源在于模糊委托环境下的边界权衡。
- 作者启示与建议:作者认为基于动作判断的静态评测会高估智能体在实际部署中的谨慎性;建议未来授权评测摒弃单一汇总评分,独立报告人工一致率、配对特征响应度、格式敏感度、沙盒工具执行行为以及语义动作对应性五项独立指标。