跳到正文
原文
PieLord757/delegation-bench·本站收录 · 原文发表 日期未标精选关注度66

DiscretionBench 发布:Agent 判断该不该先问用户,拿到工具后询问率大幅下降

DelegationBench:agent 嘴上说「该先问用户」,真拿到工具却很少问,Gemini 3.5 Flash-Lite 从 47.5% 掉到 4.2%(代码与数据)

AI 导读

研究者发布 DiscretionBench,用 156 个场景测试 AI Agent 在执行动作前是否应先征求用户授权。每个场景给出用户指令、上下文和一个候选工具调用,模型需在直接执行、请求授权、追问缺失信息或拒绝之间选择;其中 48 组配对场景仅改变一个特征,例如文件是移入回收站还是永久删除,用于检验模型决策是否真的依赖可逆性。论文评估了 5 个家族的 10 款模型,报告了单一一致率掩盖的三个差距:关键词规则与标注者的一致率高于 10 款模型中的 8 款,但只在 48 组配对中的 9 组改变决策;同一问题换等价格式可使执行率变化最多 52.5 个百分点;所有模型在需要用工具实际执行任务时(Tool-Loop)比仅判断候选动作时更少询问用户。仓库包含基准、提示词、工具沙箱、分类结果和无需调用模型即可核验数字的脚本,代码用 MIT 许可,数据用 CC BY 4.0 许可。

推荐理由

DiscretionBench 用 48 组配对场景区分模型是否真按可逆性等特征决定是否征求授权,并公开了 156 个场景与十款模型的分类结果。

阅读原文github.com