DelegationBench 评测 Agent 授权委托行为
先了解这件事
研究者发布 DelegationBench,用 156 个场景(含 48 组只改一个特征的对子)测量 AI Agent 何时该先征求用户许可,区分直接执行、请求许可、追问缺失信息和拒绝四种回应。研究发现,Agent 判断该问用户时,实际用工具执行提问率从 47.5% 降到 4.2%;固定回复一个简单的「是」可解决 97.5% 的简单许可问题,但混合型问题只有约 33.3%–75.0%;在规则被明确写出的情况下,三款受测模型的平衡准确率为 97.3%–100%。作者建议把判断一致率、对子响应性、格式敏感度和实际执行行为一并纳入评测。另有同名工作 DiscretionBench 用 156 个场景测试 Agent 执行前是否应先征求授权,每个场景给出用户指令、上下文和候选工具调用,模型需在直接执行、请求授权、追问缺失信息或拒绝之间选择,其中 48 组配对场景仅改变一个特征(如文件移入回收站还是永久删除),用于检验决策是否依赖可逆性;论文评估了 5 个家族的 10 款模型,报告了单一一致率掩盖的三个差距。
AI 根据报道生成 · 45 分钟前更新
后续时间线
- PieLord757/delegation-bench精选DiscretionBench 发布:Agent 判断该不该先问用户,拿到工具后询问率大幅下降
研究者发布 DiscretionBench,用 156 个场景测试 AI Agent 在执行动作前是否应先征求用户授权。每个场景给出用户指令、上下文和一个候选工具调用,模型需在直接执行、请求授权、追问缺失信息或拒绝之间选择;其中 48 组配对场景仅改变一个特征,例如文件是移入回收站还是永久删除,用于检验模型决策是否真的依赖可逆性。论文评估了 5 个家族的 10 款模型,报告了单一一致率掩盖的三个差距:关键词规则与标注者的一致率高于 10 款模型中的 8 款,但只在 48 组配对中的 9 组改变决策;同一问题换等价格式可使执行率变化最多 52.5 个百分点;所有模型在需要用工具实际执行任务时(Tool-Loop)比仅判断候选动作时更少询问用户。仓库包含基准、提示词、工具沙箱、分类结果和无需调用模型即可核验数字的脚本,代码用 MIT 许可,数据用 CC BY 4.0 许可。
- 论文追踪精选DelegationBench 发布:Agent 判断该问用户时,实际用工具执行提问率从 47.5% 降到 4.2%
研究者发布 DelegationBench,用 156 个场景(含 48 组只改一个特征的对子)测量 AI Agent 何时该先征求用户许可,区分直接执行、请求许可、追问缺失信息和拒绝四种回应。研究还发现固定回复一个简单的「是」可解决 97.5% 的简单许可问题,但混合型问题只有约 33.3%–75.0%;在规则被明确写出的情况下,三款受测模型的平衡准确率为 97.3%–100%。作者建议把判断一致率、对子响应性、格式敏感度和实际执行行为分开报告,并公开了基准与评测工具。
相关讨论
关注度走势
每天新增来源
- 10月8日 新增 2 个来源(2 家媒体、0 个账号)