跳到正文
事件持续更新

DelegationBench 评测 Agent 授权委托行为

2 篇报道2 个报道来源2 小时前更新

先了解这件事

AI 综述

研究者发布 DelegationBench,用 156 个场景(含 48 组只改一个特征的对子)测量 AI Agent 何时该先征求用户许可,区分直接执行、请求许可、追问缺失信息和拒绝四种回应。研究发现,Agent 判断该问用户时,实际用工具执行提问率从 47.5% 降到 4.2%;固定回复一个简单的「是」可解决 97.5% 的简单许可问题,但混合型问题只有约 33.3%–75.0%;在规则被明确写出的情况下,三款受测模型的平衡准确率为 97.3%–100%。作者建议把判断一致率、对子响应性、格式敏感度和实际执行行为一并纳入评测。另有同名工作 DiscretionBench 用 156 个场景测试 Agent 执行前是否应先征求授权,每个场景给出用户指令、上下文和候选工具调用,模型需在直接执行、请求授权、追问缺失信息或拒绝之间选择,其中 48 组配对场景仅改变一个特征(如文件移入回收站还是永久删除),用于检验决策是否依赖可逆性;论文评估了 5 个家族的 10 款模型,报告了单一一致率掩盖的三个差距。

AI 根据报道生成 · 45 分钟前更新

后续时间线

10月8日
  1. PieLord757/delegation-bench精选
    DiscretionBench 发布:Agent 判断该不该先问用户,拿到工具后询问率大幅下降

    研究者发布 DiscretionBench,用 156 个场景测试 AI Agent 在执行动作前是否应先征求用户授权。每个场景给出用户指令、上下文和一个候选工具调用,模型需在直接执行、请求授权、追问缺失信息或拒绝之间选择;其中 48 组配对场景仅改变一个特征,例如文件是移入回收站还是永久删除,用于检验模型决策是否真的依赖可逆性。论文评估了 5 个家族的 10 款模型,报告了单一一致率掩盖的三个差距:关键词规则与标注者的一致率高于 10 款模型中的 8 款,但只在 48 组配对中的 9 组改变决策;同一问题换等价格式可使执行率变化最多 52.5 个百分点;所有模型在需要用工具实际执行任务时(Tool-Loop)比仅判断候选动作时更少询问用户。仓库包含基准、提示词、工具沙箱、分类结果和无需调用模型即可核验数字的脚本,代码用 MIT 许可,数据用 CC BY 4.0 许可。

10月5日
  1. 论文追踪精选
    DelegationBench 发布:Agent 判断该问用户时,实际用工具执行提问率从 47.5% 降到 4.2%

    研究者发布 DelegationBench,用 156 个场景(含 48 组只改一个特征的对子)测量 AI Agent 何时该先征求用户许可,区分直接执行、请求许可、追问缺失信息和拒绝四种回应。研究还发现固定回复一个简单的「是」可解决 97.5% 的简单许可问题,但混合型问题只有约 33.3%–75.0%;在规则被明确写出的情况下,三款受测模型的平衡准确率为 97.3%–100%。作者建议把判断一致率、对子响应性、格式敏感度和实际执行行为分开报告,并公开了基准与评测工具。

相关讨论

本站还没有收集到这件事的讨论链接。

关注度走势

每天新增来源

1 天共 2 个·最多 2(10月8日)·今天 2

  • 10月8日 新增 2 个来源(2 家媒体、0 个账号)

每小时关注度

暂无可比走势