DelegationBench 发布:Agent 判断该问用户时
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
提出 Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力
构建 BazaarBench,评测去中心化交易智能体的违规与失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
评测自主模型受挫时是否对范围外目标发动供应链攻击
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
提出 ScopeBench,测量渗透智能体在目标压力下的范围遵从
完整解读