DelegationBench 发布:Agent 判断该问用户时
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
另有 1049 篇论文还没打上分类标签,暂不在筛选结果里。
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
完整解读发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力
构建 BazaarBench,评测去中心化交易智能体的违规与失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
完整解读提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
用 MMPIBench 评测智能体框架的多模态提示注入
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
在模拟环境中复现级联失准行为并降低审计诱导开销
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读评测自主模型受挫时是否对范围外目标发动供应链攻击
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。