DelegationBench 发布:Agent 判断该问用户时
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
另有 383 篇论文还没打上分类标签,暂不在筛选结果里。
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
完整解读发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力
构建 BazaarBench,评测去中心化交易智能体的违规与失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
完整解读提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
重评提示注入检测器,检验基准分数对智能体部署的预测力
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
用 MMPIBench 评测智能体框架的多模态提示注入
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
在模拟环境中复现级联失准行为并降低审计诱导开销
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务