DelegationBench 发布:Agent 判断该问用户时
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
另有 380 篇论文还没打上分类标签,暂不在筛选结果里。
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
完整解读提出 DIBench,评测界面注入对移动智能体选择决策的操纵
提出 Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
完整解读评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
完整解读发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
评测启用工具调用后多模态模型拒答有害图文请求的变化
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力