DelegationBench 发布:Agent 判断该问用户时
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
另有 377 篇论文还没打上分类标签,暂不在筛选结果里。
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
完整解读提出 DIBench,评测界面注入对移动智能体选择决策的操纵
提出 Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
完整解读发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力
提出操作有效性契约,审计激活监控从探针分数到告警策略的有效性
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
评测启用工具调用后多模态模型拒答有害图文请求的变化
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
重评提示注入检测器,检验基准分数对智能体部署的预测力
用 MMPIBench 评测智能体框架的多模态提示注入
在模拟环境中复现级联失准行为并降低审计诱导开销