微软研究院发布 CAVEAT
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
另有 377 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
完整解读提出 DIBench,评测界面注入对移动智能体选择决策的操纵
提出 Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
完整解读发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力
评测启用工具调用后多模态模型拒答有害图文请求的变化
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力
重评提示注入检测器,检验基准分数对智能体部署的预测力
用 MMPIBench 评测智能体框架的多模态提示注入
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 AgentGym2 基准,在去理想化环境中评测智能体端到端任务能力
完整解读提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识