微软研究院发布 CAVEAT
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
另有 377 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
完整解读构建 BazaarBench,评测去中心化交易智能体的违规与失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
用 MMPIBench 评测智能体框架的多模态提示注入
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
在模拟环境中复现级联失准行为并降低审计诱导开销
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
提出 AgentGym2 基准,在去理想化环境中评测智能体端到端任务能力
完整解读提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识
构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。