COPEX:面向 MCP 智能体的受控攻击评测基准发布
用COPEX基准在固定协议栈下评测智能体抵御MCP攻击的能力
COPEX 是一个针对模型上下文协议(MCP)智能体的安全评测基准,旨在评估大语言模型面对不同协议层对抗性上下文时的鲁棒性。
另有 3 篇论文还没打上分类标签,暂不在筛选结果里。
用COPEX基准在固定协议栈下评测智能体抵御MCP攻击的能力
COPEX 是一个针对模型上下文协议(MCP)智能体的安全评测基准,旨在评估大语言模型面对不同协议层对抗性上下文时的鲁棒性。
用MMPIBench评测智能体框架的多模态提示注入
构建ActBench评测协作智能体多步执行中的操作级行为安全
构建THINKINGBOX沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
在模拟环境中复现级联失准行为并降低审计诱导开销
构建无污染的SRE-Bench,评测智能体在真实规模二进制上的逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
构建Emergence World,评测长时程多智能体对抗韧性与群体失效