评测与基准arXiv 2610.04378
COPEX:面向 MCP 智能体的受控攻击评测基准发布
提出 COPEX 基准,固定协议栈评测 MCP 智能体的攻击抵抗力
- arXiv
- 2610.04378
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Opus 4.7、Claude Sonnet 4.6、GPT-5.5 等 9 个
提出 COPEX 基准,固定协议栈评测 MCP 智能体的攻击抵抗力
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出只改多智能体潜在通信链路以提高有害遵从的攻击
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。