评测与基准arXiv 2610.04378
COPEX:面向 MCP 智能体的受控攻击评测基准发布
提出 COPEX 基准,固定协议栈评测 MCP 智能体的攻击抵抗力
- arXiv
- 2610.04378
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Opus 4.7、Claude Sonnet 4.6、GPT-5.5 等 9 个
另有 441 篇论文还没打上分类标签,暂不在筛选结果里。
提出 COPEX 基准,固定协议栈评测 MCP 智能体的攻击抵抗力
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出只改多智能体潜在通信链路以提高有害遵从的攻击
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出 Agent Flight Recorder,为长时程工具智能体提供链上锚定的防篡改审计
Agent Flight Recorder 把长程工具智能体的动作收成可被第三方独立核验的审计记录,面向运营方本身可能改写历史的争议。
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门