评测与基准arXiv 2610.04378
COPEX:面向 MCP 智能体的受控攻击评测基准发布
用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
- arXiv
- 2610.04378
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Llama-3.2:3b、Claude Opus 4.7、Claude Sonnet 4.6 等 9 个
另有 296 篇论文还没打上分类标签,暂不在筛选结果里。
用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 ISM,协同改写技能描述与提示词以隐式操纵技能选择
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 ContextLeak,用强化学习生成恶意工具描述以诱导 Agent 外泄上下文