A2M:针对 MCP 生态的两阶段 Agent 劫持框架
提出两阶段黑盒劫持框架,优化恶意工具元数据与返回载荷以操纵智能体
论文提出了一种针对模型上下文协议(MCP)智能体的两阶段黑盒劫持框架 A2M。
- 问题背景:MCP 智能体自主从第三方服务匹配工具并信任执行返回,带来了语义元数据与输出载荷双重受控的供应链安全隐患,而现有攻击未能有效串联工具选择与调用后操纵。
- 方法核心:A2M 将攻击解耦为吸引与操纵两阶段;前期运用五类说服策略迭代工具名称与描述,筛选高调用率精英元数据;后期依托分析器-优化器架构,根据执行轨迹的结构化诊断反馈定向精炼返回载荷。
- 直接攻击结果:在 LiveMCPBench 上以 GLM-4.6 为目标模型,A2M 的平均恶意工具调用率达到 93.6%,C-DoS 加权 token 成本扩大至良性基线的 32.4 倍,IE、EIC 和 RD 的攻击成功率分别达到 65.9%、64.3% 和 92.9%(Table 1)。
- 迁移攻击结果:将 GLM-4.6 上优化的工具直接迁移至 Qwen3-Max、DeepSeek-V3.1、Kimi-K2-0905 和 GPT-5 四个模型,平均调用率为 63.6%,C-DoS 平均成本为 2.7 倍,三个场景平均攻击成功率为 24.5%(Table 1)。
- 高调用与成功断层:实验显示工具调用并不等同于攻击成功,如 GPT-5 在 64.9% 至 76.3% 的调用率下 IE 和 EIC 的成功率均为 0.0%(Table 1);未成功攻击中载荷被忽略为主要失效原因(Table 8)。
- 防御与生态启示:评估显示困惑度检测与元数据释义难以完全阻断攻击,信息流控制虽能降低攻击成功率但仍存残余风险;作者呼吁 MCP 生态应建立更为严格的工具准入审查与运行时隔离机制。