A2M:针对 MCP 生态的两阶段 Agent 劫持框架
作者提出两阶段黑盒劫持框架 A2M,在 GLM-4.6 优化后迁移至 4 个黑盒模型,平均恶意工具调用率为 63.6%。
- 63.6%以GLM-4.6为代理模型,迁移至4个目标模型的四场景平均MTIR(Table 1)
- 24.5%以GLM-4.6为代理模型,迁移至4个目标模型在IE、EIC、RD上的平均ASR(Table 1)
- 2.7×以GLM-4.6为代理模型,迁移至4个目标模型的C-DoS平均加权成本倍数(Table 1)
论文研究 MCP 智能体在第三方工具生态中的语义供应链风险,解决如何使恶意工具既能被智能体选中又能有效劫持其后续执行的问题。
相关研究包括工具增强智能体、大模型对抗攻击、智能体提示注入及工具选择偏置,作者指出既有工具攻击未联合优化元数据与返回载荷。
A2M 将攻击解耦为元数据优化与载荷精炼两阶段,结合五种说服策略与分析器-优化器架构,利用执行轨迹反馈进行黑盒迭代。
实验在 LiveMCPBench 上测试了五种模型,A2M 在直接攻击与迁移场景下均取得较高调用率,但跨模型完整攻击成功率出现下降。
作者指出研究局限在语义层攻击假设、依赖执行轨迹及固定智能体框架,实验覆盖了五种模型、四个场景与多种防御。
A2M 揭示了 MCP 智能体语义供应链风险,通过两阶段优化实现高调用率与推理劫持,且工具调用迁移性强于攻击成功率。