跳到正文
原文
研究者论文追踪· arXiv:2608.23858· Avital Aviv, Parth A. Gandh, Ron Bitton, Asaf Shabtai·本站收录 · 原文发表 精选关注度32

研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁

Beyond the Mandate: A Systematic Security Analysis of the Agent Payments Protocol (AP2)

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者系统分析Google智能体支付协议AP2 v0.2,指出合法签名无法防御前置上下文操纵,并识别出8个高风险威胁。

威胁模型威胁模型涵盖四类行动者(TA1 User、TA2 Merchant、TA3 Developer/Operator、TA4 External Attacker)、11个攻击面(S1–S11)、18项能力(AC与AK)及六大目标(AG1–AG6),评估AP2 v0.2在A1–A5五类架构下的授权与执行安全。

问题
智能体支付协议AP2通过签名凭据保护交易完整性,但未保护签名签发前的非签名上下文(如A2A消息与MCP工具结果)。攻击者无需伪造签名,仅操纵前置上下文即可诱导生成包含有害操作的合法签名凭据。
方法
将AP2生命周期划分为5个阶段并定义5类部署架构;基于MAESTRO框架对4类行动者、11个攻击面和6类目标建立威胁模型,编目48个威胁并用AIVSS评估风险;搭建测试床完成5项PoC验证,并开发三层安全扫描器。
实验与结果
8个威胁达到High风险等级;STRIDE-GPT覆盖了威胁目录中66.7%的项;8位专家评估AIVSS评级的Gwet's AC2为0.984;三层扫描器Full配置在A5达到1.00召回率,各层均能检出其他层遗漏的威胁。
局限与可以继续做的
评估时无完整公开的AP2生产或原型部署,实验基于自建测试床,未测量对底层银行卡网络与清算系统的影响;三层扫描器在A2遗漏T-2、在A3遗漏T-1与T-9、在A4遗漏T-3。
实验设置gpt-5.3、gpt-5.5 · AP2 testbed、STRIDE-GPT v0.18.0 · Recall、Gwet's AC2 等
模型
gpt-5.3gpt-5.5
基准
AP2 testbedSTRIDE-GPT v0.18.0
指标
RecallGwet's AC2Krippendorff's alphaExact pairwise agreementFull-or-partial coverageAIVSS
AI 导读和推荐理由全文 389 字

以色列本-古里安大学与 Intuit 的研究者对 Google 的 Agent Payments Protocol(AP2)v0.2 做了系统安全分析,将交易生命周期划分为五个阶段、归纳出五类部署架构,并用 MAESTRO 框架建模出 48 项威胁,分为五个攻击家族。作者用 AIVSS 对每项威胁按架构分别评分,其中 8 项在至少一种架构下达到 High 等级。由于当时没有公开的完整 AP2 部署,团队自建覆盖全部五类架构的测试床,开发了 5 个 PoC 演示,覆盖全部 8 项高危威胁及其缓解措施,并实现了一个部署感知扫描器,执行静态、跨角色一致性和对抗性检查。分析指出,AP2 主要保护签名后的 mandate 与收据,而塑造交易的签名前上下文(包括 A2A 消息和 MCP 工具调用)不在保护范围内,因此仅凭有效的 mandate 签名并不能保证代理交易反映用户意图。

推荐理由论文对 AP2 v0.2 的五个部署架构做了系统威胁建模,并给出覆盖 8 个高危威胁的 PoC 与缓解措施,可供实现者对照自查。

深度解读

6 个问题,约 6,300 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。

    论文试图解决智能体支付协议(AP2)在非签名操作上下文与复杂部署架构下缺乏系统性安全分析与威胁模型的问题。

    • 协议应用场景与风险:Google提出的AP2协议利用LLM驱动的购物智能体代表用户执行支付;协议通过可验证凭据(SD-JWT)签名保护结算和支付授权(Mandate)的完整性,但生成凭据前的前置上下文(如A2A协议通信与MCP工具结果)并未纳入密码学保护范围。
    • 现有分析方法的不足:作者指出,既有研究仅针对AP2 v0.1的提示注入、重放或特定工具投毒展开孤立分析,缺乏覆盖AP2 v0.2完整生命周期、信任边界以及不同部署架构的系统性威胁模型。
    • 论文的核心观察:合法签名的凭据无法确保交易符合用户的真实意图;攻击者无需伪造签名,仅通过操纵智能体的前置交互上下文、工具配置或通信渠道,即可使智能体合法签发偏离用户预期的恶意凭据。
    • 威胁模型设定:
      • 攻击者目标:包括未授权支付(AG1)、授权内容篡改(AG2)、授权范围膨胀(AG3)、机密性泄露(AG4)、抗抵赖失效(AG5)及阻断合法支付(AG6)。
      • 攻击者知识与能力:涵盖四类行动者(用户TA1、商户TA2、开发者/运维者TA3、外部攻击者TA4),涉及密钥、凭据、通信渠道及运行时四类访问能力(ACK、ACM、ACC、ACR)与架构/工具等知识能力(AK)。
      • 受害系统与边界:涵盖购物智能体(SA)、商户(M/MA)、凭证提供方(CP)、支付处理方(MPP)与可信交互界面(TS)五大角色,跨越A1至A5五类部署架构。
    • 论文提出的解决方案:作者基于MAESTRO框架建立了跨阶段与架构的威胁模型,编目48个威胁并用AIVSS量化风险,通过5项PoC验证高风险威胁,并实现了一款自动化安全扫描器。
  2. 有哪些相关研究?

    梳理了AP2初期安全性、多智能体商业协议及支撑协议(MCP与A2A)的安全研究现状。

    论文在相关工作与引言中将已有研究组织为以下几组:

    AP2与智能体商业协议安全

    • AP2 v0.1安全性研究:Debi等(2026)针对AP2风格的购物智能体实施提示注入红队测试,报告了恶意内容可操纵排序并泄露用户数据;Lan等(2026)指出了执行层的重放与上下文绑定缺陷,使凭据可能被二次利用。作者指出,既有工作局限于AP2 v0.1,未系统分析AP2 v0.2的新特性、架构差异及跨阶段威胁。
    • 去中心化与跨协议商业安全:Acharya(2025)研究了利用去中心化标识符、可验证凭据和零知识证明的无中介支付;Mao等(2026)总结了涵盖AP2在内的7个智能体商业协议的攻击向量;Hu和Rong(2025)指出当前协议无法同时保障授权完整性与结算可问责性。

    支撑协议安全(MCP与A2A)

    • MCP工具调用安全:多项研究(Hou等,2025;Jamshidi等,2025;Huang等,2026;Narajala和Habler,2025;Maloyan和Namiot,2026)指出了模型上下文协议(MCP)中的工具投毒、工具遮蔽(shadowing)、地毯式撤回(rug pulls)、弱能力证明以及客户端暴露于恶意工具元数据等风险。
    • 智能体间通信安全:Louck等(2025)分析了A2A、ACP和CORAL协议在认证、授权、完整性、机密性和可用性方面的安全风险。作者指出,既有MCP与A2A研究均未分析这些协议层的漏洞如何具体向上传导至AP2。

    基线方法与对比基准

    • 威胁建模对比基线:论文选取STRIDE-GPT(v0.18.0)作为独立基线,用于对比MAESTRO所推导出的威胁目录覆盖度;作者评估了ATFAA、STRIDE-AI与ASTRIDE,因缺少公开可复现分析流程而未作为自动化对比基线,并因官方MAESTRO Analyzer源自相同框架而将其排除。

    本文与既有工作的定位区别 作者称,本文提出了首个横跨AP2 v0.2生命周期阶段、信任边界与部署架构的端到端系统性威胁模型,不仅提供了概念验证攻击与防御缓解措施,还构建了面向实现者的安全扫描工具。

  3. 论文如何解决这个问题?

    划分生命周期与架构,用MAESTRO和AIVSS系统化建模48个威胁并设计三层扫描器。

    作者通过建立跨生命周期与部署架构的威胁模型,并结合自动化扫描器来系统化解决AP2的安全性分析问题,核心框架基于 MAESTRO七层模型 与 AIVSS风险评分体系。

    交易生命周期分阶段与架构分类

    • 五大生命周期阶段:论文将交易解构为凭据前准备(P1,建立密钥与AgentCard)、凭据上下文形成(P2,组装购物车与签发checkout_jwt)、凭据授权(P3,用户授权P3-U与智能体自主签名P3-A)、凭据验证与消费(P4,校验并结算)以及事后留存(P5,审计与争议存证)。
    • 五类部署架构分类:根据是否引入新的跨角色信任边界、共享状态域或工具执行面,定义了5类架构:A1(单智能体SA与MA基线)、A2(独立MCP工具层)、A3(多智能体SA与MA)、A4(Marketplace撮合平台)以及A5(共享MCP工具层)。

    基于MAESTRO的威胁建模与AIVSS风险评估

    • 威胁四元组建模:威胁表示为行动者、攻击面、能力与目标的四元组,覆盖4类行动者(TA1–TA4)、11个攻击面(S1–S11)、18项能力与6类目标(AG1–AG6)。
    • 双层量化评分:底层采用CVSS v4.0基础分衡量协议级可利用性与影响,上层结合智能体AI风险评分(AARS)的10项放大因子计算总分: AARS = ∑i=110 fi,   fi ∈ {0, 0.5, 1} 该公式累加自主性、工具使用、记忆、非确定性等10项智能体特有风险因子。
    • 最终综合风险计算:综合协议严重度与智能体放大倍数,按以下公式计算固有风险: AIVSS = round((CVSSbase + AARS)/2 × ThM × MF, 1) 公式中算术平均使两者权重均等,因评估属于PoC阶段,取威胁成熟度乘数ThM=0.97,无缓解折扣下取缓解因子MF=1.0,四舍五入保留一位小数。

    攻击家族分类法

    • 按受损安全对象聚类:将识别出的48个威胁自底向上划分为5个家族:语义操纵F1(篡改对话与工具上下文,10项)、权限冒用F2(篡改签名权限归属,9项)、供应链与信任根颠覆F3(篡改依赖软件或发现端点,13项)、状态绑定失效F4(破坏跨阶段交易状态一致性,9项)以及可问责性失效F5(隐藏实际责任主体或损毁审计证据,7项)。
    • 初始破坏优先原则:若某一威胁同时破坏多个对象,以最先打破AP2协议保证的根因对象作为归类依据。

    自动化安全扫描器设计

    • 四阶段分析流程:扫描器首先解析被测部署的架构、活跃角色与暴露面;接着筛选适用的威胁子集;第三阶段执行静态代码与配置检查;第四阶段汇总证据、阶段与修复建议。
    • 跨角色差分规范评估器(CDSE):针对语义操纵威胁,CDSE比较SA、MA、CP与MPP在同一交易中所使用的约束模式与凭据字段,发现字段定义不一致或偏离用户意图即产生警报。
    • 可选对抗测试层:在受限沙箱中启动影子智能体,对测试实例运行预定义的运行时探测用例。
  4. 论文做了哪些实验?

    通过8名专家重现AIVSS评分、对比STRIDE-GPT,并在自建测试床上完成5项PoC验证与扫描器消融。

    实验设置

    • 评测对象与测试环境:由于当时不存在公开完整的AP2部署,作者搭建了覆盖A1–A5五类架构的自建AP2测试床,并在测试床上部署各协议角色与工具链。
    • 基准模型与基线工具:威胁比对使用STRIDE-GPT(v0.18.0,生成角色采用gpt-5.3);评审模型采用gpt-5.5(温度0、固定随机种子);扫描器CDSE与对抗层采用OpenAI gpt-5.5。
    • 评测指标:威胁目录覆盖度(Full/Partial/None)、评分一致性指标(二次加权Gwet's AC2、Krippendorff's alpha与精确配对一致率)、扫描器检出率(Recall,均值与标准差)。
    • 样本量与重复次数:STRIDE-GPT共生成124条威胁场景;专家评分实验由8位来自学界与业界的独立专家对25个威胁进行评估(共计120次评分);扫描器消融实验中各配置在每类架构上重复运行5次。

    主结果

    下表汇总了经AIVSS评估在至少一种架构中达到High风险等级(7.0–8.9)的8个核心威胁:

    表格较宽,可左右滑动

    威胁ID威胁名称所属家族CVSS baseAARSAIVSS
    T-1Pre-signing Context PoisoningF1 语义操纵7.07.57.0
    T-4Tool Argument ManipulationF1 语义操纵9.26.07.4
    T-15Caller Role ConfusionF2 权限冒用8.67.07.6
    T-23Sub-Agent Prompt DriftF3 供应链与信任根8.77.07.6
    T-27A2A Extension DowngradeF3 供应链与信任根9.45.07.0
    T-29Cross-Server Tool ConfusionF3 供应链与信任根9.45.57.2
    T-34risk_data PoisoningF4 状态绑定失效8.37.07.4
    T-42Multi-Tenant Isolation FailureF5 可问责性失效8.76.07.1

    据Figure 5。作者对主结果的解读包括:

    • 高风险威胁跨越全部五大家族:8个高危威胁分布在全部5个攻击家族中,表明AP2面临的重大安全暴露不仅局限于提示注入,还广泛涉及调用者权限混淆、扩展降级与多租户隔离失效。
    • 架构对风险具有显著放大效应:例如T-31重放威胁在单智能体架构A1下的AIVSS得分为6.3,而在多智能体并发调用架构A3下激活了多智能体交互因子,AIVSS得分上升至6.7。
    • 最高分分布在不同家族:F2的调用者角色混淆(T-15)与F3的子智能体提示漂移(T-23)均达到了最高的AIVSS评分7.6。

    概念验证攻击演示(AM1–AM5)

    • 测试内容:作者在测试床上实现了5项PoC攻击,覆盖全部8个高风险威胁,包括链式攻击AM1(T-23→T-1→T-4)、AM2(T-29→T-15)以及独立攻击AM3(T-42)、AM4(T-27)和AM5(T-34)。
    • 实测结果:在AM1中,提示漂移的审批子智能体接受了恶意商户在MCP工具中虚构的报价范围,导致用户授权了上限80美元的无约束凭据;AM4中高仿域名使会话静默降级至缺乏重放防御的AP2 v0.1;AM5中欺诈者在可变risk_data字段中自行填充低风险标记,使MPP跳过OTP二次验证。
    • 作者解读:PoC证实攻击者无需破解底层密码学签名或伪造凭据,仅通过操纵未签名上下文与元数据即可达成恶意交易。

    独立专家评分复现实验(RQ2)

    • 测试内容:8位来自学界与工业界的独立专家对25个代表性威胁重新评定CVSS指标与AARS因子,检验评分系统的一致性与可复现性。
    • 实测结果:二次加权Gwet's AC2估计值为0.984(95%置信区间[0.963, 1.000]),95%下界高于预设阈值0.61;二次加权Krippendorff's alpha为0.802(95%置信区间[0.520, 0.978]);精确配对一致率为0.923(95%置信区间[0.846, 0.980]);专家在120次评分中有111次复现了参考严重度等级(92.5%)。
    • 作者解读:结果表明独立专家在应用双层评分细则时能够高度一致地重现推导出的严重度等级。

    威胁目录与STRIDE-GPT比对(RQ1)

    • 测试内容:使用STRIDE-GPT对A1至A5五类架构独立生成威胁并由gpt-5.5进行判定,评估MAESTRO目录的完备性。
    • 实测结果:STRIDE-GPT生成了124条场景,覆盖了目录中32个威胁(Full 19项,Partial 13项),覆盖率为66.7%(32/48);未引出的16项经两位第三方专家独立评审,全部被标记为Distinct(未重合),0项Overlap,0项Unsupported。
    • 作者解读:作者认为STRIDE-GPT生成的全部124条威胁均映射到了目录项中,未提出候选补充项,验证了目录的完备性。

    其他消融与分析

    • 扫描器Full配置检出率:在A2、A3、A4、A5上的平均Recall分别为0.80、0.60、0.50、1.00(Table 7)。
    • Passive层独占检出能力:在所有运行中独占检出T-4、T-8与T-24,其余两层均未能检出(Table 8)。
    • CDSE层独占检出能力:在所有运行中独占检出T-14、A4架构上的T-1以及T-29(Table 8)。
    • Adversarial层独占检出能力:在所有运行中独占检出T-5(Table 8)。
    • 扫描器未检出项:三层扫描器在A2上均遗漏T-2,在A3上均遗漏T-1与T-9,在A4上均遗漏T-3(Table 8)。
  5. 有什么可以进一步探索的点?

    作者指出评估基于自建测试床且未测底层清算系统,后续需在真实公开部署中检验扫描器。

    作者指出的局限与后续方向

    • 缺乏公开完整的生产部署:作者指出,在评估期间尚无完整的公开生产或原型AP2部署,Google公开实现仅覆盖了部分协议内容,因而评估基于自建测试床,这限制了断言相同故障是否会在未来第三方部署中原样出现的充分性(9.2.1节)。
    • 未度量对底层支付清算网络的影响:作者指出,PoC仅验证了攻击对AP2层内授权的影响,未度量由此导致的AP2层失效是否以及如何影响银行卡网络、发卡行、收单行或其他底层清算系统(9.2.1节)。
    • 后续需在真实部署中检验扫描器:作者在未来工作中提出,一旦出现公开AP2部署或参考实现,应运行扫描器进行安全审计,以更真实地评估误报率与漏报率,推动扫描器从研究原型走向生产工具(9.3节)。
    • STRIDE-GPT比对运行设定的局限:作者在8.1节指出,威胁目录与STRIDE-GPT运行采用了相同的生命周期与安全属性定义,这可能提高一致性测量值;且每种架构仅运行一次,未度量运行之间的随机波动(8.1节)。

    实验覆盖范围

    • 被测系统形态:实验覆盖了作者在自建测试床上实现的A1至A5共5类架构部署。
    • 验证威胁数量:PoC演示(AM1–AM5)覆盖了AIVSS评定出的全部8个高风险威胁。
    • 专家复现样本:专家评分实验覆盖了8位独立参与者针对5个家族共25个威胁的120次评分。
    • 扫描器测试覆盖:消融实验覆盖了A2、A3、A4、A5四类架构上的18个特定威胁,测试了7种配置组合,每种配置重复测试5次。
    • 底层系统测量:实验测量终止于AP2协议层的凭据签发与验证,论文未报告对银行卡组织、发卡行与清算网络的级联影响数据。
  6. 总结一下论文的主要内容

    系统剖析AP2协议盲区,建立威胁模型并识别8项高危威胁,通过PoC与扫描器推动前置安全防御。

    本文针对Google智能体支付协议AP2 v0.2展开了系统性安全分析,揭示了密码学签名在智能体前置操作上下文遭到篡改时的安全局限。

    • 核心问题:AP2依靠数字签名保证结算与支付凭据的防篡改性,但智能体在签名之前用于构建意图的输入(如A2A协议交互与MCP工具返回)未受签名保护,导致合法签名可能封装被操纵的恶意交易。
    • 方法要点:作者将协议划分为5个生命周期阶段并归纳5类部署架构;运用MAESTRO框架在4类行动者、11个攻击面及6类目标下识别出48个威胁,归入5个攻击家族,并通过AIVSS双层框架进行风险量化;搭建测试床并开发包含CDSE与对抗探针的三层安全扫描器。
    • 核心实验结果:评估识别出8个跨越全部家族的高风险威胁(AIVSS 7.0–7.6);独立专家复现评分的Gwet's AC2达0.984(95%置信区间[0.963, 1.000]);STRIDE-GPT引出目录中66.7%的威胁且未产生新威胁;扫描器Full配置在A5架构达到1.00召回率。
    • PoC验证:在自建测试床上完成了5项概念验证攻击,实现在不破坏签名校验的情况下达成多授权80美元(AM1)、冒用CP凭据工具(AM2)以及篡改risk_data绕过OTP二次验证(AM5)。
    • 结论与启示:作者指出,智能体授权协议必须将前置操作上下文纳入绑定保护,而不能仅仅依赖签署后的最终凭据;同时,支撑协议(A2A、MCP)及部署架构的差异会改变攻击面,防御措施必须下沉到协议交换与架构设计层面。
阅读原文arxiv.org