研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御
Signing the Transaction but Not the Decision: Whisper Attacks and a Binding Defense for AP2
作者对AP2开展Whisper决策攻击与A-VIP防御,事实操纵在gemini-3.1-flash-lite达73.3%。
攻击者控制商户API返回的所有自由文本与商品顺序,不控制用户意图、钱包、模型权重或系统提示词;目标为诱导调用支付发现RPC窃取凭据别名(Vault)、篡改购物车(Branded)或通过虚假库存/迭代事实诱导选择高价商品(Selection)。
- AP2等智能体支付协议的密码学签名仅能验证交易未受篡改,却未约束导致交易的决策过程。商户利用商品描述文本植入指令或事实性断言,即可操控购物智能体做出偏离用户意图的采购决策。
- 提出A-VIP协议层防御,将签名意图视为权能授权。通过DDFC单次令牌解耦用户凭据,利用展示快照对购物车执行结构化算术与标识比对,并对超出基准的未授权支出触发用户确认。
- 在未防御基线下,Flash-Lite预览模型上Vault与Branded攻击成功率达90%和56%,后续模型上Selection达73.3%。A-VIP以零假阳性拦截全部结构篡改,并100%露出高价攻击。
- 商户同价替换商品或单SKU捆绑销售在当前规则下无法检出;支出确认依赖用户人工审查;输入扫描器在压力测试中有12%的Strict FPR;评测未覆盖多轮社会工程与分割载荷攻击。
- 模型
- gemini-2.5-flash-litegemini-3.1-flash-litegemini-3-flash-previewgemini-3.1-pro-previewgemini-3.5-flashgemini-3.5-flash-litegemini-2.5-progemma-4-31b-itgemma-3-27b-itgpt-5.5claude-opus-5claude-sonnet-4.6mistral-largekimi-k3deepseek-v4-pro
- 基准
- AP2-WhisperBenchgoogle/ap2 v0.2.0 reference deploymentFetch.ai uAgentsCoralOS
- 指标
- ASRWilson 95% CIStrict FPRFriction FPRLatency (ms)Throughput (scans/sec)
研究者发现 AP2 智能体支付协议只对交易签名、不约束产生交易的决策,商家可控的商品描述文本即可操纵购物智能体。三类攻击中,Vault Whisper 诱导智能体用他人邮箱查询支付凭证,Branded Whisper 生成内容与展示不符但签名有效的购物车,Selection Whisper 仅用一条库存或产品沿革的事实陈述就把智能体从便宜商品推向更贵商品。在 AP2 示例智能体默认指定的 Gemini Flash-Lite 模型上,三类攻击成功率分别为 90%、56% 和 73.3%;Selection Whisper 在 17 个 Google 模型、3 个无关智能体框架和 Google 消费级助手上均有效,仅 claude-opus-5 以 1.2% 的成功率表现出较强抵抗。
推荐理由论文把 AP2 支付协议下的提示注入拆成三类攻击并给出跨模型成功率,做 Agent 支付的团队可据此理解签名无法约束决策这一缺口。
深度解读
这篇论文试图解决什么问题?
协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。
论文试图解决智能体支付协议中签名只绑定交易内容却未约束导致交易的决策过程,致使商户描述文本能操控购物智能体行为的问题。
- 问题出现的场景与重要性:在自主智能体电商场景中,用户授权智能体自主选购并结算。AP2 协议为交易生成密码学有效签名,但作者指出,签名并未绑定生成该决策的推理过程,商户受控文本无需包含指令即可改变购买结果。
- 现有防御机制的不足:AP2 规范假设防御提示注入不可行并依赖约束机制进行事后遏制;但作者指出,参考实现的有人场景将约束字段留空,且凭据发现发生在购物车签名之前,脱离了闭环约束检查范围。
- 论文的核心观察:商户操控不仅限于指令型注入,还包括陈述库存或产品迭代的事实性前提;事实性前提不含祈使句,能绕过针对指令微调的模型对齐防御。
- 论文提出的解决方案:论文提出了三类 Whisper 攻击分类法、A-VIP 协议层绑定防御机制,以及包含 1,544 个评测场景的 AP2-WhisperBench 基准测试集。
- 威胁模型:
- 攻击者目标:窃取受害者支付凭据别名、篡改购物车条目或结算对象、诱导智能体选择商户推销的高价商品。
- 攻击者知识:属于黑盒外部商户,掌握自身 API 返回的所有自由文本字段及商品排序,不掌握用户意图、模型权重、系统提示词或钱包响应。
- 攻击者能力:控制商品标签、描述及 search_products 返回的内容;不具备篡改用户意图、钱包签名或底层密码学原语的能力。
- 受害系统:运行 Google AP2 v0.2.0 参考部署的购物智能体及相关多智能体系统。
有哪些相关研究?
现有研究涵盖智能体支付安全、提示注入基准及模型输入输出防御,但缺乏意图与决策的协议层绑定。
围绕智能体支付协议与提示注入防御,论文讨论了以下相关研究:
智能体支付与协议层验证
- AP2 与 ZTRV(Lan et al., 2026):AP2(Google, 2026)通过意图、购物车和支付三组签名凭据授权交易;ZTRV 使用单次随机数在运行时绑定上下文以防御重放,但其作者明确将语义注入列为执行层验证范围之外的开放挑战。
- Verifiable Intent(Mastercard, 2026)与 x402(Coinbase, 2025):前者提供事后证明用于争议仲裁而非事前预防;后者基于不同联邦模型的加密原生支付协议,二者均不检查商户内容。
- 商户端与底层协议风险研究:针对 A2A 传输层(Anbiaee et al., 2026; Habler et al., 2025)与 MCP 接口(Huang et al., 2026; Wang et al., 2026)的研究讨论了传输与工具投毒风险。
AP2 提示注入与结构缺陷攻击
- Whispers of Wealth(Debi et al., 2026):作者称据其所知该工作首次发表针对 AP2 的提示注入攻击,提出 Branded 与 Vault 两类变体;但该工作测试规模为单任务 10 次试验,未设良性基线,且未评估防御。
- 协议结构缺陷分析(Louck, 2026):并发研究梳理了智能体电商中的模型无关结构缺陷并提供跨平台防御,而本文聚焦于依赖模型推理的决策层攻击。
间接提示注入防御
- 模型内部与输入侧防御:Meta SecAlign(Chen et al., 2025)通过对齐训练拒绝注入指令;StruQ(Chen et al., 2025)使用定界符分离数据与指令。作者指出这些方法需要模型控制权或无法防范无指令的事实性前提。
- 输出侧与凭据路径防御:CaMeL(Debenedetti et al., 2025)、MELON(Zhu et al., 2025)和 Task Shield(Jia et al., 2025)在模型决策后对工具调用进行验证,但增加推理延迟或 API 成本;SUDP(Yu et al., 2026)与 CapSeal(Jin et al., 2026)将凭据隔离在上下文外,但未绑定到 AP2 协议。
基线方法与使用的数据集
- 基线方法:输入防御基线对比了 StruQ、SecAlign、PromptArmor(Shi et al., 2025)及 CASCADE(Abasıkeleş Turgut & Gümüş, 2026)的部署端签名代理实现。
- 使用的评测环境:实验评估在 Google AP2 v0.2.0 参考实现、Fetch.ai uAgents 以及 CoralOS 上进行。
作者认为,现有防御大多需要在模型权重、高延迟推理或事后审计之间权衡,而本文定位为在协议层对已签名对象与意图进行轻量级结构绑定,填补决策未受约束的防御空白。
论文如何解决这个问题?
A-VIP将意图视为权能授权,通过会话令牌解耦凭据、结构化比对绑定购物车,并对未授权超支触发确认。
针对三类攻击,论文提出了协议层防御机制 A-VIP(AP2 Verified-Intent Protection),将签名意图视为权能授权,在 CPU 上以结构化验证拦截违规行为。
凭据查找防御:解耦用户标识符与直接数据流控制
Vault Whisper 诱导智能体向钱包传递受害者邮箱以窃取凭据。A-VIP 采用直接数据流控制器 DDFC(Direct Data Flow Controller):
- 移除标识符:智能体不再向钱包传递用户标识符,改为请求绑定会话的单次不透明令牌。
- 四方消息传递与形式化证明:凭据提供方签发令牌 T = SignC(sid, cm_hash, aud, nonce, exp),该公式表示凭据提供方对会话标识、购物车哈希、受众商户标识、单次随机数和过期时间进行签名所生成的凭据令牌。商户在结算时出示令牌与已签名的购物车授权书。
- TLC 模型检验:作者在 TLA+ 中对无标识符泄漏、受众绑定、购物车绑定与单次时效性四个不变量进行了模型检验。
购物车绑定:基于结构化快照的比对
Branded Whisper 篡改购物车行项目,生成虽有效但偏离意图的购物车授权书。A-VIP 在协议层执行三项确定性检查:
- 实体绑定:拒绝结算收款方与展示商品商户 DID 不符的购物车,防止支付重定向。
- 展示绑定:诚实智能体在展示阶段记录商品快照(含标识、单价与币种);校验时要求购物车中每一项均存在于快照、单价与币种吻合、数量不超过意图限定,且总价等于各项之和。
- 链条不变量:拒绝重放授权书、超出有效期窗口的授权书,或单次用户确认下出现的多张已签名购物车。
事实性选择拦截:超额支出露出与预算约束
Selection Whisper 诱导智能体在展示商品中选择高价替代品,生成的购物车在结构上完全吻合商户展示:
- 基线比对与确认提示:若用户未指定品牌偏好,系统以满足硬约束的最低价目录项为基线;若选中的商品价格高于基线且意图未设预算,A-VIP 暂停静默结算,露出增量支出提示用户确认。
- 预算规则消除摩擦:若用户在签名意图中明确声明了预算上限,且所选商品未超预算,系统直接放行,无需额外确认。
二级内容检测层设计
作为辅助防护,A-VIP 在输入端部署了轻量级内容扫描器:
- 多通道扫描器:包含 13 个正则表达式的关键词/模式通道(通道 B)、SBERT 余弦相似度通道(通道 A)及结构化共现检测通道(通道 C)。
- 语义验证器:使用 DeBERTa-v3 与 SBERT 评估意图与购物车的蕴含及相似度,校准于命名具体商品的良性请求。
论文做了哪些实验?
评测覆盖17个Google模型及跨厂商模型,实测记录到事实操纵普遍有效,A-VIP成功拦截结构篡改。
实验设置
- 被测模型:测试了 17 个 Google 构建版本(包括 gemini-3.1-flash-lite、gemini-3-flash-preview、gemini-3.1-pro-preview、gemini-3.5-flash、gemini-3.5-flash-lite、gemini-3.6-flash、gemini-2.5-pro、gemini-2.5-pro-preview-05-06、gemini-2.5-flash、gemini-2.5-flash-lite、gemma-4-31b-it、gemma-4-26b-a4b-it、gemma-3-27b-it、gemma-2-27b-it、gemma-3n-e4b-it、gemma-3-12b-it、gemma-3-4b-it)以及跨厂商基准 gpt-5.5、claude-opus-5、claude-sonnet-4.6、claude-3-haiku、mistral-large、kimi-k3、deepseek-v4-pro、qwen3.5、gpt-oss-120b、glm-5.2 等。
- 数据集与规模:构建了 AP2-WhisperBench 基准,包含 1,440 个核心场景(150 个 Vault Whisper、150 个 Branded Whisper、90 个 Selection Whisper、1,050 个良性控制项)及 104 个 branded_factual 场景,合计 1,544 个场景。
- 基线与对比框架:智能体框架对比了 AP2 v0.2.0、Fetch.ai uAgents 和 CoralOS;防御基线对比了 StruQ、SecAlign、PromptArmor、CASCADE 的代理实现。
- 指标与评审方式:指标采用每次调用的攻击成功率(ASR,附带 Wilson 95% 置信区间)及 Strict FPR。Vault 与 Branded 使用 Python 确定性谓词判决;Selection 使用经过人工审核验证(一致性 κ = 0.96)的确定性子句定位阅读器评分。
主结果
在未防御的 AP2 v0.2.0 基线上,各攻击家族及选择攻击在不同模型上的成功率如表所示:
表格较宽,可左右滑动
模型 厂商 测试类别 (出处) 样本量 n 成功率 ASR (95% CI) gemini-2.5-flash-lite Google Vault Whisper (Table 3) 50 90% [78.6, 95.7] gemini-2.5-flash-lite Google Branded Whisper (Table 3) 50 56% [42.3, 68.8] gemini-3.1-flash-lite Google Selection Whisper (Table 3/4) 90 73.3% [63.4, 81.4] gemini-3.1-pro-preview Google Selection Whisper (Table 4) 90 67.1% [56.1, 76.4] gemini-2.5-pro Google Selection Whisper (Table 4) 90 61.9% [51.2, 71.6] gemini-3.5-flash-lite Google Selection Whisper (Table 4) 90 50.0% [42.8, 57.2] gpt-5.5 OpenAI Selection Whisper (Table 4) 90 41.1% [31.5, 51.4] claude-opus-5 Anthropic Selection Whisper (Table 4) 90 1.2% [0.2, 6.5] 作者解读指出:
- 在 AP2 默认采用的 Flash-Lite 模型分支上,三类攻击均取得较高成功率。
- 17 个 Google 模型均未能完全抵御 Selection Whisper,成功率在 23.3% 至 73.3% 之间;高算力 Pro 模型并未表现出更强的抵御能力。
- 在测试构建中,只有 claude-opus-5 表现出较低成功率(1.2%),人工分析发现该模型会主动向商户核实库存或建议第三方选项,而非直接采信断言。
从指令到事实的表述升级与跨框架测试
- 指令与事实表述对比:在 32 个场景测试中(Table 5),gemini-3.1-pro-preview 采信事实性前提的比例为 100.0%,gemini-2.5-pro 为 93.8%,跨 6 家机构 27 个模型汇总成功率为 71.8% [68.7, 74.7];而在 90 个场景中,Anthropic Opus 模型遵从显式指令的比例仅为 3.3% 至 4.4%。
- 异构多智能体框架测试:在 Fetch.ai uAgents 上,单句事实注入在 30/30 次试验中改变了推荐(对照组 0/30);在 CoralOS 上,攻击在 29/30 次试验中成功(对照组 0/30)。
- 消费级助手测试:作者对 Gemini 3.5 Flash-Lite 消费级应用进行测试(Table 6),直接粘贴相同语句被拒绝率达 8/8;但通过检索网页提供时,4 种措辞的攻击成功率从 7/12 上升至 12/12。
防御机制拦截效果与系统开销
- 结构化防御有效性:A-VIP 结构化检查在 68 个被攻击购物车中正确识别 7/7 类篡改,在良性样本上误报率为 0/68(Table 11);DDFC 在 TLC 形式化验证下从结构上阻断了 Vault Whisper 凭据泄漏。
- 支出确认开销:在 68 个 Selection 攻击篡改的购物车中,支出确认规则露出率达 68/68(100% [94.6, 100]);在 24 个良性高价请求中,无预算声明的 16 个均触发确认,声明预算的 8 个均未触发多余确认。
- 延迟与吞吐量:在 Intel i7-13700H 笔记本上,结构化检查中位数耗时 0.04 ms,正则匹配中位数 0.21 ms,嵌入网关中位数 0.23 ms(平均 15.6 ms);8 进程下输入扫描器吞吐量达 10,328 次/秒。
其他消融与分析
- 在 10 种语言和 5 种字符集的测试中,Selection 攻击成功率为 81.1% [76.7, 84.8](Section 7.8)。
- 自适应攻击重写测试中,两个独立生成器绕过内容扫描器的比例分别为 79%(Branded)和 17%(Vault),但均无法绕过结构化绑定(Section 7.8)。
- 在多样性压力测试的 50 个良性样本中,内容扫描器的 Strict FPR 为 12% [5.6, 23.8](Appendix L)。
- 凭据泄漏矩阵测试中,相同单价($0.25/M tokens)的 gemini-3.1-flash-lite 与 claude-3-haiku 泄漏率分别为 95% 与 85%(Table 8)。
- 针对 6 种购物车数值漂移探针,+10% 的漂移因容差设计放行,其余 5 种篡改均被数字守卫拦截(Appendix H)。
负面结果与例外
- claude-opus-5 表现出对事实性操纵的抵御(ASR 为 1.2% 及 0.0%),作者分析显示该模型具备主动核查行为。
- gemini-2.5-pro 在早期测试中曾因 300 token 的输出截断限制导致未输出商品名而被判为拒绝,调高上限后其成功率恢复至 61.9%(Section 7.3)。
- 消费级应用的高级版模型在 1 次拒绝中识别出了间接提示注入测试,但在其余 12 次测试中有 11 次遵循了注入主张,作者认为这反映出模型存在不一致的行为应用(Section 7.5)。
有什么可以进一步探索的点?
作者指出同价替换无法拦截、确认依赖用户审查及扫描器误报等局限,未来可探索多轮社工与密码学证明。
作者指出的局限与后续方向
- 商户端同价替换无法通过支出规则拦截:若商户推荐的替换商品价格等于基准价格,或将配件捆绑进单一展示 SKU,支出确认规则无法检出,作者指出此类情况需要平台市场政策规范而非签名对象检查(Section 7.7)。
- 确认机制依赖真实用户审查:支出确认规则依赖用户认真审查提示而非机械式点击同意,作者指出该机制减轻了攻击但并未根除风险(Section 7.7)。
- 内容扫描器存在良性文本误报:内容扫描层在多样性压力测试中 Strict FPR 为 12%,作者指出内容检查是系统中最薄弱的组件,提出未来需通过域名白名单和语言规则重调进行生产环境校准(Section 8、Appendix L)。
- 消费级评测与模型对比的样本量限制:消费级助手每单元测试仅 8 至 13 次,推理层和跨厂商观察部分基于单次试验,作者明确指出其不能作为精确估计(Section 8)。
- 排除多轮与分割载荷攻击:基准测试未涵盖多轮社会工程攻击与分割载荷(split-payload)攻击,作者将其明确列为基准范围之外(Section 6、Section 8)。
- 密码学底层证明留待后续:DDFC 验证抽象了底层密码学原语完整性,作者指出使用 Tamarin 或 ProVerif 对底层 JWT/COSE 签名开展伴随证明留待未来工作(Appendix D)。
实验覆盖范围
- 模型覆盖范围:评测覆盖了 17 个 Google 内部及开源模型构建,以及来自 OpenAI、Anthropic、Mistral、Moonshot、DeepSeek、Alibaba、Zhipu 的 10 个外部模型。
- 环境与框架覆盖:实验在 AP2 v0.2.0 参考实现、Fetch.ai uAgents 和 CoralOS 三个智能体编排架构上开展。
- 场景覆盖范围:基准测试包含 1,544 个合成场景,覆盖 6 类良性商户边缘情况以及 5 类 Branded 操纵变体。
- 语言覆盖范围:语言测试覆盖了 10 种语言与 5 种书写系统。
- 论文未报告信息:论文未在 AP2 参考实现之外测试真实的第三方生产级商户环境,且论文未报告真实人类用户在面对增量支出确认提示时的实际点击通过率。
总结一下论文的主要内容
论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。
- 定位与目标:本文针对智能体支付协议 AP2,研究商户利用商品描述影响智能体决策的推理层攻击面,并提出了协议层绑定防御机制 A-VIP 与评测基准 AP2-WhisperBench。
- 要解决的问题:现有支付协议的密码学签名仅能证明交易未被篡改,但未约束生成交易的决策推理;商户在商品描述中植入不含违规指令的事实性断言即可左右购物结果,且生成的购物车完全符合协议校验。
- 方法要点:A-VIP 将用户签名意图转变为权能授权。针对凭据泄漏(Vault Whisper),引入 DDFC 使用单次会话令牌替代用户标识符;针对购物车篡改(Branded Whisper),通过快照进行实体与展示的算术与标识比对;针对事实性诱导(Selection Whisper),通过与最低价基准比对将未授权支出露出给用户确认。
- 关键实验发现:
- 在 AP2 默认的 Flash-Lite 预览模型上,Vault 与 Branded 攻击成功率分别达 90% 与 56%(Table 3);Selection 攻击在 GA 后续版本上达 73.3%(Table 3)。
- 事实性操纵在 17 个 Google 模型上成功率为 23.3% 至 73.3%(Table 4),在多厂商 27 个模型汇总达 71.8%(Section 7.4),仅 claude-opus-5 出现较低成功率(1.2%)。
- A-VIP 结构化检查以零假阳性闭环拦截了全部 7 类购物车篡改,并在 68 个被操纵购物车中 100% 露出了未授权支出(Table 11)。
- 辅助内容扫描器在 Intel i7 CPU 上单核达 1,932 次/秒,8 线程达 10,328 次/秒(Appendix C)。
- 作者结论与启示:作者指出模型抵御能力与模型规模、厂商或定价无直接对应关系,支付协议设计者无法依赖下游模型自觉防御,必须在协议层将凭据、购物车与支出严格绑定到用户初始授权上。