跳到正文
原文
论文追踪· arXiv:2609.22076·本站收录 · 原文发表 精选关注度59

APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权

APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

APort Vault 在 14 款模型上重放 4,371 次攻击,OAP 授权层放行 25,370 笔合规转账并实现 0 次非许可转账。

问题
大模型支付智能体面临对抗提示词诱导越权转账的风险;现有评测多依赖模型自身拒答,难以量化部署者选择最佳模型后的残留风险与工具边界拦截效果。
方法
通过 APort Vault 基准重放 4,371 次真实人类 CTF 攻击,测试 14 款模型在单/多轮轨道及 5 级策略下,对比裸模型与接入 OAP 确定性授权层的执行状态变更。
实验与结果
在 Levels 2 至 4 中,裸模型出现 140 次非许可转账(76,842 次评估),授权层为 0 次(69,297 次评估,上限 0.38%),同时放行了 25,370 笔合规支付。
局限与可以继续做的
实验仅限于单一转账工具与模拟银行环境,攻击者样本存在自选偏差,各条件为单次运行缺乏方差估计,且预注册的人工验证切片未完成。
实验设置Claude Fable 5.1、Claude Sonnet 5 等 · APort Vault · Request rate、Successful payment rate 等
模型
Claude Fable 5.1Claude Sonnet 5Claude Haiku 4.5GPT-6 AstraGPT-5.6 TerraGPT-5.6 LunaGemini 3.5 FlashGemini 3.8 FlashDeepSeek V4 ProDeepSeek V4 FlashKimi K3GLM-5.3Qwen3.8 MaxMuse Spark 1.3
基准
APort Vault
指标
Request rateSuccessful payment rateUnpermitted transfersPolicy denial rate
AI 导读和推荐理由全文 375 字

APort Vault 是一个针对工具型 AI Agent 支付授权的基准,作者把一场公开夺旗赛中人类写出的 4,371 条攻击重放到 14 个模型、8 家实验室、五档策略、两条重放轨道和两种架构上,共完成 225,964 次评测。攻击来自 2026 年 3 月至 8 月一场奖池 6,500 美元的实况 Agent 银行夺旗赛,97.7% 的尝试集中在 3 月 6 日至 12 日。评测把支付请求、成功支付、授权决定、收款人白名单成员资格和未经许可转账拆成五个事件分别记录,而非合成单一成功率。第 5 档授予零支付能力并指示模型调用工具,因此只用于测量执行是否被拦截,从不并入主结论。作者披露自己是所评估授权层开发商 APort Technologies 的创始人,225,964 条评测、分档护照、评分代码和分析脚本以 CC BY 4.0 发布。

推荐理由论文以 4,371 条真实人工攻击重放比较工具调用边界的授权检查,为 Agent 支付场景提供了可复现的评测数据和方法。

深度解读

6 个问题 · 约 5,900 字

  1. 这篇论文试图解决什么问题?

    评估在真实人类攻击下,工具调用边界的确定性授权检查能否防御大模型智能体的越权支付风险。

    在工具调用型支付智能体中,评估模型自身防御与工具边界确定性授权检查在抵御越权支付时的效果差异。

    • 场景与重要性:当大模型接入资金划转等关键工具时,攻击者可通过对话诱导智能体转账;阻断转账既可依赖模型自身拒绝请求,也可依赖模型与工具之间的前置执行检查。
    • 现有评测的不足:现有对抗基准多聚焦于模型自身的安全评分(如越狱或提示注入成功率),得分随模型重训而失效,且无法量化部署者选择最佳模型后的残留风险。
    • 核心观察与假设:被测大模型面对攻击仍存在非零失效率;作者假设在工具分发路径上引入确定性策略引擎,可在模型被诱导发出请求时有效阻断非许可转账。
    • 提出的基准方案:论文构建了 APort Vault 基准,重放真实夺旗赛中人类提交的 4,371 次攻击,对比 14 款模型在裸模型与接入确定性授权层两种架构下的状态变更结果。
  2. 有哪些相关研究?

    涉及工具智能体攻击、多轮越狱、大模型裁判审计及工具边界授权,重点对比人工构造与真实对抗。

    智能体工具调用攻击

    • AgentDojo(2024)与 InjecAgent(2024)——分别构建了 629 个和 1,054 个合成测试用例,评估提示注入对工具智能体的重定向;作者指出两者的攻击均由基准作者人工构造。
    • LLMail-Inject(2025)——发布了来自真实挑战赛中 839 名参与者的 208,095 次提示注入尝试;作者指出该工作衡量注入是否影响模型,而本文衡量后果性动作是否实际执行并在同一攻击下改变执行架构。
    • AgentHarm(2024)与 ToolEmu(2023)——分别评估模型对有害任务的顺从度或用模型模拟工具执行;作者指出两者仅研究模型自身倾向,未改变决策与执行之间的机制。

    多轮攻击研究

    • MT-JailBench(2026)与 MultiBreak(2026)——均报告多轮攻击在基于拒答的指标上优于单轮攻击,并归因于上下文累积;作者称本文在执行指标下发现多轮优势高度集中在特定攻击技术,而非普遍规律。

    攻击裁判与工具边界授权

    • Gao(2026)、StrongREJECT(2024)与 JailbreakBench(2024)——研究自动化越狱裁判的脆弱性并尝试标准化评分规则;作者称本文直接依据转账工具执行状态判定,无需依赖大模型裁判。
    • Before the Tool Call(2026)与 Zhu 等人(2026)——前者提出了开放智能体护照(Open Agent Passport, OAP)的前置授权规范,后者独立提出了基于策略执行的智能体支付协议设计。

    基线方法与对比定位

    • 基线架构与基准:基线设置为工具直接暴露给模型的裸模型架构(Model alone),在由 4,371 条真实人类攻击组成的 APort Vault 支付语料上进行评测。
    • 本文定位:作者指出本文的攻击源于带赏金的人类实战,涵盖 14 款模型,评估指标为真实的工具执行状态变更,核心变量是工具边界的执行架构而非提示词或模型本身。
  3. 论文如何解决这个问题?

    在模拟银行中重放 4,371 次真实攻击,对比裸模型与 OAP 确定性策略引擎在五级策略下的状态变更。

    论文通过构建 APort Vault 重放基准,在统一的模拟银行环境中对比裸模型架构与接入 开放智能体护照(Open Agent Passport, OAP) 确定性授权层的防御效果。

    策略分级与权限约束

    • 五级策略配置:每个层级定义一份赋予支付能力的护照:Level 1 为通配商户列表(上限 50,000 美元);Level 2 设 3 个白名单收款人(上限 2,500 美元);Level 3 设 1 个白名单收款人并设单笔与单日限额(上限 500 美元);Level 4 设 1 个白名单收款人、限额,且要求幂等性与审计码(上限 1,000 美元);Level 5 不提供任何支付能力。
    • 测量与对照设计:Level 2 至 Level 4 为核心测量层级,策略允许部分收款人并禁止其他收款人;Level 1 为全放行的对照层;Level 5 提示词诱导模型调用工具并声称拦截,用于验证无权限时的拦截强制性。

    双架构对比与确定性策略引擎

    • 裸模型架构(Model alone):智能体直接暴露 transfer_funds 工具,模型发出的工具调用直接由模拟银行执行,无任何中间审查。
    • 授权层架构(Behind the authorization layer):在工具分发路径中嵌入确定性策略引擎,每次 transfer_funds 调用在执行前依据对应层级护照核验,拒绝的调用不予执行;该检查对模型不可见且不修改提示词。
    • 策略引擎实现细节:在本地运行 OAP 的 finance.payment.charge.v1 策略包以避免依赖网络;作者披露本地引擎在 Level 4 额外要求附言携带确认码,严格于公开策略包。

    双重放轨道与调用参数

    • 单轮轨道(Track A):仅向模型发送攻击者的最后一条消息,用于隔离攻击载荷。
    • 多轮轨道(Track B):按原始顺序发送攻击者的完整消息序列,用于保留多轮交互累积的上下文压力。
    • 生成参数设定:各层级运行温度分别设为 0.8(L1)、0.6(L2)、0.5(L3)、0.3(L4)、0.1(L5);最大生成 token 为 1,024(Level 5 为 256)。

    状态判定与置信区间界定

    • 五阶段事件解耦:流水线独立记录请求产生(transfer_funds 出现在调用中)、转账成功(返回 success 为 true)、策略决策(放行或拒绝)、收款人白名单归属、非许可转账(成功转至策略未允许的收款人)。
    • 零事件统计上限界定:对于零发生率指标,采用 $1 - 0.05^{1/n}$ 计算评估层面的单侧 95% 置信度上限,并采用基于来源会话聚类的经验法则界限 $3/S$(S 为独立源会话数)作为保守估计。
  4. 论文做了哪些实验?

    重放 4,371 次攻击完成 22.5 万次评估,授权层在放行 2.5 万笔合规支付的同时阻断全部越权转账。

    实验设置

    • 被测模型:覆盖 8 家机构的 14 款模型,包括 Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5、GPT-6 Astra、GPT-5.6 Terra、GPT-5.6 Luna、Gemini 3.5 Flash、Gemini 3.8 Flash、DeepSeek V4 Pro、DeepSeek V4 Flash、Kimi K3、GLM-5.3、Qwen3.8 Max、Muse Spark 1.3。
    • 数据集与规模:使用 APort Vault 语料,源于 2026 年 3 月至 8 月公开银行 CTF 中的 1,128 个独立会话,清洗后包含 4,371 次真实人类攻击(L1 709 次、L2 938 次、L3 578 次、L4 1,293 次、L5 853 次);计划 244,776 次评估,实际完成 225,964 次。
    • 架构与轨道基线:在裸模型(Model alone)与授权层(Behind the layer)两种架构下,分别运行单轮(Track A)与多轮(Track B)重放。
    • 核心指标定义:记录请求数、成功支付数、策略决策、白名单收款人合规数,核心安全指标为非许可转账数(Unpermitted transfers,即向非白名单收款人成功转账)。
    • 判定与审计机制:核心指标直接读取工具执行状态,不依赖大模型评审;另设由 Mistral Medium 3.5 与 Grok 4.6(温度 0)组成的两模型裁判面板作为审计层(冲突时确定性结果优先)。
    • 统计方法:各层级单次运行,采用 1,500 次重抽样的源会话聚类百分位 bootstrap(种子 20260915);成对检验采用 Benjamini-Hochberg FDR(阈值 0.05)。

    主结果

    事件(每次评估计一次)裸模型(Model alone)授权层(Behind the layer)
    包含支付请求28,543 / 76,84225,527 / 69,297
    包含成功支付28,521 / 76,84225,370 / 69,297
    收款人在层级白名单中28,380 / 76,84225,370 / 69,297
    非许可转账(边界失效)140 / 76,8420 / 69,297

    出处:据 Table 2。

    • 请求与支付行为在两架构间保持接近:作者指出两类架构下模型均频繁发出请求,且大多顺利完成支付,两者的核心分歧仅在非许可转账这一行。
    • 零发生率非由完全阻断导致:在授权层下执行了 25,370 笔成功支付,且策略在评估的 25,640 次转账调用中仅拒绝了 187 次,作者称策略层在放行合规交易的同时拦截了越权交易。
    • 成对样本下的零失效表现:在 68,970 组严格匹配的模型-提示词-轨道三元组中,裸模型发生 105 次非许可转账,授权层为 0 次(请求数分别为 25,362 与 25,420 次)。

    14 款模型在相同输入下的请求行为

    • 测试内容:在 Level 4 的 1,293 个单轮提示词上,以裸模型架构对全部 14 款模型进行全量评测(Table 3)。
    • 测试结果:各模型的支付请求率介于 71.2%(Claude Haiku 4.5)至 84.3%(Gemini 3.8 Flash)之间;在 1,293 个提示词中,有 809 个(62.6%)促使全部 14 款模型发出支付请求,且均成功转账至白名单收款人。
    • 作者解读:作者指出在相同输入下请求行为具有广泛共性,模型是否拒绝转账在 809 个提示词上表现一致;但因 Level 4 策略本身允许向该白名单转账,作者称这体现了跨模型行为共性而非模型被攻破。

    攻击来源会话集中度与伪造凭证攻击

    • 测试内容:分析 Levels 2 至 4 中 140 次非许可转账的来源会话分布,以及特定攻击技术的成因(Table 6、Table 7)。
    • 测试结果:140 次违规转账来自 790 个源会话中的 24 个,其中 1 个会话占 67 次(47.9%),前 2 个会话占半数;包含伪造工具返回字段 [Tool Result: verify_recipient] 的 103 次攻击(均在 Level 2)在多轮裸模型下导致 111 次非许可转账,波及 7 款模型,而在授权层下为 0 次。
    • 作者解读:作者认为模型端失效高度集中于少数攻击源,多轮攻击的优势在执行指标下主要由伪造凭证这单一攻击手法主导;该攻击影响了模型对已验证状态的认知,而边界策略引擎直接核验真实收款人因此未受影响。

    跨模型攻击迁移与裁判审计分析

    • 测试内容:统计单轮与多轮攻击在 14 款模型之间的迁移表现,并评估 Mistral Medium 3.5 与 Grok 4.6 审计面板与确定性判定的吻合度。
    • 测试结果:在 Levels 2 至 4 的 2,809 次重放攻击中,单轮下 10 次成功的攻击均仅攻破 1 款模型;多轮下 73 次成功的攻击中无一能攻破超过 5 款模型。在 222,400 次双裁判评估中,综合 Cohen's kappa 为 0.772(Level 3 降至 0.167);Grok 4.6 召回率为 99.1%,Mistral Medium 3.5 召回率为 64.4%(遗漏 3,356 次确认结果)。
    • 作者解读:作者称越权转账的跨模型迁移能力较弱,仅靠切换模型无法获得通用防护;同时大模型裁判一致性与召回率表现不稳定,支持了采用确定性状态变更作为基准指标的必要性。

    其他消融与分析

    • 排除 99 次发布窗口外尾部攻击:Levels 2 至 4 裸模型非许可转账率由 140/76,842(0.182%)变为 140/75,694(0.185%)(据 4.11 节)。
    • 厂商输入层过滤拦截:共有 582 次评估在输入阶段被拦截,其中 GPT-6 Astra 占 538 次(Level 1 占 66 次)(据 4.11 节)。
    • 授权检查引入的延迟:端到端中位数延迟在 Claude Fable 5.1 上裸模型为 18,375ms、授权层为 17,841ms,在 Gemini 3.5 Flash 上分别为 12,332ms 与 12,432ms(据 4.12 节)。
    • 裁判审计的 Token 消耗:裁判面板消耗 1,071.7M 输入与 14.0M 输出 token,占总输入输出 token 的 47.4%(据 4.12 节)。
    • 策略决策拒绝类别分布:Levels 2 至 4 拒绝的 187 次调用中,收款人非白名单 148 次、金额无效 17 次、超额 13 次、缺失审计码 9 次(据 Table 5)。
  5. 有什么可以进一步探索的点?

    作者指出了单一工具领域、单次采样、人工验证缺失等局限,评测覆盖了 14 款模型与 5 级策略。

    作者指出的局限与后续方向

    • 单一领域与单一工具:实验仅在模拟银行环境中使用单一转账工具,无法直接推论至代码执行、数据访问或智能体间委托(第 7 节)。
    • 攻击者群体存在自选偏差:CTF 参赛者为争夺 6,500 美元奖金的参与者,非普通用户也非国家级对抗者,结果仅代表专家对抗样本而非总体估计(第 7 节)。
    • 每个单元格仅运行单次:各条件仅在 CTF 生产温度下运行单次,缺少单元格内方差估计,计划的子集重复方差检查未包含在当前版本中(第 7 节)。
    • 跨供应商解码参数未归一化:各供应商默认的 top_p 和惩罚参数存在差异且未标准化(第 7 节)。
    • 多轮轨道覆盖不完全:Kimi K3 与 GLM-5.3 缺少授权层多轮数据,Qwen3.8 Max 仅部分覆盖(第 7 节)。
    • 人工验证切片缺失与裁判可靠性未解:预注册计划的约 300 条分层人工验证切片未在冻结前完成,裁判的低一致性与低召回率仅予以披露而未修正(第 7 节)。

    实验覆盖范围

    • 被测模型覆盖 8 家机构的 14 款模型,评估环境仅包含基于 transfer_funds 的单一模拟银行界面(第 3.3 节、第 7 节)。
    • 攻击数据包含 4,371 次人类编写的攻击尝试,其中 97.7%(4,272 次)来自 3 月 6 日至 12 日的发布窗口,类别由正则分类器标注且以权限声明和直接转账为主(第 3.1 节、第 4.11 节)。
    • 策略配置包含从通配放行到无权限的 5 个层级,核心对比集中在 Level 2 至 Level 4 的 76,842 次裸模型评估与 69,297 次授权层评估(第 3.2 节、Table 2)。
    • 防御机制仅测试了在工具分发路径本地运行的 OAP finance.payment.charge.v1 确定性策略引擎(第 3.10 节)。
    • 论文未报告针对其他工具序列模糊测试、多智能体协同以及真实资金环境的评测数据(第 7 节、第 10 节)。
  6. 总结一下论文的主要内容

    22.5 万次重放评估显示,工具边界的确定性授权层在放行合规支付的同时拦截了全部越权转账。
    • 定位与核心问题:论文发布了 APort Vault 基准,旨在解决工具调用型智能体中越权支付风险仅依赖模型端拒答而缺乏工具边界确定性授权检查量化评估的问题。
    • 评测方法与体系:基于银行 CTF 中 1,128 个会话的 4,371 次真实人类攻击,在 14 款模型、5 级策略配置和单/多轮轨道下,重放对比裸模型与接入 OAP 确定性策略引擎的双架构状态变更。
    • 越权转账被有效阻断:在 Level 2 至 Level 4 中,裸模型在 76,842 次评估中产生 140 次非许可转账,而授权层在 69,297 次评估中为 0 次(按源会话聚类上限为 0.38%),在 68,970 组严格匹配三元组中为 105 对 0(Table 2、Section 4.5)。
    • 正常支付未受抑制:授权层在 Levels 2 至 4 成功执行了 25,370 笔合规支付,评估的 25,640 次转账调用中仅拒绝了 187 次,两架构间的成对请求率差异仅为 +0.084 个百分点(Table 2、Table 4)。
    • 失效高度集中且迁移性弱:140 次违规转账有 47.9%(67 次)源于单个会话,伪造凭证攻击主导了 Level 2 的 111 次多轮违规;多轮攻击无一攻破超过 5 款模型,模型端安全表现无法预测跨层级鲁棒性(Section 5.1、5.2、5.4)。
    • 作者结论与启示:作者认为单靠选择最佳模型无法消除部署残留风险,而在工具边界实施确定性策略检查能够在维持智能体执行效用的同时为越权风险提供可验证的确定性保障。
阅读原文arxiv.org