PACE:面向工具调用 LLM Agent 的来源感知能力强制执行
PACE: Provenance-Aware Capability Enforcement for Tool-Using LLM Agents
论文提出 PACE,在工具调用前做路径隔离与效果授权;八个基准上,评测配置 PACE-P 在 79 列中 62 列 ASR 严格最低,效用相对无防御最多降约 3 分。
攻击者编写 artifact K(skill、工具描述或 MCP schema)及上下文 c 中的不可信片段,可针对每次防御结果自适应;成功条件是未请求的不可逆效果或泄露秘密 s。
- 工具调用型 LLM 智能体会把文本变成真实副作用,中毒的工具元数据、检索页、记忆和可复用 skill 能影响下一次调用。作者认为准入时证据无法区分安全与泄露变体,因而不能据此放松出口调解。
- PACE 在每次工具执行前调解。路径隔离对表示出的影响路径提出可执行割,能力与效果核验把 schema 定义的效果对照由已认证请求编译出的权限。认证合约 PACE-C 保留割并复核最终调用;实验评测的是可恢复阻断调用并应用声明修复的 PACE-P。
- 三个目标模型族、八个可执行基准上,PACE-P 在 79 个合格攻击列中 62 列 ASR 严格最低、14 列并列。全基准原生效用相对无防御最多降 2.92 分。1167 例消融中,作者称安全增益主要来自效果核验,拒答控制来自边界适配。30 个越权目标上自适应搜索对 PACE-P 为 0/30,无防御为 21/30。
- 作者将语义复述、碎片化流、隐藏次级效果和持久分布式执行列为后续工作。实验评测的是 PACE-P 而非认证合约;自适应搜索为缩规模,每例 50 episode,且只用目标检查点作变异器。消融子集上 AgentDyn 效用从 66.7% 降到 33.3%,全基准三点上界在该子集不成立。
- 威胁模型
- 攻击者编写 artifact K(skill、工具描述或 MCP schema)及上下文 c 中的不可信片段,可针对每次防御结果自适应;成功条件是未请求的不可逆效果或泄露秘密 s。防御者只在工具边界读取提案与返回并削弱或阻断调用,不能重训冻结策略 M、探测工具内部或枚举 Ctx。
- 模型
- gpt-5.6-lunaDeepSeek-V4-FlashQwen-3.8-27B
- 基准
- AgentDojoAgentDynWASPInjecAgentASBPASBMCPToxMSB
- 指标
- ASRnative utilityrefusal ratePUANRP
PACE 是一种在工具调用执行前进行拦截的防御机制,用于应对被投毒的工具元数据、检索页面、记忆和可复用技能对 Agent 后续调用的操纵。作者指出,仅靠准入前的工件审查无法解决问题,因为安全变体与泄露变体可能产生相同的准入证据。PACE 通过路径限制给出可执行的影响路径切割,并用能力与效果验证将 schema 定义的效果与从已认证请求编译出的权限进行比对。在 8 个可执行 Agent 安全基准和 3 个目标模型家族上,其评估配置在 79 个有效攻击列中有 62 个取得最低攻击成功率,14 个持平,全基准原生效用相对无防御 Agent 最多下降 3 分。对 1167 组配对案例的消融显示,安全收益主要来自效果验证,拒答控制则来自边界适配;缩小规模的自适应搜索在越权目标上 0/30 成功。
深度解读
这篇论文试图解决什么问题?
准入证据分不清安全与泄露规格时,出口站点不能放松调解,决策应留到最后一次工具边界。
当 artifact 的安全变体与泄露变体产生相同准入证据时,准入关卡无法只对其中之一放松出口站点;作者把决策放到最后一次可执行的工具边界。
- 场景:工具调用型 LLM 智能体在同一循环里规划、调用工具并产生真实副作用。检索页、工具返回、文件和第三方 skill 描述与指令共享上下文,中毒的 MCP schema、可复用 skill、记忆或知识库都能影响下一次调用。作者针对的是这些内容也会进入规划上下文的部署。
- 现有方法的不足:作者把防御分成四类:锚定可信计划或重构轨迹的流控制、声明式权限与任务对齐、检测与重执行、指令/数据分离。信任倒置出现在准入依据本身由攻击者控制时:审查 skill 所读的规格,正是智能体随后遵循的同一段攻击者所写字符串。动态标签跟踪插桩流,但不对攻击者控制的上下文认证行为。
- 核心观察:安全相关对象不是 artifact K 本身,而是它在攻击者提供的上下文上诱导的行为族 Beh(K)。作者给出条件:当一条准入路线对同一变体类中的安全成员与泄露成员给出同一判断,且泄露成员能在某上下文违反站点级准则时,δ-sound 的关卡必须对两者都返回 mediate(Theorem 1)。
- 威胁模型:
- 目标:攻击者成功于未请求的不可逆效果,或对秘密 s 的披露。
- 知识与能力:攻击者编写 artifact K(skill、工具描述或 MCP schema)以及上下文 c 中任意不可信片段,并可针对每次防御结果自适应。
- 受害系统:冻结策略 M 在自由文本与工具调用之间交替;K 与携带请求、注入文本、工具返回、状态及可能的秘密 s 的上下文一起诱导轨迹测度。
- 防御者:只在工具边界行动,读取提案与返回,削弱或阻断调用;不能重训 M、探测工具内部或枚举 Ctx。
- 本文提出:Provenance-Aware Capability Enforcement(PACE)。路径隔离对表示出的影响路径提出可执行割;能力与效果核验把 schema 定义的效果对照由已认证请求编译的权限。作者区分认证执行合约与评测配置:后者可在拟阻断后恢复已授权调用,或应用声明的修复。保证针对的是表示出的链。
有哪些相关研究?
作者把相关工作分成攻击面、四类防御范式和形式化基础,并把 PACE 放在最后一次工具边界上。
- 智能体攻击面:工具调用循环使指令与数据共享选择下一动作的上下文(Yao et al., 2023; Schick et al., 2023; Qin et al., 2024; Patil et al., 2024; Zverev et al., 2025)。提示注入覆盖工具套件、网页任务和多步工作流(Perez & Ribeiro, 2022; Greshake et al., 2023; Zhan et al., 2024; Debenedetti et al., 2024; Zhang et al., 2025; Evtimov et al., 2025; Liu et al., 2024; Yi et al., 2025; Ruan et al., 2024)。载荷可经 MCP schema(Wang et al., 2026c; Yang et al., 2025; Hou et al., 2026)、可复用 skill(Duan et al., 2026)或中毒记忆与知识库(Chen et al., 2024; Zou et al., 2025; Wang et al., 2026b)进入。
- 防御范式:流控制锚定可信计划或重构轨迹(Debenedetti et al., 2025; Costa et al., 2025; Zhong et al., 2025; Wang et al., 2025);声明式权限与任务对齐(Shi et al., 2025; Jia et al., 2024);检测与重执行(Zhu et al., 2025; Liu et al., 2025; Chennabasappa et al., 2025; Rebedea et al., 2023; Inan et al., 2023);指令/数据分离(Wallace et al., 2024; Chen et al., 2025a;b; Hines et al., 2024)。可信输入各不相同:计划、由请求导出的策略、插桩溯源,或学到的指令与数据区分。近期溯源与执行监控已检查参数溯源和细粒度权限(Fan et al., 2026; Wang et al., 2026a; Santos-Grueiro, 2026)。动态污点需要每次变换携带标签(Enck et al., 2010; Kemerlis et al., 2012),作者认为工具型智能体会跨过不透明边界而使该做法失效。
- 形式化基础:概率非干扰是衡量尺度,作者称并非本文所主张的性质(Goguen & Meseguer, 1982; Sabelfeld & Myers, 2003)。超性质(Clarkson & Schneider, 2010)与自合成(Terauchi & Aiken, 2005; Barthe et al., 2004)需要配对执行的充分语义模型。准入证据包括证明携带代码(Necula, 1997)、对接口或轨迹的可靠抽象(Sekar et al., 2003; Wang et al., 2025),以及从规格读出的依赖。编辑型执行机制区别于截断型(Ligatti et al., 2005; Hamlen et al., 2006)。
- 基线方法与基准:主实验的八个可执行基准为 AgentDojo、AgentDyn、WASP、InjecAgent、ASB、PASB、MCPTox、MSB。基线跨五类:可信流与信息流控制(CaMeL、FIDES、DRIFT)、工具使用防护(Progent、MCIP Guardian、ToolShield、AgentDojo tool filter、MCPTox allowlist)、重执行(MELON)、检测(DataSentinel、PIGuard、PromptGuard-2、AgentDojo injection detector、MCPTox metadata sanitizer),以及 ASB 与 WASP 的提示词级防御(含 spotlighting)。完全插桩的 DTA 是诊断用污点参考,被排除出主表比较选择。Table 1 各块实际列出的比较对象随基准而变。
作者把本文定位为:在准入证据不能许可放松出口站点之后,于最后一次可执行工具边界上同时保留图分离条件与效果权限;保证只涉及 schema 所表示的流与效果。
论文如何解决这个问题?
PACE 分四阶段在调用前做路径割与效果核验;实验评测的是可恢复与修复的 PACE-P,不是认证合约 PACE-C。
PACE 在每次工具执行前调解:先冻结提案并扩展情节溯源图,再对表示出的影响路径求割、对效果做权限核验,然后安装动作并记录结果。认证合约 PACE-C 要求安装动作保留割且最终调用通过效果核验;实验评测的 PACE-P 允许在 P 选择终端阻断而 C 认证时恢复原调用,或对可修复裁决应用注册表声明的修复且不再跑 R6。
问题设定与形式化
- 行为族:冻结策略 M 与 artifact K、上下文 c 诱导轨迹测度 μ_{K,c}。安全对象是 Beh(K) = {μ_{K,c} : c ∈ Ctx},对 K 的审计无法枚举它。
- 非干扰尺度:Φ_NI 要求只在秘密 s 上不同的两个上下文,其出口事件的推前测度距离不超过 δ(式 (1))。投影保留原始字节,因此 base64、哈希、改写和碎片化都在比较之内。作者称有限观测不能在不受限行为族上了结该式。
- 准入不可放松:站点准则 Φ_site 是式 (1) 限制到单个出口站点 ω。δ-sound 关卡在其声明域的每个 artifact、每个站点上满足式 (2)。Theorem 1:若路线对安全与泄露变体给出同一判断(C1),且攻击者能展示泄露变体违反式 (2) 的上下文(C2),则该关卡对两者都返回 mediate。
Phase I:Propose
- 证据图:H_t 是由情节记录折叠的有向多重图,节点为数据、操作、资源、终端。提案、结果、阻断、取消和不确定派发只追加、不改写。可达性只用流子图,边类型为 resource_access、data_flow、output_flow、resource_write、terminal(式 (3))。活动图 G−_t 是决策所读的已提交边加上本提案边,排除已拒绝和已取消提案。
- 计数器:执行版本 σ_t 在已提交边、标签或活值变化时前进;策略纪元 ε_t 在 schema、效果规则、代价、合约、能力授予或适配器代码变化时前进。
- 快照与溯源:宿主用新的尝试标识 q_t 按值或版本化资源句柄冻结参数;后续阶段只读快照。既不可快照也无版本的资源为 schema-undefined,规则 R1 拒绝。命中溯源映射 ν 则复用节点,未命中则新建数据节点。溯源按槽保存。
- 发射与权限:每个 schema 定义的参数节点连到新操作节点 op(q_t),再由终端 T(q_t) 闭合,版本化的不安全效果规则标记 op(q_t) → T(q_t)。只有这些拟议边可被执行器切断。效果视图把同一冻结调用展开为效果原子,各含操作、目标资源、持久类和决定它的参数槽。已认证请求单独编译成受目的、资源、参数、预算、过期和委托深度约束的能力;它只读可信请求通道,模型生成文本不能铸造或放宽能力。
Phase II:Cut and Certify
- 源与不安全终端:P_t 只含标为秘密、个人数据、凭证、源代码或受保护载荷的 Data 与 Resource 节点。推导检查在有限确定性重编码族 Ψ 上扫描:match(y, x) = 1 当且仅当存在 ψ 使 ψ(x) 出现在 canon_ψ(y) 中(式 (4))。命中把该参数的数据节点加入本步的 P_t,作为标签而非边。作者称这是有界近似,改写、翻译和碎片化在 Ψ 之外。B_t 过近似攻击者影响可能所在:每个已提交节点有部署指定的来源,untrusted 覆盖 artifact、工具返回、检索页或记忆记录所提供的内容,派生节点继承输入的来源。U_t 只含不安全调用的终端,且与 P_t 不交;安全调用的割为空。
- 绑定与最小割:对每条拟议边 e,可信适配器声明它实现的动作 Impl(e),部署声明切断后可排除经 e 的每条真实链接的子集 Sev(e)。绑定取二者交集中声明代价最小者(式 (5))。容量 κ 在可切断的拟议边上为该代价,否则为无穷(式 (6))。C_t 是典范最小割:最便宜,代价相等时字典序最小。已提交边不可切。作者称在发射规则下,最优退化为一次可达性可在线性时间解决的二选一(Proposition D.2)。执行器消费的是边索引清单 M_t,而非割本身;条目冲突则拒绝,不搜索更贵的割。清单可采纳性所依赖的切断合约在完整集合下成立,只被声明检查,其真实性是任何自动检查达不到的前提。
- 效果链与决策:九项义务为授权覆盖、类型绑定、操作与主体控制、机密性、持久性、委托衰减、预算、相对请求与事件状态的新鲜度、钩子可用性。eff(a) = 1 表示 a 的全部原子通过。low(a_t) = 1 表示每个效果被 schema 标为可逆、汇为空且无持久副作用。式 (7) 的有序规则中,PACE-C 禁用 R2 与 R3:R1 拒绝未定义 schema;R4 在效果未通过时拒绝原调用;R5 在无有限割或清单不可采纳时拒绝;R6 在非阻断清单的结果调用未通过效果核验时拒绝;否则安装 M_t。PACE-P 中 R2 可在 AUTH 或 BUDGET 失败时仍放行低影响调用;R3 要求九项全过且无受保护影响时允许。其组合器还可恢复或修复。作者称:在请求编译、效果标签、验证器和完全调解可靠的前提下,越权的不可逆或向外效果只能经声明的修复执行。
- 两份证书:路径证书携带计算时所对的状态及决策的全部输入;验证器重建图、源和终端,再检查分离与每个绑定。效果证书把原子绑到请求、schema、能力见证和所需溯源切片,确定性验证器重跑九项义务。作者声称的是重算的分离与可执行性,不是重算的最优性。接受认证的是候选,并不表示组合器执行了该清单。
Phase III–IV 与保证
- 落地动作:割边的绑定动作在适配器暴露对应钩子、执行器在表示依赖被遍历之前安装它、且切断合约在完整清单下成立时为 grounded(Definition 2)。Enforce 在调用工具前消费组合决策。抑制效果的动作有阻断、拒绝和空跑;约束效果的有只读视图、参数改写、在调解边界上的清洗和预算上限;allow 直接放行。PACE-C 中安装先于派发,且对清单产生的字节检查 R6。σ_t 与 ε_t 的复查会取消过期尝试;该新鲜性是进程局部的。持久预留、一次性令牌花费和崩溃对账在 Section C.3,位于所评测工件之外。
- Finalize:记录 ToolEvent,更新图、溯源映射和下一提案所读的污点状态。返回值最早出现在 t+1,不进入自身证书。最终回答走同一边界;影响测试触发时其终端登记为不安全。
- 保证范围:Proposition 1 给出表示路径分离与已授权效果的可靠性,前提包括能力只从已认证请求发出、效果 schema 与槽溯源覆盖具体效果。Theorem 2:两验证器接受且 M_t 已落地时,若真实因果链的每条链接被覆盖、及时发射并被模拟,且源与终端标签完整,则该链不能在此次调用完成。Proposition 2 给出透明链被模拟的充分适配器条件:只在声明位置读写返回、无隐藏次级效果、保留直通值标识。作者明确这些保证不建立非干扰;可观察拒绝仍是信道,且未对任何 δ 证明式 (2) 形式的界。恢复被阻断的调用会在 A⋆ 非空时失去分离,即使 C 授权了该调用。情节不变量只对 PACE-C 陈述(Corollary D.2),对评测配置没有一般性主张。
论文做了哪些实验?
八基准、三模型族上 PACE-P 在 79 列中 62 列 ASR 严格最低;自适应搜索 0/30,消融把增益主要归到效果核验。
实验设置
- 被测模型:三个冻结目标族 gpt-5.6-luna、DeepSeek-V4-Flash、本地 vLLM 服务的 Qwen-3.8-27B。解码为确定性,temperature 0,补全上限 1024 token。目标、攻击源与评审角色分开;来自目标族的模型从不单独担任评审。论文未在正文列出评审模型名称。
- 基准:八个可执行基准保留原生攻击构造:AgentDojo、AgentDyn、WASP、InjecAgent、ASB、PASB、MCPTox、MSB。论文未在正文给出各基准样本条数。
- 防御配置:全部实验评测 PACE-P,表中记为 PACE。能力从可信请求通道确定性编译,排除攻击标签和评审输出。基准专用策略与 schema 在最终运行前冻结。比较在固定修订上本地运行。
- 基线:五类,见第 2 问。Table 1 每块展示无防御智能体、PACE 和按平均最差组 ASR 排名的三个最强已发表防御。完全插桩 DTA 不进入主表比较选择。
- 指标:ASR 取该基准与模型的最差攻击组。Util. 为基准自身分数,越高越好;MCPTox 上 Util. 是拒绝率。MSB 的 Util. 为 PUA。比率记录分子、有效分母以及无效与技术失败计数;缺少必需防御钩子调用会使受防御情节无效。原生指标的点估计跨基准不做合并。
- 其他协议:Section 5.2 的缩规模自适应搜索针对 30 个越权 AgentDojo 对。消融为 1167 个冻结用例上的完整 2×2×2 因子。论文正文未报告主表的重复次数。
主结果
Table 1 的 ASR 是该基准与模型的最差攻击组。MCPTox 的 Util. 为拒绝率(越低越好的方向在表题中标为 refusal ↓)。InjecAgent 无效用列。
表格较宽,可左右滑动
基准 模型 无防御 ASR / Util. PACE ASR / Util. 出处 AgentDojo Qwen / DeepSeek / ChatGPT 48.0/62.59;99.84/75.68;100.0/73.77 0.0/59.67;5.09/75.25;8.11/72.05 Table 1 AgentDyn Qwen / DeepSeek / ChatGPT 32.5/63.39;19.5/65.0;19.5/74.82 0.0/60.54;0.06/63.57;0.0/73.57 Table 1 ASB Qwen / DeepSeek / ChatGPT 88.5/30.29;74.08/64.0;81.08/80.25 0.42/29.57;10.5/64.64;8.75/81.63 Table 1 PASB Qwen / DeepSeek / ChatGPT 85.0/98.47;92.5/99.24;97.5/100.0 0.0/97.69;5.0/99.24;2.5/100.0 Table 1 WASP Qwen / DeepSeek / ChatGPT 19.05/78.57;9.52/79.76;4.76/86.9 7.14/92.86;0.0/91.67;0.0/95.24 Table 1 InjecAgent-E Qwen / DeepSeek / ChatGPT 79.07/–;52.29/–;50.5/– 0.0/–;3.12/–;30.77/– Table 1 MCPTox Qwen / DeepSeek / ChatGPT 32.52/0.16;56.54/0.42;86.93/27.96 0.0/1.97;2.62/0.58;2.65/28.55 Table 1 MSB Qwen / DeepSeek / ChatGPT 38.75/46.34;100.0/91.24;98.75/89.08 2.5/60.14;3.75/98.83;3.75/94.87 Table 1 - 跨列比较:在 79 个合格的分组 ASR 列中,PACE-P 严格最低的有 62 列,并列最低 14 列,更高的有 3 列。该计数排除派生的 InjecAgent 数据窃取合计、其三个条件 DS-S2 列,以及两列无防御 ASR 为零的列。
- 效用:相对无防御智能体,全基准效用最多下降 2.92 分;WASP 上分别升高 14.29、11.91、8.34 分;MSB 的 PUA 与 NRP 改善;MCPTox 拒绝率相差至多 1.81 分。结论中的说法是相对无防御最多失去三个点。三列 ASR 低于 PACE 的比较对象,其伴随效用低得多(Section F.1)。
- 残留:Qwen-3.8-27B 上 ASB 五组中有四组 ASR 为零。残留为 WASP 上 4.76% 与 7.14%、ASB-DPI 上 0.42%、MSB-Call 上 2.50%。作者称在 AgentDojo 上,PACE 的最差组 ASR 低于 CaMeL、MELON 和 Progent,效用高于它们,三个模型皆然。Table 1 的 AgentDojo 块列出的是 CaMeL、DTA、DataSentinel,不是 MELON 与 Progent;MELON、Progent 的数字在 Section F.1,本段摘录未给出可对齐的列。
自适应搜索
- 测了什么:缩规模自适应搜索针对 30 个越权 AgentDojo 对。无防御成功 21/30(70.0%),其中九次首次成功来自搜索生成的载荷;双侧 95% Wilson 区间为 [52.1, 83.3]%。十二次用静态种子首次成功,九次用搜索载荷,迭代在 3–39,共用 632 个 episode。
- 防御结果:PACE-P 为 0/30,区间 [0, 11.4]%,共用 1500 个 episode。其边界记录 157 次精确的越权目标调用,分布在 14 对的 126 个 episode 中,全部在派发前被阻断:149 次失败于 AUTH 与 BUDGET,8 次额外失败于 BIND 与 CTRL。没有一次使用 R2。
- 不计入 ASR 的检查:直接边界派发阻断全部 37 个冻结目标调用模式;把目标调用放进携带 1003 个选定无目标 episode 之载荷的新上下文,得到同样拒绝。这些不增加 30 例攻击样本。样本只覆盖三套件中的越权目标,用目标检查点作变异器,每例允许 50 个 episode。
消融
Table 2 在本地 Qwen-3.8-27B 上对 1167 个冻结用例做 P(路径隔离)、C(能力与效果)、B(执行边界适配)的 2×2×2。八臂共享逻辑用例标识、解码和评审;9336 个计分结果,无技术失败。A0 是与包装器匹配的无防御臂,A7 在这些用例上重聚合完整 PACE-P。C 同时打开能力安装、效果展开、核验和组合器,其估计量的是这一捆。子集的任务混合不同于各基准。
表格较宽,可左右滑动
行 A0 A1 (P) A2 (C) A3 (B) A7 (P+C+B) WASP plain / URL ASR 8.3 / 8.3 8.3 / 8.3 0.0 / 8.3 0.0 / 0.0 0.0 / 0.0 AgentDojo / AgentDyn ASR 37.4 / 25.0 0.0 / 0.0 0.0 / 1.7 33.3 / 23.3 0.0 / 0.0 InjecAgent-Base / PASB ASR 14.7 / 41.4 0.0 / 31.0 0.0 / 0.0 14.6 / 41.4 0.0 / 0.0 MCPTox / MSB macro ASR 5.2 / 24.8 0.8 / 7.1 0.0 / 4.5 5.4 / 0.0 0.0 / 0.0 AgentDojo / AgentDyn 效用 76.8 / 66.7 13.6 / 0.0 64.6 / 36.7 76.8 / 66.7 67.2 / 33.3 MCPTox 拒绝 / MSB PUA 42.2 / 48.3 78.4 / 52.5 99.3 / 55.8 0.8 / 58.2 2.3 / 62.0 A4–A6 的部分数字:InjecAgent-Base ASR 为 A4 0.0、A5 1.0、A6 0.0;AgentDyn ASR 为 A4 1.7、A5 0.0、A6 0.0;PASB ASR 为 A4 0.0、A5 39.7、A6 0.0;MCPTox ASR 均为 0.0(A4–A6);ASB overall ASR 在 A0–A7 均为 0.0,InjecAgent-Enhanced 亦均为 0.0。PASB IPI 效用在含 C 的臂为 100.0,仅 P 的 A1 与仅 P+B 的 A5 为 0.0。
- 作者的解读:每个含 C 的臂关掉 PASB,不含 C 的臂则否。仅 B 在 AgentDojo、AgentDyn、InjecAgent-Base 和 MCPTox 上留下残留,但每个含 B 的臂关掉 MSB-Call,不含 B 时为 53.8% 到 61.5%。仅 P 通过抑制降低 ASR,但仍留下 PASB 与 MSB 宏残留。ASB 与 InjecAgent-Enhanced 在各臂均为零,不能区分层次。若干缩减臂与 A7 的下限打平,没有任何安全行优于 A7;作者称完整组合没有被展示出的独有安全收益。把 B 加到 C 或 P+C 上,在有效用例 ASR 仍为零时降低 MCPTox 拒绝率。含 C 的臂部分挽回仅 P 在 AgentDojo、AgentDyn 和 PASB IPI 上的效用损失。
- 与全基准上界不一致:配对的 A0 到 A7,AgentDyn 效用从 66.7% 降到 33.3%;全基准的三点上界在该子集上不成立。ASB 效用对实现敏感(Section F)。AgentDyn 在 6647 条受守卫调用记录中有 5842 个非空候选割,但没有执行非终端改写;效用经由 C 恢复 P 的终端阻断而回来。
其他消融与分析
- Table 1 中并非处处最低:InjecAgent-E 上 ChatGPT 的 PACE ASR 为 30.77,Sandwich 为 0.59;WASP 上 Qwen 的 PACE 为 7.14,Prompt Filter 为 14.29、Baseline 为 19.05,而 FIDES 为 40.48。合格列中有 3 列 PACE-P 更高。
- AgentDojo 上 DataSentinel 效用更高、ASR 也更高:Qwen 为 ASR 35.29、Util. 73.77,PACE 为 0.0 与 59.67。
- AgentDyn 上 CaMeL:三个模型 ASR 为 0.0、5.5、0.0,效用为 0.0、3.75、0.0;PACE 效用为 60.54、63.57、73.57。
- 证书健康量:Table 16 记录每情节的前向模拟、未知操作展开、不可绑定最小割、过期状态拒绝、效果义务失败、已绑定动作执行和验证器重建不匹配;正文摘录未给出这些统计的数值。
- 直接边界与新上下文检查:37 个冻结目标调用模式全部被阻断;1003 个选定无目标 episode 的载荷放入新上下文后同样拒绝。二者不计入 30 例 ASR。
- 可观察拒绝:作者称它仍是信道,且没有对任何 δ 证明式 (2) 形式的界。
有什么可以进一步探索的点?
作者把语义复述、碎片化流、隐藏次级效果和持久分布式执行列为后续工作;实验评测的是 PACE-P。
作者指出的局限与后续方向
- 表示范围之外的流:结论写明,把覆盖扩展到语义复述、碎片化流、隐藏次级效果和持久分布式执行是后续工作(Section 6)。Section 4.1 已说明改写、翻译和碎片化位于重编码族 Ψ 之外,Section C.6 列出漏报与误报。
- 不建立非干扰:概率非干扰是衡量尺度,不是所主张的性质(Section 2.2)。证书涉及表示路径分离和 schema 暴露的效果原子上的权限;作者称两者都不建立非干扰,可观察拒绝仍是信道,且未对任何 δ 证明式 (2)(Section 4.4)。
- 评测配置不继承一般情节不变量:恢复被阻断的调用在 A⋆ 非空时失去分离,即使 C 授权该调用。完整调解下的情节不变量只对 PACE-C 给出,对评测配置没有一般性主张(Section 4.4、Corollary D.2)。
- 自动检查达不到的前提:清单可采纳性只检查部署的声明,切断合约在完整集合下为真是前提,任何自动检查达不到(Section 4.2)。最小性保持为声明,与构建器共享的遗漏仍然可能(Section C.6)。新鲜性是进程局部的;持久预留、一次性令牌和崩溃对账是部署加固,位于所评测工件之外(Section 4.3、C.3)。
- 透明片段的排除项:Theorem 2 与 Proposition 2 覆盖类型化句柄、宿主管理的值、直通链和宿主版本化资源。排除项包括无宿主溯源的模型重组字符串、未暴露效果、工具内部次级调用,以及绕过版本化适配器的写(Section 4.4)。schema 之外的路径不能进入已认证的割(伦理声明对 Section 4.4 的转述)。
- 自适应评测的范围:附录写明该样本只覆盖三套件中的越权目标,用目标检查点作变异器,每例 50 个 episode;更强变异器以及对解析或未表示变换的攻击仍未测试。
实验覆盖范围
- 主评测:八个可执行基准 AgentDojo、AgentDyn、WASP、InjecAgent、ASB、PASB、MCPTox、MSB,三个目标族 gpt-5.6-luna、DeepSeek-V4-Flash、Qwen-3.8-27B;全部实验评测的是 PACE-P(Section 5.1)。Table 1 按基准与模型报告最差攻击组 ASR 及该基准自身效用。
- 比较对象:基线分五类,Table 1 每块保留无防御、PACE 和按平均最差组 ASR 选出的三个已发表防御;完全插桩 DTA 不进入主表比较选择(Section 5.1、E.5)。79 个合格分组 ASR 列的计数排除派生 InjecAgent 数据窃取合计、三个条件 DS-S2 列和两列无防御 ASR 为零的列(Section 5.2)。
- 消融:本地 Qwen-3.8-27B 上 1167 个冻结用例、八臂、9336 个计分结果、无技术失败(Table 2、Section 5.3)。子集任务混合不同于各基准;该子集上 AgentDyn 效用从 66.7% 降到 33.3%,全基准三点上界在此不成立。
- 自适应:30 个越权 AgentDojo 对;无防御 21/30(632 episode),PACE-P 0/30(1500 episode);157 次越权目标调用全部在派发前阻断。另有 37 个冻结模式与 1003 个无目标 episode 的受控检查,不增加攻击样本。
- 论文未报告的协议细节:正文未给出各基准样本量、主实验重复次数,也未在正文点名评审模型;目标、攻击源与评审角色分开,且目标族的模型从不单独担任评审(Section 5.1)。证书健康量的定义在 Table 16,摘录未给出数值。
总结一下论文的主要内容
PACE 在工具边界做路径割与效果核验;PACE-P 在 79 列中 62 列 ASR 最低,30 个越权目标上自适应搜索为 0。
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
- 问题:攻击者编写 skill、工具描述或 MCP schema,并控制上下文中的不可信片段,目标是未请求的不可逆效果或泄露秘密。防御者不能重训冻结策略、不能探测工具内部。作者用行为族上的站点准则说明,安全变体与泄露变体若得到同一准入判断,δ-sound 关卡必须对两者都继续调解(Theorem 1)。
- 方法:四阶段为冻结提案并建图、求可执行割并核验九项效果义务、安装动作、记录结果以供下次调用。PACE-C 保留割并复核最终调用;实验中的 PACE-P 可以恢复被 P 阻断但经 C 认证的调用,或应用声明修复且不再跑 R6。保证是条件性的:链必须被 schema 覆盖、及时发射并被模拟;作者称这不蕴含非干扰。
- 主结果:三个目标族、八个基准上,PACE-P 在 79 个合格攻击列中严格最低 62 列、并列 14 列、更高 3 列。全基准原生效用相对无防御最多降 2.92 分,结论表述为至多三个点;WASP 效用升高 14.29、11.91、8.34 分。Table 1 中例如 AgentDojo 上 Qwen 的最差组 ASR 从 48.0 到 0.0,ChatGPT 从 100.0 到 8.11;InjecAgent-E 上 ChatGPT 的 PACE 为 30.77,同块 Sandwich 为 0.59。
- 组件与自适应:1167 例消融中,作者称安全增益大多来自效果核验,拒答控制来自边界适配;含 C 的臂关掉 PASB,含 B 的臂关掉 MSB-Call,完整组合没有被展示出的独有安全收益。该子集上 AgentDyn 效用从 66.7% 降到 33.3%。30 个越权目标上,无防御自适应成功 21/30,PACE-P 为 0/30,157 次目标调用均在派发前阻断。
- 作者的结论:准入审查不能为受影响的出口站点放松调解;调用仍需要运行时决定。两条检查不可互换。把覆盖扩到语义复述、碎片化流、隐藏次级效果和持久分布式执行是后续工作。