跳到正文
原文
论文追踪· arXiv:2608.30041· Wujie Xiong, Rabimba Karanjai, Yang Lu, Weidong Shi, Lei Xu·本站收录 · 原文发表

SkillGuard:面向间接提示注入的 LLM Agent 能力限制机制

Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

SkillGuard 在 AgentDojo 上用可达性限制污染后的技能能力,Travel 上 ASR 降至 0%,且不增加模型调用。

威胁模型攻击者可影响技能返回的外部内容(网页、文档、数据库记录),通过 indirect prompt injection 诱导后续越权调用;知道技能接口,不能破坏 harness,也不能让已注册技能偏离其声明的 transition summary。

问题
LLM 智能体把外部技能输出写入执行状态后,不可信数据会改变后续特权动作。现有防御主要分类内容或逐次授权,不直接决定污染之后哪些能力必须被限制。
方法
SkillGuard 在 harness 内用 Skill Impact Graph、steerability signature 和内联引用监视器,在污染后用 binary、fractional 或 fractional-flow 做加权能力限制,不调用辅助语言模型。
实验与结果
在 AgentDojo Tool Knowledge 上,两个后端的 Travel、Banking、Workspace 攻击成功率降到 0%;Slack 仍有残余。组合攻击上 Llama 低于各基线,Gemini 接近最强基线且良性效用更高。fractional-flow 在相同攻击成功率下保留更多能力,且不增加模型调用或 token。
局限与可以继续做的
保证依赖可信 harness、静态技能注册表以及摘要、签名和策略正确。Workspace 图上限制计算可达数秒。组合基准规模小于 AgentDojo,且只比较了固定策略下的基线。
实验设置Gemini 2.5 Flash、Llama3.3-70B · AgentDojo v1.2.2、AgentDojo Tool Knowledge(Banking, Slack, Workspace, Travel) 等 · ASR、BU 等
威胁模型
攻击者可影响技能返回的外部内容(网页、文档、数据库记录),通过 indirect prompt injection 诱导后续越权调用;知道技能接口,不能破坏 harness,也不能让已注册技能偏离其声明的 transition summary。受害系统是由 harness 中介的 LLM 智能体。排除终端用户直接越狱、训练时攻击、harness 被攻破、错误技能摘要、幻觉/谄媚、多智能体协调失败,以及不调用工具的 text-to-text 攻击。
模型
Gemini 2.5 FlashLlama3.3-70B
基准
AgentDojo v1.2.2AgentDojo Tool Knowledge(Banking, Slack, Workspace, Travel)AgentDojo Travel 全部 16 种攻击Compositional attack benchmark(Banking, Slack, Travel, Workspace)
指标
ASRBUUATPRFPRRCRACRLLM callstokenslatency
AI 导读全文 278 字

研究者提出 SkillGuard,一种 harness 层的执行约束机制,用于应对 LLM Agent 在间接提示注入下把外部技能输出带入执行上下文的问题。该方法把不可信数据进入状态视为污染事件,用 Skill Impact Graph 表示安全相关状态转移,用 steerability signatures 规定技能参数的可接受控制范围,并通过内联引用监视器介入技能调用;污染发生后按二值、分数或分数流策略计算加权能力限制,且不依赖额外的语言模型推理。分数流限制在相同攻击成功率下比二值限制保留更多能力,两种设置下均不增加模型调用或 token 开销。

深度解读

6 个问题,约 8,900 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    污染进入状态后,如何限制未来能力使执行到不了禁止状态。

    不可信技能输出进入执行状态后,如何限制智能体未来能力,使后续执行到不了部署者定义的禁止状态。

    • 场景:LLM 智能体调用检索、代码执行、数据库和应用 API,把观察追加进上下文并据此采取下一步。作者认为这构成 confused-deputy:特权智能体本身未被直接攻破,却被诱导以用户权限行事。当前模型不能可靠区分指令与不可信数据,因此 indirect prompt injection 是技能调用边界上的结构性风险。
    • 现有不足:模型层防御依赖在内容影响决策前识别并处理不可信内容;系统层方法(CaMeL、AgentArmor、AttriGuard)主要回答“这次提议的操作是否被用户请求证明合理”,不回答污染之后哪些能力必须被限制。作者还称现有基准很少单独考察组合攻击,且运行时防御开销大:评测中 CaMeL 与 AttriGuard 每任务最多增加 15 次模型调用和 69K token。
    • 核心观察:部署策略标明可能含不可信数据的技能输出后,harness 提交该输出即把状态标为污染,并基于可达性切断到禁止状态的路径,而不解释造成污染的自然语言。
    • 本文提出:SkillGuard,位于可信 harness 内、在分发前中介技能调用。它用 Skill Impact Graph(SIG)表示安全相关转移,用 steerability signature 规定参数可由哪些来源控制,用内联引用监视器(IRM)做检查;污染后用 binary、fractional 或 fractional-flow 计算加权能力限制,不调用辅助语言模型。作者还构建了组合攻击数据集。
    • 威胁模型:
      • 目标:通过技能输出中的 indirect prompt injection 或其他恶意内容,操纵智能体后续行为,使其做未授权调用或使用未授权参数。安全目标是即使存在这类攻击,执行仍满足策略规定的状态安全(SS)、上下文完整性(CI)、能力不升级(CNE)和信息流机密性(IFC)。
      • 知识与能力:攻击者可影响或控制技能访问到的外部内容(网页、文档、数据库记录);知道暴露的技能接口;不能攻破 harness,也不能让已注册技能偏离其声明的 transition summary。外部数据源 D 被视为不可信。
      • 受害系统:由可信 harness H 中介的 LLM M 与技能集 Σ。M 不假定能区分指令与数据;技能按声明接口与摘要执行,但仍可能在模型给出受攻击者影响的参数时做出未授权动作。
      • 范围外:终端用户直接越狱、训练时后门与数据投毒、harness 被攻破、恶意或摘要错误的技能实现、幻觉与谄媚、多智能体协调失败,以及不调用工具、诱使人类执行动作的 text-to-text 攻击。
  2. 有哪些相关研究?

    相关工作分模型层隔离、系统层逐次授权,以及可达性与能力限制。

    论文把相关工作放在引言的防御讨论和 §2 的问题设定中,并在实验里点名基线。

    • 模型层指令与数据隔离:Hines 等(Spotlighting)用提示技术显式分隔不可信内容;Chen 等与 Wallace 等用训练把指令通道和数据通道分开或对齐;ProtectAI 的检测器在内容到达模型前筛查。作者称这些方法的有效性取决于在不可信内容影响决策之前识别并安全处理它。
    • 系统层逐次授权:Debenedetti 等的 CaMeL 从可信用户请求导出控制流与数据流约束;Wang 等的 AgentArmor 从观察到的执行轨迹重建程序依赖;Chen 等的 AttriGuard 对观察历史做反事实回放,以评估提议的调用。作者称这些系统会利用先前执行步骤,但主要回答单次操作是否被用户请求证明合理,而本文处理互补的可达性问题。
    • 保护状态与图割:Harrison 等用保护状态之间的转移刻画系统安全;Bishop 等把可达性用于这类转移;作者还引用基于最小割断开不安全路径的图方法。SkillGuard 采用这一表述来建模智能体执行。能力模型方面,作者引用 Miller 等,把每个技能视为与外部环境交互的独立权限。运行时机制上,IRM 被描述为 Ligatti 等意义上的 suppression automaton。confused deputy 来自 Hardy。
    • 基线方法与基准:实验基线为 No Defense(只依赖后端模型自身抵抗注入指令)、Spotlighting、CaMeL、AttriGuard。基准为 AgentDojo v1.2.2(过滤 text-to-text 后 97 个用户任务、929 个攻击实例),以及作者构建的、覆盖 Banking、Slack、Travel、Workspace 的组合攻击数据集。

    作者把本文定位为:不把检索内容分类为良性或恶意,而是在污染提交后,用 harness 计算的转移抽象上的可达性限制未来能力,并在不增加模型调用的前提下与上述基线比较。

  3. 论文如何解决这个问题?

    用 SIG、签名和 IRM,在污染后做最小代价能力限制。

    整体上,SkillGuard 把“不可信输出被提交”当作污染,在 SIG 上求最小代价限制,使污染状态到禁止状态集 B 不再可达,并由 IRM 在分发前执行该限制。

    问题设定与 Skill Impact Graph

    • 组件:LLM M、技能集 Σ、不可信外部数据源 D、可信 harness H。H 拦截调用、分发、取回结果并写入上下文;SkillGuard 集成在 H 中,在副作用发生前做决定。
    • SIG:定义 1 中 G = (Q, Σ, δ, q0)。状态只记录当前启用的能力以及策略所需的信任与限制数据,不保留与强制无关的模型上下文。一次执行事件 e = (σ, p, o),后继为 q′ = δ(q, e)。可达性回答:从当前状态经允许的技能执行能否到达禁止状态。
    • 四条策略:SS 要求从 q0 不可达 B;CI 要求安全敏感参数不被未授权来源影响;CNE 要求技能执行不扩大能力集;IFC 要求敏感信息只流向策略授权的技能或输出。部署策略把这四条映射到 SIG 上的禁止状态或禁止转移。

    Steerability signature 与 IRM

    • 签名:对技能 σ 的每个参数 pi,签名给出类型 τi 和 steerability envelope Ei,输出类型为 τout。精度分三档:Exact(类型或有限值集)、Harness-enforced refinement(如把文件路径限制到某一前缀)、Conservative(没有可靠界时 Ei = ⊤)。签名可靠的条件是攻击者实际能诱导的取值集合 Ai 满足 Ai ⊆ Ei。
    • IRM:位于 LLM 与技能执行之间。分发前检查技能在当前能力集中且每个参数满足当前 envelope,失败则拒绝。执行后校验输出,失败则丢弃且状态不变。作者称 IRM 是 suppression automaton:丢弃被拒调用和无效输出,不终止智能体,也不插入合成动作。
    • 局部检查不够:一次调用可以满足当下约束,仍留下通往禁止状态的后续路径。限制在产生污染的事件提交之后生效,不回溯拒绝引入污染的那一次调用。

    三种能力限制

    • 目标:污染后在前瞻 SIG 上选最小代价限制 (R, T),使 Reach 从当前状态 q 与 B 的交集为空。R 是移除集合,T 是对保留能力的收紧映射。代价 W(R, T) 由策略定义。计算只用 harness 抽象,不调用语言模型。
    • Binary:每个能力一个 0/1 变量,路径约束要求每条从 q 到 B 的路径至少移除一个能力。结果只含移除集,T 为空。IRM 随后拒绝该技能的一切调用。
    • Fractional:在 binary 标出的能力上,各自求最小代价收紧。收紧因子 yc ∈ [0, 1]:0 保留原 envelope,1 相当于移除该能力。yc < 1 时技能仍可用,但参数必须落在收紧后的 envelope 内。
    • Fractional-flow:在整张 SIG 上联合选择能力限制与经认证的收紧,用最小费用流处理共享路径,避免能由更少能力切断的路径被重复限制。作者给出用 Dinic 算法时复杂度为 O((n + m)^2 (kn + m)),其中 n 为注册技能数,m 为转移数,k 为策略固定的并行边数。

    工作流与条件性保证

    • Algorithm 1:初始化 q0、K0、Sig0 并 BuildSIG。每个调用先做 IRM 预检,通过后执行,再做输出后检;提交后若污染标记相对前一状态改变,则 ComputeRestriction,移除能力、收紧签名并 RebuildSIG。技能摘要、原始签名和安全性质在执行中固定;新增技能时只把它的转移并入 SIG,除非它带来额外安全约束。
    • 命题 1:设 qc 不在 B 中,且受限图 Gc 上从 qc 不可达 B。在 harness 可信、技能注册表静态、摘要与签名正确、SkillGuard 忠实执行策略的假设下,作者论证从 qc 出发被允许的每条延续都满足 SS、CI、CNE 和 IFC。证明按延续长度归纳,依赖 IRM 完全中介调用。
    • 成功判定与指标口径:基准 ASR 看攻击者目标是否达成;SS、CI、CNE、IFC 相对 SkillGuard 的部署策略定义。作者写明:攻击目标落在部署策略之外时,ASR 可以非零,同时没有形式安全性质被违反。RCR = |Cfinal| / |Cinit|,ACR = |Cinit| − |Cfinal|。
  4. 论文做了哪些实验?

    两后端、四套件与组合攻击上,SkillGuard 把多数 ASR 降到 0%。

    实验设置

    • 模型:Gemini 2.5 Flash(reasoning budget 8,192 tokens)与 Llama3.3-70B。单步攻击每项 5 次,组合攻击每项 10 次,报告均值。
    • 基准:AgentDojo v1.2.2。排除 text-to-text 后,949 个 user–injection 实例去掉 20 个,得到 97 个用户任务、929 个攻击实例。评测 Tool Knowledge(Workspace、Slack、Travel、Banking)以及 Travel 上全部 16 种攻击(7 个 Instruction-Hijacking hard、9 个 DoS / Direct Injection easy)。组合攻击另建于四个套件,含片段化指令、跨源信息组合、多步工作流操纵三类;附录 A 对每个场景做单片段消融,确认单独成分不足以诱导目标违规。
    • 基线:No Defense、Spotlighting、CaMeL、AttriGuard。SkillGuard 变体含 IRM Only、IRM + Binary Cut(BC)、IRM + Fractional-Flow Cut(FFC)。
    • 指标:BU、UA、ASR、TPR、FPR、RCR、ACR。开销看每任务毫秒或秒、模型调用次数和 token。ASR 由基准定义的攻击目标判定,与策略上的 SS/CI/CNE/IFC 不是同一谓词。
    • 策略敏感性:Travel 的 Tool Knowledge 上,把 hotel、recipients、title 三个身份 envelope 从原规格改为 conservative,以及 unconstrained。

    主结果

    Table 2 是四域 Tool Knowledge 上 SkillGuard 自身的 ASR 与 RCR。摘要中的 Slack 数字写作 4.8% 与 14.3%,与 Table 2 的 4.76% 与 14.29% 对应同一设置。

    表格较宽,可左右滑动

    模型Banking ASR (Flow)Slack ASR (Flow)Workspace ASR (Flow)Travel ASR (Flow)Travel RCR (Flow)
    Gemini 2.5 Flash0.00%4.76%0.00%0.00%93.21%
    Llama3.3-70B0.00%14.29%0.00%0.00%94.08%

    据 Table 2。Binary 的 ASR:Gemini 四域为 0.00%、4.76%、0.00%、0.00%;Llama 为 0.00%、8.57%、0.00%、0.00%。Flow 相对 Binary 的 ΔRCR:Gemini 为 6.82%、27.53%、14.49%、16.96%;Llama 为 19.32%、30.74%、10.03%、14.79%。

    • 作者解读:两个后端在 Banking、Workspace、Travel 上 ASR 为 0;Slack 是唯一非零域。作者称残余来自两类边界:有的基准目标被 SkillGuard 当成污染事件而不是策略违规,有的在限制生效前已经完成。
    • 与基线:摘要称 Tool Knowledge 下 SkillGuard 在三个套件上消除攻击成功,Slack 上 Gemini 为 4.8%、Llama 为 14.3%。Figure 2 的坐标文字给出部分基线点,但中间列在文本转换中错位,不能逐格对应到模型与套件,故不把图中孤立百分数写成对比表。正文给出的可读对比是 Llama-Travel:SkillGuard 将 ASR 从 AttriGuard 的 4.2% 降到 0%,BU 从 20.0% 升到 35.0%。
    • 能力保留:Travel 上 fractional-flow 的 RCR 为 93.21%–94.08%,binary 为 76.25%–79.29%,两者 ASR 均为 0%(Table 1 与 Table 2 的 Travel 列一致)。

    组件增量与攻击类型

    Table 1 在 Travel、全部 16 种攻击上比较组件。

    • IRM 不够:No Defense 的 ASR 为 Gemini 22.34%、Llama 50.83%;IRM Only 降到 14.19% 与 10.37%,TPR 均为 0.00%。加上 BC 或 FFC 后,两模型 ASR 均为 0.00%。
    • 效用与误拒:BC 的 TPR 为 100.00%,RCR 为 Gemini 76.25%、Llama 79.29%,Llama 的 FPR 为 5.47%。FFC 的 TPR 为 Gemini 97.27%、Llama 81.57%,FPR 为 4.09% 与 1.84%,RCR 为 93.21% 与 94.08%。相对 BC,FFC 的 BU/UA 更高:Gemini BU 从 40.00% 到 45.31%,Llama 从 14.06% 到 23.64%。每任务开销 BC 为 5.57 ms 与 5.25 ms,FFC 为 10.40 ms 与 9.82 ms。
    • Table 3:Travel 上 DoS / Direct Injection 几乎全为 0.00% ASR;例外是 Gemini 在 system message、fractional-flow 下 ASR 为 0.71%。Instruction-Hijacking 对 Gemini 更高,binary 最高 5.71%(important instr.),flow 最高 5.00%;Llama 在表中全部攻击上为 0.00%。模型级 ACR:binary 为 Gemini 6.65、Llama 5.80;flow 为 1.90 与 1.66。Table 3 的攻击级 ASR 与 Table 1“全部 16 种攻击聚合 ASR 为 0.00%”口径不同,论文未解释该差异。

    与基线的组合攻击及开销

    • 组合攻击:作者称在 Llama 上 SkillGuard 的 ASR 最低,为 8.00%,UA 最高,为 81.82%。在 Gemini 上 ASR 为 14.29%,CaMeL 为 14.00%,相差 0.29 个百分点;BU 为 92.27% 对 CaMeL 的 82.27%,高 10 个百分点。附录 A 的单片段消融:Travel T4、Banking B3 的各单片段 ASR 为 0%,完整组合才成功;Banking B4 要求三笔分期全部改道才算成功,单片段消融 ASR 为 0%,完整组合为 100%。
    • 开销:作者称 SkillGuard 不增加模型调用或 token。保护开销在 Banking、Slack、Travel 上至多 10.02 ms/任务;Workspace 图上为 7.17–12.56 s。Llama-Travel 端到端延迟从 CaMeL 的 147.40 s 降到 SkillGuard 的 34.57 s。
    • 策略不完整:Table 4,Gemini、Travel、Tool Knowledge。原规格 ASR 0.00%、BU 60%、UA 48.33%、RCR 93.21%。三个身份 envelope 改为 conservative 后 ASR 仍为 0.00%,BU 45%、UA 41.67%、RCR 82.50%。作者称若这些 envelope 不受约束,限制不足以满足 steerability 约束,SkillGuard 会移除全部工具;Table 4 未给出该行的数字。

    其他消融与分析

    • Table 1,Travel,16 种攻击:No Defense 的 BU/UA 为 Gemini 57.61%/52.67%、Llama 40.00%/21.67%,RCR 均为 100%。
    • Table 1,IRM Only:Gemini BU/UA 55.00%/48.52%,FPR 0.00%,开销 0.14 ms;Llama BU/UA 24.79%/21.42%,FPR 0.13%,开销 0.19 ms。
    • Table 2,Binary RCR:Gemini 四域 86.36%、61.21%、61.45%、76.25%;Llama 61.36%、56.97%、72.42%、79.29%。
    • Table 3(b):Gemini ΔRCR 16.96%,Llama ΔRCR 14.79%(Travel,攻击类型汇总)。
    • Slack 的 Flow ASR 高于同域 Binary:Llama 从 8.57% 到 14.29%;Gemini 两者同为 4.76%(Table 2)。
    • 论文未单列 fractional(非 flow)策略的实验数字;主实验对比的是 binary 与 fractional-flow。
  5. 有什么可以进一步探索的点?

    保证以摘要、签名和策略正确为前提;Workspace 上计算开销到秒级。

    作者指出的局限与后续方向

    • 条件性保证:可达性保证依赖于可信计算基和抽象的可靠性。harness 必须忠实执行监视器决定;已注册技能必须符合声明的转移摘要;SIG 必须保守覆盖全部安全相关行为;部署策略和 steerability signature 必须正确指定禁止状态与允许的控制来源(引言 Results;命题 1 的假设,§3.6)。
    • 限制不回溯:能力更新发生在产生污染的事件提交之后,只约束未来调用,不回溯拒绝引入污染的那一次调用(§3.5)。作者在结果中把 Slack 残余和“限制生效前目标已完成”联系起来。
    • 策略目标与基准目标可能不一致:攻击目标落在部署策略之外时,ASR 可以非零,同时没有形式安全性质被违反(§5.2)。作者把部分残余归为:基准目标被当成污染事件而不是策略违规(引言 Results)。
    • 签名规格影响保留能力:评测假定部署策略和签名指定正确。三个身份 envelope 改为 conservative 时 ASR 仍为 0%,RCR 从 93.21% 降到 82.50%;不受约束时作者称会移除全部工具(§5.3,Table 4)。
    • 大图上的计算代价:限制求解的运行时间随图规模增长,更大的可达转移集会带来不可忽略的 Min-Cut 代价(§4.3)。Workspace 上测得 7.17–12.56 s(引言 Results)。
    • 范围外威胁:直接越狱、训练时攻击、harness 被攻破、恶意或错误摘要的技能、幻觉与谄媚、多智能体失败,以及不调用工具的 text-to-text,作者明确排除(§2 Scope)。

    论文的 Limitations / Future Work 没有单独列出“计划发布代码”或新实验清单;上面各条是正文里明确作为假设、边界或范围外写出的内容。

    实验覆盖范围

    • 被测后端为 Gemini 2.5 Flash 与 Llama3.3-70B;AgentDojo v1.2.2 过滤后为 97 个用户任务、929 个攻击实例(§5.2)。
    • Tool Knowledge 覆盖 Banking、Slack、Workspace、Travel;Travel 另报全部 16 种攻击的组件分析与分类型 ASR(Table 1–3)。
    • 基线为 No Defense、Spotlighting、CaMeL、AttriGuard;重复次数为单步 5 次、组合攻击 10 次,报告均值(§5.2)。
    • 组合攻击基准由作者在四个套件上构建,并用单片段消融检查“单独观察不足”;附录 A 给出 Travel T4、Banking B3、Banking B4 的代表场景与消融 ASR。
    • 开销报告了模型调用、token 和延迟:SkillGuard 不增加模型调用或 token;与 CaMeL 的端到端延迟对比写在 Llama-Travel 上(147.40 s 对 34.57 s)。论文未报告 fractional(非 flow)变体的单独结果表,也未报告评审模型,ASR 按基准目标是否达成计算。
  6. 总结一下论文的主要内容

    SkillGuard 用污染后的可达性限制切断禁止状态,多数套件 ASR 为 0%。

    SkillGuard 是放在可信 harness 里的强制层,用来处理 indirect prompt injection 进入智能体状态之后的能力可达性,而不是再做一次内容分类。

    • 问题:技能输出来自信任边界之外,却会进入上下文并影响后续特权动作。作者认为现有防御要么依赖识别不可信内容,要么只做逐次授权,没有回答污染之后还应保留哪些能力。
    • 方法:用 SIG 表示安全相关转移,用 steerability signature 约束每个参数的可操纵范围,用 IRM 在分发前检查技能是否仍被允许、参数是否落在 envelope 内,并在提交前校验输出。新的污染会触发 binary、fractional 或 fractional-flow 限制,切断到禁止状态集的路径。命题 1 的保证以 harness 可信、注册表静态、摘要与签名正确为前提。不调用辅助语言模型。
    • Tool Knowledge:Gemini 与 Llama 在 Banking、Workspace、Travel 上 Flow ASR 为 0.00%;Slack 为 4.76% 与 14.29%(Table 2;摘要写作 4.8% 与 14.3%)。Travel 上 fractional-flow 的 RCR 为 93.21%–94.08%,binary 为 76.25%–79.29%,ASR 同为 0%。
    • 组件与类型:Travel 全部 16 种攻击上,IRM Only 仍有 ASR(Gemini 14.19%,Llama 10.37%),IRM+BC 与 IRM+FFC 为 0.00%(Table 1)。分类型表里 Gemini 的 Instruction-Hijacking 最高到 5.71%,system message 的 flow ASR 为 0.71%,Llama 在该表全部为 0.00%(Table 3)。
    • 组合攻击与开销:Llama 上 ASR 8.00%、UA 81.82%,作者称低于各基线。Gemini 上 ASR 14.29%,与 CaMeL 的 14.00% 相差 0.29 个百分点,BU 为 92.27% 对 82.27%。保护不增加模型调用或 token;小套件开销至多 10.02 ms/任务,Workspace 为 7.17–12.56 s。Llama-Travel 端到端延迟为 34.57 s,CaMeL 为 147.40 s。
    • 作者的结论:在摘要与策略可靠时,污染后的可达性限制可以把三个套件上的 Tool Knowledge 攻击成功率降到 0,并用更细的 envelope 收紧换回能力;Slack 残余和签名过宽时移除全部工具,标出了该保证的边界。
阅读原文arxiv.org