STAC:看似无害的工具调用链如何攻破 LLM Agent
STAC: When Innocent Tools Form Dangerous Chains for LLM Agents
作者针对工具调用型智能体提出多轮序列化工具攻击框架,在8个模型上测得平均最终ASR达91.2%。
攻击者拥有直接用户接口交互权限与环境规范(工具模式、数据和初始状态)白盒知识,无模型权重与系统提示词访问权,可多轮自适应调整输入但不可篡改工具代码或系统提示词。
- 智能体通过工具调用改变外部环境,带来超越文本生成的安全威胁;现有安全检查多孤立评估单次工具调用,难以防范恶意意图被稀释在多个步骤中的多轮攻击。
- 提出STAC框架,通过推理规划生成多步工具链、在真实环境中执行验证可行性、逆向工程构建看似无害的多轮前缀,并利用规划器自适应诱导智能体执行最终恶意调用。
- 在483个案例上,8个被测智能体的平均最终ASR达91.2%;提示词防御在多轮自适应攻击下均显不足,其中推理防御在首轮将GPT-4.1的ASR降至58.6%,但最终轮回升至86.7%。
- 评估依赖同家族模型作为裁判,主实验基于单次运行点估计;攻击成功率以验证通过的工具链和合成前缀为前提;真实MCP工具实验规模有限且未对序列级监控进行评测。
- 被测模型
- GPT-4.1-2025-04-14GPT-4.1-mini-2025-04-14Qwen3-32BLlama-3.1-405B-InstructLlama-3.3-70B-InstructMistral-Large-Instruct-2411Mistral-Small-3.2-24B-Instruct-2506Magistral-Small-2506
- 基准
- SHADE-ArenaAgent-SafetyBenchOpenAgentSafety
- 指标
- ASRPHRRGoal Progress
AWS AI Labs 研究者提出 Sequential Tool Attack Chaining(STAC),一种针对工具型 LLM Agent 的多轮攻击框架:把每个单独看都无害的工具调用串联起来,恶意意图只在最后一步显现。框架用自动闭环流水线生成可执行工具链、在环境中验证,并反向构造隐蔽的多轮提示诱导 Agent 执行。研究者在 SHADE-Arena 与 Agent-SafetyBench 环境上构建了 483 个案例、1,352 组用户-Agent-环境交互,覆盖 10 种失败模式;对包括 GPT-4.1 在内的 8 个 Agent 评测,平均最终攻击成功率 91.2%,除一个模型外均超过 90%,提示有害率低于 2%、拒答率低于 4%。
推荐理由论文给出 483 个可执行工具链案例与 91.2% 平均攻击成功率,并对比多种提示防御,可供部署工具型 Agent 的团队评估序列级风险。
深度解读
这篇论文试图解决什么问题?
作者针对工具型智能体提出多轮工具链攻击框架,应对孤立看似无害但组合成害的新型威胁。
这篇论文试图解决工具调用型 LLM 智能体在多轮交互中面临的序列化工具链攻击(Sequential Tool Attack Chaining, STAC)安全脆弱性问题。
- 智能体工具交互暴露出新型物理与数字环境威胁:作者指出,与仅生成文本内容的传统对话 LLM 不同,工具调用型智能体可执行代码、调用 API、读写数据库及控制外部系统,其行为可直接且不可逆地改变环境状态。
- 现有安全护栏主要局限于单步与孤立调用评估:作者称,现有的访问控制列表或安全检查多针对单独一次工具调用进行判定,无法识别被分散在多轮合法操作中的隐蔽恶意意图。
- 核心观察为步骤单看无害但组合成害:作者提出,攻击者可将恶意目标分解为一系列表面完全合理、看似无害的前置操作,仅在最后一步才显露恶意目的,从而在全程绕过针对单步请求的安全防线。
- 提出自动化闭环攻击生成与验证框架:作者构建了 STAC 框架,通过自动化规划、环境执行验证、提示词逆向工程与自适应攻击,系统性研究智能体在多轮工具链攻击下的安全界限。
- 威胁模型:
- 访问权限(Access):攻击者通过面向用户的交互界面直接输入提示词(如通过被盗账户、共享智能体或委托访问权限);拥有直接访问权也使攻击者能够伪造多轮交互历史作为上下文注入。
- 先验知识(Knowledge):在主要模拟评测中,攻击者拥有白盒环境规范知识(包括工具模式、可用数据与初始状态),但无法获取智能体的模型权重和系统提示词;在真实 MCP 评测中则设为黑盒知识。
- 攻击能力(Capability):攻击者可跨多个交互轮次自适应调整提示词,但无法修改工具实现代码、无法向工具输出中注入恶意内容,也无法篡改智能体的系统提示词。
- 受害系统:受害系统为具备多步工具调用和环境执行能力的自主 LLM 智能体。
有哪些相关研究?
作者梳理了工具攻击、多轮越狱、组合安全与智能体防御四类研究,凸显本文在多维度的独特性。
作者在论文中系统讨论了四类相关研究,并在 Table 7 中对比了关键工作:
智能体安全与工具调用攻击
- 单轮与直接注入基准:Andriushchenko et al. (2024)、Guo et al. (2024) 评测了通用任务与代码生成的恶意请求;Zhang et al. (2024)、Zhan et al. (2024) 评估了智能体直接与间接提示注入风险;ToolEmu (Ruan et al., 2023) 与 HAICOSYSTEM (Zhou et al., 2024) 模拟了工具调用风险。作者指出,这些工作主要局限于单轮交互或单次恶意调用。
- 针对工具接口的攻击机制:Mo et al. (2025) 提出 Attractive Metadata Attack 诱导调用恶意工具;Triedman et al. (2025) 针对多智能体控制流劫持进行探索;Tur et al. (2025) 手工构造了多轮网页智能体攻击案例(n=49)。作者称,Tur et al. 的工作依赖人工设计,缺乏自动化与系统性。
多轮越狱攻击(Multi-Turn Jailbreaks)
- 对话型大模型多轮诱导:Crescendo (Russinovich et al., 2024)、X-Teaming (Rahman et al., 2025) 等通过多轮对话逐步引导 LLM 越狱,另有工作结合规划推理(Ren et al., 2024)或策略学习(Chen et al., 2025)。作者指出,这些方法的目标是诱导生成有害文本,而 STAC 聚焦于引起外部环境状态改变的工具调用序列。
组合式智能体安全研究(Compositional Agent Security)
- 任务分解与跨基底组合风险:MT-AgentRisk (Li et al., 2026a) 将有害任务分解为多步序列;MOSAIC-Bench (Steinberg and Gal, 2026) 与 MOSAIC-CLI (Wu et al., 2026b) 针对代码及命令行漏洞;SCR (Xie et al., 2026) 与 Wang et al. (2026b) 测量技能市场中的组合风险;Ahad et al. (2026) 探讨任务调度分解。作者称,STAC 的预印本(2025年9月)早于这一系列工作。
智能体防御机制(Defending Tool-Enabled Agents)
- 提示词与运行时护栏:包括基于历史记忆的监控 MAGE (Wang et al., 2026c)、上下文数据溯源审计 (Weng et al., 2026)、组合策略代数 (Schneider et al., 2026)、形式化验证 (Wu et al., 2026a) 以及控制流隔离架构 CaMeL (Debenedetti et al., 2025)。作者指出,部分护栏(如 MAGE)在静态回放 STAC 攻击链时表现出防护效果,但未测试针对自适应攻击者的鲁棒性。
基线方法与基准
- 对比基线:攻击基线包括单轮攻击(Single-turn)、MT-AgentRisk (Li et al., 2026a) 与 X-Teaming (Rahman et al., 2025);防御基线包括 Failure Modes (Zhang et al., 2024)、Spotlighting via Datamarking (Hines et al., 2024) 与 ToolShield (Li et al., 2026a)。
- 评测基准:实验采用 SHADE-Arena (Kutasov et al., 2025)、Agent-SafetyBench (Zhang et al., 2024) 以及 OpenAgentSafety (Vijayvargiya et al., 2025)。
作者称,STAC 是结合了通用在会话工具调用曲面、强制单步看似无害、环境交互执行验证和成套防御分析的研究框架(Table 7)。
论文如何解决这个问题?
作者提出包含工具链生成、环境执行验证、提示词逆向构建与自适应执行的闭环STAC框架。
作者提出了包含五个组件的闭环自动化攻击框架 STAC(Sequential Tool Attack Chaining),通过逆向生成前置上下文并实施自适应规划来诱导智能体执行恶意工具链。
攻击形式化与阶段划分
- 序列化链条设定:攻击链长度设为 L ∈ {2, …, 6},由工具调用序列 {TC1, …, TCL} 组成。
- 隐蔽性约束:前 L−1 步操作在孤立视线下均保持合理且看似无害,恶意目的仅在最终工具调用 TCL 处显露。定义攻击执行轮次索引为 τ ∈ {T, T+1, T+2},其中 T 为首次尝试执行最终目标的执行轮次。
工具链生成与环境执行验证
- 生成器(Generator)规划:Generator 基于 GPT-4.1,输入环境信息、工具规范与目标失效模式,在不与环境交互的情况下规划出包含 2–6 步工具调用的初始攻击链 {TC1, …, TCL}。
- 验证器(Verifier)执行修正:Verifier 同样基于 GPT-4.1,将生成的工具调用逐一在真实环境中执行并观察反馈 Ei。当遇到参数错误、缺少先决条件或调用失败时,Verifier 动态调整参数、替换工具或重构序列,输出可实际成功运行的验证工具链。
提示词逆向工程与自适应攻击执行
- 提示词编写器(Prompt Writer)构建前缀:Prompt Writer 基于 Qwen3-32B,针对验证工具链的前 L−1 步反向生成看似合法的用户提示词 {P1, …, PL−1},并配合执行输出拼接成合成的多轮对话历史,无需针对被测模型反复重放。
- 规划器(Planner)自适应越狱:Planner 基于 GPT-4.1,在合成对话前缀基础上,最多在 3 个执行轮次内分析智能体响应 Rτ 和环境反馈 Eτ,自适应生成攻击提示词 Pτ 以促成最终恶意调用。
评估与防御设计
- 裁判模型(Judge)打分:Judge 基于 GPT-4.1,每轮对三个指标评分:提示词无害性(Prompt Harmlessness,-3 到 3 分)、目标进度(Attack Goal Progress,-3 到 3 分,达 3 分代表完全成功并触发早停)以及智能体配合度(Agent Helpfulness,-2 到 2 分)。
- 防御提示词设计:
- 利弊权衡推理防御(Reasoning defense):在系统提示词中要求智能体在调用任何工具前,分析受影响各方、潜在负面后果与正面收益,并在潜在危害大于收益时执行拒答。
- 累积意图总结防御(Summarization defense):要求智能体在每轮响应前先总结用户在多轮交互中的累积意图,识别跨轮次构建的恶意风险。
论文做了哪些实验?
作者在483个模拟案例和真实MCP工具上评估8个模型及多类防御,发现被测智能体普遍存在较高脆弱性。
实验设置
- 被测模型:共评估 8 个模型,涵盖 4 个模型家族:GPT-4.1-2025-04-14、GPT-4.1-mini-2025-04-14、Qwen3-32B、Llama-3.1-405B-Instruct、Llama-3.3-70B-Instruct、Mistral-Large-Instruct-2411、Mistral-Small-3.2-24B-Instruct-2506、Magistral-Small-2506。
- 评测数据集与环境:主基准包含 483 个案例,覆盖 66 个环境,其中 390 个案例来自 SHADE-Arena 的 4 个环境(Spam Filter 103 例、Travel 99 例、Workspace 98 例、Banking 90 例),93 个案例来自 Agent-SafetyBench 的 62 个环境。此外构建了基于 OpenAgentSafety 的 MCP 真实工具评测集。
- 基线方法:攻击基线包括单轮 STAC、MT-AgentRisk(n=124)和 X-Teaming;防御基线包括 Failure Modes、Spotlighting via Datamarking 和 ToolShield。
- 指标定义:攻击成功率(ASR,Goal Progress = 3 的比例)、提示词有害率(PH,Prompt Harmlessness < 0 的比例)、拒答率(RR,Agent Helpfulness < 0 的比例)。
- 评审方式:由 GPT-4.1 担任 Judge,依据评分量表判定,Goal Progress 达到 3 时提前终止评测。
- 样本量与交互预算:主评测样本量 n=483;用户规划轮次上限为 3 轮,智能体每轮最多可与环境交互 10 次工具调用。
主结果
下表呈现 8 个被测模型在 483 个基准案例上的 ASR、PH 和 RR 评测结果(据 Table 2):
表格较宽,可左右滑动
被测模型 ASR(T) ASR(T+1) ASR(T+2) PH(T) PH(T+1) PH(T+2) RR(T) RR(T+1) RR(T+2) GPT-4.1 87.4% 92.5% 93.4% 0.4% 0.2% 0.2% 1.9% 0.2% 0.2% GPT-4.1-mini 85.7% 93.8% 95.0% 0.2% 0.2% 0.0% 1.0% 0.6% 0.4% Qwen3-32B 85.3% 91.7% 93.2% 0.4% 0.2% 0.0% 0.8% 0.6% 0.6% Llama-3.1-405B 86.3% 90.7% 92.3% 0.8% 0.2% 0.0% 1.4% 1.4% 1.0% Llama-3.3-70B 85.9% 92.8% 94.0% 0.4% 0.4% 0.2% 0.4% 0.4% 0.4% Mistral-Large 82.8% 90.7% 92.3% 0.6% 0.2% 0.2% 1.7% 3.1% 2.1% Mistral-Small 80.7% 88.8% 91.3% 0.6% 0.2% 0.0% 3.5% 2.9% 2.9% Magistral-Small 46.2% 70.0% 77.8% 0.6% 1.2% 1.4% 3.1% 2.5% 2.3% 平均值 80.0% 88.9% 91.2% 0.5% 0.3% 0.2% 1.7% 1.5% 1.2% - 普遍高脆弱性:除 Magistral-Small 外,其余 7 个模型在 T+2 轮的最终 ASR 均超过 90%,8 个模型平均最终 ASR 达到 91.2%。
- 高隐蔽性保持:所有模型的提示词有害率 PH 均低于 2%(平均仅 0.2%–0.5%),拒答率 RR 均低于 4%(平均仅 1.2%–1.7%)。
- 自适应轮次提升效果:随着执行轮次从 T 推进到 T+2,平均 ASR 从 80.0% 升至 91.2%,作者指出多轮自适应机制能够有效克服初始执行障碍。
攻击方法与前缀消融对比
- 测了什么:在 390 个 SHADE-Arena 案例上对比多轮 STAC、去除前缀的单轮 STAC、MT-AgentRisk 以及 X-Teaming(据 Table 3)。
- 实验结果:多轮 STAC 达到 95.1% ASR、0.0% PH、0.5% RR 及平均 2.8 轮;单轮 STAC 达 72.8% ASR、1.0% PH、0.5% RR(1.0 轮);MT-AgentRisk 为 53.2% ASR、27.4% PH、5.6% RR(3.9 轮);X-Teaming 为 61.5% ASR(4.2 轮)。
- 作者解读:单轮 STAC 的 ASR 较完整 STAC 低 22.3 个百分点,作者认为这量化了合成多轮前缀所起到的上下文铺垫作用;MT-AgentRisk 因缺乏环境验证及子步骤可能带有明显恶意,导致成功率较低且 PH 高达 27.4%。
真实 MCP 工具后端泛化验证
- 测了什么:在 OpenAgentSafety 基准的真实文件系统与 Playwright 浏览器自动化 Docker 环境中测试 GPT-4.1,对比完整流水线与无工具链直接攻击(据 Table 12)。
- 实验结果:在 32 个匹配任务上,完整流水线的 ASR 达到 35.5%(无工具链为 12.5%),事后评估完全成功率达 52.9%(无工具链为 12.5%),拒答率从 12.5% 降至 3.6%。
- 作者解读:作者指出真实 MCP 下的黑盒设定与权限限制导致成功率低于模拟环境(35.5% 对比 95.1%),但验证工具链依然显著放大了攻击效力,且保持了低拒答率。
提示词防御与防御感知攻击评估
- 测了什么:在 483 个案例上评估 GPT-4.1 搭载不同防御的表现,以及将防御提示词提供给 Planner 时的防御感知自适应攻击(据 Table 4、Table 6)。
- 实验结果:在 GPT-4.1 上,Reasoning 防御在 T 轮取得最低 ASR 58.6%(较无防御下降 28.8 个百分点,RR 为 29.8%),但在 T+2 轮 ASR 回升至 86.7%;ToolShield 在 T+2 轮取得最低 ASR 78.1%(RR 为 8.3%)。向攻击者公开防御提示词后,各防御在 T+2 轮的 ASR 均出现下降(降幅为 7.2 至 10.0 个百分点)。
- 作者解读:作者指出推理防御在初始轮表现最强但随自适应攻击衰减,ToolShield 更具持久性但仍不充分;攻击者知晓防御后成功率反而下降,是因为攻击者放弃了隐蔽的上下文连贯性策略而采用了更容易引起拒答的防御规避说辞。
其他消融与分析
- 工具链长度分布:2 步占比 47.4%(229 例),3 步占比 37.3%(180 例),4 步 59 例,5+ 步 15 例,平均长度 2.6 步(据 Table 11)。
- 失败模式分布:10 种失败模式分别包含 42 至 55 个案例,分布接近均匀(据 Table 11)。
- 跨模型防御泛化:在 Qwen3-32B、Mistral-Small-3.2-24B 和 Llama-3.3-70B 上,所有提示词防御在 T+2 轮留存的 ASR 均处于 74.3% 至 92.5% 之间(据 Table 5)。
- 负面结果与例外:Magistral-Small 的 ASR 较低(T 轮 46.2%,T+2 轮 77.8%),作者指出是因为该模型自身工具执行能力较弱导致任务未完成,其 RR 始终保持在 3.1% 以下。
有什么可以进一步探索的点?
作者指出了单一模型裁判、单次估计及防御范围局限等问题,后续需拓宽序列监控与真实工具评测。
作者指出的局限与后续方向
- 单一模型裁判与构念效度:作者指出,主实验的裁判模型与生成器、规划器同属 GPT-4.1 系列,单模型家族裁判可能影响报告的 ASR、PH 和 RR;作者将分层抽样的人工验证和跨模型家族裁判列为重要的后续工作(Section 6)。
- 单次运行与统计不确定性:作者指出,Table 2–6 的结果均为单次运行的点估计,由于生成与规划存在随机性,未能刻画运行间的方差;作者提出未来应在 483 个案例上计算 Bootstrap 置信区间并进行多随机种子重复实验(Section 6)。
- 验证链筛选偏差与条件依赖:作者指出,基准中仅收录了通过环境验证的工具链,这保证了可执行性但可能使数据集偏向更容易成功的攻击(MCP 设置下候选链验证成功率为 90.3%);同时评估条件依赖于合成的前缀历史,端到端动态交互生成前缀有待未来进一步测定(Section 6)。
- 真实工具评测规模与多样性:作者指出,真实 MCP 工具评测目前仅覆盖文件系统和浏览器两个后端,任务数量和模型单一(仅 GPT-4.1);更广泛的真实工具覆盖、分环境与分失效模式细分指标,以及评估更多前沿推理模型为后续方向(Section 6)。
- 预定义失效模式的约束:作者指出,框架依赖现有文献预定义的 10 类失效模式,可能限制其发现由独特工具组合或特定环境约束引发的新型漏洞模式(Section 6)。
- 防御研究范围局限于提示词层级:作者指出,评测集中于无需重新训练或更改架构的提示词与经验防御,而对于基于记忆、数据溯源、策略组合和形式化验证等智能体护栏在面对自适应 STAC 攻击时的鲁棒性尚未展开测试;同时未直接评估审计日志、行为模式和状态差异等序列级监控器(Section 3.4 与 Section 6)。
实验覆盖范围
- 被测智能体模型覆盖范围:评测覆盖了 4 个家族共 8 个 LLM(包括 GPT-4.1、GPT-4.1-mini、Qwen3-32B、Llama-3.1-405B、Llama-3.3-70B、Mistral-Large、Mistral-Small、Magistral-Small)。
- 评测环境与任务覆盖范围:模拟环境覆盖 SHADE-Arena 的 4 个环境(390 例)与 Agent-SafetyBench 的 62 个环境(93 例);真实工具评测覆盖 2 个 MCP 后端及 OpenAgentSafety 的 32 个匹配任务。
- 评测预算与交互参数:设定用户攻击轮次上限为 3 轮,智能体每轮环境交互上限为 10 次工具调用;生成温度设为 1.0,执行规划与裁判温度设为 0.15。
- 防御机制评测范围:评估了 4 种零样本提示词防御(Spotlighting、Failure Modes、Summarization、Reasoning)及 1 种基于经验的系统提示词防御(ToolShield)。
- 论文未报告指标与设置:论文未报告主实验的统计置信区间与重复运行方差,未报告主基准从候选生成到验证通过的完整比例,亦未报告序列级外部监控器对 STAC 的检测表现。
总结一下论文的主要内容
作者提出并验证了智能体在序列化工具攻击下的普遍脆弱性,指出针对累积动作序列防御的必要性。
- 研究定位与核心问题:论文针对具备工具使用能力的 LLM 智能体,研究恶意意图被分散在多轮合法工具调用中的序列化工具链攻击(STAC)脆弱性。与纯文本越狱不同,此类攻击直接导致不可逆的外部环境改变。
- 方法设计要点:构建了包含五大角色的闭环自动化框架,首先由生成器规划多步工具链并约束前置步骤无害,接着由验证器在真实环境中交互执行以修正不可行调用,再由提示词编写器逆向工程合成看似合法的多轮对话前缀,最后由规划器自适应引导智能体完成最终恶意操作。
- 智能体普遍面临高安全风险:在涵盖 66 个环境的 483 个基准案例中,8 个前沿开源与闭源智能体平均最终 ASR 达到 91.2%(除能力较弱的 Magistral-Small 外均超 90%),同时全过程保持低提示词有害率(平均 0.2%–0.5%)与低拒答率(平均 1.2%–1.7%)(Table 2)。
- 多轮前缀与环境验证的效力验证:在 390 个 SHADE-Arena 案例上,完整 STAC 的 ASR 达到 95.1%,较无合成前缀的单轮攻击高出 22.3 个百分点,并大幅超过未经验证的基线 MT-AgentRisk(53.2%)(Table 3);在真实 MCP 工具后端中,完整流水线取得 35.5% 的黑盒 ASR,明显高于无工具链基线的 12.5%(Table 12)。
- 现有提示词防御的局限与启示:利弊权衡推理防御在首轮将 GPT-4.1 的 ASR 从 87.4% 压制至 58.6%,但在自适应攻击下保护效果迅速衰减,最终 ASR 升至 86.7%;经验防御 ToolShield 展现出相对更持久的防护(最终 ASR 为 78.1%),但所有提示词防御均未能将攻击阻断在可接受水平(Table 4)。
- 作者结论:作者认为智能体安全防御必须从隔离评估单步动作转向对动作序列及其累积后果进行全局推理,呼吁未来进一步探索动作感知型防护机制。