研究揭示多智能体 LLM 流水线的结构性漏洞
Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures
作者在三模型五层流水线上评估四类边界攻击,称成功率取决于架构而非骨干模型。
五层十智能体流水线中,攻击者利用未校验的内容、身份或委托边界,使对抗内容作为可信输入传播。
- 多智能体流水线把中间输出当可信输入下传,却不校验内容、身份和委托边界。作者认为对抗内容会跨智能体传播;现有工作多看单模型或合成攻击,未区分漏洞属于骨干模型还是架构。
- 作者把边界校验定义为跨智能体消息的显式验证,并从TRAIL轨迹按三个标准筛出四类失败。再在十智能体五层流水线上固定架构,只换GPT-5-mini、Claude Sonnet 4.5和Kimi K2.5来操作化攻击。
- 836个错误中452个属四类,147条安全分均为满分。三模型A1成功率0.61–0.72,A3为0.81–0.86。Claude Sonnet 4.5在A4下恢复率0.22,A1与A3下低于0.10。作者称成败取决于架构而非模型。
- 论文未专门讨论局限。评估覆盖三个骨干模型,以及TRAIL中的GAIA与SWE-Bench Lite轨迹。论文未报告20个共享任务的基准名称和任务准确率的评审方式,也未评测Discussion里的边界强制机制。
- 威胁模型
- 五层十智能体流水线中,攻击者利用未校验的内容、身份或委托边界,使对抗内容作为可信输入传播。A1只需控制一个可抓取资源,不需模型权重或系统提示词;A2控制一个子智能体;A3注入截断计划的信号;A4在重试时占据同一路由位置。成功由跳数、是否核验、计划符合度或下游是否转发判定。
- 被测模型
- GPT-5-miniClaude Sonnet 4.5Kimi K2.5
- 基准
- TRAILGAIASWE-Bench Litefive-layer ten-agent pipeline
- 指标
- attack success ratetask accuracyrecovery ratepropagation hop count
论文指出多智能体 LLM 流水线缺少跨智能体边界的验证机制,一旦某个智能体接受对抗内容,该内容会作为可信输入在整条流水线中传播。作者基于 GAIA 和 SWE-Bench 的标注生产轨迹,展示内容注入、智能体冒充、计划偏离和记忆投毒等攻击面在正常部署中也会出现,且大多能绕过现有评测框架。在受控多智能体环境中对 GPT-5-mini、Claude Sonnet 4.5 和 Kimi K2.5 使用相同流水线配置测试后,攻击成功率与流水线结构相关而非模型能力,说明对抗脆弱性是架构属性,需要转向流水线级防御。该论文已被 2026 IEEE GLOBECOM 接收。
深度解读
这篇论文试图解决什么问题?
多智能体流水线缺少边界校验,对抗内容会作为可信输入向下游传播。
多智能体流水线传递中间输出时没有边界校验,对抗内容一旦被接受,就会作为可信输入向下游传播。
- 场景:作者称多个专门化智能体通过结构化通信协作,中间结果逐级传递,用于工具使用和长程推理。作者认为,这种协作里的对抗影响可以穿过整个系统后才形成最终输出。
- 现有不足:作者称现有分析多把漏洞当成单个模型或孤立输入的属性;AgentDojo 与 Agent Security Bench 用合成攻击,未检验其是否对应真实部署失败。作者称综述也没有实证刻画对抗行为如何跨协作边界传播,以及漏洞属于骨干模型还是架构。
- 假设:作者把缺失的原语称为边界校验(boundary verification),即显式验证跨智能体的数据,覆盖内容、身份、执行意图和状态完整性。Section II 将未校验边界分为内容、身份、委托三类,称为隐式信任假设。
- 做法:从 TRAIL 的 147 条标注生产轨迹归纳四类漏洞,再在十智能体、五层流水线上,对 GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5 做架构固定、只换骨干模型的攻击评估。
- 威胁模型:
- 目标:使对抗内容在边界被接受并作为可信输入传播,从而改变输出、提前终止或替换结果。
- 知识:A1 不需要模型权重或系统提示词,控制一个可抓取资源即可。
- 能力:A2 控制一个子智能体的返回;A3 注入使执行在声明计划结束前截断的信号;A4 在工具失败后的重试窗口占据同一路由位置。
- 受害系统:轨迹侧为 GAIA 与 SWE-Bench Lite 上的智能体流水线;受控评估为 Figure 5 的五层流水线。
有哪些相关研究?
相关工作覆盖单点注入、跨智能体传播和模型层防御,作者用轨迹与跨模型对照来定位。
引言和 Section VI 把相关工作分成单智能体注入、多智能体传播、模型层防御和综述。
单智能体提示注入
- Greshake 等(2023)、Liu 等(2024)、Zou 等的 PoisonedRAG(2025):间接提示注入、提示注入攻防的形式化评测,以及对 RAG 的知识污染。作者称这些攻击把 LLM 当作终端端点,而不是协作流水线中的节点。
多智能体传播与共谋
- Prompt Infection(Lee 与 Tiwari,2024)与 Ju 等(2024):注入指令可跨智能体边界自主传播。Lupinacci 等(2025):作者称能抵抗直接注入的模型,在相同载荷来自对等智能体时仍会执行;作者把这称为 AI-to-AI trust gap,并称自己的边界框架形式化了这一隐式信任。
- Motwani 等(2024):智能体可通过标准监控看不见的信道进行 covert collusion。
- AgentDojo(Debenedetti 等,2024)与 Shahroz 等(2025):多步执行会放大对抗影响。作者称这与本文 A1、A2 下的高跳数一致。引言另称 AgentDojo 用合成方式构造攻击。
模型层防御与评测
- PsySafe(Zhang 等,2024)、AutoDefense(Zeng 等,2024)、Agent Security Bench(Zhang 等,2024):在模型层提出缓解或攻防评测。作者称自适应攻击者仍以高成功率绕过(Nasr 等,2025),并据此认为漏洞属于架构时,模型层干预不够;该句未给出百分比。
- 引言称 Agent Security Bench 与 AgentDojo 一样用合成攻击构造,因此未回答所研究威胁是否出现在真实部署中。
综述中的开放问题
- Deng 等(2025)、He 等(2025)、de Witt(2025)、Raza 等的 TRiSM(2026)、Wang 等(2024):把智能体间信任、风险、安全和可追溯性列为开放问题。作者称这些综述没有实证刻画缺口如何落在协作边界上,也没有检验它们是模型特异还是结构性的。
基线与数据
- 轨迹数据:TRAIL(Deshpande 等,2025),任务设置为 GAIA(Mialon 等,2023)和 SWE-Bench Lite(Jimenez 等,2023)。
- 对抗评估对照:同一流水线上的干净运行,论文给出基线任务准确率 0.80。
作者称轨迹驱动方法和跨模型评估对应上述两个缺口,并称攻击面属于流水线架构而非骨干模型。
论文如何解决这个问题?
用轨迹筛出四类边界失效,再在固定五层流水线上对三个骨干模型操作化。
作者把问题写成缺失的边界校验:先形式化三类边界,再从生产轨迹归纳失败,最后在架构固定的流水线上操作化攻击。摘要举例还包括记忆投毒,正文没有把它单列成已评估的一类。
流水线与三类边界
- 流水线写成有向无环图 G=(A, E)。任务按拓扑序由各智能体复合。作者称没有全局状态或集中校验时,任一级接受的对抗内容会作为可信输入向前传播。
- 内容边界要求外部检索词元与操作者指令不相交,即 Cdata ∩ Cinstr = ∅。作者称实际输入是二者的并,检索路径上的指令性文本会被当成任务指令。
- 委托边界要求实际执行序列等于规划者声明的子任务序列,即 π̂ = π。作者称该约束未被执行,编排者信任规划者自报的完成信号。
- 身份由路由位置而非持久凭证决定。作者称重试时同一槽位上的响应进程可以换成另一个,占用该槽位的进程与合法智能体不可区分。
从轨迹归纳威胁
- 语料是 TRAIL 的 147 条标注轨迹、836 个人工标注错误,带 OpenTelemetry span。GAIA 为两级 CodeAgent 到 ToolCallingAgent;SWE-Bench Lite 为单个 CodeAgent。
- 作者不预先定义攻击类。筛选标准是:可被注入内容或信号诱发、在多条轨迹的同一位置复现、并污染起源之外的 span。
- 四类全部满足这三条。作者称它们出现在良性部署中。频数见实验一节。
受控流水线与操作化
- Figure 5 为五层十智能体:L0 Orchestrator,L1 Planner,L2 两个 Researcher、Analyst、Coder,L3 Reviewer 与 Critic,L4 Summarizer 与 Validator。骨干为 GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5,架构固定。
- A1 在可抓取资源中放入覆盖指令、伪造引用和虚假完成信号,检索结果不经清洗进入推理;成功指未标记地跨至少 2 跳。A2 注入有毒计划以及伪造的 Reviewer、Critic 裁决;无法定人数时任一子结果都可被接受,成功指 Orchestrator 未经核验即提交。
- A3 经 Planner 加入完成信号与确定性信号,使执行在声明计划结束前截断;成功指计划符合度低于 0.5。A4 在路由槽位换入 Sybil 智能体,并升到 3 个并行位置中的 2 个;成功指下游接受并转发。
评估所问的问题
- 四个问题是:哪类边界最易进入;注入成功如何影响端任务;流水线能否恢复;成败主要由骨干模型还是架构决定。
- 指标为攻击成功率、任务准确率、恢复率和跳数。论文没有写出任务对错由哪个模型或规则判定。
- Discussion 称应在边上做内容划分、法定人数式计划承诺和身份的加密证明,并称模型不能对自己跨边界的消息做这些检查。评估没有实现这些机制。
论文做了哪些实验?
作者在三模型上测四类攻击,称成败取决于架构;图中A3高于作者称为最有效的A1。
实验设置
- 骨干模型:GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5。作者称它们来自不同提供方和训练方法,且没有专门为智能体间交互做安全调优。架构固定,只换骨干模型。
- 流水线:Figure 5 的五层十智能体,即 Orchestrator、Planner、两个 Researcher、Analyst、Coder、Reviewer、Critic、Summarizer、Validator。
- 轨迹语料:TRAIL 的 147 条标注轨迹、836 个人工标注错误。GAIA 为 CodeAgent 到 ToolCallingAgent;SWE-Bench Lite 为单个 CodeAgent。
- 攻击运行:20 个共享任务,每类 3 个 escalating payload variants,1,080 次攻击运行,90 次干净运行,基线任务准确率 0.80。论文没有写出这 20 个任务出自哪个基准,也没有写出运行数如何由任务、变体和模型数组成。
- 指标:攻击成功率按类使用跳数、是否核验、计划符合度或是否转发;另有任务准确率、恢复率、传播跳数。
- 评审:论文没有写出任务准确率的评审模型、阈值或与人工的一致性。成功条件是结构条件,不是单独的评审模型分数。
主结果
据 Figure 6a。图例从左到右为 Claude Sonnet 4.5、GPT-5-mini、Kimi K2.5;该列顺序与正文“GPT-5-mini 成功率更高”以及鲁棒性排序一致。
表格较宽,可左右滑动
攻击 Claude Sonnet 4.5 GPT-5-mini Kimi K2.5 A1 Prompt Injection 0.61 0.72 0.68 A2 Consensus Poisoning 0.79 0.83 0.81 A3 Plan Hijacking 0.81 0.86 0.83 A4 Sybil Substitution 0.76 0.78 0.77 - 作者称 A1 最有效,并在正文给出 0.61-0.72,同时把 A3 写成 0.81-0.86。表中 A3 每一列都高于 A1。作者仍把内容边界称为主要入口,用以回答 RQ1。
- 作者称四类成功率都超过 0.6,因此没有可防守的边界;并认为 GPT-5-mini 成功率更高,可能对应 compliance-robustness tradeoff。
- 作者称模型间差距窄(A1 最大 0.07),任一模型上 A1 与 A3 相差 0.25,大约四倍,故结构是主导变量。Figure 6a 给出的是分模型成功率,论文没有列出与 0.07、0.25 对应的逐格计算。作者认为只做模型安全加固不够:终端用户侧被拒绝的内容,在被包装成对等智能体消息、编排指令或工具输出时仍会被接受。
轨迹中的四类失败
- 836 个错误按可诱发、同位置可复现、可跨边界传播筛选。四类合计 452/836 个错误、108/147 条轨迹(Section III)。
- A1 为 102/147(69.4%,154 个实例)。A2 为 78 条(53.1%,110 个实例);作者写 97.3% 为 HIGH-impact,未写分母。A3 为 56 条(38.1%,57 个实例)。A4 为 77 条(52.4%,131 个实例);作者称在 SWE-Bench 的集中度为 83.9%,在 GAIA 为 44.0%。
- 作者称 147 条轨迹在 TRAIL rubric 下安全分均为满分,因此现有自动评估发现不了这些漏洞。结构证据包括:trace 5a6c51d5 的结论没有 ToolCallingAgent.run span;trace 5e5dc94e 在第 2 步调用 final_answer,计划中的四个检索步骤都未执行;trace 4a8d094e 的步骤 2 至 6 没有对应 span;另有 45 条在报错后重试工具调用,且未核验重试是否到达同一端点。
准确率、恢复与跳数
- Figure 6b 比较攻击下的任务准确率,干净基线为 0.80。作者称各攻击条件下准确率相对基线下降,A1 下降最明显;鲁棒性排序在各攻击类型上稳定,为 Claude Sonnet 4.5 > Kimi K2.5 > GPT-5-mini。作者称 GPT-5-mini 的干净运行准确率更高,论文没有给出分模型数字。Figure 6b 的逐柱数值论文文本没有给出。
- Figure 6c 的恢复率在 Claude Sonnet 4.5 的 A4 下达到 0.22,A1 与 A3 下三个模型均低于 0.10。作者称注入成功后,流水线不能可靠地恢复正确性。
- Figure 6d:A1 与 A2 的载荷跨越 4-6 跳;A3 的跳数为 HC ≤ 2。作者称 A3 是压低流水线深度,而不是把内容传过各层。作者称 A4 的准确率下降较小,下游审查智能体部分过滤了 Sybil 载荷,注入成功与任务伤害之间出现部分脱钩。图例含 Inter-agent boundary(HC=2)。A4 的跳数正文没有给出。
其他消融与分析
- 载荷变体:每类 3 个 escalating variants;分变体成功率未单独给出。
- 干净运行:90 次,任务准确率 0.80;分模型干净准确率未给出。
- Discussion 将成功概率写成 S(G, M_LLM, A_k),并称式 (10) 右侧不含 M_LLM;这是讨论中的形式化,不是额外实验数字。
- Section V 提出的加密证明、法定人数承诺和带外审计没有实验结果。
有什么可以进一步探索的点?
论文未专门讨论局限或后续方向。
作者指出的局限与后续方向
论文未专门讨论局限。Discussion 与 Conclusion 没有把某项结果写成不足,也没有列出后续实验。
实验覆盖范围
- 轨迹分析使用 TRAIL 的 147 条标注轨迹和 836 个人工标注错误,任务设置是 GAIA 与 SWE-Bench Lite(Section III)。
- 对抗评估的骨干模型为 GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5,流水线为 Figure 5 的五层十智能体结构,攻击为 A1 至 A4(Section IV)。
- 论文写明 20 个共享任务、每类 3 个 escalating payload variants、1,080 次攻击运行和 90 次干净运行,基线任务准确率 0.80;没有写出 20 个任务所属基准,也没有写出运行数如何由任务、变体和模型数组成。
- 成功判定写明为:A1 未标记地传播至少 2 跳,A2 为 Orchestrator 未经核验即提交,A3 为计划符合度低于 0.5,A4 为下游接受并转发。
- 论文没有写出构造载荷的模型、任务准确率的评审方式,以及 Section V 所写边界强制机制的实验结果。
总结一下论文的主要内容
缺边界校验使对抗内容跨智能体传播,作者称这是架构属性而非模型能力。
作者把多智能体 LLM 流水线的对抗问题定义为缺少边界校验,并用生产轨迹和受控实验检查脆弱性来自架构还是骨干模型。
中间输出未经验证就传给下游。作者认为,一旦某级接受对抗内容,后续智能体会把它当作可信输入。
做法分三步。其一,用有向无环图描述流水线,并定义内容、委托、身份三类应被校验的边界。其二,在 TRAIL 的 147 条轨迹、836 个错误中,按可诱导、可复现、可跨边界传播筛出四类失败。其三,在十智能体五层流水线上操作化这些失败,架构固定,只更换三个骨干模型。
- A1 出现在 102/147 条轨迹(69.4%)。四类合计 452/836 个错误、108/147 条轨迹。作者称这 147 条的 TRAIL 安全分都是满分。
- Figure 6a 中,Claude Sonnet 4.5、GPT-5-mini、Kimi K2.5 的 A3 成功率分别为 0.81、0.86、0.83,A1 分别为 0.61、0.72、0.68。作者仍称 A1 是主要入口。
- 干净基线任务准确率 0.80(90 次运行)。恢复率在 Claude Sonnet 4.5 的 A4 下为 0.22,A1 与 A3 下三模型都低于 0.10。A1 与 A2 跨越 4-6 跳,A3 的跳数不超过 2。
- 作者的结论是:攻击是否成功取决于流水线结构,而不取决于骨干模型;只加强模型安全不够,因为来自对等智能体、编排指令或工具输出的内容仍被信任。作者认为应在边上强制内容划分、计划绑定和身份校验。