跳到正文
原文
论文追踪· arXiv:2608.00718· Faisal Haque Bappy, Tahrim Hossain, Tarannum Shaila Zaman, Raiful Hasan, Kamrul Hasan, Tariqul Islam·本站收录 · 原文发表

研究揭示多智能体 LLM 流水线的结构性漏洞

Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

作者在三模型五层流水线上评估四类边界攻击,称成功率取决于架构而非骨干模型。

威胁模型五层十智能体流水线中,攻击者利用未校验的内容、身份或委托边界,使对抗内容作为可信输入传播。

问题
多智能体流水线把中间输出当可信输入下传,却不校验内容、身份和委托边界。作者认为对抗内容会跨智能体传播;现有工作多看单模型或合成攻击,未区分漏洞属于骨干模型还是架构。
方法
作者把边界校验定义为跨智能体消息的显式验证,并从TRAIL轨迹按三个标准筛出四类失败。再在十智能体五层流水线上固定架构,只换GPT-5-mini、Claude Sonnet 4.5和Kimi K2.5来操作化攻击。
实验与结果
836个错误中452个属四类,147条安全分均为满分。三模型A1成功率0.61–0.72,A3为0.81–0.86。Claude Sonnet 4.5在A4下恢复率0.22,A1与A3下低于0.10。作者称成败取决于架构而非模型。
局限与可以继续做的
论文未专门讨论局限。评估覆盖三个骨干模型,以及TRAIL中的GAIA与SWE-Bench Lite轨迹。论文未报告20个共享任务的基准名称和任务准确率的评审方式,也未评测Discussion里的边界强制机制。
实验设置GPT-5-mini、Claude Sonnet 4.5 等 · TRAIL、GAIA 等 · attack success rate、task accuracy 等
威胁模型
五层十智能体流水线中,攻击者利用未校验的内容、身份或委托边界,使对抗内容作为可信输入传播。A1只需控制一个可抓取资源,不需模型权重或系统提示词;A2控制一个子智能体;A3注入截断计划的信号;A4在重试时占据同一路由位置。成功由跳数、是否核验、计划符合度或下游是否转发判定。
被测模型
GPT-5-miniClaude Sonnet 4.5Kimi K2.5
基准
TRAILGAIASWE-Bench Litefive-layer ten-agent pipeline
指标
attack success ratetask accuracyrecovery ratepropagation hop count
AI 导读论文指出多智能体 LLM 流水线缺少跨智能体边界的验证机制,一旦某个智能体接受对抗内容,该内容会作为可信输入在整条流水线中传播。作者基于 GAIA 和 SWE-Bench 的标注生产轨迹,展示内容注入、智能体冒充、计划偏离和记忆投毒等攻击面在正常部署中也会出现,且大多能绕过现有评测框架。在受控多智能体环境中对 GPT-5-mini、Claude Sonnet 4.5 和 Kimi K2.5 使用相同流水线配置测试后,攻击成功率与流水线结构相关而非模型能力,说明对抗脆弱性是架构属性,需要转向流水线级防御。该论文已被 2026 IEEE GLOBECOM 接收。

论文指出多智能体 LLM 流水线缺少跨智能体边界的验证机制,一旦某个智能体接受对抗内容,该内容会作为可信输入在整条流水线中传播。作者基于 GAIA 和 SWE-Bench 的标注生产轨迹,展示内容注入、智能体冒充、计划偏离和记忆投毒等攻击面在正常部署中也会出现,且大多能绕过现有评测框架。在受控多智能体环境中对 GPT-5-mini、Claude Sonnet 4.5 和 Kimi K2.5 使用相同流水线配置测试后,攻击成功率与流水线结构相关而非模型能力,说明对抗脆弱性是架构属性,需要转向流水线级防御。该论文已被 2026 IEEE GLOBECOM 接收。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    多智能体流水线缺少边界校验,对抗内容会作为可信输入向下游传播。

    多智能体流水线传递中间输出时没有边界校验,对抗内容一旦被接受,就会作为可信输入向下游传播。

    • 场景:作者称多个专门化智能体通过结构化通信协作,中间结果逐级传递,用于工具使用和长程推理。作者认为,这种协作里的对抗影响可以穿过整个系统后才形成最终输出。
    • 现有不足:作者称现有分析多把漏洞当成单个模型或孤立输入的属性;AgentDojo 与 Agent Security Bench 用合成攻击,未检验其是否对应真实部署失败。作者称综述也没有实证刻画对抗行为如何跨协作边界传播,以及漏洞属于骨干模型还是架构。
    • 假设:作者把缺失的原语称为边界校验(boundary verification),即显式验证跨智能体的数据,覆盖内容、身份、执行意图和状态完整性。Section II 将未校验边界分为内容、身份、委托三类,称为隐式信任假设。
    • 做法:从 TRAIL 的 147 条标注生产轨迹归纳四类漏洞,再在十智能体、五层流水线上,对 GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5 做架构固定、只换骨干模型的攻击评估。
    • 威胁模型:
      • 目标:使对抗内容在边界被接受并作为可信输入传播,从而改变输出、提前终止或替换结果。
      • 知识:A1 不需要模型权重或系统提示词,控制一个可抓取资源即可。
      • 能力:A2 控制一个子智能体的返回;A3 注入使执行在声明计划结束前截断的信号;A4 在工具失败后的重试窗口占据同一路由位置。
      • 受害系统:轨迹侧为 GAIA 与 SWE-Bench Lite 上的智能体流水线;受控评估为 Figure 5 的五层流水线。
  2. 有哪些相关研究?

    相关工作覆盖单点注入、跨智能体传播和模型层防御,作者用轨迹与跨模型对照来定位。

    引言和 Section VI 把相关工作分成单智能体注入、多智能体传播、模型层防御和综述。

    单智能体提示注入

    • Greshake 等(2023)、Liu 等(2024)、Zou 等的 PoisonedRAG(2025):间接提示注入、提示注入攻防的形式化评测,以及对 RAG 的知识污染。作者称这些攻击把 LLM 当作终端端点,而不是协作流水线中的节点。

    多智能体传播与共谋

    • Prompt Infection(Lee 与 Tiwari,2024)与 Ju 等(2024):注入指令可跨智能体边界自主传播。Lupinacci 等(2025):作者称能抵抗直接注入的模型,在相同载荷来自对等智能体时仍会执行;作者把这称为 AI-to-AI trust gap,并称自己的边界框架形式化了这一隐式信任。
    • Motwani 等(2024):智能体可通过标准监控看不见的信道进行 covert collusion。
    • AgentDojo(Debenedetti 等,2024)与 Shahroz 等(2025):多步执行会放大对抗影响。作者称这与本文 A1、A2 下的高跳数一致。引言另称 AgentDojo 用合成方式构造攻击。

    模型层防御与评测

    • PsySafe(Zhang 等,2024)、AutoDefense(Zeng 等,2024)、Agent Security Bench(Zhang 等,2024):在模型层提出缓解或攻防评测。作者称自适应攻击者仍以高成功率绕过(Nasr 等,2025),并据此认为漏洞属于架构时,模型层干预不够;该句未给出百分比。
    • 引言称 Agent Security Bench 与 AgentDojo 一样用合成攻击构造,因此未回答所研究威胁是否出现在真实部署中。

    综述中的开放问题

    • Deng 等(2025)、He 等(2025)、de Witt(2025)、Raza 等的 TRiSM(2026)、Wang 等(2024):把智能体间信任、风险、安全和可追溯性列为开放问题。作者称这些综述没有实证刻画缺口如何落在协作边界上,也没有检验它们是模型特异还是结构性的。

    基线与数据

    • 轨迹数据:TRAIL(Deshpande 等,2025),任务设置为 GAIA(Mialon 等,2023)和 SWE-Bench Lite(Jimenez 等,2023)。
    • 对抗评估对照:同一流水线上的干净运行,论文给出基线任务准确率 0.80。

    作者称轨迹驱动方法和跨模型评估对应上述两个缺口,并称攻击面属于流水线架构而非骨干模型。

  3. 论文如何解决这个问题?

    用轨迹筛出四类边界失效,再在固定五层流水线上对三个骨干模型操作化。

    作者把问题写成缺失的边界校验:先形式化三类边界,再从生产轨迹归纳失败,最后在架构固定的流水线上操作化攻击。摘要举例还包括记忆投毒,正文没有把它单列成已评估的一类。

    流水线与三类边界

    • 流水线写成有向无环图 G=(A, E)。任务按拓扑序由各智能体复合。作者称没有全局状态或集中校验时,任一级接受的对抗内容会作为可信输入向前传播。
    • 内容边界要求外部检索词元与操作者指令不相交,即 Cdata ∩ Cinstr = ∅。作者称实际输入是二者的并,检索路径上的指令性文本会被当成任务指令。
    • 委托边界要求实际执行序列等于规划者声明的子任务序列,即 π̂ = π。作者称该约束未被执行,编排者信任规划者自报的完成信号。
    • 身份由路由位置而非持久凭证决定。作者称重试时同一槽位上的响应进程可以换成另一个,占用该槽位的进程与合法智能体不可区分。

    从轨迹归纳威胁

    • 语料是 TRAIL 的 147 条标注轨迹、836 个人工标注错误,带 OpenTelemetry span。GAIA 为两级 CodeAgent 到 ToolCallingAgent;SWE-Bench Lite 为单个 CodeAgent。
    • 作者不预先定义攻击类。筛选标准是:可被注入内容或信号诱发、在多条轨迹的同一位置复现、并污染起源之外的 span。
    • 四类全部满足这三条。作者称它们出现在良性部署中。频数见实验一节。

    受控流水线与操作化

    • Figure 5 为五层十智能体:L0 Orchestrator,L1 Planner,L2 两个 Researcher、Analyst、Coder,L3 Reviewer 与 Critic,L4 Summarizer 与 Validator。骨干为 GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5,架构固定。
    • A1 在可抓取资源中放入覆盖指令、伪造引用和虚假完成信号,检索结果不经清洗进入推理;成功指未标记地跨至少 2 跳。A2 注入有毒计划以及伪造的 Reviewer、Critic 裁决;无法定人数时任一子结果都可被接受,成功指 Orchestrator 未经核验即提交。
    • A3 经 Planner 加入完成信号与确定性信号,使执行在声明计划结束前截断;成功指计划符合度低于 0.5。A4 在路由槽位换入 Sybil 智能体,并升到 3 个并行位置中的 2 个;成功指下游接受并转发。

    评估所问的问题

    • 四个问题是:哪类边界最易进入;注入成功如何影响端任务;流水线能否恢复;成败主要由骨干模型还是架构决定。
    • 指标为攻击成功率、任务准确率、恢复率和跳数。论文没有写出任务对错由哪个模型或规则判定。
    • Discussion 称应在边上做内容划分、法定人数式计划承诺和身份的加密证明,并称模型不能对自己跨边界的消息做这些检查。评估没有实现这些机制。
  4. 论文做了哪些实验?

    作者在三模型上测四类攻击,称成败取决于架构;图中A3高于作者称为最有效的A1。

    实验设置

    • 骨干模型:GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5。作者称它们来自不同提供方和训练方法,且没有专门为智能体间交互做安全调优。架构固定,只换骨干模型。
    • 流水线:Figure 5 的五层十智能体,即 Orchestrator、Planner、两个 Researcher、Analyst、Coder、Reviewer、Critic、Summarizer、Validator。
    • 轨迹语料:TRAIL 的 147 条标注轨迹、836 个人工标注错误。GAIA 为 CodeAgent 到 ToolCallingAgent;SWE-Bench Lite 为单个 CodeAgent。
    • 攻击运行:20 个共享任务,每类 3 个 escalating payload variants,1,080 次攻击运行,90 次干净运行,基线任务准确率 0.80。论文没有写出这 20 个任务出自哪个基准,也没有写出运行数如何由任务、变体和模型数组成。
    • 指标:攻击成功率按类使用跳数、是否核验、计划符合度或是否转发;另有任务准确率、恢复率、传播跳数。
    • 评审:论文没有写出任务准确率的评审模型、阈值或与人工的一致性。成功条件是结构条件,不是单独的评审模型分数。

    主结果

    据 Figure 6a。图例从左到右为 Claude Sonnet 4.5、GPT-5-mini、Kimi K2.5;该列顺序与正文“GPT-5-mini 成功率更高”以及鲁棒性排序一致。

    表格较宽,可左右滑动

    攻击Claude Sonnet 4.5GPT-5-miniKimi K2.5
    A1 Prompt Injection0.610.720.68
    A2 Consensus Poisoning0.790.830.81
    A3 Plan Hijacking0.810.860.83
    A4 Sybil Substitution0.760.780.77
    • 作者称 A1 最有效,并在正文给出 0.61-0.72,同时把 A3 写成 0.81-0.86。表中 A3 每一列都高于 A1。作者仍把内容边界称为主要入口,用以回答 RQ1。
    • 作者称四类成功率都超过 0.6,因此没有可防守的边界;并认为 GPT-5-mini 成功率更高,可能对应 compliance-robustness tradeoff。
    • 作者称模型间差距窄(A1 最大 0.07),任一模型上 A1 与 A3 相差 0.25,大约四倍,故结构是主导变量。Figure 6a 给出的是分模型成功率,论文没有列出与 0.07、0.25 对应的逐格计算。作者认为只做模型安全加固不够:终端用户侧被拒绝的内容,在被包装成对等智能体消息、编排指令或工具输出时仍会被接受。

    轨迹中的四类失败

    • 836 个错误按可诱发、同位置可复现、可跨边界传播筛选。四类合计 452/836 个错误、108/147 条轨迹(Section III)。
    • A1 为 102/147(69.4%,154 个实例)。A2 为 78 条(53.1%,110 个实例);作者写 97.3% 为 HIGH-impact,未写分母。A3 为 56 条(38.1%,57 个实例)。A4 为 77 条(52.4%,131 个实例);作者称在 SWE-Bench 的集中度为 83.9%,在 GAIA 为 44.0%。
    • 作者称 147 条轨迹在 TRAIL rubric 下安全分均为满分,因此现有自动评估发现不了这些漏洞。结构证据包括:trace 5a6c51d5 的结论没有 ToolCallingAgent.run span;trace 5e5dc94e 在第 2 步调用 final_answer,计划中的四个检索步骤都未执行;trace 4a8d094e 的步骤 2 至 6 没有对应 span;另有 45 条在报错后重试工具调用,且未核验重试是否到达同一端点。

    准确率、恢复与跳数

    • Figure 6b 比较攻击下的任务准确率,干净基线为 0.80。作者称各攻击条件下准确率相对基线下降,A1 下降最明显;鲁棒性排序在各攻击类型上稳定,为 Claude Sonnet 4.5 > Kimi K2.5 > GPT-5-mini。作者称 GPT-5-mini 的干净运行准确率更高,论文没有给出分模型数字。Figure 6b 的逐柱数值论文文本没有给出。
    • Figure 6c 的恢复率在 Claude Sonnet 4.5 的 A4 下达到 0.22,A1 与 A3 下三个模型均低于 0.10。作者称注入成功后,流水线不能可靠地恢复正确性。
    • Figure 6d:A1 与 A2 的载荷跨越 4-6 跳;A3 的跳数为 HC ≤ 2。作者称 A3 是压低流水线深度,而不是把内容传过各层。作者称 A4 的准确率下降较小,下游审查智能体部分过滤了 Sybil 载荷,注入成功与任务伤害之间出现部分脱钩。图例含 Inter-agent boundary(HC=2)。A4 的跳数正文没有给出。

    其他消融与分析

    • 载荷变体:每类 3 个 escalating variants;分变体成功率未单独给出。
    • 干净运行:90 次,任务准确率 0.80;分模型干净准确率未给出。
    • Discussion 将成功概率写成 S(G, M_LLM, A_k),并称式 (10) 右侧不含 M_LLM;这是讨论中的形式化,不是额外实验数字。
    • Section V 提出的加密证明、法定人数承诺和带外审计没有实验结果。
  5. 有什么可以进一步探索的点?

    论文未专门讨论局限或后续方向。

    作者指出的局限与后续方向

    论文未专门讨论局限。Discussion 与 Conclusion 没有把某项结果写成不足,也没有列出后续实验。

    实验覆盖范围

    • 轨迹分析使用 TRAIL 的 147 条标注轨迹和 836 个人工标注错误,任务设置是 GAIA 与 SWE-Bench Lite(Section III)。
    • 对抗评估的骨干模型为 GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5,流水线为 Figure 5 的五层十智能体结构,攻击为 A1 至 A4(Section IV)。
    • 论文写明 20 个共享任务、每类 3 个 escalating payload variants、1,080 次攻击运行和 90 次干净运行,基线任务准确率 0.80;没有写出 20 个任务所属基准,也没有写出运行数如何由任务、变体和模型数组成。
    • 成功判定写明为:A1 未标记地传播至少 2 跳,A2 为 Orchestrator 未经核验即提交,A3 为计划符合度低于 0.5,A4 为下游接受并转发。
    • 论文没有写出构造载荷的模型、任务准确率的评审方式,以及 Section V 所写边界强制机制的实验结果。
  6. 总结一下论文的主要内容

    缺边界校验使对抗内容跨智能体传播,作者称这是架构属性而非模型能力。

    作者把多智能体 LLM 流水线的对抗问题定义为缺少边界校验,并用生产轨迹和受控实验检查脆弱性来自架构还是骨干模型。

    中间输出未经验证就传给下游。作者认为,一旦某级接受对抗内容,后续智能体会把它当作可信输入。

    做法分三步。其一,用有向无环图描述流水线,并定义内容、委托、身份三类应被校验的边界。其二,在 TRAIL 的 147 条轨迹、836 个错误中,按可诱导、可复现、可跨边界传播筛出四类失败。其三,在十智能体五层流水线上操作化这些失败,架构固定,只更换三个骨干模型。

    • A1 出现在 102/147 条轨迹(69.4%)。四类合计 452/836 个错误、108/147 条轨迹。作者称这 147 条的 TRAIL 安全分都是满分。
    • Figure 6a 中,Claude Sonnet 4.5、GPT-5-mini、Kimi K2.5 的 A3 成功率分别为 0.81、0.86、0.83,A1 分别为 0.61、0.72、0.68。作者仍称 A1 是主要入口。
    • 干净基线任务准确率 0.80(90 次运行)。恢复率在 Claude Sonnet 4.5 的 A4 下为 0.22,A1 与 A3 下三模型都低于 0.10。A1 与 A2 跨越 4-6 跳,A3 的跳数不超过 2。
    • 作者的结论是:攻击是否成功取决于流水线结构,而不取决于骨干模型;只加强模型安全不够,因为来自对等智能体、编排指令或工具输出的内容仍被信任。作者认为应在边上强制内容划分、计划绑定和身份校验。
阅读原文arxiv.org