攻击arXiv 2608.00718
研究揭示多智能体 LLM 流水线的结构性漏洞
提出多智能体流水线的边界攻击,使对抗内容作为可信输入跨层传播
- arXiv
- 2608.00718
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5
- 攻击提示注入
摘要缺边界校验使对抗内容跨智能体传播,作者称这是架构属性而非模型能力。
作者把多智能体 LLM 流水线的对抗问题定义为缺少边界校验,并用生产轨迹和受控实验检查脆弱性来自架构还是骨干模型。中间输出未经验证就传给下游。作者认为,一旦某级接受对抗内容,后续智能体会把它当作可信输入。