跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.22949· Rudrendu Kumar Paul·· 13 天前

多智能体系统提示注入威胁模型与防御架构:14 类攻击向量与四类防御

Beyond Single-Model Injection: A Threat Model and Defense Architecture for Prompt Injection in Multi-Agent Systems

AI 导读

论文针对多智能体系统提出提示注入威胁模型,列举四类共 14 种攻击向量:用户输入直接注入 3 种、工具输出间接注入 4 种、智能体间消息传递注入 4 种、通过编排器操纵的级联注入 3 种。作者在一个 6 智能体的生产代表性系统上测试全部 14 种向量,发现即使有系统提示词层面的护栏,仍有 67% 的智能体至少对一种越权行为存在脆弱性,工具输出间接注入的成功率为 43%。四类架构防御将整体注入成功率从 31.2% 降至 4.2%:带来源追踪的消息签名使智能体间注入下降 91%,智能体边界处的输入输出净化使间接注入下降 78%,按角色限定工具权限完全消除了权限提升,智能体间通信异常检测捕获 84% 的级联尝试。

阅读原文arxiv.org