跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.05640· James Peters-Gill, Avi Semler, Henning Bartsch, Ilia Shumailov, Christian Schroeder de Witt·本站收录 · 原文发表 精选关注度33

研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

Can CaMeLs Talk? Securing Multi-Agent Systems Against Indirect Prompt Injection Attacks

AI 导读

牛津大学等机构的研究者发现,为每个智能体单独部署 CaMeL 防护不足以保证多智能体系统安全:不可信数据跨越智能体边界后被下游智能体当作可信输入,从而劫持其控制流,作者将这一失效模式称为 boundary laundering,并构造了具体攻击。为此他们提出 multi-CaMeL,在智能体间通信中把可信自然语言指令与不可信数据分离到不同通道,并在运行时保留数据来源信息。在扩展 AgentDojo 得到的 MultiAgentDojo 基准上,multi-CaMeL 将攻击成功率从无防护的 12.9%、单智能体 CaMeL 的 0.2% 降至 0.0%;在 AssetOpsBench 上相对单智能体 CaMeL 平均仅增加 3.2 个百分点的效用损失,且模型能力越强损失越小。作者同时开源了 MultiAgentDojo 及 multi-CaMeL 实现。

深度解读生成中

推荐理由

论文给出多智能体系统中单智能体防护失效的具体攻击路径,并配套发布可复现的多智能体评测基准与防护实现。

阅读原文arxiv.org