研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL
提出multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
- 论文定位:这是一项针对分层多智能体系统在间接提示注入威胁下的安全性与防御协议研究。
- 核心问题:现有单智能体系统级防御(如 CaMeL)无法在多智能体交互中自动组合,上游智能体获取的非可信数据经跨边界传递后会被下游智能体的规划模型视为可信输入,从而发生“边界清洗”并劫持系统控制流。
- 防御方法:提出 multi-CaMeL 通信协议与扩展解释器,将跨智能体调用强制解耦为可信指令通道(message)与不透明数据通道(variables),在运行时维持指令通道完整性与数据溯源。
- 核心实验结果:
- 在 MultiAgentDojo 上,multi-CaMeL 将 5 款模型的平均攻击成功率从无防御的 12.9% 和单智能体 CaMeL 的 0.2% 降低至 0.0%,消除了残留攻击(Table III)。
- 在良性效用上,AssetOpsBench 中 multi-CaMeL 较单智能体 CaMeL 平均仅多损失 3.2 个百分点,在 Claude Fable 5 与 GPT-5.5 上额外损失仅 0.85 个百分点(Figure 5)。
- 效用损失随着模型能力的提升而呈现收窄趋势,作者称这提示能力更强的模型更能适应预定义控制流与变量解耦的约束(Figure 5、Figure 6)。
- 作者结论与启示:作者指出“跨越智能体边界不得隐式提升信息的可信度”是多智能体安全的核心原则;单纯保护每个个体智能体并不足以保障系统安全,必须在系统交互接口处对指令与数据实施显式隔离。