防御arXiv 2609.22949
多智能体系统提示注入威胁模型与防御架构:14 类攻击向量与四类防御
提出多智能体提示注入威胁模型与四层架构防御
- arXiv
- 2609.22949
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- GPT-4o (2024-08-06)、Claude 3.5 Sonnet、Llama 3 70B-Instruct
提出多智能体提示注入威胁模型与四层架构防御
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。