防御arXiv 2609.22949
多智能体系统提示注入威胁模型与防御架构:14 类攻击向量与四类防御
提出多智能体提示注入威胁模型与四层架构防御
- arXiv
- 2609.22949
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- GPT-4o (2024-08-06)、Claude 3.5 Sonnet、Llama 3 70B-Instruct
提出多智能体提示注入威胁模型与四层架构防御
提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
提出以协调情节为单位遏制智能体协同入侵的准则
摘要立场是跨执行保留关系并约束共享状态。