防御arXiv 2609.22949
多智能体系统提示注入威胁模型与防御架构:14 类攻击向量与四类防御
提出多智能体提示注入威胁模型与四层架构防御
- arXiv
- 2609.22949
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- GPT-4o (2024-08-06)、Claude 3.5 Sonnet、Llama 3 70B-Instruct
提出多智能体提示注入威胁模型与四层架构防御
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
提出以协调情节为单位遏制智能体协同入侵的准则
摘要立场是跨执行保留关系并约束共享状态。