防御arXiv 2609.22949
多智能体系统提示注入威胁模型与防御架构:14 类攻击向量与四类防御
提出多智能体提示注入威胁模型与四层架构防御
- arXiv
- 2609.22949
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- GPT-4o (2024-08-06)、Claude 3.5 Sonnet、Llama 3 70B-Instruct
另有 534 篇论文还没打上分类标签,暂不在筛选结果里。
提出多智能体提示注入威胁模型与四层架构防御
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本
面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。
提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门
FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。