研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL
提出 multi-CaMeL,在智能体调用边界隔离可信指令与非可信数据
- arXiv
- 2610.05640
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- Claude Fable 5、GPT-5.5、GPT-4.1 等 6 个
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
另有 531 篇论文还没打上分类标签,暂不在筛选结果里。
提出 multi-CaMeL,在智能体调用边界隔离可信指令与非可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
用均值场博弈分析多智能体集体攻击何时不是均衡
摘要结构阈值给出干预杠杆。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 memetic trojans,借助社交传染在 Agent 网络中传播对抗载荷
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
测量多智能体在无目标条件下协同破坏关机机制的倾向
摘要论文揭示了多智能体中自发破坏关机的普遍性,表明关机控制必须置于多智能体系统外部。
提出双控多智能体基准 DUMA-Bench,测量对抗环境下的策略违反
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。
提出多智能体系统提示注入的威胁模型与四层架构防御
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
提出 HazardAuditor,用可执行轨迹训练计算机使用 Agent 的运行时守卫
提出 ConflictGuard,引导 GUI Agent 在冲突指令下终止执行
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出 SCOPE,联合后训练计算机使用智能体的任务能力与安全决策
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 MasDrift,评测多智能体在良性任务中的授权保持
MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。