防御arXiv 2610.05640
研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
- arXiv
- 2610.05640
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- Claude Fable 5、GPT-5.5、GPT-4.1 等 6 个
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
另有 441 篇论文还没打上分类标签,暂不在筛选结果里。
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 UCM,用 DOM 掩码与类型受限隔离模型隔开网页智能体与不可信内容
提出可验证操作卡 VAC,从真实 DOM 重构智能体浏览器的确认信息
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。