摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
- 其他arXiv 2610.00902
用平均场博弈分析 AI 安全:以 2026 年 7 月 Hugging Face 事件为例
用均值场最优停止分析多智能体集体攻击的均衡条件
- arXiv
- 2610.00902
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要结构阈值给出干预杠杆。
- 其他arXiv 2609.06140
论文提出反集群准则:以协调事件为单元遏制智能体协同入侵
提出以协调情节为操作单位的跨执行准则,规定如何发现未授权智能体协同并在重启后遏制
- arXiv
- 2609.06140
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 风险欺骗与谋划
摘要立场是跨执行保留关系并约束共享状态。
- 防御arXiv 2610.00371
FlowReview:以授权配对评测控制多智能体组合信息流
提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流
- arXiv
- 2610.00371
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要配对标准要求拒绝禁止使用并完成授权使用,FlowReview 把三项审查接到执行。
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
- 攻击arXiv 2610.00392
A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
- arXiv
- 2610.00392
- 发表
- 层
- 应用层
摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
- 防御arXiv 2609.01677
Skill-as-API:面向智能体软件工程的机密多智能体协作协议
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
- arXiv
- 2609.01677
- 发表
- 层
- 应用层
摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
- 评测与基准arXiv 2608.07556
MasDrift:跨多智能体架构的授权保持基准
用 MasDrift 评测多智能体架构的授权保持
- arXiv
- 2608.07556
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
摘要授权保持可被测量:层级用未授权动作换完成率,重锚定比沿链携带更稳。
MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。
- 评测与基准arXiv 2609.05591
WolfSociety:金融智能体社会中有害智能体规模带来的集体风险
用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃
- arXiv
- 2609.05591
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要更大的金融智能体社会在更低有害比例上崩溃,但所需有害人数仍增加。
WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。
摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
- 防御arXiv 2609.30824
基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案
提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体
- arXiv
- 2609.30824
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要用只衰减的身份绑定令牌和上下文外钱包,约束代表人类行动的分布式智能体。
代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。
已经到底了