摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
- 防御arXiv 2610.03089
COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
- arXiv
- 2610.03089
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
- 其他arXiv 2610.00902
用平均场博弈分析 AI 安全:以 2026 年 7 月 Hugging Face 事件为例
用均值场最优停止分析多智能体集体攻击的均衡条件
- arXiv
- 2610.00902
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要结构阈值给出干预杠杆。
- 其他arXiv 2609.06140
论文提出反集群准则:以协调事件为单元遏制智能体协同入侵
提出以协调情节为操作单位的跨执行准则,规定如何发现未授权智能体协同并在重启后遏制
- arXiv
- 2609.06140
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 风险欺骗与谋划
摘要立场是跨执行保留关系并约束共享状态。
- 防御arXiv 2610.00371
FlowReview:以授权配对评测控制多智能体组合信息流
提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流
- arXiv
- 2610.00371
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要配对标准要求拒绝禁止使用并完成授权使用,FlowReview 把三项审查接到执行。
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
- 防御arXiv 2610.00450
ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
- arXiv
- 2610.00450
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 攻击arXiv 2610.00392
A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
- arXiv
- 2610.00392
- 发表
- 层
- 应用层
摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
- 防御arXiv 2609.01677
Skill-as-API:面向智能体软件工程的机密多智能体协作协议
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
- arXiv
- 2609.01677
- 发表
- 层
- 应用层
摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
- 评测与基准arXiv 2609.32915
AgentTell:浏览器 Agent 的行为侧信道泄漏基准
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
- arXiv
- 2609.32915
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。
- 评测与基准arXiv 2608.07556
MasDrift:跨多智能体架构的授权保持基准
用 MasDrift 评测多智能体架构的授权保持
- arXiv
- 2608.07556
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
摘要授权保持可被测量:层级用未授权动作换完成率,重锚定比沿链携带更稳。
MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。
- 防御arXiv 2609.15134
HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
- arXiv
- 2609.15134
- 发表
- 层
- 应用层
- 防御监控与审计
- 风险Agent 危险操作
- 组件监控器
- 评测与基准arXiv 2609.05591
WolfSociety:金融智能体社会中有害智能体规模带来的集体风险
用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃
- arXiv
- 2609.05591
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要更大的金融智能体社会在更低有害比例上崩溃,但所需有害人数仍增加。
WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。
摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
- 防御arXiv 2609.18411
可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认
提出可验证操作卡 VAC,从真实 DOM 重构智能体浏览器的确认信息
- arXiv
- 2609.18411
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 防御arXiv 2609.30824
基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案
提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体
- arXiv
- 2609.30824
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要用只衰减的身份绑定令牌和上下文外钱包,约束代表人类行动的分布式智能体。
代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。
- 防御arXiv 2609.03438
CONFLICTGUI 基准与 CONFLICTGUARD 框架:让多模态 GUI Agent 学会在冲突指令下终止执行
作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。
- arXiv
- 2609.03438
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 防御推理时干预
- 风险Agent 危险操作
- 组件视觉
摘要ConflictGUI 暴露 GUI 智能体的执行偏向过度服从,ConflictGuard 用条件转向提高冲突终止率。
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
- 防御arXiv 2609.22724
MATE:面向移动 Agent 的策略感知安全审计方法
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
- arXiv
- 2609.22724
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 攻击者
- 黑盒
- 防御监控与审计
- 攻击恶意使用
- 风险Agent 危险操作
- 组件监控器
摘要MATE 用合成轨迹微调轻量审计器,在可编辑策略下判断移动智能体轨迹是否违规并给出解释。
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。