论文复盘 OpenAI、Anthropic 与 Google Agent 安全事件并提出 PASAC 框架
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
- arXiv
- 2610.12463
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击
DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。
提出 AMU 按推导图门控企业 Agent 共享记忆的列级访问
AMU 用列级推导门控共享记忆,拦截经缓存流出的无权敏感列,并标出同名 KPI 的定义冲突。
提出 MemAdapter,在检索后约束记忆对智能体推理的影响
MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。
提出 APEX,在执行边界用授权契约防御 Agent 间接提示注入
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用
提出 Kubernetes 运维智能体的七层纵深防御框架与参考架构
把 Kubernetes 上的运维智能体当作不可信租户,在假定提示注入已完全控制其工具选择的前提下,用基础设施重建数据面与控制面的边界。要解决的是:智能体读日志、注解、工单或 MCP 工具描述时,这些内容可以变成它带着自身凭据执行的命令。模型对齐和分类器只降低概率。
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 PACE,在工具调用前做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 ActionGuard 在执行前拦截被投毒技能诱发的未授权工具调用
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
提出 Skilder,按角色渐进下发企业工具并确定性拦截越权调用
Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。
提出企业 MCP 零信任授权与发现扩展,在架构上拒绝提示注入下的越权调用
作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
提出 IntentCap,按来源字段所有权合成并裁决 Agent 能力租约
IntentCap 是把智能体能力绑到当前任务意图、并按上下文来源划分字段所有权的权限机制。