防御arXiv 2610.12463
论文复盘 OpenAI、Anthropic 与 Google Agent 安全事件并提出 PASAC 框架
提出 PASAC 与边界保证栈,把智能体评测越界纳入全周期可验证保证
- arXiv
- 2610.12463
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
另有 530 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PASAC 与边界保证栈,把智能体评测越界纳入全周期可验证保证
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出依赖引导回滚修复,纠正记忆增强 Agent 消费故障记忆后的回答与状态
提出 ActionGuard,在执行前拦截被投毒技能诱发的未授权工具调用
提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出多智能体提示注入威胁模型与四层架构防御
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。