论文复盘 OpenAI、Anthropic 与 Google Agent 安全事件并提出 PASAC 框架
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
- arXiv
- 2610.12463
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击
DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。
提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出两阶段门控审计框架,在执行前阻断有害智能体动作
提出 AgentPrivArena 与运行时审计,评测 Agent 轨迹级隐私泄露
提出 AgentMonBench 评测长时程编程智能体监控并检验 EBG
长时程软件工程任务里,用户要判断智能体哪些选择值得核验。作者用 AgentMonBench 评测监控器,并用免训练的 EBG 组织带源证据。
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用
提出 Kubernetes 运维智能体的七层纵深防御框架与参考架构
把 Kubernetes 上的运维智能体当作不可信租户,在假定提示注入已完全控制其工具选择的前提下,用基础设施重建数据面与控制面的边界。要解决的是:智能体读日志、注解、工单或 MCP 工具描述时,这些内容可以变成它带着自身凭据执行的命令。模型对齐和分类器只降低概率。
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
提出 VoxParity,固定转写只改音频,评测语音智能体是否按行业规则改工具调用
VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。
对比类型化评审与生成式评审对智能体轨迹的安全判定
在已保存的工具使用智能体轨迹上,比较类型化评审 JEV 与四种生成式评审的回溯安全分类。
用五阶段蒙特卡洛分析奖励作弊如何导致 Agent 围堵失效
这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提议前沿开发者托管嵌入式评估,审查内部智能体监控、权限与对齐
嵌入式评估是一种第三方评估:独立评估者在前沿 AI 开发者现场获得接近员工的系统、人员与文档访问,用来审查依赖内部系统与实践的风险。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全失败
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
提出 HazardAuditor,用可执行轨迹训练计算机使用 Agent 的运行时守卫