Palo Alto Networks 与 NVIDIA 联手收紧对 AI 智能体的控制
Palo Alto Networks 扩大与 NVIDIA 的合作,通过 NVIDIA Open Agent Safety Platform 参考设计管控 AI 智能体的活动、网络流量与身份管理。
Palo Alto Networks 扩大与 NVIDIA 的合作,通过 NVIDIA Open Agent Safety Platform 参考设计管控 AI 智能体的活动、网络流量与身份管理。
ToolFence 通过在执行前编译类型化授权蓝图并由确定性监控器执行,把用户授权值与不可信观测区分开,以应对保留工具但篡改参数的 within-tool 攻击。
Assay 将 AI 编码智能体的每条声明(测试通过、无密钥泄露、行为不变)绑定到其覆盖代码依赖锥的 Merkle 哈希,代码或其依赖一变声明即失效。在五个公开仓库上,600 token 的简报比探索式代理省 14x 至 114x,热重建比冷重建快最多 5x;锥绑定只需重验 7.9% 至 81.9% 的声明,而按模块绑定会漏掉 23% 至 68% 的应失效声明。
Tracekit 是一个开源、无依赖的审计系统,为每个 Agent 会话捕获人类意图、模型自述推理和实际执行动作三条通道,写入哈希链账本并交叉核对。它接入 Claude Code 生命周期事件、重建多 Agent 层级、在工具调用前做策略拦截,并支持其他 Agent 通过 SDK 或 HTTP API 上报事件。
MetaPermit 是一个基于策略的 Agent 工具访问控制框架,将语义推断与安全执行解耦,以应对工具误用和间接提示注入攻击。它通过分析 Agent 与用户的交互,提取一组紧凑且与任务无关的元属性,刻画用户意图、执行上下文与拟调用工具之间的关系,从而无需枚举用户意图即可授权工具使用。运行时由 LLM 推断每次工具调用的元属性取值,再由固定策略据此允许或拒绝调用,使每个决策都可依据推断值和策略规则审计。
针对自主 AI 智能体面临的提示注入攻击与凭证泄露风险,该提案提出一种基于能力安全原则的框架,利用 OAuth Agent Authorization Profile 及 W3C DID 和 VC 标准,让智能体通过加密绑定其身份与签发者身份、并限定作用域的令牌访问服务。服务方可验证委托链仅涉及权限衰减后再执行令牌操作。该安全层位于语言模型上下文窗口之外的安全模块中,使智能体能在可强制执行的安全边界内行动。
Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。
论文将应用层 Agent 遥测与内核级 syscall 追踪配对,首次给出内核层与应用层信号在 Agent 安全上的配对证据刻画。作者构建 Agent Cross-Layer Evidence(ACE)配对会话语料库,包含 4,047 个会话和 17 个威胁模型,覆盖六类投递向量家族、OWASP LLM 与 Agent 威胁类别中的 14 个,并归纳为 12 种攻击机制。在四类检测器上,内核证据单独即具判别力,与应用层证据组合通常优于任一单层视角,显示出单层分析可能遗漏的互补信号。研究还展示了对未见攻击家族的泛化能力以及向另一 Agent 运行时的迁移。
作者提出 skilder 框架,把能力打包成角色,即技能、工具、指令及其边界的组合,智能体从最小角色目录起步,按任务需要学习角色,并通过单一 MCP server 获取该角色的技能、指令和工具。由于工具只在已学到的技能内到达智能体,同一 server 可确定性地执行所学范围。作者在 13 项任务、6 个模型、每个 10 次运行的设置下,将 skilder 与扁平上下文工具选择和多智能体编排对比;结果显示,当模型完成发现流程并发出受治理调用时,skilder 的模拟授权层未执行任何未授权工具调用或参数违规,例如超支。总体任务通过率还反映各模型是否遵循发现协议并通过回答质量检查,这些未通过不属于授权失败。
ActGov 是一个运行时执行框架,在 LLM 提出的每个工具动作产生外部影响前先做校验。它基于授权、动作、运行时上下文与安全约束的统一语义模型:ActGov-Policy 从工具规格、良性任务和已观测的失败轨迹中迭代构建策略集,每次更新都用基于 SMT 的反例检查验证;ActGov-Runtime 在运行时把每次工具调用抽象为有限策略记录,只有当调用处于任务范围内的授权边界内且满足所有适用策略时才放行。作者在 AgentDojo 和 AgentDyn 两个基准上跨多个模型和攻击配置做了评测,称 ActGov 在保持任务效用的同时持续降低间接提示注入攻击的成功率,明显优于现有防御,且不依赖底层 LLM 正确识别恶意指令。
论文提出 Trustworthiness as a Service(TaaS),用于解决智能体跨组织边界调用工具、服务与其他智能体时,依赖方无法仅凭生产域控制与记录评估被委托动作的问题。其分析单元为跨域依赖命题,通过三条件结构外化诊断识别需多域依赖、生产方独立验证且须在撤销、失败、记录冲突或争议后仍可复核的命题,并为此设计不可变工作流清单与仅追加、发行方可归属的信任证据信封。论文还给出拓扑中立的逻辑参考模型,并以三个分析场景和 TaaS-Eval 协议提案定义清单、独立消费者、硬门控、对抗性证据测试与指标。
研究者提出 MATE,一个轻量的策略条件审计器,同时编码 Agent 轨迹与自然语言安全策略,判断轨迹是否违反给定策略并给出原因。由于把策略当作可编辑文本而非固定模型参数,MATE 无需重新训练即可适配用户自定义和不断变化的要求。作者从全球数百个热门移动应用中抽取应用描述、工作流和策略构建知识库,并用多阶段流水线合成超过 140K 条语义真实的策略条件轨迹。团队同时发布 MATEBench,包含两个合成子集和一个由人工收集轨迹构成的真实子集。
论文对企业级 MCP 的授权缺口做了系统分析,并给出不改动协议与 SDK 内部实现的 FastMCP 可组合扩展。作者调研 Python、TypeScript、Go、Rust、C#、Swift 六种 MCP SDK,指出三个结构性缺陷:凭据提取绑定单一 Authorization 头,使同时服务人类用户(企业 SSO)与自动化 Agent(不同请求头上的服务账号凭据)的双角色部署需要自定义中间件;缺少认证前的工具发现;基础 SDK 缺少按工具的细粒度授权。
论文提出可验证行动卡片(VAC),一种面向智能体浏览器的架构防御,把审批信息从真实待执行的浏览器动作和可信意图来源重建,并在浏览器 chrome 中带外渲染,将批准绑定到派发时重新校验的同一动作。VAC 由五部分组成:来源围栏(C1)、真实动作描述符(C2)、带外默认拒绝卡片(C3)、来源感知风险门控(C4)和执行绑定(C5)。作者在完整的开源智能体浏览器(Electron/Chromium 外壳加 Python agent,经 Chrome DevTools Protocol 驱动)中实现 VAC,并在 24 个场景的基准上评测,覆盖混淆代理表单、Lies-in-the-Loop 对话框伪造、间接提示注入、自适应动作替换、来源规避和合法任务。
推荐理由论文给出可复现的浏览器端确认机制与跨模型评测,做 Agent 权限与确认界面设计的团队可参考其架构取舍。
论文提出可验证操作卡(VAC),一种从真实待执行的浏览器操作和可信意图来源重建审批信息、在可信浏览器界面中带外渲染、并把审批绑定到派发时重新验证的同一操作的架构级防护。VAC 结合来源隔离、真实操作描述符、默认拒绝确认、来源感知风险门控和执行绑定,并在一个完整的智能体浏览器中实现。在覆盖混淆代理攻击、Lies-in-the-Loop 对话伪造、间接提示注入、自适应操作替换、来源规避和正常任务的 24 场景基准上,无 VAC 时各评测 LLM 的攻击成功率为 68% 至 100%,VAC 将每个模型的攻击成功率降至 0%,正常任务完成率 78%,误拦截率 0%。
这篇综述针对工具调用 AI 智能体的授权问题,提出以人类用户、运营方、编排智能体、子智能体和工具端点构成的委托层级框架,并梳理五个相互依赖的层面:智能体身份与凭证生命周期、多跳链路上的委托与范围传播、策略执行点上的运行时执行与即时授权、作为授权绕过的提示注入,以及可审计性、溯源与不可否认性。作者从 2023 至 2026 年间约 180 篇候选文献中筛出 89 篇一手来源做结构化叙述性综述,据此提出七项结构性要求,推导出一套四层参考架构,并将这些要求应用到三种可部署的参考配置上。综述指出,运行时执行与聚合边界是当前最主要的未解决缺口。全文 70 页,含 8 张图和 10 张表。
研究者提出一套统一框架下的通用防御策略,用于应对工具集成 LLM Agent 面临的直接提示注入、间接提示注入、记忆投毒和后门攻击四类对抗攻击。方法包含两类基于工具的防御:Attacker Tool Filtering 用异常检测(如 Isolation Forest)识别并移除可疑工具,Normal Tool Recalling 则在规划前以白盒方式恢复 Agent 的原始工具集;同时引入 Chain-of-Thought 提示与自我反思等基于提示的防御,并通过任务改写缓解攻击。
ActGuard 是一个执行前动作审计框架,用于防御 LLM Agent 面临的间接提示注入攻击。它不判断外部内容本身是否可疑,而是评估该内容是否使当前动作偏离局部合理的预期:每一步先预测即将使用的工具并构建局部工具先验,再将候选动作与该先验对比,做工具级对比分析和参数级证据定位,识别工具选择与动作参数上的偏离。随后由验证器检查定位到的证据,只遮蔽被确认恶意的片段,并从净化后的上下文重新生成动作,从而保留合法规划灵活性、减少无差别过滤带来的信息损失。在面向工具使用 Agent 的基准上,ActGuard 将攻击成功率降至与当前最优防御相当的水平,同时任务效用接近无攻击设置。代码已公开。
论文指出,个人 AI 智能体现有的隐私防御靠后端 LLM 在攻击者可控的同一对话上下文中自行判断是否披露敏感信息,使防御机制与攻击面重合。作者提出三种无需提示注入、仅靠普通交互即可实施的攻击:把信息提取包装成协作任务(Collaborative Workspace Lure)、通过省略而非智能体写出的内容诱导披露(Semantic Obfuscation Attack)、把提取请求与披露拆到相互独立的通道(Channel Decoupling Attack),三者的泄露率都明显高于这些防御原本针对的攻击。据此作者提出 FLOWSEAL,在 LLM 上下文之外的工具层拦截器中,依据数据来源和带受控降密的信息流控制格执行保密。在三个基准、五种基于提示的基线和八种攻击(包括通过 MCP 执行真实工具调用的智能体)上,FLOWSEAL 把泄露率降到接近零(如 Collaborative Workspace Lure 从 52.2% 降到 0.5%),同时保持任务效用,且不依赖底层 LLM。
推荐理由论文给出三种无需提示注入即可绕过现有隐私防御的交互式攻击,并附各防御下的泄露率对比,便于评估 Agent 隐私防护的实际边界。
研究者提出 CapScope,一种在 harness 层限制工具调用的授权机制,无需模型自行识别恶意文本。它先从可信输入推导任务级权限上限,再为每个 Agent 分配独立的能力集合,存放在模型上下文之外,每次工具调用都按发起该调用的 Agent 的能力进行检查,因此某个子 Agent 获得的权限不会自动传给另一个。作者在 Pi 编码 Agent 上实现该机制,并在一个由编排者向子 Agent 分派子任务的修复流程中评测,覆盖 5 个 Python 任务、5 个注入面、4 种授权条件和每格 3 次试验共 300 次运行。
研究者提出 CoER,将带有多轮工具调用和多次注入的任务建模为一般和马尔可夫博弈,以此训练能够适应不断演化的攻击者的防御方案。该方法先用成功轨迹初始化攻击者,再用双边对抗强化学习(BA-RL)保留双方的历史策略作为对手种群并混合新旧对手,随后复用这些攻击者挑战教师智能体,只用经安全性验证并通过任务完成的示范来微调共同演进的防御者。在七个领域、三个随机种子上,CoER 将自适应攻击成功率从 41.3% 降至 0.2%,并将安全完成率从 39.6% 提高到 76.2%。外部基准上也表现出更强的抗攻击能力,消融实验进一步验证了历史对手混合与基于种群的精炼的有效性。
推荐理由论文把工具智能体的自适应间接提示注入建模为多轮博弈,用攻防协同演化加教师示范微调,给出跨七个域的攻防成功率与安全任务完成率对比。
论文提出 CONTINUITY 框架,用于解决 LLM Agent 安全控制的组合问题:来源追踪、授权、策略执行、协议适配与执行控制各自正确,但安全关键上下文在跨组件边界时可能被丢弃、放宽、重绑定或重新解释,作者将这一失效模式称为安全上下文不连续。CONTINUITY 用 assume-guarantee 契约建模每个组件,并通过签名根授权、来源承诺、角色绑定的转换回执、有界类型化释放、转换见证和效果绑定执行许可,在状态转换间传递经过认证的安全上下文。作者形式化了端到端后果完整性,要求每个实际发生的外部效果都有有效且当前的授权见证,串联主体、任务、来源、委托、策略状态、规范动作与终局边界。
Skill-as-API 是一种协议层协调方案,让 AI 编程智能体在互相调用技能时只公开技能名称、描述、类型化输入/输出 schema 和信任层级,技能本体以闭包形式留在所有者进程内、永不跨网络传输。该协议通过四层机制实现访问控制,并从结构上收窄提示注入面,而非依赖内容过滤。作者在 XMTP 上给出开源 Python 实现,跨洲热重连延迟为 1.8-2.9 s,并以三个智能体协作完成 pull-request 审查为案例,验证各方可保留其专有分析提示词的所有权。
研究者提出 StepGuard,一个步骤级护栏模型,既能审计已完成的智能体轨迹,也能在工具动作执行前进行检查。为训练该模型,作者设计了 StepGen 数据引擎,生成上下文相同但在风险步骤上动作不同的安全与不安全轨迹;并提出 Balance-GRPO,根据观测到的准确率动态平衡安全与不安全动作的学习,以减少过度防御和防御不足。实验显示,StepGuard 在开放权重护栏模型中平均准确率最高,性能与 GPT-5.4 相当;在 AgentDojo 和 AgentDyn 上用于守护智能体时,相比无护栏设置将平均攻击成功率降低 77.3%,平均效用仅下降 2.8 个百分点。该工作已被 EMNLP 2026 接收。
Google Threat Intelligence Group(GTIG)联合 Mandiant 发布了针对软件供应链入侵的加固与缓解建议,指出 2025 年至 2026 年上半年出现了大规模的开源软件供应链入侵行动,涉及代码仓库、依赖项及开发者工具的攻陷。 其中,UNC6780(又名 TeamPCP)于 2026 年 2 月至 5 月在 PyPI、npm、Docker Hub 发动广泛攻击,滥用 GitHub Actions 的 pull_request_target 触发器获取基础仓库密钥并植入凭证窃取程序 SANDCLOCK,还试图从被感染的 AI 软件横向渗透到企业网络环境。
Google Threat Intelligence 旗下 Mandiant Consulting 发文,针对企业将 LLM 智能体接入 CI/CD 做自动化漏洞挖掘与修复的场景,给出一套操作护栏建议。文中援引 Mandiant M-Trends 2026 报告称平均利用时间(TTE)已降至 -7 天,并强调应把代码库视为不可信输入以防源码注释中的间接提示注入,同时落实云服务商的零数据留存(ZDR)、工作负载隔离与人主导的红队测试。
NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理,仅靠运行时护栏并不足够。随着自主 AI 智能体能力增强,开放模型、MCP 连接的工具与可移植技能让智能体更易扩展,但规模化使用需要结构透明与运行完整性。组织与团队需要理解和信任智能体所使用的技能(即指令)。
NVIDIA 针对智能体环境中的间接 AGENTS.md 注入攻击给出缓解方法,聚焦编码智能体场景。正文以 OpenAI Codex 为例,说明此类编码智能体可自动完成代码生成、调试与创建 PR 等任务,AI 工具正显著加速软件开发。
NVIDIA 发布面向智能体工作流的安全实践指引,聚焦沙箱化与执行风险管理。文章指出,AI 编码智能体通过命令行运行工具时,会继承与用户相同的权限和授权,因而成为计算机使用智能体,带来常被忽视的攻击面。该指引围绕这一执行风险给出实践建议。
推荐理由NVIDIA 安全团队从权限与执行风险角度给出智能体工作流的沙箱实践指引,适合部署编码智能体的团队参考。
ToolSafe 提出面向 LLM 智能体工具调用安全的步骤级护栏方案,包含基准 TS-Bench、护栏模型 TS-Guard 和推理框架 TS-Flow。TS-Guard 通过多任务强化学习训练,在执行前基于交互历史推理,评估请求有害性与动作和攻击的关联,输出可解释、可泛化的安全判断与反馈。TS-Flow 由护栏反馈驱动,在提示注入攻击下将 ReAct 风格智能体的有害工具调用平均减少 65%,同时把良性任务完成率提升约 10%。作者称该工作仍在进行中,代码已公开。
Tim Kellogg 提出用颜色分类 MCP 工具来应对提示注入风险:红色代表会接触不可信指令的工具,蓝色代表攻击者不应触发的关键操作,智能体可据此避免两类工具同时混用。他建议用 _meta 对象记录 MCP 工具与资源的颜色,并借助 LLM 为约 200 个工具批量打标,使分类标准可扩展到初始工具集之外。
NVIDIA 提出通过结构化应用设计来保护 KV cache。输入结构会影响 Transformer 模型(如 LLM、VLM)的输出,而实际提示词往往不止是简单的用户提问,常由系统指令、上下文数据和用户输入等来源动态拼装而成。
NVIDIA 技术博客提出用 WebAssembly 沙箱隔离智能体 AI 工作流。文章指出,智能体工作流常需执行大语言模型生成的代码来完成数据可视化等任务,这类代码应先清洗并在安全环境中运行,以降低提示注入和返回代码出错带来的风险。作者认为,用正则表达式清洗 Python 并配合受限运行时并不充分,因此需要更强的隔离手段。文章由 Joseph Lucas 撰写,发布于 NVIDIA 开发者博客。