为 AI 模型带来可验证信任:NVIDIA NGC 中的模型签名
NVIDIA 在 NGC 中引入模型签名,为 AI 模型带来可验证的信任。AI 正进入由能推理、规划并采取行动的智能体主导的阶段,这类系统动态调用 API、工具乃至物理环境,大幅扩展了 AI 攻击面:单个被攻陷的模型即可影响下游决策、访问外部系统并触发级联故障。
NVIDIA 在 NGC 中引入模型签名,为 AI 模型带来可验证的信任。AI 正进入由能推理、规划并采取行动的智能体主导的阶段,这类系统动态调用 API、工具乃至物理环境,大幅扩展了 AI 攻击面:单个被攻陷的模型即可影响下游决策、访问外部系统并触发级联故障。
NVIDIA 发布面向智能体工作流的安全实践指引,聚焦沙箱化与执行风险管理。文章指出,AI 编码智能体通过命令行运行工具时,会继承与用户相同的权限和授权,因而成为计算机使用智能体,带来常被忽视的攻击面。该指引围绕这一执行风险给出实践建议。
推荐理由NVIDIA 安全团队从权限与执行风险角度给出智能体工作流的沙箱实践指引,适合部署编码智能体的团队参考。
NVIDIA 推出 DOCA 芯片内安全能力,支撑智能体 AI 的 AI 工厂基础设施。该方案针对 AI 工厂在训练、微调和部署时引入的新攻击面,把安全能力下沉到芯片层。
Google 分享了针对 Cloud AI Platform 上的 Vertex AI 开展大语言模型漏洞研究的方法。公开这套做法的目的是让外部研究者从中学习,并帮助他们发现新的漏洞。
Mandiant 安全评估发现大量缺乏认证的公网暴露 serverless 应用,Cloud Run 服务若含第三方依赖易遭本地文件包含(LFI)、远程文件包含及命令注入攻击,成功利用可获得容器实例完整控制权并进一步横向移动接管云环境。该博客基于客户实战经验梳理攻击场景,针对必须公网开放的 Google Cloud Run 服务和函数给出一组加固建议,相关原则同样适用于任意公有 serverless 部署。
Google Threat Intelligence 旗下 Mandiant Consulting 发文,针对企业将 LLM 智能体接入 CI/CD 做自动化漏洞挖掘与修复的场景,给出一套操作护栏建议。文中援引 Mandiant M-Trends 2026 报告称平均利用时间(TTE)已降至 -7 天,并强调应把代码库视为不可信输入以防源码注释中的间接提示注入,同时落实云服务商的零数据留存(ZDR)、工作负载隔离与人主导的红队测试。
Google Threat Intelligence Group(GTIG)联合 Mandiant 发布了针对软件供应链入侵的加固与缓解建议,指出 2025 年至 2026 年上半年出现了大规模的开源软件供应链入侵行动,涉及代码仓库、依赖项及开发者工具的攻陷。 其中,UNC6780(又名 TeamPCP)于 2026 年 2 月至 5 月在 PyPI、npm、Docker Hub 发动广泛攻击,滥用 GitHub Actions 的 pull_request_target 触发器获取基础仓库密钥并植入凭证窃取程序 SANDCLOCK,还试图从被感染的 AI 软件横向渗透到企业网络环境。
Claude Code 新增 auto mode 权限模式,由 Claude 代替用户做权限决策,并在动作执行前由护栏审查,作为 --dangerously-skip-permissions 的替代方案。护栏由独立的分类器模型实现,运行在 Claude Sonnet 4.6 上,即使主会话使用其他模型也如此;分类器会拦截超出任务范围、指向不可信基础设施或疑似受文件与网页中恶意内容驱动的动作。用户可在终端运行 claude auto-mode defaults 查看完整默认规则 JSON,并可用自定义规则扩展。
Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。
微软 PyRIT 发布 v0.12.1 安全补丁,修复 Jinja2 模板注入(SSTI)漏洞,建议 0.12.0 及更早版本用户升级。漏洞源于模板渲染使用未沙箱化的 Jinja2 Environment,远程数据集加载器把抓取的数据直接传入 SeedPrompt(value=...) 并在 __post_init__ 中按模板渲染,被投毒的数据集可借此实现 Python 对象遍历。
论文提出一种在旧款 GPU 上实现可验证差分隐私(DP)训练的框架,用 CPU 侧 TEE 配合不受信任的 GPU 完成校验。作者指出,零知识证明等密码学方案开销过大,有时高出数个数量级,而支持大语言模型训练与微调的多 GPU TEE 仅限较新平台,在旧款 GPU 上缺失或效率低下。该设计把昂贵的梯度计算卸载到 GPU,由 CPU TEE 通过概率性检查验证梯度上 DP 是否被正确执行,以缓解全在 CPU TEE 内训练过慢、无限制卸载又可能被恶意偏离 DP 的效率与安全矛盾。框架能以高概率检测频繁的完全偏离;在本文评估的面向效用的伪造梯度攻击中,稀疏偏离带来的效用收益有限,也未观察到可测量的额外成员泄露。
NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,让 LLM 推理在个人、企业和受监管场景中处理敏感数据与专有模型上下文时运行于可信环境。该方案面向生产级 AI 推理,兼顾私有性与高性能。
Google 披露其用 AI 辅助将一个名为 giflib 的 C 库重写为 Rust,目的是缓解内存安全类漏洞。该工作属于其在依赖项层面规模化推进内存安全的尝试,博客同时给出了这次 AI 协助重写的实践路径。(共三句,含受影响对象名称与目标。)
SKILLLITE 是一个证据引导的智能体框架,用紧凑、可本地部署的 LLM 检测 Agent Skill 中的恶意行为。研究指出小模型难以识别复杂 Skill 包中隐含的恶意行为,SKILLLITE 先提取安全相关行为并推断 Skill 的预期功能,再据此评估恶意性。
研究提出"物理认证联邦学习",将守恒定律、执行器耦合等信息物理过程不变量从运行时检测启发式改造为联邦更新的可验证准入条件,自动从干净运行数据中挖掘。在 SWaT、WADI 两个水务测试床和 BATADAL 基准上,挖掘出的不变量对 100 个诚实分片零拒绝,并全部拒绝朴素伪造更新,包括 FoolsGold 完全放行的优化扰动。