跳到正文

#防御/护栏

今天收录 1 条
今天10月2日周五
  1. Goodfire Research · 66

    Goodfire 用蛋白质嵌入向量为 AI 智能体构建生物安全监控器

    Goodfire 提出基于蛋白质语言模型嵌入向量的序列感知监控器,用于筛查 AI 智能体在双用途生物任务中的有害序列。该方法同时利用序列本身和任务上下文,在自建基准上优于前沿模型护栏,且在双用途任务上拒答更少。监控器对改写和片段化等对抗攻击更稳健,在原始蛋白存在于筛查数据库时 AUROC 约为 0.98;原始蛋白不在库中时各方法性能均下降,但该方法在低误报率下仍保持优势。其泛化能力还扩展到留出的蛋白家族、酶类毒素机制留出集以及外部细菌毒素数据集 Exo-Tox。检测速度达每序列毫秒级,与序列搜索相当,且随蛋白质模型能力提升而增强。

    推荐理由Goodfire 用蛋白质模型嵌入向量做序列感知监控,在双用途任务上比前沿模型护栏更准且拒答更少,做生物安全筛查的团队可参考其评测方式。

10月1日周四
  1. Google DeepMind ·

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质与结构加水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印既能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。该方法按数据类型调整策略,对序列微调氨基酸选择,对预测的 3D 结构调整原子坐标。在 AlphaProteo 与 SynthID Bio 版 ProteinMPNN 的实验中,针对 VEGF-A、SARS-CoV-2 spike 蛋白 RBD 和 PD-L1 三个靶点的水印设计在命中率、结合亲和力与序列多样性上与未加水印版本相当,作者称这是首批带水印且具备生物功能的蛋白质结合体。

9月28日周一
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 开放智能体安全平台:面向持续在硅基芯片内监测智能体的参考方案

    NVIDIA 发布了开放智能体安全平台,作为持续在硬件层面对 AI 智能体进行监测的参考实现。该平台将互联网兴起带来的机遇与风险作类比,强调智能体时代同样需要在底层提供安全保障。目前公开的信息仅为其定位说明,尚未披露具体的监测机制与技术指标。

  2. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA OpenShell:为 AI 智能体添加运行时控制

    NVIDIA 推出 OpenShell,为 AI 智能体提供运行时控制能力。智能体可被赋予目标、编写代码、调用工具并在新信息出现时持续工作,适用于调查软件故障、运行实验以及执行跨天或跨周的关键业务操作与研究。这类智能体需要访问工作区、计算资源、数据、凭证和外部服务。

9月24日周四
  1. Google Threat Intelligence(GTIG) ·

    Google GTIG 发布 CI/CD 与代码流水线主动防御蓝图

    Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。

9月23日周三
9月21日周一
  1. UK NCSC(AI 相关) ·

    英国 NCSC 谈自主智能体网络防御为何难以照搬攻击者模式

    英国 NCSC 委托 CETAS 开展的自主网络防御研究指出,攻击者的核心是技术问题且成功状态明确,防御者却受制于组织与预算等"政治"问题,因此不能像攻击者那样直接部署智能体工具。文章提出按"效力"维度评估防御动作风险,从 AI 仅向人类提供可解释建议,到 AI 提供不可解释建议,再到以只读权限跨 API 和网络搜索自主收集数据,逐级递增风险。

9月17日周四
  1. NVIDIA NeMo Guardrails 版本发布 ·

    NVIDIA NeMo Guardrails v0.24.1 发布

    NVIDIA NeMo Guardrails 发布 v0.24.1 补丁版本,集中修复若干缺陷。该版本修正了 benchmark 中 Locust 并发测量与扫描、content-safety 对 Nemotron 3.5 响应的解析、server 在 IORails 准入丢弃时返回过载响应,以及 rails 对组合配置加载 config.py 的问题。

9月3日周四
8月27日周四
  1. NVIDIA NeMo Guardrails 版本发布 ·

    NVIDIA NeMo Guardrails v0.24.0 发布

    NVIDIA 发布 NeMo Guardrails v0.24.0,IORails 现可直接执行库内 67 项输入输出接口中的 59 项,并与 LLMRails 共享同一底层实现。该版本引入引擎中立的 RailOutcome 契约、声明式的 rail manifest 以及统一的对外 HTTP 客户端,同时新增 F5 Guardrails 集成、服务器健康检查端点及通过 `/v1/checks` 进行输出检查的功能。

8月24日周一
8月21日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 谈安全在 AI 智能体栈中的位置

    NVIDIA 的安全团队基于其 OpenShell 及生态合作经验,阐述了新兴 AI 智能体栈中安全的定位问题,指出随着智能体能力增强并运行于更长的时间跨度,将安全与信任内建于其所驱动的应用愈发重要。该视角覆盖智能体栈的各层及其作用,面向开发者、开源项目和合作伙伴提供参考。

8月20日周四
  1. UK NCSC(AI 相关) ·

    UK NCSC 发布《管理智能体 AI 的网络风险》指南

    UK NCSC 发布针对智能体 AI 网络风险的防护指南,建议将 AI 智能体运行于沙箱环境并管控其本地及网络的资源访问。指南提出四层网络访问成熟度模型(从无限制访问到模型本地托管且无外部网络)、四级计算隔离模型以及凭证最小化原则,并要求通过多层隔离加显式提示降低沙箱逃逸风险。 对于高风险场景,最稳健的做法是在隔离断网环境中运行智能体并使用预先下载的工具和信息;若需联网则仅放行白名单连接,必要时改用协议或服务感知代理并经人工审批。该指南还指出部分自主 AI 工具会接入大量系统与服务,访问面越大潜在 blast radius 越高,因此应将其权限收敛到完成任务所需的最小集合并持续监测越权尝试。

7月31日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 提出四种更安全地部署 AI 智能体的方式

    NVIDIA 技术博客提出四种更安全部署 AI 智能体的方式,针对将大语言模型接入工作流所带来的风险。文中指出 AI 智能体作为“数字同事”能自动处理缺陷报告、实现并测试修复、推送补丁再交由人工复核,从而带来生产力提升,但也因此扩大了攻击面。

7月30日周四
  1. Google Threat Intelligence(GTIG) ·

    Google Threat Intelligence Group 供应链入侵缓解指南:开放源代码软件生态威胁活动激增

    Google Threat Intelligence Group(GTIG)联合 Mandiant 发布了针对软件供应链入侵的加固与缓解建议,指出 2025 年至 2026 年上半年出现了大规模的开源软件供应链入侵行动,涉及代码仓库、依赖项及开发者工具的攻陷。 其中,UNC6780(又名 TeamPCP)于 2026 年 2 月至 5 月在 PyPI、npm、Docker Hub 发动广泛攻击,滥用 GitHub Actions 的 pull_request_target 触发器获取基础仓库密钥并植入凭证窃取程序 SANDCLOCK,还试图从被感染的 AI 软件横向渗透到企业网络环境。

7月21日周二
  1. Google DeepMind ·

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 及面向网络安全的 3.5 Flash Cyber

    Google DeepMind 发布三款新 Gemini 模型:主力模型 Gemini 3.6 Flash、最快最便宜的 3.5 Flash-Lite,以及与代码安全智能体 CodeMender 搭配的网络专用模型 3.5 Flash Cyber。据 Artificial Analysis Index,Gemini 3.6 Flash 比 3.5 Flash 减少 17% 的输出 token,价格降至 $1.50/1M 输入 token 和 $7.50/1M 输出 token,并在 DeepSWE(49% vs. 37%)等多个基准上升。

7月16日周四
  1. Google Threat Intelligence(GTIG) ·

    Google 详解 AI 辅助漏洞管理:从确定性管控到 ZDR 的操作蓝图

    Google Threat Intelligence 旗下 Mandiant Consulting 发文,针对企业将 LLM 智能体接入 CI/CD 做自动化漏洞挖掘与修复的场景,给出一套操作护栏建议。文中援引 Mandiant M-Trends 2026 报告称平均利用时间(TTE)已降至 -7 天,并强调应把代码库视为不可信输入以防源码注释中的间接提示注入,同时落实云服务商的零数据留存(ZDR)、工作负载隔离与人主导的红队测试。

  2. Google DeepMind ·

    Google DeepMind 与 Isomorphic Labs 联合公布生物韧性方案

    Google DeepMind 与 Isomorphic Labs 公布了双方应对生物韧性的联合方案,一方面防范威胁行为者滥用其模型,另一方面帮助政府、科研机构和生物安全专家借助 AI 建设更具韧性的社会。过去 12 个月,两家机构推进了超过 15 项合作,覆盖预防、检测与响应三个方向:Gemini 遵循四步安全流程并尝试将 SynthID 水印扩展到生物学用途,AlphaEvolve 优化宏基因组测序算法以加快疫情侦测,Isomorphic Labs 则设立专门团队快速调用药物设计引擎研发医疗对策。该工作属于其对 CBRN 风险的整体管理的一部分,并与 Frontier Safety Framework 相衔接。

7月15日周三
  1. Google Threat Intelligence(GTIG) ·

    Google Cloud Run 无认证公开函数的安全风险与加固指南

    Mandiant 安全评估发现大量缺乏认证的公网暴露 serverless 应用,Cloud Run 服务若含第三方依赖易遭本地文件包含(LFI)、远程文件包含及命令注入攻击,成功利用可获得容器实例完整控制权并进一步横向移动接管云环境。该博客基于客户实战经验梳理攻击场景,针对必须公网开放的 Google Cloud Run 服务和函数给出一组加固建议,相关原则同样适用于任意公有 serverless 部署。

7月3日周五
7月2日周四
  1. NVIDIA NeMo Guardrails 版本发布 ·

    NVIDIA NeMo Guardrails v0.23.0 发布:IORails 扩展工具调用与可观测性

    NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。

6月25日周四
  1. Google DeepMind ·

    Gemini 3.5 Flash 内置计算机操作能力

    Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。该能力使开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境看、推理并执行操作的智能体,面向持续软件测试等长周期与企业自动化任务。针对实时环境中的提示注入风险,Gemini 3.5 Flash 采用了定向对抗训练,并提供两个可选企业防护系统:敏感或不可逆操作需用户显式确认,检测到间接提示注入则自动停止任务。

6月16日周二
  1. Google DeepMind · 71

    Google DeepMind 发布 AI Control Roadmap,用纵深防御保障内部 Agent 安全

    Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部署和管理先进 AI 时提供系统级安全保障。该框架采用纵深防御思路,在沙箱、端点安全和提示注入抵抗等传统防护之上,把模型对齐作为主要防线,同时把内部 Agent 视为可能未对齐的对象,按已验证行为逐步授予权限。路线图借鉴 MITRE ATT&CK 构建 AI 威胁建模框架,将不可信 Agent 当作内部威胁拆解为具体战术与技术,并用可信 AI 系统作为监督者审查工作 Agent 的推理、行动和计划,必要时阻断有害操作。

    推荐理由Google DeepMind 公开其内部 AI 控制路线图,把不可信 Agent 当作内部威胁来建模,并给出检测与响应的分级思路。

6月9日周二
  1. NIST 信息技术(AI 相关) · 62

    NIST 数学证明:AI 护栏无法穷尽抵御对抗提示,需转向持续监控与更新

    NIST 高级科学家 Apostol Vassilev 在 IEEE Security and Privacy 发表论文,借助哥德尔 1931 年不完备定理给出数学证明:不存在一组有限的护栏能普遍抵御对抗提示,总能找到让 AI 无视规则的提示词。证明指出,AI 护栏如同建立在有限规则上的系统,攻击者可通过精心构造的提示绕过拒答机制,导致网络攻击、数据泄露和高度个性化钓鱼等现实风险。Vassilev 提出三要素应对路径:红队持续寻找新的对抗提示、针对新发现的提示持续更新加固护栏、以及在漏洞被利用时优先限制影响并快速恢复的运营韧性。他表示目标不是彻底解决问题,而是让攻击者寻找新漏洞的成本超过其资源,形成对攻击者经济上不可行的新平衡。论文题为 Robust AI Security and Alignment: A Sisyphean Endeavor?

    推荐理由NIST 研究者用哥德尔不完备定理证明不存在能抵御所有对抗提示的有限护栏集合,并提出红队、持续更新与运营韧性三要素的应对路径。

6月1日周一
5月23日周六
  1. NVIDIA NeMo Guardrails 版本发布 ·

    NVIDIA NeMo Guardrails v0.22.0 发布:LangChain 解耦、IORails 里程碑 2

    NVIDIA NeMo Guardrails v0.22.0 将 LangChain 从核心依赖降为可选,OpenAI 兼容 LLM 改用内置 httpx 客户端,其他场景可通过 NEMOGUARDRAILS_LLM_FRAMEWORK=langchain 重新接入。新编排引擎 IORails 进入第二阶段,支持流式输出、OpenTelemetry 和推理模型,并在非流式模式下实现推测生成,让输入护栏与主模型响应并行以隐藏延迟。该版本还引入匿名使用统计,可通过 NEMO_GUARDRAILS_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或配置文件退出。

5月20日周三
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理,仅靠运行时护栏并不足够。随着自主 AI 智能体能力增强,开放模型、MCP 连接的工具与可移植技能让智能体更易扩展,但规模化使用需要结构透明与运行完整性。组织与团队需要理解和信任智能体所使用的技能(即指令)。

5月1日周五
4月18日周六
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体

    NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。

4月3日周五
3月23日周一
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 如何为机密 AI 工厂构建零信任架构

    为机密 AI 工厂构建零信任架构,用于应对企业私有数据与 AI 模型结合时的隐私与信任风险。AI 正从实验走向生产,但企业所需的大部分数据位于公有云之外,包括患者记录、市场调研以及承载企业知识的遗留系统,隐私与信任顾虑常常拖慢甚至阻断 AI 的采用。

3月17日周二
3月12日周四
  1. NVIDIA NeMo Guardrails 版本发布 ·

    NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails

    NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。

3月9日周一
1月31日周六
  1. NVIDIA 技术博客:可信 AI 与网络安全 · 62

    NVIDIA 发布智能体工作流沙箱与执行风险管理的安全实践指引

    NVIDIA 发布面向智能体工作流的安全实践指引,聚焦沙箱化与执行风险管理。文章指出,AI 编码智能体通过命令行运行工具时,会继承与用户相同的权限和授权,因而成为计算机使用智能体,带来常被忽视的攻击面。该指引围绕这一执行风险给出实践建议。

    推荐理由NVIDIA 安全团队从权限与执行风险角度给出智能体工作流的沙箱实践指引,适合部署编码智能体的团队参考。

12月9日周二
  1. Google Security Blog · 71

    Chrome 公布智能体能力的分层安全架构

    Chrome 安全团队公布了针对 Gemini 智能体浏览能力的分层防御设计,核心应对威胁是间接提示注入。团队引入 User Alignment Critic,由与不可信内容隔离的独立模型在规划完成后复核每个拟执行动作,判断其是否符合用户目标,不通过则否决并反馈给规划模型重新规划。Chrome 还扩展同源隔离理念提出 Agent Origin Sets,把每个会话的来源分为只读与可读写两类,只允许智能体读取任务相关来源的数据,并限制数据只能流向可写来源,模型生成的 URL 需经确定性检查限定为已知公开 URL。

    推荐理由Chrome 安全团队公开了智能体浏览的分层防御架构,包括独立审查模型与来源集合限制,可供做浏览器智能体的团队参考。

11月4日周二
10月3日周五
7月29日周二
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    为 AI 模型带来可验证信任:NVIDIA NGC 中的模型签名

    NVIDIA 在 NGC 中引入模型签名,为 AI 模型带来可验证的信任。AI 正进入由能推理、规划并采取行动的智能体主导的阶段,这类系统动态调用 API、工具乃至物理环境,大幅扩展了 AI 攻击面:单个被攻陷的模型即可影响下游决策、访问外部系统并触发级联故障。