Google DeepMind 将 Hybrid 传输协议扩展至通用 JSON 消息
Google DeepMind 将 Hybrid 传输协议扩展为支持通用 JSON 消息,为多种新的安全认证与凭证用例铺路。该升级在原有 Hybrid 传输基础上加入通用 JSON 消息支持,具体版本号、性能数据与适用范围原文未披露。
Google DeepMind 将 Hybrid 传输协议扩展为支持通用 JSON 消息,为多种新的安全认证与凭证用例铺路。该升级在原有 Hybrid 传输基础上加入通用 JSON 消息支持,具体版本号、性能数据与适用范围原文未披露。
Microsoft PyRIT 发布 v0.11.0,破坏性变更将攻击与执行器从 SeedPromptGroup 改为基于 Message 运行,并重命名场景配置 API。该版本新增 WebSocketCopilotTarget,可通过 WebSocket 向 Microsoft Copilot 发送提示词执行,同时加入图像下载支持的 ImageTarget 重构及 OpenAIImageTarget 的图像编辑/混合功能。
Goodfire 发布 preview.goodfire.ai,一个用于理解和操控 Llama 3 行为的桌面界面,后端在 Llama-3-8B-Instruct 第 19 层残差流上训练稀疏自编码器(SAE),提取可修改的特征。训练数据选用 LMSYS-Chat-1M,作者称其在聊天场景下产生的特征最有效,而 FineWeb 等非聊天数据训练出的特征迁移效果较差。团队用自动化可解释性流程借助 Claude 为特征生成人类可读标签,并通过基于梯度的归因方法筛选干预候选,再以特征干预改变模型输出。作者观察到正向干预通常单个特征即可生效,负向干预常需多个特征,可能与自我修复有关;同时指出跨层叠加会让部分特征难以被干预。
NVIDIA garak 发布 v0.14.0,新增 JSON 配置文件支持和检测器评测文档及基准结果,并移除 `--generate-autodan` CLI 选项。该版本重新设计了 HTML 报告,修改了 JSONL 报告中 eval 与 digest 条目格式属破坏性变更,同时更新 OpenAI 库到 2.x、加入 Transformers 5 支持并将校准数据更新至 2026 年冬季版。
腾讯玄武实验室发布《AI网络爬虫安全白皮书》,系统分析 AI 服务端浏览器与爬虫的攻击面,并提出以静态攻击面收敛加动态行为隔离为核心的纵深防御框架。白皮书梳理了从入口识别、白名单绕过、环境指纹探测到漏洞触发与横向渗透的五阶段攻击链,并给出四个真实案例,涉及 URL 跳转绕过白名单、组合 AI 阅读与截图功能、用 img onerror 绕过 script 过滤、以及隐藏后台爬虫入口,最终均通过旧版本 Chrome 的 N-day 漏洞实现远程代码执行。作者称相关产品服务端用户规模累计超 10 亿。防御侧建议关闭 WebGL、WebRTC、PDF 插件等无用模块,避免使用 --no-sandbox,并做网络、文件系统与实例隔离。
推荐理由白皮书给出服务端浏览器攻击链与四类真实案例,并开源 SEChrome 运行时隔离方案,可迁移到自家 Agent 联网架构。
面向 Hugging Face 模型的 OWASP AIBOM Generator 正式贡献给 OWASP GenAI Security Project,并迁至 owasp-genai-aibom.org。该工具自动提取 AI 模型的关键元数据,按 CycloneDX 标准生成 AIBOM,帮助团队了解模型内部构成、来源以及数据和配置参数,并评估文档完整性与可信度。它此前已在 RSAC 2025 亮相并被列入 CycloneDX Tool Center,如今转向开放社区治理,同时推进《OWASP AIBOM Generation Handbook》编写及字段映射改进。
Microsoft 开源红队工具 PyRIT 发布 v0.10.0,对包内大部分代码做了重写,把 Orchestrator 统一改名为 Attack,并新增 pyrit_scan 命令行与 pyrit_shell 交互式 shell,为自动化红队提供基础。
NVIDIA garak 发布 v0.13.3,新增检测 API Key 泄露的探针及配套检测器和零宽坏字符注入探针,并加入 AWS Bedrock 生成器。该版本还改进 unreal pkghallu 目标覆盖、令 OpenAICompatible 类默认单次生成一条回复,并为生成器启用一致的 PRNG 访问。此外引入延迟加载与依赖裁剪、AVID 报告导出中 metadata 与 vuln_id 处理的多项修复。
OWASP GenAI Security Project 发布《Agentic 应用 Top 10》,将智能体安全风险归纳为十类,并同步更新 Threats and Mitigations 1.1 分类。
OWASP GenAI Security Project 发布《OWASP Top 10 for Agentic Applications》,用于帮助组织识别和缓解自主 AI 智能体带来的风险。该清单经过一年多研究、评审和修订,汇集 100 多位安全研究者、行业从业者、用户组织及网络安全与 GenAI 厂商的意见,并由包含 NIST、European Commission、Alan Turing Institute 等机构代表的 Agentic Security Initiative Expert Review Board 评审。
OpenAI 介绍了为 gpt-5-codex 和 gpt-5.1-codex-max 训练专用智能体代码审查器的经验,将其作为深度防御策略中的输出监控手段。审查器获得仓库级工具和执行权限后,能发现更多关键问题并减少误报,专门针对代码审查的训练进一步提升效果。部署上优先保证信噪比,宁可适度降低召回率以换取开发者信任,并允许通过自定义任务指令或 AGENTS.md 调整这一取舍。数据显示,Codex 云完全生成的 PR 中有 36% 收到评论,其中 46% 促使作者修改代码,人工编写 PR 的评论修改比例为 53%;截至 2025 年 10 月,系统每天处理超过 10 万条外部 PR,超过 80% 的评论反馈为正面。
推荐理由OpenAI 公开了代码审查智能体的训练取舍与部署数据,可了解输出监控在真实工程流程中的落地方式。
Goodfire 在 GPT-2 Small 上训练跨层转码器(CLT),复现并验证其半自动发现模型内部计算结构的能力。CLT 用 FineWeb 的 100M token 训练,扩展因子 64,每层 49,152 个特征、12 层共 589,824 个特征,激活函数用 ReLU。在 greater-than 任务上,CLT 成功识别出可解释特征(包括抽象的奇偶特征),但发现的机制与 Hanna 等人此前的结果存在差异,提示稀疏解释器模型对计算机制的表示与分解可能有所不同。
Goodfire Research 发布 Paint With Ember,用画布取代提示词框,直接操控图像模型内部激活来编辑和生成图像。该工具基于 3.5B 参数的 Stable Diffusion XL-Turbo,针对其 UNet 的 block down.2.1 层训练 BatchTopK SAE 分解 16x16 patch 的潜向量,再用非负矩阵分解(NMF)把细粒度特征聚合成可操作的高层概念单元。用户可绘画添加物体、拖动概念、调整语义权重或修改主体动作,公开版应用与开源 SAE 解释器模型均已开放。
NVIDIA garak 发布 v0.13.2,新增迭代式探针基类与 FITD 探针,并加入 any 检测器。该版本修复了 MustRefuteClaimModel 目标类错误、TAP/PAIR 探针的 NameError、Win11 探针仍使用 Windows 10 产品名等问题,同时限制 langchain 版本、改进提示词翻译支持并新增运行加速文档。
AI 系统从被动工具演变为能生成代码、做出决策并自主行动的智能体后,代码执行成为关键安全风险。若不对 AI 生成代码的执行方式与位置施加严格管控,攻击者可构造输入诱导 AI 生成恶意代码。
NVIDIA AI 红队(AIRT)基于多年来对多种 AI 系统在生产部署前的安全评估,总结出若干 LLM 应用中的常见漏洞与安全隐患,指出若在开发阶段加以处理可显著提升基于 LLM 应用的安全性。
NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。
Google 隐私、安全与安保团队联合 Airbus 在 DEF CON 33 举办了聚焦人机协作的 GenSec Capture the Flag(CTF)。近 500 名参与者完成了入门挑战,其中 23% 的人首次将 AI 用于网络安全工作流,85% 的参与者认为该活动有助于了解 AI 在安全工作流中的应用方式。活动中还提供实验性的网络安全 AI——Sec-Gemini 作为可选助手,77% 的受访者表示它对自己解决挑战“很有帮助”或“极有帮助”。
AI 智能体自主性增强,AI 应用正带来传统安全模型无法完全覆盖的新攻击面。应对原则是 Assume prompt injection,即假设提示注入已经发生,但把它转化为有效防御并不简单。AI Kill Chain 框架被用来建模这类攻击,Cyber Kill Chain 则定义了攻击者如何运作。
NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。
Google 为 OSV-SCALIBR 推出补丁奖励计划,向提交新型 OSV-SCALIBR 插件的开发者提供资金激励,插件方向包括资产清点、漏洞检测和密钥检测。该计划由 Google Bug Hunters 发布。
NVIDIA 在 NGC 中引入模型签名,为 AI 模型带来可验证的信任。AI 正进入由能推理、规划并采取行动的智能体主导的阶段,这类系统动态调用 API、工具乃至物理环境,大幅扩展了 AI 攻击面:单个被攻陷的模型即可影响下游决策、访问外部系统并触发级联故障。
Google 开源安全团队(GOSST)发布 OSS Rebuild,通过重新执行并比对上游构建来增强开源软件包的信任度。该项目自动推导 PyPI、npm 和 Crates.io 现有软件包的声明式构建定义,并为其中数以千计的流行包签发满足 SLSA Build Level 3 要求的溯源证明,无需维护者介入。它还能检测源码缺失、构建环境遭入侵以及隐蔽后门三类供应链风险,并提供基础设施定义供企业自行运行实例。
NVIDIA 发布 DOCA 3.0,为 BlueField DPU 和 ConnectX SuperNIC 扩展能力,提升 AI 平台的可扩展性与性能。该框架自首个版本起持续演进,已成为下一代 AI 基础设施的关键组件,各版本均围绕 BlueField DPU 与 ConnectX SuperNIC 扩充功能。
NVIDIA 发布博客介绍如何用 NVIDIA NIM 安全部署 AI 模型,帮助企业在推进 AI 项目时兼顾合规、风险管理与安全态势要求。文章面向企业安全负责人,聚焦评估 AI 模型时面临的挑战,但正文未给出具体版本号、攻击数据或修复细节。
NVIDIA NeMo Guardrails 可对 LLM 逐 token 实时输出的流式响应进行安全增强。LLM 流式传输已从可选功能演变为现代 LLM 应用的核心组件,而传统等待完整响应再处理的方式在多模型调用等复杂场景下会造成明显延迟。
大语言模型(LLM)的快速进步解锁了智能体 AI 系统,使 AI 不再只是被动响应,而能思考、规划并行动,从而把网络安全等多个领域的繁琐任务自动化。传统上,AI 在网络安全中的应用主要集中在检测类任务。
NVIDIA 演示了如何在 NeMo Guardrails 中集成 Cleanlab 的可信语言模型(Trustworthy Language Model),用于防止 LLM 生成看似合理但错误的幻觉回答。该方案将 Cleanlab 的可信度评分作为护栏机制接入 NeMo Guardrails,以提升企业 AI 应用的可靠性。
NVIDIA NeMo Guardrails 提供内容安全、话题控制、越狱检测等 AI 护栏,用于保障 AI 智能体及对话式 AI 应用的安全、符合品牌调性与可靠行为。该文探讨衡量与优化这些护栏效果和性能的技术方法,帮助企业在生成式 AI 应用中评估并提升护栏表现。
LLM 红队测试指向大语言模型等生成式 AI 提供输入,检验其输出是否偏离可接受标准,这一做法自 2023 年起迅速演变为行业惯例与可信 AI 的基石。NVIDIA 技术博客由此提出,业界需要进一步标准化并明确定义 LLM 红队测试。
NVIDIA 技术博客探讨 AI 智能体的自主性等级与安全问题,将智能体工作流视为 AI 工具的下一步演进。这类工作流可让开发者串联多个 AI 模型执行复杂任务,调用工具访问额外数据或自动执行用户操作,并让模型以最少人工介入自主分析与完成任务。
Google DeepMind 发布了面向学生、研究人员和相关从业者的 AGI 安全短期课程,总时长 75 分钟,由录制讲座和练习组成,并配有幻灯片和练习手册。课程涵盖 AI 对齐问题及技术与治理层面的应对思路,内容包括刻意规划带来的风险、规格博弈与目标错误泛化两种错位目标来源、知情监督原则以及危险能力评估等前沿安全实践。若想进一步参与该方向工作,研究科学家与研究工程师岗位申请开放至 2 月 28 日。
NVIDIA NeMo Guardrails 为客服场景的 AI 智能体提供安全防护。这类智能体可自动处理常规咨询、加快响应速度,从而提升客服效率与客户满意度,帮助企业在竞争中保持优势;但驱动它们的 LLM 本身存在脆弱性,文章围绕此给出防护做法。
NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书,阐述其保障 NVIDIA AI Enterprise 软件栈容器安全所采取的措施。白皮书涵盖安全开发生命周期、容器构建生命周期管理、安全设计、安全加固、SBOM、容器签名与模型签名及 NIM 微服务。漏洞响应部分包括漏洞扫描、修补、VEX 与协同漏洞披露,并由 NGC 通知服务做安全事件监控。
NVIDIA NeMo Guardrails 通过集成 Meta 的 LlamaGuard 和 AlignScore 等第三方安全模型,为 RAG 应用提供内容审核与安全检查。该工具以开源工具包和微服务两种形式部署,支持内容审核、越狱检测、PII 检测、幻觉检测等护栏功能,可在 LLM 输出前扫描检索内容与生成回复中的冒犯性语言、虚假信息或政策违规。NeMo Guardrails 微服务处于早期访问阶段,提供 OpenAI 兼容 API。
NVIDIA AI Blueprints 可在 AWS 的 CI 流水线中自动完成早期安全补丁。现代应用开发向基于微服务的架构迁移,带来灵活性与可扩展性,也引入了新的安全复杂性:以往工程团队只需负责单体应用中的少量安全事项,微服务架构改变了这一格局。
Super Protocol 借助区块链去中心化扩展 NVIDIA 机密计算(CC)能力,让 AI 开发、训练与推理中的用户数据实现去中心化、私密且由用户自主掌控。该方案针对自主权 AI 场景,将机密计算与去中心化结合,解决数据隐私与控制权问题。
NVIDIA Morpheus 通过加速告警分诊与 LLM 智能体,帮助安全运营中心(SOC)分析师应对海量安全告警。SOC 分析师每天需处理大量告警,从中筛除误报并识别真正的入侵指标,而告警数量过大会使重要的早期信号被淹没。
腾讯玄武实验室公开一款基于安全大模型的EDR告警研判机器人,能对EDR设备上报的告警做多维度的智能分析与自动调查取证。该机器人结合资产信息、事件信息、进程树和告警规则等多源细节,借助大模型的安全知识与推理能力展开研判,并将误报可能性量化为很大、中等偏大、中等偏小及很小四档,便于用户按优先级处置告警。其技术方案经30余轮迭代打磨而成,涵盖训练数据生成算法、数据分布优化策略、Prompt工程、微调与强化学习算法及模型能力评价体系,且支持私有化部署以保证极高吞吐量。
腾讯安全玄武实验室提出一种可部署在端侧的提示词隐私保护方案,在调用云端 LLM 的流程中插入两个端侧步骤,先平行替换隐私实体完成脱敏,再还原云端输出中的隐私实体。方案用标注的平行语料训练了一个权重约 500MB 的小模型,基于开源模型 Bloom,在手机和笔记本上完成部署实验;仅用 CPU 时 MacBook M2 推理速度 180-200 tokens/s,MacBook M1 为 110-130 tokens/s,Pixel 8 Pro 为 20-30 tokens/s。原生支持润色、摘要、翻译、阅读理解和文本分类,并支持 Zero Shot 自定义扩展任务。