NVIDIA:为视觉语言模型更新分类器规避方法
NVIDIA 技术博客发布《为视觉语言模型更新分类器规避》,围绕视觉语言模型(VLM)的分类器规避方法更新展开。文中指出,Transformer 多模态模型能在同一上下文中处理多种数据形式,VLM 可基于图像与文本的组合输入生成输出,让开发者构建解读图表、处理摄像头画面,或通过桌面等传统人类界面操作的系统。
英伟达 AI Red Team 的研究、garak 与 NeMo Guardrails 等开源安全工具,以及 Agent 运行时防护。
在这个话题内搜索或按分类筛选NVIDIA 技术博客发布《为视觉语言模型更新分类器规避》,围绕视觉语言模型(VLM)的分类器规避方法更新展开。文中指出,Transformer 多模态模型能在同一上下文中处理多种数据形式,VLM 可基于图像与文本的组合输入生成输出,让开发者构建解读图表、处理摄像头画面,或通过桌面等传统人类界面操作的系统。
NVIDIA 发布面向智能体工作流的安全实践指引,聚焦沙箱化与执行风险管理。文章指出,AI 编码智能体通过命令行运行工具时,会继承与用户相同的权限和授权,因而成为计算机使用智能体,带来常被忽视的攻击面。该指引围绕这一执行风险给出实践建议。
推荐理由NVIDIA 安全团队从权限与执行风险角度给出智能体工作流的沙箱实践指引,适合部署编码智能体的团队参考。
NVIDIA 推出 OpenShell,用于更安全地运行自主、自进化的 AI 智能体。这类被称为 claws 的智能体可接受目标后自行规划并持续执行,无需人类介入。随着其能力增强,信任难度上升,其自进化自主性也改变了运行环境。
为机密 AI 工厂构建零信任架构,用于应对企业私有数据与 AI 模型结合时的隐私与信任风险。AI 正从实验走向生产,但企业所需的大部分数据位于公有云之外,包括患者记录、市场调研以及承载企业知识的遗留系统,隐私与信任顾虑常常拖慢甚至阻断 AI 的采用。
NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。
NVIDIA 针对智能体环境中的间接 AGENTS.md 注入攻击给出缓解方法,聚焦编码智能体场景。正文以 OpenAI Codex 为例,说明此类编码智能体可自动完成代码生成、调试与创建 PR 等任务,AI 工具正显著加速软件开发。
NVIDIA AI Red Team 提出用语法约束解码改进小语言模型的 Bash 命令生成,并将命令生成列为研究目标。Bash 是暴露给 AI 智能体的最灵活接口之一,模型输出的命令是可执行动作,能够读取文件、修改工作区、打开网络连接并串联工具。
NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理,仅靠运行时护栏并不足够。随着自主 AI 智能体能力增强,开放模型、MCP 连接的工具与可移植技能让智能体更易扩展,但规模化使用需要结构透明与运行完整性。组织与团队需要理解和信任智能体所使用的技能(即指令)。
NVIDIA 发布 MCG Toolkit,用于自动化生成 AI 模型文档。该工具针对加州 AB-2013 和欧盟 AI Act 等监管框架下的模型卡编写需求,帮助软件团队在模型发布前产出可审计的完整文档,涵盖模型工作原理、预期用途与许可、训练数据及性能等信息。
NVIDIA 推出 DOCA 芯片内安全能力,支撑智能体 AI 的 AI 工厂基础设施。该方案针对 AI 工厂在训练、微调和部署时引入的新攻击面,把安全能力下沉到芯片层。
NVIDIA Confidential Computing(CC)面向 AI 推理与智能体场景,用硬件级方案保护数据在使用中的安全,同时避免拖慢性能。该方案针对企业在数据隐私与主权方面的顾虑,目标是让 AI 模型在推理和交互过程中数据始终处于受保护状态。
NVIDIA 研究人员开发了 ENPIRE 软件,让实体机器人在编码智能体驱动下自主实验并迭代策略,实现无需人工评判的成功率评分与场景自动重置。该系统由环境、策略改进、Rollout 和进化四个模块组成,工作站搭载 NVIDIA RTX 5090,配合两台 YAM 机械臂运行。在 PushT、整理插针盒和使用切割器剪断扎带等任务中取得最高 99% 成功率,并能尝试将 GPU 插入主板。
Google DeepMind 将 SynthID 合成内容检测扩展到 Search 和 Chrome,并新增基于 C2PA Content Credentials 的来源查验,此前该能力已在 Gemini App 中被调用 5000 万次。SynthID 已将超过 1000 亿张图片和视频以及 60000 年时长音频加水印,Pixel 8、9、10 将在未来数周内获得原生相机视频凭证。
NavIsaacLab 通过并行机器人学习生成逼真人群,为人机共存环境中的“人类感知”导航提供高保真基准。该框架基于 NVIDIA Isaac Lab 实现 GPU 并行仿真,将行人建模为由 SMPL 驱动的关节级物理智能体,并用轨迹扩散模型加 AMP 替代手写规则。它针对现有模拟器低物理保真度、简化行人建模和缺乏并行化三大缺陷设计,配套标准化基准从亲密度和社会规范维度评估策略。
NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。
NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。
NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。
NVIDIA NeMo Guardrails v0.22.0 将 LangChain 从核心依赖降为可选,OpenAI 兼容 LLM 改用内置 httpx 客户端,其他场景可通过 NEMOGUARDRAILS_LLM_FRAMEWORK=langchain 重新接入。新编排引擎 IORails 进入第二阶段,支持流式输出、OpenTelemetry 和推理模型,并在非流式模式下实现推测生成,让输入护栏与主模型响应并行以隐藏延迟。该版本还引入匿名使用统计,可通过 NEMO_GUARDRAILS_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或配置文件退出。
NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。
NVIDIA 发布 NeMo Guardrails v0.24.0,IORails 现可直接执行库内 67 项输入输出接口中的 59 项,并与 LLMRails 共享同一底层实现。该版本引入引擎中立的 RailOutcome 契约、声明式的 rail manifest 以及统一的对外 HTTP 客户端,同时新增 F5 Guardrails 集成、服务器健康检查端点及通过 `/v1/checks` 进行输出检查的功能。