全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态0DIN
0DIN 开放免费 AI 安全评估:用红队武器库提前攻破你的 AI
0DIN 面向正在交付 AI 系统的团队开放限时免费安全评估,用其研究员来源的红队武器库攻击用户自有或获授权测试的模型,并给出按优先级排序的报告。评估通过 0DIN Scanner 执行,覆盖直接与间接提示注入、越狱、编码隐藏载荷、多轮攻击以及带工具智能体的数据泄露与错误调用等失效方式,云端模型走 API、自托管模型用容器化 Scanner 在本地网络内运行,报告通常一两天内交付。报告包含安全评级与风险等级、可长期跟踪的攻击成功率(ASR)、分类发现、与前沿模型的对比及修复建议,并映射到 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF、ISO/IEC 42001 和 EU AI Act 等框架;该评估基于 NVIDIA 开源 garak 引擎并叠加 0DIN 的赏金探针库,每次评估均经人工把关。
- 动态Adversa AI
2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击
Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA Morpheus:以加速告警分诊和 LLM 智能体增强 SOC
NVIDIA Morpheus 通过加速告警分诊与 LLM 智能体,帮助安全运营中心(SOC)分析师应对海量安全告警。SOC 分析师每天需处理大量告警,从中筛除误报并识别真正的入侵指标,而告警数量过大会使重要的早期信号被淹没。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
Super Protocol 如何用自主权 AI 与 NVIDIA 机密计算实现去中心化隐私
Super Protocol 借助区块链去中心化扩展 NVIDIA 机密计算(CC)能力,让 AI 开发、训练与推理中的用户数据实现去中心化、私密且由用户自主掌控。该方案针对自主权 AI 场景,将机密计算与去中心化结合,解决数据隐私与控制权问题。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
用 NVIDIA AI Blueprints 在 AWS 的 CI 流水线中自动完成早期安全补丁
NVIDIA AI Blueprints 可在 AWS 的 CI 流水线中自动完成早期安全补丁。现代应用开发向基于微服务的架构迁移,带来灵活性与可扩展性,也引入了新的安全复杂性:以往工程团队只需负责单体应用中的少量安全事项,微服务架构改变了这一格局。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA NeMo Guardrails 如何为 RAG 应用做内容审核与安全检查
NVIDIA NeMo Guardrails 通过集成 Meta 的 LlamaGuard 和 AlignScore 等第三方安全模型,为 RAG 应用提供内容审核与安全检查。该工具以开源工具包和微服务两种形式部署,支持内容审核、越狱检测、PII 检测、幻觉检测等护栏功能,可在 LLM 输出前扫描检索内容与生成回复中的冒犯性语言、虚假信息或政策违规。NeMo Guardrails 微服务处于早期访问阶段,提供 OpenAI 兼容 API。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA GTC 2025 网络技术专场:网络创新如何支撑吉瓦级 AI 工厂
NVIDIA GTC 2025 的网络技术专场聚焦网络创新如何让 AI 工厂达到吉瓦级规模并实现性能与效率突破。会议内容围绕支撑这一规模所需的网络技术展开,配图来源包括 Plask 与 Cern。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA:AI 智能体的自主性等级与安全
NVIDIA 技术博客探讨 AI 智能体的自主性等级与安全问题,将智能体工作流视为 AI 工具的下一步演进。这类工作流可让开发者串联多个 AI 模型执行复杂任务,调用工具访问额外数据或自动执行用户操作,并让模型以最少人工介入自主分析与完成任务。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA 技术博客:如何定义与标准化 LLM 红队测试
LLM 红队测试指向大语言模型等生成式 AI 提供输入,检验其输出是否偏离可接受标准,这一做法自 2023 年起迅速演变为行业惯例与可信 AI 的基石。NVIDIA 技术博客由此提出,业界需要进一步标准化并明确定义 LLM 红队测试。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA NeMo Guardrails 如何衡量与优化生成式 AI 应用中的护栏效果与性能
NVIDIA NeMo Guardrails 提供内容安全、话题控制、越狱检测等 AI 护栏,用于保障 AI 智能体及对话式 AI 应用的安全、符合品牌调性与可靠行为。该文探讨衡量与优化这些护栏效果和性能的技术方法,帮助企业在生成式 AI 应用中评估并提升护栏表现。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA:以智能体 AI 系统推进网络安全运营
大语言模型(LLM)的快速进步解锁了智能体 AI 系统,使 AI 不再只是被动响应,而能思考、规划并行动,从而把网络安全等多个领域的繁琐任务自动化。传统上,AI 在网络安全中的应用主要集中在检测类任务。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
用 NVIDIA NIM 安全部署 AI 模型
NVIDIA 发布博客,介绍如何用 NVIDIA NIM 安全部署 AI 模型,帮助企业在推进 AI 项目时兼顾合规、风险管理与安全态势,面向评估 AI 模型的企业安全负责人。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
如何用 AI Kill Chain 框架建模针对 AI 应用的攻击
AI 智能体自主性增强,AI 应用正带来传统安全模型无法完全覆盖的新攻击面。应对原则是 Assume prompt injection,即假设提示注入已经发生,但把它转化为有效防御并不简单。AI Kill Chain 框架被用来建模这类攻击,Cyber Kill Chain 则定义了攻击者如何运作。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA AI 红队分享 LLM 安全实践建议
NVIDIA AI 红队(AIRT)基于多年来对多种 AI 系统在生产部署前的安全评估,总结出若干 LLM 应用中的常见漏洞与安全隐患,指出若在开发阶段加以处理可显著提升基于 LLM 应用的安全性。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体
NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA AI Red Team 如何用语法约束解码改进小语言模型的 Bash 生成
NVIDIA AI Red Team 提出用语法约束解码改进小语言模型的 Bash 命令生成,并将命令生成列为研究目标。Bash 是暴露给 AI 智能体的最灵活接口之一,模型输出的命令是可执行动作,能够读取文件、修改工作区、打开网络连接并串联工具。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA MCG Toolkit 如何自动化 AI 模型文档编写
NVIDIA 发布 MCG Toolkit,用于自动化生成 AI 模型文档。该工具针对加州 AB-2013 和欧盟 AI Act 等监管框架下的模型卡编写需求,帮助软件团队在模型发布前产出可审计的完整文档,涵盖模型工作原理、预期用途与许可、训练数据及性能等信息。
- 动态Import AI
NVIDIA 用 ENPIRE 搭建机器人自我改进闭环
NVIDIA 研究人员开发了 ENPIRE 软件,让实体机器人在编码智能体驱动下自主实验并迭代策略,实现无需人工评判的成功率评分与场景自动重置。该系统由环境、策略改进、Rollout 和进化四个模块组成,工作站搭载 NVIDIA RTX 5090,配合两台 YAM 机械臂运行。在 PushT、整理插针盒和使用切割器剪断扎带等任务中取得最高 99% 成功率,并能尝试将 GPU 插入主板。
- 动态Failure-First
NavIsaacLab:面向人类感知导航基准的高保真人群仿真框架
NavIsaacLab 通过并行机器人学习生成逼真人群,为人机共存环境中的“人类感知”导航提供高保真基准。该框架基于 NVIDIA Isaac Lab 实现 GPU 并行仿真,将行人建模为由 SMPL 驱动的关节级物理智能体,并用轨迹扩散模型加 AMP 替代手写规则。它针对现有模拟器低物理保真度、简化行人建模和缺乏并行化三大缺陷设计,配套标准化基准从亲密度和社会规范维度评估策略。
- 动态NVIDIA garak 版本发布
NVIDIA garak v0.13.0 发布:新增 Leet 编码攻击插件与对话支持
NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。
- 动态NVIDIA garak 版本发布
NVIDIA garak v0.13.1 发布:新增多种探针插件并改进检测器配置
NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。
- 动态NVIDIA NeMo Guardrails 版本发布
NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails
NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。
- 动态NVIDIA NeMo Guardrails 版本发布
NVIDIA NeMo Guardrails v0.22.0 发布:LangChain 解耦、IORails 里程碑 2
NVIDIA NeMo Guardrails v0.22.0 将 LangChain 从核心依赖降为可选,OpenAI 兼容 LLM 改用内置 httpx 客户端,其他场景可通过 NEMOGUARDRAILS_LLM_FRAMEWORK=langchain 重新接入。新编排引擎 IORails 进入第二阶段,支持流式输出、OpenTelemetry 和推理模型,并在非流式模式下实现推测生成,让输入护栏与主模型响应并行以隐藏延迟。该版本还引入匿名使用统计,可通过 NEMO_GUARDRAILS_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或配置文件退出。
- 动态NVIDIA NeMo Guardrails 版本发布
NVIDIA NeMo Guardrails v0.23.0 发布:IORails 扩展工具调用与可观测性
NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。