跳到正文
10月3日周六
  1. 0DIN · 收录 · 原文 15

    0DIN 开放免费 AI 安全评估:用红队武器库提前攻破你的 AI

    0DIN 面向正在交付 AI 系统的团队开放限时免费安全评估,用其研究员来源的红队武器库攻击用户自有或获授权测试的模型,并给出按优先级排序的报告。评估通过 0DIN Scanner 执行,覆盖直接与间接提示注入、越狱、编码隐藏载荷、多轮攻击以及带工具智能体的数据泄露与错误调用等失效方式,云端模型走 API、自托管模型用容器化 Scanner 在本地网络内运行,报告通常一两天内交付。报告包含安全评级与风险等级、可长期跟踪的攻击成功率(ASR)、分类发现、与前沿模型的对比及修复建议,并映射到 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF、ISO/IEC 42001 和 EU AI Act 等框架;该评估基于 NVIDIA 开源 garak 引擎并叠加 0DIN 的赏金探针库,每次评估均经人工把关。

10月1日周四
  1. Adversa AI · 收录 · 原文 18

    2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击

    Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。

  2. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    NVIDIA Morpheus:以加速告警分诊和 LLM 智能体增强 SOC

    NVIDIA Morpheus 通过加速告警分诊与 LLM 智能体,帮助安全运营中心(SOC)分析师应对海量安全告警。SOC 分析师每天需处理大量告警,从中筛除误报并识别真正的入侵指标,而告警数量过大会使重要的早期信号被淹没。

  3. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 6

    Super Protocol 如何用自主权 AI 与 NVIDIA 机密计算实现去中心化隐私

    Super Protocol 借助区块链去中心化扩展 NVIDIA 机密计算(CC)能力,让 AI 开发、训练与推理中的用户数据实现去中心化、私密且由用户自主掌控。该方案针对自主权 AI 场景,将机密计算与去中心化结合,解决数据隐私与控制权问题。

  4. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 6

    用 NVIDIA AI Blueprints 在 AWS 的 CI 流水线中自动完成早期安全补丁

    NVIDIA AI Blueprints 可在 AWS 的 CI 流水线中自动完成早期安全补丁。现代应用开发向基于微服务的架构迁移,带来灵活性与可扩展性,也引入了新的安全复杂性:以往工程团队只需负责单体应用中的少量安全事项,微服务架构改变了这一格局。

  5. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    NVIDIA NeMo Guardrails 如何为 RAG 应用做内容审核与安全检查

    NVIDIA NeMo Guardrails 通过集成 Meta 的 LlamaGuard 和 AlignScore 等第三方安全模型,为 RAG 应用提供内容审核与安全检查。该工具以开源工具包和微服务两种形式部署,支持内容审核、越狱检测、PII 检测、幻觉检测等护栏功能,可在 LLM 输出前扫描检索内容与生成回复中的冒犯性语言、虚假信息或政策违规。NeMo Guardrails 微服务处于早期访问阶段,提供 OpenAI 兼容 API。

  6. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 20

    NVIDIA:AI 智能体的自主性等级与安全

    NVIDIA 技术博客探讨 AI 智能体的自主性等级与安全问题,将智能体工作流视为 AI 工具的下一步演进。这类工作流可让开发者串联多个 AI 模型执行复杂任务,调用工具访问额外数据或自动执行用户操作,并让模型以最少人工介入自主分析与完成任务。

  7. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 11

    NVIDIA NeMo Guardrails 如何衡量与优化生成式 AI 应用中的护栏效果与性能

    NVIDIA NeMo Guardrails 提供内容安全、话题控制、越狱检测等 AI 护栏,用于保障 AI 智能体及对话式 AI 应用的安全、符合品牌调性与可靠行为。该文探讨衡量与优化这些护栏效果和性能的技术方法,帮助企业在生成式 AI 应用中评估并提升护栏表现。

  8. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 6

    NVIDIA:以智能体 AI 系统推进网络安全运营

    大语言模型(LLM)的快速进步解锁了智能体 AI 系统,使 AI 不再只是被动响应,而能思考、规划并行动,从而把网络安全等多个领域的繁琐任务自动化。传统上,AI 在网络安全中的应用主要集中在检测类任务。

  9. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 27

    如何用 AI Kill Chain 框架建模针对 AI 应用的攻击

    AI 智能体自主性增强,AI 应用正带来传统安全模型无法完全覆盖的新攻击面。应对原则是 Assume prompt injection,即假设提示注入已经发生,但把它转化为有效防御并不简单。AI Kill Chain 框架被用来建模这类攻击,Cyber Kill Chain 则定义了攻击者如何运作。

  10. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体

    NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。

  11. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 15

    NVIDIA AI Red Team 如何用语法约束解码改进小语言模型的 Bash 生成

    NVIDIA AI Red Team 提出用语法约束解码改进小语言模型的 Bash 命令生成,并将命令生成列为研究目标。Bash 是暴露给 AI 智能体的最灵活接口之一,模型输出的命令是可执行动作,能够读取文件、修改工作区、打开网络连接并串联工具。

  12. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    NVIDIA MCG Toolkit 如何自动化 AI 模型文档编写

    NVIDIA 发布 MCG Toolkit,用于自动化生成 AI 模型文档。该工具针对加州 AB-2013 和欧盟 AI Act 等监管框架下的模型卡编写需求,帮助软件团队在模型发布前产出可审计的完整文档,涵盖模型工作原理、预期用途与许可、训练数据及性能等信息。

  13. Import AI · 收录 · 原文 18

    NVIDIA 用 ENPIRE 搭建机器人自我改进闭环

    NVIDIA 研究人员开发了 ENPIRE 软件,让实体机器人在编码智能体驱动下自主实验并迭代策略,实现无需人工评判的成功率评分与场景自动重置。该系统由环境、策略改进、Rollout 和进化四个模块组成,工作站搭载 NVIDIA RTX 5090,配合两台 YAM 机械臂运行。在 PushT、整理插针盒和使用切割器剪断扎带等任务中取得最高 99% 成功率,并能尝试将 GPU 插入主板。

  14. Failure-First · 收录 · 原文 15

    NavIsaacLab:面向人类感知导航基准的高保真人群仿真框架

    NavIsaacLab 通过并行机器人学习生成逼真人群,为人机共存环境中的“人类感知”导航提供高保真基准。该框架基于 NVIDIA Isaac Lab 实现 GPU 并行仿真,将行人建模为由 SMPL 驱动的关节级物理智能体,并用轨迹扩散模型加 AMP 替代手写规则。它针对现有模拟器低物理保真度、简化行人建模和缺乏并行化三大缺陷设计,配套标准化基准从亲密度和社会规范维度评估策略。

  15. NVIDIA garak 版本发布 · 收录 · 原文 20

    NVIDIA garak v0.13.0 发布:新增 Leet 编码攻击插件与对话支持

    NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。

  16. NVIDIA garak 版本发布 · 收录 · 原文 16

    NVIDIA garak v0.13.1 发布:新增多种探针插件并改进检测器配置

    NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。

  17. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails

    NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。

  18. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 12

    NVIDIA NeMo Guardrails v0.22.0 发布:LangChain 解耦、IORails 里程碑 2

    NVIDIA NeMo Guardrails v0.22.0 将 LangChain 从核心依赖降为可选,OpenAI 兼容 LLM 改用内置 httpx 客户端,其他场景可通过 NEMOGUARDRAILS_LLM_FRAMEWORK=langchain 重新接入。新编排引擎 IORails 进入第二阶段,支持流式输出、OpenTelemetry 和推理模型,并在非流式模式下实现推测生成,让输入护栏与主模型响应并行以隐藏延迟。该版本还引入匿名使用统计,可通过 NEMO_GUARDRAILS_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或配置文件退出。

  19. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.23.0 发布:IORails 扩展工具调用与可观测性

    NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。

  20. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.24.0 发布

    NVIDIA 发布 NeMo Guardrails v0.24.0,IORails 现可直接执行库内 67 项输入输出接口中的 59 项,并与 LLMRails 共享同一底层实现。该版本引入引擎中立的 RailOutcome 契约、声明式的 rail manifest 以及统一的对外 HTTP 客户端,同时新增 F5 Guardrails 集成、服务器健康检查端点及通过 `/v1/checks` 进行输出检查的功能。

  21. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 7

    NVIDIA NeMo Guardrails v0.24.1 发布

    NVIDIA NeMo Guardrails 发布 v0.24.1 补丁版本,集中修复若干缺陷。该版本修正了 benchmark 中 Locust 并发测量与扫描、content-safety 对 Nemotron 3.5 响应的解析、server 在 IORails 准入丢弃时返回过载响应,以及 rails 对组合配置加载 config.py 的问题。

  22. NVIDIA garak 版本发布 · 收录 · 原文 15

    NVIDIA garak v0.13.2 发布

    NVIDIA garak 发布 v0.13.2,新增迭代式探针基类与 FITD 探针,并加入 any 检测器。该版本修复了 MustRefuteClaimModel 目标类错误、TAP/PAIR 探针的 NameError、Win11 探针仍使用 Windows 10 产品名等问题,同时限制 langchain 版本、改进提示词翻译支持并新增运行加速文档。

  23. NVIDIA garak 版本发布 · 收录 · 原文 15

    NVIDIA garak v0.13.3 发布:新增 API Key 探测插件与 AWS Bedrock 生成器

    NVIDIA garak 发布 v0.13.3,新增检测 API Key 泄露的探针及配套检测器和零宽坏字符注入探针,并加入 AWS Bedrock 生成器。该版本还改进 unreal pkghallu 目标覆盖、令 OpenAICompatible 类默认单次生成一条回复,并为生成器启用一致的 PRNG 访问。此外引入延迟加载与依赖裁剪、AVID 报告导出中 metadata 与 vuln_id 处理的多项修复。

  24. NVIDIA garak 版本发布 · 收录 · 原文 15

    NVIDIA garak v0.14.0 发布:JSON 配置支持与报告系统重构

    NVIDIA garak 发布 v0.14.0,新增 JSON 配置文件支持和检测器评测文档及基准结果,并移除 `--generate-autodan` CLI 选项。该版本重新设计了 HTML 报告,修改了 JSONL 报告中 eval 与 digest 条目格式属破坏性变更,同时更新 OpenAI 库到 2.x、加入 Transformers 5 支持并将校准数据更新至 2026 年冬季版。

  25. NVIDIA garak 版本发布 · 收录 · 原文 20

    NVIDIA garak v0.14.1 发布:新增 WebSocket 生成器并移除 nemollm

    NVIDIA garak 发布 v0.14.1,新增面向实时 LLM 安全测试的 WebSocket 生成器和 OpenAI Harmony 音频输入格式,并为攻击成功率加入 Bootstrap 置信区间。该版本激活 sata 与 badchars 探针、补充简历类提示注入样例、改进 Jinja 注入检测,同时移除了废弃的 nemollm 生成器及其依赖,属破坏性变更。

  26. NVIDIA garak 版本发布 · 收录 · 原文 25

    NVIDIA garak v0.15.0 发布:新增多轮 GOAT、Agent breaker 与系统提示提取探针

    NVIDIA garak 发布 v0.15.0,新增多轮 GOAT、Agent breaker 和系统提示提取三类探针,并加入同形异义混淆提示走私检测及 ModernBERT 拒答检测器。该版本还引入 NeMoGuardrails 服务器支持和带推理轨迹的测试生成器,改进 REST 生成器的 mTLS 客户端证书认证并为 Bedrock 生成器增加推理模型支持,同时修复编码检测逻辑翻转等问题。

  27. NVIDIA garak 版本发布 · 收录 · 原文 15

    NVIDIA garak v0.15.1 发布:新增 ProPILE 隐私泄露检测探针

    NVIDIA 的 LLM 漏洞扫描工具 garak 发布 v0.15.1,新增 ProPILE 探针用于 PII 泄露检测,并加入 simonw/llm 库作为生成器支持。garak.analyze.qual_review 现支持 JSON 与文件输出模式。该版本还修复了 OpenAICompatible 中 response.choices 为 None、Hugging Face 文件探针本地路径处理、snowball 检测器 MISP 标签格式错误等问题,并移除已弃用的 maxrecall 评估器。

  28. NVIDIA garak 版本发布 · 收录 · 原文 29

    NVIDIA garak v0.16.0 发布:新增技术与意图标注及初始 IntentProbe

    NVIDIA garak 发布 v0.16.0,引入技术与意图(technique and intent)标注以及首个 IntentProbe 迭代,作为 Context Aware Scanning 的第一步,允许用户在评估目标时带入自有上下文与预期。该版本还新增原生 Anthropic 生成器插件和一个简单自适应攻击探针,并带来破坏性变更:统一的 run.spec 选择语法取代旧的 probe_spec/buff_spec,report.jsonl 增加 probe_summary 条目并调整 digest 结构。

  29. NVIDIA garak 版本发布 · 收录 · 原文 15

    NVIDIA garak v0.17.0 新增 EU AI Act 风险映射

    NVIDIA 的开源 LLM 漏洞扫描器 garak 发布 v0.17.0,新增 EU AI Act 映射,可为探针结果提供参考标签并按该法案中的各类风险分组呈现。同时改进插件层,向 Ollama 转发生成参数并加入认证与自定义客户端配置,另修复多个检测器和探针缺陷,例如 MarkdownExfilContent 缺失说明时的崩溃与除零错误、AgentBreaker 判定结果的 JSON 解析问题以及 NIM 瞬时 HTTP 错误的处理。此版还移除 Python 3.10 支持、改为支持 Python 3.13,并在兼容前锁定 anthropic Python 客户端版本。

  30. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 11

    NVIDIA 用 Nemotron 构建自适应智能体网络安全系统

    NVIDIA 基于 Nemotron 打造自适应智能体网络安全系统,目标是识别现有防线遗漏之处并将缺口转化为改进方向。该系统面向安全运营场景,强调突破既有告警、预设工作流和已知攻击行为的束缚,而非仅将智能体接入传统流程。

已经到底了