NVIDIA garak v0.13.0 发布:新增 Leet 编码攻击插件与对话支持
NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。
开源红队、评测与防护工具。
在这个话题内搜索或按分类筛选NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。
NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。
Google DeepMind 发布了面向学生、研究人员和相关从业者的 AGI 安全短期课程,总时长 75 分钟,由录制讲座和练习组成,并配有幻灯片和练习手册。课程涵盖 AI 对齐问题及技术与治理层面的应对思路,内容包括刻意规划带来的风险、规格博弈与目标错误泛化两种错位目标来源、知情监督原则以及危险能力评估等前沿安全实践。若想进一步参与该方向工作,研究科学家与研究工程师岗位申请开放至 2 月 28 日。
MITRE ATLAS 发布 v5.4.0,新增多项针对 AI Agent 的攻击技术,包括发布被投毒的 AI Agent 工具、从 Agent 逃逸到宿主机、利用漏洞获取凭据、利用漏洞规避防御,以及 AI Agent 用户执行类的被投毒工具与恶意链接。该版本还更新了修改 AI Agent 配置这一既有技术。案例研究方面新增了暴露的 ClawdBot 控制接口导致凭据访问与执行、通过被投毒 ClawdBot 技能实施供应链入侵、OpenClaw 一键远程代码执行,以及通过提示注入对 OpenClaw 实施命令与控制。
推荐理由MITRE ATLAS v5.4.0 新增针对 AI Agent 的攻击技术与真实案例,做 Agent 威胁建模的团队可对照更新自己的攻击面清单。
MITRE ATLAS 发布 v5.5.0 版本,新增多项攻击技术与案例研究。新增技术包括 AI Agent Tool Poisoning、AI Supply Chain Rug Pull。
Mandiant 安全评估发现大量缺乏认证的公网暴露 serverless 应用,Cloud Run 服务若含第三方依赖易遭本地文件包含(LFI)、远程文件包含及命令注入攻击,成功利用可获得容器实例完整控制权并进一步横向移动接管云环境。该博客基于客户实战经验梳理攻击场景,针对必须公网开放的 Google Cloud Run 服务和函数给出一组加固建议,相关原则同样适用于任意公有 serverless 部署。
Google 开源安全团队(GOSST)发布 OSS Rebuild,通过重新执行并比对上游构建来增强开源软件包的信任度。该项目自动推导 PyPI、npm 和 Crates.io 现有软件包的声明式构建定义,并为其中数以千计的流行包签发满足 SLSA Build Level 3 要求的溯源证明,无需维护者介入。它还能检测源码缺失、构建环境遭入侵以及隐蔽后门三类供应链风险,并提供基础设施定义供企业自行运行实例。
Google 隐私、安全与安保团队联合 Airbus 在 DEF CON 33 举办了聚焦人机协作的 GenSec Capture the Flag(CTF)。近 500 名参与者完成了入门挑战,其中 23% 的人首次将 AI 用于网络安全工作流,85% 的参与者认为该活动有助于了解 AI 在安全工作流中的应用方式。活动中还提供实验性的网络安全 AI——Sec-Gemini 作为可选助手,77% 的受访者表示它对自己解决挑战“很有帮助”或“极有帮助”。
AWS 发布实践指南,用 Strands Agents SDK 的生命周期钩子把 Amazon Bedrock Guardrails 从模型边界扩展到工具边界,在三个信任边界设置校验检查点。Checkpoint 1 用 BeforeInvocationEvent 在模型推理或工具执行前校验用户输入、其他 Agent 数据、MCP 工具服务器和 RAG 管道内容;Checkpoint 2 用 BeforeToolCallEvent 在工具执行前检查模型即将传入的参数,这是模型级护栏覆盖不到的缺口;Checkpoint 3 用 AfterToolCallEvent 在结果返回用户或下游系统前校验工具输出,尤其针对抓取外部网页的搜索工具。
推荐理由给出三个校验检查点的完整实现代码,部署 Agent 的团队可据此把护栏从模型边界扩展到工具调用边界。
2026 年 9 月值得关注的开源安全工具包括:Sift 可在本地磁盘、Windows 文件共享、Active Directory、SharePoint、OneDrive、Teams、Slack、Jira 和 Confluence 中扫描密码与 API key;ToolHive 以 Apache 2.0 许可在容器内运行 MCP server;腾讯朱雀实验室的 AI-Infra-Guard 可识别 Ollama、vLLM、ComfyUI 等服务,比对 1,600 多个已知 CVE,并检查 MCP server 与 agent 技能、对目标模型做越狱评估。
GitHub Security Lab 研究员 Kevin Stubbings 在实验室开源 Taskflow Agent 之上构建了面向移动应用的 AI 审计工作流 taskflows,用其发现并报告了 Android 应用中的 20 多个漏洞。
Trail of Bits 发布 gosentry,一个面向模糊测试的 Go 工具链分支,保留标准 testing.F 工作流,底层默认改用 LibAFL 引擎。它支持原生 fuzz struct 等复合类型、通过 Nautilus 做基于语法的模糊测试,并新增整数溢出、数据竞争、goroutine 泄漏和执行超时等缺陷类别的检测,还能用一条命令生成覆盖率报告。已有 Go fuzz harness 无需重写,只需指向 gosentry 的二进制并加上 --catch-races、--catch-leaks 等新参数。
Trail of Bits 与 zizmor 维护者合作三个月,为这款 GitHub Actions 静态分析器补全 YAML 锚点支持,共提交 20 个 issue、15 个合并 PR。团队修复了序列中别名被错误展平、锚点前缀泄漏进值、重复锚点导致崩溃、模板注入审计在别名 run 值上崩溃四类锚点 bug,并新增集成测试与文档更新。验证基于 6,612 个高价值开源仓库的 41,253 个 workflow 文件,其中仅 43 个使用锚点,zizmor 最初在 45 个 workflow 上崩溃。
Trail of Bits 与 OpenAI 的 Daybreak 计划合作推出 Patch the Planet,让工程师借助 GPT-5.5-Cyber 等前沿模型为关键开源项目找漏洞并直接提交补丁。首周覆盖 19 个项目,包括 cURL、NATS、pyca、Sigstore、aiohttp、Go、Python 与 python.org、urllib3、PyPI、SimpleX、Valkey 和 RustCrypto,共提交 64 个 pull request 和 51 个 issue,其中 37 个 PR 已合并、19 个 issue 已修复关闭,目前已有 30 多个项目加入。
Trail of Bits 在 Patch the Planet 项目中让 GPT-5.5-Cyber 通过 Codex 的 /goal 命令为 zlib 构建模糊测试活动,一天内完成了以往需数周的工作。模型自行判断静态审查价值有限,转而搭建动态测试工具,使用 ASan 和 UBSan 构建、复用边界测试作为种子语料,并针对 inflate、inflateBack、uncompress2、gzFile、MiniZip 等十余个入口编写 C/C++ harness,还利用 INFLATE_STRICT 等编译期变体触及默认构建隐藏的代码。其最成功的 harness 在操作系统背压构造的有效 gz* 状态下发现了漏洞。
推荐理由Trail of Bits 记录了 GPT-5.5-Cyber 一天内为 zlib 搭建模糊测试实验室的过程,展示了前沿模型在漏洞挖掘上的自动化能力与报告纪律要求。
Trail of Bits 在与 OpenAI 合作的 Patch the Planet 项目中,借助 Codex 的 /goal 目标式提示功能审计 Rust、curl、zlib 等广泛使用的开源代码库。/goal 从单一变体分析流水线找出其提交的全部 Rust 漏洞,包括已在 Rust 1.98 修补的一个健全性缺陷和一个错误编译问题,并将各项目历史 CVE 转为需在易受影响版本触发、在修补版本静默的 Semgrep 规则,命中 11 处跨项目变体告警,还在一次探测中发现 Keycloak SAML 组件两个潜在高危权限提升漏洞。
Trail of Bits 梳理了 Nitro Enclaves 与 AWS KMS 通信信道的被动与主动攻击类别,并指出即使密码学实现正确,运营风险依然存在。KMS 通过基于 PCR 值的密钥策略和用 enclave 公钥加密响应两种机制限制访问,仅 GenerateDataKey、GenerateDataKeyPair、Decrypt、DeriveSharedSecret、GenerateRandom 支持这些机制,Encrypt 不在其列。文章给出避免被动攻击的检查清单,要求请求始终包含 Recipient 参数、使用加密上下文并正确授权 Encrypt 与 GenDataKey 操作。
Anthropic 推出研究预览版 Claude Cowork,被描述为“面向其余工作的 Claude Code”,仅向 Max 订阅用户开放,随后也向 $20/月的 Claude Pro 用户开放。它本质上是套上更友好界面的 Claude Code,并将文件挂载进容器化沙箱,Claude Code 逆向发现其使用 Apple VZVirtualMachine 下载并启动定制 Linux 根文件系统。作者用它筛选三个月内 46 个草稿文件并执行 44 次站内搜索,同时指出此类功能始终面临提示注入威胁。
Adnan Khan 披露了一条针对 Cline GitHub 仓库的攻击链:Cline 用 anthropics/claude-code-action@v1 做 AI issue 自动分诊,配置了 Bash、Read、Write 等工具权限,且提示词包含 issue 标题,攻击者可在标题中诱导 Claude 执行任意命令,例如通过 npm install 安装指定 GitHub 包,再由其 package.json 的 preinstall 脚本运行代码。
推荐理由完整还原了一条从 issue 标题提示注入到缓存投毒、最终污染 NPM 发布包的攻击链,适合评估 CI 中 AI 自动化的权限边界。
Simon Willison 在旧金山 Pragmatic Summit 的火边对话中分享了对智能体工程的看法,称 Opus 4.5 是他第一个真正建立信任的模型——对于见过它处理过的类问题,他有信心不会出错。他强调每次编码会话都用一句“use red-green TDD”(约五个 token)启动,所有好的编程智能体都能理解并因此提高产出可用代码的概率,而不写测试的做法非常糟糕。他还批评 StrongDM“没人写代码也没人读代码”的原则极不负责任,尤其是作为一家做安全软件的安全公司。