腾讯 AI-Infra-Guard v4.6.4 发布,新增可组合提示注入研究工具包 pikit
腾讯 AI-Infra-Guard 发布 v4.6.4,在 Research/pikit 下新增可组合提示注入研究工具包 pikit。该版本同时修复 Skill-Scan,将可选的 reasoning effort 转发至模型 API,并更新了 Research/pikit 的 README 文档。
腾讯 AI-Infra-Guard 发布 v4.6.4,在 Research/pikit 下新增可组合提示注入研究工具包 pikit。该版本同时修复 Skill-Scan,将可选的 reasoning effort 转发至模型 API,并更新了 Research/pikit 的 README 文档。
腾讯 AI-Infra-Guard 发布 v4.6.3,新增 DeepTeam 在运行期间将完成的测试用例写入磁盘,并修复 API Checker 对 Claude 5 签名的支持。该版本为 API Checker 补充失败指纹样本以提升模型识别可靠性,同时为 Prompt-Eval 加入限流感知退避、熔断器和进程组终止机制,并在熔断器与模型间共享限流计数器、加固 Retry-After 解析。文档方面新增 FORGE-Bench 与 RogueHandoff-20 研究条目并同步至 8 种语言 README。
腾讯 AI-Infra-Guard 发布 v4.6.2,新增面向自主智能体的确定性失控基准 FORGE-Bench(forge_bench)及干净的 RogueHandoff-20 基准,并补充一批 AIG 检测规则。该版将 aig-skill-scan 升级到 0.2.2,减少无证据误报、避免模型工具调用卡死并约束流式中断响应,同时修正判定与公开结果的比对逻辑。Extract-Vuln 模块剥离 CDATA 包装并兼容常见标签别名,另清理了 12 处 YAML 校验失败等问题。
NVIDIA 的开源 LLM 漏洞扫描器 garak 发布 v0.17.0,新增 EU AI Act 映射,可为探针结果提供参考标签并按该法案中的各类风险分组呈现。同时改进插件层,向 Ollama 转发生成参数并加入认证与自定义客户端配置,另修复多个检测器和探针缺陷,例如 MarkdownExfilContent 缺失说明时的崩溃与除零错误、AgentBreaker 判定结果的 JSON 解析问题以及 NIM 瞬时 HTTP 错误的处理。此版还移除 Python 3.10 支持、改为支持 Python 3.13,并在兼容前锁定 anthropic Python 客户端版本。
Microsoft PyRIT v1.1.0 发布,改进评分、扩展扫描器能力并新增多项 CoPyRIT 功能。评分现可为“未确定”状态,读取 score_value 前需检查 score.is_undetermined;部分被拦截回复默认纳入评分,可设 should_score_blocked_content=False 恢复旧行为。扫描器新增 Best-of-N、split-payload、多语言、audio achilles、package hallucination、system-prompt extraction 与 FigStep 能力,并新增 10 个转换器;数据集新增 488 条 TrustAIRLab in-the-wild 越狱模板。
OWASP GenAI Security Project 发布了 2026 版 LLM 应用 Top 10、面向智能体系统的 Agent Control Standard,以及扩充后的 AI Security Solutions Directory,同时其社区成员突破 30,000 人并新增四家赞助商。新版指南由数百位专家参与编写,纳入更新排名、扩大威胁覆盖范围和来自数千起真实事件的调研,并在前 48 小时内下载超过 10,000 次。该标准将既有智能体风险与控制指引延伸至运行时强制执行,目录则提供生成式 AI 安全、智能体安全和 AI 及智能体红队测试等多重视角。
Goodfire Research 提出模型差分放大(model diff amplification,后称 logit diff amplification)方法,通过 logits_amplified = logits_after + α(logits_after – logits_before) 采样下一个 token,放大微调前后模型的差异,从而用更少 rollout 暴露罕见不良行为。在涌现性错位案例中,用不同比例不良医疗建议数据微调 Llama 3.2 1B Instruct,当坏数据仅占 5% 时标准采样 1/10000 有害,放大后升至 1/30,整体使错位回答出现频率提高 10 到 300 倍。
推荐理由Goodfire 提出用训练前后 logits 差值放大采样,把罕见不良行为从百万分之一提升到可观测频率,为部署前红队提供可迁移方法。
MITRE ATLAS 发布 v2026.08 数据版本,包含 1 个矩阵、16 项战术、114 项技术、83 项子技术、39 项缓解措施和 72 个案例研究。ATLAS 是基于真实攻击观测与 AI 红队演示构建的 AI 对抗战术与技术知识库,覆盖针对 AI 系统的攻击、AI 能力滥用以及 AI 实质性促成的有害自主行为。
腾讯 AI-Infra-Guard 发布 v4.6.0,新增 API Checker 模块提供 API 安全审计并集成 Web 代理与统一 CLI 命令,同时加入针对 LLM API 投毒攻击的新检测能力。Agent-Scan(aig-agent-redteam)升级到 v5.0.0,重构变异引擎并将 workflow-attack 合并入 mutation-attack,还完成了 DeepSeek Harness 提示注入评估的研究工作。此外修复了 MCP 客户端迁移至 SDK 2.0、streamable_http_client 头参数兼容等问题,文档中组件表更新且 CVE 计数从 1900+ 升至 2000+。
NVIDIA garak 发布 v0.16.0,引入技术与意图(technique and intent)标注以及首个 IntentProbe 迭代,作为 Context Aware Scanning 的第一步,允许用户在评估目标时带入自有上下文与预期。该版本还新增原生 Anthropic 生成器插件和一个简单自适应攻击探针,并带来破坏性变更:统一的 run.spec 选择语法取代旧的 probe_spec/buff_spec,report.jsonl 增加 probe_summary 条目并调整 digest 结构。
腾讯 AI-Infra-Guard 发布 v4.5.1,PromptSecurity 新增 Many-Shot、PAIR、GOAT 和 ActorAttack 多轮越狱攻击。Agent-Scan 新增 5 项 OWASP 检测技能(含 agentic-supply-chain、cascading-failure、human-agent-trust、inter-agent-comm、unexpected-code-execution)及 web-exfiltration-detection 技能,MCP-Scan 新增硬编码密钥、不安全反序列化等 4 条 MCP 安全检测规则,并更新 AIG 规则至 2026-07-24。
Microsoft PyRIT 发布 v1.0.1 补丁,修复 OpenAI Responses 与 Chat Completions 返回结构化拒答时被误判为解析/运行时失败的问题。此前目标模型的拒答会导致攻击目标未完成并抛出误导性的 ValueError,现在拒答会被正常记录和评分,真正的部分执行则抛出 ScenarioPartialFailureException。使用 OpenAIResponseTarget 或 OpenAIChatTarget 对接近期 OpenAI 与 Azure OpenAI 模型的用户应升级;该版本还调整了推理模型响应片段顺序,将 reasoning 排在 text 之后。
Microsoft PyRIT 发布 v1.0.0,确立场景、攻击技术、执行器、注册表、标识符与记忆的 v1 架构,并包含有意的破坏性变更。场景策略更名为 techniques,组件构建统一走 BuildableRegistry,PromptConverter 改为 Converter,会话状态从 MessagePiece 迁至新的 Conversation 模型,0.15 及此前弃用的兼容层被移除。
NIST 高级科学家 Apostol Vassilev 在 IEEE Security and Privacy 发表论文,借助哥德尔 1931 年不完备定理给出数学证明:不存在一组有限的护栏能普遍抵御对抗提示,总能找到让 AI 无视规则的提示词。证明指出,AI 护栏如同建立在有限规则上的系统,攻击者可通过精心构造的提示绕过拒答机制,导致网络攻击、数据泄露和高度个性化钓鱼等现实风险。Vassilev 提出三要素应对路径:红队持续寻找新的对抗提示、针对新发现的提示持续更新加固护栏、以及在漏洞被利用时优先限制影响并快速恢复的运营韧性。他表示目标不是彻底解决问题,而是让攻击者寻找新漏洞的成本超过其资源,形成对攻击者经济上不可行的新平衡。论文题为 Robust AI Security and Alignment: A Sisyphean Endeavor?
推荐理由NIST 研究者用哥德尔不完备定理证明不存在能抵御所有对抗提示的有限护栏集合,并提出红队、持续更新与运营韧性三要素的应对路径。
Microsoft PyRIT 发布 v0.14.0,将 Message、Score、Seed 类及 Identifier 等核心模型迁移到 Pydantic v2,构造改为仅限关键字参数并拒绝额外字段,同时强制所有异步函数加 `_async` 后缀并重命名部分辅助函数。该版本移除此前标记弃用的全部功能,GCG 转为实验特性并提供新的公开 API,新增 Round Robin Target、Realtime 流式会话与服务端打断攻击以及图像转换器,还加入 VLGuard、StrongREJECT、Agent Threat Rules 等多个数据集加载器和 Python 3.14 支持,并修复 38+ 个依赖项漏洞及特定 CVE。
NVIDIA 的 LLM 漏洞扫描工具 garak 发布 v0.15.1,新增 ProPILE 探针用于 PII 泄露检测,并加入 simonw/llm 库作为生成器支持。garak.analyze.qual_review 现支持 JSON 与文件输出模式。该版本还修复了 OpenAICompatible 中 response.choices 为 None、Hugging Face 文件探针本地路径处理、snowball 检测器 MISP 标签格式错误等问题,并移除已弃用的 maxrecall 评估器。
Gemini Spark 将持久化智能体引入 Gemini App,Google Bug Hunters 发文说明针对这一新范式的安全测试方法与高影响力漏洞的关注重点。
MITRE ATLAS 从本次发布开始将知识库内容与数据格式分开管理版本:月度内容更新改用 YYYY.MM.N 方案并把版本存入 Collection 对象,格式变更则沿用语义化版本。此次内容版 v2026.05 给所有技术条目补充了一个或多个运行平台字段(预测式 AI、生成式 AI、智能体 AI、企业);同时推出的格式 v6.0.0 新增 ATLAS YAML 结构,提供 Pydantic schema 校验、SQLAlchemy ORM 持久化和 FastAPI REST API,并将历史版本迁移保存于 dist/legacy/ 与 dist/v6/。
NVIDIA AI Red Team 提出用语法约束解码改进小语言模型的 Bash 命令生成,并将命令生成列为研究目标。Bash 是暴露给 AI 智能体的最灵活接口之一,模型输出的命令是可执行动作,能够读取文件、修改工作区、打开网络连接并串联工具。
MITRE ATLAS 发布 v5.6.0,新增三项攻击技术:获取公开 AI 制品下的 AI Agent 配置搜索、搜索开放网站/域名下的代码仓库,以及钓鱼下的 Deepfake 辅助钓鱼。同时更新了钓鱼、LLM 越狱与缓解措施,涉及用户培训、Deepfake 检测,并更新了 OpenClaw 通过提示注入实现命令与控制等案例研究。
NVIDIA garak 发布 v0.15.0,新增多轮 GOAT、Agent breaker 和系统提示提取三类探针,并加入同形异义混淆提示走私检测及 ModernBERT 拒答检测器。该版本还引入 NeMoGuardrails 服务器支持和带推理轨迹的测试生成器,改进 REST 生成器的 mTLS 客户端证书认证并为 Bedrock 生成器增加推理模型支持,同时修复编码检测逻辑翻转等问题。
OpenAI 在 Codex 中推出 Auto-review,用独立的 Codex Agent 审批越过沙箱边界的操作,替代同步人工批准。
推荐理由OpenAI 公开了 Codex Auto-review 的内部部署数据与安全评测结果,并说明其无法防范模型谋划的边界。
Microsoft PyRIT 发布 v0.13.0,将 TargetCapabilities 替换为 TargetConfiguration,并引入新的 AttackTechnique 抽象来标准化攻击参数的声明与消费方式,同时移除多个弃用功能,属破坏性更新。该版本还新增 TargetRequirements、AttackTechniqueRegistry,并为 OpenAIChatTarget 默认启用图像输入,加入 VisualLeakBench 数据集加载器及符合 ISO 42001 的危害定义。
NVIDIA garak 发布 v0.14.1,新增面向实时 LLM 安全测试的 WebSocket 生成器和 OpenAI Harmony 音频输入格式,并为攻击成功率加入 Bootstrap 置信区间。该版本激活 sata 与 badchars 探针、补充简历类提示注入样例、改进 Jinja 注入检测,同时移除了废弃的 nemollm 生成器及其依赖,属破坏性变更。
Google 通过持续发现新攻击、扩充漏洞目录并迭代防御,缓解 Workspace with Gemini 面临的间接提示注入(IPI)威胁。其手段包括人工红队测试、自动化红队测试、Google AI 漏洞奖励计划(VRP)和公开攻击情报收集,并用 Simula 生成合成数据,使合成数据生成量提升 75%。
Google 漏洞奖励计划(VRP)2025 年迎来 15 周年,向全球 700 多名研究者发放超 1700 万美元奖金,创历史新高,较 2024 年增长逾 40%。
Microsoft 发布 AI 红队测试工具 PyRIT v0.12.0,首次让 GUI(CoPyRIT)、CLI 和框架三种交互方式全部达到可用状态。CLI 新增 Scam、Leakage、Psychosocial、Jailbreak 四类 AIRT 场景及 RedTeamAgent Foundry 预配置红队测试,覆盖 25+ 攻击策略。框架引入 YAML 配置系统、TargetRegistry 和 8 个新数据集加载器,但含破坏性变更需按迁移指南升级。
OWASP GenAI Security Project 发布了面向 LLM 与智能体安全的更新版全景指南及配套资源,并公布其在 RSA 2026 期间的一周活动安排。该项目的《Q2 2026 Updated Landscape Guide for LLM and Agentic Security》新增供应商与工具体系文档以及智能体红队测试分类体系,覆盖开发、测试、部署与治理全生命周期。同期发布的还有自主与智能体 AI 系统风险清单、Secure MCP Server Development 指南、SBOM/AIBOM Generator 开源工具以及 AI 红队服务商评估标准。
Microsoft PyRIT 发布 v0.11.0,破坏性变更将攻击与执行器从 SeedPromptGroup 改为基于 Message 运行,并重命名场景配置 API。该版本新增 WebSocketCopilotTarget,可通过 WebSocket 向 Microsoft Copilot 发送提示词执行,同时加入图像下载支持的 ImageTarget 重构及 OpenAIImageTarget 的图像编辑/混合功能。
NVIDIA garak 发布 v0.14.0,新增 JSON 配置文件支持和检测器评测文档及基准结果,并移除 `--generate-autodan` CLI 选项。该版本重新设计了 HTML 报告,修改了 JSONL 报告中 eval 与 digest 条目格式属破坏性变更,同时更新 OpenAI 库到 2.x、加入 Transformers 5 支持并将校准数据更新至 2026 年冬季版。
NVIDIA 技术博客发布《为视觉语言模型更新分类器规避》,围绕视觉语言模型(VLM)的分类器规避方法更新展开。文中指出,Transformer 多模态模型能在同一上下文中处理多种数据形式,VLM 可基于图像与文本的组合输入生成输出,让开发者构建解读图表、处理摄像头画面,或通过桌面等传统人类界面操作的系统。
Microsoft 开源红队工具 PyRIT 发布 v0.10.0,对包内大部分代码做了重写,把 Orchestrator 统一改名为 Attack,并新增 pyrit_scan 命令行与 pyrit_shell 交互式 shell,为自动化红队提供基础。
NVIDIA garak 发布 v0.13.3,新增检测 API Key 泄露的探针及配套检测器和零宽坏字符注入探针,并加入 AWS Bedrock 生成器。该版本还改进 unreal pkghallu 目标覆盖、令 OpenAICompatible 类默认单次生成一条回复,并为生成器启用一致的 PRNG 访问。此外引入延迟加载与依赖裁剪、AVID 报告导出中 metadata 与 vuln_id 处理的多项修复。
NVIDIA garak 发布 v0.13.2,新增迭代式探针基类与 FITD 探针,并加入 any 检测器。该版本修复了 MustRefuteClaimModel 目标类错误、TAP/PAIR 探针的 NameError、Win11 探针仍使用 Windows 10 产品名等问题,同时限制 langchain 版本、改进提示词翻译支持并新增运行加速文档。
NVIDIA AI 红队(AIRT)基于多年来对多种 AI 系统在生产部署前的安全评估,总结出若干 LLM 应用中的常见漏洞与安全隐患,指出若在开发阶段加以处理可显著提升基于 LLM 应用的安全性。
NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。
AI 智能体自主性增强,AI 应用正带来传统安全模型无法完全覆盖的新攻击面。应对原则是 Assume prompt injection,即假设提示注入已经发生,但把它转化为有效防御并不简单。AI Kill Chain 框架被用来建模这类攻击,Cyber Kill Chain 则定义了攻击者如何运作。
NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。
多模态 AI 模型正从感知走向推理、甚至开始自主行动,随之出现新的攻击面:这些威胁不只针对输入输出,而是利用 AI 跨模态处理、综合与推理的方式。NVIDIA AI Red Team 会在攻击者之前发现并测试这类漏洞,此前已开展语义提示注入(semantic prompt injection)研究。
腾讯玄武实验室在 Black Hat US 2025 发布研究,提出一种将触发器与载荷解耦的提示词注入新范式,用同一组优化 Token 序列即可控制模型精确输出攻击者指定内容。作者用贪婪坐标梯度(GCG)方法在包含上万条样本的对抗数据集上训练触发器前缀与后缀,在 Qwen-2、Llama-3.1、Devstral-Small 等开源模型上经约 200-500 次迭代后平均攻击成功率约 70%。演示案例中,攻击者通过嵌入触发器的恶意邮件让 Open Interpreter 执行命令,或通过更新第三方 MCP 工具描述使 Cline 跳过自动批准直接执行 shell 命令。
推荐理由展示了触发器与载荷解耦的通用提示注入方法,并给出在 Cline 与 Open Interpreter 上的实际攻击链,可供部署智能体的团队评估工具审批与沙箱策略。