跳到正文

#提示注入

今天还没有收录新动态
10月1日周四
  1. Jev Gateway Study(GitHub) · 82

    Jev 与开源决策模型的提示注入检测器基准测试

    该基准在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 和关键词规则在文档块注入与用户消息越狱两类任务上的表现。文档块测试中 Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%,Kev-4B 为 0.90 和 70%,Prompt Guard 2 为 0.83 和 19%;对不直接提及 AI 的隐蔽攻击,Jev 召回 97%,Kev-4B 62%,三个专用注入分类器接近随机水平。在 220 条 LLMail-Inject 真实人类攻击上,Jev 捕获 95%、误报 0%,Kev-4B 捕获 86%、误报 1%;作为邮件助手时 gpt-oss-120b 有 20/220 向攻击者地址发送邮件,Jev 前置时 0 条通过。

    推荐理由这份评测把提示注入检测器放到网关真实任务上横向对比,并给出端到端攻击成功率,可用来判断各检测器的实际拦截差距。

  2. Google DeepMind · 60

    Google DeepMind 发布 Gemini 4 Argon,先向可信网络防御者开放

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon 面向长周期复杂工作流,输出 token 上限从 64K 提升到 1M,在 DeepSWE v1.1 上取得 77.9%,在 LVBench 长视频理解上取得 91.7%,在 Zapier 的 AutomationBench 上以 51.3% 排名第一。

    推荐理由Google DeepMind 在发布前公开了 Gemini 4 Argon 的分阶段开放安排与四类前沿安全措施,可对照其 Frontier Safety Framework 看能力与防护如何同步推进。

9月15日周二
  1. MITRE ATLAS 数据发布 ·

    MITRE ATLAS 发布 v2026.09 数据更新,新增多项 Agent 与多模态攻击技术

    MITRE ATLAS 发布 v2026.09 数据版本,包含 1 个矩阵、16 项战术、120 项技术、88 项子技术、40 项缓解措施和 73 个案例研究。新增技术涵盖多模态输入中的触发器、AI Agent 响应偏置、伪造 AI 助手链接、配置错误或公开暴露的 AI 服务、发现 AI Agent 运行时能力、AI 定向隐蔽以及针对 AI 基础设施的主动扫描等。更新了 LLM 提示混淆、间接 LLM 提示注入、LLM 越狱、LLM 响应渲染和 AI Agent 点击诱饵等技术。缓解措施新增 AI 蜜罐,更新生成式 AI 护栏。

9月8日周二
  1. Google Threat Intelligence(GTIG) · 71

    GTIG 报告:攻击者转向智能体 AI,六小时内完成大规模凭据窃取

    Google Threat Intelligence Group(GTIG)发布 2026 年第二季度 AI 威胁追踪报告,指出攻击者已从基础提示词交互转向智能体 AI 工作流与 AI 自动化。报告称,2026 年第二季度 GTIG 观察到威胁行为者先攻陷云资源,随后在不到六小时内规划、构建并执行了一次由智能体驱动的大规模凭据窃取行动,压缩了防御方的响应窗口。

    推荐理由报告以 Mandiant 一线响应数据呈现攻击者从提示词走向智能体自动化的具体案例,可对照自身 AI 资产与供应链暴露面。

8月26日周三
  1. 腾讯 AI-Infra-Guard 版本发布 ·

    腾讯 AI-Infra-Guard v4.6.0 发布:新增 API Checker 与 LLM API 投毒检测

    腾讯 AI-Infra-Guard 发布 v4.6.0,新增 API Checker 模块提供 API 安全审计并集成 Web 代理与统一 CLI 命令,同时加入针对 LLM API 投毒攻击的新检测能力。Agent-Scan(aig-agent-redteam)升级到 v5.0.0,重构变异引擎并将 workflow-attack 合并入 mutation-attack,还完成了 DeepSeek Harness 提示注入评估的研究工作。此外修复了 MCP 客户端迁移至 SDK 2.0、streamable_http_client 头参数兼容等问题,文档中组件表更新且 CVE 计数从 1900+ 升至 2000+。

8月17日周一
  1. 腾讯 AI-Infra-Guard 版本发布 ·

    腾讯 AI-Infra-Guard v4.5.2 发布:新增 SkillJack 项目并修复 mcp-scan 提示注入致 RCE

    腾讯 AI-Infra-Guard 发布 v4.5.2,新增 SkillJack 项目和一批 AIG 检测规则,并为 Qdrant、Chroma、Weaviate 补充仅 GET 指纹识别。该版修复了 mcp-scan 动态扫描模式下经提示注入触发的远程代码执行问题,同时修补 skill-scan 字符集内容走私及隐藏编译字节码两处缺陷,并将 aig-agent-redteam 变异引擎重构到 v5.0.0、合并工作流攻击与变异攻击流程。

7月16日周四
  1. Google Threat Intelligence(GTIG) ·

    Google 详解 AI 辅助漏洞管理:从确定性管控到 ZDR 的操作蓝图

    Google Threat Intelligence 旗下 Mandiant Consulting 发文,针对企业将 LLM 智能体接入 CI/CD 做自动化漏洞挖掘与修复的场景,给出一套操作护栏建议。文中援引 Mandiant M-Trends 2026 报告称平均利用时间(TTE)已降至 -7 天,并强调应把代码库视为不可信输入以防源码注释中的间接提示注入,同时落实云服务商的零数据留存(ZDR)、工作负载隔离与人主导的红队测试。

7月1日周三
  1. MITRE ATLAS 数据发布 ·

    MITRE ATLAS 发布 v2026.06,新增窃取 Web 会话 Cookie 技术与多起 AI 攻击案例

    MITRE ATLAS 发布 v2026.06 数据更新,新增“窃取 Web 会话 Cookie”和“使用替代认证材料:Web 会话 Cookie”两项技术,并更新了 AI 服务 Web 界面相关条目。现有技术 LLM Jailbreak 与缓解措施 Generative AI Guardrails、Generative AI Guidelines、AI Telemetry Logging 也得到更新。

6月25日周四
  1. Google DeepMind ·

    Gemini 3.5 Flash 内置计算机操作能力

    Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。该能力使开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境看、推理并执行操作的智能体,面向持续软件测试等长周期与企业自动化任务。针对实时环境中的提示注入风险,Gemini 3.5 Flash 采用了定向对抗训练,并提供两个可选企业防护系统:敏感或不可逆操作需用户显式确认,检测到间接提示注入则自动停止任务。

6月6日周六
  1. Microsoft PyRIT 版本发布 ·

    Microsoft PyRIT v0.14.0 发布

    Microsoft PyRIT 发布 v0.14.0,将 Message、Score、Seed 类及 Identifier 等核心模型迁移到 Pydantic v2,构造改为仅限关键字参数并拒绝额外字段,同时强制所有异步函数加 `_async` 后缀并重命名部分辅助函数。该版本移除此前标记弃用的全部功能,GCG 转为实验特性并提供新的公开 API,新增 Round Robin Target、Realtime 流式会话与服务端打断攻击以及图像转换器,还加入 VLGuard、StrongREJECT、Agent Threat Rules 等多个数据集加载器和 Python 3.14 支持,并修复 38+ 个依赖项漏洞及特定 CVE。

5月14日周四
  1. OWASP GenAI Security Project · 71

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

5月4日周一
  1. MITRE ATLAS 数据发布 ·

    MITRE ATLAS v5.6.0 更新:新增 AI 智能体配置搜索等攻击技术

    MITRE ATLAS 发布 v5.6.0,新增三项攻击技术:获取公开 AI 制品下的 AI Agent 配置搜索、搜索开放网站/域名下的代码仓库,以及钓鱼下的 Deepfake 辅助钓鱼。同时更新了钓鱼、LLM 越狱与缓解措施,涉及用户培训、Deepfake 检测,并更新了 OpenClaw 通过提示注入实现命令与控制等案例研究。

5月2日周六
  1. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.15.0 发布:新增多轮 GOAT、Agent breaker 与系统提示提取探针

    NVIDIA garak 发布 v0.15.0,新增多轮 GOAT、Agent breaker 和系统提示提取三类探针,并加入同形异义混淆提示走私检测及 ModernBERT 拒答检测器。该版本还引入 NeMoGuardrails 服务器支持和带推理轨迹的测试生成器,改进 REST 生成器的 mTLS 客户端证书认证并为 Bedrock 生成器增加推理模型支持,同时修复编码检测逻辑翻转等问题。

4月24日周五
  1. Google Security Blog · 74

    Google 扫描公开网页:间接提示注入的真实分布与增长趋势

    Google 威胁情报团队扫描 Common Crawl 的公开网页,发现真实存在的间接提示注入(IPI)尝试,多数属于无害恶作剧、帮助性引导、SEO 操纵和劝阻 AI 抓取,少数涉及数据窃取和破坏。

    推荐理由Google 对 Common Crawl 全网扫描,给出间接提示注入在真实网页中的分类分布与增长数据,可了解当前攻击成熟度。

4月21日周二
4月18日周六
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体

    NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。

4月15日周三
  1. OWASP GenAI Security Project ·

    OWASP 上线 FinBot CTF,用模拟金融多智能体平台演练 Agentic 安全风险

    OWASP GenAI Security Project 的 Agentic Security Initiative 正式上线 FinBot CTF,这是一个围绕模拟金融服务应用构建的交互式 Agentic 安全 CTF,被定位为“Agentic AI 的 Juice Shop”。FinBot 模拟一个多智能体供应商管理平台,包含自主入驻、欺诈检测、发票处理和通信等由 LLM 驱动并拥有真实工具访问权限的流程。

4月3日周五
  1. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.14.1 发布:新增 WebSocket 生成器并移除 nemollm

    NVIDIA garak 发布 v0.14.1,新增面向实时 LLM 安全测试的 WebSocket 生成器和 OpenAI Harmony 音频输入格式,并为攻击成功率加入 Bootstrap 置信区间。该版本激活 sata 与 badchars 探针、补充简历类提示注入样例、改进 Jinja 注入检测,同时移除了废弃的 nemollm 生成器及其依赖,属破坏性变更。

3月31日周二
  1. MITRE ATLAS 数据发布 · 65

    MITRE ATLAS 发布 v5.4.0,新增 AI Agent 攻击技术与案例研究

    MITRE ATLAS 发布 v5.4.0,新增多项针对 AI Agent 的攻击技术,包括发布被投毒的 AI Agent 工具、从 Agent 逃逸到宿主机、利用漏洞获取凭据、利用漏洞规避防御,以及 AI Agent 用户执行类的被投毒工具与恶意链接。该版本还更新了修改 AI Agent 配置这一既有技术。案例研究方面新增了暴露的 ClawdBot 控制接口导致凭据访问与执行、通过被投毒 ClawdBot 技能实施供应链入侵、OpenClaw 一键远程代码执行,以及通过提示注入对 OpenClaw 实施命令与控制。

    推荐理由MITRE ATLAS v5.4.0 新增针对 AI Agent 的攻击技术与真实案例,做 Agent 威胁建模的团队可对照更新自己的攻击面清单。

3月28日周六
  1. Microsoft PyRIT 版本发布 ·

    Microsoft PyRIT v0.12.0 发布:GUI、CLI 与框架三种交互方式全部可用

    Microsoft 发布 AI 红队测试工具 PyRIT v0.12.0,首次让 GUI(CoPyRIT)、CLI 和框架三种交互方式全部达到可用状态。CLI 新增 Scam、Leakage、Psychosocial、Jailbreak 四类 AIRT 场景及 RedTeamAgent Foundry 预配置红队测试,覆盖 25+ 攻击策略。框架引入 YAML 配置系统、TargetRegistry 和 8 个新数据集加载器,但含破坏性变更需按迁移指南升级。

2月2日周一
  1. 腾讯玄武实验室 · 71

    腾讯玄武实验室发布 AI 网络爬虫安全白皮书并开源 SEChrome 防护方案

    腾讯玄武实验室发布《AI网络爬虫安全白皮书》,系统分析 AI 服务端浏览器与爬虫的攻击面,并提出以静态攻击面收敛加动态行为隔离为核心的纵深防御框架。白皮书梳理了从入口识别、白名单绕过、环境指纹探测到漏洞触发与横向渗透的五阶段攻击链,并给出四个真实案例,涉及 URL 跳转绕过白名单、组合 AI 阅读与截图功能、用 img onerror 绕过 script 过滤、以及隐藏后台爬虫入口,最终均通过旧版本 Chrome 的 N-day 漏洞实现远程代码执行。作者称相关产品服务端用户规模累计超 10 亿。防御侧建议关闭 WebGL、WebRTC、PDF 插件等无用模块,避免使用 --no-sandbox,并做网络、文件系统与实例隔离。

    推荐理由白皮书给出服务端浏览器攻击链与四类真实案例,并开源 SEChrome 运行时隔离方案,可迁移到自家 Agent 联网架构。

12月11日周四
12月9日周二
  1. Google Security Blog · 71

    Chrome 公布智能体能力的分层安全架构

    Chrome 安全团队公布了针对 Gemini 智能体浏览能力的分层防御设计,核心应对威胁是间接提示注入。团队引入 User Alignment Critic,由与不可信内容隔离的独立模型在规划完成后复核每个拟执行动作,判断其是否符合用户目标,不通过则否决并反馈给规划模型重新规划。Chrome 还扩展同源隔离理念提出 Agent Origin Sets,把每个会话的来源分为只读与可读写两类,只允许智能体读取任务相关来源的数据,并限制数据只能流向可写来源,模型生成的 URL 需经确定性检查限定为已知公开 URL。

    推荐理由Chrome 安全团队公开了智能体浏览的分层防御架构,包括独立审查模型与来源集合限制,可供做浏览器智能体的团队参考。

9月12日周五
9月2日周二
  1. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.13.0 发布:新增 Leet 编码攻击插件与对话支持

    NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。

8月6日周三
  1. 腾讯玄武实验室 · 81

    腾讯玄武实验室在 Black Hat 2025 披露劫持智能体实现 RCE 的通用触发器注入方法

    腾讯玄武实验室在 Black Hat US 2025 发布研究,提出一种将触发器与载荷解耦的提示词注入新范式,用同一组优化 Token 序列即可控制模型精确输出攻击者指定内容。作者用贪婪坐标梯度(GCG)方法在包含上万条样本的对抗数据集上训练触发器前缀与后缀,在 Qwen-2、Llama-3.1、Devstral-Small 等开源模型上经约 200-500 次迭代后平均攻击成功率约 70%。演示案例中,攻击者通过嵌入触发器的恶意邮件让 Open Interpreter 执行命令,或通过更新第三方 MCP 工具描述使 Cline 跳过自动批准直接执行 shell 命令。

    推荐理由展示了触发器与载荷解耦的通用提示注入方法,并给出在 Cline 与 Open Interpreter 上的实际攻击链,可供部署智能体的团队评估工具审批与沙箱策略。

8月1日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    保障智能体 AI 安全:语义提示注入如何绕过 AI 护栏

    语义提示注入能够绕过 AI 护栏,成为智能体 AI 面临的新安全威胁。自大语言模型部署早期起,提示注入就通过操纵输入让模型产生非预期行为;防御方在文本攻击上已有进展,但多模态与智能体 AI 的转变正在快速扩大攻击面,红队测试在此发挥关键作用。

7月18日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    如何用 NVIDIA Safety Recipe 保护智能体式 AI 系统

    NVIDIA Safety Recipe 用于防护具备自主行动、工具调用与推理能力的 LLM 智能体系统。这类系统的自主性会放大目标错位、提示注入、非预期行为以及人类监督减少等风险。企业正因灵活性与低推理成本加速采用智能体系统,因此引入稳健的安全措施变得至关重要。

7月15日周二
  1. OWASP GenAI Security Project ·

    OWASP GenAI 安全项目发布 2025 年 Q2 生成式 AI 事件与漏洞利用汇总

    OWASP GenAI 安全项目汇总了 2025 年 3 月至 6 月的 14 起生成式 AI 事件与漏洞利用。其中包括 GPT-4.1 通过工具投毒被越狱、ChatGPT 提示注入导致数据泄露、DeepSeek 数据泄露、M365 Copilot 零点击 AI 命令注入,以及 NVIDIA TensorRT-LLM Python 执行器漏洞(CVE-2025-23254)。另有一批深度伪造语音诈骗、AI 生成音乐侵权和 AI 驱动的凭证填充等攻击被记录在案。

已经到底了