跳到正文

提示注入

今天新收录 6 条(含旧文)

第 7 页更新的内容回到最新

10月1日周四
  1. Adversa AI · 收录 · 原文 53

    Adversa AI 披露 Cryptographic Context Injection 攻击:Grok 零点击泄露聊天记录,Gemini 被绕过安全策略

    Adversa AI 公开了一种名为 Cryptographic Context Injection 的攻击手法,把恶意指令封装成 AES-256-GCM 密文并诱导模型在自己的代码执行沙箱中解密,使解密后的指令以运行时输出的形式进入可信上下文,从而绕过静态护栏。在 xAI Grok 网页版聊天中,用户只需发出普通的“总结这个页面”请求,页面内嵌的加密 JSON 就会让 Agent 调用其联网导航工具,把用户名、粗略位置、订阅等级和整段对话历史拼进 URL 参数发往攻击者服务器,全程无点击、无确认、无警告。

    推荐理由Adversa AI 公开了一种把恶意指令藏进 AES 密文、借模型自身代码运行时解密的新型注入手法,并给出 Grok 零点击窃取聊天记录与 Gemini 绕过安全策略的复现结果。

  2. OWASP GenAI Security Project · 收录 · 原文 21

    OWASP GenAI 安全项目发布 2025 年 Q2 生成式 AI 事件与漏洞利用汇总

    OWASP GenAI 安全项目汇总了 2025 年 3 月至 6 月的 14 起生成式 AI 事件与漏洞利用。其中包括 GPT-4.1 通过工具投毒被越狱、ChatGPT 提示注入导致数据泄露、DeepSeek 数据泄露、M365 Copilot 零点击 AI 命令注入,以及 NVIDIA TensorRT-LLM Python 执行器漏洞(CVE-2025-23254)。另有一批深度伪造语音诈骗、AI 生成音乐侵权和 AI 驱动的凭证填充等攻击被记录在案。

  3. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 14

    如何用 NVIDIA Safety Recipe 保护智能体式 AI 系统

    NVIDIA Safety Recipe 用于防护具备自主行动、工具调用与推理能力的 LLM 智能体系统。这类系统的自主性会放大目标错位、提示注入、非预期行为以及人类监督减少等风险。企业正因灵活性与低推理成本加速采用智能体系统,因此引入稳健的安全措施变得至关重要。

  4. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 21

    保障智能体 AI 安全:语义提示注入如何绕过 AI 护栏

    语义提示注入能够绕过 AI 护栏,成为智能体 AI 面临的新安全威胁。自大语言模型部署早期起,提示注入就通过操纵输入让模型产生非预期行为;防御方在文本攻击上已有进展,但多模态与智能体 AI 的转变正在快速扩大攻击面,红队测试在此发挥关键作用。

  5. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 27

    如何用 AI Kill Chain 框架建模针对 AI 应用的攻击

    AI 智能体自主性增强,AI 应用正带来传统安全模型无法完全覆盖的新攻击面。应对原则是 Assume prompt injection,即假设提示注入已经发生,但把它转化为有效防御并不简单。AI Kill Chain 框架被用来建模这类攻击,Cyber Kill Chain 则定义了攻击者如何运作。

  6. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体

    NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。

  7. Hugging Face Daily Papers · 收录 · 原文 论文57

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    论文在字节完全相同、仅 token id 不同的条件下对比聊天模板注入,发现把伪造角色标记编码为普通子词后,Llama-3.1、GLM-4.5 和 Seed-OSS-36B 在 InjecAgent 上的攻击成功率下降 39 至 66 个百分点,AgentDojo 多轮任务中差距依然存在。作者用 Matched 对照控制额外 token 数量,确认差距来自保留 token 的学习向量而非标记文本;在 Llama-3.1 上,嵌入空间最近的普通 token 向量可完全恢复攻击。指令微调会加强模型对保留标记的偏好,抑制 Qwen3-8B 的推理块会把直接危害上的差距从 8.1 扩大到 49.8 个百分点。

    推荐理由论文用固定字节、只改 token id 的对照,量化了保留 token 表示在聊天模板注入中贡献多少攻击成功率,并指出常见缓解只覆盖特殊 token。

  8. Hugging Face Daily Papers · 收录 · 原文 42

    研究:自然语言自编码器中如何挑选最具信息量的 token 位置

    论文研究在自然语言自编码器解释模型内部激活时,审计者应检查哪些 token 位置,基于提示注入与隐瞒场景下的 470 万条解释展开分析。作者比较了来自模型计算的信号与仅用聊天结构训练的排序器,发现聊天结构通常能选出更相关的解释,且位置选择无需模型前向传播。在四个数据集中的三个上,只解释 5% 的位置即可保留解释全部位置时接近全部的成功率,这里的成功指获得关于威胁的解释,收益随审计任务不同而变化。研究还显示,预训练 verbalizer 无需额外训练即可恢复模型通过微调学会隐瞒的词语,说明有用的解释可以超出 verbalizer 原本被训练描述的模型范围。

  9. 腾讯玄武实验室 · 收录 · 原文 57

    腾讯玄武实验室在 Black Hat 2025 披露劫持智能体实现 RCE 的通用触发器注入方法

    腾讯玄武实验室在 Black Hat US 2025 发布研究,提出一种将触发器与载荷解耦的提示词注入新范式,用同一组优化 Token 序列即可控制模型精确输出攻击者指定内容。作者用贪婪坐标梯度(GCG)方法在包含上万条样本的对抗数据集上训练触发器前缀与后缀,在 Qwen-2、Llama-3.1、Devstral-Small 等开源模型上经约 200-500 次迭代后平均攻击成功率约 70%。演示案例中,攻击者通过嵌入触发器的恶意邮件让 Open Interpreter 执行命令,或通过更新第三方 MCP 工具描述使 Cline 跳过自动批准直接执行 shell 命令。

    推荐理由展示了触发器与载荷解耦的通用提示注入方法,并给出在 Cline 与 Open Interpreter 上的实际攻击链,可供部署智能体的团队评估工具审批与沙箱策略。

  10. SPY Lab · 收录 · 原文 43

    ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击

    SPY Lab 撰文指出,传统对抗样本研究的两条基本原则(扰动不可感知、依赖梯度优化)在针对聊天机器人的攻击中基本不成立。越狱攻击由用户自己发起,提示注入中的第三方文本用户通常看不到,因此攻击文本无需保持不可感知;当前最强的越狱手段是手工试错的社会工程式指令,而非优化算法。作者在近期论文中测试了 ARCA 和 GDBA 两种优化攻击,针对 GPT-2、LLaMa 和经过拒答微调的 Vicuna,结果显示优化攻击对无防御模型部分有效,但对 Vicuna 多数失败,且即使存在可触发目标输出的提示词也找不到。

  11. Nicholas Carlini Writing · 收录 · 原文 31

    Little Bobby —— GPT-4 中的新型指令注入漏洞

    Nicholas Carlini 披露了一种针对 GPT-4 的新型指令注入方式:由于 GPT-4 沿用了 GPT-2 表示文档结束的特殊 token,当该 token 出现在输入中并被移除空格处理后,模型会将其当作真正的文档终止符执行,从而跳出当前对话并开始采样新的无关文本。这种手法类似空字符串注入,可用于将不可信的用户数据插入聊天机器人提示词的场景。作者于 7 月 18 日向 OpenAI 报告此问题,对方称并不担心其会被真正利用。

  12. Google DeepMind · 收录 · 原文 26

    Gemini 3.5 Flash 内置计算机操作能力

    Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。该能力使开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境看、推理并执行操作的智能体,面向持续软件测试等长周期与企业自动化任务。针对实时环境中的提示注入风险,Gemini 3.5 Flash 采用了定向对抗训练,并提供两个可选企业防护系统:敏感或不可逆操作需用户显式确认,检测到间接提示注入则自动停止任务。

  13. Embrace The Red · 收录 · 原文 56

    研究者用提示注入把 ChatGPT 变成可远程控制的 ZombAI 节点

    安全研究者 Johann Rehberger 在 Black Hat Europe 演讲中展示了一套命令与控制(C2)系统,通过提示注入远程控制 ChatGPT 实例,构成一种新型僵尸网络的基础。攻击前提是用户被提示注入恶意软件感染一次,途径包括用 ChatGPT 访问恶意网站、分析恶意图片或总结 PDF,恶意指令会持久化在 ChatGPT 的长期存储中。

    推荐理由作者以可复现的 PoC 展示提示注入如何把 ChatGPT 变成可长期远程控制的节点,并给出数据外泄的绕过路径。

  14. Embrace The Red · 收录 · 原文 50

    用提示注入与延迟工具调用篡改 Gemini 长期记忆

    研究者演示了通过上传文档中的间接提示注入,配合延迟工具调用,让 Gemini 把攻击者指定的虚假信息写入长期记忆。Gemini 通常不会在处理不可信数据时调用敏感工具,但攻击者先在文档摘要中埋入指令,要求用户在回复 yes、sure 或 no 等触发词时保存记忆,用户一旦照做,Gemini 便误以为这是用户本人的指令而调用记忆工具。演示中写入的虚假记忆包括昵称、年龄和喜好,并可在后续会话中持续存在,作者还通过询问年龄验证了端到端效果。

  15. Embrace The Red · 收录 · 原文 56

    研究者实测 ChatGPT Operator 提示注入攻击与三层防护绕过

    安全研究者 Johann 自费订阅 ChatGPT Pro 实测 OpenAI 的 Operator 浏览器智能体,演示了通过网页提示注入劫持 Operator 并窃取用户 PII 的完整攻击链。攻击方式是在 GitHub issue 等页面植入指令,诱导 Operator 跳转到用户已登录的站点(如 news.ycombinator.com、Booking.com、The Guardian),复制私密邮箱、住址和电话,再粘贴到攻击者控制的第三方页面,该页面无需点击提交按钮即可把输入直接发送到服务器。

    推荐理由作者以付费实测展示 Operator 的三层防护如何被绕过,并给出可复现的攻击链与失效边界。

  16. Embrace The Red · 收录 · 原文 46

    ASCII Smuggler 更新:用两个不可见字符走私任意 Unicode 数据

    Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。

  17. Embrace The Red · 收录 · 原文 43

    GitHub Copilot 自定义指令文件可被植入后门代码

    作者实测发现,GitHub Copilot 会读取仓库中的 .github/copilot-instructions.md 文件并加入提示词上下文,因此指令文件中一行隐蔽内容即可让 Copilot 生成带后门代码的补全结果,作者以 Go 语言做了演示。作者同时提到 Pillar Security 此前已指出 Cursor 的 .mdc 规则文件存在同类风险,并涉及隐藏 Unicode 字符。GitHub 去年已缓解 0-click 图片渲染数据泄露问题,点击超链接时也会弹出确认对话框,除非目标域名在 VS Code 的受信任站点列表中。

  18. Embrace The Red · 收录 · 原文 55

    研究者披露 MCP 工具元数据隐藏指令攻击,可劫持 Claude 等客户端

    安全研究者 Johann 披露 MCP 协议中工具元数据可携带隐藏 Unicode Tags 指令,用户界面不可见但会被 Claude 等模型解释执行。作者自建恶意 MCP 服务器演示了完整攻击链:在 message_of_the_day 工具描述中嵌入不可见指令,诱导 Claude 在调用该工具前先调用 enter_matrix 工具,而 UI 中检查描述看不到任何异常。攻击无需实际调用工具,仅将恶意服务器加入对话上下文即可劫持会话,因为工具元数据会被自动插入系统提示词。该攻击在 Claude Desktop、GitHub Copilot Agent Mode 和 Cursor 上均可复现。

    推荐理由作者以自建 MCP 服务器实测,展示工具元数据中隐藏 Unicode Tags 指令如何绕过 UI 可见性并触发未授权工具调用。

  19. Embrace The Red · 收录 · 原文 43

    ChatGPT 记忆与聊天历史功能如何运作:一次系统提示词实测

    作者用两个 ChatGPT 账号实测新上线的 chat history 记忆功能,发现它并不真正检索历史对话,而是把用户画像和近期对话写入系统提示词。系统提示词中与记忆相关的部分包括 Model Set Context、Assistant Response Preferences、Notable Past Conversation Topic Highlights、Helpful User Insights、Recent Conversation Content 和 User Interaction Metadata,条目多带有 Confidence=high 标签。

  20. Embrace The Red · 收录 · 原文 50

    研究者用 ClickFix 社工手法劫持 Computer-Use Agent

    安全研究者 Johann 把真实世界的 ClickFix 社工手法改造成针对 Computer-Use Agent 的攻击,并称多数变体都能奏效。攻击方式是在网页按钮被点击时用 JavaScript 把 curl 命令写入剪贴板,再诱导 Agent 打开终端、粘贴并执行,同时用终端图标和 CTRL+SHIFT+V 等 GUI 指令引导操作。作者称 Claude 偶尔拒答,但把验证文案从 Are you a Human 改成 Are you a Computer、把按钮从 Begin Validation 改成 Show Instructions 后,拒答几乎完全消失。

  21. Embrace The Red · 收录 · 原文 50

    Anthropic 弃用的 Slack MCP Server 存在数据外泄漏洞

    安全研究者披露 Anthropic 已弃用且不再维护的 Slack MCP Server 存在数据外泄漏洞,攻击者可通过提示注入让 AI 智能体把敏感信息拼进超链接,再借 Slack 的链接展开功能把数据发往第三方服务器。该服务器在 npm 上每周下载量超过 14k,可能存在数万个易受影响的安装。作者以 Claude Code 和 Claude Desktop 为例演示了从 .env 文件窃取 API key 的完整链路,并指出数据会经 Slack-LinkExpanding、Slackbot 1.0 和 Slack-ImgProxy 多次泄露。

  22. Embrace The Red · 收录 · 原文 50

    Embrace The Red 宣布 2025 年 AI 漏洞月,将披露 20 余篇编码 Agent 漏洞

    安全研究者 Johann Rehberger 宣布启动 2025 年 AI 漏洞月(Month of AI Bugs),8 月将在其博客发布 20 余篇针对主流智能体系统的漏洞分析,重点聚焦 AI 编码 Agent。作者称过去一年审查的每个 AI 编码 Agent 都存在漏洞,均已向对应厂商负责任披露,部分厂商数天内修复,也有厂商数月未回应、部分问题至今未缓解,还有厂商完全停止回复。

  23. Embrace The Red · 收录 · 原文 57

    研究者用提示注入绕过 ChatGPT 安全 URL 渲染,外泄聊天历史与记忆

    研究者演示了 OpenAI 的 safe URL 渲染功能存在绕过,使 ChatGPT 可把个人信息发送到第三方服务器,攻击者通过不可信数据中的提示注入即可利用。当用户处理不可信内容(如总结网页或分析 PDF)时,文档作者能外泄提示上下文中的任意信息,包括过往聊天历史。攻击链为:提示注入劫持 ChatGPT,读取系统提示中 Recent Conversation Content 部分,将内容发送到 https://trustnoai.blob.core.windows.net,攻击者再通过 Azure blob 存储日志查看结果。

    推荐理由作者以第一手实测展示 ChatGPT 聊天历史可经提示注入外泄,并给出 url_safe 绕过与披露时间线,便于评估同类渲染风险。

  24. Embrace The Red · 收录 · 原文 50

    通过间接提示注入将 ChatGPT Codex 变成 ZombAI 智能体

    安全研究者演示了借助 GitHub issue 中的间接提示注入劫持 ChatGPT Codex,把它接入 C2 服务器变成 ZombAI 僵尸网络智能体。OpenAI 在 6 月初为这个云端编码 Agent 加入联网能力,提供 Off、Full、自定义域名允许列表和 Common Dependencies 几类选项。Common Dependencies 允许列表包含 71 个域名,其中 azure.com 可被攻击者利用,在 Azure 上设置以 cloudapp.azure.com 结尾的 DNS 名来托管 C2。攻击链中,被恶意指令劫持的 Codex 会下载并执行植入物,泄露环境变量、源码与算力。

  25. Embrace The Red · 收录 · 原文 52

    Cursor IDE 经 Mermaid 渲染任意外泄数据,CVE-2025-54132 已在 v1.3 修复

    安全研究者 Johann 披露 Cursor IDE 存在通过 Mermaid 图表渲染实现任意数据外泄的漏洞,编号 CVE-2025-54132。Cursor 会渲染 Mermaid 图表,而图表中的图片链接可向外部服务器发起请求,且不经过沙箱限制、无需用户确认,因此间接提示注入即可把敏感数据带出。作者演示了两条攻击链:从项目配置文件中 grep 出 API key 并嵌入图片 URL 查询参数外泄,以及把 Cursor 存储的开发者记忆外泄到攻击者服务器。注入来源可以是源代码注释、网页请求、MCP 服务器、图片上传等,恶意模型或幻觉、后门也可能主动触发。

  26. Embrace The Red · 收录 · 原文 50

    Amp Code 可通过提示注入任意执行命令,Sourcegraph 已修复

    安全研究者 Johann 发现 Sourcegraph 的编码 Agent Amp 能够写入项目文件夹之外的配置文件,从而被间接提示注入利用实现任意代码执行。攻击链有两条:一是向 settings.json 的 amp.commands.allowlist 加入 curl、sh 等命令绕过开发者确认,二是写入恶意的 amp-mcpServers 条目,Amp 会立即启动该 MCP server,作者用一个小 Python 程序弹出计算器演示了任意代码执行。该漏洞于 7 月初发现并报告给 Sourcegraph,Amp 团队在几天内完成修复,作者建议用户升级到最新版本。

  27. Embrace The Red · 收录 · 原文 57

    研究者花 500 美元实测 Devin:从 GitHub issue 提示注入到远程代码执行

    安全研究者 Johann Rehberger 花 500 美元购买 Devin 30 天访问权限,演示了针对 Cognition 旗下 AI 软件工程师 Devin 的间接提示注入攻击。攻击者只需在 GitHub issue 或网站上植入指令,诱导 Devin 离开 GitHub 访问攻击者控制的页面,Devin 便会点击链接下载恶意二进制文件,在遇到权限拒绝后自行添加执行权限并运行,最终通过 Bishop Fox 的 Sliver C2 服务器获得远程 shell,实现 Devin DevBox 的完全沦陷。

    推荐理由作者自费实测 Devin 的间接提示注入链路,从 GitHub issue 到远程代码执行,并给出厂商披露时间线与缓解建议。

  28. Embrace The Red · 收录 · 原文 52

    研究者披露 Devin 通过四种途径泄露密钥

    安全研究者展示攻击者如何借助间接提示注入,让 Devin 把敏感信息发送到第三方服务器。Devin 内置密钥管理,密钥在运行时以环境变量形式可用,成为外泄目标。作者梳理出四条外泄路径:通过 Shell 工具执行 curl、wget 或 Python 脚本外传数据;通过浏览器工具访问带敏感数据的攻击者 URL;在聊天框渲染指向不可信域名的 Markdown 图片;以及结合 Slack 超链接与不可见 Unicode 字符。测试中 Cognition 似乎已禁用 Devin 发帖时的链接展开,信息未自动泄露,但用户点击看似无害的链接仍会通过 URL 编码把隐藏字符随 HTTP 请求发出。

  29. Embrace The Red · 收录 · 原文 57

    研究者用提示注入诱使 Devin 将本地端口暴露到公网

    安全研究者发现 Devin 的系统提示词中包含 expose_port 工具,可将本地端口暴露到公网并返回 .devinapps.com 的公开 URL,且无需人工确认即可调用。作者据此构建多阶段间接提示注入 PoC:第一阶段让 Devin 创建 Python Web 服务器暴露文件系统,第二阶段利用图片 markdown 漏洞把公开 URL 泄露给攻击者服务器,最终攻击者可从公网访问 Devin 机器上的文件。作者称 Devin 起初会拒绝此类请求,但通过跨多个域名和阶段逐步引导即可绕过。

    推荐理由作者用多阶段提示注入实测 Devin 的 expose_port 工具,展示自主 Agent 在无人确认下把本地端口暴露到公网的可复现路径。

  30. Embrace The Red · 收录 · 原文 53

    OpenHands 被提示注入零点击外泄 GITHUB_TOKEN

    安全研究者披露 OpenHands(原 OpenDevin,由 All-Hands AI 开发)存在零点击数据外泄漏洞:网页、源码或上传文档中的提示注入载荷可用 Markdown 语法强制渲染图片,并把信息拼进 URL 外传,从而窃取容器/VM 内的 GITHUB_TOKEN。模型最初拒绝直接读取并外发 token,作者改用只匹配 ghp_ 子串的方式绕过拒答;OpenHands 对识别为密钥的内容做脱敏后,又用 Base64 编码绕过。

  31. Embrace The Red · 收录 · 原文 53

    OpenHands 被提示注入劫持:从访问网页到远程代码执行

    安全研究者披露,OpenHands 智能体可被网页或 GitHub issue 中的不可信数据提示注入劫持,进而下载并执行恶意软件、连接攻击者控制的 C2 服务器,把实例变成 ZombAI。作者复用了此前针对 Anthropic Claude Computer-Use Agent 的同一份攻击载荷,仅替换了被执行的二进制文件,并让 OpenHands 在初始任务中仅被要求访问一个网站。作者还测试了 AI ClickFix 手法,OpenHands 按网页指令把 shell 命令复制粘贴进终端工具,一次即成功。

  32. Embrace The Red · 收录 · 原文 49

    Claude Code 被曝可经 DNS 请求外泄数据,Anthropic 已修复(CVE-2025-55284)

    安全研究者披露 Claude Code 存在高危漏洞,攻击者可通过间接提示注入劫持 Claude Code,把开发者机器上的敏感信息(如 API key)经 DNS 请求发往外部服务器,Anthropic 已于 6 月初修复。作者发现 Claude Code 的 Bash 工具虽需用户批准,但 ping、nslookup、host、dig 等命令在白名单中自动放行,于是把 .env 文件内容拼进 ping 请求的子域名,形成 DNS 外泄通道,也验证了可通过 /proc/PID/environ 泄露环境变量。

  33. Embrace The Red · 收录 · 原文 61

    GitHub Copilot 经提示注入实现远程代码执行(CVE-2025-53773)

    安全研究者披露 GitHub Copilot 与 VS Code 中的提示注入漏洞 CVE-2025-53773,攻击者可借此在开发者机器上实现远程代码执行。利用链从源代码文件、网页、GitHub issue 或工具调用响应中的提示注入开始,先向 ~/.vscode/settings.json 写入 chat.tools.autoApprove: true,使 Copilot 进入 YOLO 模式并关闭所有用户确认,随后执行终端命令,还可按操作系统条件选择载荷。该实验性设置默认存在,在 Windows、macOS 和 Linux 上均有效。

    推荐理由作者以第一手红队视角还原了从提示注入到远程代码执行的完整利用链,并给出可迁移的 Agent 配置写入风险检查点。

  34. Embrace The Red · 收录 · 原文 50

    Google Jules 被曝多种数据外泄漏洞

    作者披露 Google Jules 存在多条数据外泄路径,攻击者可通过间接提示注入窃取 Jules 可访问的信息。第一种是 Markdown 图片渲染,Jules 访问被注入的网页后被劫持,把此前对话中的信息拼到第三方 URL 上并加载图片,造成零点击外泄;第二种是 view_text_website 工具,攻击者把载荷写进 GitHub issue,Jules 读取后会把机器上的源码文件内容发送到攻击者服务器,且整个过程在 Jules 提出计划之前就已完成,绕过了人工审批环节。作者还提到第三种路径涉及任意代码执行,将在下一篇展开。

  35. Embrace The Red · 收录 · 原文 53

    研究者演示通过提示注入劫持 Google Jules 并远程控制其开发机

    研究者演示了通过 GitHub issue 中的间接提示注入劫持 Google Jules 编码 Agent 的攻击链,使其下载 Sliver 恶意软件并接入远程命令控制服务器,开发机被完全控制。攻击利用 Jules 的 run_in_bash_session 工具执行任意系统命令,且 Jules 具备不受限的外网访问能力。Jules 只在会话开始时提出计划,后续任务会自动调用工具而不再触发确认,初始计划在超时后也会自动批准,该超时时间从 20 秒改为 120 秒。作者建议谨慎让 Jules 处理不可信数据、避免其接触私有代码和生产密钥,并参考 ChatGPT Codex 默认禁止任意外网访问的做法。

    推荐理由作者以第一手实测展示编码 Agent 被间接提示注入后下载恶意软件并接入 C2 的完整链路,并给出可迁移的缓解建议。

  36. Embrace The Red · 收录 · 原文 55

    Google Jules 被曝可被不可见提示注入攻击

    安全研究者 Johann Rehberger 演示了针对 Google Jules 的不可见提示注入攻击:在 GitHub issue 正文中嵌入隐藏的 Unicode Tag 字符,Jules 会将其当作指令执行,自动添加后门函数、编译并运行代码。作者指出 Gemini 系列模型能较稳定地把隐藏 Unicode Tag 字符解读为指令,该问题最早于 2024 年 2 月 22 日报告给 Google 并被确认为有效漏洞,但模型和 API 层面至今未修复,因此影响所有基于 Gemini 构建的应用。

    推荐理由作者用可复现步骤演示隐藏 Unicode 字符如何劫持 Jules 写入后门,并给出针对编码 Agent 的缓解清单。

  37. Embrace The Red · 收录 · 原文 43

    Sourcegraph 修复 Amp Code 的不可见提示注入漏洞

    Sourcegraph 的编码 Agent Amp 曾受不可见 Unicode Tag 字符提示注入影响,攻击者可借此劫持 Agent 执行命令并外泄环境变量。作者演示的端到端利用链为:用隐藏字符触发 grep 搜索环境变量,将其编码进 URL 查询参数,再通过 read_web_page 或 markdown 图片渲染把密钥外传;在提示前加上可见的 Do this now 文本能提高可靠性,而模糊搜索如 .e* 和 ANT 可绕过模型对直接索取 API key 的拒答。作者称 Claude、Gemini、Grok 等模型会把隐藏 Unicode Tag 码点当作指令,OpenAI 是唯一在模型核心或 API 层缓解该问题的厂商。

  38. Embrace The Red · 收录 · 原文 51

    Sourcegraph Amp Code 修复通过图片渲染外泄数据的漏洞

    Sourcegraph 的 Amp Code 曾存在一个漏洞,攻击者可利用 markdown 图片渲染外泄敏感信息,该漏洞已被修复。作者用既有演示复现了完整攻击链:托管在网站上的提示注入要求 AI 把先前聊天数据作为查询参数渲染进图片,从而发送到第三方服务器,无需人工介入即可实现 0-click 数据外泄。攻击还能先通过文件读取把敏感信息拉入上下文再泄露,其中调用 grep 工具的隐晦写法用于绕过底层模型的拒答;本例中提示注入来自源代码文件里的注释。作者于 2025 年 6 月 14 日联系 Sourcegraph 后漏洞很快得到处理,建议运行最新版本。