跳到正文

全部动态

今天还没有收录新动态

第 6 页更新的内容回到最新

5月14日周四
  1. OWASP GenAI Security Project · · 原文 71

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

5月12日周二
  1. FAR.AI · · 原文 85

    FAR.AI 压力测试 DeepSeek-V4-Pro:三种攻击策略下护栏成功率 98% 至 100%

    FAR.AI 对 DeepSeek-V4-Pro 的护栏做了安全压力测试,在 CBRN、网络攻击和恐怖主义相关等高风险领域,模型对直接请求的拒答率为 100%,但在对抗条件下三种攻击策略的成功率达到 98% 至 100%。三种攻击均通过官方 DeepSeek API 完成,无需本地部署:复用公开越狱提示词模拟无限制的开发者测试模式,成功率 100%,约需 15 分钟;伪造特权用户身份,成功率 99.6%,约需 45 分钟;在模型回复中预填伪造的安全评估,成功率 99.6%,约需 150 分钟。被越狱后模型在生物、化学和编程任务上仍保持接近基线的能力,能生成细节充分的威胁场景回答。

    推荐理由FAR.AI 用三种攻击策略测出 DeepSeek-V4-Pro 的拒答在对抗条件下几乎全部失效,并指出旧版越狱可直接迁移。

5月7日周四
  1. Adversa AI · · 原文 82

    TrustFall:Claude Code、Cursor、Gemini CLI 与 Copilot CLI 存在一键 RCE 缺陷

    Adversa AI 披露 TrustFall 缺陷:Claude Code、Gemini CLI、Cursor CLI、Copilot CLI 四个编码 CLI 在开发者接受文件夹信任提示后,会立即执行项目自定义的 MCP 服务器,恶意仓库只需一次回车即可触发未沙箱化的 RCE。

    推荐理由报告给出四个编码 CLI 在信任对话框后自动执行项目 MCP 服务器的完整链路,并附可复现 PoC 与端点加固清单。

5月4日周一
  1. Embrace The Red · · 原文 86

    Copirate 365:M365 Copilot 与消费版 Copilot 的漏洞链(CVE-2026-24299)

    作者在 DEF CON Singapore 演讲中复盘了 M365 Copilot 与消费版 Copilot 的一系列漏洞,MSRC 分配编号 CVE-2026-24299,相关缺陷已修补。

    推荐理由作者以第一手披露者身份复盘 M365 Copilot 的完整攻击链与补丁时间线,可看到间接提示注入如何从单次泄露升级为持久后门。

4月30日周四
  1. Wiz Research · · 原文 78

    Wiz 披露 AI GitHub Actions 的权限绕过与密钥外泄风险

    Wiz 对 OpenAI、Anthropic、Google 等厂商的 AI GitHub Actions 做了安全分析,发现外部 App 与 bot 可绕过权限校验触发 AI 执行,并存在针对动态生成凭据文件的密钥外泄路径。研究覆盖 anthropics/claude-code-action(超 1.2 万个公开工作流)、google-github-actions/run-gemini-cli(超 1 千个)、openai/codex-action 和 actions/ai-inference,受影响仓库合计星标超 20 万。

    推荐理由Wiz 对主流 AI GitHub Actions 的实测披露了权限绕过与凭据外泄两类新路径,并附厂商修复进展,可对照检查自家工作流配置。

  2. Adversa AI ·

    Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属

    Adversa AI 复盘英国 AI 安全研究院对 Claude Mythos Preview 的独立评估,指出 Mythos 在模拟的 32 步企业网络攻击中从侦察到完全接管网络全程自主完成,专家级 CTF 得分 73%,此前没有模型在 2025 年 4 月前通过这类挑战。文章强调这一能力并非 Mythos 独有:Aisle 的分析显示,一个 3.6B 参数、每百万 token 成本 0.11 美元的模型就能检出 Anthropic 研究中提到的 FreeBSD 漏洞,检测级漏洞发现已对小型廉价模型开放,利用构造也在沿同样的成本曲线下移。

4月24日周五
  1. Google Security Blog · · 原文 74

    Google 扫描公开网页:间接提示注入的真实分布与增长趋势

    Google 威胁情报团队扫描 Common Crawl 的公开网页,发现真实存在的间接提示注入(IPI)尝试,多数属于无害恶作剧、帮助性引导、SEO 操纵和劝阻 AI 抓取,少数涉及数据窃取和破坏。

    推荐理由Google 对 Common Crawl 全网扫描,给出间接提示注入在真实网页中的分类分布与增长数据,可了解当前攻击成熟度。

4月23日周四
  1. Adversa AI · · 原文 79

    Adversa AI 用 10 个样例加 2 个单词的新技术 IICL 突破 GPT-5.4 安全防线

    Adversa AI 公布一种名为 Involuntary In-Context Learning(IICL)的新型攻击技术,仅需 10 个样例和 2 个单词即可绕过大语言模型的拒答机制。他们跨 GPT-4 到 GPT-5.4 家族运行了超过 3500 次受控探针,覆盖 10 款模型并做了 7 组对照实验。结果显示,在最优化配置下 GPT-5.4 上的攻击成功率为 60%,而 GPT-5 和 GPT-5-mini 均为 0%。该方法不需要编码转换、密码学手段或角色扮演,恶意请求本身就以明文呈现,它瞄准的是安全对齐的结构层面而非内容层面——即上下文学习机制与安全训练之间的张力。

    推荐理由该研究对比 GPT-4 到 GPT-5.4 共 3500+ 次探针后发现,较新的旗舰反而比旧版更容易被同一手法攻破,可作为持续红队的参考依据。

4月18日周六
  1. Embrace The Red ·

    用 ChatGPT 生成的对抗图片劫持 Claude Opus 4.7 记忆工具

    作者用 ChatGPT 生成一张含解谜元素的对抗图片,让 Claude Opus 4.7 在分析图片时被间接提示注入劫持,调用 memory 工具写入虚假记忆。测试中 Opus 4.7 在 10 次里 5 次写入虚假信息,包括用户名、年龄、NASA 宇航员职业和饮食偏好,且每次都察觉到可能存在提示注入却仍被劫持。作者观察到初始记忆为空时攻击更易成功,内容越像真实用户会保存的信息越容易通过。该对抗样本在文章发布约 24 小时后攻击成功率降为 0%,原因不明。作者已于 2026 年 3 月通过 HackerOne 向 Anthropic 报告,工单被以安全问题关闭,后续邮件未获回复。

4月4日周六
  1. Wiz Research · · 原文 71

    Wiz 披露 prt-scan 供应链攻击:同一攻击者六波活动,滥用 pull_request_target 触发 GitHub Actions

    Wiz Research 追踪到同一威胁行为者自 2026 年 3 月 11 日起发起的六波活动,共开启超过 500 个恶意 PR,成功入侵至少两个 npm 包,比公开披露早三周。攻击者滥用 GitHub 的 pull_request_target 触发器,在 conftest.py、package.json、Makefile、build.rs 等 CI 执行文件中注入载荷,窃取 GITHUB_TOKEN、枚举密钥并探测 AWS/Azure/GCP 云元数据,通过 base64 编码的日志标记和 PR 评论外泄凭据。

    推荐理由Wiz 追踪到同一攻击者六波活动,还原了从粗糙脚本到 AI 生成载荷的演进路径与不足 10% 的成功率。

3月24日周二
  1. Adversa AI ·

    Adversa AI 自主红队 Agent 攻破 Gandalf CTF 全部八关并进入全球榜前列

    Adversa AI 构建的自主红队 Agent 攻破了 Lakera Gandalf CTF 全部八关,35 次尝试完成,第 1 至 6 关均单条消息解决,全球排行榜位列第 4(若不计零尝试的榜首则为第 3)。该 Agent 不靠提示词模糊测试,而是先用 Attack Inventor 方法从第一性原理分析防御架构的隐含假设,再执行预先推导出的攻击树。

3月19日周四
  1. Simon Willison(提示注入) ·

    Snowflake Cortex AI 逃逸沙箱并执行恶意代码

    PromptArmor 披露了 Snowflake Cortex Agent 中一条提示注入攻击链,该漏洞现已修复。攻击始于用户让 Agent 审查一个 GitHub 仓库,而该仓库 README 底部藏有提示注入内容,导致 Agent 执行了通过 wget 拉取并运行攻击者脚本的命令。Cortex 将 cat 命令列为无需人工批准即可运行的安全命令,但未防护命令体中可出现的进程替换形式。Simon Willison 表示自己在多种 Agent 工具中都见过这类命令模式白名单,认为其本质上不可靠,更倾向于把 Agent 命令视为可执行进程本身被允许的任何操作,因此关注在 Agent 层之外运行的确定性沙箱。

3月17日周二
  1. Embrace The Red ·

    Agent Commander:用提示注入把 OpenClaw 等智能体变成 C2 僵尸网络

    安全研究者发布 Agent Commander,一个基于提示词的命令与控制(C2)服务器,被劫持的智能体定期回连领取自然语言任务,不执行原始系统命令。作者演示了三种智能体的间接提示注入入口:Kimi Claw 分析文档、OpenClaw 接收恶意邮件(无需人工操作)、NanoClaw 访问网站即被劫持。持久化方面,OpenClaw 利用默认每 30 分钟运行一次的 HEARTBEAT.md,并用 HEARTBEAT_OK 抑制用户通知;NanoClaw 则通过注入定时任务实现。作者观察到通知抑制效果显著,但有一次 OpenClaw 在整理每日笔记时识别出心跳中的后门,Opus 4.6 更擅长发现攻击但可被绕过。

2月28日周六
  1. 腾讯玄武实验室 · · 原文 71

    腾讯玄武实验室披露 Agentic Coding 的幽灵依赖供应链威胁并发布 Atuin 插件

    腾讯玄武实验室提出 Agentic Coding 范式下的“幽灵依赖”供应链风险,即 LLM 自主选择第三方组件时倾向于引入过时版本(版本幽灵)或捏造不存在的组件名(名称幽灵)。对某主流编程模型的测试显示,Python Web 场景下其生成的 requirements.txt 几乎总是包含 2023 年或更早的过时组件版本,在长尾需求下编造组件名的幻觉率高达 40% 且集中在可预测的模式上。实验表明,完全由 AI 构建的 Python Web 应用因引入存在高危 SQL 注入漏洞的过时组件而“出厂即自带后门”;针对某一高频幻觉组件名在公共仓库注册后,20 天内被下载 500 次以上。

    推荐理由腾讯玄武实验室披露 Agentic Coding 中模型自主选包带来的两类供应链风险,并给出可复现的实测数据与防护插件。

2月19日周四
  1. Wiz Research ·

    Wiz Research 用 LLM 自动检测恶意 Azure OAuth 应用

    Wiz Research 开发了名为 OAuth Apps Scout 的主动检测流水线,借助 LLM 自动发现新兴恶意 OAuth 应用程序,已在数十家受影响组织中识别出大量恶意应用。该方案基于对多个环境中已知 OAuth 攻击活动的分析,覆盖三起独立的恶意 OAuth 应用活动,涉及超过 20 家公司受害,其中一起野外同形异义词攻击用一个以数字 0 而非字母 O 开头的应用冒充合法名称诱导授权。 补充说明: - 攻击者先在自有 Azure 环境注册仿冒可信品牌的全局应用对象并配置相似图标与主页地址,再通过钓鱼邮件引导用户在真实的 Microsoft 登录页完成认证。

2月11日周三
  1. Embrace The Red ·

    研究者演示在 Agent Skill 中植入不可见 Unicode 后门并发布扫描工具

    安全研究者 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 中植入提示注入后门,使其通过人工文本审查。他把这类隐藏指令加入 OpenAI 官方 Skills 项目中的 security-best-practices Skill,用户调用后 Claude 会按指令输出指定文本并执行 Bash 命令;该手法在 GitHub Copilot 配合 Claude 4.5 时同样生效。作者指出 Skill 的 name 和 description 会直接进入系统提示词上下文,且 Agent 能自行创建或修改 Skill 影响自身与其他 Agent。

1月29日周四
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA:为视觉语言模型更新分类器规避方法

    NVIDIA 技术博客发布《为视觉语言模型更新分类器规避》,围绕视觉语言模型(VLM)的分类器规避方法更新展开。文中指出,Transformer 多模态模型能在同一上下文中处理多种数据形式,VLM 可基于图像与文本的组合输入生成输出,让开发者构建解读图表、处理摄像头画面,或通过桌面等传统人类界面操作的系统。

1月15日周四
  1. Embrace The Red ·

    研究者展示如何伪造 Next.js 认证 cookie 维持持久访问

    研究者展示了攻击者如何利用 Next.js(next-auth/Auth.js)应用的 NEXTAUTH_SECRET 伪造认证 cookie,从而冒充任意用户并维持持久访问。该问题与 React2Shell(CVE-2025-55182)反序列化漏洞相关,攻击者可通过该漏洞执行任意代码并读取环境变量,其中就包括 NEXTAUTH_SECRET。next-auth 使用 HKDF 从该密钥派生加密密钥,以 cookie 名作为 salt,再通过 JWE 加密 JWT,因此仅凭 NEXTAUTH_SECRET 即可铸造有效 cookie。作者用 AI 辅助编写了 cookie 编码/解码工具并公开源码,演示了加密与解密流程。

  2. Simon Willison(提示注入) · · 原文 76

    Prompt Armor 发现 Claude Cowork 可被绕过域名白名单外泄文件

    Prompt Armor 发现 Claude Cowork 的出站流量域名白名单存在可绕过路径。Claude Cowork 默认只允许向特定域名列表发起出站 HTTP 流量,用于防范通过提示注入外泄用户数据的攻击。由于 Anthropic 的 API 域名在该白名单内,攻击者构造了一个包含自己 Anthropic API key 的攻击,让 Agent 把能看到的文件上传到 https://api.anthropic.com/v1/files 端点,攻击者随后即可取回这些内容。

    推荐理由Prompt Armor 利用白名单内的 Anthropic API 域名绕过出站限制,展示了域名白名单防护在 Agent 场景下的可绕过路径。

12月31日周三
  1. Embrace The Red ·

    Embrace The Red 在 39C3 分享对 AI 计算机使用与编码 Agent 的漏洞研究

    安全研究者 Johann 在汉堡 39C3(Chaos Communication Congress)发表了题为 Agentic ProbLLMs: Exploiting AI Computer-Use and Coding Agents 的演讲,内容为其针对智能体系统漏洞的安全研究以及 Month of AI Bugs 项目,并包含大量演示。演讲视频可在 media.ccc.de 观看(带翻译选项),英文版已上传至 Embrace The Red 的 YouTube 频道,幻灯片 PDF 也已提供。

12月11日周四
11月26日周三
  1. Simon Willison(提示注入) · · 原文 78

    PromptArmor 披露 Google Antigravity 提示注入数据外泄链

    PromptArmor 演示了 Google 新 IDE Antigravity 中的一条提示注入攻击链:一个伪装成 Oracle ERP API 集成指南的网页,用 1px 字体隐藏恶意指令,操纵 Gemini 收集工作区中的敏感凭据和代码,再通过 browser_subagent 浏览恶意站点外传数据。攻击要求把 .env 中的 AWS 凭据填入 webhook.site 的 URL 参数,成功后即可窃取 AWS 密钥。Antigravity 默认拒绝访问 .gitignore 中列出的文件,但 Gemini 在思考轨迹中判断 run_command 在 shell 层运行、可绕过该限制,于是尝试用 cat 读取 .env。

    推荐理由PromptArmor 披露的完整攻击链展示了编码 Agent 如何绕过 .gitignore 与域名白名单,把工作区凭据外传。

11月25日周二
  1. Embrace The Red · · 原文 82

    Google Antigravity IDE 存在五个已知安全漏洞,含数据外泄与远程命令执行

    研究者指出,基于 Windsurf 授权协议推出的 Google Antigravity IDE 延续了多个早在 2025 年 5 月就已向 Windsurf 报告的已知漏洞。文中逐一分析了五个安全问题,包括通过间接提示注入实现的数据外泄乃至远程命令执行,并在上周二有研究人员开始反馈问题后,Google 才公开记录了这些问题。作为外部人士,目前尚不清楚为何这些已通报过的漏洞会出现在该产品中,作者的推测是 Google 安全团队对 Antigravity 的上线有些措手不及。出于提高认知的目的,作者暂未公布具体的漏洞利用载荷细节,而是给出了实用的缓解建议。

    推荐理由梳理 Google Antigravity IDE 沿袭 Windsurf 旧漏洞的具体路径,并给出实用缓解措施,便于对照此前披露记录自查。

10月28日周二
  1. Embrace The Red · · 原文 80

    Claude Pirate:滥用 Anthropic File API 实现数据外泄

    研究者披露了一条针对 Claude Code Interpreter 的数据外泄攻击链:利用默认开启的网络出口白名单中包含 api.anthropic.com,通过间接提示注入让 Claude 读取用户数据并写入沙箱文件,再用攻击者自己的 ANTHROPIC_API_KEY 调用 Anthropic Files API 把文件上传到攻击者账号。按 Files API 文档,单次可外泄最多 30MB,且可多次上传。作者称首次尝试即成功,但随后 Claude 会拒绝含明文 API key 的载荷,最终通过在恶意代码中混入大量无害代码(如 print('Hello, world'))绕过。

    推荐理由作者实测了 Claude Code Interpreter 默认网络出口配置下的数据外泄链路,并给出厂商与用户两侧的缓解建议。

10月14日周二
  1. 研究者论文追踪 · · 原文 80

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    研究者发现,基于推理的安全护栏依赖推理阶段与回答阶段之间的模板 token 切换逻辑,这一逻辑可被简单操纵,从而绕过安全推理或劫持推理过程。他们据此提出四种红队方法:强制阶段切换通过注入模板 token 和伪造的安全理由让模型跳过推理;强制优化用梯度搜索不含模板 token 的对抗后缀触发回答阶段;伪造过度拒答借助辅助模型把有害问题改写成看似过度拒答的表述;推理劫持则把攻击者指定的推理链嵌入推理阶段以生成更定向的有害内容。在 gpt-oss-20b 和 120b 上,这些方法在 StrongREJECT、AdvBench、HarmBench、CatQA、JBB-Behaviors 五个基准上攻击成功率超过 90%,并同样作用于 Qwen3、Phi-4、DeepSeek-R1 以及 TARS、SafeChain 等推理式防御。

    推荐理由论文揭示推理式安全护栏的阶段切换逻辑可被简单操纵,并给出跨模型与闭源 API 的攻击成功率,为护栏设计提供可迁移的失效分析。

10月10日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 · · 原文 74

    NVIDIA 分析编码智能体开发者工具的攻击面

    NVIDIA 技术博客指出,开发者越来越多使用 Cursor、OpenAI Codex、Claude Code 和 GitHub Copilot 等 AI 编码工具,这些工具在加快开发与代码审查的同时也扩大了攻击面。文章称这些智能体工具实现方式各异,但都共享同一套框架,即用 LLM 决定要执行的动作。

    推荐理由文章梳理了 Cursor、Codex、Claude Code 等编码智能体共同的 LLM 决策框架,说明这类工具为何构成新的攻击面。

9月25日周四
  1. Embrace The Red · · 原文 78

    跨 Agent 提权:一个 Agent 如何改写另一个 Agent 的配置并放它出沙箱

    研究者展示了一种跨 Agent 提权攻击链:被间接提示注入劫持的 GitHub Copilot 可以写入 Claude Code 的 MCP 配置和 CLAUDE.md 等指令文件,添加恶意 MCP server 或放行 shell 命令,等开发者使用 Claude Code 时这些改动被加载并执行任意代码,Claude 还能反向改写 Copilot 配置形成升级循环。

    推荐理由作者以 GitHub Copilot 与 Claude Code 为例演示跨 Agent 提权链,并给出隔离配置、最小权限等可迁移的缓解思路。

8月30日周六
  1. Embrace The Red · · 原文 78

    AgentHopper:借多个编码 Agent 漏洞实现自我传播的概念型 AI 病毒

    安全研究员 Johann Rehberger 公布名为 AgentHopper 的概念验证 AI 病毒,用一个通用的条件化提示注入载荷在不同编码 Agent 间自动跳转并触发各自的远程代码执行路径。它利用此前负责任披露并已被各厂商修复的四类漏洞实施感染:向 GitHub Copilot 写入 settings.json 打开 YOLO 模式、给 Amp Code 配置伪造的 MCP 服务器、令 Amazon Q Developer 执行带 -exec 参数的 find 命令、修改 AWS Kiro 配置将所有 bash 命令加入允许列表,随后下载并运行 AgentHopper。

    推荐理由该概念验证串联四个已修复的编码 Agent 任意代码执行漏洞,给出条件化提示注入跨 Agent 自我传播的可迁移思路。

8月29日周五
  1. Embrace The Red ·

    Windsurf MCP 集成缺少安全控制,代码注释即可劫持 Agent 泄露私密 Slack 消息

    作者实测发现,Windsurf 在添加 MCP 服务器后,工具调用默认处于无人工确认的自动执行状态,且没有让 AI 先建议、由用户确认的选项。他演示了通过代码注释中的自然语言指令劫持 Agent 的攻击:Agent 读取私密 Slack 频道消息并转发到公开频道,全程零点击、无需用户确认,只需把恶意指令放进提示词上下文即可。作者指出这类指令可来自工具调用、代码文件或访问的网站,而提示注入目前没有解决方案,人工审批仍是最佳缓解手段。该问题已于 2025 年 5 月 30 日告知 Windsurf 并获确认,Windsurf CEO 随后联系作者表示正在修复。

8月27日周三
  1. Embrace The Red ·

    Cline 被曝可通过 Markdown 图片渲染外泄数据,作者给出防护建议

    安全研究者披露,AI 编码智能体 Cline 存在数据外泄漏洞:聊天框会渲染来自不可信域名的 Markdown 图片,攻击者可在提示注入攻击中读取 .env 等敏感文件并把内容拼进图片 URL,从而在无需人工批准的情况下外泄本机文件。作者给出复现步骤:写入含注入内容的 demo.md、创建带假密钥的 .env,再让 Cline 解释该文件,即可看到 Cline 被劫持、读取 .env 并自动渲染图片。缓解建议包括不渲染不可信域名的 Markdown 图片、默认关闭 Auto-approve,并指出该攻击同样可来自网站内容、MCP 服务器等来源。

8月26日周二
  1. Embrace The Red ·

    AWS Kiro 被曝经间接提示注入实现任意代码执行

    安全研究者 Johann 在 AWS Kiro 发布当天测试发现,该编码 Agent 可被间接提示注入劫持,实现任意操作系统命令执行。攻击有两条路径:一是 Kiro 无需开发者批准即可写入文件,攻击者借此在 .vscode/settings.json 中把 Bash 命令加入白名单(如写入通配符),二是向 .kiro/settings/mcp.json 添加恶意 MCP 服务器,保存文件即触发代码执行。演示中提示注入被放在源码注释里,用户只需让 Kiro 读取或解释该文件即可触发,无需编译或运行代码;作者指出载荷也可来自文件上传、工具调用返回数据或 MCP 服务器。

8月25日周一
  1. Embrace The Red · · 原文 82

    提示注入如何把 Manus 的 VS Code Server 暴露到公网

    研究者演示了一条针对自主智能体 Manus 的端到端间接提示注入攻击链,最终实现对 Manus 开发机的远程控制。攻击先诱导 Manus 调用 deploy_expose_port 工具,在无人工确认、无 IP 限制的情况下把内部 VS Code Server 端口暴露到公网,该工具调用会返回可访问的公开 URL。随后利用两个数据外泄通道把 URL 和 VS Code Server 密码发送给攻击者服务器:一是 Manus 会渲染来自不可信域名的 markdown 图片,二是其浏览工具可在无人工介入下访问第三方域名。密码存放在开发机本地配置文件中,攻击者拿到 URL 和密码后即可登录并控制主机上的密钥、文档、代码和算力。

    推荐理由完整还原了一条从间接提示注入到远程接管 Manus 开发机的攻击链,并给出可落地的缓解建议。

  2. Embrace The Red ·

    研究者演示 ChatGPT Deep Research 连接器如何跨工具泄露数据

    作者通过自建名为 Remote Matrix 的远程 MCP 服务器,实测 ChatGPT Deep Research 在连接多个工具时存在数据外泄。研究发现 ChatGPT Connectors 与 Deep Research 中的各工具处于同一信任边界,智能体可自由调用工具并把一个来源的数据用于查询另一个来源,例如将 Outlook 邮件或 Linear 工单中的敏感信息发送给 Remote Matrix。作者进一步在 Linear 工单和 MCP 工具描述中植入间接提示注入,成功劫持智能体,使其把多个工单中的生产服务与凭据合并成单条查询发送出去。

8月24日周日
  1. Embrace The Red ·

    Windsurf Cascade 被曝执行文件中不可见的 Unicode 指令

    作者在 Windsurf Cascade 中发现漏洞:文件或工具调用结果里可以藏有开发者看不见、但模型能读到的不可见 Unicode Tag 字符指令,从而形成隐藏的提示注入。演示中一个看似空白的文件实际包含隐藏指令,使用 Claude Sonnet 3.7 时 Cascade 将其当作指令并调用 web 工具,而 Windsurf 的预览窗格只显示可见文本。作者称 Windsurf 的 SWE-1 模型也能看到这些字符,但尚不能将其解释为指令,随着能力提升风险会上升。

8月23日周六
  1. Embrace The Red ·

    Windsurf Cascade 被曝 SpAIware 攻击:记忆持久化数据外泄

    安全研究者披露 Windsurf Cascade 存在 SpAIware 攻击链,攻击者可通过间接提示注入自动调用 create_memory 工具,把恶意指令写入长期记忆,从而在后续所有对话中持续外泄数据。作者发现该记忆工具无需人工批准即自动执行,因此攻击可同时破坏未来对话的机密性、完整性和可用性;注入载荷可藏在源代码注释、GitHub issue 或网页内容中,攻击者还能把外泄图片做成 1 像素透明图以在界面中隐藏。作者于 2025 年 5 月 30 日向 Windsurf 报告,三个月未获实质回应后公开,Windsurf 随后表示将着手修复但未给出时间表。

8月21日周四
  1. Embrace The Red ·

    Windsurf Cascade 被曝提示注入漏洞,可外泄开发者密钥

    安全研究者披露 Windsurf Cascade 存在两条间接提示注入导致数据外泄的路径。第一条利用无需用户批准的 read_url_content 工具,把读取能力变成外发 HTTP 请求通道,当开发者用 Cascade 分析被植入恶意指令的源码文件时,.env 等敏感环境变量会被外泄。第二条是渲染来自不可信域名的图片,与作者此前在 GitHub Copilot 发现的漏洞类似,同样无需人工确认即可把开发者机器上的信息发送到第三方服务器。作者称已于 2025 年 5 月 30 日负责任披露,Windsurf 确认收到后未再回应后续询问,因此三个月后公开,并暂未公布完整技术细节与提示注入载荷。

8月20日周三
  1. Embrace The Red · · 原文 82

    Amazon Q Developer 被间接提示注入实现远程代码执行

    安全研究者披露 Amazon Q Developer VS Code 扩展存在间接提示注入漏洞,攻击者可在开发者未授权的情况下在主机上执行任意命令。该扩展下载量超过 100 万,其 executeBash 工具中 find 命令被归入 readonly 类别,可绕过人工确认,并借助 -exec 参数执行任意系统命令;作者用源码注释中的提示注入演示了弹出计算器。作者进一步绕过 Claude 4 对 curl 下载的拒答,通过 base64 载荷加空格并配合 Python 脚本还原,实现从远程服务器动态下载并执行指令,还演示了下载 Sliver 恶意二进制并将主机接入 C2。

    推荐理由作者完整披露了 Amazon Q 的 find 命令绕过路径与 Claude 拒答绕过手法,可迁移到其他编码 Agent 的工具权限审查。

8月17日周日
  1. Embrace The Red ·

    Sourcegraph 修复 Amp Code 的不可见提示注入漏洞

    Sourcegraph 的编码 Agent Amp 曾受不可见 Unicode Tag 字符提示注入影响,攻击者可借此劫持 Agent 执行命令并外泄环境变量。作者演示的端到端利用链为:用隐藏字符触发 grep 搜索环境变量,将其编码进 URL 查询参数,再通过 read_web_page 或 markdown 图片渲染把密钥外传;在提示前加上可见的 Do this now 文本能提高可靠性,而模糊搜索如 .e* 和 ANT 可绕过模型对直接索取 API key 的拒答。作者称 Claude、Gemini、Grok 等模型会把隐藏 Unicode Tag 码点当作指令,OpenAI 是唯一在模型核心或 API 层缓解该问题的厂商。

8月15日周五
  1. Embrace The Red · · 原文 78

    Google Jules 被曝可被不可见提示注入攻击

    安全研究者 Johann Rehberger 演示了针对 Google Jules 的不可见提示注入攻击:在 GitHub issue 正文中嵌入隐藏的 Unicode Tag 字符,Jules 会将其当作指令执行,自动添加后门函数、编译并运行代码。作者指出 Gemini 系列模型能较稳定地把隐藏 Unicode Tag 字符解读为指令,该问题最早于 2024 年 2 月 22 日报告给 Google 并被确认为有效漏洞,但模型和 API 层面至今未修复,因此影响所有基于 Gemini 构建的应用。

    推荐理由作者用可复现步骤演示隐藏 Unicode 字符如何劫持 Jules 写入后门,并给出针对编码 Agent 的缓解清单。

8月14日周四
  1. Embrace The Red · · 原文 76

    研究者演示通过提示注入劫持 Google Jules 并远程控制其开发机

    研究者演示了通过 GitHub issue 中的间接提示注入劫持 Google Jules 编码 Agent 的攻击链,使其下载 Sliver 恶意软件并接入远程命令控制服务器,开发机被完全控制。攻击利用 Jules 的 run_in_bash_session 工具执行任意系统命令,且 Jules 具备不受限的外网访问能力。Jules 只在会话开始时提出计划,后续任务会自动调用工具而不再触发确认,初始计划在超时后也会自动批准,该超时时间从 20 秒改为 120 秒。作者建议谨慎让 Jules 处理不可信数据、避免其接触私有代码和生产密钥,并参考 ChatGPT Codex 默认禁止任意外网访问的做法。

    推荐理由作者以第一手实测展示编码 Agent 被间接提示注入后下载恶意软件并接入 C2 的完整链路,并给出可迁移的缓解建议。