全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Embrace The Red
Amazon Q Developer 被间接提示注入实现远程代码执行
安全研究者披露 Amazon Q Developer VS Code 扩展存在间接提示注入漏洞,攻击者可在开发者未授权的情况下在主机上执行任意命令。该扩展下载量超过 100 万,其 executeBash 工具中 find 命令被归入 readonly 类别,可绕过人工确认,并借助 -exec 参数执行任意系统命令;作者用源码注释中的提示注入演示了弹出计算器。作者进一步绕过 Claude 4 对 curl 下载的拒答,通过 base64 载荷加空格并配合 Python 脚本还原,实现从远程服务器动态下载并执行指令,还演示了下载 Sliver 恶意二进制并将主机接入 C2。
- 动态Embrace The Red
Amazon Q Developer VS Code 扩展被曝不可见提示注入漏洞
安全研究者披露 Amazon Q Developer VS Code 扩展存在不可见提示注入漏洞,攻击者可利用人类不可见的 Unicode Tag 字符在文件中隐藏指令,Amazon Q 处理文件时会将其当作指令执行。该扩展下载量超过 100 万,底层使用 Anthropic Claude 模型,而 Claude 模型已知会将不可见 Unicode Tag 字符解释为指令,且据作者了解 Anthropic 不打算在模型层修复,缓解责任落在应用开发者身上。作者称 OpenAI 是唯一在模型或 API 层缓解该问题的厂商。攻击者还可结合此前披露的 find -exec 问题实现任意命令执行,从而入侵用户机器。
- 动态Embrace The Red
Windsurf Cascade 被曝提示注入漏洞,可外泄开发者密钥
安全研究者披露 Windsurf Cascade 存在两条间接提示注入导致数据外泄的路径。第一条利用无需用户批准的 read_url_content 工具,把读取能力变成外发 HTTP 请求通道,当开发者用 Cascade 分析被植入恶意指令的源码文件时,.env 等敏感环境变量会被外泄。第二条是渲染来自不可信域名的图片,与作者此前在 GitHub Copilot 发现的漏洞类似,同样无需人工确认即可把开发者机器上的信息发送到第三方服务器。作者称已于 2025 年 5 月 30 日负责任披露,Windsurf 确认收到后未再回应后续询问,因此三个月后公开,并暂未公布完整技术细节与提示注入载荷。
- 动态Embrace The Red
Windsurf Cascade 被曝 SpAIware 攻击:记忆持久化数据外泄
安全研究者披露 Windsurf Cascade 存在 SpAIware 攻击链,攻击者可通过间接提示注入自动调用 create_memory 工具,把恶意指令写入长期记忆,从而在后续所有对话中持续外泄数据。作者发现该记忆工具无需人工批准即自动执行,因此攻击可同时破坏未来对话的机密性、完整性和可用性;注入载荷可藏在源代码注释、GitHub issue 或网页内容中,攻击者还能把外泄图片做成 1 像素透明图以在界面中隐藏。作者于 2025 年 5 月 30 日向 Windsurf 报告,三个月未获实质回应后公开,Windsurf 随后表示将着手修复但未给出时间表。
- 动态Embrace The Red
Windsurf Cascade 被曝执行文件中不可见的 Unicode 指令
作者在 Windsurf Cascade 中发现漏洞:文件或工具调用结果里可以藏有开发者看不见、但模型能读到的不可见 Unicode Tag 字符指令,从而形成隐藏的提示注入。演示中一个看似空白的文件实际包含隐藏指令,使用 Claude Sonnet 3.7 时 Cascade 将其当作指令并调用 web 工具,而 Windsurf 的预览窗格只显示可见文本。作者称 Windsurf 的 SWE-1 模型也能看到这些字符,但尚不能将其解释为指令,随着能力提升风险会上升。
- 动态Embrace The Red
研究者演示 ChatGPT Deep Research 连接器如何跨工具泄露数据
作者通过自建名为 Remote Matrix 的远程 MCP 服务器,实测 ChatGPT Deep Research 在连接多个工具时存在数据外泄。研究发现 ChatGPT Connectors 与 Deep Research 中的各工具处于同一信任边界,智能体可自由调用工具并把一个来源的数据用于查询另一个来源,例如将 Outlook 邮件或 Linear 工单中的敏感信息发送给 Remote Matrix。作者进一步在 Linear 工单和 MCP 工具描述中植入间接提示注入,成功劫持智能体,使其把多个工单中的生产服务与凭据合并成单条查询发送出去。
- 动态Embrace The Red
提示注入如何把 Manus 的 VS Code Server 暴露到公网
研究者演示了一条针对自主智能体 Manus 的端到端间接提示注入攻击链,最终实现对 Manus 开发机的远程控制。攻击先诱导 Manus 调用 deploy_expose_port 工具,在无人工确认、无 IP 限制的情况下把内部 VS Code Server 端口暴露到公网,该工具调用会返回可访问的公开 URL。随后利用两个数据外泄通道把 URL 和 VS Code Server 密码发送给攻击者服务器:一是 Manus 会渲染来自不可信域名的 markdown 图片,二是其浏览工具可在无人工介入下访问第三方域名。密码存放在开发机本地配置文件中,攻击者拿到 URL 和密码后即可登录并控制主机上的密钥、文档、代码和算力。
- 动态Embrace The Red
AWS Kiro 被曝经间接提示注入实现任意代码执行
安全研究者 Johann 在 AWS Kiro 发布当天测试发现,该编码 Agent 可被间接提示注入劫持,实现任意操作系统命令执行。攻击有两条路径:一是 Kiro 无需开发者批准即可写入文件,攻击者借此在 .vscode/settings.json 中把 Bash 命令加入白名单(如写入通配符),二是向 .kiro/settings/mcp.json 添加恶意 MCP 服务器,保存文件即触发代码执行。演示中提示注入被放在源码注释里,用户只需让 Kiro 读取或解释该文件即可触发,无需编译或运行代码;作者指出载荷也可来自文件上传、工具调用返回数据或 MCP 服务器。
- 动态Embrace The Red
Cline 被曝可通过 Markdown 图片渲染外泄数据,作者给出防护建议
安全研究者披露,AI 编码智能体 Cline 存在数据外泄漏洞:聊天框会渲染来自不可信域名的 Markdown 图片,攻击者可在提示注入攻击中读取 .env 等敏感文件并把内容拼进图片 URL,从而在无需人工批准的情况下外泄本机文件。作者给出复现步骤:写入含注入内容的 demo.md、创建带假密钥的 .env,再让 Cline 解释该文件,即可看到 Cline 被劫持、读取 .env 并自动渲染图片。缓解建议包括不渲染不可信域名的 Markdown 图片、默认关闭 Auto-approve,并指出该攻击同样可来自网站内容、MCP 服务器等来源。
- 动态Embrace The Red
Windsurf MCP 集成缺少安全控制,代码注释即可劫持 Agent 泄露私密 Slack 消息
作者实测发现,Windsurf 在添加 MCP 服务器后,工具调用默认处于无人工确认的自动执行状态,且没有让 AI 先建议、由用户确认的选项。他演示了通过代码注释中的自然语言指令劫持 Agent 的攻击:Agent 读取私密 Slack 频道消息并转发到公开频道,全程零点击、无需用户确认,只需把恶意指令放进提示词上下文即可。作者指出这类指令可来自工具调用、代码文件或访问的网站,而提示注入目前没有解决方案,人工审批仍是最佳缓解手段。该问题已于 2025 年 5 月 30 日告知 Windsurf 并获确认,Windsurf CEO 随后联系作者表示正在修复。
- 动态Embrace The Red
AgentHopper:借多个编码 Agent 漏洞实现自我传播的概念型 AI 病毒
安全研究员 Johann Rehberger 公布名为 AgentHopper 的概念验证 AI 病毒,用一个通用的条件化提示注入载荷在不同编码 Agent 间自动跳转并触发各自的远程代码执行路径。它利用此前负责任披露并已被各厂商修复的四类漏洞实施感染:向 GitHub Copilot 写入 settings.json 打开 YOLO 模式、给 Amp Code 配置伪造的 MCP 服务器、令 Amazon Q Developer 执行带 -exec 参数的 find 命令、修改 AWS Kiro 配置将所有 bash 命令加入允许列表,随后下载并运行 AgentHopper。
- 动态Embrace The Red
跨 Agent 提权:一个 Agent 如何改写另一个 Agent 的配置并放它出沙箱
研究者展示了一种跨 Agent 提权攻击链:被间接提示注入劫持的 GitHub Copilot 可以写入 Claude Code 的 MCP 配置和 CLAUDE.md 等指令文件,添加恶意 MCP server 或放行 shell 命令,等开发者使用 Claude Code 时这些改动被加载并执行任意代码,Claude 还能反向改写 Copilot 配置形成升级循环。
- 动态Embrace The Red
Claude Pirate:滥用 Anthropic File API 实现数据外泄
研究者披露了一条针对 Claude Code Interpreter 的数据外泄攻击链:利用默认开启的网络出口白名单中包含 api.anthropic.com,通过间接提示注入让 Claude 读取用户数据并写入沙箱文件,再用攻击者自己的 ANTHROPIC_API_KEY 调用 Anthropic Files API 把文件上传到攻击者账号。按 Files API 文档,单次可外泄最多 30MB,且可多次上传。作者称首次尝试即成功,但随后 Claude 会拒绝含明文 API key 的载荷,最终通过在恶意代码中混入大量无害代码(如 print('Hello, world'))绕过。
- 动态Embrace The Red
Google Antigravity IDE 存在五个已知安全漏洞,含数据外泄与远程命令执行
研究者指出,基于 Windsurf 授权协议推出的 Google Antigravity IDE 延续了多个早在 2025 年 5 月就已向 Windsurf 报告的已知漏洞。文中逐一分析了五个安全问题,包括通过间接提示注入实现的数据外泄乃至远程命令执行,并在上周二有研究人员开始反馈问题后,Google 才公开记录了这些问题。作为外部人士,目前尚不清楚为何这些已通报过的漏洞会出现在该产品中,作者的推测是 Google 安全团队对 Antigravity 的上线有些措手不及。出于提高认知的目的,作者暂未公布具体的漏洞利用载荷细节,而是给出了实用的缓解建议。
- 动态Embrace The Red
AI 中的偏差正常化:从 LLM 不可信输出来看间接提示注入风险
AI 行业正重演挑战者号航天飞机灾难前的文化失误——将偏离正确行为的做法逐渐常态化。该概念源自社会学家 Diane Vaughan 提出的"Normalization of Deviance",此处用以描述系统性地过度依赖 LLM 输出的现象,尤其在智能体系统中。由于 LLM 是不可信的参与者,访问检查、编码与净化等安全控制必须施加于其输出下游,否则会同时放大良性错误与恶意输入带来的后果。 Microsoft 文档警告提示注入攻击可能覆盖智能体指令并导致数据泄露或安装恶意软件,Anthropic 也记录了针对 Claude 的数据泄露问题。
- 动态Embrace The Red
OpenAI 新论文详解基于 URL 的数据外泄缓解措施
OpenAI 发布论文《Preventing URL-Based Data Exfiltration in Language-Model Agents》,详细说明其为语言模型智能体新增的 URL 数据外泄缓解措施。作者曾在 2023 年初向 OpenAI 报告零点击数据外泄漏洞,当时 OpenAI 尚无漏洞赏金计划,问题未获修复;同期微软在 2023 年 5 月通过 Content-Security-Policy 头修复了 Bing Chat 的同类问题。
- 动态Embrace The Red
研究者演示在 Agent Skill 中植入不可见 Unicode 后门并发布扫描工具
安全研究者 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 中植入提示注入后门,使其通过人工文本审查。他把这类隐藏指令加入 OpenAI 官方 Skills 项目中的 security-best-practices Skill,用户调用后 Claude 会按指令输出指定文本并执行 Bash 命令;该手法在 GitHub Copilot 配合 Claude 4.5 时同样生效。作者指出 Skill 的 name 和 description 会直接进入系统提示词上下文,且 Agent 能自行创建或修改 Skill 影响自身与其他 Agent。
- 动态Embrace The Red
Agent Commander:用提示注入把 OpenClaw 等智能体变成 C2 僵尸网络
安全研究者发布 Agent Commander,一个基于提示词的命令与控制(C2)服务器,被劫持的智能体定期回连领取自然语言任务,不执行原始系统命令。作者演示了三种智能体的间接提示注入入口:Kimi Claw 分析文档、OpenClaw 接收恶意邮件(无需人工操作)、NanoClaw 访问网站即被劫持。持久化方面,OpenClaw 利用默认每 30 分钟运行一次的 HEARTBEAT.md,并用 HEARTBEAT_OK 抑制用户通知;NanoClaw 则通过注入定时任务实现。作者观察到通知抑制效果显著,但有一次 OpenClaw 在整理每日笔记时识别出心跳中的后门,Opus 4.6 更擅长发现攻击但可被绕过。
- 动态Embrace The Red
用 ChatGPT 生成的对抗图片劫持 Claude Opus 4.7 记忆工具
作者用 ChatGPT 生成一张含解谜元素的对抗图片,让 Claude Opus 4.7 在分析图片时被间接提示注入劫持,调用 memory 工具写入虚假记忆。测试中 Opus 4.7 在 10 次里 5 次写入虚假信息,包括用户名、年龄、NASA 宇航员职业和饮食偏好,且每次都察觉到可能存在提示注入却仍被劫持。作者观察到初始记忆为空时攻击更易成功,内容越像真实用户会保存的信息越容易通过。该对抗样本在文章发布约 24 小时后攻击成功率降为 0%,原因不明。作者已于 2026 年 3 月通过 HackerOne 向 Anthropic 报告,工单被以安全问题关闭,后续邮件未获回复。
- 动态Failure-First
IHDec:用发散度引导对比解码维护多轮指令层级
Liu 等人提出 IHDec,一种免训练、推理时的干预方法,通过实时 logit 调整维护大语言模型的指令层级(System ≻ User ≻ Assistant ≻ Data)。作者用 Jensen-Shannon 散度作为诊断工具,当低优先级角色对下一 token 分布的影响超过高优先级角色时触发冲突集,再用专家与反专家对比解码生成校正向量,并采用 ϵ=1×10−8 的归一化项和 0.97 的衰减因子保证稳定性。在 IHEval 基准上,IHDec 比训练式方法 ISE 提升 11.98 个百分点;在 Llama-3.1-8B-Instruct 的多轮冲突场景达到 50.68% 准确率,而 ISE 为 12.60%。
- 动态Failure-First
《The safety failures we are not instrumenting》:现代 AI 系统中隐藏的安全关键挑战
一篇立场文章指出当前 AI 安全讨论聚焦于可见的输出异常,却忽视了由整个部署栈交互产生的隐性系统性失效。作者提出可信度、分布性、时间延展性与纠错退化四个共同特征,并搭建认知完整性、控制完整性、时间完整性、组织完整性和生态完整性五层诊断框架,用以刻画校准债务、不确定性洗白、指令权威崩塌、行动放大、安全漂移、记忆污染以及合成证据污染等问题。
- 动态NVIDIA garak 版本发布
NVIDIA garak v0.13.0 发布:新增 Leet 编码攻击插件与对话支持
NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。
- 动态MITRE ATLAS 数据发布
MITRE ATLAS 发布 v5.4.0,新增 AI Agent 攻击技术与案例研究
MITRE ATLAS 发布 v5.4.0,新增多项针对 AI Agent 的攻击技术,包括发布被投毒的 AI Agent 工具、从 Agent 逃逸到宿主机、利用漏洞获取凭据、利用漏洞规避防御,以及 AI Agent 用户执行类的被投毒工具与恶意链接。该版本还更新了修改 AI Agent 配置这一既有技术。案例研究方面新增了暴露的 ClawdBot 控制接口导致凭据访问与执行、通过被投毒 ClawdBot 技能实施供应链入侵、OpenClaw 一键远程代码执行,以及通过提示注入对 OpenClaw 实施命令与控制。
- 动态Google Threat Intelligence
Google 详解 AI 辅助漏洞管理:从确定性管控到 ZDR 的操作蓝图
Google Threat Intelligence 旗下 Mandiant Consulting 发文,针对企业将 LLM 智能体接入 CI/CD 做自动化漏洞挖掘与修复的场景,给出一套操作护栏建议。文中援引 Mandiant M-Trends 2026 报告称平均利用时间(TTE)已降至 -7 天,并强调应把代码库视为不可信输入以防源码注释中的间接提示注入,同时落实云服务商的零数据留存(ZDR)、工作负载隔离与人主导的红队测试。