Task Injection:利用自主 AI 智能体的能动性
Google 披露了一种针对自主 AI 智能体的 Task Injection 攻击,它与 Prompt Injection 不同,专门利用智能体被赋予的广泛行动与任务执行能力。该攻击对设计用于执行多种任务的 AI 智能体尤为相关。
Google 披露了一种针对自主 AI 智能体的 Task Injection 攻击,它与 Prompt Injection 不同,专门利用智能体被赋予的广泛行动与任务执行能力。该攻击对设计用于执行多种任务的 AI 智能体尤为相关。
研究者提出一种微调攻击,通过 OpenAI 的黑盒微调 API 撤销模型对齐,从 ChatGPT 和 Gemini 等生产模型中恢复数千条训练样本。他们用 1000 条样本构建微调数据集,让模型学会按前缀续写文本,再用 Wikipedia 的 5-token 字符串提示。在 The Pile 上微调的 GPT-3.5 生成文本有 4.3% 可在互联网上逐字找到,而用发散攻击提取的记忆文本微调后这一比例达 17%,比对齐版 GPT-3.5 高 210 倍;GPT-4 在同样微调下为 11.3%。
推荐理由研究展示微调 API 可撤销对齐保护,用不到 3 美元即可让 GPT-3.5 与 GPT-4 复现训练数据,为评估微调接口风险提供可复现方法。
研究者演示了通过上传文档中的间接提示注入,配合延迟工具调用,让 Gemini 把攻击者指定的虚假信息写入长期记忆。Gemini 通常不会在处理不可信数据时调用敏感工具,但攻击者先在文档摘要中埋入指令,要求用户在回复 yes、sure 或 no 等触发词时保存记忆,用户一旦照做,Gemini 便误以为这是用户本人的指令而调用记忆工具。演示中写入的虚假记忆包括昵称、年龄和喜好,并可在后续会话中持续存在,作者还通过询问年龄验证了端到端效果。
Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。
作者披露 Google Jules 存在多条数据外泄路径,攻击者可通过间接提示注入窃取 Jules 可访问的信息。第一种是 Markdown 图片渲染,Jules 访问被注入的网页后被劫持,把此前对话中的信息拼到第三方 URL 上并加载图片,造成零点击外泄;第二种是 view_text_website 工具,攻击者把载荷写进 GitHub issue,Jules 读取后会把机器上的源码文件内容发送到攻击者服务器,且整个过程在 Jules 提出计划之前就已完成,绕过了人工审批环节。作者还提到第三种路径涉及任意代码执行,将在下一篇展开。
研究者演示了通过 GitHub issue 中的间接提示注入劫持 Google Jules 编码 Agent 的攻击链,使其下载 Sliver 恶意软件并接入远程命令控制服务器,开发机被完全控制。攻击利用 Jules 的 run_in_bash_session 工具执行任意系统命令,且 Jules 具备不受限的外网访问能力。Jules 只在会话开始时提出计划,后续任务会自动调用工具而不再触发确认,初始计划在超时后也会自动批准,该超时时间从 20 秒改为 120 秒。作者建议谨慎让 Jules 处理不可信数据、避免其接触私有代码和生产密钥,并参考 ChatGPT Codex 默认禁止任意外网访问的做法。
推荐理由作者以第一手实测展示编码 Agent 被间接提示注入后下载恶意软件并接入 C2 的完整链路,并给出可迁移的缓解建议。
安全研究者 Johann Rehberger 演示了针对 Google Jules 的不可见提示注入攻击:在 GitHub issue 正文中嵌入隐藏的 Unicode Tag 字符,Jules 会将其当作指令执行,自动添加后门函数、编译并运行代码。作者指出 Gemini 系列模型能较稳定地把隐藏 Unicode Tag 字符解读为指令,该问题最早于 2024 年 2 月 22 日报告给 Google 并被确认为有效漏洞,但模型和 API 层面至今未修复,因此影响所有基于 Gemini 构建的应用。
推荐理由作者用可复现步骤演示隐藏 Unicode 字符如何劫持 Jules 写入后门,并给出针对编码 Agent 的缓解清单。
Sourcegraph 的编码 Agent Amp 曾受不可见 Unicode Tag 字符提示注入影响,攻击者可借此劫持 Agent 执行命令并外泄环境变量。作者演示的端到端利用链为:用隐藏字符触发 grep 搜索环境变量,将其编码进 URL 查询参数,再通过 read_web_page 或 markdown 图片渲染把密钥外传;在提示前加上可见的 Do this now 文本能提高可靠性,而模糊搜索如 .e* 和 ANT 可绕过模型对直接索取 API key 的拒答。作者称 Claude、Gemini、Grok 等模型会把隐藏 Unicode Tag 码点当作指令,OpenAI 是唯一在模型核心或 API 层缓解该问题的厂商。
安全研究者披露 Windsurf Cascade 存在两条间接提示注入导致数据外泄的路径。第一条利用无需用户批准的 read_url_content 工具,把读取能力变成外发 HTTP 请求通道,当开发者用 Cascade 分析被植入恶意指令的源码文件时,.env 等敏感环境变量会被外泄。第二条是渲染来自不可信域名的图片,与作者此前在 GitHub Copilot 发现的漏洞类似,同样无需人工确认即可把开发者机器上的信息发送到第三方服务器。作者称已于 2025 年 5 月 30 日负责任披露,Windsurf 确认收到后未再回应后续询问,因此三个月后公开,并暂未公布完整技术细节与提示注入载荷。
研究者展示了一种跨 Agent 提权攻击链:被间接提示注入劫持的 GitHub Copilot 可以写入 Claude Code 的 MCP 配置和 CLAUDE.md 等指令文件,添加恶意 MCP server 或放行 shell 命令,等开发者使用 Claude Code 时这些改动被加载并执行任意代码,Claude 还能反向改写 Copilot 配置形成升级循环。
推荐理由作者以 GitHub Copilot 与 Claude Code 为例演示跨 Agent 提权链,并给出隔离配置、最小权限等可迁移的缓解思路。
研究者指出,基于 Windsurf 授权协议推出的 Google Antigravity IDE 延续了多个早在 2025 年 5 月就已向 Windsurf 报告的已知漏洞。文中逐一分析了五个安全问题,包括通过间接提示注入实现的数据外泄乃至远程命令执行,并在上周二有研究人员开始反馈问题后,Google 才公开记录了这些问题。作为外部人士,目前尚不清楚为何这些已通报过的漏洞会出现在该产品中,作者的推测是 Google 安全团队对 Antigravity 的上线有些措手不及。出于提高认知的目的,作者暂未公布具体的漏洞利用载荷细节,而是给出了实用的缓解建议。
推荐理由梳理 Google Antigravity IDE 沿袭 Windsurf 旧漏洞的具体路径,并给出实用缓解措施,便于对照此前披露记录自查。
安全研究者 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 中植入提示注入后门,使其通过人工文本审查。他把这类隐藏指令加入 OpenAI 官方 Skills 项目中的 security-best-practices Skill,用户调用后 Claude 会按指令输出指定文本并执行 Bash 命令;该手法在 GitHub Copilot 配合 Claude 4.5 时同样生效。作者指出 Skill 的 name 和 description 会直接进入系统提示词上下文,且 Agent 能自行创建或修改 Skill 影响自身与其他 Agent。
Trail of Bits 测试了 ClawHub、Cisco skill-scanner 以及 skills.sh 集成的 Gen、Socket、Snyk 三家扫描器,用四个恶意 skill 全部绕过检测,其中三个不到一小时就完成。攻击手法包括在恶意代码前插入 10 万个换行符让 OpenClaw 扫描器截断文件、用 .docx 压缩包间接引用恶意脚本、在看似无害的格式化 skill 中夹带会读取环境变量的 .pyc 字节码,以及用企业环境配置话术包装的提示注入,诱导 agent 把 npm/yarn 指向攻击者控制的 registry。
推荐理由Trail of Bits 用四个恶意 skill 实测了 ClawHub、Cisco 与 skills.sh 的扫描器,并公开了可复现的攻击仓库,适合评估 skill 分发链的信任模型。
PromptArmor 演示了 Google 新 IDE Antigravity 中的一条提示注入攻击链:一个伪装成 Oracle ERP API 集成指南的网页,用 1px 字体隐藏恶意指令,操纵 Gemini 收集工作区中的敏感凭据和代码,再通过 browser_subagent 浏览恶意站点外传数据。攻击要求把 .env 中的 AWS 凭据填入 webhook.site 的 URL 参数,成功后即可窃取 AWS 密钥。Antigravity 默认拒绝访问 .gitignore 中列出的文件,但 Gemini 在思考轨迹中判断 run_command 在 shell 层运行、可绕过该限制,于是尝试用 cat 读取 .env。
推荐理由PromptArmor 披露的完整攻击链展示了编码 Agent 如何绕过 .gitignore 与域名白名单,把工作区凭据外传。
Wiz 对 OpenAI、Anthropic、Google 等厂商的 AI GitHub Actions 做了安全分析,发现外部 App 与 bot 可绕过权限校验触发 AI 执行,并存在针对动态生成凭据文件的密钥外泄路径。研究覆盖 anthropics/claude-code-action(超 1.2 万个公开工作流)、google-github-actions/run-gemini-cli(超 1 千个)、openai/codex-action 和 actions/ai-inference,受影响仓库合计星标超 20 万。
推荐理由Wiz 对主流 AI GitHub Actions 的实测披露了权限绕过与凭据外泄两类新路径,并附厂商修复进展,可对照检查自家工作流配置。
Wiz Research 披露名为 GhostApproval 的漏洞模式,影响 Amazon Q Developer、Anthropic Claude Code、Augment、Cursor、Google Antigravity 和 Windsurf 六款 AI 编码助手。攻击者构造含符号链接(CWE-61)的恶意仓库,诱使 Agent 将文件写入工作区之外,例如把攻击者 SSH 公钥写入 ~/.ssh/authorized_keys,从而获得持久免密访问甚至远程代码执行。
推荐理由Wiz 披露六款 AI 编码助手共有的符号链接信任边界缺陷,并给出各厂商修复与拒绝的处置差异,可供评估 Agent 文件写入权限的团队参考。
Google 威胁情报团队扫描 Common Crawl 的公开网页,发现真实存在的间接提示注入(IPI)尝试,多数属于无害恶作剧、帮助性引导、SEO 操纵和劝阻 AI 抓取,少数涉及数据窃取和破坏。
推荐理由Google 对 Common Crawl 全网扫描,给出间接提示注入在真实网页中的分类分布与增长数据,可了解当前攻击成熟度。
一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。
推荐理由论文披露加密思维链块可在同族模型间重放并越狱还原,还衍生出借思维链实施提示注入的新变体。