跳到正文

#Google DeepMind

今天还没有收录新动态
10月1日周四
  1. Stolen Thoughts · 84

    研究者称仍可通过第三方云聚合商窃取美国前沿模型的推理轨迹

    研究者对 OpenAI、Anthropic 直连端点及 AWS Bedrock、Microsoft Azure、OpenRouter 等下游云聚合商做了审计,发现厂商针对推理轨迹提取的修补碎片化且易被绕过。推理重放攻击在 Azure 上对每个 OpenAI 模型(含 GPT-6 Astra)以及 Anthropic 直到 Sonnet 5 的模型仍间歇有效,一次解码即可逐字还原轨迹;scratchpad 攻击仍能从所有 OpenAI 模型以及 Opus 4.8、Sonnet 5 提取推理,目前只有 Opus 5、Fable 5、Fable 5.1 不暴露推理。作者指出下游主机存在补丁传播延迟和策略漂移,攻击者无需绕过主厂商护栏,只需把请求路由到未同步防护的下游主机即可,并建议对无法同步执行推理轨迹保密与工具范围护栏的云主机不予授权。

    推荐理由作者实测多家云聚合商上的推理轨迹提取,指出厂商补丁在下游存在传播延迟,可据此检查多云部署的防护一致性。

  2. arXiv:防御、护栏、反学习与有害微调 ·

    研究揭示多轮攻击中危害性表征的几何演化

    研究分析了 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 和 Gemma-2-9B-it 三个指令微调模型在 Crescendo、ActorAttack 和 X-Teaming 三种多轮攻击框架下的隐藏状态表征。结果显示,不同攻击框架沿不同的几何方向推进,但都能取得相近的有害输出成功率;危害性方向在对话轮次推进中于中后层模型的回合末 token 位置逐渐变得线性可分;危害性表征与拒答相关表征仅弱对齐。作者认为,多轮攻击并非通过压制模型内部的危害性表征来成功,而是让危害性表征随轮次变得更可分,这可能是静态单轮安全探针在多轮场景下退化的一种解释,稳健防御需考虑表征的时间动态。

  3. arXiv:越狱与提示注入 · 80

    SceneJail:利用视频场景上下文越狱多模态大模型

    研究者提出 SceneJail,一个自适应黑盒越狱框架,把视频中的周边场景而非有害查询的呈现方式当作攻击面:同一有害查询放在不同视频场景中,会得到不同的安全响应。框架由两部分组成:自适应场景构建搜索与有害查询语境相容的场景,场景感知提示搜索再根据黑盒响应反馈为该场景搜索文本引导。在 HADES 和 SafeBench 数据集、八个 Video-MLLM(含 GPT-4.1 和 Gemini 3.5 Flash 两个闭源模型)上,持续完整呈现查询的 SceneJail-F 平均攻击成功率最高 91.5%,比最强基线高 29.1 个百分点;把查询分散到连续帧的 SceneJail-S 在严格图像过滤下仍保持 72.3%。

    推荐理由论文把视频场景本身当作攻击面,并给出跨八个 Video-MLLM 的成功率与三种防御下的表现,可供多模态安全评测参考。

9月28日周一
  1. arXiv:越狱与提示注入 ·

    RISE:用迭代策略演化对现代文生图模型做红队测试

    研究者提出 RISE,通过演化可复用的攻击策略而非逐条改写提示词,对现代文生图系统做红队测试。作者先指出,此前 T2I 红队工作中广泛使用的判官在模糊的不安全内容目标下不可靠,会漏掉真实违规或在硬化 API 上奖励良性边缘图像,因此定义了严格的分类别成功标准,并用人工标注校准了强 VLM 判官。作者还发现常用的提示词修改流程在更严的护栏设置下仍受限于种子提示词、无法迁移或难以自举正样本。在 DALL-E 3、Nano Banana 2(Google)和 GPT-Image-2 上,RISE 达到最高 13% 的人工核验 ASR;在同一套校准评测下,此前报告 ASR 高达约 30% 的方法降至接近零。

9月26日周六
  1. arXiv:越狱与提示注入 · · 原文 81

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    瑞士意大利语区大学的研究者提出用规则化、可逆的语义保持变换作为对齐泛化的受控探针,在八个模型上发现一种被称为对齐-效用不对称的现象:模型一旦能在变换后的输入上正常工作,任务效用往往基本保留,而对齐失败上升得更陡。在微调设置下,GPT-4.1 mini 的有害率从 13.3% 升至 74.3%,效用下降有限;Llama3-8B、Gemma-7B、Qwen2.5-7B 的对齐差距分别达 64.0、51.0、63.3 个百分点。在 ICL 设置下,Gemini 3 Flash 有害率从 2.3% 升至 43.0%,Claude 4 Sonnet 从 0.0% 升至 12.0%。仅用良性变换数据微调(ρ=0)时对齐失败仍升至 40.3%,说明该不对称无需接触变换后的有害样本即可出现;谄媚与 BBQ 公平性两个维度也出现类似退化。作者据此建议发布评估不应只依赖标准形式提示词。

    推荐理由论文用可控的语义保持变换同时测量任务效用与对齐失败,给出了八款模型上效用保留而对齐失效的具体差距。

9月24日周四
  1. arXiv:越狱与提示注入 · · 原文 80

    输出前缀攻击瞄准推理模型:注入推理通道可将攻击成功率推高至 99%

    该研究首次系统隔离推理模型的 scratchpad 推理通道作为输出前缀攻击面,在 AdvBench 的 1,800 个测试用例上对 Gemini 3 Flash Preview、DeepSeek V4 Flash 和 Claude Haiku 4.5 三个前沿模型做了 3×2 因子实验(前缀类型 × 是否注入恶意推理)。结果显示,单独注入恶意推理几乎无效(攻击成功率约 0%),但同样的推理加上一句简单的输出前缀后,部分模型的攻击成功率最高升至 99%。上下文相关前缀优于静态前缀,且易感性高度依赖模型:Claude Haiku 4.5 在所有策略下攻击成功率不超过 1%,Gemini 3 Flash Preview 在推理加静态前缀下达 99%,DeepSeek V4 Flash 从静态前缀的 19% 升至上下文前缀的 56%。

    推荐理由论文用 3×2 因子设计在三个前沿模型上量化了推理通道注入的增益,并给出推理单独注入为何无效的 token 分布解释。

9月19日周六
  1. arXiv:Agent 与 MCP 安全 · · 原文 84

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    特拉维夫大学研究者提出爆炸性提示词(explosive prompt),一种把恶意载荷写成条件语句、在攻击者选定的触发词出现前保持休眠的间接提示注入形式,无需训练即可在推理时植入单条检索内容。在 896 对配对样本上,同一恶意目标改为休眠条件式后,在拒绝直接指令的前沿模型上仍能触发真实工具调用,Grok-4.20 从 0.0% 升至 34.2%,Llama-3.1-70B 从 0.1% 升至 26.1%,七款模型配对均值 16.5% 对 2.4%。已部署的注入分类器 Prompt Guard 2、PIGuard、PIShield 在其工作阈值上校准失当,1% 误报预算下最多只拦住 52.7%;偏好优化模型 SecAlign 完全阻断直接注入,却仍执行 11.8% 的爆炸性提示词,且全部在触发轮触发。

    推荐理由论文把条件触发式提示注入与普通注入做了配对实测,并给出九款生产 Agent 的绕过率,部署 Agent 的团队可据此检查检索内容的摄入环节。

9月14日周一
  1. arXiv:越狱与提示注入 ·

    如何像孩子一样向前沿 AI 提问:跨 OpenAI、Anthropic、xAI 与 Google DeepMind 六款模型的"认知越狱"实验

    一项实验对 OpenAI、Anthropic、xAI 和 Google DeepMind 的六种前沿模型各做 10 次独立会话,用同一套三阶段提示词从架构偏好问到完整 ASCII 主干。在"学校听众"设定下,回答反复收敛到同一架构模式,包含持久潜在状态、自适应计算、记忆、专家路由、验证、停止控制与延迟解码;去掉该设定后回答明显更异质,无法复现同样的稳定主题收敛。GPT-5.6 Sol 给出的后继架构与 GPT-6 Astra 独立勾勒的架构高度重叠,作者称随要求具体化而出现的技术溯源失范为"认知越狱",并强调实验只确立可复现的行为模式,未验证任何专有实现主张。

9月9日周三
  1. arXiv:对齐与欺骗 · · 原文 78

    研究:任意密文攻击前沿大模型无需微调即可越狱

    McGill 大学研究者 Thomas Rivasseau 发现,前沿大模型无需微调即可通过提示和上下文学习掌握字母置换密文通信,并借此绕过对齐与有害性分类器。攻击分三步:先用提示让模型接受一套字母置换方案,再给出若干密文问答示例,最后用该方案发送有害请求;密文在分类器看来只是乱码。作者关闭模型推理,因为开启后模型会把指令解密成明文,足以绕过分类器但不足以绕过对齐。单次注入完整置换的方案在 Claude Sonnet 4 上稳定成功,可产出炸弹、生物武器制作说明和攻击代码;迭代逐级教授字母交换的方案在 Gemini 3 Flash preview 上成功。作者称对 Claude Sonnet 4 实现完全越狱、Gemini 3 完全越狱、Claude Sonnet 4.5 仅证明可行性、GPT 5.5 需结合已知越狱提示词。

    推荐理由论文给出无需微调、仅靠提示与上下文学习即可让前沿模型用字母置换密文绕过拒答与有害性分类器的完整方法。

9月8日周二
  1. arXiv:后门、投毒与隐私 ·

    WPMIA:面向严格黑盒大模型的词级概率成员推断攻击

    研究者提出 Word-level Probability MIA(WPMIA),一种面向严格黑盒场景的成员推断攻击,用于判断某段文本是否被纳入大语言模型的训练语料。该方法通过蒙特卡洛采样结合局部核平滑估计词级生成概率,再聚合成序列级似然估计,并构造不同前缀条件下的似然以放大成员与非成员之间的分布差异。在多个开源大语言模型上,WPMIA 一致优于现有黑盒基线;在 GPT-5-Chat、Gemini-2.5-Flash 和 Claude-4.5-Haiku 等闭源模型上,平均 TPR@5%FPR 达到 42.0。论文共 17 页、5 张图、17 张表,代码已公开。

  2. arXiv:越狱与提示注入 ·

    结构越狱可跨厂商泛化但不叠加:IICL 的跨厂商与多语言研究

    研究用确定性的 IICL 操作符和 StrongREJECT 式评分,对两个 Google Gemini 模型在 HarmBench 的 30 项一般危害行为和 FinProof 的 30 项金融滥用行为上做红队测试,覆盖英语、西班牙语、印地语、阿拉伯语。IICL 可泛化到第二个厂商,且金融场景更严重:HarmBench 上攻击成功率从不超过 6.7% 升至 80-90%,FinProof 上从不超过 6.7% 升至 97-100%,比该方法的原始研究在 OpenAI GPT-5.4 上报告的 24% 高一个数量级。

8月20日周四
  1. Adversa AI · · 原文 76

    Adversa AI 披露 Cryptographic Context Injection 攻击:Grok 零点击泄露聊天记录,Gemini 被绕过安全策略

    Adversa AI 公开了一种名为 Cryptographic Context Injection 的攻击手法,把恶意指令封装成 AES-256-GCM 密文并诱导模型在自己的代码执行沙箱中解密,使解密后的指令以运行时输出的形式进入可信上下文,从而绕过静态护栏。在 xAI Grok 网页版聊天中,用户只需发出普通的“总结这个页面”请求,页面内嵌的加密 JSON 就会让 Agent 调用其联网导航工具,把用户名、粗略位置、订阅等级和整段对话历史拼进 URL 参数发往攻击者服务器,全程无点击、无确认、无警告。

    推荐理由Adversa AI 公开了一种把恶意指令藏进 AES 密文、借模型自身代码运行时解密的新型注入手法,并给出 Grok 零点击窃取聊天记录与 Gemini 绕过安全策略的复现结果。

  2. arXiv ·

    TempJail:通过字幕时间调度对大型视觉语言模型发起时序越狱攻击

    研究者提出 TempJail,一种黑盒视频越狱框架,通过构造与查询对齐的对话式字幕序列并优化其时间调度,利用大型视觉语言模型(LVLM)在时间维度上的脆弱性诱导出符合原始有害意图的回答。分析发现,越狱效果不仅取决于文本语义,还取决于其时间呈现方式,包括持续时长和时段分配;字幕因在真实视频中常见且可精确控制时间而不显突兀,被用作攻击媒介。在四个代表性 LVLM 和两个数据集上的实验显示,TempJail 在所有模型与数据集组合中取得最高攻击成功率,在 GPT-5 和 Gemini 3.5-Flash 上数据集平均 ASR 分别比最强基线高出 53 和 18 个百分点。论文共 8 页、4 张图。

8月18日周二
  1. Adversa AI · · 原文 78

    Adversa AI 盘点针对 AI 智能体的十起零点击攻击

    Adversa AI 汇总了十起针对 AI 智能体的零点击攻击,受害者在正常工作流中不点击、不授权,仍会丢失数据或机器控制权。十起中有九起出现在已商业发售的产品里,涉及 Microsoft 365 Copilot、Cursor、Claude Code、Gemini CLI、Perplexity Comet、ChatGPT 等;三起获得 CVE,评分多在 9.3 以上,其余七起或被静默修补,或被厂商以超出威胁模型为由拒绝。共同机制是不可信内容经正常检索进入模型上下文,模型无法区分内容与指令,随后由智能体自身权限执行攻击;外泄通道从图片预取、厂商云端服务端 HTTP,逐步转向浏览器导航、Outlook 正常发信和开发者 shell。

    推荐理由梳理十起零点击攻击的入口、外泄通道与厂商处置差异,可对照检查自家 Agent 的检索信任边界与出站通道。

8月12日周三
  1. Simon Willison(提示注入) · · 原文 76

    论文披露从专有 LLM API 窃取加密思维链的方法

    一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。

    推荐理由论文披露加密思维链块可在同族模型间重放并越狱还原,还衍生出借思维链实施提示注入的新变体。

7月8日周三
  1. Wiz Research · · 原文 84

    Wiz 披露 GhostApproval 漏洞:六款 AI 编码助手存在符号链接信任边界缺陷

    Wiz Research 披露名为 GhostApproval 的漏洞模式,影响 Amazon Q Developer、Anthropic Claude Code、Augment、Cursor、Google Antigravity 和 Windsurf 六款 AI 编码助手。攻击者构造含符号链接(CWE-61)的恶意仓库,诱使 Agent 将文件写入工作区之外,例如把攻击者 SSH 公钥写入 ~/.ssh/authorized_keys,从而获得持久免密访问甚至远程代码执行。

    推荐理由Wiz 披露六款 AI 编码助手共有的符号链接信任边界缺陷,并给出各厂商修复与拒绝的处置差异,可供评估 Agent 文件写入权限的团队参考。

6月3日周三
  1. Trail of Bits Blog · · 原文 82

    Trail of Bits 绕过 ClawHub、Cisco 与 skills.sh 的 skill 扫描器

    Trail of Bits 测试了 ClawHub、Cisco skill-scanner 以及 skills.sh 集成的 Gen、Socket、Snyk 三家扫描器,用四个恶意 skill 全部绕过检测,其中三个不到一小时就完成。攻击手法包括在恶意代码前插入 10 万个换行符让 OpenClaw 扫描器截断文件、用 .docx 压缩包间接引用恶意脚本、在看似无害的格式化 skill 中夹带会读取环境变量的 .pyc 字节码,以及用企业环境配置话术包装的提示注入,诱导 agent 把 npm/yarn 指向攻击者控制的 registry。

    推荐理由Trail of Bits 用四个恶意 skill 实测了 ClawHub、Cisco 与 skills.sh 的扫描器,并公开了可复现的攻击仓库,适合评估 skill 分发链的信任模型。

5月26日周二
  1. Adversa AI · · 原文 87

    Adversa AI 披露 SymJack:符号链接劫持在六款 AI 编码 Agent 上实现 RCE

    Adversa AI 研究员 Rony Utevsky 披露名为 SymJack 的攻击手法,通过恶意仓库中的符号链接劫持,让 AI 编码 Agent 在用户批准一次看似无害的文件复制时改写自身配置,并在下次重启时以用户权限执行攻击者代码。该手法在 Claude Code、Gemini CLI/Antigravity CLI、Cursor Agent CLI、GitHub Copilot CLI、Grok Build CLI 和 OpenAI Codex CLI 六款产品上得到验证,作者认为这是架构层面的共性问题而非单个产品的漏洞。

    推荐理由Adversa AI 披露的 SymJack 用符号链接劫持让审批提示显示错误写入目标,六个编码 Agent 的厂商回应与修复差异可供对照。

5月7日周四
  1. Adversa AI · · 原文 82

    TrustFall:Claude Code、Cursor、Gemini CLI 与 Copilot CLI 存在一键 RCE 缺陷

    Adversa AI 披露 TrustFall 缺陷:Claude Code、Gemini CLI、Cursor CLI、Copilot CLI 四个编码 CLI 在开发者接受文件夹信任提示后,会立即执行项目自定义的 MCP 服务器,恶意仓库只需一次回车即可触发未沙箱化的 RCE。

    推荐理由报告给出四个编码 CLI 在信任对话框后自动执行项目 MCP 服务器的完整链路,并附可复现 PoC 与端点加固清单。

4月30日周四
  1. Wiz Research · · 原文 78

    Wiz 披露 AI GitHub Actions 的权限绕过与密钥外泄风险

    Wiz 对 OpenAI、Anthropic、Google 等厂商的 AI GitHub Actions 做了安全分析,发现外部 App 与 bot 可绕过权限校验触发 AI 执行,并存在针对动态生成凭据文件的密钥外泄路径。研究覆盖 anthropics/claude-code-action(超 1.2 万个公开工作流)、google-github-actions/run-gemini-cli(超 1 千个)、openai/codex-action 和 actions/ai-inference,受影响仓库合计星标超 20 万。

    推荐理由Wiz 对主流 AI GitHub Actions 的实测披露了权限绕过与凭据外泄两类新路径,并附厂商修复进展,可对照检查自家工作流配置。

4月24日周五
  1. Google Security Blog · · 原文 74

    Google 扫描公开网页:间接提示注入的真实分布与增长趋势

    Google 威胁情报团队扫描 Common Crawl 的公开网页,发现真实存在的间接提示注入(IPI)尝试,多数属于无害恶作剧、帮助性引导、SEO 操纵和劝阻 AI 抓取,少数涉及数据窃取和破坏。

    推荐理由Google 对 Common Crawl 全网扫描,给出间接提示注入在真实网页中的分类分布与增长数据,可了解当前攻击成熟度。

2月11日周三
  1. Embrace The Red ·

    研究者演示在 Agent Skill 中植入不可见 Unicode 后门并发布扫描工具

    安全研究者 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 中植入提示注入后门,使其通过人工文本审查。他把这类隐藏指令加入 OpenAI 官方 Skills 项目中的 security-best-practices Skill,用户调用后 Claude 会按指令输出指定文本并执行 Bash 命令;该手法在 GitHub Copilot 配合 Claude 4.5 时同样生效。作者指出 Skill 的 name 和 description 会直接进入系统提示词上下文,且 Agent 能自行创建或修改 Skill 影响自身与其他 Agent。

12月11日周四
11月26日周三
  1. Simon Willison(提示注入) · · 原文 78

    PromptArmor 披露 Google Antigravity 提示注入数据外泄链

    PromptArmor 演示了 Google 新 IDE Antigravity 中的一条提示注入攻击链:一个伪装成 Oracle ERP API 集成指南的网页,用 1px 字体隐藏恶意指令,操纵 Gemini 收集工作区中的敏感凭据和代码,再通过 browser_subagent 浏览恶意站点外传数据。攻击要求把 .env 中的 AWS 凭据填入 webhook.site 的 URL 参数,成功后即可窃取 AWS 密钥。Antigravity 默认拒绝访问 .gitignore 中列出的文件,但 Gemini 在思考轨迹中判断 run_command 在 shell 层运行、可绕过该限制,于是尝试用 cat 读取 .env。

    推荐理由PromptArmor 披露的完整攻击链展示了编码 Agent 如何绕过 .gitignore 与域名白名单,把工作区凭据外传。

11月25日周二
  1. Embrace The Red · · 原文 82

    Google Antigravity IDE 存在五个已知安全漏洞,含数据外泄与远程命令执行

    研究者指出,基于 Windsurf 授权协议推出的 Google Antigravity IDE 延续了多个早在 2025 年 5 月就已向 Windsurf 报告的已知漏洞。文中逐一分析了五个安全问题,包括通过间接提示注入实现的数据外泄乃至远程命令执行,并在上周二有研究人员开始反馈问题后,Google 才公开记录了这些问题。作为外部人士,目前尚不清楚为何这些已通报过的漏洞会出现在该产品中,作者的推测是 Google 安全团队对 Antigravity 的上线有些措手不及。出于提高认知的目的,作者暂未公布具体的漏洞利用载荷细节,而是给出了实用的缓解建议。

    推荐理由梳理 Google Antigravity IDE 沿袭 Windsurf 旧漏洞的具体路径,并给出实用缓解措施,便于对照此前披露记录自查。

9月25日周四
  1. Embrace The Red · · 原文 78

    跨 Agent 提权:一个 Agent 如何改写另一个 Agent 的配置并放它出沙箱

    研究者展示了一种跨 Agent 提权攻击链:被间接提示注入劫持的 GitHub Copilot 可以写入 Claude Code 的 MCP 配置和 CLAUDE.md 等指令文件,添加恶意 MCP server 或放行 shell 命令,等开发者使用 Claude Code 时这些改动被加载并执行任意代码,Claude 还能反向改写 Copilot 配置形成升级循环。

    推荐理由作者以 GitHub Copilot 与 Claude Code 为例演示跨 Agent 提权链,并给出隔离配置、最小权限等可迁移的缓解思路。

8月21日周四
  1. Embrace The Red ·

    Windsurf Cascade 被曝提示注入漏洞,可外泄开发者密钥

    安全研究者披露 Windsurf Cascade 存在两条间接提示注入导致数据外泄的路径。第一条利用无需用户批准的 read_url_content 工具,把读取能力变成外发 HTTP 请求通道,当开发者用 Cascade 分析被植入恶意指令的源码文件时,.env 等敏感环境变量会被外泄。第二条是渲染来自不可信域名的图片,与作者此前在 GitHub Copilot 发现的漏洞类似,同样无需人工确认即可把开发者机器上的信息发送到第三方服务器。作者称已于 2025 年 5 月 30 日负责任披露,Windsurf 确认收到后未再回应后续询问,因此三个月后公开,并暂未公布完整技术细节与提示注入载荷。

8月17日周日
  1. Embrace The Red ·

    Sourcegraph 修复 Amp Code 的不可见提示注入漏洞

    Sourcegraph 的编码 Agent Amp 曾受不可见 Unicode Tag 字符提示注入影响,攻击者可借此劫持 Agent 执行命令并外泄环境变量。作者演示的端到端利用链为:用隐藏字符触发 grep 搜索环境变量,将其编码进 URL 查询参数,再通过 read_web_page 或 markdown 图片渲染把密钥外传;在提示前加上可见的 Do this now 文本能提高可靠性,而模糊搜索如 .e* 和 ANT 可绕过模型对直接索取 API key 的拒答。作者称 Claude、Gemini、Grok 等模型会把隐藏 Unicode Tag 码点当作指令,OpenAI 是唯一在模型核心或 API 层缓解该问题的厂商。

8月15日周五
  1. Embrace The Red · · 原文 78

    Google Jules 被曝可被不可见提示注入攻击

    安全研究者 Johann Rehberger 演示了针对 Google Jules 的不可见提示注入攻击:在 GitHub issue 正文中嵌入隐藏的 Unicode Tag 字符,Jules 会将其当作指令执行,自动添加后门函数、编译并运行代码。作者指出 Gemini 系列模型能较稳定地把隐藏 Unicode Tag 字符解读为指令,该问题最早于 2024 年 2 月 22 日报告给 Google 并被确认为有效漏洞,但模型和 API 层面至今未修复,因此影响所有基于 Gemini 构建的应用。

    推荐理由作者用可复现步骤演示隐藏 Unicode 字符如何劫持 Jules 写入后门,并给出针对编码 Agent 的缓解清单。

8月14日周四
  1. Embrace The Red · · 原文 76

    研究者演示通过提示注入劫持 Google Jules 并远程控制其开发机

    研究者演示了通过 GitHub issue 中的间接提示注入劫持 Google Jules 编码 Agent 的攻击链,使其下载 Sliver 恶意软件并接入远程命令控制服务器,开发机被完全控制。攻击利用 Jules 的 run_in_bash_session 工具执行任意系统命令,且 Jules 具备不受限的外网访问能力。Jules 只在会话开始时提出计划,后续任务会自动调用工具而不再触发确认,初始计划在超时后也会自动批准,该超时时间从 20 秒改为 120 秒。作者建议谨慎让 Jules 处理不可信数据、避免其接触私有代码和生产密钥,并参考 ChatGPT Codex 默认禁止任意外网访问的做法。

    推荐理由作者以第一手实测展示编码 Agent 被间接提示注入后下载恶意软件并接入 C2 的完整链路,并给出可迁移的缓解建议。

  2. Embrace The Red ·

    Google Jules 被曝多种数据外泄漏洞

    作者披露 Google Jules 存在多条数据外泄路径,攻击者可通过间接提示注入窃取 Jules 可访问的信息。第一种是 Markdown 图片渲染,Jules 访问被注入的网页后被劫持,把此前对话中的信息拼到第三方 URL 上并加载图片,造成零点击外泄;第二种是 view_text_website 工具,攻击者把载荷写进 GitHub issue,Jules 读取后会把机器上的源码文件内容发送到攻击者服务器,且整个过程在 Jules 提出计划之前就已完成,绕过了人工审批环节。作者还提到第三种路径涉及任意代码执行,将在下一篇展开。

3月13日周四
  1. Embrace The Red ·

    ASCII Smuggler 更新:用两个不可见字符走私任意 Unicode 数据

    Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。

2月10日周一
  1. Embrace The Red ·

    用提示注入与延迟工具调用篡改 Gemini 长期记忆

    研究者演示了通过上传文档中的间接提示注入,配合延迟工具调用,让 Gemini 把攻击者指定的虚假信息写入长期记忆。Gemini 通常不会在处理不可信数据时调用敏感工具,但攻击者先在文档摘要中埋入指令,要求用户在回复 yes、sure 或 no 等触发词时保存记忆,用户一旦照做,Gemini 便误以为这是用户本人的指令而调用记忆工具。演示中写入的虚假记忆包括昵称、年龄和喜好,并可在后续会话中持续存在,作者还通过询问年龄验证了端到端效果。

7月2日周二
  1. SPY Lab Blog · · 原文 78

    研究者用微调攻击从 ChatGPT 和 Gemini 提取训练数据

    研究者提出一种微调攻击,通过 OpenAI 的黑盒微调 API 撤销模型对齐,从 ChatGPT 和 Gemini 等生产模型中恢复数千条训练样本。他们用 1000 条样本构建微调数据集,让模型学会按前缀续写文本,再用 Wikipedia 的 5-token 字符串提示。在 The Pile 上微调的 GPT-3.5 生成文本有 4.3% 可在互联网上逐字找到,而用发散攻击提取的记忆文本微调后这一比例达 17%,比对齐版 GPT-3.5 高 210 倍;GPT-4 在同样微调下为 11.3%。

    推荐理由研究展示微调 API 可撤销对齐保护,用不到 3 美元即可让 GPT-3.5 与 GPT-4 复现训练数据,为评估微调接口风险提供可复现方法。

已经到底了