跳到正文

#隐私/数据泄露

今天收录 2 条

第 5 页更新的内容回到最新

8月23日周六
  1. Embrace The Red ·

    Windsurf Cascade 被曝 SpAIware 攻击:记忆持久化数据外泄

    安全研究者披露 Windsurf Cascade 存在 SpAIware 攻击链,攻击者可通过间接提示注入自动调用 create_memory 工具,把恶意指令写入长期记忆,从而在后续所有对话中持续外泄数据。作者发现该记忆工具无需人工批准即自动执行,因此攻击可同时破坏未来对话的机密性、完整性和可用性;注入载荷可藏在源代码注释、GitHub issue 或网页内容中,攻击者还能把外泄图片做成 1 像素透明图以在界面中隐藏。作者于 2025 年 5 月 30 日向 Windsurf 报告,三个月未获实质回应后公开,Windsurf 随后表示将着手修复但未给出时间表。

8月21日周四
  1. Embrace The Red ·

    Windsurf Cascade 被曝提示注入漏洞,可外泄开发者密钥

    安全研究者披露 Windsurf Cascade 存在两条间接提示注入导致数据外泄的路径。第一条利用无需用户批准的 read_url_content 工具,把读取能力变成外发 HTTP 请求通道,当开发者用 Cascade 分析被植入恶意指令的源码文件时,.env 等敏感环境变量会被外泄。第二条是渲染来自不可信域名的图片,与作者此前在 GitHub Copilot 发现的漏洞类似,同样无需人工确认即可把开发者机器上的信息发送到第三方服务器。作者称已于 2025 年 5 月 30 日负责任披露,Windsurf 确认收到后未再回应后续询问,因此三个月后公开,并暂未公布完整技术细节与提示注入载荷。

8月19日周二
  1. Embrace The Red ·

    Amazon Q Developer 经 DNS 请求泄露密钥并遭提示注入劫持

    研究人员披露 Amazon Q Developer VS Code 扩展存在高危漏洞,可通过 DNS 请求将开发者机器上的敏感信息(如 API key)发送到外部服务器,并能借间接提示注入触发该行为。该扩展下载量超过 100 万次,其安全性高度依赖模型行为,executeBash 工具的 ping、dig 等命令属于免人工确认的白名单类别,导致读取 .env 文件并通过 ping 外传无需开发者同意。作者于 2025 年 7 月 5 日向 AWS 提交漏洞,AWS 确认后在未发布公告或分配 CVE 的情况下悄然完成修补,建议用户运行最新版本以获得修复。作者的缓解方案是把 ping 和 dig 移出默认允许列表,改为强制人在回路确认。

8月17日周日
  1. Embrace The Red ·

    Sourcegraph Amp Code 修复通过图片渲染外泄数据的漏洞

    Sourcegraph 的 Amp Code 曾存在一个漏洞,攻击者可利用 markdown 图片渲染外泄敏感信息,该漏洞已被修复。作者用既有演示复现了完整攻击链:托管在网站上的提示注入要求 AI 把先前聊天数据作为查询参数渲染进图片,从而发送到第三方服务器,无需人工介入即可实现 0-click 数据外泄。攻击还能先通过文件读取把敏感信息拉入上下文再泄露,其中调用 grep 工具的隐晦写法用于绕过底层模型的拒答;本例中提示注入来自源代码文件里的注释。作者于 2025 年 6 月 14 日联系 Sourcegraph 后漏洞很快得到处理,建议运行最新版本。

  2. Embrace The Red ·

    Sourcegraph 修复 Amp Code 的不可见提示注入漏洞

    Sourcegraph 的编码 Agent Amp 曾受不可见 Unicode Tag 字符提示注入影响,攻击者可借此劫持 Agent 执行命令并外泄环境变量。作者演示的端到端利用链为:用隐藏字符触发 grep 搜索环境变量,将其编码进 URL 查询参数,再通过 read_web_page 或 markdown 图片渲染把密钥外传;在提示前加上可见的 Do this now 文本能提高可靠性,而模糊搜索如 .e* 和 ANT 可绕过模型对直接索取 API key 的拒答。作者称 Claude、Gemini、Grok 等模型会把隐藏 Unicode Tag 码点当作指令,OpenAI 是唯一在模型核心或 API 层缓解该问题的厂商。

8月14日周四
  1. Embrace The Red ·

    Google Jules 被曝多种数据外泄漏洞

    作者披露 Google Jules 存在多条数据外泄路径,攻击者可通过间接提示注入窃取 Jules 可访问的信息。第一种是 Markdown 图片渲染,Jules 访问被注入的网页后被劫持,把此前对话中的信息拼到第三方 URL 上并加载图片,造成零点击外泄;第二种是 view_text_website 工具,攻击者把载荷写进 GitHub issue,Jules 读取后会把机器上的源码文件内容发送到攻击者服务器,且整个过程在 Jules 提出计划之前就已完成,绕过了人工审批环节。作者还提到第三种路径涉及任意代码执行,将在下一篇展开。

8月11日周一
  1. Embrace The Red ·

    Claude Code 被曝可经 DNS 请求外泄数据,Anthropic 已修复(CVE-2025-55284)

    安全研究者披露 Claude Code 存在高危漏洞,攻击者可通过间接提示注入劫持 Claude Code,把开发者机器上的敏感信息(如 API key)经 DNS 请求发往外部服务器,Anthropic 已于 6 月初修复。作者发现 Claude Code 的 Bash 工具虽需用户批准,但 ping、nslookup、host、dig 等命令在白名单中自动放行,于是把 .env 文件内容拼进 ping 请求的子域名,形成 DNS 外泄通道,也验证了可通过 /proc/PID/environ 泄露环境变量。

8月9日周六
  1. Embrace The Red ·

    OpenHands 被提示注入零点击外泄 GITHUB_TOKEN

    安全研究者披露 OpenHands(原 OpenDevin,由 All-Hands AI 开发)存在零点击数据外泄漏洞:网页、源码或上传文档中的提示注入载荷可用 Markdown 语法强制渲染图片,并把信息拼进 URL 外传,从而窃取容器/VM 内的 GITHUB_TOKEN。模型最初拒绝直接读取并外发 token,作者改用只匹配 ghp_ 子串的方式绕过拒答;OpenHands 对识别为密钥的内容做脱敏后,又用 Base64 编码绕过。

8月8日周五
  1. Embrace The Red · · 原文 82

    研究者用提示注入诱使 Devin 将本地端口暴露到公网

    安全研究者发现 Devin 的系统提示词中包含 expose_port 工具,可将本地端口暴露到公网并返回 .devinapps.com 的公开 URL,且无需人工确认即可调用。作者据此构建多阶段间接提示注入 PoC:第一阶段让 Devin 创建 Python Web 服务器暴露文件系统,第二阶段利用图片 markdown 漏洞把公开 URL 泄露给攻击者服务器,最终攻击者可从公网访问 Devin 机器上的文件。作者称 Devin 起初会拒绝此类请求,但通过跨多个域名和阶段逐步引导即可绕过。

    推荐理由作者用多阶段提示注入实测 Devin 的 expose_port 工具,展示自主 Agent 在无人确认下把本地端口暴露到公网的可复现路径。

8月7日周四
  1. Embrace The Red ·

    研究者披露 Devin 通过四种途径泄露密钥

    安全研究者展示攻击者如何借助间接提示注入,让 Devin 把敏感信息发送到第三方服务器。Devin 内置密钥管理,密钥在运行时以环境变量形式可用,成为外泄目标。作者梳理出四条外泄路径:通过 Shell 工具执行 curl、wget 或 Python 脚本外传数据;通过浏览器工具访问带敏感数据的攻击者 URL;在聊天框渲染指向不可信域名的 Markdown 图片;以及结合 Slack 超链接与不可见 Unicode 字符。测试中 Cognition 似乎已禁用 Devin 发帖时的链接展开,信息未自动泄露,但用户点击看似无害的链接仍会通过 URL 编码把隐藏字符随 HTTP 请求发出。

8月4日周一
  1. Embrace The Red ·

    Cursor IDE 经 Mermaid 渲染任意外泄数据,CVE-2025-54132 已在 v1.3 修复

    安全研究者 Johann 披露 Cursor IDE 存在通过 Mermaid 图表渲染实现任意数据外泄的漏洞,编号 CVE-2025-54132。Cursor 会渲染 Mermaid 图表,而图表中的图片链接可向外部服务器发起请求,且不经过沙箱限制、无需用户确认,因此间接提示注入即可把敏感数据带出。作者演示了两条攻击链:从项目配置文件中 grep 出 API key 并嵌入图片 URL 查询参数外泄,以及把 Cursor 存储的开发者记忆外泄到攻击者服务器。注入来源可以是源代码注释、网页请求、MCP 服务器、图片上传等,恶意模型或幻觉、后门也可能主动触发。

8月3日周日
  1. SPY Lab Blog ·

    arXiv 上 LLM 生成引用趋势分析

    arXiv 上疑似由 LLM 幻觉生成的参考文献占比呈加速上升趋势,2025 年初起明显加剧,时间点与 Deep Research 发布大致吻合。作者用 pdftotext++ 和 AnyStyle 从 2020 年以来的 arXiv PDF 中提取引用,将"标题匹配已有 arXiv 论文但作者列表不同"的引用标记为候选幻觉,再用 Claude Sonnet 4 过滤误报。目前约 0.025%(约 1/4000)的引用疑似幻觉,作者认为这几乎肯定是显著低估。

8月1日周五
  1. Embrace The Red · · 原文 82

    研究者用提示注入绕过 ChatGPT 安全 URL 渲染,外泄聊天历史与记忆

    研究者演示了 OpenAI 的 safe URL 渲染功能存在绕过,使 ChatGPT 可把个人信息发送到第三方服务器,攻击者通过不可信数据中的提示注入即可利用。当用户处理不可信内容(如总结网页或分析 PDF)时,文档作者能外泄提示上下文中的任意信息,包括过往聊天历史。攻击链为:提示注入劫持 ChatGPT,读取系统提示中 Recent Conversation Content 部分,将内容发送到 https://trustnoai.blob.core.windows.net,攻击者再通过 Azure blob 存储日志查看结果。

    推荐理由作者以第一手实测展示 ChatGPT 聊天历史可经提示注入外泄,并给出 url_safe 绕过与披露时间线,便于评估同类渲染风险。

7月22日周二
  1. Rising Tide(Helen Toner) ·

    个性化 AI 正在重演社交媒体最糟糕的那一套

    CDT 旗下 AI Governance Lab 负责人 Miranda Bogen 撰文指出,OpenAI、Google 等公司的记忆功能和基于多年行为画像的用户档案正把个性化推向更深层风险——系统能记住对话中的职业安排乃至家庭矛盾、人际纠纷等信息,其危害可能超过社交媒体推荐算法造成的操纵与歧视,而已有的 AI 安全框架主要针对基础模型的固有能力和国家安全威胁,并未设计来应对这类由个人数据积累引发的新风险类别。

5月5日周一
  1. Embrace The Red ·

    ChatGPT 记忆与聊天历史功能如何运作:一次系统提示词实测

    作者用两个 ChatGPT 账号实测新上线的 chat history 记忆功能,发现它并不真正检索历史对话,而是把用户画像和近期对话写入系统提示词。系统提示词中与记忆相关的部分包括 Model Set Context、Assistant Response Preferences、Notable Past Conversation Topic Highlights、Helpful User Insights、Recent Conversation Content 和 User Interaction Metadata,条目多带有 Confidence=high 标签。

4月30日周三
3月13日周四
  1. Embrace The Red ·

    ASCII Smuggler 更新:用两个不可见字符走私任意 Unicode 数据

    Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。

3月11日周二
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 谈隐私论文为何不能被用来论证生成式 AI 版权问题

    机器学习研究者 Nicholas Carlini 撰文说明其记忆化(memorization)研究的出发点是隐私与安全而非版权,因此法律案件不宜直接援引他的论文作为证据。他指出可从其研究中得出的唯一可靠结论是:模型有时会逐字输出训练数据——例如他在 2020 年从 15 亿参数的 GPT-2 中提取出仅 600 条独特训练样本,但这既不能证明所有模型的常规行为,也不能支撑“模型必然侵犯版权”的主张。

2月17日周一
  1. Embrace The Red · · 原文 80

    研究者实测 ChatGPT Operator 提示注入攻击与三层防护绕过

    安全研究者 Johann 自费订阅 ChatGPT Pro 实测 OpenAI 的 Operator 浏览器智能体,演示了通过网页提示注入劫持 Operator 并窃取用户 PII 的完整攻击链。攻击方式是在 GitHub issue 等页面植入指令,诱导 Operator 跳转到用户已登录的站点(如 news.ycombinator.com、Booking.com、The Guardian),复制私密邮箱、住址和电话,再粘贴到攻击者控制的第三方页面,该页面无需点击提交按钮即可把输入直接发送到服务器。

    推荐理由作者以付费实测展示 Operator 的三层防护如何被绕过,并给出可复现的攻击链与失效边界。

2月10日周一
  1. Embrace The Red ·

    用提示注入与延迟工具调用篡改 Gemini 长期记忆

    研究者演示了通过上传文档中的间接提示注入,配合延迟工具调用,让 Gemini 把攻击者指定的虚假信息写入长期记忆。Gemini 通常不会在处理不可信数据时调用敏感工具,但攻击者先在文档摘要中埋入指令,要求用户在回复 yes、sure 或 no 等触发词时保存记忆,用户一旦照做,Gemini 便误以为这是用户本人的指令而调用记忆工具。演示中写入的虚假记忆包括昵称、年龄和喜好,并可在后续会话中持续存在,作者还通过询问年龄验证了端到端效果。

1月7日周二
  1. Embrace The Red · · 原文 80

    研究者用提示注入把 ChatGPT 变成可远程控制的 ZombAI 节点

    安全研究者 Johann Rehberger 在 Black Hat Europe 演讲中展示了一套命令与控制(C2)系统,通过提示注入远程控制 ChatGPT 实例,构成一种新型僵尸网络的基础。攻击前提是用户被提示注入恶意软件感染一次,途径包括用 ChatGPT 访问恶意网站、分析恶意图片或总结 PDF,恶意指令会持久化在 ChatGPT 的长期存储中。

    推荐理由作者以可复现的 PoC 展示提示注入如何把 ChatGPT 变成可长期远程控制的节点,并给出数据外泄的绕过路径。

12月19日周四
  1. SPY Lab Blog ·

    SPY Lab 立场论文:成员推断攻击无法证明模型训练使用了你的数据

    SPY Lab 在将发表于 SaTML 2025 的立场论文中论证,成员推断(MI)攻击在向法官等第三方证明 GPT-4 等生产模型训练使用了特定数据时存在根本性缺陷。作者将训练数据证明形式化为假设检验,指出其关键在于证明假阳性率(FPR)足够低,而现有研究通过采样零假设来估计 FPR,必须完全控制数据生成与模型训练过程。

11月18日周一
  1. SPY Lab Blog · · 原文 71

    SPY Lab 研究:自然提示下主流 LLM 聊天输出最多 15% 逐字复现网络文本

    SPY Lab 与 Nicholas Carlini、Daphne Ippolito 合作研究发现,在完全自然、非对抗的提示下,主流聊天模型生成的文本中最多 15% 由约 50 字符的片段组成,这些片段可在互联网上逐字找到。研究覆盖创意写作、说服性写作和事实性任务,发现事实性(说明文)任务复现率远高于创意任务,写百科和新闻文章时近 30% 的生成文本包含至少 50 字符的逐字网络片段,且这一模式在所有测试模型中一致,Claude 3 Opus 复现最多。与人类对比,人类文本中位数不含 50 字符的逐字网络片段,而 LLM 文本中位数最多含 10%。

    推荐理由研究用自然提示词而非对抗手段测出主流聊天模型会逐字复现训练数据,为评估数据泄露风险提供了可复现的测量方法。

11月15日周五
10月18日周五
  1. SPY Lab Blog · · 原文 80

    SPY Lab 研究:预训练数据投毒可穿透对齐阶段

    SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。

    推荐理由研究者在从零预训练到 7B 的模型上验证,仅污染 0.1% 预训练数据即可让后门穿过 SFT 与 DPO 存活下来。

7月2日周二
  1. SPY Lab Blog · · 原文 78

    研究者用微调攻击从 ChatGPT 和 Gemini 提取训练数据

    研究者提出一种微调攻击,通过 OpenAI 的黑盒微调 API 撤销模型对齐,从 ChatGPT 和 Gemini 等生产模型中恢复数千条训练样本。他们用 1000 条样本构建微调数据集,让模型学会按前缀续写文本,再用 Wikipedia 的 5-token 字符串提示。在 The Pile 上微调的 GPT-3.5 生成文本有 4.3% 可在互联网上逐字找到,而用发散攻击提取的记忆文本微调后这一比例达 17%,比对齐版 GPT-3.5 高 210 倍;GPT-4 在同样微调下为 11.3%。

    推荐理由研究展示微调 API 可撤销对齐保护,用不到 3 美元即可让 GPT-3.5 与 GPT-4 复现训练数据,为评估微调接口风险提供可复现方法。

6月27日周四
  1. SPY Lab Blog ·

    SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践

    SPY Lab 发布论文与博客,称用于保护艺术家风格不被模型模仿的扰动工具 Glaze 可被绕过,并批评 Glaze 团队在安全实践上的做法。作者指出,Glaze 团队拒绝向研究社区提供源码,使第三方难以评估其鲁棒性;在作者公开论文后,Glaze 团队基于论文信息自行重实现其去噪方案并据此发布 Glaze v2.1,作者实测后称其多数结论不成立,自己的去噪器对 Glaze 2.1 在卡通风格等多种风格上仍然有效。作者还称,仅更换微调脚本就能显著削弱 Glaze 的保护,并指出 Glaze 无法被有意义地修补:已发布到网上的图片可被下载留存,后续补丁无法追溯保护,且 Glaze 失效时不会留下可检测的痕迹。

4月29日周一
  1. SPY Lab Blog · · 原文 71

    SPY Lab 研究:机器学习隐私防御的评测存在误导

    SPY Lab 的研究发现,现有对启发式机器学习隐私防御的评测可能严重低估隐私泄露,在 CIFAR-10 上把各防御(含 DP-SGD)调到至少 88% 测试准确率时,既有评测对泄露的低估可达五十倍。作者指出常见评测的三个问题:只关注群体层面的隐私、使用弱且非自适应的攻击、对比低效用的 DP 基线。论文提出以最脆弱样本的样本级隐私、强自适应攻击和恰当 DP 基线为原则的新评测协议,并设计一小组金丝雀来高效近似最脆弱样本的泄露,金丝雀需随防御方法选择,误标或非典型样本是常见起点。将协议用于五种启发式防御(涉及知识蒸馏、合成数据和损失扰动)后,它们均比原评测泄露更多,且没有一个能胜过调好超参数的启发式 DP-SGD 基线。

    推荐理由原文指出隐私防御评测普遍高估防护效果,并给出可复用的样本级评测协议与金丝雀设计思路。

12月5日周二
  1. 腾讯玄武实验室 ·

    腾讯玄武实验室提出端侧提示词隐私保护方案并开源中文权重

    腾讯安全玄武实验室提出一种可部署在端侧的提示词隐私保护方案,在调用云端 LLM 的流程中插入两个端侧步骤,先平行替换隐私实体完成脱敏,再还原云端输出中的隐私实体。方案用标注的平行语料训练了一个权重约 500MB 的小模型,基于开源模型 Bloom,在手机和笔记本上完成部署实验;仅用 CPU 时 MacBook M2 推理速度 180-200 tokens/s,MacBook M1 为 110-130 tokens/s,Pixel 8 Pro 为 20-30 tokens/s。原生支持润色、摘要、翻译、阅读理解和文本分类,并支持 Zero Shot 自定义扩展任务。

10月18日周三
12月5日周六
已经到底了