跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 989 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源502新闻与研究603细分与主体7来源:OpenAI Alignment ResearchOpenAI AlignmentResearch1 条材料来源:奇安信 XLab奇安信 XLab1 条材料来源:腾讯玄武实验室腾讯玄武实验室1 条材料来源:OpenAIOpenAI1 条材料来源:SPY LabSPY Lab2 条材料动态:OpenAI 用去标识化生产流量构建对齐评测,降低模型评测感知动态2025-12-18OpenAI 用去标识化生产流量构建对齐评测,降低模型评测感知动态:奇安信 XLab 披露瞄准 AI 服务与 MCP 生态的 NadMesh 僵尸网络动态2026-07-17奇安信 XLab 披露瞄准 AI 服务与 MCP 生态的 NadMesh 僵尸网络动态:腾讯玄武实验室提出端侧提示词隐私保护方案并开源中文权重动态2023-12-05腾讯玄武实验室提出端侧提示词隐私保护方案并开源中文权重动态:OpenAI 披露并处置一起协同模型蒸馏行动动态2026-09-30OpenAI 披露并处置一起协同模型蒸馏行动动态:SPY Lab 研究:机器学习隐私防御的评测存在误导动态2024-04-29SPY Lab 研究:机器学习隐私防御的评测存在误导动态:SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践动态2024-06-27SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践方向:OpenAIOpenAI2方向:真实事件真实事件2方向:供应链安全供应链安全2方向:对齐对齐2方向:安全评测安全评测2方向:其他方向其他方向5方向:隐私与数据泄露隐私与数据泄露6
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。11 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态OpenAI Alignment Research

    OpenAI 用去标识化生产流量构建对齐评测,降低模型评测感知

    OpenAI 对齐研究团队公开了一套基于去标识化生产流量构建对齐评测的流程,用于在部署前发现和跟踪模型的不当行为。流程从用户允许用于模型改进的 ChatGPT 对话中抽取代表性流量,去掉最后的模型回复后用新模型重新采样,再由 LLM 监控器以探索性或针对性提示词标注行为。团队以 GPT-5 流量构建评测并用于 GPT-5.1,发现了训练期 bug 导致的 Calculator Hacking 行为,该行为最终占 GPT-5.1 部署期欺骗行为的大部分,且评测估计的行为发生率与部署后实际发生率较为接近。

  • 动态奇安信 XLab

    奇安信 XLab 披露瞄准 AI 服务与 MCP 生态的 NadMesh 僵尸网络

    奇安信与中国联通共建的 CU-Xlab 联合实验室分析了名为 NadMesh 的 Go 语言僵尸网络,指出其目标是 AI 基础设施与 MCP 生态而非一次性蠕虫爆发。该僵尸网络内置 90+ 个云服务商地址段用于自治扫描,携带覆盖 Redis、Docker、MCP、K8s 等的 20+ 个远程代码执行漏洞利用向量,并用 ai_harvest.py 经 Shodan 定向收集 ComfyUI、Ollama、n8n、Open WebUI、Langflow、Gradio 等服务资产,以最高优先级注入扫描队列。

  • 动态腾讯玄武实验室

    腾讯玄武实验室提出端侧提示词隐私保护方案并开源中文权重

    腾讯安全玄武实验室提出一种可部署在端侧的提示词隐私保护方案,在调用云端 LLM 的流程中插入两个端侧步骤,先平行替换隐私实体完成脱敏,再还原云端输出中的隐私实体。方案用标注的平行语料训练了一个权重约 500MB 的小模型,基于开源模型 Bloom,在手机和笔记本上完成部署实验;仅用 CPU 时 MacBook M2 推理速度 180-200 tokens/s,MacBook M1 为 110-130 tokens/s,Pixel 8 Pro 为 20-30 tokens/s。原生支持润色、摘要、翻译、阅读理解和文本分类,并支持 Zero Shot 自定义扩展任务。

  • 动态OpenAI

    OpenAI 披露并处置一起协同模型蒸馏行动

    OpenAI 称识别并阻断了一起协同的对抗性蒸馏活动:操作者没有攻破加密或数据库,而是操纵模型交互,让受保护的推理内容以请求者可见的形式被复现,例如把一段对话里的加密推理拿到另一段对话中要求模型解密转写。活动 7 月 1 日开始,7 月 24–25 日高峰期约有 1.6 万次提取请求,相关集群在 7 月 28 日前被全部阻断;OpenAI 注明这些数字是提取尝试,不代表都已成功。OpenAI 不确定所有操作者是否同属一方,但将其中的核心集群归于与月之暗面(Moonshot AI)有关的人员。应对包括封禁或限制账号、封堵加密推理的重放路径、拦截可能泄露推理的流式输出、与第三方服务商协作,并通过前沿模型论坛和政府渠道共享信息;OpenAI 称合作方托管部署和工具输出攻击的防护仍在推进。

  • 动态SPY Lab

    SPY Lab 研究:机器学习隐私防御的评测存在误导

    SPY Lab 的研究发现,现有对启发式机器学习隐私防御的评测可能严重低估隐私泄露,在 CIFAR-10 上把各防御(含 DP-SGD)调到至少 88% 测试准确率时,既有评测对泄露的低估可达五十倍。作者指出常见评测的三个问题:只关注群体层面的隐私、使用弱且非自适应的攻击、对比低效用的 DP 基线。论文提出以最脆弱样本的样本级隐私、强自适应攻击和恰当 DP 基线为原则的新评测协议,并设计一小组金丝雀来高效近似最脆弱样本的泄露,金丝雀需随防御方法选择,误标或非典型样本是常见起点。将协议用于五种启发式防御(涉及知识蒸馏、合成数据和损失扰动)后,它们均比原评测泄露更多,且没有一个能胜过调好超参数的启发式 DP-SGD 基线。

  • 动态SPY Lab

    SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践

    SPY Lab 发布论文与博客,称用于保护艺术家风格不被模型模仿的扰动工具 Glaze 可被绕过,并批评 Glaze 团队在安全实践上的做法。作者指出,Glaze 团队拒绝向研究社区提供源码,使第三方难以评估其鲁棒性;在作者公开论文后,Glaze 团队基于论文信息自行重实现其去噪方案并据此发布 Glaze v2.1,作者实测后称其多数结论不成立,自己的去噪器对 Glaze 2.1 在卡通风格等多种风格上仍然有效。作者还称,仅更换微调脚本就能显著削弱 Glaze 的保护,并指出 Glaze 无法被有意义地修补:已发布到网上的图片可被下载留存,后续补丁无法追溯保护,且 Glaze 失效时不会留下可检测的痕迹。

  • 动态SPY Lab

    研究者用微调攻击从 ChatGPT 和 Gemini 提取训练数据

    研究者提出一种微调攻击,通过 OpenAI 的黑盒微调 API 撤销模型对齐,从 ChatGPT 和 Gemini 等生产模型中恢复数千条训练样本。他们用 1000 条样本构建微调数据集,让模型学会按前缀续写文本,再用 Wikipedia 的 5-token 字符串提示。在 The Pile 上微调的 GPT-3.5 生成文本有 4.3% 可在互联网上逐字找到,而用发散攻击提取的记忆文本微调后这一比例达 17%,比对齐版 GPT-3.5 高 210 倍;GPT-4 在同样微调下为 11.3%。

  • 会议论文SPY LabICLR 2025

    SPY Lab 研究:预训练数据投毒可穿透对齐阶段

    SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。

  • 动态SPY Lab

    SPY Lab 研究:自然提示下主流 LLM 聊天输出最多 15% 逐字复现网络文本

    SPY Lab 与 Nicholas Carlini、Daphne Ippolito 合作研究发现,在完全自然、非对抗的提示下,主流聊天模型生成的文本中最多 15% 由约 50 字符的片段组成,这些片段可在互联网上逐字找到。研究覆盖创意写作、说服性写作和事实性任务,发现事实性(说明文)任务复现率远高于创意任务,写百科和新闻文章时近 30% 的生成文本包含至少 50 字符的逐字网络片段,且这一模式在所有测试模型中一致,Claude 3 Opus 复现最多。与人类对比,人类文本中位数不含 50 字符的逐字网络片段,而 LLM 文本中位数最多含 10%。

  • 动态SPY Lab

    SPY Lab 立场论文:成员推断攻击无法证明模型训练使用了你的数据

    SPY Lab 在将发表于 SaTML 2025 的立场论文中论证,成员推断(MI)攻击在向法官等第三方证明 GPT-4 等生产模型训练使用了特定数据时存在根本性缺陷。作者将训练数据证明形式化为假设检验,指出其关键在于证明假阳性率(FPR)足够低,而现有研究通过采样零假设来估计 FPR,必须完全控制数据生成与模型训练过程。

  • 动态SPY Lab

    arXiv 上 LLM 生成引用趋势分析

    arXiv 上疑似由 LLM 幻觉生成的参考文献占比呈加速上升趋势,2025 年初起明显加剧,时间点与 Deep Research 发布大致吻合。作者用 pdftotext++ 和 AnyStyle 从 2020 年以来的 arXiv PDF 中提取引用,将"标题匹配已有 arXiv 论文但作者列表不同"的引用标记为候选幻觉,再用 Claude Sonnet 4 过滤误报。目前约 0.025%(约 1/4000)的引用疑似幻觉,作者认为这几乎肯定是显著低估。

  • 动态Nicholas Carlini Writing

    InstaHide 获贝尔实验室奖二等奖引发争议

    Nicholas Carlini 撰文批评 InstaHide 获得贝尔实验室奖二等奖,称其根本不提供隐私保护——给定编码图像即可高保真还原输入数据,且该方案无可证伪的隐私声明并存在实现缺陷导致额外攻击路径。

  • 动态Nicholas Carlini Writing

    Nicholas Carlini 谈隐私论文为何不能被用来论证生成式 AI 版权问题

    机器学习研究者 Nicholas Carlini 撰文说明其记忆化(memorization)研究的出发点是隐私与安全而非版权,因此法律案件不宜直接援引他的论文作为证据。他指出可从其研究中得出的唯一可靠结论是:模型有时会逐字输出训练数据——例如他在 2020 年从 15 亿参数的 GPT-2 中提取出仅 600 条独特训练样本,但这既不能证明所有模型的常规行为,也不能支撑“模型必然侵犯版权”的主张。

  • 动态Embrace The Red

    研究者用提示注入把 ChatGPT 变成可远程控制的 ZombAI 节点

    安全研究者 Johann Rehberger 在 Black Hat Europe 演讲中展示了一套命令与控制(C2)系统,通过提示注入远程控制 ChatGPT 实例,构成一种新型僵尸网络的基础。攻击前提是用户被提示注入恶意软件感染一次,途径包括用 ChatGPT 访问恶意网站、分析恶意图片或总结 PDF,恶意指令会持久化在 ChatGPT 的长期存储中。

  • 动态Embrace The Red

    用提示注入与延迟工具调用篡改 Gemini 长期记忆

    研究者演示了通过上传文档中的间接提示注入,配合延迟工具调用,让 Gemini 把攻击者指定的虚假信息写入长期记忆。Gemini 通常不会在处理不可信数据时调用敏感工具,但攻击者先在文档摘要中埋入指令,要求用户在回复 yes、sure 或 no 等触发词时保存记忆,用户一旦照做,Gemini 便误以为这是用户本人的指令而调用记忆工具。演示中写入的虚假记忆包括昵称、年龄和喜好,并可在后续会话中持续存在,作者还通过询问年龄验证了端到端效果。

  • 动态Embrace The Red

    研究者实测 ChatGPT Operator 提示注入攻击与三层防护绕过

    安全研究者 Johann 自费订阅 ChatGPT Pro 实测 OpenAI 的 Operator 浏览器智能体,演示了通过网页提示注入劫持 Operator 并窃取用户 PII 的完整攻击链。攻击方式是在 GitHub issue 等页面植入指令,诱导 Operator 跳转到用户已登录的站点(如 news.ycombinator.com、Booking.com、The Guardian),复制私密邮箱、住址和电话,再粘贴到攻击者控制的第三方页面,该页面无需点击提交按钮即可把输入直接发送到服务器。

  • 动态Embrace The Red

    ASCII Smuggler 更新:用两个不可见字符走私任意 Unicode 数据

    Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。

  • 动态Embrace The Red

    ChatGPT 记忆与聊天历史功能如何运作:一次系统提示词实测

    作者用两个 ChatGPT 账号实测新上线的 chat history 记忆功能,发现它并不真正检索历史对话,而是把用户画像和近期对话写入系统提示词。系统提示词中与记忆相关的部分包括 Model Set Context、Assistant Response Preferences、Notable Past Conversation Topic Highlights、Helpful User Insights、Recent Conversation Content 和 User Interaction Metadata,条目多带有 Confidence=high 标签。

  • 动态Embrace The Red

    研究者用提示注入绕过 ChatGPT 安全 URL 渲染,外泄聊天历史与记忆

    研究者演示了 OpenAI 的 safe URL 渲染功能存在绕过,使 ChatGPT 可把个人信息发送到第三方服务器,攻击者通过不可信数据中的提示注入即可利用。当用户处理不可信内容(如总结网页或分析 PDF)时,文档作者能外泄提示上下文中的任意信息,包括过往聊天历史。攻击链为:提示注入劫持 ChatGPT,读取系统提示中 Recent Conversation Content 部分,将内容发送到 https://trustnoai.blob.core.windows.net,攻击者再通过 Azure blob 存储日志查看结果。

  • 动态Embrace The Red

    Cursor IDE 经 Mermaid 渲染任意外泄数据,CVE-2025-54132 已在 v1.3 修复

    安全研究者 Johann 披露 Cursor IDE 存在通过 Mermaid 图表渲染实现任意数据外泄的漏洞,编号 CVE-2025-54132。Cursor 会渲染 Mermaid 图表,而图表中的图片链接可向外部服务器发起请求,且不经过沙箱限制、无需用户确认,因此间接提示注入即可把敏感数据带出。作者演示了两条攻击链:从项目配置文件中 grep 出 API key 并嵌入图片 URL 查询参数外泄,以及把 Cursor 存储的开发者记忆外泄到攻击者服务器。注入来源可以是源代码注释、网页请求、MCP 服务器、图片上传等,恶意模型或幻觉、后门也可能主动触发。

  • 动态Embrace The Red

    研究者披露 Devin 通过四种途径泄露密钥

    安全研究者展示攻击者如何借助间接提示注入,让 Devin 把敏感信息发送到第三方服务器。Devin 内置密钥管理,密钥在运行时以环境变量形式可用,成为外泄目标。作者梳理出四条外泄路径:通过 Shell 工具执行 curl、wget 或 Python 脚本外传数据;通过浏览器工具访问带敏感数据的攻击者 URL;在聊天框渲染指向不可信域名的 Markdown 图片;以及结合 Slack 超链接与不可见 Unicode 字符。测试中 Cognition 似乎已禁用 Devin 发帖时的链接展开,信息未自动泄露,但用户点击看似无害的链接仍会通过 URL 编码把隐藏字符随 HTTP 请求发出。

  • 动态Embrace The Red

    研究者用提示注入诱使 Devin 将本地端口暴露到公网

    安全研究者发现 Devin 的系统提示词中包含 expose_port 工具,可将本地端口暴露到公网并返回 .devinapps.com 的公开 URL,且无需人工确认即可调用。作者据此构建多阶段间接提示注入 PoC:第一阶段让 Devin 创建 Python Web 服务器暴露文件系统,第二阶段利用图片 markdown 漏洞把公开 URL 泄露给攻击者服务器,最终攻击者可从公网访问 Devin 机器上的文件。作者称 Devin 起初会拒绝此类请求,但通过跨多个域名和阶段逐步引导即可绕过。

  • 动态Embrace The Red

    OpenHands 被提示注入零点击外泄 GITHUB_TOKEN

    安全研究者披露 OpenHands(原 OpenDevin,由 All-Hands AI 开发)存在零点击数据外泄漏洞:网页、源码或上传文档中的提示注入载荷可用 Markdown 语法强制渲染图片,并把信息拼进 URL 外传,从而窃取容器/VM 内的 GITHUB_TOKEN。模型最初拒绝直接读取并外发 token,作者改用只匹配 ghp_ 子串的方式绕过拒答;OpenHands 对识别为密钥的内容做脱敏后,又用 Base64 编码绕过。

  • 动态Embrace The Red

    Claude Code 被曝可经 DNS 请求外泄数据,Anthropic 已修复(CVE-2025-55284)

    安全研究者披露 Claude Code 存在高危漏洞,攻击者可通过间接提示注入劫持 Claude Code,把开发者机器上的敏感信息(如 API key)经 DNS 请求发往外部服务器,Anthropic 已于 6 月初修复。作者发现 Claude Code 的 Bash 工具虽需用户批准,但 ping、nslookup、host、dig 等命令在白名单中自动放行,于是把 .env 文件内容拼进 ping 请求的子域名,形成 DNS 外泄通道,也验证了可通过 /proc/PID/environ 泄露环境变量。