CSA 研究笔记:对抗性蒸馏成为模型来源的系统性风险
Adversarial Distillation as Systemic Risk to Model Provenance
AI 导读
CSA Labs 发布研究笔记,分析 OpenAI 于 2026 年 9 月 30 日披露的对抗性蒸馏活动,OpenAI 将其中核心集群归因于与 Moonshot AI 相关的人员,但承认无法把所有操作者归于同一主体,所引报道中也没有 Moonshot 的回应。该活动针对的是隐藏推理而非模型权重,操作者据称在会话之间搬运加密推理内容并要求模型转录,未破解加密。OpenAI 称活动在 7 月 24 日和 25 日达到峰值,约 4,000 多名用户发出约 16,000 次请求,7 月 28 日前观察到约 15,000 个提示模式相似的用户或账号,这些数字描述的是尝试而非确认成功。OpenAI 表示已封禁相关账号、收紧注册验证、扩大监控、加强对隐藏推理的保护,并通过 Frontier Model Forum 与其他实验室共享发现。
推荐理由
梳理 OpenAI 披露的对抗性蒸馏事件与 Anthropic 此前记录,说明模型来源为何成为采购与安全团队需要追问的供应链属性。
阅读原文