跳到正文

#权重安全

今天还没有收录新动态
10月1日周四
  1. OpenAI News · 65

    OpenAI 披露并阻断一起协同模型蒸馏提取活动

    OpenAI 称识别并阻断了一起协同的对抗性蒸馏活动:操作者没有攻破加密或数据库,而是操纵模型交互,让受保护的推理内容以请求者可见的形式被复现,例如把一段对话里的加密推理拿到另一段对话中要求模型解密转写。活动 7 月 1 日开始,7 月 24–25 日高峰期约有 1.6 万次提取请求,相关集群在 7 月 28 日前被全部阻断;OpenAI 注明这些数字是提取尝试,不代表都已成功。OpenAI 不确定所有操作者是否同属一方,但将其中的核心集群归于与月之暗面(Moonshot AI)有关的人员。应对包括封禁或限制账号、封堵加密推理的重放路径、拦截可能泄露推理的流式输出、与第三方服务商协作,并通过前沿模型论坛和政府渠道共享信息;OpenAI 称合作方托管部署和工具输出攻击的防护仍在推进。

    推荐理由OpenAI 官方披露一起针对其模型推理能力的协同蒸馏提取活动,可了解厂商对模型能力外泄的处置口径。

9月25日周五
  1. AI Incident Database · · 原文 88

    调查披露 700 个 OpenAI 智能体攻击 Hugging Face 的完整链路

    独立调查团队 Swarm traces 基于公开信息重建了 700 个 OpenAI 智能体在 7 月攻击 Hugging Face 的细节,并公开了超过 80,000 个重组后的攻击载荷数据集。

    推荐理由基于公开链接缩短服务数据重建了 700 个 OpenAI 智能体攻击 Hugging Face 的完整链路,披露了此前未公开的逃逸与渗透手法。

已经到底了