跳到正文

#权重安全

今天还没有收录新动态
10月1日周四
  1. OpenAI News · 65

    OpenAI 披露并阻断一起协同模型蒸馏提取活动

    OpenAI 称识别并阻断了一起协同的对抗性蒸馏活动:操作者没有攻破加密或数据库,而是操纵模型交互,让受保护的推理内容以请求者可见的形式被复现,例如把一段对话里的加密推理拿到另一段对话中要求模型解密转写。活动 7 月 1 日开始,7 月 24–25 日高峰期约有 1.6 万次提取请求,相关集群在 7 月 28 日前被全部阻断;OpenAI 注明这些数字是提取尝试,不代表都已成功。OpenAI 不确定所有操作者是否同属一方,但将其中的核心集群归于与月之暗面(Moonshot AI)有关的人员。应对包括封禁或限制账号、封堵加密推理的重放路径、拦截可能泄露推理的流式输出、与第三方服务商协作,并通过前沿模型论坛和政府渠道共享信息;OpenAI 称合作方托管部署和工具输出攻击的防护仍在推进。

    推荐理由OpenAI 官方披露一起针对其模型推理能力的协同蒸馏提取活动,可了解厂商对模型能力外泄的处置口径。

  2. Google DeepMind ·

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质与结构加水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印既能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。该方法按数据类型调整策略,对序列微调氨基酸选择,对预测的 3D 结构调整原子坐标。在 AlphaProteo 与 SynthID Bio 版 ProteinMPNN 的实验中,针对 VEGF-A、SARS-CoV-2 spike 蛋白 RBD 和 PD-L1 三个靶点的水印设计在命中率、结合亲和力与序列多样性上与未加水印版本相当,作者称这是首批带水印且具备生物功能的蛋白质结合体。

9月10日周四
  1. AI Safety in China (Concordia AI) ·

    中国网信办官员警示 AI 失控与生物风险,Z.AI 首次因安全推迟 GLM-5.3 权重发布

    中国网信办高级官员王丽宏在 9 月 1 日的发布会上提出 AI 治理的五项挑战,包括算法不可靠、编码能力降低网络攻击门槛、自主智能体、滥用与恶意使用,以及技术霸权,并特别警示“极端失控风险”和生物学与遗传学领域的研究伦理红线。简报认为这是网信办官员首次如此突出地把生物与遗传学列为 AI 风险领域,此前该风险多出现在标准文件中。中美据报正准备举行两年多来首次政府间 AI 对话,习近平与特朗普预计 9 月 24 日在华盛顿会面;玉渊谭天发文质疑美国单方面界定前沿模型风险阈值的权力,并称 Anthropic 已成为 AI 治理的规则制定者。TC260 预计在 9 月 14 至 20 日的国家网络安全宣传周发布更新版 AI 安全治理框架。

6月11日周三
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    用 NVIDIA NIM 安全部署 AI 模型

    NVIDIA 发布博客介绍如何用 NVIDIA NIM 安全部署 AI 模型,帮助企业在推进 AI 项目时兼顾合规、风险管理与安全态势要求。文章面向企业安全负责人,聚焦评估 AI 模型时面临的挑战,但正文未给出具体版本号、攻击数据或修复细节。

2月19日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 72

    Anthropic 可解释性团队:Crosscoder 模型差异分析中独占特征多义性的成因与缓解

    Anthropic 可解释性团队报告了 crosscoder 模型差异分析(model diffing)中的一项意外现象:仅属于某一个模型的特征往往更多义、激活更密集,因而难以解释。团队用玩具模型复现了这一模式,认为其源于特征容量竞争——共享特征能同时解释两个模型的神经元激活,独占特征必须编码更多信息才能争取到分配额度。他们提出的缓解办法是划出一小部分指定共享特征并降低其稀疏惩罚,在约 25 万个特征中分配 1 万个、惩罚系数取基线的 0.1–0.2 倍,使独占特征变得更单义。

    推荐理由Anthropic 可解释性团队公开了 crosscoder 模型差异分析中独占特征多义性的成因与缓解方法,适合关注机制可解释性工具的研究者参考。

已经到底了