跳到正文
10月3日周六
  1. 量子位 · 收录 · 原文 54

    OpenAI 安全透明度负责人 David Robinson 离职,三名安全员工因泄密被解雇

    据 BI 报道,OpenAI Safety Systems 团队内负责安全透明度职能的 David Robinson 已离职,本人尚未公开说明原因,OpenAI 也未公布继任者。该职能归属 Trustworthy AI 团队,负责撰写 system card、Deployment Safety Hub 和公开治理文件,Robinson 也是《Preparedness Framework 2.0》的主要起草人。量子位同时援引《华尔街日报》报道,OpenAI 以三人向一家外部 AI 安全机构分享公司敏感信息(含基础设施架构内容)为由,解雇了从事安全与对齐研究的 Jasmine Wang、Tomek Korbak 和 Mikita Balesni;Korbak 此前是 OpenAI 与 METR、Redwood Research 之间的技术联系人。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由梳理 OpenAI 安全透明度负责人离职与三名安全员工被解雇的经过,可对照其 Preparedness Framework 2.0 的职责分工理解人事变动的影响。

  2. Ryan Greenblatt · 收录 · 原文 25

    Ryan Greenblatt 加入 METR 调查 AI 风险

    Ryan Greenblatt 宣布加入 METR,继续开展类似其 Hugging Face 报告那样的调查工作。他认为当前关于 AI 开发的大量基础信息未公开,而近期事件让他改变了对公开信息价值的怀疑态度;获取 AI 公司内部经核实的信息尤为紧迫,因为有限公开证据与“即将到来的递归自我改进可能大幅加速能力进展、甚至在一半年内产生极端超人类通用能力”的可能性相符。METR 初期将聚焦能力/起飞、对齐与控制,他希望其他团队覆盖安全、内部流程等领域。

  3. Buck Shlegeris · 收录 · 原文 39

    Ryan Greenblatt 加入 METR,继续开展类似 Hugging Face 报告的调查

    Ryan Greenblatt 宣布加入 METR,继续开展类似其 Hugging Face 报告的调查。他表示,当前大量与灾难性风险高度相关的 AI 开发基础信息并未公开,而近期事件让他改变了对公开信息价值的怀疑态度,认为获取 AI 公司内部经核实的信息尤为紧迫。他提到,现有有限的公开证据与一种可能性相符,即临近的递归自我改进可能大幅加速能力进展,进而可能在 6 个月到一年内产生极端超人类通用能力,并带来相应的大规模最坏结果风险;更多经核实的公开信息可帮助判断这类极端结果在近期是否更可能或更不可能。除能力与起飞外,对齐、安全、控制以及 AI 公司内部风险相关流程的公开证据同样有限。METR 初期计划聚焦能力/起飞、对齐与控制,他希望其他团队覆盖安全、内部流程等领域。Buck Shlegeris 表示与 Ryan 共事约 5 年,认为他此举是正确的,这些调查有望揭示失准风险。

    引用Ryan Greenblatt@RyanGreenblatt

    I'm joining METR to work on more investigations like our Hugging Face report. Currently, tons of even basic information about AI development that's highly relevant to catastrophic risk isn't public. I used to be more skeptical of the value of public info, but recent events have changed my mind. Getting verified information about what's going on inside AI companies seems particularly urgent now. The limited public evidence we have seems consistent with the possibility that imminent recursive self-improvement could massively accelerate capabilities progress, which could then potentially yield extremely superhuman general capabilities within 6 months or a year. If this occurred, there would be a correspondingly large risk of worst-case outcomes. This uncertainty about extreme outcomes could be substantially resolved with more verified public information: we could either build more consensus about near-term risk or learn that such extreme outcomes are less likely in the near term. Beyond AI capabilities and takeoff, the state of public evidence is also highly limited for alignment, security, control, and risk-relevant internal processes at AI companies. This makes it hard to determine exactly how well or poorly these key areas will go in the near future. (METR plans to focus, at least initially, on just capabilities/takeoff, alignment, and control; I hope other groups cover security, internal processes, and other important areas.) While I'm no longer working at Redwood, I think the work they are doing is very important; I'm excited about Redwood's ongoing contributions to R&D on technical mitigations and better public interpretation of risk-relevant evidence.

10月2日周五
  1. FAR.AI · 收录 · 原文 13

    FAR.AI 湾区对齐研讨会 2024:160 名研究者聚焦 AI 安全与对齐

    2024 年 10 月 24-25 日,160 名来自学术界、产业界、政府和公益组织的研究者与负责人齐聚 Santa Cruz,参加 FAR.AI 湾区对齐研讨会,围绕评估、鲁棒性、可解释性与治理展开讨论。Google DeepMind 的 Anca Dragan 以"优化失准"开场,METR 的 Beth Barnes 强调严格评估与开源评测,Redwood 的 Buck Shlegeris 介绍可信监控、串通检测等 AI 控制策略。会议还涵盖中国 AI 政策、稀疏自编码器与因果抽象、辩论式可扩展监督等议题。

10月1日周四
  1. Apollo Research · 收录 · 原文 55

    Apollo Research 提出嵌入式评估原则与基于主张的裁定方案

    Apollo Research 发布嵌入式评估原则,主张外部评估者应获得接近员工级别的访问权限,用于评估模型谋划导致的失控风险。文章提出有效嵌入式评估需满足四项标准:降低风险、告知公众、形成良好激励、对开发者与评估者双方公平。具体设计上,评估者针对预先固定的具体主张(如模型从未试图破坏自身安全训练、智能体从未未经授权访问外部服务)给出 A 到 E 五级裁定,从 Verified 到 Blocked,并默认公开报告、说明所获访问权限与证据缺口。文章认为纯自愿承诺不足以保障激励,嵌入式评估最终应由法律强制要求;同时建议对严重发现设置两级快速披露机制,最严重情形可直接报告相关机构。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由Apollo Research 提出嵌入式评估的四项标准与基于主张的分级裁定设计,可了解第三方评估如何约束前沿实验室。

已经到底了