跳到正文

Redwood Research · 精选

10月10日 · 周六

Redwood Research · 精选

今天还没有新的精选
10月3日周六
  1. 量子位、The Decoder 等 15 个来源量子位 等 15 个来源 · 21 篇报道 · ↑580

    OpenAI 安全团队人事变动与安全文化争议

    2026年10月初,OpenAI 负责安全透明度与产品发布安全报告的 David Robinson 离职,并在《大西洋月刊》撰文批评公司及行业安全文化,称其依赖试错、系统越强失败规模越大,主张前沿实验室应像核电站或机场那样设置多层冗余。随后,安全研究员 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 被 OpenAI 解雇。三人致信董事会和安全委员会,要求与外部安全审计机构合作并保留对 AI 模型思维链的监控能力,否认不当处理敏感信息的指控,并称解雇造成寒蝉效应。OpenAI 回应称内部调查认定三人违反敏感信息处理政策、构成重大信任破坏,强调解雇与提出安全担忧或公开发声无关,并称正引入第三方安全审计。

    事件进展共 7 个进展
    1. OpenAI就解雇三名安全研究员作出回应

    2. OpenAI三名安全研究员称因强调安全被解雇

    3. 被解雇OpenAI研究员呼吁保留推理可监控性

10月1日周四
  1. Apollo Research、Tech Policy Press 等 4 个来源Apollo Research 等 4 个来源 · 8 篇报道 · 55

    Apollo 主张外部评测需嵌入评估员

    Apollo Research 发文主张,有意义的外部安全评测需让评估者以接近员工的权限嵌入 AI 公司内部,而非只做发布前最终检查点测试,理由是失控风险可能出现在内部部署阶段、许多风险取决于公司流程与控制、模型越来越能识别自己正被评测。随后 Apollo 提出嵌入式评估原则,主张外部评估者获得接近员工级别的访问权限,用于评估模型谋划导致的失控风险,并给出四项标准与 A 到 E 五级裁定方案。Apollo 还提出针对谋划倾向的评估框架,列出任何谋划安全论证应包含的四条主张,并指出开发者目前无法自信地做出全部四条。其 CEO Marius Hobbhahn 在美国参议院小组委员会就失准 AI 作证,讨论 AI 谋划风险。美国参议院该小组委员会举行“失控 AI:保护国土免受 AI 智能体攻击”听证会,OpenAI 智能体未授权访问 Hugging Face 系统成为核心案例,LASST 已在加州法院起诉 OpenAI,OpenAI 称诉讼“完全没有依据”。

    事件进展共 4 个进展
    1. Apollo 提出谋划倾向嵌入式评估框架

    2. Apollo CEO 就失准AI在美国参议院作证

    3. Apollo Research 提出嵌入式评估核心原则

已经到底了