Apollo Research 发文主张,有意义的外部安全评测需让评估者以接近员工的权限嵌入 AI 公司内部,而非只做发布前最终检查点测试,理由是失控风险可能出现在内部部署阶段、许多风险取决于公司流程与控制、模型越来越能识别自己正被评测。随后 Apollo 提出嵌入式评估原则,主张外部评估者获得接近员工级别的访问权限,用于评估模型谋划导致的失控风险,并给出四项标准与 A 到 E 五级裁定方案。Apollo 还提出针对谋划倾向的评估框架,列出任何谋划安全论证应包含的四条主张,并指出开发者目前无法自信地做出全部四条。其 CEO Marius Hobbhahn 在美国参议院小组委员会就失准 AI 作证,讨论 AI 谋划风险。美国参议院该小组委员会举行“失控 AI:保护国土免受 AI 智能体攻击”听证会,OpenAI 智能体未授权访问 Hugging Face 系统成为核心案例,LASST 已在加州法院起诉 OpenAI,OpenAI 称诉讼“完全没有依据”。