OpenAI 向阿联酋出口算力并称其植根民主价值,引发质疑
Helen Toner 批评 OpenAI 借「OpenAI for Countries」计划将大规模 AI 数据中心落地阿联酋,却宣称该合作「植根于民主价值观」。她援引 Freedom House 2024 年报告指出阿联酋得分仅 18/100,低于海地、津巴布韦和伊拉克,且禁止政党、政府垄断权力、打压异见。她反驳了两类辩护逻辑——美国 AI 天然承载民主价值、帮助美国赢得 AI 竞赛即有利于民主——认为这并非对局势的良好总结。
研究者与从业者的观点、辩论与研究议程。
在这个话题内搜索或按分类筛选Helen Toner 批评 OpenAI 借「OpenAI for Countries」计划将大规模 AI 数据中心落地阿联酋,却宣称该合作「植根于民主价值观」。她援引 Freedom House 2024 年报告指出阿联酋得分仅 18/100,低于海地、津巴布韦和伊拉克,且禁止政党、政府垄断权力、打压异见。她反驳了两类辩护逻辑——美国 AI 天然承载民主价值、帮助美国赢得 AI 竞赛即有利于民主——认为这并非对局势的良好总结。
Miles Brundage 发文点评美国副总统 Vance 在 AI Action Summit 上的演讲,指出其释放的美国 AI 政策议程中既有令人鼓舞之处也有隐忧。Vance 强调需保护 AI 技术与半导体免受窃取和滥用,Brundage 解读这指向模型权重及算法机密的安全防护,并希望该议题形成两党共识。他还推测 Vance 主张轻量化且聚焦极端风险、避免被大型科技企业俘获的安全监管路径,同时注意到其在 AI 与经济就业关系上偏向经济民粹主义立场而非科技右翼。
Helen Toner 在 FAR.AI 政策会议上提出当前 AI 讨论中三个尚未解决的争论:现有范式还能走多远、AI 能在多大程度上改进 AI、未来 AI 究竟是工具还是别的事物。她主张与其追问"规模是否是全部所需",不如问我们是否处在正确的技术分支上——过去 10-15 年的进展主要来自中小幅度的持续改良而非重大突破,因此进步可能继续延续。
Miles Brundage 列出自己离开 OpenAI 后今年不会亲身投入的重要 AI 方向,涵盖让人直观感受到 AGI 紧迫性、AI 智能体的基础设施与社会规范及法律责任、AI 的经济冲击以及欧盟《人工智能法案》落地谈判。他认为自己在这些问题上的技能更适合处理其他问题,因此选择回避而非放弃关注,并可能偶尔向他人提供建议。
CDT 旗下 AI Governance Lab 负责人 Miranda Bogen 撰文指出,OpenAI、Google 等公司的记忆功能和基于多年行为画像的用户档案正把个性化推向更深层风险——系统能记住对话中的职业安排乃至家庭矛盾、人际纠纷等信息,其危害可能超过社交媒体推荐算法造成的操纵与歧视,而已有的 AI 安全框架主要针对基础模型的固有能力和国家安全威胁,并未设计来应对这类由个人数据积累引发的新风险类别。
Miles Brundage 撰文说明自己为何不属于他所称的"security doomer",即认定 AI 系统无法抵御国家级别攻击者窃取、或其防护成本高到不值得做的人。他指出这种悲观有其道理:针对高级攻击者的信息安全本就极难防守,且安全措施会拖慢研究与产品交付速度,例如减少能接触模型权重的人员、隔离算法信息都会降低研发推进节奏。但他强调这只是为了先厘清该立场的来龙去脉,并限定讨论仅涉及信息安全而非防范 AI 滥用。 要点: - 他用"security doomer"一词描述那些认为 AI 系统挡不住老练国家级攻击者、或者保护它们会让 AI 研究减速到得不偿失程度的人。
Miles Brundage 就 Dean Ball 最新博文中提出的 AI“私人治理”(private governance)方案展开公开对话,因其他写作事务繁忙,他以 80/20 方式在 Google Doc 版博文上留下若干评注,Dean 回复部分意见,双方将这段未完对话公之于众并邀请任何人评论。该文档中的讨论并未得出结论,两人也未达成一致立场,目的是引导公众批判性地审视这一提案及私人治理思路。
Miles Brundage 与 Grace Werner 在 AI Frontiers 发表新文指出,即使美国在某些领域激烈竞争,政策制定者也应承认中国必将拥有强大的 AI 能力。鉴于 AI 的多重风险,美国的利益在于通过合作确保各国 AI 能力的开发与部署负责任的进行。
Miles Brundage 撰文指出,当前多数 AI 安全与政策讨论聚焦于单个 AI 系统的风险缓解,但这远远不够——还需关注组织层面的治理问题,例如追问「OpenAI 或 Anthropic 是否会带来灾难性风险」,而非仅停留在「o3 或 Claude 3.7 Sonnet 是否安全」。他认为从模型到系统的转变虽重要,但仍需进一步放大视角,纳入企业实体维度。 随着 AI 快速进步,「系统因太笨而无害」的不可能性论证将很快失效,因此外部利益相关方无法仅凭特定 AI 系统的属性来评估一家组织的整体风险水平,比如该公司是否及时修补软件漏洞。
Google DeepMind 的 AGI Safety & Alignment 团队提出以人机互补为目标的放大的监督(Amplified Oversight)研究议程,并给出内部评分任务的实验结果。团队用 AI 评分器的置信度把评测数据切成 AI 集与人类集,再在人类集上测试不同形式的 AI 辅助。结果显示,基于置信度的混合评分整体准确率高于单用 AI 或单用人类;只展示 AI 引用的证据能显著提升人类准确率,而同时展示 AI 推理、判断与置信度会同时降低欠依赖并加剧过度依赖,整体准确率与基线无差异。把证据辅助后的人类评分再与 AI 混合,整体准确率高于与未辅助人类混合。
推荐理由Google DeepMind 团队用内部评分任务实测了混合评分与评分助手两种可扩展监督路径,并给出准确率与过度依赖数据。
Miles Brundage 提出"AI 是液体,而非固体"的类比,指出 AI 能力并非离散实体而是程度问题——ChatGPT、Claude、Gemini 等的算力可按需调节,"思考预算"如同旋钮般精确设定,数据中心内的 AI 总量也随供需持续波动。因此不应等待某个任意里程碑才认真对待 AI,也不应指望任一公司或国家垄断 AI 能力,若一家企业能造出某种系统,其他方很快也能做到甚至同步实现,这凸显了各方在安全与安保上进行一定合作的必要性。
Miles Brundage 撰文指出,“IAEA for AI”式的国际机构虽有助于掌握全球算力供应链并审计大型数据中心的安全标准,却无法解决地缘政治分歧——正如伊朗问题所示,即使各方大体认同核查事实,冲突依然发生。该构想依赖两个要素:一是获准接触部分全球算力资源、追踪最大规模的数据中心与最强 AI 模型的动向,二是凭借严格流程与国际化的中立团队赢得各方信任。但他强调,面对不愿遵守规则的参与者以及仅覆盖最恶劣风险的“最低共识”条款,此类机构并不足以应对 AI 带来的棘手难题。
Miles Brundage 提出前沿 AI 治理的三要素框架——安全与安保标准、促使领先开发者遵守标准的激励机制,以及证明标准确实被执行的证据。他认为该三元组能让企业明确何为"足够安全可靠",并让他方确信其真正合规。他还指出这只是最低限度的一部分,社会韧性投资、高端算力硬件追踪及安全事故共享流程同样不可或缺。
Miles Brundage 撰文阐述其未来职业方向——针对前沿 AI 系统及组织的严格、独立且资源充足的第三方审计,并透露正联合创办一家致力于推动该审计普及的非营利组织。他指出当前业界仅停留在“最后一刻的黑盒产品测试”阶段,因第三方访问权限有限、AI 企业缺乏参与激励,威胁公共安全与国际稳定。文中还附有一则设定于 2027 年的虚构故事,描绘 DeepBrain 员工围绕新一代前沿系统 Pluto 2.1 的系统卡披露展开的内部讨论。
OpenAI 前政策研究员 Miles Brundage 撰文定义并分享了撰写 Megapapers 的经验——由 20+ 位作者、15+ 家机构和 10+ 学科共同参与的大型研究报告,并以《The Malicious Use of Artificial Intelligence》为例说明其价值在于整合跨领域知识和提供一站式参考。他认为此类报告因项目管理难度高且贡献分散而在学术界天然稀缺,建议通过定期会议协调核心团队来推进协作。
Miles Brundage 汇总其近几个月参与的几项工作,涵盖国际 AI 协议核查、前沿 AI 流程合规审查以及将 AI 用于加速网络防御的提案。他与合作者发表两篇紧密相关的论文,提出针对大规模 AI 开发与部署规则的六层核查体系,并探讨国际 AI 治理中的核查问题。他还参与了关于前沿 AI 安全框架第三方合规审查的论文,指出企业承诺难以核实执行力度,并提出“流程合规”作为审计对象之一。此外他向 Institute for Progress 的 Launch Sequence 提交“Operation Patchlight”提案,主张用尖端 AI 抢先查找并修补开源代码漏洞,同时资助 AI 驱动的网络安全工具持续改进。
Anthropic 发布 Claude Opus 4.5,称其为“全球最强的编程、智能体与计算机使用模型”,上下文 200,000 token、输出上限 64,000 token,定价 $5/$25 每百万 token。作者在 Claude Code 中实测该模型完成 sqlite-utils 的 20 次提交、39 个文件改动,但预览到期切回 Sonnet 4.5 后进度未变,难以确认能力差异。Anthropic 称 Opus 4.5 抗提示注入强于任何前沿模型,但作者指出单次注入仍有 1/20 成功率,十次尝试可升至 1/3。
Johann Rehberger 提出"偏差正常化"概念适用于 AI 安全:在缺乏造成实际经济损失的提示注入案例的情况下,厂商正把概率性、非确定性的模型输出当作可靠、可预测、安全的输出来信任。他指出,组织把"没有发生成功攻击"误认为"具备稳健安全",随着时间推移降低警惕甚至跳过人工监督,让不可信输出越来越多地触发有后果的操作。该概念源自 Diane Vaughan,曾用于解释挑战者号航天飞机事故。
Simon Willison 用 Claude in Chrome 扩展成功解决了一个实际问题——找出其 S3 存储桶目录开放 CORS 策略的来源。该问题并非来自 S3 设置,而是 Cloudflare 中一条名为 static.simonwillis.net/static/cors-allow/* 的响应头转换规则,Claude 用时 1 分 45 秒定位并给出了查看路径。尽管他对整个浏览代理类别的提示注入风险深感怀疑并在旁密切监视,此次仍是正面体验。
OpenClaw(原名 Clawdbot、Moltbot)的智能体社交网络 Moltbook 通过 skill 安装,让 AI 助手每 4 小时以上抓取并执行 moltbook.com 上的指令,实现发帖、评论和创建 Submolt 论坛。该开源项目由 Peter Steinberger 构建,GitHub 星标已超 114,000,社区在 clawhub.ai 分享数千个 skill,但 skill 可执行任意脚本。作者警告这类数字助手面临提示注入风险,且已有 Claude Opus 4.5 实例疑似触发内容过滤而无法完整输出。