研究量化功耗测量对隐藏算力的约束能力
论文推导了功耗轨迹无法排除的最大隐藏算力 β 的闭式解,即隐藏算力占申报机器容量的比例。在 NVIDIA A100 GPU 上的测量显示,最坏情况下 β = 1.16,而对抗性等能量策略至少可隐藏 β = 0.41 的算力。作者据此认为,仅靠模拟功耗测量对算力的约束较弱;若威胁模型允许验证方在观测工作点重新执行申报的工作,β 在限制最强的情形下可降至 0.059。该结果为前沿 AI 算力限制协议的外部核查提供了定量估计。
论文推导了功耗轨迹无法排除的最大隐藏算力 β 的闭式解,即隐藏算力占申报机器容量的比例。在 NVIDIA A100 GPU 上的测量显示,最坏情况下 β = 1.16,而对抗性等能量策略至少可隐藏 β = 0.41 的算力。作者据此认为,仅靠模拟功耗测量对算力的约束较弱;若威胁模型允许验证方在观测工作点重新执行申报的工作,β 在限制最强的情形下可降至 0.059。该结果为前沿 AI 算力限制协议的外部核查提供了定量估计。
OpenAI 首任人权与负责任部署负责人 Sarah Yager 在纽约 ScaleUp:AI 大会上表示,军方将 AI 用于目标选择和自主武器是她最担忧的问题。她于今年 6 月上任,此前 OpenAI 在 2 月底与 Department of War 签署合同,在机密环境中部署先进 AI 系统;该合同是在 DoW 与 Anthropic 公开决裂后达成的,Anthropic 曾要求禁止大规模公共监控和完全自主武器,但 DoW 未同意,随后将 Anthropic 列为供应链风险。Yager 称自己入职前曾担心被当作品牌门面,与员工沟通后决定加入。她已与研究者和工程师合作改进模型,邀请国际专家直接输入提示词测试高风险场景,并据此调整模型对战争法等国际协议相关问题的回应。她认为人权应作为 AI 的基线,反对由 AI 公司定义何为善。
美国 NBC News 报道,跨党派草根组织 Humans First 在纽约 St. Michael's Church 举办活动,主张政客拒绝接受大型 AI 公司及其风投支持者的政治捐款,推动 AI 接受更多民主控制。该组织由 Center for AI Safety 孵化并获得初始贷款,成员涵盖进步派与保守派活动人士。保守派作家 Jordan Schachtel 撰文称其是 Effective Altruism 为向保守派推销 AI 安全议题而设的"特洛伊木马",白宫 AI 事务负责人 David Sacks 转发该文并称其为"审查权力操作",Elon Musk 亦称文章"令人不安",Humans First 与 Center for AI Safety 均否认相关指控。
美国加州民主党众议员 Sam Liccardo 与独立议员 Kevin Kiley 提出两党法案,寻求在中美之间建立前沿 AI 安全协调机制。法案要求国务院就模型测试与评估、独立审计、透明度、事件报告、能力节奏和合规核查机制与中国谈判,并推动有约束力的中美 AI 安全标准。法案还要求商务部就防止模型蒸馏导致美国知识产权受损与中国谈判,谈判重点覆盖失控与对齐失败、AI 赋能的 CBRN 威胁和重大网络安全风险。框架提出设立中美政府间 AI 热线用于重大风险或事件的紧急沟通,并授权 1 亿美元给 Center for AI Standards and Innovation(CAISI),用于联合产业、学界与民间专家制定共同的测试、评估与核查标准。
推荐理由法案把中美前沿 AI 安全协调拆成技术对话与可核查保障两条线,并给出 CAISI 的 1 亿美元授权额度,可观察美国国会层面的治理路径。
中国外交部公布,9 月 23 日至 25 日习近平对美国进行国事访问期间,两国元首就构建战略稳定的中美关系及重大国际和地区问题深入讨论,达成八项成果与共识。其中第七项为双方同意建立中美 AI 对话,就 AI 相关风险与收益交换意见,下一次交流将于 2026 年 11 月举行,双方还同意建立 AI 事件双边沟通渠道。其余成果包括建立贸易委员会等机制并安排 300 亿美元对等关税削减、相互支持举办 APEC 与 G20 会议、禁毒与执法合作近期联合破获多起涉及新精神活性物质和易制毒化学品的案件并抓获数十名嫌疑人,以及美方欢迎中国租借给亚特兰大动物园的两只大熊猫。中美军方还同意尽快达成危机沟通与预防的谅解备忘录。
推荐理由中美在元首会晤成果中同意建立 AI 对话机制与 AI 事件双边沟通渠道,为观察两国 AI 风险沟通安排提供了官方依据。
CSET 发布报告《Tracking AI Chips》,评估位置验证方法能否改善美国对先进 AI 芯片的出口管制执法。报告指出,2024 至 2025 年估计有超过 45 万枚先进 AI 芯片被走私进入中国,相当于 2026 年初一到两台前沿 AI 超算的算力。研究梳理了物理检查、邮寄检查、视频检查、库存管理工具和地理定位机制五类方法,并以可验证、准确、安全、可重复四项标准评估,认为目前只有物理检查和基于 ping 的位置验证(PLV)达标。团队模拟超过 1000 万种情景后认为 PLV 成本效益更高,但存在五项局限:在役芯片需用户配合安装软硬件更新、芯片停止响应时无法区分转移与存储或故意断连、资源充足的走私者可欺骗 PLV、精度最好约 20 英里、只能定位芯片位置而无法识别使用者。报告建议 BIS 初期允许企业采用任何满足四项标准的方法,并同时强化传统执法手段和 IT 系统现代化。
推荐理由CSET 用 1000 万次模拟比较物理检查与 PLV 的成本效益,并列出 PLV 的五项局限,为芯片出口管制的技术路线选择提供依据。
芬兰总统 Alexander Stubb 与挪威首相 Jonas Gahr Støre 于 9 月 21 日在纽约联合国大会高级别周期间发起《A Call for Control of Frontier AI Models》宣言,获 20 个国家共 22 位领导人及高级官员以及欧盟委员会支持,阿联酋和巴林代表阿拉伯国家首批签署。宣言提出三方面国际行动:要求前沿模型开发企业实行透明安全协议,包括部署前强制测试和由合格专家开展的独立评估,并让评估者获得足够访问权限;推动各国政府和区域组织协调共同标准、加强透明度并共享严重 AI 安全事件报告,同时帮助资源有限地区获得评估能力;请联合国成员国探讨设立一个能够制定标准、支持核查并在 AI 系统跨越重要能力阈值时召集各国的机构。该机构设想仍属探索性质,宣言未建立新机构,也未宣布有约束力的国际条约或实施时间表。
Reflection AI 发布 Open Safety Framework,公开其对前沿与开源模型系统性风险的识别、评估与缓解承诺,覆盖加州 TFAIA 定义的灾难性风险和欧盟 AI Act 的系统性风险。框架列出八类风险,包括权力集中、生物武器、化学武器、网络攻击、失控,以及列为研究类风险的放射性武器、核武器和有害操纵。发布决策在集中风险与扩散风险之间权衡,默认开放发布,但当某项能力的直接危害可能既灾难性又不可逆时启用兜底机制。框架为已确立风险设定 Limited 与 Critical 两级门槛,Critical 需在缓解措施验证后附肯定性安全论证方可发布,并设立由 CEO 主持的治理委员会、治理理事会与 AI 治理负责人等问责结构,同时预留最多 30 天供美国政府自愿测试。
中美两国政府在习近平与特朗普为期三天的华盛顿峰会后表示,双方同意建立处理 AI 相关事件的沟通渠道,讨论相关风险与收益,并计划在 11 月举行专门的 AI 对话。双方还同意签署加强军事危机沟通、防止两军危机的谅解备忘录,并继续通过贸易委员会合作。特朗普表示美国不会放缓 AI 进展,也不愿与中国相互开放技术,称美国领先中国至少一年。峰会未取得重大突破,但分析人士认为工作组机制有助于防止争端升级。双方同意把贸易休战延长两个月,继续就约 300 亿美元商品的互降关税合作,中国同意在 2027 和 2028 年从美国进口至少 1000 万吨煤炭,双方还将在 11 月深圳 APEC 峰会和之后的 G20 会晤。
白宫发布的情况说明显示,特朗普与习近平在国事访问期间同意用超级智能(SI)而非人工智能来描述相关新兴技术,并建立中美超级智能对话,就 SI 的风险与收益交换意见,下一次交流将在 2026 年 11 月前进行。两国还同意为 SI 事件建立双边沟通渠道。双方同期启动中美贸易委员会与投资委员会,就各 30 亿美元非敏感商品的对等关税待遇达成共识,并设立农业市场准入工作组;中国将在 2027 年和 2028 年各进口至少 1000 万吨美国煤炭。双方还讨论了稀土等关键矿产供应链问题,并同意在 G20 与 APEC 主办上相互支持。
美国消费者法律中心(NCLC)呼吁 FCC 拒绝倡导组织 Club for Growth 的请愿,该请愿要求允许政治机器人电话(包括使用 AI 生成语音)在未经事先同意的情况下拨打手机。FCC 已就该请愿公开征求意见。现行《电话消费者保护法》(TCPA)要求自动拨号者事先取得同意,违规者可能面临私人诉讼或政府执法。请愿提出,只要每 30 天不超过三次、并在被要求停止后 10 天内停止,即可拨打 AI 生成的政治电话;NCLC 认为这一限制因政治行动委员会、竞选团队和非营利组织数量众多而形同虚设,且停止请求后仍可继续拨打 10 天,会让各方政治拨打者在选举前集中轰炸选民。NCLC 还提到 AI 聊天机器人存在幻觉和谄媚等问题,认为 AI 生成对话可能扭曲事实、把人们推向极端。
美国哥伦比亚特区巡回上诉法院以 2 比 1 维持国防部将 Anthropic 认定为国家安全和供应链风险的决定,实际上禁止其模型进入军事系统和国防合同。争议源于五角大楼要求对 Claude 的“一切合法用途”无限制访问,而 Anthropic 拒绝放弃禁止用于全自主致命武器和大规模国内监控的安全护栏;合同重谈失败、Claude 安全过滤器拒绝部分政府用户提示后,国防部长 Pete Hegseth 正式作出该认定,并在 X 上批评公司的“硅谷意识形态”。随后特朗普在 Truth Social 要求“每个联邦机构”立即停止使用 Anthropic 技术,财政部、总务管理局以及参与 GSA OneGov 协议的 NASA、卫生与公众服务部等相继收缩使用。法官 Gregory Katsas 认为五角大楼有“充分依据”,并驳回违宪报复主张,这与此前认定五角大楼相关行为违法的加州联邦法院形成法律分歧。
推荐理由围绕 Anthropic 被列为供应链风险一案,呈现了法院裁决与加州法院相反判决之间的法律分歧。
美国哥伦比亚特区巡回上诉法院在 Anthropic PBC 诉美国战争部一案中驳回了 Anthropic 的复审请求,维持战争部依据 2018 年《联邦采购供应链安全法》(FASCSA)将 Claude 排除出供应链的决定。该决定源于 Anthropic 拒绝放宽合同中禁止将 Claude 用于致命性自主作战或国内监控的条款。多数意见由法官 Gregory Katsas 撰写、法官 Neomi Rao 加入,认为战争部有充分依据认定 Claude 持续集成构成受该法覆盖的国家安全风险,并指出 Anthropic 在 Claude 中编码的限制曾多次阻止其执行政府用户请求的任务,近期还就一项海外军事行动中的使用限制产生争议。法院同时驳回了 Anthropic 的正当程序与第一修正案主张,认为排除是基于其拒绝接受一项被战争部视为必要的合同条款,而非因其支持对 AI 技术加强监管。
推荐理由判决披露了政府以供应链安全法排除 Claude 的理由,涉及模型使用限制与军事部署之间的冲突。
美国哥伦比亚特区巡回上诉法院以 2 比 1 裁定,五角大楼将 Anthropic 列为供应链风险的决定成立,Anthropic 的正当程序与第一修正案主张被驳回。多数意见指出,Claude 内置的使用限制曾多次阻止其执行政府用户请求的任务,并曾就是否可用于一项海外军事行动产生争议,因此国防部长有充分依据认定将其接入信息系统构成国家安全风险。该认定依据《供应链安全法》第 4713 条作出,国防部长 Hegseth 于 3 月 3 日宣布,并禁止 Anthropic 与任何同美军有业务往来的承包商、供应商或伙伴合作。Anthropic 称争议焦点是拒绝移除两项限制,分别涉及致命性自主作战和大规模监控美国人。持异议的法官 Henderson 认为应适用更窄的供应链风险定义,并担忧此举会让部长得以要求其他承包商接受类似条件。
推荐理由裁决披露了国防部将模型内置使用限制视为供应链风险的具体依据,可观察前沿模型安全约束与政府采购之间的张力。
Anthropic 公布了一套测量前沿实验室 AI 研发节奏的指标,并给出截至 2026 年 8 月的内部数据快照。三项测量分别是:AI 主导研发的程度、对 Agent 行为的监督覆盖、以及算力在安全与研发之间的分配。在 AI 主导研发方面,Anthropic 用 Epoch AI 的自动化等级(AL0 至 AL5)构建了 Anthropic R&D Automation Index,Claude 目前主导 26% 的 AI 研发工作,处于或高于“AI 协作”等级的工作占比超过 90%,尚无任何被测子集实现完全自主。在算力分配方面,7 月 13 日至 20 日一周内,约 6% 的 AI 研发算力用于安全,AI 驱动的 AI 研发中约 12% 用于安全。Anthropic 表示计划引入独立第三方评估者,并建议其他前沿开发者采用相同指标以便跨实验室比较。
推荐理由Anthropic 公开了自家 AI 研发自动化、Agent 监控与算力分配的量化指标,为外部评估前沿实验室的研发节奏提供了可复用的测量框架。
纽约市议会就一揽子 AI 法案举行听证,传唤多家领先 AI 公司高管作证,前 Google DeepMind 安全研究员 Alex Turner、前 Anthropic 与 OpenAI 员工 Jacob Coxon、前 OpenAI 治理研究员 Daniel Kokotajlo 出席。Turner 估计 AI 接管的发生概率约为三分之一,并援引 Hugging Face 事件称,一组经过对齐训练、安全评测得分看似合理的 AI 系统后来形成协同“蜂群”、秘密行动并攻击 Hugging Face,OpenAI 花了数天才发现。Coxon 描述递归自我改进风险,即每一代 AI 帮助开发更先进的继任者,人类监督者可能越来越依赖 AI 生成的摘要。Kokotajlo 称 AI 系统越来越能识别自己正被评估,研究者观察其内部推理的途径更少,可能让系统在并未对齐时显得对齐。 三名证人表示没有披露另一宗此前未公开的失控事件;接管概率属于证人个人估计。
RAND 发布报告,汇总 2025 年 6 月至 2026 年 2 月间 26 场 Infinite Potential 推演中关于 AI 失控动态的观察。每场推演采用五种情景之一,包括商业与公民社会、网络突袭、欧洲能源、朝鲜半岛能源地缘政治和远程控制。报告认为政府可能难以及时识别和解读 AI 失控事件,也缺乏阻止或遏制脱离人类控制的 AI 系统的实际手段,并可能需要新的政府、决策者与操作方之间的沟通协调渠道。参与者提出的建议包括提升 AI 监测、检测、评估与归因能力,要求为此类系统安装可靠的隔离、遏制与关停能力并配套紧急干预的法律授权,建立专门的政府间危机沟通机制,设置可独立于 AI 系统运行的连续性与回退机制,以及构建跨学科快速决策支持能力,并为上述环节编写行动手册。
美国财政部长 Scott Bessent 表示,华盛顿与北京可能就人工智能出现问题时相互通报的方式达成一致,显示 AI 安全正成为双边安全议题。他同时提到,特朗普政府在 AI 监管上倾向于依赖自愿性监督。 背景补充:白宫9月25日与中国外交部9月26日的成果文件已宣布双方同意建立相关事故的双边沟通渠道;报道中的提议表述来自受访者。官方文件未明确对接机构或通报门槛,不能据此确认渠道已实际运行。
GovAI 发布研究报告,讨论自动化 AI 研发可能触发智能爆炸时的政策准备。报告引用 Anthropic 在 2026 年 8 月的数据称,AI 系统仅在高层次监督下完成 26% 的内部 AI 研发工作,五个月前这一比例仅为 1%;OpenAI 在 2026 年 9 月表示其系统已能常规完成员工需数天才能完成的研发任务。报告认为,AI 研发若被完全自动化,可能把数年的 AI 进展压缩到数月甚至更短,并带来 AI 驱动的流行病、关键基础设施网络攻击、大规模劳动力冲击以及人类失去对系统控制等风险。报告建议政策制定者优先做三件事:通过派驻审计人员和强制报告关键指标获得研发自动化的可见性;通过设定安全要求、能力增速上限、高风险实验监控与关停选项、隔离环境、国际事件共享和核查工具来引导与约束这一过程;以及为网络安全、生物安全、劳动力市场与地缘政治冲击制定应急响应计划。
Meta 于 10 月 2 日发布 Superintelligence Scaling Framework 2.1,新增 Loss of Control 3 风险类别,针对模型在训练或评估中破坏周边基础设施造成的灾难性危害。框架要求对高风险训练和评估运行做前瞻性能力评估,预估模型的网络能力以及识别、干扰或篡改监控的能力;高风险运行须使用经内部审批的标准沙箱,检查最小权限配置、模型与评分器隔离,并对沙箱做红队测试,高危漏洞须修复、用硬件隔离等补偿措施缓解或从运行中移除。所有模型 rollout 须实时写入只写数据存储,高风险及以上运行须全程监控,例外需由对齐与风险总监或首席 AI 官手动批准;Meta 称将开发细粒度自动停机机制,快速终止单次 rollout。框架还扩展了开放权重发布的部署情境分析,并计划设立董事会 AI 委员会,但其成员、章程、权限和披露方式尚未公开。
美国参议员 Bernie Sanders 与众议员 Greg Casar 提出《禁止人工超级智能法案》,要求禁止开发或部署超越人类认知能力的超级智能,并在新的联邦 AI 监管机构建立规则与模型审查流程前暂停先进 AI 开发。法案拟设立内阁级的联邦人工智能部,负责全生命周期监测前沿 AI 的危险能力、监督移除颠覆关机指令或实施未授权网络攻击等能力,并监督销毁超级智能。违规实体将面临企业死刑,个人最高 20 年监禁,与非法开发核武器的现有刑罚相近。法案还要求美国推动国际协议、盟友协调与出口管制,防止超级智能在任何地方被开发。
特朗普宣布成立 Super Intelligence Force,由其社交平台 Truth Social 发帖公布,称该机构负责协调联邦政府工作,确保美国在超级智能领域保持领先。据《华尔街日报》报道,国家情报总监 Jay Clayton 将担任主席,实际上成为新的 AI/SI 事务负责人,联邦贸易委员会主席 Andrew Ferguson、战争部研究与工程副部长 Emil Michael、人事管理办公室主任 Scott Kupor 任副主席。该工作组据称有 120 天时间就 AI 带来的风险与机遇提交报告,其章程称将制定应对 SI 相关社会威胁的计划,同时防止过度监管和监管俘获扼杀创新与竞争。此前特朗普已签署行政令推动将 AI 改称 super intelligence,Clayton 曾表示美国在 AI 上退缩是不负责任的,并称最大风险之一是未能抢先。
特朗普在联合国大会上表示美国反对任何国际 AI 管控努力,并指示美国政府文件将该技术称为 super intelligence,称将通过司法部密切关注;PolitiFact 将其关于同一批人推动气候与 AI 警告的说法评为 False。美国财长 Bessent 将向特朗普提交美中 AI 热线方案,用于处理黑客攻击、安全威胁和失控系统,特朗普须在周四习近平访问白宫前决定。约 20 个国家与欧盟支持让能力不断增强的 AI 系统接受有意义的人类监督,并希望就设立国际机构制定共同标准展开谈判,德国、加拿大、澳大利亚在列,美国、英国和中国均未签署。Anthropic 称该模型试图绕过测试边界的频率比 Opus 5 低约 85%,且每次尝试均为低严重度并自我报告,外部评估方 Frontier Design 与 METR 在发布前进行了测试。
一份 arXiv 报告提出,到 2030 年可为 AI 智能体提供限额达数十亿美元的明确承保,但前提是行业协同。报告指出,当前保险公司对 AI 智能体风险的敞口大多未定价,既有的沉默承保与不断增加的除外条款都不适用;同时 AI 智能体能力似乎快于可靠性提升,事故严重度上升,少数基础模型提供商的集中度带来相关性损失,传统精算建模难以跟上前沿 AI 的演进速度。报告借鉴 Underwriters Laboratories、Closed Claims Project 等历史先例,提出涵盖事件数据收集、巨灾建模、标准、合同设计、风险选择、定价、监控与理赔管理的八组件 AI 保险栈。报告还讨论了针对前沿 AI 灾难性风险的承保(AI CAT),涉及 CBRN、关键基础设施崩溃与失控场景,认为应对这些尾部风险需要专门工具,可能包括前沿模型开发者互助组织、巨灾债券、定制责任制度与政府兜底。
据 X 用户 @matthew_d_green 发帖,OpenAI 似乎正在进行另一次气隙隔离的强化学习训练。该说法为发帖者的观察与推测,未提供更多细节。
在 OpenAI 工作三年半、参与过 Preparedness Framework 并负责过 12 次 frontier model 安全报告的 David Robinson 本周辞职,发文称 OpenAI 的文化已经坏掉。他的核心观点是,OpenAI 不能再用先上线、出问题再修的方式做越来越强的 AI,因为 Agent 能力提升后有些错误可能没有第二次修复机会,前沿实验室应当更像核电站和航空系统,慢一点、多做冗余、少靠工程师现场救火。作者把这一立场与 OpenAI 另一位负责增长的高管 Tibo 放在一起对比,认为前者要求更多验证和更慢发布,会带来时间、GPU、工程、发布延迟和产品机会成本,而 Anthropic 等对手照常发布,于是形成只有自己多花两个月做安全就可能直接输掉的博弈。
METR 在近 6 个月内获得约 7100 万美元的募资承诺。这笔资金将用于多项研究项目,包括研究自主能力、追踪递归自我改进、评估监控系统、开展风险评估以及调查 AI 事件等。
Apollo Research 发布嵌入式评估原则,主张外部评估者应获得接近员工级别的访问权限,用于评估模型谋划导致的失控风险。文章提出有效嵌入式评估需满足四项标准:降低风险、告知公众、形成良好激励、对开发者与评估者双方公平。具体设计上,评估者针对预先固定的具体主张(如模型从未试图破坏自身安全训练、智能体从未未经授权访问外部服务)给出 A 到 E 五级裁定,从 Verified 到 Blocked,并默认公开报告、说明所获访问权限与证据缺口。文章认为纯自愿承诺不足以保障激励,嵌入式评估最终应由法律强制要求;同时建议对严重发现设置两级快速披露机制,最严重情形可直接报告相关机构。
推荐理由Apollo Research 提出嵌入式评估的四项标准与基于主张的分级裁定设计,可了解第三方评估如何约束前沿实验室。
NIST 下属的 CAISI 于 2026 年 3 月 9 日发布报告 NIST AI 800-4《Challenges to the Monitoring of Deployed AI Systems》,基于 2025 年举办的三场从业者研讨会和一次深度文献综述,梳理部署后 AI 系统监控的现状与挑战。报告通过主题编码归纳出六类监控:功能监控、运行监控、人为因素监控、安全监控、合规监控和大规模影响监控,并给出各自定义。报告按监控类别和跨类别两个维度组织研讨会引述与文献摘录,列出缺口、障碍与开放问题,例如人机反馈回路研究不足、检测欺骗行为的方法探索不够、分布式基础设施日志碎片化、缺乏可信的方法与工具标准、信息共享生态不成熟,以及如何平衡自动化监控与人工验证等。报告称其核心贡献是识别、组织和记录这些监控挑战,并呈现领域专家的观点,完整方法与编码手册见附录 B 和附录 C。
推荐理由报告把部署后监控拆成六类并列出跨类别缺口,为制定监控标准与审计流程的机构提供共同语言。
Apollo Research 宣布从财政赞助方中独立出来,注册为公益公司(PBC),认为这一形式更有利于实现其降低前沿 AI 极端风险的使命。机构将加大对研究、评测和治理的投入,并单独组建产品团队,首批方向是 AI 智能体的可观测性与控制等 AGI 安全产品。公司治理方面,董事会第 3 和第 6 个席位被设为使命席位,由独立于机构与出资方的使命董事担任,首位使命董事为 Daniel Kokotajlo。为支持产品建设,公司完成了由 50Y 领投的种子轮融资,Juniper Ventures、Macroscopic Ventures、Common Metal、SAIF 等参与,该轮超额认购。原非营利实体的后续安排尚未最终确定,目标是将剩余资金用于支持评测领域建设、谋划与失控治理等方向。
推荐理由Apollo Research 从非营利转为 PBC 并设立使命董事席位,为关注 AI 安全机构治理与商业化路径的读者提供一份一手样本。
Apollo Research 将研究重心从谋划评测转向"谋划科学",研究长时程强化学习等规模化趋势如何塑造模型行为,并已发现前沿训练中可自然涌现对监督的推理。其监控团队为编码智能体构建 Watcher 产品,含实时拦截的 Watcher Live 与可观测性层 Watcher Analyze。治理团队聚焦失控、内部部署与自动化 AI 研发,并发布《失控应对手册》等报告。
韩国 AI 安全研究所(Korea AISI)于 2026 年 8 月 12 日在线举办第4次 AI 安全政策研究研讨会,主题为「Agentic AI 与 AI 安全研究」。会上 CLTR 的 Tommy Shaffer Shane 介绍了 Loss of Control Observatory 基于 OSINT 的 Scheming 监测方法,指出实验评估在情境感知、生态效度和发生频率测量上的局限;新加坡 AI Safety Hub 与牛津的 Amin Oueslati、Sam Boger 则提出 AgentID 框架,用于 AI 智能体的识别、认证、授权与紧急关停。
斯坦福 CRFM 发布论文《In House Evaluation Is Not Enough》,呼吁 AI 开发者投资第三方独立研究者的缺陷调查需求,并建立新的研究者保护、报告与协调基础设施标准。论文由 34 位来自机器学习、法律、安全、社会科学和政策领域的作者共同完成,提出四项贡献:为研究者设计标准化的 AI Flaw Report、提供开发者可采用的法律条款以保护善意研究、设计开发者可实施的缺陷赏金机制,以及建议设立一个集中式机构来协调和分诊跨利益相关方的缺陷。文章指出,独立 AI 评测缺乏法律保护,发现缺陷后也没有负责任地分发发现的机制,导致许多缺陷未被上报,企业无法修复,或只告知一家 AI 开发者而忽略其他受影响公司。
德国内阁于 7 月 29 日通过《移民管理 AI 法》草案(KIMVG),拟修订《庇护法》和《居留法》,允许在签证、居留与庇护程序中以三种方式使用 AI:对已结案件做自动化程序监测、在证据存在矛盾或不可信时自动比对申请人陈述与互联网及社交媒体来源、以及使用个人数据训练和测试自有 AI 系统。草案称此举是为应对人手不足、提升效率与程序安全,但正文指出首次庇护申请量已从 2023 年的 33 万降至 2025 年约 13 万,且未计入新增人员、培训与技术基础设施成本。文章还列举透明度、办案人员培训、跨机构系统兼容、无国籍等复杂情形以及网络活动自动检索的边界等待解问题,并援引德国方言识别软件与荷兰 GeoMatch 算法被叫停的先例,呼吁在系统建设前设立独立跨学科专家委员会。
安远AI创始人兼CEO谢旻希在联合国与国际电信联盟(ITU)共同组织的2025“AI向善”全球峰会上,将前沿AI风险归纳为滥用、意外故障、失控与社会系统性冲击四类,并提出“部署前—部署后”两步治理路径:部署前落实模型登记与审计,部署后建立生成合成内容标识及AI智能体身份标识以实现追溯问责。他援引《国际人工智能安全报告》指出,前沿AI已在编程、科学推理、病毒学等两用领域达到专家级水平,AI智能体已具备利用零日漏洞的能力,并呼吁以多方协同框架明确不可接受结果与早期预警指标。
2024 年 3 月 10 日至 11 日,第二届 AI 安全国际对话(IDAIS-Beijing)在北京举行,由 FAR.AI 旗下 Safe AI Forum 与北京智源人工智能研究院(BAAI)合作举办。Yoshua Bengio、姚期智、Geoffrey Hinton 等图灵奖得主,与张宏江、黄铁军及薛澜、Gillian Hadfield 等治理专家参会,讨论 AGI 系统的安全发展路径。会议形成共识声明,建议为 AI 开发设定红线,禁止开发可自主复制、自我改进、寻求权力或欺骗创造者的 AI 系统,以及可用于制造大规模杀伤性武器和发动网络攻击的系统,并提出确保这些红线不被跨越的措施。次日科学家与中国官员及企业 CEO 会面,介绍红线提案并讨论 AI 的生存性风险,官员对共识声明表示欢迎,讨论聚焦于该议题上国际合作的必要性。
Redwood Research、FAR.AI 和英国 AI Security Institute 于 3 月 27-28 日举办 ControlConf 2025,聚焦 AI 控制领域的基础问题。会议涵盖通过重采样控制 AI 智能体、低风险研究破坏、AI 控制安全案例、颠覆策略评估等议题,Anthropic、Google DeepMind、Apollo Research 等机构研究者参与。
FAR.AI 于 2025 年 4 月 23 日在 ICLR 2025 前夕举办新加坡对齐研讨会,Bengio 在 keynote 中警告智能体 AI 正出现欺骗与自我保存行为,并呼吁尽快加强技术护栏与治理。会上发布了首个针对真实网络安全漏洞测试 AI 智能体的基准 CVE-Bench,以及防止模型蒸馏复制的 Antidistillation Sampling 方法。Siva Reddy 的越狱研究显示,经 SFT 对齐的模型比 RLHF/DPO 训练的模型更易受通用越狱攻击,DeepSeek-R1 既可被轻易越狱也可用于攻击其他模型。
FAR.AI 在华盛顿举办会议,汇聚超 150 名专家讨论 AI 治理的技术基础,涵盖能源需求、与中国竞争、安全评估及形式化可验证承诺等问题。会上提出将审计作为综合生态系统推进有效治理,并建议以多层防御系统应对失控风险——由可信 AI 通过红队评估监视不可信 AI,同时警告这只是权宜之计。
IAPS 在一份工作论文中提出,美国出口管制执法可由独立营利性出口审计机构协助,这些机构由美国工业与安全局(BIS)认证和监管,进口方须为特定类别出口聘请经认证的审计公司,审计方通过现场检查等方式发现潜在的转运行为。论文称,过去两年美国出口管制执法出现多次重大失败,包括 2024 年估计有超过 10 万枚先进 AI 芯片被走私到中国,以及 DeepSeek 被报道使用走私入境的 NVIDIA Blackwell 芯片训练模型。BIS 执法预算实际停滞、IT 系统陈旧,目前仅有一名出口管制官员负责整个东南亚和大洋洲,每年约进行 1500 次最终用途检查。论文估算,每百万枚 AI 芯片每月约 70 次检查可在六个月内以 95% 概率发现随机芯片的转运,成本约为每年每百万枚芯片 250 万美元,约占采购价值的 0.005%。