跳到正文
原文
arXiv:可解释性· arXiv:2610.10560· Makoto Kelp, Amirhossein Arzani, Patricia Castellanos, Paul Griffiths, Ivan Higuera-Mendieta, Manuel Perez-Carrasco, Viral Shah, Patrick Obin Sturm, James Weber·本站收录 · 原文发表

地球科学中 AI 模型的战略性治理

Strategic Governance of AI Models in Earth Science

论文速读

其他

据论文 PDF 整理(AI 生成),以原文为准

作者向十年调查建议:地球科学 AI 不应只看预报技巧,而应把是否符合物理过程列为使用条件。

问题
天气与气候再分析上预训练的基础模型,正被微调到天气预报以外的任务,采用快于评估。作者认为 RMSE 等技巧指标只衡量与参考有多接近,不衡量模型是否表示支配系统的物理过程;这一区分在从未受训的非平稳条件下最要紧。
方法
作者不训练新模型,而列出五项优先级:训练数据筛选与归因、微调对物理行为的影响、极端与分布外扰动测试、机制可解释性,以及大模型上优先做训练后检验。十年建议是开放评估数据、共享报告标准和安全研究计划。
实验与结果
没有自跑定量实验。作者转述:Aurora 大气化学微调的污染物预报时效最长五天仍有技巧,但未保持氮氧化物与臭氧的光化学关系(Figure 1 转自 Hu 等 2026,白区为负浓度)。GraphCast 内部特征既有天气现象,也有网格与地理。
局限与可以继续做的
论文无单独局限节。Section 4 写物理评估的 AI-ready 过程级数据尚不存在,评估方法尚非常规,且尚未培养兼通地球科学与 AI 评估的人力。图转自 Hu 等 2026,本文未报告样本量或误差。
AI 导读基于天气与气候数据预训练的 AI 基础模型正被微调用于远超天气预报的地球科学任务,其发展速度已超过科学界的评估能力。这些模型几乎只靠基准技能指标评判,而技能指标只衡量预报对参考产品的复现程度,不衡量模型是否表征了所预测系统的物理过程,在气候变化带来的非平稳条件下这一区别尤为关键。作者提出从训练数据、微调、行为测试、机制可解释性到输出验证的五个物理评估优先方向,并建议未来十年建设开放评估数据集、共享物理评估报告标准和专门的模型安全研究计划。

基于天气与气候数据预训练的 AI 基础模型正被微调用于远超天气预报的地球科学任务,其发展速度已超过科学界的评估能力。这些模型几乎只靠基准技能指标评判,而技能指标只衡量预报对参考产品的复现程度,不衡量模型是否表征了所预测系统的物理过程,在气候变化带来的非平稳条件下这一区别尤为关键。作者提出从训练数据、微调、行为测试、机制可解释性到输出验证的五个物理评估优先方向,并建议未来十年建设开放评估数据集、共享物理评估报告标准和专门的模型安全研究计划。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    技巧指标只衡量与参考有多接近,作者认为这不等于模型是否符合物理过程。

    预报技巧测的是与参考有多接近,作者认为这不等于地球科学 AI 是否符合物理过程。

    • 场景:作者称,天气与气候再分析上预训练的基础模型正被微调到天气预报以外,开发与采用快于科学界的评估。作者认为风险在基础模型上最突出,因为低成本采用会放大评估缺口。例子包括 Aurora 的大气成分预测和 Prithvi WxC 的重力波参数化;许多任务依赖模型从未被训练去表示的过程。
    • 现有做法:数值天气、气候或化学传输模型由显式方程和守恒律构成,误差可追溯到物理假设。AI 模型架构固定,但训练形成的内部表示不能直接控制,也不必对应物理过程。作者称社区因而主要靠基准:RMSE 和与再分析的相关便于比较并推动了进展,却只奖励与参考产品一致,分不清机制和相关,也分不清是否继承参考产品在参数化与分辨率上的弱点。
    • 作者的主张:作者认为预报技巧与 physical reliability 是不同性质,现有基准只评估技巧。过程表示本身应成为标准,尤其在气候预估这类从未受训的用途上。超出训练范围没有准确性保证,范围内也没有统计保证。采用预计在研究机构、业务中心和公司中快速增长;若基准技巧已满足发表和使用标准,刻画物理行为的压力可能很小。作者称,未经检验、可能不符合物理的行为,会在业务预报和决策支持中变成公共健康与资源管理风险,并把这称为 AI 安全问题。
    • 本文给出什么:这是回应 2028–2037 年国家科学院地球科学十年调查信息征集的白皮书,作者写明未经同行评审。作者列出五项物理评估优先级,并建议开放 AI-ready 评估数据、物理评估报告标准,以及针对这些模型安全的研究计划。
  2. 有哪些相关研究?

    作者把本文放在物理评估与治理上,对照的是技巧基准和已有可解释性工作。

    讨论集中在引言与 Section 1–4 所引工作,本文没有实验对照。

    地球系统模型与 AI 预报

    • 基础模型:Bommasani et al. 2022 与 Zhu et al. 2026 被用来界定地球系统基础模型,即在多样数据上自监督预训练、可做大气与海洋现象预测的大神经网络。作者写本文聚焦再分析预训练模型,所述评估也适用于任务专用模拟器。
    • 被点名的系统:作者点名 Prithvi WxC(Schmude et al. 2024)、Aurora(Bodnar et al. 2025)、GraphCast(Lam et al. 2023)和 AIFS(Lang et al. 2024)。作者称这些系统的全球预报技巧匹配或超过传统数值天气预报,计算成本只占一小部分,引用的是 Bi et al. 2022、2023,L. Chen et al. 2023,Pathak et al. 2022 与 Vaughan et al. 2024。
    • 微调去向:Aurora 被用于大气成分与热带气旋预测,Prithvi WxC 被用于重力波参数化与局地可再生能源预报。作者认为许多任务依赖预训练从未表示的过程,模型是否适合仍不清楚,但微调仍在发生。

    技巧基准与排行榜

    • RMSE 与相关:作者称这两项指标使模型可以直接比较,并推动了 AI 天气预报,引用 Rasp et al. 2020、2024(参考文献题为 WeatherBench 与 WeatherBench 2)。作者同时认为它们只奖励与参考产品一致。
    • 过程级信息:Section 4 写,有的基准已含极端事件个例(Huang et al. 2026),但没有一份提供判定行为是否符合物理所需的过程级信息(Dueben et al. 2022)。天气技巧已有标准化 AI-ready 基准,其他领域更稀疏、更不均一的观测没有。
    • 排行榜:作者引用 Corley et al. 2026,称依赖排行榜会奖励优化分数,而不是内部表示有效的模型。Ullrich et al. 2025 被引为独立评估建议;Husain et al. 2025 被用来支持现有基准只评估技巧。

    可解释性与物理约束

    • 已有个例:作者称 MacMillan and Ouellette 2025 在 GraphCast 上用稀疏自编码器,恢复出与热带气旋、大气河、大尺度降水一同激活的特征,也有编码网格和地理而非物理过程的特征。Hu et al. 2026 被引来说明 Aurora 大气化学微调未保持 NOx 与臭氧的光化学关系;最长五天的污染物预报技巧另引自 Bodnar et al. 2025。
    • XAI 与机制可解释性:作者认为显著性图、逐层相关传播和 SHAP 主要是相关的,到不了输入与输出之间的计算,并引用 Silva and Keller 2024:输出可以归因到正确输入,内部计算仍可以与物理无关。机制可解释性与行为测试的引用包括 Olah et al. 2020、Hendrycks et al. 2022、Nanda et al. 2023。另一路线是解析模型发现(Brunton et al. 2016;Viknesh et al. 2026)。
    • 训练时写入物理:Raissi et al. 2019、Karniadakis et al. 2021、Kelp et al. 2020、Sturm and Wexler 2022 在损失或结构里加入物理信息。作者引用 Kelp et al. 2022 与 Sturm et al. 2023,称即便在部件级模型上,施加约束也并未一致提高精度或稳定性,并认为没有多少证据期望基础模型尺度会不同。

    微调、极端与采用

    • 微调:LoRA 与适配器(Hu et al. 2021;Zhang et al. 2025)、微调可能扭曲预训练特征(Kumar et al. 2022;Shuttleworth et al. 2025)以及避免灾难性遗忘(Elhadidy et al. 2026),被用来说明微调如何保留或破坏物理行为尚不清楚。机器遗忘(Bourtoule et al. 2021;Baiman et al. 2026)被写成探测模型内化了什么的互补办法。
    • 极端与划分:作者引用 Zhang et al. 2026,称 AI 模型在破纪录极端事件上不如基于物理的模型。Kattenborn et al. 2022 与 Rolf et al. 2024 被引来说明空间和时间自相关会使随机划分高估泛化。
    • 采用与开放数据:Gal and Casper 2025、Hickman et al. 2025、Soranno and Cheruvelil 2025 被用来讨论低成本采用和开放数据压力。作者写,独立评估依赖的开放观测正变得更不安全,闭源系统又不提供权重和训练细节。

    基线与基准:论文没有自己的实验基线。技巧参照是传统数值天气预报;极端事件参照是基于物理的模型(Zhang et al. 2026)。当前指标是 RMSE 和与再分析的相关。

    作者把本文放在治理议程上:不是再报一套预报技巧,而是主张把物理过程的表示列为使用条件,并把训练数据、微调、行为测试、机制可解释性和后验验证写成十年优先事项。

  3. 论文如何解决这个问题?

    作者给出五项评估优先级,并建议十年内建设数据、报告标准与安全研究。

    作者不训练新模型。Section 2 的四个引导问题里,前三问由 Section 3 的五项优先级回答,第四问由 Section 4 的三项活动回答。Figure 2 转载自 Hu et al. 2026,示意如何探测基础模型怎样产生预报。

    引导问题与范围

    • 四个问题:模型是靠物理机制还是统计相关做预测;历史记录上准确的模型,在从未受训的非平稳条件下是否仍站得住;预训练和微调如何决定技巧与 physical reliability;何种标准、开放观测和治理能把物理上站得住变成使用条件。
    • 范围:从任务专用模拟器到基础模型。作者写风险在基础模型上最突出,所述评估也适用于地球科学 AI 模型整体。
    • 作者的例子:预测地面臭氧的模型可能主要学到它与温度的相关,排放或野火烟改变这一相关后就会失败(Schnell and Prather 2017)。作者认为稀有事件对数据驱动模型是重大挑战,可能需要专门开发(Sapsis 2021)。

    训练数据与微调

    • 再分析:主导做法是在现成的大再分析上预训练。作者称再分析有全球覆盖和内部一致,适合天气预报,但会平滑大气,可能压低急梯度和极端(Abel et al. 2026;Hersbach et al. 2020)。对大气成分,它把排放、化学、输送和气象混成一个产品。
    • 两问都未系统研究:哪类数据源、变量和分辨率带来最有技巧的预报;哪类数据更让模型学到可辨认的过程而不是相关。直接用观测训练是一条正在做的替代,作者称尚未达到再分析训练模型的技巧(Lean et al. 2026)。训练于基于过程的模式输出能接触物理上一致的场,但可能继承其偏差和缺失过程。作者认为这类模式的继续发展仍然关键。把观测、再分析与过程分辨的模式输出放进多保真设置,可能服务于第二问,也可能反过来暴露物理模式的缺口。
    • 归因:训练数据归因用影响函数和 TRAK 等,量化单个训练样本对预测的影响。作者称影响函数现在可以扩展到数十亿参数的模型。用到地球系统 AI 上,可以看一次极端事件预报依赖的是物理上相似的片段,还是再分析里无关的相关。作者把记录训练数据的组成与处理,写成理解并改进这些模型时代价较低的办法之一。
    • 微调:在用的包括全监督微调、LoRA 和适配器层。作者写,微调如何保留或破坏预训练中获得的物理行为尚不清楚,又必须在避免灾难性遗忘和学入新信息之间取得平衡。天气预训练模型没有生物或生物地球化学过程的表示,微调去预测海洋初级生产力或陆面碳通量时,只能从相关的物理场去推断。机器遗忘被写成探测模型内化了什么的互补办法。

    极端与分布外测试

    • 划分:地球系统数据在空间和时间上自相关,随机训练–测试划分会把测试样本放在训练样本附近,从而高估泛化。作者认为,鉴于地球系统非平稳,空间和时间上有意识的评估应成为标准。
    • 扰动:改变一个输入,看预报是否以物理上说得通的方式变化。作者举例:提高排放输入,看对应污染物是否上升;提高温度场,看依赖变量是否按热力学所要求的方式响应。作者写,这类试验不能证明模型使用了物理机制,只检验响应是否在物理上说得通。
    • 做不到的情况:试验要求模型把相关变量当作输入,许多模型并不如此。即便如此,物理上正确的响应也没有保证,因为没有支配过程的显式表示。作者还写,部署后“分布外条件”的精确定义可能并不显然,自动的分布外推断防护是另一个开放问题。

    机制可解释性

    • 与 XAI 的差别:作者认为应离开输入归因,走向机制可解释性:反推内部特征,以及连接它们的计算通路。因果检验是干预一个内部表示,再测输出变化。另一条是用解析模型发现来建造按设计就可解释的模型。
    • Figure 2:图注写三种做法,并称这些方法可推广到各类 AI 模型。一是扰动输入并分析输出响应;二是用主成分分析(PCA)检查潜在表示;三是在每个 transformer block 上训练稀疏自编码器,以发现可解释特征。图注写明转载自 Hu et al. 2026,用于 Aurora。正文看不到曲线或簇的位置,这里不描述图面分布。
    • 作者给出的理由:这类因果检验开始追踪模型把输入变成预报的内部通路,种类上更接近传统模式的显式方程,也更适合预想训练分布以外的行为。Section 4 补充:语言模型可以被提示露出 chain-of-thought,地球基础模型没有这扇窗,作者称解释内部表示是判断它如何得到预报的唯一途径。

    后验验证与十年活动

    • 两种施加位置:物理信息机器学习在训练时把物理信息写入损失或结构;后验验证在训练后用物理定律检查输出。作者认为对大模型后者优先级更高(Kasteleyn et al. 2026)。理由是地球系统过程多、认识不全、参数化不完美,能施加的约束必然是部分的或不便实施;只强制已知关系会带来强归纳偏置,可能限制模型学习数据里新的结构(Vafa et al. 2025)。多数物理信息模型并非按构造满足物理,而是依赖要在预定范围内探查的软约束,若未覆盖所要的全部物理,泛化问题仍可留下。作者认为没有多少证据期望基础模型尺度会不同,因为要约束的变换多得多。后验检查输出和内部,被写成避开这一交换。
    • 开放数据:物理评估要用的 AI-ready 数据尚不存在,但可以组装。数据应把观测场、模拟场和支配它们的物理量配在一起,例如大气化学的排放与反应速率、陆面的热通量与碳通量,并纳入破纪录和复合事件,覆盖这些模型正被改去使用的海洋和陆面。格式举例为 Zarr 与 Icechunk。全量存档每个场不现实,作者建议 NASA 用云端可部署的模式容器按需再生诊断量。
    • 报告标准:作者举例,一次模型发布应写明质量守恒落在所声明的容差内、规定的排放变化产生预期的污染物变化、技巧在典型和极端条件下都核验过。可依托 ESMValTool(Eyring et al. 2020)。还应写明预处理:归一化统计、掩膜和单位约定。作者认为预处理是模型的一部分,不是实现细节;这些细节很少发布,缺了它们即使在原仪器数据上也不能完成评估或微调。
    • 安全研究计划:Section 3 的方法对地球系统 AI 模型尚非常规。作者把机制可解释性放在首位,并认为随着方法继续扩展,用 AI 系统协助探测和解释其他模型的自动与智能体式评估可能是一个方向。作者还写,解释基础模型自己建起的地球系统表示,也可能暴露传统模式里缺失或表示有误的关系。
  4. 论文做了哪些实验?

    没有自跑实验;转述 Aurora 未保持光化学关系,以及 GraphCast 的内部特征。

    实验设置

    • 文档性质:这是提交给国家科学院 2028–2037 年地球科学十年调查信息征集的白皮书。作者写明未经同行评审。
    • 作者自跑实验:论文未报告作者自行运行的模型、训练、微调、评测、样本量、重复次数或统计检验。
    • 被引例证中的系统:Aurora(大气化学微调)、CAMS、GraphCast、Prithvi WxC、AIFS,以及传统数值天气预报和基于过程的模式。这些不是本文新跑的对象。
    • 图:Figure 1 与 Figure 2 的图注都写明转载自 Hu et al. 2026。Figure 2 是评估框架示意图,图注没有定量结果。
    • 指标:正文把 RMSE 和与再分析的相关写成现有技巧指标。作者没有在本文计算这些指标,也没有给出判定物理一致性的数值阈值。
    • 评审:论文未报告 LLM 评审、人工评估或一致性。

    主结果

    论文没有主结果表。下表只列正文和图注写明的例证;误差、样本量和差值均为未报告。

    例证论文写明的条件作者转述
    Aurora 污染物预报Bodnar et al. 2025时效最长五天仍称有技巧;误差未报告
    Aurora 与 CAMSFigure 1;2022-09-01 12:00 UTC;转自 Hu et al. 2026正文称未保持 NOx–臭氧光化学关系;图注为 NO2 光解速率与 NOx 比值,白区为负浓度
    GraphCastMacMillan and Ouellette 2025;稀疏自编码器特征与热带气旋、大气河、大尺度降水一同激活;另有网格与地理特征;数量未报告
    破纪录极端Zhang et al. 2026AI 不如基于物理的模型;差值未报告
    • 图注与正文:正文把未保持 NOx 与臭氧的光化学关系归于做大气化学微调的 Aurora,并指向 Figure 1。图注写的是 CAMS 与该 Aurora 的 NO2 光解速率和 NOx 比值;白区表示计算中至少一种组分被模型预测为负浓度。图注在并列两个系统后用了单数 the model,没有单独写白区属于哪一个。
    • 作者的解读:作者称技巧不能推出物理上是否一致;上述 Aurora 一例里,预报有技巧与未保持光化学关系同时出现。作者还称,物理行为在模型之间、甚至同一模型的不同变量之间都可以不同。
    • GraphCast:作者把编码网格和地理、而非物理过程的特征,当作内部表示可以偏离它看似在预测的过程的例子。

    被引的极端、观测训练与约束

    • 破纪录极端:作者引用 Zhang et al. 2026,称 AI 模型不如基于物理的模型。本文未给出事件数或技巧差值。
    • 观测训练:作者引用 Lean et al. 2026,称直接从观测训练的系统尚未达到再分析训练模型的技巧。未给出差值。
    • 训练时加约束:作者引用 Kelp et al. 2022 与 Sturm et al. 2023,称施加物理约束并未一致提高精度或稳定性,并认为没有多少证据期望到基础模型尺度会不同。未给出精度或稳定性数值。

    其他消融与分析

    • 论文没有消融、超参数扫描或重复实验;训练数据归因和分布外防护只作为建议,没有本文的数值。
  5. 有什么可以进一步探索的点?

    论文无单独局限节;Section 4 把数据、评估常规和跨学科人力写成十年任务。

    作者指出的局限与后续方向

    论文没有 Limitations、Discussion、Conclusion 或 Future Work 节。下列内容出自 Section 4 明确写成尚未具备或未来十年要做的话。

    • 过程级数据:物理评估所需、含过程级信息的 AI-ready 数据尚不存在。天气技巧已有标准化基准,其他领域的物理评估没有(Section 4)。
    • 存档:全量存档每个相关场不现实;作者建议用云端可部署的模式容器按需再生诊断量,作为策展数据集的补充(Section 4)。
    • 预处理与报告标准:归一化统计、掩膜和单位约定很少发布;作者写,缺了它们即使在原仪器数据上也不能完成评估或微调,并建议把预处理视为模型的一部分,建立共享的物理评估报告标准(Section 4)。
    • 方法尚未成为常规:Section 3 的评估方法对地球系统 AI 模型尚非常规实践;建立它们,尤其是机制可解释性,被写成未来十年的核心科学任务(Section 4)。
    • 自动与智能体式评估:作者认为,随着这些方法继续扩展,用 AI 系统协助探测和解释其他模型可能是一个方向(Section 4)。
    • 人力与治理:作者写,该领域尚未培养同时通晓地球科学与 AI 系统评估的人力,必须有意建设,并需要能根据评估结果采取行动的治理能力(Section 4)。

    实验覆盖范围

    • 本文未报告作者自行运行的训练、微调或评测。Figure 1 与 Figure 2 图注写明转载自 Hu et al. 2026,对象为做大气化学微调的 Aurora,Figure 1 并与 CAMS 对照,时次为 2022 年 9 月 1 日 12:00 UTC。
    • 正文另引用 MacMillan and Ouellette 2025 对 GraphCast 的稀疏自编码器分析、Bodnar et al. 2025 关于最长五天污染物预报技巧的说法,以及 Zhang et al. 2026 关于破纪录极端事件的比较。
    • 论文未报告这些被引结果的样本量、重复次数、误差数值或统计检验。
    • 作者在 Section 3 讨论了物理信息机器学习,并说明对大模型把后验验证放在更高优先级:可施加的约束必然是部分的或不便实施,多数此类模型并非按构造满足物理,而是依赖需在预定范围内探查的软约束。
    • 作者在 Section 3 写,扰动实验不能证明模型使用了物理机制,只检验响应是否在物理上说得通,且许多模型不把相关变量当作输入。
  6. 总结一下论文的主要内容

    立场白皮书:主张把过程表示列为使用条件,并建议十年做数据、标准与安全研究。

    这是一份未经同行评审的立场白皮书,回应 2028–2037 年地球科学十年调查,谈的是治理议程,不是一次新实验。

    • 要处理的落差:再分析上预训练的基础模型正被微调到大气成分、热带气旋、重力波参数化和可再生能源等任务。作者认为发表和使用几乎只看基准技巧,而技巧测的是与参考产品有多接近,不是模型有没有表示支配系统的过程。作者把二者的分离放在气候变化的非平稳条件上,因为这些模型从未在那些条件上受训。
    • 做法:五项优先级是训练数据如何筛选和归因、微调是否留下物理行为、极端与分布外的扰动测试、查看内部特征的机制可解释性,以及对大模型优先做训练后的物理检验,而不是在训练时硬加不完整的物理约束。十年三项活动是开放 AI-ready 评估数据、共享报告标准,以及地球科学 AI 模型的安全研究计划。
    • 用来支撑的个例:作者没有自跑数字。转述称,Aurora 大气化学微调对污染物的预报时效最长五天仍有技巧(Bodnar et al. 2025),却未保持 NOx 与臭氧的光化学关系;Figure 1 转自 Hu et al. 2026,图的是 2022-09-01 12:00 UTC 的 NO2 光解速率和 NOx 比值,白区为负浓度。GraphCast 的稀疏自编码器特征里,既有热带气旋、大气河和大尺度降水,也有网格和地理。另一处引用称,破纪录极端上 AI 不如基于物理的模型,本文未给差值。
    • 作者的结论:过程表示应成为能否使用的条件;开放权重和训练细节是独立评估的前提。作者还称,地球基础模型没有语言模型那种 chain-of-thought 窗口,解释内部表示是判断预报如何得出的唯一途径,并可能反过来暴露传统模式里缺失或表示有误的关系。
阅读原文arxiv.org