论文提出用语言模型充当 AI 研究世界模型,预测实验结果
Language Models as AI Research World Models
语言模型作RWM预测干预增益:五环境in-env平均Spearman从0.506升至0.774。
- 研究智能体提出实验快于在真实环境中执行。预算有限时,需要在执行前预测干预增益,并判断一个环境的实验记录能否帮助预测另一个环境中的未见干预。
- 把参数固定的语言模型当作研究世界模型,输入环境、干预和允许的历史,输出增益中位数。比较无记录、同环境记录和跨环境记录,并按预测在固定预算下选择实验,包括多轮 Autoresearch。
- 作者报告in-env平均Spearman从0.506升至0.774,cross-env宏观Regret@3降52.2%。OLMo3-100M多轮:in-env、cross-env使final best gain相对W0高15.8%、11.6%。
- 作者称所展示的收益来自上下文学习,跨环境证据目前限于自回归预训练。下一步是在多样记录上训练 RWM,并在未见环境与上下文学习比较。评测记录来自九个环境共 2,653 条;13 个骨干的比较和多轮实验都在 OLMo3-100M 上。
- 被测模型
- Claude Opus 5Grok-4.6GPT-6 AstraGPT-5.6 SolGPT-5.6 TerraGPT-5.6 LunaMiniMax-M2.5Kimi-K2.5GLM-5Qwen3-235BDeepSeek-V3.2Nemotron-3-SuperMistral-Large-3
- 基准
- OLMo3-100MOLMo3-190MMarinNanochatQwen3Diffusion (E2D2-170M)Math distillationCode RLInference optimizationAIME24AIME25LiveCodeBench
- 指标
- SpearmanMAERegret@3NDCG@3final best gainnAULC
论文研究语言模型能否作为研究世界模型(RWM),预测候选干预在不同研究环境中的结果。评估基于九个研究环境、超过 2600 条实验记录,涵盖预训练、后训练和推理,合计逾 171000 H100 GPU 小时。来自真实实验的研究知识能提升 RWM 对同一环境内未见干预的预测(Spearman +0.27),并可跨环境复用:仅用 OLMo3、Marin 和 Nanochat 的预训练经验,RWM 在 Qwen3 环境中把选择遗憾降低 78%。在固定选择预算的多轮 Autoresearch 中,具备环境内和跨环境研究知识的 RWM 分别把最佳增益提高 15.8% 和 11.6%。对 13 个作为 RWM 的语言模型的消融显示,加入研究知识对干预排序的改善超过更换模型或单纯增加推理投入。
深度解读
这篇论文试图解决什么问题?
提案快于执行,需要在预算内预测干预增益,并跨环境复用实验记录。
研究智能体提出干预快于真实执行,有限预算下需要预测未见干预的增益,并判断实验经验能否跨环境复用。
- 场景:作者认为,改学习率调度或训练数据配比,在一种模型和预算下可能提升表现,换一个模型或预算则收益很小,甚至变差。这种不确定性决定能探索哪些干预、多快找到有效改进,并贯穿预训练、后训练和推理。
- 现有方法:作者称,语言模型已能在单个任务内用实验经验辅助优化和研究。既有研究没有直接回答:一个环境里的真实实验知识,能否预测另一环境中未见干预的结果。
- 核心观察:同一干预在不同环境中效果可以不同,预测必须计入实施它的环境。作者把可积累、可服务多个环境的实验经验称为研究知识,而不是只绑定在产出记录的那个环境上。
- 提出的对象:作者定义研究世界模型(Research World Model, RWM):同一个模型服务多个研究环境,在执行前预测候选干预的增益。本文用语言模型实现 RWM,并在九个环境、2,653 条真实记录(171,862 H100 GPU-hours)上比较无记录、同环境(in-env)和跨环境(cross-env)。
有哪些相关研究?
作者把本文放在自动研究流程之外,专注实验知识能否改善环境内与跨环境预测。
自动研究智能体
- 迭代实验流程:Autoresearch(Karpathy, 2026)、AIRA2(Hambardzumyan et al., 2026)和 AI Scientist(Lu et al., 2024)把提出、实现、评估实验做成不同的搜索与执行流程。AutoLLMResearch(Guo et al., 2026)在多保真环境里通过交互学习实验配置策略。
- 作者的定位:作者称这些系统仍要为评估候选消耗时间和算力;本文研究的是互补能力,即预测结果,以决定哪些候选值得执行。
- 附录中的相关系统:附录 A 还写到 ResearchAgent、AI co-scientist、AI Scientist-v2、Agent Laboratory,以及 MLAgentBench、MLE-bench。论文把它们写成研究预测可以派上用场的流程和评测设置,没有逐篇批评。
实验决策的预测模型
- 语言模型预测:LLAMBO(Liu et al., 2024)用历史评估作上下文示例,做代理建模和候选采样,并给出带经验不确定性的数值预测。Research preference models(Foster et al., 2026)比较候选方案和代码;Predict-Before-Executing(Zheng et al., 2026)研究成对方案偏好,并把预测放进 ForeAgent 的 predict-then-verify 循环。
- 更早的代理模型:附录 A 还写到贝叶斯优化(Snoek et al., 2012)、学习曲线预测(Klein et al., 2017)和架构搜索的性能预测(Baker et al., 2017)。作者称缩放定律、计算最优训练和 DoReMi 说明实验条件为何重要,但没有解决任意代码级干预的预测。
- 作者的定位:作者称上述工作把预测和优化、研究搜索连在一起,是用预测分配实验投入的近例;引言称既有研究没有直接回答跨环境复用这一问题。
面向研究的世界模型
- 动作后果预测:World Models(Ha and Schmidhuber, 2018)以及 Dreamer 一系列工作(Hafner et al., 2019a 等)用动作后果的预测支持规划和控制。附录 A 还讨论 PlaNet、DreamerV3、PETS、MBPO 和 MuZero。
- WMRL:Yang et al.(2026)用语言模型对执行结果的预测作为 RL 后训练的代理奖励,并用真实执行校正偏差、降低更新方差。作者称这是用语言模型近似研究环境交互的直接先例。
- 同名不同义:附录 A 脚注写明,AI-Supervisor(Long, 2026)也使用 Research World Model,指方法、基准、局限和研究空白的持久知识图谱。作者称本文的用法是动作条件下的实验结果预测。
基线与评测环境
- 基线方法:kNN 回归和 ridge 回归。二者与带记录的 RWM 接收相同的实验记录和候选输入,超参只用允许的历史选择。k 取自 {1, 3, 5, 10},λ 取自 {0.03, 0.1, 0.3, 1, 3, 10, 30, 100}(附录 C.2)。
- 评测环境:Table 1 的九个研究环境。结果是各环境协议下相对参考的增益,不是另发的一份命名基准。
作者把本文放在互补位置:检验实验知识能否改善环境内和跨环境的干预结果预测,包括目标环境没有结果记录的迁移,以及这些预测在固定预算下是否带来更好的选择。知识通过上下文学习使用,作者将在大规模研究数据上训练专用 RWM 写成长期目标。
论文如何解决这个问题?
固定参数的语言模型读入环境、干预和历史,预测增益中位数并据此选实验。
作者用参数固定的语言模型实现 Research World Model(RWM)。它在执行前读取环境、干预和允许的历史,预测增益中位数;只有排序靠前的干预消耗实验预算,执行结果再进入后续历史。
环境与增益
- 环境:每个任务 τ 定义环境 Eτ,规定参考系统以及执行、评估的条件。可采纳干预空间之外的条件保持固定,包括实验协议施加的条件。
- 干预:a 是相对参考代码或配方的具体改动,可以合并多处编辑。终态 s 从 Eτ(·|a) 抽取,g = gτ(s) 是相对参考的增益。
- 分数与增益:score 是绝对测量,gain 是相对参考的变化。BPB 用参考减候选;准确率和吞吐用候选减参考。准确率在 [0, 1] 内时,差值乘 100,以百分点报告。正值表示改进。作者称最终性能增益是首要结果。
- 固定参考:同一环境的实验从同一参考出发,历史 H 持续累积。跨环境检验的是:参考模型或训练实现等环境内固定条件改变后,经验是否仍然有用。
预测目标
预测对准 rollout 分布下增益的中位数:
ĝ = M(Eτ, a, H) ≈ Medians ∼ Eτ(· ∣ a)[gτ(s)]
该式表示:同一个 M 估计的是给定环境和干预时增益读出的条件中位数,不是某一次执行的样本。
- 文本接口:ϕ 把任务描述、已实现的干预和允许的历史序列化为文本。θ 固定,预测写成 LLMθ(ϕ(Eτ, a, H))。提示词要求返回与实测增益同单位的中位数,字段为 primary_gain_q50。附录 C.1 给出压缩后的提示词。
- 信息边界:被查询干预的结果和执行后元数据在所有条件下都扣留。记录按数据而不是指令处理;不使用工具或网络搜索。作者称原始提示词面向跨研究设置的保守预测。
- 默认骨干:Claude Opus 5,上下文窗口 1M,推理力度 HIGH(Section 3.1)。
三种历史
记录写成 (Eτi, ai, gi),并保留参考信息、测量和执行元数据。源记录的增益相对该记录自己的参考。
- W0:n = 0。没有实验记录,仍给出目标任务和被查询干预。
- Win-env:n > 0,且每条记录都来自目标环境。
- Wcross-env:n > 0,且每条记录都不是目标环境。本文的 cross-env 评估还从源历史中去掉留出干预及其近重复组(Section 3.2.2)。
比较学习与迁移时只改记录来源,不改 θ 和推理设置。
如何用预测做选择
- 单轮:从 16 个候选里选预测最高的 3 个。作者称这模拟大约 20% 的执行预算。200 个随机划分,各预测器共享候选池。预测完全相同时,选择指标对并列取均匀期望。
- 多轮:OLMo3-100M 上五次评估、每次八轮。每轮新增 16 个候选,未选中者以后仍可选。每种方法的预测以初始记录加上它自己已执行的记录为条件。总选择预算 24。并列按固定候选 ID 升序打破(附录 E)。
- 对照:kNN 输出近邻增益的中位数;ridge 在干预特征上做 L2 线性回归,截距不惩罚。词表和 TF–IDF 只在允许的历史上拟合。超参只按允许历史的验证 MAE 选择(附录 C.2)。
判定指标
- 预测:MAE 越低越好,Spearman 越高越好。每次静态评估用一个固定划分,所有预测器共享。
- 选择:Regret@3 是池中最高增益减去所选三个里的最高增益。NDCG@3 的相关性是 max(g, 0)。没有正增益的池不进入 NDCG@3,仍进入 Regret@3。Random 是均匀选三个的精确期望。
- 多轮:final best gain 包含增益为 0 的未改参考。nAULC 以同到达日程、同预算、事先知道实测增益的 Arrival Oracle 为 100% 参照,再对五次评估平均。
论文做了哪些实验?
作者报告in-env平均Spearman从0.506到0.774;cross-env宏观Regret@3降52.2%。
实验设置
- 骨干:默认 Claude Opus 5(1M 上下文,HIGH)。Figure 3a 另比较 13 个语言模型;推理力度为 LOW、MEDIUM、HIGH、XHIGH、MAX(附录 C.3)。知识条件之间骨干和推理设置固定。
- 环境与规模:Table 1 共九个环境、2,653 条记录、171,862 H100 GPU-hours。in-env 为 OLMo3-100M、Diffusion、Math distillation、Code RL、Inference optimization。cross-env 为五个自回归预训练环境:OLMo3-100M、OLMo3-190M、Qwen3、Marin、Nanochat。
- 增益协议:自回归预训练用十个任务 BPB 的不加权平均,增益为参考减候选。Diffusion 用 DUEL BPB。数学蒸馏是 Qwen3-1.7B 在 AIME24/25 上的 avg@32,增益为百分点。Code RL 是 OLMo-3-7B 的 LiveCodeBench。推理优化是 Gemma-4-E4B-it / vLLM 的质量约束吞吐(tokens/s)。没有 LLM 评审。
- 划分:静态预测每个环境一个固定划分。cross-env 用其余四个环境的 244 条记录,预测目标环境 71 个干预,不提供目标环境记录(Section 3.2.2)。
- 基线:W0、kNN、ridge。选择实验对 200 个共享随机划分平均。多轮对五次评估平均。论文未报告静态预测的多次重复。
- 不确定性:附录 D.1 对 cross-env 的 Spearman 差做 3,000 次配对 bootstrap,重抽样 69 个语义组。区间以固定历史、预测和已记录结果为条件。
主结果
默认骨干为 Claude Opus 5。下表是 Table 2 的 Spearman,History/Test 为同环境上下文条数和留出候选数。
表格较宽,可左右滑动
环境(单位) History/Test W0 kNN ridge Win-env OLMo3-100M(BPB) 320/160 0.62 0.78 0.67 0.90 Diffusion(BPB) 536/125 0.46 0.49 0.50 0.78 Math distillation(pp) 180/100 0.43 0.61 0.62 0.70 Code RL(pp) 34/115 0.48 0.29 0.48 0.62 Inference optimization(tokens/s) 457/98 0.54 0.62 0.72 0.88 - 引言与 Section 3.2.1 报告,五个环境未见干预的平均 Spearman 从 0.506 升至 0.774,相对 W0 提高 0.27。Section 3.1 写明聚合在四舍五入前计算,因此与表中四舍五入单元格不完全相同。
- 作者称,带记录的 RWM 在每个环境的 MAE 和 Spearman 上都优于使用同样记录的 kNN 和 ridge。Table 2 的 MAE 中,Inference optimization 从 W0 的 13.19 到 Win-env 的 1.34。
- Code RL 的同环境历史是 34 条、测试 115 条。作者未单独解释这一划分。该行 kNN 的 Spearman 低于 W0,作者未对此作解释。
跨环境预测
- 协议:五个自回归预训练环境轮流作目标。Wcross-env 用其余四个环境的 244 条记录预测 71 个干预;源历史排除留出干预及其近重复组。kNN 和 ridge 使用同样的源记录。
- 点估计:作者报告五个目标的 Spearman 点估计都高于 W0。引言写平均 Spearman 从 0.628 升至 0.729;Table 3 四舍五入后的宏观值为 0.63 到 0.73,宏观 MAE 从 1.31e-2 到 1.22e-2。Table 3 中 Wcross-env 的 Spearman 为 0.83、0.78、0.82、0.50、0.71(OLMo3-100M、OLMo3-190M、Qwen3、Marin、Nanochat)。
- 例外与区间:kNN 的宏观 Spearman 为 0.36,低于 W0 的 0.63,且每个迁移目标都低于 W0。Nanochat 上 kNN 为 −0.17、ridge 为 −0.12。Table 7 中,相对 W0 的差:OLMo3-190M 为 +0.06,区间 [−0.07, +0.18];Marin 为 +0.08,区间 [−0.05, +0.24]。作者举 Nanochat 的 Muon 优化器变体:源记录 kNN 预测 +0.018 BPB,实测 −0.036,W0 预测 −0.035。
固定预算选择
- 同环境:从每个 16 候选池中选 3 个,200 个划分。各环境 Regret@3 相对降幅的等权平均为 58.2%(附录 D.2 的第一种算法,不是宏观均值的相对降幅)。引言称 NDCG@3 均值从 0.599 升至 0.785。作者称 NDCG@3 相对 W0 在每个环境都更高。
- 未同时最优的一行:Table 4 中 Inference optimization 的 Regret@3,Win-env 为 2.53,kNN 为 1.62,ridge 为 2.09,W0 为 3.60。作者未解释该行为何 kNN 低于 Win-env。
- 跨环境与摘要数字:Wcross-env 使五环境宏观平均 Regret@3 相对 W0 降 52.2%;Table 5 宏观 Regret@3 从 2.51e-3 到 1.20e-3,宏观 NDCG@3 从 0.63 到 0.74。除 Marin 外,Regret@3 和 NDCG@3 在各目标都更好。Marin 的 Regret@3 从 W0 的 7.40e-4 到 Wcross-env 的 7.90e-4,NDCG@3 从 0.74 到 0.70。两个特征基线的宏观 Regret@3 都高于 W0。摘要称,只用 OLMo3、Marin、Nanochat 的预训练经验,Qwen3 的选择 regret 相对零经验降 78%。Table 5 的 Qwen3 为 W0 9.40e-4、Wcross-env 2.10e-4。论文未说明 78% 是否由这两格算出,也未说明摘要的三个源环境是否等于 Section 3.2.2 的其余四个环境。
多轮 Autoresearch
- 设置:OLMo3-100M,五次评估,每次八轮。每轮 16 个新候选,每轮选 3 个,预算 24。Win-env 与 Wcross-env 各用 244 条初始记录,来源分别是同环境和其它环境。候选从与初始同环境历史不交的 231 个未见干预中抽取 128 个(附录 E)。
- 增益:作者报告,同预算下平均 final best gain 相对无初始知识的 W0 提高 15.8%(in-env)和 11.6%(cross-env)。摘要写的是 best gain 提高 15.8% 和 11.6%,未写“平均”。
- nAULC:Figure 2b 标注的平均 nAULC 为 W0 85.26、Win-env 98.26、Wcross-env 94.34、cross-env kNN 86.16、cross-env ridge 78.06。作者称跨环境记录接近同环境记录,并高于用同样源记录初始化的特征预测器。图中 best-so-far 曲线的端点数值未标注。
其他消融与分析
- 13 个骨干、OLMo3-100M 面板:无额外知识的 Spearman 从 −0.362 到 0.621,有 in-env 知识从 0.638 到 0.896。作者称有知识时最弱骨干仍高于无知识时最强骨干,两段范围不重叠(Section 3.5,Figure 3a)。论文未给出每个骨干的单独数字。
- Claude Opus 5 推理力度:LOW 到 MAX,Spearman 从 0.609 到 0.648;LOW 加研究知识为 0.892。Figure 3b 标注 Best W0 (XHIGH): 0.65,Worst Win-env (LOW): 0.89。作者称有记录的 LOW 高于每一个无记录的推理力度。
- 预测成本(Section 3.3):Claude Opus 5(1M,HIGH)对 16 个候选各调用一次,作者称约 6.3 美元。九环境单次实验平均算力成本的中位数为 42.3 H100 GPU-hours,按每 GPU-hour 3 美元约 127 美元。作者称给 16 个候选打分约为一次代表性实验的 5%。
- 参考可重复性(附录 B.1):三种子 mean BPB 标准差为 0.00544、0.00515、0.00507、0.00340、0.00570,顺序是 OLMo3-100M、OLMo3-190M、Qwen3、Marin、Nanochat。数学蒸馏 21 次参考重训的标准差为 0.586 个百分点。推理优化四次参考运行的吞吐标准差为 0.5604 tokens/s。作者称这些测量不估计干预特异方差。
有什么可以进一步探索的点?
作者称收益来自上下文学习,跨环境证据限于自回归预训练。
作者指出的局限与后续方向
- 获取方式:作者写明,所展示的收益来自上下文学习(Section 5)。
- 跨环境范围:作者写明,跨环境证据目前限于自回归预训练(Section 5)。
- 训练比较:作者提出下一步是在多样实验记录上训练 RWM,并在未见环境中与上下文学习比较泛化(Section 5)。这是后续方向,不是已完成的训练。
- 即时改进与积累知识:作者提出,把 RWM 接入持续研究时,要处理即时改进与为未来决策积累知识之间如何平衡(Section 5)。
- 总成本:作者写明,评估这类系统要测量研究进展和总成本,包括数据获取、推理和执行;更好的预测本身并不保证研究更有效(Section 5)。
- 保留记录:作者认为应保留环境描述、干预和结果,包括没有提升表现的实验(Section 5)。
实验覆盖范围
- 记录来自 Table 1 的九个环境,合计 2,653 条、171,862 H100 GPU-hours。in-env 列为 ✓ 的是 OLMo3-100M、Diffusion、Math distillation、Code RL、Inference optimization;Cross-env 列为 ✓ 的是五个自回归预训练环境。
- 默认骨干是 Claude Opus 5(1M,HIGH)。13 个骨干和五种推理力度的比较使用 OLMo3-100M 的历史与测试面板(Section 3.5,附录 C.3)。
- 多轮 Autoresearch 在 OLMo3-100M 上进行:五次评估、每次八轮、每轮 16 个新候选、每次选择预算 24(Section 3.4,Figure 2,附录 E)。
- 静态预测每个环境使用一个固定划分;选择指标对 200 个划分平均(Section 3.1、3.3)。附录 D.1 报告 cross-env Spearman 差的配对 bootstrap 区间。论文未报告静态预测的多次重复,也未报告干预特异的增益方差。
- 知识条件之间 θ 与推理设置固定,记录经上下文输入(Section 2.3)。论文未报告在实验记录上更新 RWM 参数后的预测。Reproducibility Statement 写明语言模型预测依赖商业 API,不能按位复现。
总结一下论文的主要内容
作者称实验记录可在环境内外复用,并改善固定预算下的实验选择。
作者把语言模型用作研究世界模型,在执行前预测干预增益的中位数,用来在有限预算下比较候选实验。
要处理的缺口是研究智能体提案快于执行。同一类改动在不同参考模型、配方和预算下效果可以不同,因此需要能离开原环境继续使用的实验知识。
做法是固定语言模型参数,把真实记录放进上下文。无记录、同环境记录、跨环境记录共用同一骨干。BPB 的增益是参考减候选,准确率和吞吐是候选减参考。默认骨干是 Claude Opus 5(1M,HIGH)。语料是九个环境的 2,653 条记录,对应 171,862 H100 GPU-hours。
作者报告的主要结果:
- 五个 in-env 环境上,未见干预的平均 Spearman 从 0.506 升至 0.774。
- 五个自回归预训练环境没有目标环境记录时,引言中的平均 Spearman 从 0.628 到 0.729;Table 3 的宏观值是 0.63 到 0.73。宏观 Regret@3 相对 W0 降 52.2%。Marin 的 Regret@3 与 NDCG@3 没有一起变好。
- OLMo3-100M 上八轮、24 次选择的 Autoresearch 中,in-env 与 cross-env 初始记录使平均 final best gain 相对 W0 提高 15.8% 和 11.6%。
- 同一 OLMo3-100M 面板上,13 个骨干无额外知识时 Spearman 为 −0.362 到 0.621,有同环境知识时为 0.638 到 0.896。Claude Opus 5 从 LOW 到 MAX 为 0.609 到 0.648,LOW 加上研究知识为 0.892。
作者称,真实实验产生的知识可以服务后续研究,包括产出它的环境之外;在所测设置里,缺少相关实验知识比推理力度更突出。在多样研究数据上训练 RWM 被写成长期目标。作者同时写明,更好的预测本身并不保证研究更有效。