跳到正文
原文
论文追踪· arXiv:2607.28568· Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xi·本站收录 · 原文发表

Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

论文速读

对齐/训练方法

据论文 PDF 整理(AI 生成),以原文为准

作者训练 Frontis-MA1-35B 作 MLE 元进化智能体:在 MLE-Bench Lite、12 小时/任务预算下,OpenMLE-Evo 将 Medal Average 从 39.39% 提到 60.61%,Evo-Max 达 71.21%。

问题
递归自我改进需要能改进“构建 AI 过程”的系统。机器学习工程提供可执行反馈,但公开系统很少同时覆盖可验证环境、基于执行的后训练和长程进化搜索。
方法
OpenMLE 把 Draft、Improve、Debug、Crossover 四个算子同时用于后训练和推理:Gym 提供 5758 个可执行任务,ERL 用执行反馈做 SFT 与 RL,Evo 把算子组成经验引导的长程搜索,并训练 Frontis-MA1-35B。
实验与结果
MLE-Bench Lite、每任务 12 小时、一块限 12 GB 显存的 RTX 4090 上,OpenMLE-Evo 将 Medal Average 从基座的 39.39% 提到 60.61%,OpenMLE-Evo-Max 达 71.21%。NatureBench Lite 上,换模型使 Match-SOTA 从 50% 到 70%,换搜索框架从 20% 到 50%。
局限与可以继续做的
作者计划发布数据、训练与评测代码、沙箱、harness 和检查点,正文写的是将发布而非已完成。受许可限制,完整任务包只覆盖 1415 个任务,其余 4343 个只发布脚本。具体局限需以第 8 节原文为准,本摘要所见正文在该节之前被截断。
实验设置Frontis-MA1-35B、Qwen3.6-35B-A3B 等 · MLE-Bench Lite、NatureBench Lite 等 · Medal Average、Medal avg@3 等
模型
Frontis-MA1-35BQwen3.6-35B-A3BFrontis-MA1-30BQwen3-30B-A3B-Thinking-2507GPT-5.6 SolGPT-5.5Kimi K3GLM-5.2Kimi K2.6MiniMax-M3Grok-4.5Opus 4.8Gemini 3.5 FlashSonnet 5Doubao-2.1 Pro
基准
MLE-Bench LiteNatureBench LiteOpenMLE-Gym
指标
Medal AverageMedal avg@3Human RankMatch-SOTAValidation Medal CountValidation Base RewardGroup Best Reward
AI 导读全文 397 字

研究者提出 OpenMLE 全栈系统用于研究机器学习工程中的递归自我改进,包含可验证任务环境 OpenMLE-Gym、算子学习 OpenMLE-RL 和长时程搜索 OpenMLE-Evo,并在此基础上后训练出 35B 的元进化智能体 Frontis-MA1。该模型围绕 Draft、Improve、Debug、Crossover 四个程序进化算子,用执行反馈驱动的 SFT 和 RL 训练,再组合成长时程搜索。在单张 RTX 4090、12 GB 显存、每任务 12 小时预算下,MLE-Bench Lite 的 Medal Average 从基座的 39.39% 提升到 60.61%,配合 OpenMLE-Evo-Max 达到 71.21%,超过 GPT-5.5 + Codex,接近 GPT-5.6 Sol 和 2.8T 的 Kimi K3。作者开源了模型权重和完整 OpenMLE 栈。

深度解读

6 个问题,约 11,300 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    作者要把可执行 MLE 做成通向元进化的 RSI 试验场,并训练改进器本身。

    如何让语言模型在可执行机器学习工程里,通过同一组程序进化算子既被训练、又被用于长程搜索,从而迈向元进化(meta-evolution)。

    • 场景:作者认为 AI 能力增长不再只靠人类工程师,系统已能写代码、跑实验并参与构建下一代 AI(AI4AI)。更远的终点是递归自我改进(recursive self-improvement, RSI):每个被改进的系统继续改进产生后继者的过程。这需要的不只是一次性生成,而是能检查数据、提出算法、执行实验、诊断失败并分配下一步算力的智能体。
    • 试验场:机器学习工程(MLE)被作者视为 AI4AI 的直接实例:智能体为真实任务构建机器学习方案,并依据执行反馈迭代。单次迭代可能耗时数分钟到数小时,反馈延迟、有噪声且异质。
    • 现有不足:作者把已有工作分成推理期 harness、可执行环境、以及用执行反馈后训练三条线。作者称,在附录 Table 11 审计的代表性公开系统中,没有系统同时覆盖可扩展任务与环境构建、基于执行的智能体后训练、以及把训练后模型部署到长程进化搜索的 harness,并附带复现整条闭环所需的制品。
    • 核心设定:作者区分 AI4AI(优化对象)、进化(按执行反馈反复修改候选系统)和元进化(用进化轨迹训练提出后续修改的模型)。RSI 还要求更强、持续的闭环。OpenMLE 研究的是从进化走向元进化的具体一步:用 SFT 和 RL 重用可执行搜索经验,改进程序变换模型。
    • 本文提出:开源全栈 OpenMLE——OpenMLE-Gym(可验证任务与执行反馈)、OpenMLE-ERL(算子学习)、OpenMLE-Evo(长程搜索)——并后训练 Frontis-MA1-35B 作为元进化智能体(meta-evolution agent)。Draft、Improve、Debug、Crossover 四个原子算子同时是训练目标和推理期搜索的组成单元。作者还训练 Frontis-MA1-30B 做跨模型复现,并称将发布数据、代码、沙箱、harness 和检查点。
  2. 有哪些相关研究?

    作者把相关工作分成推理期搜索、可执行环境和执行反馈后训练三条线。

    引言把 MLE 智能体的已有进展分成三条相互重叠的线,并点名若干同时触及其中子集的系统。第 7 节标题为 Related Work,但本次可见正文在进入该节的展开之前中断,因此下面只写引言、问题形式化和方法节里实际讨论过的工作。

    • 推理期搜索 harness:Du et al. (2025)、Fang et al. (2025)、InternScience (2026)、Jiang et al. (2025)、Liu et al. (2025a)、Nam et al. (2025)、Toledo et al. (2025)、Zhu et al. (2026b) 发展基于结构化或进化搜索的推理期 harness。方法节进一步把 AIDE、AIRA、AIRA2 写成在可执行程序上做树或种群式探索、反复执行和候选精炼(Hambardzumyan et al., 2026;Jiang et al., 2025;Toledo et al., 2025)。作者对标准 AIRA-Evo 的具体差异写在方法里:它以自由形式记忆为主、急切合成记忆、主要按标量适应度选父代,且不同算子拿到大体相似的历史;OpenMLE-Evo 改为结构化经验、按质量/进展/新颖性做非贪心选择,并按算子按需合成有界记忆。

    • 可执行任务与环境:Lupidi et al. (2026)、Nathani et al. (2025)、Qiang et al. (2025a,b) 构建可执行任务与环境。任务形式沿用 MLE-Dojo 与 MLE-Bench(Chan et al., 2024;Qiang et al., 2025a)。Kaggle Dataset 分支利用并扩展 MLE-Smith 的数据集到任务流水线(Qiang et al., 2025b)。环境契约引用 Gym 式的动作、转移、观察、奖励与停止条件(Brockman et al., 2016;Nathani et al., 2025;Qiang et al., 2025a;Xi et al., 2024)。Figure 4 把 OpenMLE-Gym 的 5758 个任务与 MLE-Smith 606、MLE-Dojo 200+、DSBench 74、MLE-Bench 75、MLGym-Bench 13、MLAgentBench 13 并列,作为任务包规模对照。

    • 执行反馈后训练:Cai et al. (2026)、Li et al. (2025b)、Liu et al. (2025b)、Yang et al. (2025a) 用执行反馈后训练 MLE 智能体。作者点名两套跨线系统:MLE-Dojo 支持模型调优,AceGRPO 把迭代执行轨迹回收进训练(Cai et al., 2026;Qiang et al., 2025a)。训练动机引用 RLVR 分析:RL 可以提高 Pass@1,但在大 K 上增益有限,而教师蒸馏可以引入基座采样支撑里没有的行为(Yue et al., 2025);并与数学和代码上的短程 RLVR 对比(Shao et al., 2024)。奖励塑形引用自适应可验证环境与演化量规(Shao et al., 2025;Zeng et al., 2025),以及 TTT-Discover 的上尾原则和 Best-of-N / Pass@k 目标(Yuksekgonul et al., 2026;Bagirov et al., 2025;Chen et al., 2025;Peng et al., 2025;Walder and Karkhanis, 2025)。

    • RSI 与元进化定位:RSI 的更强闭环引用 Eth and Davidson (2025)、Favaro and Clark (2026)、Good (1965)、Schmidhuber (2003)。元进化智能体这一角色引用 Jiang et al. (2026)。Figure 2 把机制阶梯画成进化、元进化、自我进化,并把本文放在“改进器本身被训练”的元进化层。

    • 基线方法与基准:评测主基准是 MLE-Bench Lite,迁移用 NatureBench Lite(Wang et al., 2026)。引言给出的对照包括:同一 OpenMLE-Evo harness 下的基座 Qwen3.6-35B-A3B 与 Qwen3-30B-A3B-Thinking-2507;通用 Claude Code 或 Codex scaffold(四个前沿模型)以及 Frontis-MA1-35B 上的原始 AIRA-Evo;系统级对照 GPT-5.5 + Codex,并称 OpenMLE-Evo-Max 接近 GPT-5.6 Sol 和 2.8T 的 Kimi K3。Figure 1 图注写柱为全部已完成 harness 结果,Pareto 面板保留每个模型的最佳 harness。附录表末行列出的公开系统对照包括 R&D-Agent(68.18%,12h · 1×V100,GPT-5)、MLE-RL(33.30%,12h · A10,MLE-RL-32B-S)、AceGRPO(51.52%,12h · GPU NR,Ace-30B),以及若干更高预算或不同 GPU 上的 harness 结果(如 80.30%、77.27%);该表列在可见文本中可能错位,这里只保留与行内文字连在一起的数字。

    作者把本文定位为:在被审计的代表性公开系统中,同时覆盖可扩展环境、基于执行的后训练和部署该模型的进化 harness,并用四个共享算子把学习与进化接成一个元进化闭环。

  3. 论文如何解决这个问题?

    OpenMLE 用 Gym、ERL、Evo 三层,把四个程序进化算子同时用于训练和搜索。

    整体思路是把 Draft、Improve、Debug、Crossover 做成后训练与推理共享的接口:OpenMLE-Gym 提供可执行任务和反馈,OpenMLE-ERL 用这些转移做 SFT 与 RL,OpenMLE-Evo 在测试时把同一算子组成长程搜索。训练后的模型成为进化 harness 的变异引擎。

    问题设定与形式化

    • 任务:每个任务 τ 含自然语言说明、可见数据、提交契约、任务特定评测器和沙箱。第 t 步,搜索算法选择算子 a_t,并从零个或多个父程序及其执行反馈构造上下文 c_t。
    • 生成与打分:候选程序按 pt ∼ gθ(· ∣ τ, at, ct) 采样,沙箱 E 执行后由评测器 R_τ 给出任务分 s_t。g_θ 是由语言模型参数 θ 参数化的算子条件程序生成策略。
    • 搜索目标:因指标量纲和方向不同,第 4.3 节把 s_t 转成越大越好的有符号分数 s̃_t。预算内寻找 s̃ 最高的候选。算子空间固定为上述四个,全局组合留给推理期搜索算法。
    • 学习目标:元进化提高 θ,使 g_θ 更倾向执行结果更好的程序。SFT 与 RL 都概括为对执行分 s_i 加权的对数似然。SFT 保留高分程序并给予正监督;RL 在截断策略目标里用处理后的执行奖励和熵优势给新采样程序加权。

    OpenMLE-Gym:环境与任务构建

    • 环境契约:五要素为任务/状态(说明、公开数据、隐藏评测器、资源预算、工作区)、动作(提交的 MLE 程序及执行需求)、转移(沙箱执行)、观察(状态、分数、日志、错误类型、产物、运行时元数据)、奖励(评测器返回的可验证分数)。完成条件、控制器停止准则或时间/算力预算决定终止或截断。
    • 三条来源:Curated Anchors 从已有论文和基准手工选取,质量高但规模有限;Kaggle Datasets 用并扩展 MLE-Smith,规模大、质量更不稳定;Kaggle Competitions 有人工题目、指标和提交协议,并排除与 MLE-Bench 重叠的竞赛。Figure 3 中竞赛漏斗为:Meta Kaggle 目录约 11000 场 → 合格候选 3972(保留 36%)→ 可执行包 2839(26%)→ 质量门控任务 2240(20%)。
    • 统一包格式:raw/ 放原始资产;data/public/ 放智能体可见的说明、训练数据、测试输入和样例提交;data/private/ 隔离隐藏答案;metric.py 校验预测并返回标量反馈。竞赛分支还会生成 prepare.py,执行准备代码并对样例提交打分,失败则有界重试,仍无法构建或不能产生有效标量的包在语义过滤前删除。
    • 质量过滤与沙箱:LLM 过滤器按任务有效性、数据充分性、原始数据使用、任务复杂度和数据质量五维判断,只保留指标有效且得到严格推荐决定的任务。调度器把作业分到 CPU/GPU Docker worker。六种反馈:成功完成、运行时错误、缺少代码、缺少提交、评分失败、超时。
    • 规模:5758 个可执行任务:156 个 Curated Anchors、3362 个 Kaggle Dataset 任务、2240 个 Kaggle Competition 任务(Figure 4)。模态分布:Tabular 44%、Image 18%、Time Series 13%、Multimodal 11%、Text 9%、Audio 2%、Video 1%、Other 2%。任务类型:Classification 56%、Regression 31%、Other 9%、Segmentation 2%、Object Detection 1%、Generation 1%;分类加回归占 87%。非原始包大小:Under 1 MiB 29%、1–10 MiB 24%、10–100 MiB 23%、100 MiB–1 GiB 15%、1 GiB or more 9%。因许可,完整任务包数据发布 1415 个;其余 4343 个只发布 prepare.py 和 metric.py,不重新分发源数据。

    OpenMLE-ERL:可复用算子的 SFT 与 RL

    • 算子:不训练完整轨迹,而训练可复用的局部变换。Draft 创建代码,Improve 精炼,Debug 修复,Crossover 合并父代。词汇沿 AIRA 式可执行 MLE 搜索和 AIDE 式代码空间探索,但被改成开源模型后训练的显式 SFT/RL 目标。附录给出算子定义和提示模板;按安全边界,这里不复述模板中的具体句式。
    • SFT 采集:每任务在沙箱执行采样程序,按有效性和任务分保留,直到达到接受样本配额或耗尽执行预算。并行路径独立采样完整 Draft,贡献 17245 条全响应;进化路径在已执行程序上做 Improve、Debug、Crossover,从高质量局部轨迹保留有用步骤,贡献 9014 条轨迹步。合计发布语料 26259 条。Figure 7 说明:进化路径里有效终点可能只在多次 Debug 之后出现,此时回溯到前一个非 Debug 算子,并用 LLM 从该修复轨迹保留有用步骤。
    • 奖励对齐:原始分先转成越大越好的 s̃,再用固定上下界得到基奖励。固定界可能宽于当前策略实际到达的分数区,使不同程序的奖励挤在一起,因此再用该任务历史 on-policy 分数前沿得到更紧的自适应界,映成处理后奖励 r_proc。Figure 7 的示意组把七个非零任务分映成四个非零处理后奖励,低于下界的分数截为 0。
    • 上尾优势与父代选择:熵优势放大每个 rollout 组顶部的奖励差,并替换裁剪策略目标里常见的 GRPO 式组归一化信号;β 在固定熵/KL 预算下选取。Figure 8(a) 标注:无熵加权时最佳候选的 mean processed advantage 为 1.58,有熵加权时为 6.39,作者称上尾信号强 4.0 倍。父代适应度由父程序奖励、子奖励方差和随访问下降的冷却项组成:第一项利用强解,第二项指向结果仍有信息量的状态,第三项避免单一现任解占满 rollout。
    • 异步 rollout:生成加执行的组独立启动,训练器从队列取已完成的组,使更新不必等待名义批次里最慢的沙箱作业。作者把正文中的加速说法保持为定性,实测计时放在附录 B.4。奖励黑客的检测与预防放在附录 B.6,可见正文未给出该附录的具体规则。

    OpenMLE-Evo:经验引导的长程搜索

    • 与 AIRA-Evo 的差别:采用 AIRA-Evo 式种群循环来组合四个已训练算子,但改变对执行证据的用法。作者称标准 AIRA-Evo 存储大体自由形式的记忆、急切合成、主要按标量适应度选父代,并向不同算子提供大体相似的历史。
    • 设计问题:作者把经验驱动进化收成两个问题:下一步扩展哪个节点(超出贪心分数最大化);以及如何构造记忆,使被选中的算子得到可执行证据而不是不断变长的轨迹。
    • 作者给出的答案:父代选择使用质量、进展和新颖性三个因素的非贪心选择;记忆按算子条件、按需从有界的相关经验合成。经验在两个互补层次积累。第 5.1 节之后的父代选择公式、记忆合成触发条件和算子条件上下文的具体规则,在本次可见正文中被截断,附录 C 标题列出进化父代适应度、算子提示模板、结构化经验记录、经验引导父代选择和操作触发的记忆合成。
    • OpenMLE-Evo-Max:作者在脚注中称它是增强的 OpenMLE 配置,使用与基准无关的经验先验和异步搜索,细节指向第 6.1 节;该节不在本次可见正文中。

    Figure 5 把训练与推理画成:进化推理沿 Draft/Improve/Debug/Crossover 扩展解树;SFT 从教师 MLE rollout 过滤有效高分样本并按奖励去重,得到 10K+ Draft rollout,再暖启动 RL;RL 按奖励、方差和访问冷却采样父代,经自适应界和熵权重做策略更新。图中还列出可组合这些算子的 scaffold:Greedy、abMCTS、AIRA-EVO、OpenEvolve。

  4. 论文做了哪些实验?

    主结果在 MLE-Bench Lite:Evo 把 Medal Average 从 39.39% 提到 60.61%,Evo-Max 到 71.21%。

    实验设置

    • 被测模型:主模型 Frontis-MA1-35B,基座为 Qwen3.6-35B-A3B。对照复现为 Frontis-MA1-30B,基座为 Qwen3-30B-A3B-Thinking-2507。Figure 1 横轴还出现 GPT-5.6 Sol、Kimi K3、GPT-5.5、GLM-5.2、Kimi K2.6、MiniMax-M3、Grok-4.5、Opus 4.8、Gemini 3.5 Flash、Sonnet 5、Doubao-2.1 Pro、LongCat-2.0、DS-V4 Pro、Qwen3.7 Plus、Sonnet 4.6、GLM-4.7、DS-V4 Flash、MiniMax-M2.7、MiMo-V2.5 Pro、Qwen3.6-35B、Qwen3-30B、Step-3.7 等标签;图注写这些柱是全部已完成 harness 结果。训练曲线对象是 Frontis-MA1-35B。
    • 基准与预算:主评测为 MLE-Bench Lite,每任务固定 12 GPU-hour;摘要另写一块 RTX 4090、显存上限 12 GB、每任务 12 小时。迁移为 held-out 的 NatureBench Lite。训练环境为 OpenMLE-Gym 的 5758 个任务,并称训练数据相对全部评测基准做了去重。
    • 系统变体:模型层比较在同一 OpenMLE-Evo harness 下换模型;harness 层比较 OpenMLE-Evo、通用 Claude Code 或 Codex scaffold,以及 Frontis-MA1-35B 上的原始 AIRA-Evo;系统层为 Frontis-MA1-35B + OpenMLE-Evo-Max。Figure 1 图例分为 Frontis·Evo、Other models·Evo、OpenMLE-Evo-Max,以及 General: Codex / Claude Code / Gemini CLI。
    • 指标:Medal Average,以及 Figure 1 的 Medal avg@3(%);Human Rank。NatureBench Lite 用 Match-SOTA。RL 曲线还有 Validation Base Reward、Validation Medal Count(out of 176)、Rollout Base Reward、Group Best Reward、Test medal rate。Medal Average 与 Medal avg@3 是否为同一统计量,论文在可见正文里没有把二者定义成同一个式子,因此分开书写。
    • 评审方式:奖励来自任务特定评测器的可验证分数,而不是另一个 LLM 评审模型给最终方案打分。SFT 质量过滤和进化轨迹里“保留有用步骤”使用了 LLM,论文未在可见正文写明该过滤器或该保留步骤所用的模型名。重复次数、Medal 的奖牌阈值和 Human Rank 的精确定义在可见正文中未给出;附录 D.1 标题为 MLE-Bench Lite 上的重复评测统计。
    • Figure 8 的早期 harness:图注写面板 (b) 的两个 test medal rate 使用更简单的早期 harness,而不是 OpenMLE-Evo。

    主结果

    摘要与引言报告的 MLE-Bench Lite 数字如下。Figure 1 标注了一组 Medal avg@3,但柱与模型名在纯文本里错位,无法逐柱对应的数字不写入表。

    表格较宽,可左右滑动

    设置Medal AverageHuman Rank出处
    Qwen3.6-35B-A3B + OpenMLE-Evo39.39%0.5828引言
    Frontis-MA1-35B + OpenMLE-Evo60.61%0.7647摘要、引言
    Frontis-MA1-35B + OpenMLE-Evo-Max71.21%0.8126摘要、引言
    Qwen3-30B-A3B-Thinking-2507 + OpenMLE-Evo34.85%未报告引言
    Frontis-MA1-30B + OpenMLE-Evo53.03%未报告引言
    • 作者的模型层解读:在相同 OpenMLE-Evo harness 下,Frontis-MA1-35B 相对 Qwen3.6-35B-A3B 的 Medal Average 从 39.39% 到 60.61%,Human Rank 从 0.5828 到 0.7647。30B 复现从 34.85% 到 53.03%。
    • 作者的系统层解读:Frontis-MA1-35B + OpenMLE-Evo-Max 达到 71.21% Medal Average 和 0.8126 Human Rank,作者称超过 GPT-5.5 + Codex,并接近 GPT-5.6 Sol 与 2.8T 参数的 Kimi K3。Figure 1 上直接标出的 Medal avg@3 包括 72.7、72.7、71.2、68.2、66.7、66.7、65.2、65.2、63.6、63.6、59.1、56.1、56.1、54.5、54.5、54.5、51.5、51.5、50.0、40.9、39.4、34.9、27.3;纯文本无法把这些数可靠地配到具体模型,其中 71.2 与正文 71.21% 数值接近,但是否同一条件论文未在图注中写明。Pareto 面板横轴为 Total parameters(log scale),标有 30B、100B、1T、10T。
    • 作者的 harness 层解读:作者称匹配比较中 OpenMLE-Evo 在四个前沿模型上优于通用 Claude Code 或 Codex scaffold,并在 Frontis-MA1-35B 上优于原始 AIRA-Evo。可见正文没有给出这四次比较各自的 Medal Average。

    训练动态

    • Figure 6:三条 RL 曲线的横轴都是 RL Training Step,范围约 0 到 200。左为 Validation Base Reward,纵轴约 0.15–0.40;中为 Validation Medal Count(out of 176),纵轴 0–35;右为 Rollout Base Reward,纵轴约 0.1–0.6。纯文本没有给出各步的读数,不能写曲线端点。
    • Figure 8:无熵加权时最佳候选 mean processed advantage 为 1.58,有熵加权时为 6.39。面板 (b) 中,作者称自适应界加熵加权的平滑 Group Best Reward 轨迹强于先前奖励构造;图上标注 peak smoothed reward 0.666,相对先前 +0.089。两个 test medal rate 为 34.8 ± 4.3 与 24.2 ± 5.7,使用更简单的早期 harness,不是 OpenMLE-Evo。论文未在图中写明这两个比率分别对应哪种奖励构造的最终测试,只按面板标题把较高的 34.8 ± 4.3 画在自适应界加熵加权一侧,24.2 ± 5.7 画在 previous reward 一侧。

    迁移

    • NatureBench Lite:作者称两个组件都能迁移。框架固定时,换入训练后的模型使 Match-SOTA 从 50% 升到 70%;模型固定时,换入 OpenMLE-Evo 使 Match-SOTA 从 20% 升到 50%。可见正文没有写明这两次替换各自的模型名和 harness 全称,只写了“框架固定/模型固定”这一对照结构。附录 D.2 标题为 NatureBench Lite 的任务构成,具体任务数未出现在可见正文。

    其他消融与分析

    • 可见正文在第 6 节标题处中断。目录列出的实验小节为:6.2 Training and Search Gains Compose,6.3 Long-Horizon Self-Improvement,6.4 Solution Ceiling,6.5 Search Efficiency and Mechanism,6.6 Meta-Ability and Transfer。这些小节的表格数字不在可见文本中,因此不填写。
    • 附录表末行把 OpenMLE(ours)记为 71.21%,运行设置为 12h · RTX 4090(12G VRAM),模型为 Frontis-MA1-35B。同行对照里,与文字连写的结果包括 R&D-Agent 68.18%(12h · 1×V100,GPT-5)、MLE-RL 33.30%(12h · A10,count NR,MLE-RL-32B-S)、AceGRPO 51.52%(12h · GPU NR,Ace-30B)。表注写 NR 表示未报告,“–”表示没有对应的 MLE-Bench Lite 结果;MLZero 评了 22 个任务中的 21 个,展示的比率仍用 22 为分母,被排除任务计为非奖牌。
    • 负面结果:可见正文没有单独报告失败案例。Figure 8 把 previous reward 的 test medal rate 标为 24.2 ± 5.7,低于自适应界加熵加权一侧的 34.8 ± 4.3,且两者都不是 OpenMLE-Evo。
  5. 有什么可以进一步探索的点?

    作者把 RSI 写成更远目标;完整任务包因许可只发布 1415 个。第 8 节正文未进入可见文本。

    作者指出的局限与后续方向

    目录有第 8 节 Limitations and Future Work 和第 9 节 Conclusion,但这两节的正文不在本次可见文本中,不能把未读到的句子写成作者指出的局限。下面只保留前文里作者明确写成未完成、约束或后续用途的句子。

    • 发布仍是计划:引言写“We will release”数据集、训练与评测代码、沙箱、harness 和后训练检查点,并称该发布将使完整 OpenMLE 流程可复现。这是作者计划,不是已经完成的陈述(第 1 节)。贡献列表第 5 条同时用“release”描述 Frontis-MA1-35B 与配套制品;与 “will release” 并列,不能把代码与数据的公开程度写成已核对完成。
    • 数据发布受许可约束:因源数据许可与版权,完整任务包数据只针对 1415 个任务发布;其余 4343 个只发布 prepare.py 和 metric.py,不重新分发源数据(第 4 节脚注)。
    • RSI 未被声称已经达到:作者把 RSI 写成更远终点,把 OpenMLE 写成从进化走向元进化的具体一步,Figure 2 把 RSI 标成 limiting goal。这是定位,不是作者列出的局限清单(第 1–2 节、Figure 2)。
    • 异步加速保持定性:作者写实现的加速取决于任务运行时间分布和 worker 分配,因此正文主张保持定性,实测计时放在附录 B.4(第 4.3 节)。

    实验覆盖范围

    • 主评测:MLE-Bench Lite,每任务 12 GPU-hour;摘要的硬件写法是一块 RTX 4090、显存上限 12 GB。报告了 Medal Average 与 Human Rank 的模型层和系统层数字;30B 复现只报告 Medal Average,未报告 Human Rank(第 1 节)。
    • 迁移:NatureBench Lite 上报告了两组 Match-SOTA:框架固定时 50% 到 70%,模型固定时 20% 到 50%(摘要)。
    • 训练环境:OpenMLE-Gym 共 5758 个任务,来源为 156 + 3362 + 2240;SFT 语料 26259 条,其中 Draft 全响应 17245 条、轨迹步 9014 条。作者称训练数据相对全部评测基准去重(摘要、第 3.5 节、第 4.2 节)。
    • RL 诊断:Figure 6 的验证奖牌计数分母为 176。Figure 8 的 test medal rate 使用更简单的早期 harness,不是 OpenMLE-Evo。
    • 论文未报告的设置:可见正文未报告 Medal Average 的重复次数、四个前沿模型上 harness 对比的逐模型分数、OpenMLE-Evo-Max 相对 OpenMLE-Evo 的配置差异(只指向第 6.1 节),以及第 6.2–6.6 节的表格。附录 D.1 的标题表明作者做了 MLE-Bench Lite 的重复评测统计,具体数字不在可见正文。
  6. 总结一下论文的主要内容

    OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。

    作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序;作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。

    • 栈的三层:OpenMLE-Gym 把手工锚点、Kaggle 数据集和 Kaggle 竞赛收成 5758 个带隔离执行和任务评测器的环境。OpenMLE-ERL 用预算自适应的执行反馈 SFT(26259 条)暖启动,再用自适应分数界、熵优势、异步 rollout 和带冷却的父代选择做 RL。OpenMLE-Evo 用质量、进展和新颖性选择父代,并按算子按需合成有界记忆。四个算子是 Draft、Improve、Debug、Crossover。
    • 主结果:MLE-Bench Lite、相同 OpenMLE-Evo、每任务 12 GPU-hour 下,Frontis-MA1-35B 的 Medal Average 为 60.61%、Human Rank 为 0.7647,基座 Qwen3.6-35B-A3B 为 39.39% 和 0.5828。OpenMLE-Evo-Max 为 71.21% 和 0.8126;作者称超过 GPT-5.5 + Codex,接近 GPT-5.6 Sol 和 2.8T 的 Kimi K3。Frontis-MA1-30B 在同一 harness 下从基座的 34.85% 到 53.03%。
    • 迁移:NatureBench Lite 上,框架固定时换入训练模型,Match-SOTA 从 50% 到 70%;模型固定时换入 OpenMLE-Evo,从 20% 到 50%。作者据此称后训练和进化搜索都能离开竞赛式 MLE。
    • 作者的结论:贡献是一条把可验证环境、后训练和测试时进化接在一起的工作流,以及按此训练的 Frontis-MA1-35B 与 30B 对照模型。作者计划发布数据、训练与评测代码、沙箱、harness 和检查点;因许可,完整任务包数据对应 1415 个任务。
阅读原文arxiv.org