Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
作者训练 Frontis-MA1-35B 作 MLE 元进化智能体:在 MLE-Bench Lite、12 小时/任务预算下,OpenMLE-Evo 将 Medal Average 从 39.39% 提到 60.61%,Evo-Max 达 71.21%。
- 递归自我改进需要能改进“构建 AI 过程”的系统。机器学习工程提供可执行反馈,但公开系统很少同时覆盖可验证环境、基于执行的后训练和长程进化搜索。
- OpenMLE 把 Draft、Improve、Debug、Crossover 四个算子同时用于后训练和推理:Gym 提供 5758 个可执行任务,ERL 用执行反馈做 SFT 与 RL,Evo 把算子组成经验引导的长程搜索,并训练 Frontis-MA1-35B。
- MLE-Bench Lite、每任务 12 小时、一块限 12 GB 显存的 RTX 4090 上,OpenMLE-Evo 将 Medal Average 从基座的 39.39% 提到 60.61%,OpenMLE-Evo-Max 达 71.21%。NatureBench Lite 上,换模型使 Match-SOTA 从 50% 到 70%,换搜索框架从 20% 到 50%。
- 作者计划发布数据、训练与评测代码、沙箱、harness 和检查点,正文写的是将发布而非已完成。受许可限制,完整任务包只覆盖 1415 个任务,其余 4343 个只发布脚本。具体局限需以第 8 节原文为准,本摘要所见正文在该节之前被截断。
- 模型
- Frontis-MA1-35BQwen3.6-35B-A3BFrontis-MA1-30BQwen3-30B-A3B-Thinking-2507GPT-5.6 SolGPT-5.5Kimi K3GLM-5.2Kimi K2.6MiniMax-M3Grok-4.5Opus 4.8Gemini 3.5 FlashSonnet 5Doubao-2.1 Pro
- 基准
- MLE-Bench LiteNatureBench LiteOpenMLE-Gym
- 指标
- Medal AverageMedal avg@3Human RankMatch-SOTAValidation Medal CountValidation Base RewardGroup Best Reward
研究者提出 OpenMLE 全栈系统用于研究机器学习工程中的递归自我改进,包含可验证任务环境 OpenMLE-Gym、算子学习 OpenMLE-RL 和长时程搜索 OpenMLE-Evo,并在此基础上后训练出 35B 的元进化智能体 Frontis-MA1。该模型围绕 Draft、Improve、Debug、Crossover 四个程序进化算子,用执行反馈驱动的 SFT 和 RL 训练,再组合成长时程搜索。在单张 RTX 4090、12 GB 显存、每任务 12 小时预算下,MLE-Bench Lite 的 Medal Average 从基座的 39.39% 提升到 60.61%,配合 OpenMLE-Evo-Max 达到 71.21%,超过 GPT-5.5 + Codex,接近 GPT-5.6 Sol 和 2.8T 的 Kimi K3。作者开源了模型权重和完整 OpenMLE 栈。
深度解读
这篇论文试图解决什么问题?
作者要把可执行 MLE 做成通向元进化的 RSI 试验场,并训练改进器本身。
如何让语言模型在可执行机器学习工程里,通过同一组程序进化算子既被训练、又被用于长程搜索,从而迈向元进化(meta-evolution)。
- 场景:作者认为 AI 能力增长不再只靠人类工程师,系统已能写代码、跑实验并参与构建下一代 AI(AI4AI)。更远的终点是递归自我改进(recursive self-improvement, RSI):每个被改进的系统继续改进产生后继者的过程。这需要的不只是一次性生成,而是能检查数据、提出算法、执行实验、诊断失败并分配下一步算力的智能体。
- 试验场:机器学习工程(MLE)被作者视为 AI4AI 的直接实例:智能体为真实任务构建机器学习方案,并依据执行反馈迭代。单次迭代可能耗时数分钟到数小时,反馈延迟、有噪声且异质。
- 现有不足:作者把已有工作分成推理期 harness、可执行环境、以及用执行反馈后训练三条线。作者称,在附录 Table 11 审计的代表性公开系统中,没有系统同时覆盖可扩展任务与环境构建、基于执行的智能体后训练、以及把训练后模型部署到长程进化搜索的 harness,并附带复现整条闭环所需的制品。
- 核心设定:作者区分 AI4AI(优化对象)、进化(按执行反馈反复修改候选系统)和元进化(用进化轨迹训练提出后续修改的模型)。RSI 还要求更强、持续的闭环。OpenMLE 研究的是从进化走向元进化的具体一步:用 SFT 和 RL 重用可执行搜索经验,改进程序变换模型。
- 本文提出:开源全栈 OpenMLE——OpenMLE-Gym(可验证任务与执行反馈)、OpenMLE-ERL(算子学习)、OpenMLE-Evo(长程搜索)——并后训练 Frontis-MA1-35B 作为元进化智能体(meta-evolution agent)。Draft、Improve、Debug、Crossover 四个原子算子同时是训练目标和推理期搜索的组成单元。作者还训练 Frontis-MA1-30B 做跨模型复现,并称将发布数据、代码、沙箱、harness 和检查点。
有哪些相关研究?
作者把相关工作分成推理期搜索、可执行环境和执行反馈后训练三条线。
引言把 MLE 智能体的已有进展分成三条相互重叠的线,并点名若干同时触及其中子集的系统。第 7 节标题为 Related Work,但本次可见正文在进入该节的展开之前中断,因此下面只写引言、问题形式化和方法节里实际讨论过的工作。
推理期搜索 harness:Du et al. (2025)、Fang et al. (2025)、InternScience (2026)、Jiang et al. (2025)、Liu et al. (2025a)、Nam et al. (2025)、Toledo et al. (2025)、Zhu et al. (2026b) 发展基于结构化或进化搜索的推理期 harness。方法节进一步把 AIDE、AIRA、AIRA2 写成在可执行程序上做树或种群式探索、反复执行和候选精炼(Hambardzumyan et al., 2026;Jiang et al., 2025;Toledo et al., 2025)。作者对标准 AIRA-Evo 的具体差异写在方法里:它以自由形式记忆为主、急切合成记忆、主要按标量适应度选父代,且不同算子拿到大体相似的历史;OpenMLE-Evo 改为结构化经验、按质量/进展/新颖性做非贪心选择,并按算子按需合成有界记忆。
可执行任务与环境:Lupidi et al. (2026)、Nathani et al. (2025)、Qiang et al. (2025a,b) 构建可执行任务与环境。任务形式沿用 MLE-Dojo 与 MLE-Bench(Chan et al., 2024;Qiang et al., 2025a)。Kaggle Dataset 分支利用并扩展 MLE-Smith 的数据集到任务流水线(Qiang et al., 2025b)。环境契约引用 Gym 式的动作、转移、观察、奖励与停止条件(Brockman et al., 2016;Nathani et al., 2025;Qiang et al., 2025a;Xi et al., 2024)。Figure 4 把 OpenMLE-Gym 的 5758 个任务与 MLE-Smith 606、MLE-Dojo 200+、DSBench 74、MLE-Bench 75、MLGym-Bench 13、MLAgentBench 13 并列,作为任务包规模对照。
执行反馈后训练:Cai et al. (2026)、Li et al. (2025b)、Liu et al. (2025b)、Yang et al. (2025a) 用执行反馈后训练 MLE 智能体。作者点名两套跨线系统:MLE-Dojo 支持模型调优,AceGRPO 把迭代执行轨迹回收进训练(Cai et al., 2026;Qiang et al., 2025a)。训练动机引用 RLVR 分析:RL 可以提高 Pass@1,但在大 K 上增益有限,而教师蒸馏可以引入基座采样支撑里没有的行为(Yue et al., 2025);并与数学和代码上的短程 RLVR 对比(Shao et al., 2024)。奖励塑形引用自适应可验证环境与演化量规(Shao et al., 2025;Zeng et al., 2025),以及 TTT-Discover 的上尾原则和 Best-of-N / Pass@k 目标(Yuksekgonul et al., 2026;Bagirov et al., 2025;Chen et al., 2025;Peng et al., 2025;Walder and Karkhanis, 2025)。
RSI 与元进化定位:RSI 的更强闭环引用 Eth and Davidson (2025)、Favaro and Clark (2026)、Good (1965)、Schmidhuber (2003)。元进化智能体这一角色引用 Jiang et al. (2026)。Figure 2 把机制阶梯画成进化、元进化、自我进化,并把本文放在“改进器本身被训练”的元进化层。
基线方法与基准:评测主基准是 MLE-Bench Lite,迁移用 NatureBench Lite(Wang et al., 2026)。引言给出的对照包括:同一 OpenMLE-Evo harness 下的基座 Qwen3.6-35B-A3B 与 Qwen3-30B-A3B-Thinking-2507;通用 Claude Code 或 Codex scaffold(四个前沿模型)以及 Frontis-MA1-35B 上的原始 AIRA-Evo;系统级对照 GPT-5.5 + Codex,并称 OpenMLE-Evo-Max 接近 GPT-5.6 Sol 和 2.8T 的 Kimi K3。Figure 1 图注写柱为全部已完成 harness 结果,Pareto 面板保留每个模型的最佳 harness。附录表末行列出的公开系统对照包括 R&D-Agent(68.18%,12h · 1×V100,GPT-5)、MLE-RL(33.30%,12h · A10,MLE-RL-32B-S)、AceGRPO(51.52%,12h · GPU NR,Ace-30B),以及若干更高预算或不同 GPU 上的 harness 结果(如 80.30%、77.27%);该表列在可见文本中可能错位,这里只保留与行内文字连在一起的数字。
作者把本文定位为:在被审计的代表性公开系统中,同时覆盖可扩展环境、基于执行的后训练和部署该模型的进化 harness,并用四个共享算子把学习与进化接成一个元进化闭环。
论文如何解决这个问题?
OpenMLE 用 Gym、ERL、Evo 三层,把四个程序进化算子同时用于训练和搜索。
整体思路是把 Draft、Improve、Debug、Crossover 做成后训练与推理共享的接口:OpenMLE-Gym 提供可执行任务和反馈,OpenMLE-ERL 用这些转移做 SFT 与 RL,OpenMLE-Evo 在测试时把同一算子组成长程搜索。训练后的模型成为进化 harness 的变异引擎。
问题设定与形式化
- 任务:每个任务 τ 含自然语言说明、可见数据、提交契约、任务特定评测器和沙箱。第 t 步,搜索算法选择算子 a_t,并从零个或多个父程序及其执行反馈构造上下文 c_t。
- 生成与打分:候选程序按 pt ∼ gθ(· ∣ τ, at, ct) 采样,沙箱 E 执行后由评测器 R_τ 给出任务分 s_t。g_θ 是由语言模型参数 θ 参数化的算子条件程序生成策略。
- 搜索目标:因指标量纲和方向不同,第 4.3 节把 s_t 转成越大越好的有符号分数 s̃_t。预算内寻找 s̃ 最高的候选。算子空间固定为上述四个,全局组合留给推理期搜索算法。
- 学习目标:元进化提高 θ,使 g_θ 更倾向执行结果更好的程序。SFT 与 RL 都概括为对执行分 s_i 加权的对数似然。SFT 保留高分程序并给予正监督;RL 在截断策略目标里用处理后的执行奖励和熵优势给新采样程序加权。
OpenMLE-Gym:环境与任务构建
- 环境契约:五要素为任务/状态(说明、公开数据、隐藏评测器、资源预算、工作区)、动作(提交的 MLE 程序及执行需求)、转移(沙箱执行)、观察(状态、分数、日志、错误类型、产物、运行时元数据)、奖励(评测器返回的可验证分数)。完成条件、控制器停止准则或时间/算力预算决定终止或截断。
- 三条来源:Curated Anchors 从已有论文和基准手工选取,质量高但规模有限;Kaggle Datasets 用并扩展 MLE-Smith,规模大、质量更不稳定;Kaggle Competitions 有人工题目、指标和提交协议,并排除与 MLE-Bench 重叠的竞赛。Figure 3 中竞赛漏斗为:Meta Kaggle 目录约 11000 场 → 合格候选 3972(保留 36%)→ 可执行包 2839(26%)→ 质量门控任务 2240(20%)。
- 统一包格式:raw/ 放原始资产;data/public/ 放智能体可见的说明、训练数据、测试输入和样例提交;data/private/ 隔离隐藏答案;metric.py 校验预测并返回标量反馈。竞赛分支还会生成 prepare.py,执行准备代码并对样例提交打分,失败则有界重试,仍无法构建或不能产生有效标量的包在语义过滤前删除。
- 质量过滤与沙箱:LLM 过滤器按任务有效性、数据充分性、原始数据使用、任务复杂度和数据质量五维判断,只保留指标有效且得到严格推荐决定的任务。调度器把作业分到 CPU/GPU Docker worker。六种反馈:成功完成、运行时错误、缺少代码、缺少提交、评分失败、超时。
- 规模:5758 个可执行任务:156 个 Curated Anchors、3362 个 Kaggle Dataset 任务、2240 个 Kaggle Competition 任务(Figure 4)。模态分布:Tabular 44%、Image 18%、Time Series 13%、Multimodal 11%、Text 9%、Audio 2%、Video 1%、Other 2%。任务类型:Classification 56%、Regression 31%、Other 9%、Segmentation 2%、Object Detection 1%、Generation 1%;分类加回归占 87%。非原始包大小:Under 1 MiB 29%、1–10 MiB 24%、10–100 MiB 23%、100 MiB–1 GiB 15%、1 GiB or more 9%。因许可,完整任务包数据发布 1415 个;其余 4343 个只发布 prepare.py 和 metric.py,不重新分发源数据。
OpenMLE-ERL:可复用算子的 SFT 与 RL
- 算子:不训练完整轨迹,而训练可复用的局部变换。Draft 创建代码,Improve 精炼,Debug 修复,Crossover 合并父代。词汇沿 AIRA 式可执行 MLE 搜索和 AIDE 式代码空间探索,但被改成开源模型后训练的显式 SFT/RL 目标。附录给出算子定义和提示模板;按安全边界,这里不复述模板中的具体句式。
- SFT 采集:每任务在沙箱执行采样程序,按有效性和任务分保留,直到达到接受样本配额或耗尽执行预算。并行路径独立采样完整 Draft,贡献 17245 条全响应;进化路径在已执行程序上做 Improve、Debug、Crossover,从高质量局部轨迹保留有用步骤,贡献 9014 条轨迹步。合计发布语料 26259 条。Figure 7 说明:进化路径里有效终点可能只在多次 Debug 之后出现,此时回溯到前一个非 Debug 算子,并用 LLM 从该修复轨迹保留有用步骤。
- 奖励对齐:原始分先转成越大越好的 s̃,再用固定上下界得到基奖励。固定界可能宽于当前策略实际到达的分数区,使不同程序的奖励挤在一起,因此再用该任务历史 on-policy 分数前沿得到更紧的自适应界,映成处理后奖励 r_proc。Figure 7 的示意组把七个非零任务分映成四个非零处理后奖励,低于下界的分数截为 0。
- 上尾优势与父代选择:熵优势放大每个 rollout 组顶部的奖励差,并替换裁剪策略目标里常见的 GRPO 式组归一化信号;β 在固定熵/KL 预算下选取。Figure 8(a) 标注:无熵加权时最佳候选的 mean processed advantage 为 1.58,有熵加权时为 6.39,作者称上尾信号强 4.0 倍。父代适应度由父程序奖励、子奖励方差和随访问下降的冷却项组成:第一项利用强解,第二项指向结果仍有信息量的状态,第三项避免单一现任解占满 rollout。
- 异步 rollout:生成加执行的组独立启动,训练器从队列取已完成的组,使更新不必等待名义批次里最慢的沙箱作业。作者把正文中的加速说法保持为定性,实测计时放在附录 B.4。奖励黑客的检测与预防放在附录 B.6,可见正文未给出该附录的具体规则。
OpenMLE-Evo:经验引导的长程搜索
- 与 AIRA-Evo 的差别:采用 AIRA-Evo 式种群循环来组合四个已训练算子,但改变对执行证据的用法。作者称标准 AIRA-Evo 存储大体自由形式的记忆、急切合成、主要按标量适应度选父代,并向不同算子提供大体相似的历史。
- 设计问题:作者把经验驱动进化收成两个问题:下一步扩展哪个节点(超出贪心分数最大化);以及如何构造记忆,使被选中的算子得到可执行证据而不是不断变长的轨迹。
- 作者给出的答案:父代选择使用质量、进展和新颖性三个因素的非贪心选择;记忆按算子条件、按需从有界的相关经验合成。经验在两个互补层次积累。第 5.1 节之后的父代选择公式、记忆合成触发条件和算子条件上下文的具体规则,在本次可见正文中被截断,附录 C 标题列出进化父代适应度、算子提示模板、结构化经验记录、经验引导父代选择和操作触发的记忆合成。
- OpenMLE-Evo-Max:作者在脚注中称它是增强的 OpenMLE 配置,使用与基准无关的经验先验和异步搜索,细节指向第 6.1 节;该节不在本次可见正文中。
Figure 5 把训练与推理画成:进化推理沿 Draft/Improve/Debug/Crossover 扩展解树;SFT 从教师 MLE rollout 过滤有效高分样本并按奖励去重,得到 10K+ Draft rollout,再暖启动 RL;RL 按奖励、方差和访问冷却采样父代,经自适应界和熵权重做策略更新。图中还列出可组合这些算子的 scaffold:Greedy、abMCTS、AIRA-EVO、OpenEvolve。
论文做了哪些实验?
主结果在 MLE-Bench Lite:Evo 把 Medal Average 从 39.39% 提到 60.61%,Evo-Max 到 71.21%。
实验设置
- 被测模型:主模型 Frontis-MA1-35B,基座为 Qwen3.6-35B-A3B。对照复现为 Frontis-MA1-30B,基座为 Qwen3-30B-A3B-Thinking-2507。Figure 1 横轴还出现 GPT-5.6 Sol、Kimi K3、GPT-5.5、GLM-5.2、Kimi K2.6、MiniMax-M3、Grok-4.5、Opus 4.8、Gemini 3.5 Flash、Sonnet 5、Doubao-2.1 Pro、LongCat-2.0、DS-V4 Pro、Qwen3.7 Plus、Sonnet 4.6、GLM-4.7、DS-V4 Flash、MiniMax-M2.7、MiMo-V2.5 Pro、Qwen3.6-35B、Qwen3-30B、Step-3.7 等标签;图注写这些柱是全部已完成 harness 结果。训练曲线对象是 Frontis-MA1-35B。
- 基准与预算:主评测为 MLE-Bench Lite,每任务固定 12 GPU-hour;摘要另写一块 RTX 4090、显存上限 12 GB、每任务 12 小时。迁移为 held-out 的 NatureBench Lite。训练环境为 OpenMLE-Gym 的 5758 个任务,并称训练数据相对全部评测基准做了去重。
- 系统变体:模型层比较在同一 OpenMLE-Evo harness 下换模型;harness 层比较 OpenMLE-Evo、通用 Claude Code 或 Codex scaffold,以及 Frontis-MA1-35B 上的原始 AIRA-Evo;系统层为 Frontis-MA1-35B + OpenMLE-Evo-Max。Figure 1 图例分为 Frontis·Evo、Other models·Evo、OpenMLE-Evo-Max,以及 General: Codex / Claude Code / Gemini CLI。
- 指标:Medal Average,以及 Figure 1 的 Medal avg@3(%);Human Rank。NatureBench Lite 用 Match-SOTA。RL 曲线还有 Validation Base Reward、Validation Medal Count(out of 176)、Rollout Base Reward、Group Best Reward、Test medal rate。Medal Average 与 Medal avg@3 是否为同一统计量,论文在可见正文里没有把二者定义成同一个式子,因此分开书写。
- 评审方式:奖励来自任务特定评测器的可验证分数,而不是另一个 LLM 评审模型给最终方案打分。SFT 质量过滤和进化轨迹里“保留有用步骤”使用了 LLM,论文未在可见正文写明该过滤器或该保留步骤所用的模型名。重复次数、Medal 的奖牌阈值和 Human Rank 的精确定义在可见正文中未给出;附录 D.1 标题为 MLE-Bench Lite 上的重复评测统计。
- Figure 8 的早期 harness:图注写面板 (b) 的两个 test medal rate 使用更简单的早期 harness,而不是 OpenMLE-Evo。
主结果
摘要与引言报告的 MLE-Bench Lite 数字如下。Figure 1 标注了一组 Medal avg@3,但柱与模型名在纯文本里错位,无法逐柱对应的数字不写入表。
表格较宽,可左右滑动
设置 Medal Average Human Rank 出处 Qwen3.6-35B-A3B + OpenMLE-Evo 39.39% 0.5828 引言 Frontis-MA1-35B + OpenMLE-Evo 60.61% 0.7647 摘要、引言 Frontis-MA1-35B + OpenMLE-Evo-Max 71.21% 0.8126 摘要、引言 Qwen3-30B-A3B-Thinking-2507 + OpenMLE-Evo 34.85% 未报告 引言 Frontis-MA1-30B + OpenMLE-Evo 53.03% 未报告 引言 - 作者的模型层解读:在相同 OpenMLE-Evo harness 下,Frontis-MA1-35B 相对 Qwen3.6-35B-A3B 的 Medal Average 从 39.39% 到 60.61%,Human Rank 从 0.5828 到 0.7647。30B 复现从 34.85% 到 53.03%。
- 作者的系统层解读:Frontis-MA1-35B + OpenMLE-Evo-Max 达到 71.21% Medal Average 和 0.8126 Human Rank,作者称超过 GPT-5.5 + Codex,并接近 GPT-5.6 Sol 与 2.8T 参数的 Kimi K3。Figure 1 上直接标出的 Medal avg@3 包括 72.7、72.7、71.2、68.2、66.7、66.7、65.2、65.2、63.6、63.6、59.1、56.1、56.1、54.5、54.5、54.5、51.5、51.5、50.0、40.9、39.4、34.9、27.3;纯文本无法把这些数可靠地配到具体模型,其中 71.2 与正文 71.21% 数值接近,但是否同一条件论文未在图注中写明。Pareto 面板横轴为 Total parameters(log scale),标有 30B、100B、1T、10T。
- 作者的 harness 层解读:作者称匹配比较中 OpenMLE-Evo 在四个前沿模型上优于通用 Claude Code 或 Codex scaffold,并在 Frontis-MA1-35B 上优于原始 AIRA-Evo。可见正文没有给出这四次比较各自的 Medal Average。
训练动态
- Figure 6:三条 RL 曲线的横轴都是 RL Training Step,范围约 0 到 200。左为 Validation Base Reward,纵轴约 0.15–0.40;中为 Validation Medal Count(out of 176),纵轴 0–35;右为 Rollout Base Reward,纵轴约 0.1–0.6。纯文本没有给出各步的读数,不能写曲线端点。
- Figure 8:无熵加权时最佳候选 mean processed advantage 为 1.58,有熵加权时为 6.39。面板 (b) 中,作者称自适应界加熵加权的平滑 Group Best Reward 轨迹强于先前奖励构造;图上标注 peak smoothed reward 0.666,相对先前 +0.089。两个 test medal rate 为 34.8 ± 4.3 与 24.2 ± 5.7,使用更简单的早期 harness,不是 OpenMLE-Evo。论文未在图中写明这两个比率分别对应哪种奖励构造的最终测试,只按面板标题把较高的 34.8 ± 4.3 画在自适应界加熵加权一侧,24.2 ± 5.7 画在 previous reward 一侧。
迁移
- NatureBench Lite:作者称两个组件都能迁移。框架固定时,换入训练后的模型使 Match-SOTA 从 50% 升到 70%;模型固定时,换入 OpenMLE-Evo 使 Match-SOTA 从 20% 升到 50%。可见正文没有写明这两次替换各自的模型名和 harness 全称,只写了“框架固定/模型固定”这一对照结构。附录 D.2 标题为 NatureBench Lite 的任务构成,具体任务数未出现在可见正文。
其他消融与分析
- 可见正文在第 6 节标题处中断。目录列出的实验小节为:6.2 Training and Search Gains Compose,6.3 Long-Horizon Self-Improvement,6.4 Solution Ceiling,6.5 Search Efficiency and Mechanism,6.6 Meta-Ability and Transfer。这些小节的表格数字不在可见文本中,因此不填写。
- 附录表末行把 OpenMLE(ours)记为 71.21%,运行设置为 12h · RTX 4090(12G VRAM),模型为 Frontis-MA1-35B。同行对照里,与文字连写的结果包括 R&D-Agent 68.18%(12h · 1×V100,GPT-5)、MLE-RL 33.30%(12h · A10,count NR,MLE-RL-32B-S)、AceGRPO 51.52%(12h · GPU NR,Ace-30B)。表注写 NR 表示未报告,“–”表示没有对应的 MLE-Bench Lite 结果;MLZero 评了 22 个任务中的 21 个,展示的比率仍用 22 为分母,被排除任务计为非奖牌。
- 负面结果:可见正文没有单独报告失败案例。Figure 8 把 previous reward 的 test medal rate 标为 24.2 ± 5.7,低于自适应界加熵加权一侧的 34.8 ± 4.3,且两者都不是 OpenMLE-Evo。
有什么可以进一步探索的点?
作者把 RSI 写成更远目标;完整任务包因许可只发布 1415 个。第 8 节正文未进入可见文本。
作者指出的局限与后续方向
目录有第 8 节 Limitations and Future Work 和第 9 节 Conclusion,但这两节的正文不在本次可见文本中,不能把未读到的句子写成作者指出的局限。下面只保留前文里作者明确写成未完成、约束或后续用途的句子。
- 发布仍是计划:引言写“We will release”数据集、训练与评测代码、沙箱、harness 和后训练检查点,并称该发布将使完整 OpenMLE 流程可复现。这是作者计划,不是已经完成的陈述(第 1 节)。贡献列表第 5 条同时用“release”描述 Frontis-MA1-35B 与配套制品;与 “will release” 并列,不能把代码与数据的公开程度写成已核对完成。
- 数据发布受许可约束:因源数据许可与版权,完整任务包数据只针对 1415 个任务发布;其余 4343 个只发布 prepare.py 和 metric.py,不重新分发源数据(第 4 节脚注)。
- RSI 未被声称已经达到:作者把 RSI 写成更远终点,把 OpenMLE 写成从进化走向元进化的具体一步,Figure 2 把 RSI 标成 limiting goal。这是定位,不是作者列出的局限清单(第 1–2 节、Figure 2)。
- 异步加速保持定性:作者写实现的加速取决于任务运行时间分布和 worker 分配,因此正文主张保持定性,实测计时放在附录 B.4(第 4.3 节)。
实验覆盖范围
- 主评测:MLE-Bench Lite,每任务 12 GPU-hour;摘要的硬件写法是一块 RTX 4090、显存上限 12 GB。报告了 Medal Average 与 Human Rank 的模型层和系统层数字;30B 复现只报告 Medal Average,未报告 Human Rank(第 1 节)。
- 迁移:NatureBench Lite 上报告了两组 Match-SOTA:框架固定时 50% 到 70%,模型固定时 20% 到 50%(摘要)。
- 训练环境:OpenMLE-Gym 共 5758 个任务,来源为 156 + 3362 + 2240;SFT 语料 26259 条,其中 Draft 全响应 17245 条、轨迹步 9014 条。作者称训练数据相对全部评测基准去重(摘要、第 3.5 节、第 4.2 节)。
- RL 诊断:Figure 6 的验证奖牌计数分母为 176。Figure 8 的 test medal rate 使用更简单的早期 harness,不是 OpenMLE-Evo。
- 论文未报告的设置:可见正文未报告 Medal Average 的重复次数、四个前沿模型上 harness 对比的逐模型分数、OpenMLE-Evo-Max 相对 OpenMLE-Evo 的配置差异(只指向第 6.1 节),以及第 6.2–6.6 节的表格。附录 D.1 的标题表明作者做了 MLE-Bench Lite 的重复评测统计,具体数字不在可见正文。
总结一下论文的主要内容
OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序;作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。
- 栈的三层:OpenMLE-Gym 把手工锚点、Kaggle 数据集和 Kaggle 竞赛收成 5758 个带隔离执行和任务评测器的环境。OpenMLE-ERL 用预算自适应的执行反馈 SFT(26259 条)暖启动,再用自适应分数界、熵优势、异步 rollout 和带冷却的父代选择做 RL。OpenMLE-Evo 用质量、进展和新颖性选择父代,并按算子按需合成有界记忆。四个算子是 Draft、Improve、Debug、Crossover。
- 主结果:MLE-Bench Lite、相同 OpenMLE-Evo、每任务 12 GPU-hour 下,Frontis-MA1-35B 的 Medal Average 为 60.61%、Human Rank 为 0.7647,基座 Qwen3.6-35B-A3B 为 39.39% 和 0.5828。OpenMLE-Evo-Max 为 71.21% 和 0.8126;作者称超过 GPT-5.5 + Codex,接近 GPT-5.6 Sol 和 2.8T 的 Kimi K3。Frontis-MA1-30B 在同一 harness 下从基座的 34.85% 到 53.03%。
- 迁移:NatureBench Lite 上,框架固定时换入训练模型,Match-SOTA 从 50% 到 70%;模型固定时换入 OpenMLE-Evo,从 20% 到 50%。作者据此称后训练和进化搜索都能离开竞赛式 MLE。
- 作者的结论:贡献是一条把可验证环境、后训练和测试时进化接在一起的工作流,以及按此训练的 Frontis-MA1-35B 与 30B 对照模型。作者计划发布数据、训练与评测代码、沙箱、harness 和检查点;因许可,完整任务包数据对应 1415 个任务。