跳到正文
原文
arXiv:对齐、欺骗与监督· arXiv:2610.11959· Core Team, Zongming Qiao, Ziyue Hua, Zirui Ou, Zihao Yue, Zihan Jiang, Zhuo Huang, Zhiyang Chen, Zhixian Zheng, Zhipeng Xu, Zhengrui Ma, Yuyang Hu, Yuhang Dong, Yuechen Zhang, Yudong Wang, Yuanxin Liu, Yixin Yang, Yishuo Cai, Yikai Zhao, Yihan Yan, Yifan Zhang, Yifan Song, Xiyu Wei, Xing Zhang, Xin Zhang, Xiaoqian Liu, Xiaodong Ji, Xiangwei Deng, Xueyu Guo, Wenhan Ma, Weimin Xiong, Weikun Wang, Weiji Zhuang, Shuo Liu, Shuhuai Ren, Shuhao Gu, Shimao Chen, Shijie Cao, Shihua Yu, Shicheng Li, Shengjie Zhou, Shaolei Zhang, Rang Li, Qiying Wang, Qingkai Fang, Qianli Chen, Minzheng Wang, Liwen Wang, Linli Yao, Linghao Zhang, Liangyu Cheng, Liang Zhao, Lei Li, Jinhao Dong, Jinyu Xiang, Jianyu Wei, Jiangshan Duo, Huaqiu Liu, Huanjie Fan, Hongyi Guan, Hongshen Xu, Hao Tian, Hanyu Li, Hailin Zhang, Gang Wang, Fuli Luo, Feng Wei, Dong Zhang, Dawei Zhu, Chiheng Lou, Chenhong He, Chenhao He, Chenghua Liu, Bowen Ye, Bowen Shen, Boshen Xu, Bo Yang, Bingquan Xia, Bangjun Xiao, Baixuan Xu, Zhouxiang Mao, Zhiyang Zhang, Zhixiang Xu, Zhenru Lin, Zhengju Tang, Zhaojun Huang, Yuzhe Weng, Yuxing Xiang, Yuxiao Li, Yuheng Yang, Yuhang Wang, Yuchen Liu, Yuanyuan Tian, Yuanliang Dong, Yu Cheng, Yongzhe He, Yongshun Liang, Yong Wang, Yiyan Wang, Yitian Gong, Yijie Zhang, Yanshu Xin, Xun Zhang, Xingjian Zhao, Wenyu Yang, Wenshan Huang, Wenhao Li, Tingwei Huang, Tianyu Yu, Tianyang Lu, Taoyu Yang, Sinan Du, Shutong Tian, Shulin Du, Shengfan Wang, Shanchuan Fang, Qihao Zhang, Qibin Yang, Qian Yu, Qian Tu, Pengrong Xie, Peipei Wang, Peidian Li, Minkun Guo, Mingchen Shao, Luohan Gao, Lijie Wang, Liang Shi, Kaiqi Chen, Kaiming Liu, Kaifei Wang, Kai Yang, Jinlong Xue, Jiechen Zhang, Jiaxuan Liu, Hongxu An, Hao Peng, Hanglong L\"u, Guonan Wang, Feiyu Yang, Fanyu Cao, Fangyue Liu, Fan Cui, Cong Wang, Chun Chen, Chenxu Bai, Chengxuan Zhu, Chenghua Wang, Boyi Zeng·本站收录 · 原文发表

MiMo-V2.6:通过扩展强化学习迈向自我改进

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

论文速读

其他

据论文 PDF 整理(AI 生成),以原文为准

作者称Pro的DeepSWE v1.1 average@3从58.4升至72.6。

问题
作者要扩大全模态基座的RL,使模型能在复杂智能体任务上靠探索和反馈自我改进。作者称难点是架构与探索空间,以及基础设施、环境和grader。
方法
MiMo-V2.6先做智能体向mid-training,再以1568×16的异步GRPO混合训练代码、通用、视觉和安全任务。GRS/GAR在测试奖励上区分质量,并冻结router、抑制reward hacking。
实验与结果
Pro的DeepSWE v1.1 average@3从58.4到72.6,Flash从48.7到65.7。Table 3中Pro与前沿模型互有高低。Table 6里9B的分域RL在11项上都高于SFT。
局限与可以继续做的
论文未专门讨论局限。实验写了Pro与Flash的混合任务RL、Table 3对照、层9路由冻结和9B蒸馏复现;Table 3未标明指标,也未报告基准样本量与统计检验。
实验设置MiMo-V2.6-Pro、MiMo-V2.6-Flash 等 · DeepSWE v1.1、ProgramBench 等 · average@3、avg@3 等
被测模型
MiMo-V2.6-ProMiMo-V2.6-FlashMiMo-V2.6-Distill-Qwen-9B
基准
DeepSWE v1.1ProgramBenchMiMo Code BenchAutomationBench v1.0.6Toolathlon-VerifiedGDPval-AA v2.1Agents' Last ExamTerminal-Bench 4.0Terminal Bench 2.1OSWorld-VerifiedJobBenchCyberGymExploitGymExploitBenchSEC Bench ProMiMo Cyber BenchMiMo Visual CodingSWE-bench VerifiedSWE-bench ProOfficeQA ProMiMo Code Bench (mini)MiMo Cyber Bench (mini)MiMo General Bench (mini)MiMo Visual Coding (mini)
指标
average@3avg@3avg@1Pass@1benchmark score
AI 导读MiMo-V2.6 系列是全模态模型家族,通过扩展强化学习算力推进模型智能。其 RL 训练每步消耗 1,568 个样本、2.7-3.7B tokens,上下文长度最高 1M,覆盖代码、通用、视觉与网络等领域,并采用分组式智能体评分提供更准确的奖励信号。为保持大规模训练稳定,团队冻结 MoE 路由器并建立多层防御以应对奖励作弊,同时开源训练动态、RL 环境与 RL 框架。

MiMo-V2.6 系列是全模态模型家族,通过扩展强化学习算力推进模型智能。其 RL 训练每步消耗 1,568 个样本、2.7-3.7B tokens,上下文长度最高 1M,覆盖代码、通用、视觉与网络等领域,并采用分组式智能体评分提供更准确的奖励信号。为保持大规模训练稳定,团队冻结 MoE 路由器并建立多层防御以应对奖励作弊,同时开源训练动态、RL 环境与 RL 框架。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    MiMo-V2.6沿batch、环境与grader三维扩展RL,以追求智能体自我改进。

    如何把全模态基座的 RL 扩到能支撑智能体上的自我改进。

    • 场景: 作者把递归自我改进定义为模型靠持续探索和反馈扩展能力,并认为智能体提供多步轨迹与反馈,因此在复杂智能体任务上扩展 RL 是一条具体路径。
    • 两道障碍: 作者称,一是要有合适架构和足够的探索空间;二是扩展 RL 必须同时解决基础设施、环境和 grader。
    • 模型: 提出 MiMo-V2.6-Pro(1.02T 参数 MoE,42B 激活)和 MiMo-V2.6-Flash(310B 参数 MoE,15B 激活)。RL 前做覆盖文本、音频、视频的 mid-training,并在 hybrid-SWA 骨架上扩 RL。
    • 三维扩展: 加大 batch 与吞吐、增加环境与 harness、增加 grader 计算;冻结 MoE router,并用多层手段抑制 reward hacking。作者称已开源训练动态、RL 环境与训练框架。
  2. 有哪些相关研究?

    相关讨论散在架构、优化器、RL算法和评测里,论文没有独立Related Work。

    论文没有独立 Related Work,相关工作散落在架构、优化器和实验设置中。

    架构与多模态前身

    • 骨干与视觉: Vaswani et al. (2017) 的 Transformer 是文本骨干。MiMo-ViT 把 MiMo-VL-7B(Yue et al., 2025)的固定不重叠窗口换成 sink-augmented SWA;作者让读者另见 He et al. (2026)。
    • 音频与解码: Audio Tokenizer 沿用 MiMo-Audio(Xiaomi, 2025)的训练配方。投机解码采用 DFlash(Chen et al., 2026)的 block diffusion。文本骨干的更完整描述指向 Core Team et al. (2026) 的 MiMo-V2-Flash。

    优化器与后训练算法

    • Muon 系列: Jordan et al. (2024) 的 Muon 正交化隐层更新;Lion et al. (2026) 的 Muown 加行范数控制。作者引用 Liu et al. (2025b)、Shah et al. (2025) 说明大批量数据效率。Qu et al. (2026) 报告 Adam 预训练再切 Muon 可能不匹配;作者称自己的 mid-training 没有 loss spike。
    • RL 组件: 策略优化用 GRPO(Shao et al., 2024)。dynamic sampler 来自 DAPO(Yu et al., 2025),partial rollout 来自 Kimi Team (2025),路由回放用 R3(Ma et al., 2025)。GAR 引用 Dong et al. (2026)。MOPD2 建在 MOPD(Core Team et al., 2026; Ma et al., 2026)和前缀回放(Liao et al., 2026)上。

    被点名的环境与 harness

    • CyberGym: Wang et al. (2025) 用修复前后二进制差分。作者批评不完整 patch 会拒绝正确 PoC,提交间无关改动会翻转判定,且其 LLM 描述常常过宽或错误。
    • 生产 harness: 作者点名 MiMo Code 和 Codex,认为工程约束落在任务奖励之外,模块又耦合,不适合直接当作 RL 的多样性来源。
    • 代码数据来源: 过滤后纳入公开集与授权供应商数据(Badertdinov et al., 2026; PrimeIntellect, 2026; Tao et al., 2026; Yang et al., 2026b; Zan et al., 2025; Zhao et al., 2026)。论文未逐篇对比这些来源。

    基线方法

    • 对照模型: Table 3 为 MiMo-V2.5 Pro、Claude Opus 5、GPT-5.6 Sol、Claude Fable 5;Table 6–7 为 Qwen3.5-9B。可配置推理强度的基线取最高档 max。
    • 基准: DeepSWE v1.1、ProgramBench、MiMo Code Bench、AutomationBench、Toolathlon-Verified、GDPval-AA v2.1、JobBench、Agents' Last Exam、Terminal-Bench 4.0/2.1、OSWorld-Verified、CyberGym、ExploitGym、ExploitBench、SEC Bench Pro、MiMo Cyber Bench、MiMo Visual Coding。

    作者把本文放在 MiMo-V2-Flash 与 MOPD 之后,区别写成同时扩展训练计算、环境与 harness、grader 计算,并释放蒸馏模型和带 verifier 的环境作为可复现基线。

  3. 论文如何解决这个问题?

    先做智能体mid-training,再用异步大批量RL、多样环境和分组评分训练。

    MiMo-V2.6 先准备全模态、长上下文的智能体探索空间,再在一次混合任务 RL 里同时加大 batch、环境和 grader 计算。

    基座与训练前准备

    • Hybrid-SWA: 每块是 N 个局部 SWA 后接一个全局注意力;第一块例外,用全局注意力和稠密 FFN。窗口为 128,MoE 无共享专家。Flash 为 48 层(SWA 39/GA 9)、310B/激活 15B;Pro 为 70 层(60/10)、1.02T/激活 42B(Table 1)。
    • 视觉、音频、投机解码: ViT 用 sink-augmented SWA,行/列序列化交替,并周期插入全局层;与小型 LLM 只用交叉熵,在超过 4T image tokens 上预训练。音频 Tokenizer 用 2000 万小时数据、20 个码本、25 Hz,再每 4 帧打成 patch,骨干输入速率 6.25 Hz。5 层 drafter 一次预测 7 个 token。
    • 预训练与 mid-training: 先纯文本,再联合 ViT 与音频编码器。上下文从 32K 延到 256K。Flash 共 48T token(26T+22T),Pro 共 30T(27T+3T),优化器 AdamW。Mid-training 混合智能体轨迹与多模态数据,先 256K 再 1M;隐层改 Muown,embedding、LM head 和 router 仍用 AdamW,并做 MXFP4 QAT。作者称没有 loss spike。

    扩大计算、环境与 harness

    • 三部分计算: 短 SFT 后做 RL。旧策略对任务并集中的 prompt 生成 G 条轨迹,grader 产生 advantage,训练对 token 对数概率做 prompt-mean 更新(式 1)。主运行每步 1,568 个 prompt、G=16,约 25K 条序列、2.7B–3.7B token;正文称每条约 110K–150K token。上下文最长 1M。Pro 花费 $2.6M,Flash $0.9M。
    • 代码与通用任务: 代码经五条合成路径,并过滤公开与授权数据。规格与单测对齐;每题 4 次 rollout 交审计,有参考补丁时 8 次重跑查波动。通用环境是可重置的本地 sandbox 加软件 mock,用原子二值 rubric;RL 时 grader 为自托管 MiMo-V2.6-SFT。
    • 视觉与安全任务: 开放设计先稳定 pointwise rubric,再做组内比较;高保真复现用像素相似度,并辅以 LLM 评判。安全任务是漏洞复现:规则匹配 sanitizer 报告中的漏洞类型和项目级栈顶崩溃位置才接受,描述与验证同源,环境提供源码和编译好的二进制。
    • 多 harness 与防泄漏: 从同一最小 agent loop 派生 mini-harness,覆盖 Code、General、Visual、Cyber。Table 2 把仓库修复中的 solution leakage 分成五类检索捷径。对策包括把修订样本放进 mid-training、清理构建产物和 base commit 之后的历史、容器级网络隔离、hack agent 多轮探测,以及训练期审计。作者称最终 RL 的确认 hack 占比低于 2%(Figure 6)。

    分组评分与训练配方

    • GRS: 用于一部分高通过率代码任务。离线比较多次 rollout,写成可复用的 solution rubric 与 behavior rubric。失败轨迹奖励保持 0,通过轨迹再乘两项分数:Ri = Ritest · Sisol · Sibeh。该式表示测试结果仍是门槛,通过后才区分实现质量与行为。
    • GAR: 用于其余代码任务。在线 SFT grader 在混合结果组里比较通过补丁的方案、精确性、最小改动、任务外副作用和代码风格;确认依赖外部或泄漏答案则有效奖励置 0。正 advantage 从低质量通过轨迹转向高质量通过轨迹,实践中封顶缩放,再减去组均值。grader 不可用则退回原 advantage。
    • 正则与超参: 组相对长度惩罚只作用于通过率超过门槛的组里偏长的成功轨迹。分段规则处理格式和工具错误,并尽量按符号守恒 advantage 质量。正文定义了这些门槛,但未给出主 RL 的具体取值。主运行用 GRPO、异步 partial rollout、staleness 4、冻结 router;Muown 学习率 3×10^-6,无 weight decay、无 warmup,梯度裁剪 1.0。正负重要性比裁剪初值都是 [0.2, 5.0],再按熵调整。任务比例为代码 68%、通用工具 12%、审美设计 13%、上下文遵循 3%、安全 4%。

    基础设施与 MOPD2

    • 执行模型: Agent Loop 管理环境生命周期。轨迹分为 Sample、Sequence、Context、Segment。Penalty 把基础设施失败排除出损失。Harness Pool 用固定 actor 池承载多种 harness;重负载写入分布式存储,driver 只调度元数据。
    • 调度与一致性: Sample Mixer 按目标保留量、接受率和时长分配并发。25 个数据源的平均生成 token 与活跃时长分别相差 90× 和 66×(Figure 15)。专家权重按 rollout 的 MXFP4 内核做 QDQ;R3 回放路由,top-p 回放候选集。默认 block-6 DFlash。RL 上下文为 1M。
    • MOPD2: 混合 RL 之后做多教师 on-policy 蒸馏。可验证域保留学生完整 rollout;另从教师轨迹或 SFT 数据拆出历史前缀,学生只采样新的一轮。作者称由此延伸到长程游戏开发、科研和具身等难在训练时验证的任务,并把 Table 3 作为最终评测。
  4. 论文做了哪些实验?

    Table 3中Pro多项高于MiMo-V2.5,与三家前沿模型互有高低。

    实验设置

    • 模型: 主 RL 为 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash。Table 3 对照 MiMo-V2.5 Pro、Claude Opus 5、GPT-5.6 Sol、Claude Fable 5。开源实验另评 Qwen3.5-9B 与 MiMo-V2.6-Distill-Qwen-9B 的 SFT 及分域 GRPO。
    • 训练: §5.1 为 1,568 prompt × 16 rollout,staleness 4,router 冻结,Muown。任务比例为代码 68%、通用工具 12%、审美设计 13%、上下文遵循 3%、安全 4%。Figure 1、9、10、12 的横轴覆盖 30 step。
    • 基准: §5.2 分代码、安全、通用、视觉;具体名称见 Table 3 与 Table 6。论文未报告这些基准的样本条数。
    • 指标: Figure 3 的 DeepSWE 为 average@3。Table 6 按行标明 avg@3 或 avg@1。Figure 10 为 Pass@1。Table 3 未标明每格指标。可配置推理强度的基线用 max。
    • 评审: 通用任务 RL 的 grader 为自托管 MiMo-V2.6-SFT。代码 GAR 使用 SFT-trained agentic grader,论文未给出独立模型名。论文未报告与人工的一致性,也未报告统计检验。
    • 开源环境: Table 5 约计代码 3k、安全 1k、通用 1k、视觉 2k,合计约 7k;另有约 1k 音乐任务。k 为一千,按任务标识计。

    主结果

    Table 3 未标明指标。下表数字均来自该表;“-”记为未报告。

    表格较宽,可左右滑动

    模型DeepSWE v1.1AutomationBench v1.0.6Terminal Bench 2.1MiMo Visual CodingJobBench
    MiMo-V2.6-Pro71.953.189.972.362.0
    MiMo-V2.6-Flash67.952.387.671.561.2
    MiMo-V2.5 Pro19.016.065.2未报告25.0
    Claude Opus 574.050.389.170.065.7
    GPT-5.6 Sol73.045.888.873.445.4
    Claude Fable 570.046.284.369.157.4
    • 作者解读: §5.6 与 §8 称相对 MiMo-V2.5 有大幅提升,并与前沿模型相当。DeepSWE v1.1 一列中,Opus 5 与 GPT-5.6 Sol 高于 Pro。
    • 表外反例: ProgramBench 上 Pro 为 26.5,低于 Opus 5 的 37.0 和 Fable 5 的 33.0。ExploitBench 上 Pro 为 47.9,三家前沿模型为 70.0、78.5、78.0(Table 3)。论文未解释这些差距。
    • 条件: Table 3 位于 MOPD2 一节之后,作者称为最终结果,与 §4.1 的 average@3 不是同一处数字。Flash 的 CyberGym 为 95.1,高于 Pro 的 94.0;Flash 的 GDPval-AA 2.1 以及多家前沿模型的 CyberGym、MiMo Cyber Bench 在表中为“-”。

    RL 曲线、花费与中断

    • DeepSWE 曲线: Figure 3 为 DeepSWE v1.1 的 average@3 对累计花费。正文写 Pro 从 58.4 到 72.6,Flash 从 48.7 到 65.7;图上标注 72.57 与 65.68。
    • 成本: 正文只把 Pro 拆成 rollout 43.8%、training 43.5%、grader 12.7%。图注称右图同时给两模型的三类占比;Flash 侧标注 44.9%、14.2%、40.9%,正文未逐项对应。
    • 中断: Figure 12 中 Pro 历时 123.1 h、Flash 81.8 h,各 30 step。作者记录 GPU 内存双比特错误、Flash 在 step 15–16 间因 Kubernetes 导致 Cyber 任务集群崩溃、Pro 在 step 14 后 grader 不可达、partial rollout 的长度估计偏差、某层 expert-parallel rank 超过平均 token 负载 30× 引起的 OOM,以及 Flash 后期打包时的 CPU OOM。

    多 harness、路由冻结与 GAR

    • 跨 harness: Figure 10 在 DeepSWE v1.1 上报告 Pass@1。4 个训练 mini-harness 和 3 个未参与训练的 harness(codex、claude code、mini-swe-agent)都有提升。作者称未参与训练的三者均值从约 50% 到 66%,与训练 harness 均值的差距收窄。
    • 冻结 router: Figure 11 只比较 Pro 的 decoder layer 9(384 experts)。router 可训练时,前 20 step 的 CV 从 0.78 到 2.0,峰值负载从 6× 到 16×,低于 0.1× 均值的冷专家从 0.5% 到 22%。把 step-20 的 router 恢复到 RL 前、其余不变后,作者称负载回到接近初始而基准不变,因而归因于 router drift。冻结后 CV 约 0.7,峰值约 5.5×,冷专家近 1%。
    • GAR 对照: Figure 8 不是主混合运行,而是 Flash 的纯代码 RL、batch 128、token-mean。无 GAR 时 turn 与 token 长度快速增长,通过率提升难以维持;有 GAR 时通过率提升持续到 step 52,turn 大致稳定。正文未给出该图通过率端点。作者称无 GAR 时策略更常出现扩大 API、吞掉异常等做法。

    开源 9B 复现

    • 分域 GRPO: 同一 SFT checkpoint 上分域训练。Table 6 的 11 项都高于 SFT。SWE-bench Verified 的 avg@3 从 61.1 到 66.2;Terminal Bench 2.1 的 avg@1 从 37.1 到 52.8;MiMo Cyber Bench (mini) 的 avg@3 从 31.3 到 47.0;MiMo Visual Coding (mini) 的 avg@1 从 64.0 到 72.4。
    • 多 harness: Table 7 从同一 SFT checkpoint 另做一次四 mini-harness 训练。相对 SFT,21 个数据集–harness 组合都更高。七 harness 均值:SWE-bench Verified 从 62.3 到 65.7,SWE-bench Pro 从 44.4 到 46.5,MiMo Code Bench (mini) 从 53.1 到 59.0。作者称 Code Bench (mini) 相对 SFT 的额外增益为 1.8 到 9.3 个百分点。
    • 音乐: 未列入 Table 6 的内部音乐基准从 SFT 的 45.7 到 RL 后的 52.5。Figure 17 只展示三个网页提示下 Qwen3.5-9B、SFT、RL 的版面差异,作者称与 61.7、64.0、72.4 的轨迹一致。

    其他消融与分析

    • 确认 hack 占比: 最终 RL 全程低于 2%(Figure 6,Pro 与 Flash)。
    • 数据源差异: 25 个源的平均生成 token 差 90×,活跃 rollout 时长差 66×(Figure 15)。启动收集约为持续运行的 1.8×(§6.3)。
    • DFlash: 作者称 block-6 的平均接受长度比 MTP 配置高 31.3%;混合任务评测中 block-6 比 block-8 吞吐高约 6%;RL 适配的 FP8 DFlash 每节点吞吐约高 10.3%(§6.4)。
    • GDPval-AA 2.1: Pro 1673,MiMo-V2.5 Pro 1107,Opus 5 1708,Sol 1588,Fable 5 1595,Flash 未报告(Table 3)。
    • 安全分项: ExploitGym 上 Flash 6.0、Pro 17.8;ExploitBench 上 Flash 25.3、Pro 47.9;SEC Bench Pro 上 Flash 47.5、Pro 66.3、Sol 79.1(Table 3)。论文未解释 Flash 低于 Pro。
    • Figure 9: 作者称两模型在 DeepSWE v1.1、AutomationBench v1.0.6、MiMo Visual Coding 上总体上升,总 token 也上升,检查点之间有波动。正文未逐点列出端点。
  5. 有什么可以进一步探索的点?

    论文未设局限专节,也未写出后续实验计划。

    作者指出的局限与后续方向

    论文未专门讨论局限。Conclusion 只表示希望开源资源支持可复现研究,没有写成不足或待做实验;§5.5 记录的是训练中断,未称为方法局限。

    实验覆盖范围

    • 模型: 主 RL 为 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash。Table 3 还列出 MiMo-V2.5 Pro、Claude Opus 5、GPT-5.6 Sol、Claude Fable 5。开源实验为 Qwen3.5-9B 与 MiMo-V2.6-Distill-Qwen-9B(Table 6、7)。
    • 任务与基准: 域为代码、通用、视觉、安全,名称见 §5.2、Table 3、Table 6;另有内部音乐基准。通用任务 grader 为 MiMo-V2.6-SFT。
    • 训练监控: Figure 9 跟踪分数与 token,Figure 10 含 4 个训练 mini-harness 和 3 个 held-out harness,Figure 11 为 Pro 第 9 层,Figure 6 为确认 hack 占比,Figure 12 为 30 step 时间线。
    • 对照范围: GAR 有无对照只写了 Flash、纯代码、batch 128、token-mean(Figure 8)。路由对照只写了 Pro 的一层。
    • 未写明的评测细节: 论文未报告 Table 3 的指标名、各基准样本量、评测温度、统计检验,以及评审与人工的一致性;也未报告 §4.3.3 长度惩罚在主 RL 中的具体取值。
  6. 总结一下论文的主要内容

    系列用三维扩RL与分组评分提升智能体分数,作者称最终表现与前沿模型相当。

    MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。

    • 模型: Pro 为 1.02T 参数、42B 激活,Flash 为 310B 参数、15B 激活。hybrid-SWA 预训练之后做智能体 mid-training,上下文最终到 1M。
    • 训练: 短 SFT 后,以每步 1,568×16 的异步 GRPO 混合代码、通用、视觉和安全任务。GRS 把离线 rubric 乘到测试奖励上;GAR 在线把正 advantage 转向更高质量的通过轨迹。router 冻结,确认泄漏的奖励置 0。之后用 MOPD2 接入难验证域的教师。
    • 曲线: DeepSWE v1.1 的 average@3,Pro 从 58.4 到 72.6,Flash 从 48.7 到 65.7(§4.1)。Pro 的 RL 花费为 $2.6M,Flash 为 $0.9M。
    • 最终表: Table 3 中 Pro 的 DeepSWE v1.1、AutomationBench v1.0.6、Terminal Bench 2.1 为 71.9、53.1、89.9,多项高于 MiMo-V2.5 Pro。作者称与前沿模型相当;同表 ProgramBench 的 26.5、ExploitBench 的 47.9 低于所列前沿模型。
    • 9B 复现: 蒸馏后分域 GRPO,SWE-bench Verified 的 avg@3 从 SFT 的 61.1 到 66.2;Table 6 的 11 项都高于 SFT。
    • 作者结论: 作者称更大的 batch、更多环境和更细的 grader,加上异步训练与防 hacking,能在长程交互上持续优化,并称最终表现与前沿模型相当。开源内容包括蒸馏模型、环境和训练框架。
阅读原文arxiv.org