跳到正文
原文
论文追踪· LLM-Core Xiaomi·本站收录 · 原文发表

小米 MiMo-V2.6 发布:以强化学习扩展推动模型自我改进

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

AI 导读

小米发布 MiMo-V2.6 系列全模态模型,含 1.02T 参数、42B 激活参数的 MiMo-V2.6-Pro 和 310B 参数、15B 激活参数的 MiMo-V2.6-Flash,通过扩展强化学习算力推进模型自我改进。其 RL 训练每步消耗 1,568 个样本、2.7∼3.7B tokens,上下文长度最高 1M,覆盖代码、通用、视觉与网络等环境,并冻结 MoE router、建立多层防御以抑制奖励作弊。团队开源训练动态、RL 环境与 RL 框架。

阅读原文huggingface.co