其他arXiv 2610.11959
MiMo-V2.6:通过扩展强化学习迈向自我改进
扩展全模态基座的强化学习以支撑智能体自我改进
- arXiv
- 2610.11959
- 发表
- 被测模型
- MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B
摘要系列用三维扩 RL 与分组评分提升智能体分数,作者称最终表现与前沿模型相当。
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
扩展全模态基座的强化学习以支撑智能体自我改进
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出 ERPO,用探针共识奖励在无标签代码题上做测试时强化学习
提出 OpenMLE,后训练元进化智能体并做机器学习工程长程搜索
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。