MiMo-V2.6:通过扩展强化学习迈向自我改进
扩展全模态基座的强化学习以支撑智能体自我改进
- arXiv
- 2610.11959
- 发表
- 被测模型
- MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B
摘要系列用三维扩 RL 与分组评分提升智能体分数,作者称最终表现与前沿模型相当。
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
扩展全模态基座的强化学习以支撑智能体自我改进
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
提出 comprehension audits,以人类理解证据作为继续研发门槛
本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。
提出 QPT,用奖励与成本 Q 惩罚训练满足约束的离线强化学习策略
QPT 针对安全离线 RL:只从离线数据学习,同时处理约束满足、回报最大化和行为正则,并希望部署时更换成本阈值而无需重训。
用可验证经验流水线训练智能体并分析研发中的人机分工
Atria Dawn Preview 是面向研究与工程流程的智能体语言模型,论文同时报告它的基准表现,以及开发它的过程中人与智能体如何分工。
提出 ERPO,用探针共识奖励在无标签代码题上做测试时强化学习
提出 OpenMLE,后训练元进化智能体并做机器学习工程长程搜索
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。