MiMo-V2.6:通过扩展强化学习迈向自我改进
扩展全模态基座的强化学习以支撑智能体自我改进
- arXiv
- 2610.11959
- 发表
- 被测模型
- MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B
摘要系列用三维扩 RL 与分组评分提升智能体分数,作者称最终表现与前沿模型相当。
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
扩展全模态基座的强化学习以支撑智能体自我改进
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
提出 comprehension audits,以人类理解证据作为继续研发门槛
本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出 Mid-Harness,在执行前验证并筛选终端智能体的候选动作
Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。
提出 PatchHolmes,用混合检索和列表式智能体选出 CVE 修复提交
PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。
提出 SelfSearch,用自我修改记录无奖励搜索改进编码智能体
Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。
TAIP 是放在未修改 RepoAudit 之外的保证层,用来在软件交付门上重算智能体安全控制的当前姿态。
作者把高自主 AI scientist 的规模化协调写成经济与制度问题:假设生成变便宜之后,要分配的是稀缺验证资源,并处理信用、问责和恶意使用。
提出双层系统 AIDE2,使研究智能体自改进 Harness 并对比人类研发基线
摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。
提出 Djinnlang,使人只写无歧义规格,由编译器内 LLM 补实现并经 Dafny 核验
Djinnlang 让程序员只写规格,把 LLM 放进编译器,并用 Dafny 验证器加上无歧义约束钉住语义。
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
提出 ERPO,用探针共识奖励在无标签代码题上做测试时强化学习
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行
提出 OpenMLE,后训练元进化智能体并做机器学习工程长程搜索
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。
这是一篇关于 LLM 驱动 AI scientists 的 perspective:自主科研能力增强时,误用和意外后果缺少科学情境下的系统防护。