MiMo-V2.6:通过扩展强化学习迈向自我改进
扩展全模态基座的强化学习以支撑智能体自我改进
- arXiv
- 2610.11959
- 发表
- 被测模型
- MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B
摘要系列用三维扩 RL 与分组评分提升智能体分数,作者称最终表现与前沿模型相当。
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
扩展全模态基座的强化学习以支撑智能体自我改进
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
在 CWEval 上跟踪代码生成的功能-安全差距
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
用 J-lens 检测辩论中屈从多数的智能体是否仍内部表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
检验低监控读数能否证明代码生成中的奖励作弊已受控
本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。
提出 AuraForge,从漏洞修复合成安全测试并训练编码 Agent
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
提出 CGMIA,检测代码生成基准样本是否泄漏进训练集
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。
提出 ERPO,用探针共识奖励在无标签代码题上做测试时强化学习
提出 OpenMLE,后训练元进化智能体并做机器学习工程长程搜索
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。
复评前沿模型代码生成中的包名幻觉与抢注攻击面
摘要评估显示前沿模型包幻觉率收窄但威胁仍在,作者识别出跨模型通用攻击面并呼吁联合防御。