MiMo-V2.6:通过扩展强化学习迈向自我改进
扩展全模态基座的强化学习以支撑智能体自我改进
- arXiv
- 2610.11959
- 发表
- 被测模型
- MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B
摘要系列用三维扩 RL 与分组评分提升智能体分数,作者称最终表现与前沿模型相当。
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
另有 244 篇论文还没打上分类标签,暂不在筛选结果里。
扩展全模态基座的强化学习以支撑智能体自我改进
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
提出 comprehension audits,以人类理解证据作为继续研发门槛
本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。
提出热启动 Bandit 的部署前有界离线注入攻击
提出利用路由元数据推断敏感话题的侧信道攻击
摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
提出 SOUL 稀疏特征策略遗忘,缓解 VLA 状态幻觉
SOUL用稀疏特征引导的策略 unlearning 处理 VLA 的 state hallucination。
提出 VeriFine,用双环协同扩展验证以实现具身推理自我改进
VeriFine 把驾驶和导航推理的自改进写成策略、课程和无参考评审的协同演化,用来处理固定评审跟不上新失败模式的问题。
提出 SIGMA,让模型依据 Model Spec 自造对齐数据并改进安全对齐
SIGMA 让 Qwen3.6-27B 只凭 Model Spec 和高层领域,自己生产对齐任务、评分细则和奖励。
TAPDreamer 用公开编码器做固定补丁。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出推理时上下文注入,用代码注释诱导补全生成含弱点的代码
提出利用共享冷却的跨租户干扰攻击,并设计租户隔离机制
摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。
提出 Perturbot 扰动训练,打破 VLA 的模态捷径
Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。
论证人形机器人学习四层代理可在目标缺失时报成功
作者讨论腿式机器人 RL 流水线中,奖励、课程门控、评测统计量和参考运动如何在物理目标缺失时仍报告成功。传统观点只把奖励当作会被优化、因而会偏离的代理。
检验低监控读数能否证明代码生成中的奖励作弊已受控
本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。
提出 AuraForge,从漏洞修复合成安全测试并训练编码 Agent
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
提出 FAIL BANK,用运行时 CBF 反馈自进化更新 VLA 策略
提出 ReSAIL,用选择蒸馏与特权保留缓解智能体自蒸馏崩塌