@_LuoFuli: MiMo-V2.6:扩大强化学习的艰难之路 MiMo-V2.6很可能是迄今为止在计算资源上进行的最大的单次强化学习运行之一……
摘要
MiMo-V2.6是一个大规模强化学习模型,已成为顶尖的开源模型,其研究创新超越了DeepSeek R1,并发布了资源以推动Agentic RL研究。
查看缓存全文
缓存时间: 2026/09/22 19:54
MiMo-V2.6:强化学习规模化扩张的艰险之路
MiMo-V2.6很可能是至今所有开源模型团队中,按计算量计算,规模最大的单次强化学习训练任务之一。在计算资源极端稀缺的时代,我们仍选择投入数十人团队,在较长时间内专注单一目标:扩展强化学习。这不仅需要研究信念,更需要对通用人工智能的愿景、对未知领域的敬畏,以及直面最艰难问题的勇气。
该模型的潜力通过中期训练构建,借助大规模强化学习释放。如今它已成为排名领先的开源模型。我强烈建议阅读其技术报告——我相信这篇论文会成为智能体强化学习从业者反复研读、每次都有新发现的经典文献。在我看来,其背后的研究创新与工程挑战,已超越我曾部分参与的DeepSeek R1。
有人或许会问:为何选择MixRL而非MOPD?首先,二者并非竞争关系。我们在中等难度的可验证任务(包括代码及相关智能体任务)上运行MixRL,发现生成的模型具备出色的泛化能力。其次,对于难以验证、超长周期或过于复杂而无法纳入联合强化学习的任务,我们采用单独训练。强行纳入会大幅降低采样效率或导致严重的采样数据陈旧问题。随后通过MOPD整合生成的能力。游戏、3D任务以及带有主观评价信号的任务都属于此类。
还有第三个略带调侃的答案:我们团队结构扁平且极少存在组织壁垒,MixRL对我们而言并不困难。更重要的是,每个人都享受这种工作方式。不同领域的研究者每日汇聚,在追求通用人工智能与自我进化智能的驱动下,共同应对并解决各领域的强化学习瓶颈。我将永远铭记这段时间的每日强化学习进展会议——它们紧张而充实,智慧在实时碰撞中迸发。
为帮助开源社区聚焦于真正的智能体强化学习问题,我们发布了从MiMo强化学习轨迹中蒸馏而来的千问模型(作为更强大的强化学习起点),以及7000个多样化环境与完整的强化学习训练框架。我们期待这些资源能推动智能体强化学习研究向前发展。
MiMo-V2.6仅仅是起点。在智能易于复制的时代,我们仍选择这条通往自我进化与通用人工智能的艰险之路。前路大部分仍未知,但我们愿意持续投入所需的时间、算力与热情,逐一攻克难题并彻底解决每个挑战,直至智能迈入新纪元。
相似文章
XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face
MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。
@sleepy0x13: Luo Fuli 刚写了一篇关于MiMo-V2.6的很长的回顾文章。通读全文后,它实际上在探讨一个…
Luo Fuli关于MiMo-V2.6的回顾文章详细介绍了小米在扩展智能体强化学习方面的创新,重点关注了扩展的环境、集成的工具集和改进的评分系统,从而显著提升了智能体的能力。
@cline: 在观看MiMo模型的现场RL训练后,它正式展现出惊人的性能!旗舰模…
MiMo-v2.6-Pro模型已经发布,声称在人工智能指数上性能最佳,是最佳开放权重模型,现已在ClinePass上可用。
MiMo-V2.6:扩展强化学习迈向自我提升(9分钟阅读)
MiMo-V2.6 引入了组间优势重分配,通过比较同级尝试和使用分级反馈来增强AI代理的强化学习,在多个任务领域显示稳定的性能提升。
@tianjun_zhang: 我们为MiMo系列在TPU上扩展强化学习 这对我们来说是一段旅程,使用Jax + TPU将强化学习规模化:最…
Peano Labs 已在TPU上为MiMo模型家族扩展了强化学习,使用Jax实现了310B参数的全参数强化学习,其中扩展主要是配置更改。