@_LuoFuli: MiMo-V2.6:扩大强化学习的艰难之路 MiMo-V2.6很可能是迄今为止在计算资源上进行的最大的单次强化学习运行之一……

X AI KOLs Timeline 模型

摘要

MiMo-V2.6是一个大规模强化学习模型,已成为顶尖的开源模型,其研究创新超越了DeepSeek R1,并发布了资源以推动Agentic RL研究。

MiMo-V2.6:扩大强化学习的艰难之路 MiMo-V2.6很可能是迄今为止任何开源模型团队在计算资源上进行的最大的单次强化学习运行之一。在计算资源极其稀缺的时代,我们仍然选择投入一个几十人的团队,长期专注于一个目标:扩大强化学习。这需要的不仅仅是研究信念。它需要对通用人工智能(AGI)的远见、对未知的尊重,以及直面最难题的勇气。 其结果是一个模型,其潜力通过中期训练构建,并通过强化学习释放。如今,它是排名第一的开源模型。我强烈推荐阅读技术报告。我相信它将成为智能体强化学习从业者反复查阅、每次都能发现新内容的论文之一。在我看来,其背后的研究创新和工程挑战超越了DeepSeek R1,我曾部分参与后者。 有人会问:为什么选择MixRL而不是MOPD?首先,它们不是竞争性选择。我们在中等难度的可验证任务上运行MixRL,包括代码和相关智能体任务,发现由此产生的模型泛化能力非常出色。其次,那些难以验证、极长视野或过于复杂而无法纳入联合强化学习运行的任务,会被单独训练。将它们纳入会显著降低展开效率或引入显著的展开陈旧性。然后,我们通过MOPD合并由此产生的能力。游戏、3D任务以及具有主观评估信号的任务都属于这一类别。 还有一个第三个,略带俏皮的答案。我们的团队足够扁平,足够摆脱组织壁垒,因此MixRL对我们来说并不困难。更重要的是,每个人都享受这种工作方式。来自不同领域的人每天聚集在一起,以追求AGI和能够持续自我改进的智能为动力,直面并解决各领域的强化学习瓶颈。我将永远记得这段时期的强化学习每日更新会议。它们紧张而密集,智能实时涌现。 为了帮助开源社区专注于解决真正的Agentic RL问题,我们发布了一个从MiMo RL轨迹蒸馏而来的Qwen模型,作为强化学习的更强起点,以及7000个多样化的环境和一个完整的强化学习训练框架。我们希望这些资源能帮助推动Agentic RL研究。 MiMo-V2.6只是开始。在智能易于复制的时代,我们仍然选择通往自我改进和AGI的艰难之路。前方许多事物仍然未知。但我们愿意持续投入所需的时间、计算资源和热情,一个接一个地攻克难题,并彻底解决每个问题,直到智能跨越到新的领域。
查看原文
查看缓存全文

缓存时间: 2026/09/22 19:54

MiMo-V2.6:强化学习规模化扩张的艰险之路

MiMo-V2.6很可能是至今所有开源模型团队中,按计算量计算,规模最大的单次强化学习训练任务之一。在计算资源极端稀缺的时代,我们仍选择投入数十人团队,在较长时间内专注单一目标:扩展强化学习。这不仅需要研究信念,更需要对通用人工智能的愿景、对未知领域的敬畏,以及直面最艰难问题的勇气。

该模型的潜力通过中期训练构建,借助大规模强化学习释放。如今它已成为排名领先的开源模型。我强烈建议阅读其技术报告——我相信这篇论文会成为智能体强化学习从业者反复研读、每次都有新发现的经典文献。在我看来,其背后的研究创新与工程挑战,已超越我曾部分参与的DeepSeek R1。

有人或许会问:为何选择MixRL而非MOPD?首先,二者并非竞争关系。我们在中等难度的可验证任务(包括代码及相关智能体任务)上运行MixRL,发现生成的模型具备出色的泛化能力。其次,对于难以验证、超长周期或过于复杂而无法纳入联合强化学习的任务,我们采用单独训练。强行纳入会大幅降低采样效率或导致严重的采样数据陈旧问题。随后通过MOPD整合生成的能力。游戏、3D任务以及带有主观评价信号的任务都属于此类。

还有第三个略带调侃的答案:我们团队结构扁平且极少存在组织壁垒,MixRL对我们而言并不困难。更重要的是,每个人都享受这种工作方式。不同领域的研究者每日汇聚,在追求通用人工智能与自我进化智能的驱动下,共同应对并解决各领域的强化学习瓶颈。我将永远铭记这段时间的每日强化学习进展会议——它们紧张而充实,智慧在实时碰撞中迸发。

为帮助开源社区聚焦于真正的智能体强化学习问题,我们发布了从MiMo强化学习轨迹中蒸馏而来的千问模型(作为更强大的强化学习起点),以及7000个多样化环境与完整的强化学习训练框架。我们期待这些资源能推动智能体强化学习研究向前发展。

MiMo-V2.6仅仅是起点。在智能易于复制的时代,我们仍选择这条通往自我进化与通用人工智能的艰险之路。前路大部分仍未知,但我们愿意持续投入所需的时间、算力与热情,逐一攻克难题并彻底解决每个挑战,直至智能迈入新纪元。

相似文章

XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face

Reddit r/LocalLLaMA

MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。