@seclink: 罗老师真的牛,又有一个大创新,号召大厂都学习需学习...
摘要
Fuli Luo 分享了关于 MiMo-V2.6 模型在强化学习方面的扩展研究,重点关注计算规模、环境和工具链的提升。
查看缓存全文
缓存时间: 2026/09/17 04:08
罗老师真的牛,又有一个大创新,号召大厂都学习需学习…
Fuli Luo (@_LuoFuli): Nearly half a year of silence. We spent it studying one problem: how far RL can scale.
MiMo-V2.6 is in the middle of its RL run right now. Three things we scaled: compute (~2B tokens per step, 1568 prompts × 16 rollouts, fully async), environments and harnesses (multi-task
相似文章
@seclink: MiMo-V2.5-Pro-UltraSpeed 超快 , 生成基于多臂老虎机的强化学习示意视频。
MiMo-V2.5-Pro-UltraSpeed 是一款快速的多模态模型,可生成基于多臂老虎机的强化学习示意视频。
@seclink: 确实不错,最近 mimo 发布 2.6 flash 了,我也快速用上了。
MiMo 发布了 2.6 flash 版本,并引用了 Tianjun Zhang 关于在 TPUs 上使用 JAX 扩展强化学习的博客文章。
@sleepy0x13: Luo Fuli 刚写了一篇关于MiMo-V2.6的很长的回顾文章。通读全文后,它实际上在探讨一个…
Luo Fuli关于MiMo-V2.6的回顾文章详细介绍了小米在扩展智能体强化学习方面的创新,重点关注了扩展的环境、集成的工具集和改进的评分系统,从而显著提升了智能体的能力。
@_LuoFuli: MiMo-V2.6:扩大强化学习的艰难之路 MiMo-V2.6很可能是迄今为止在计算资源上进行的最大的单次强化学习运行之一……
MiMo-V2.6是一个大规模强化学习模型,已成为顶尖的开源模型,其研究创新超越了DeepSeek R1,并发布了资源以推动Agentic RL研究。
@seclink: 智谱 AI(https://Z.ai)今天发布了 GLM-5.3,和 GLM-5.2 共用同一个基座模型,所有提升都来自后训练阶段的强化学习(RL)。 【1】编程:开源阵营里最强,但离闭源前沿还有距离 GLM-5.3 在多个编程基准上拿到…
智谱AI发布了GLM-5.3,通过后训练强化学习在编程和网络安全能力上取得显著提升,成为开源模型中编程能力最强的模型,并意外发现大量真实漏洞。