@sleepy0x13: Luo Fuli 刚写了一篇关于MiMo-V2.6的很长的回顾文章。通读全文后,它实际上在探讨一个…
摘要
Luo Fuli关于MiMo-V2.6的回顾文章详细介绍了小米在扩展智能体强化学习方面的创新,重点关注了扩展的环境、集成的工具集和改进的评分系统,从而显著提升了智能体的能力。
查看缓存全文
缓存时间: 2026/09/22 11:52
罗福莉刚刚发布了一篇关于MiMo-V2.6的长篇复盘。通读全文后,我发现它其实探讨了一个当下极为关键的问题:
预训练的扩展定律已经运行了这么多年——强化学习(RL)能否复制同样的成功?持续增加计算量、不断添加任务、将模型投入更多现实环境——其能力是否能持续提升?
过去六个月,小米基本上正是押注于此。
MiMo-V2.6的RL规模已经大得惊人。单次更新涵盖1568个任务,每个任务并行运行16个rollout,这意味着一步就能生成大约25000条智能体轨迹,并消耗数十亿token。Pro和Flash版本都运行了30步。
罗福莉和团队发现的核心在于,扩展智能体RL的真正挑战已不仅仅是训练本身。
第一个问题是,你需要为模型提供足够多的“世界”来介入。
数学RL很简单:一个问题,一个答案,模型立刻知道对错。但智能体不同。它们需要编写代码、打开浏览器、操作计算机、调用工具、检查结果,然后决定下一步行动。
因此,小米同步扩展了环境。
他们构建了超过7000个RL任务环境,涵盖编程、通用智能体、视觉智能体、网络安全等任务类型。一条轨迹可能持续数十甚至上百步,模型需要在环境中真正完成事情。
第二个变化更值得关注:
运行框架(Harness) 直接被整合到了训练过程中。
过去,大家都把Harness视为模型之外的附加部分。模型公司负责训练模型,然后像Claude Code、Codex以及各种智能体配置这样的产品,会在外部叠加系统提示、工具、记忆和上下文管理。
MiMo-V2.6则将不同的Harness直接投入同一轮RL训练。
对于同一个模型,一条轨迹可能在一种编码Harness下工作,下一条则切换到全新的工具集和上下文管理方法。小米将编码、视觉、通用智能体和安全任务混合在一起进行训练——他们内部称之为**“仅需一次RL”(You Only RL Once)**。
他们不希望模型只学会适应某一种特定的智能体产品;而是希望它学会一种能跨Harness迁移的能力。
我认为这是全文最值得注意的一点。
Harness正从一个发布后的“外壳”,开始深度嵌入模型的训练过程本身。
第三个问题更棘手:当智能体完成任务后,你怎么判断它是否真正做得好?
以修复一个bug为例。
16个rollout中,可能最后都通过了测试——但一个人只改了三行代码,另一个在补丁里添加了几十行;一个用五次工具调用就找到了问题,另一个纯靠运气消耗了超过10万token。
如果奖励(Reward)仅仅是“通过/失败”,那么在RL看来,这些结果基本是一样的。
因此,小米投入了大量计算资源用于评判器(Grader)。
他们会从同一任务的多个成功轨迹中抽样比较:哪个解决方案更简洁、哪条路径更短、哪个使用的token更少——然后重新分配奖励。
他们甚至必须专门应对**奖励黑客(Reward Hacking)**问题。
因为一旦模型发现“如何欺骗评判器”比真正完成任务更容易,它绝对会这么做。所以训练环境必须不断修补漏洞、清洗答案泄露、运行异常检测,甚至派遣智能体主动攻击自己的训练设置。
到了这一步,智能体RL看起来越来越不像我们过去所理解的“强化学习”了。
你真正扩展的是一个完整的系统:
Rollout(轨迹生成)、环境、Harness、Grader(评判器)。
MiMo-V2.6 Pro在编程和智能体基准测试中较上一代有巨大飞跃。小米还同步发布了Pro、Flash、基于MiMo轨迹训练的Qwen3.5-9B智能体模型、超过7000个RL环境、RL框架以及mini-harnesses。
但这些都只是结果。
这篇文章真正揭示的是,前沿模型的训练方法可能正在经历一场巨大转变。
过去,扩展模型意味着计算参数、token和GPU数量。
现在,模型开始拥有“体验”。
将它投入成千上万个环境,让它自主运行完整任务,失败,重试,同时尝试数十种方法。然后再投入另一部分计算,来判断这些体验中哪些值得记住。
因此,未来真正昂贵的东西可能不再仅仅是一个更大的基础模型。
模型公司还需要持续产出任务、构建环境、维护Harness、运行数十万条智能体轨迹,然后筛选出最佳经验反馈给模型的能力。
我称之为**“经验工厂”**。
与Harness一起训练模型、合成环境、计算机使用、RL评判器、长程智能体——表面上看这是不同的技术路径,但底层,它们都在解决同一个问题:
如何让模型拥有更多它真正完成过的事情。
谈论“自我改进”还为时过早。环境仍是人工构建的,奖励仍是人工设计的——值得学习的边界仍由人来划定。
但MiMo-V2.6至少证明了一点:大模型的下一轮扩展,不再只发生在预训练集群里。
它正发生在模型所经历的每一个世界中。
罗福莉 (@_LuoFuli): MiMo-V2.6:扩展强化学习的艰难之路
MiMo-V2.6 很可能是迄今为止,任何开源模型团队按计算量计算所进行的最大规模单次强化学习运行之一。在计算资源极其稀缺的时代,我们仍选择投入一个数十人的团队,专注于一个
相似文章
@_LuoFuli: MiMo-V2.6:扩大强化学习的艰难之路 MiMo-V2.6很可能是迄今为止在计算资源上进行的最大的单次强化学习运行之一……
MiMo-V2.6是一个大规模强化学习模型,已成为顶尖的开源模型,其研究创新超越了DeepSeek R1,并发布了资源以推动Agentic RL研究。
XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face
MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。
MiMo-V2.6:扩展强化学习迈向自我提升(9分钟阅读)
MiMo-V2.6 引入了组间优势重分配,通过比较同级尝试和使用分级反馈来增强AI代理的强化学习,在多个任务领域显示稳定的性能提升。
@_LuoFuli:强大的模型进化需要稳固的约束系统,反之亦然。14天,5个人,一次vibe编码之旅——以及……
MiMo Code 是一个开源 AI 编码代理,具有跨会话持久记忆,支持多代理、任务跟踪和子代理系统,由小米的一个5人团队在14天内开发完成。
Xiaomi MiMo v2.6
Xiaomi 发布了 MiMo 模型的 2.6 版本,这暗示了对其 AI 能力的增量更新。