@sleepy0x13: Luo Fuli 刚写了一篇关于MiMo-V2.6的很长的回顾文章。通读全文后,它实际上在探讨一个…

X AI KOLs Timeline 模型

摘要

Luo Fuli关于MiMo-V2.6的回顾文章详细介绍了小米在扩展智能体强化学习方面的创新,重点关注了扩展的环境、集成的工具集和改进的评分系统,从而显著提升了智能体的能力。

Luo Fuli刚写了一篇关于MiMo-V2.6的很长的回顾文章。通读全文后,它实际上在探讨一个当前极其关键的问题: 预训练的Scaling Law已经运行了这么多年——RL能同样做到吗?不断增加计算,不断添加任务,将模型放入更多真实环境——其能力能持续提升吗? 过去六个月,小米基本上一直在押注这一点。 MiMo-V2.6的RL规模已经庞大到惊人。单次更新拉取1,568个任务,每个任务并行运行16次rollout,这意味着一步生成约25,000个智能体轨迹,消耗数十亿tokens。Pro和Flash版本都运行了30步。 Luo Fuli和团队发现,扩展Agent RL的真正挑战已经不仅仅是训练本身。 第一个问题是,你需要足够的“世界”让模型进入。 数学RL很简单:一个问题,一个答案,模型立即知道对错。智能体则不同。它们需要编写代码、打开浏览器、操作计算机、调用工具、检查结果,然后决定下一步行动。 因此,小米在扩展环境方面做了相应工作。 他们构建了超过7,000个RL任务环境,覆盖编码、通用智能体、视觉智能体、网络安全和其他任务类型。单个轨迹可能持续数十甚至数百步,模型必须真正在环境中完成任务。 第二个变化更值得注意: 工具集直接融入了训练。 过去,每个人都将工具集视为模型之外的东西。模型公司负责训练模型,然后像Claude Code、Codex和各种智能体设置这样的产品在外部叠加系统提示、工具、记忆和上下文管理。 MiMo-V2.6将不同的工具集直接放入同一轮RL中。 对于同一个模型,一个轨迹可能在一种编码工具集中工作,下一个轨迹则切换到全新的工具集和上下文管理方法。小米在训练中混合了编码、视觉、通用智能体和安全任务——内部称之为You Only RL Once。 他们不希望模型仅仅学会适应一个特定的智能体产品;他们希望它学会一种能跨工具集迁移的能力。 我认为这是整篇文章中最值得注意的一点。 工具集开始从发布后的“外壳”深入到模型的训练中。 第三个问题更棘手:一旦智能体完成任务,你怎么知道它是否做得好? 以修复bug为例。 在16次rollout中,可能所有测试最终都通过——但一个人只改了三行代码,另一个在补丁中添加了数十行;一个用五次工具调用就找到了问题,另一个靠运气消耗了超过100,000个tokens。 如果奖励只是“通过/失败”,所有这些结果对RL来说看起来基本一样。 所以小米在评分器上投入了大量计算。 从同一任务中提取多个成功轨迹进行比较:哪个解决方案更简洁,哪条路径更短,哪个使用更少的tokens——然后重新分配奖励。 他们甚至必须专门对抗奖励欺骗。 因为一旦模型发现“如何欺骗评分器”比实际完成任务更容易,它绝对会这么做。因此训练环境必须不断修补漏洞、清理答案泄露、运行异常检测,甚至派遣智能体主动攻击自己的训练设置。 到这时,Agent RL开始越来越不像我们过去理解的“强化学习”了。 真正扩展的是一个整个系统: Rollout、环境、工具集、评分器。 MiMo-V2.6 Pro在编码和智能体基准测试中比前一代有了巨大飞跃。小米还同时发布了Pro、Flash、基于MiMo轨迹训练的Qwen3.5-9B智能体模型、超过7,000个RL环境、RL框架和迷你工具集。 但这些只是结果。 这篇文章真正揭示的是,前沿模型的训练方法可能正在经历巨大转变。 过去,扩展模型意味着计算参数、tokens和GPU。 现在,模型开始有“体验”。 将其投入数千个环境,让它自行运行完整任务,失败,重试,同时尝试数十种方法。然后花费更多计算来判断哪些体验值得记住。 所以未来真正昂贵的可能不仅仅是更大的基础模型。 模型公司还需要能够持续生成任务、构建环境、维护工具集、运行数十万智能体轨迹,然后筛选出最佳体验反馈给模型。 我称之为体验工厂。 与工具集、合成环境、计算机使用、RL评分器、长期智能体一起训练模型——表面上看是独立的技术路径,但本质上都在解决同一个问题: 如何给模型越来越多它真正完成过的东西。 现在谈“自我改进”还为时过早。环境仍然是人工构建的,奖励仍然是人为设计的——值得学习的内容仍然有界限。 但MiMo-V2.6至少证明了一件事:大模型的下一轮扩展不再只发生在预训练集群中。 它发生在模型经历过的每一个世界里。
查看原文
查看缓存全文

缓存时间: 2026/09/22 11:52

罗福莉刚刚发布了一篇关于MiMo-V2.6的长篇复盘。通读全文后,我发现它其实探讨了一个当下极为关键的问题:

预训练的扩展定律已经运行了这么多年——强化学习(RL)能否复制同样的成功?持续增加计算量、不断添加任务、将模型投入更多现实环境——其能力是否能持续提升?

过去六个月,小米基本上正是押注于此。

MiMo-V2.6的RL规模已经大得惊人。单次更新涵盖1568个任务,每个任务并行运行16个rollout,这意味着一步就能生成大约25000条智能体轨迹,并消耗数十亿token。Pro和Flash版本都运行了30步。

罗福莉和团队发现的核心在于,扩展智能体RL的真正挑战已不仅仅是训练本身。

第一个问题是,你需要为模型提供足够多的“世界”来介入。

数学RL很简单:一个问题,一个答案,模型立刻知道对错。但智能体不同。它们需要编写代码、打开浏览器、操作计算机、调用工具、检查结果,然后决定下一步行动。

因此,小米同步扩展了环境

他们构建了超过7000个RL任务环境,涵盖编程、通用智能体、视觉智能体、网络安全等任务类型。一条轨迹可能持续数十甚至上百步,模型需要在环境中真正完成事情。

第二个变化更值得关注:

运行框架(Harness) 直接被整合到了训练过程中。

过去,大家都把Harness视为模型之外的附加部分。模型公司负责训练模型,然后像Claude Code、Codex以及各种智能体配置这样的产品,会在外部叠加系统提示、工具、记忆和上下文管理。

MiMo-V2.6则将不同的Harness直接投入同一轮RL训练。

对于同一个模型,一条轨迹可能在一种编码Harness下工作,下一条则切换到全新的工具集和上下文管理方法。小米将编码、视觉、通用智能体和安全任务混合在一起进行训练——他们内部称之为**“仅需一次RL”(You Only RL Once)**。

他们不希望模型只学会适应某一种特定的智能体产品;而是希望它学会一种能跨Harness迁移的能力。

我认为这是全文最值得注意的一点。

Harness正从一个发布后的“外壳”,开始深度嵌入模型的训练过程本身。

第三个问题更棘手:当智能体完成任务后,你怎么判断它是否真正做得好?

以修复一个bug为例。

16个rollout中,可能最后都通过了测试——但一个人只改了三行代码,另一个在补丁里添加了几十行;一个用五次工具调用就找到了问题,另一个纯靠运气消耗了超过10万token。

如果奖励(Reward)仅仅是“通过/失败”,那么在RL看来,这些结果基本是一样的。

因此,小米投入了大量计算资源用于评判器(Grader)

他们会从同一任务的多个成功轨迹中抽样比较:哪个解决方案更简洁、哪条路径更短、哪个使用的token更少——然后重新分配奖励。

他们甚至必须专门应对**奖励黑客(Reward Hacking)**问题。

因为一旦模型发现“如何欺骗评判器”比真正完成任务更容易,它绝对会这么做。所以训练环境必须不断修补漏洞、清洗答案泄露、运行异常检测,甚至派遣智能体主动攻击自己的训练设置。

到了这一步,智能体RL看起来越来越不像我们过去所理解的“强化学习”了。

你真正扩展的是一个完整的系统:

Rollout(轨迹生成)、环境、Harness、Grader(评判器)。

MiMo-V2.6 Pro在编程和智能体基准测试中较上一代有巨大飞跃。小米还同步发布了Pro、Flash、基于MiMo轨迹训练的Qwen3.5-9B智能体模型、超过7000个RL环境、RL框架以及mini-harnesses。

但这些都只是结果。

这篇文章真正揭示的是,前沿模型的训练方法可能正在经历一场巨大转变。

过去,扩展模型意味着计算参数、token和GPU数量。

现在,模型开始拥有“体验”。

将它投入成千上万个环境,让它自主运行完整任务,失败,重试,同时尝试数十种方法。然后再投入另一部分计算,来判断这些体验中哪些值得记住。

因此,未来真正昂贵的东西可能不再仅仅是一个更大的基础模型。

模型公司还需要持续产出任务、构建环境、维护Harness、运行数十万条智能体轨迹,然后筛选出最佳经验反馈给模型的能力。

我称之为**“经验工厂”**。

与Harness一起训练模型、合成环境、计算机使用、RL评判器、长程智能体——表面上看这是不同的技术路径,但底层,它们都在解决同一个问题:

如何让模型拥有更多它真正完成过的事情。

谈论“自我改进”还为时过早。环境仍是人工构建的,奖励仍是人工设计的——值得学习的边界仍由人来划定。

但MiMo-V2.6至少证明了一点:大模型的下一轮扩展,不再只发生在预训练集群里。

它正发生在模型所经历的每一个世界中。

罗福莉 (@_LuoFuli): MiMo-V2.6:扩展强化学习的艰难之路

MiMo-V2.6 很可能是迄今为止,任何开源模型团队按计算量计算所进行的最大规模单次强化学习运行之一。在计算资源极其稀缺的时代,我们仍选择投入一个数十人的团队,专注于一个

相似文章

XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face

Reddit r/LocalLLaMA

MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。

Xiaomi MiMo v2.6

Hacker News Top

Xiaomi 发布了 MiMo 模型的 2.6 版本,这暗示了对其 AI 能力的增量更新。