@VukRosic99: 理想汽车的Mach-Mind-4-Flash:一个仅有3B活跃参数的35B MoE模型,仅通过后训练就能匹配100B级别的模型……
摘要
理想汽车的Mach-Mind-4-Flash是一个拥有3B活跃参数的35B MoE模型,通过使用统一的强化学习/在线策略蒸馏损失进行后训练优化,在多个基准测试中达到了匹配或超越100B参数模型的性能。
查看缓存全文
缓存时间: 2026/07/13 13:56
理想汽车的 Mach-Mind-4-Flash:一个仅有 3B 激活参数的 35B MoE 模型,仅通过后训练即可媲美 100B 级别模型。
秘诀在于:将强化学习和在线策略蒸馏统一为一个加权损失 —— L = aL_OPD + bL_RL —— 因此同一分布式管道可以在纯 RL、纯蒸馏或两者兼顾的模式间切换。多个教师以配置树的形式接入。
新视频解说该技术报告:
论文 - https://arxiv.org/pdf/2607.09375 成为 AI 研究员:https://skool.com/become-ai-researcher-2669/about…
Mach-Mind-4-Flash 技术报告
来源:https://arxiv.org/html/2607.09375
摘要
我们提出 Mach-Mind-4-Flash,一个具有 35B 参数、3B 激活参数的混合专家(MoE)智能体模型。仅通过后训练优化(未扩展预训练计算),该模型的性能即可达到或超越 100B 参数级别的模型。通过引入可扩展的智能体交互环境用于大规模强化学习,该模型在真实世界应用任务上取得了显著的性能提升。我们的流程包含三个阶段:(1) 统一的 RL/OPD 训练基础设施,具有动态多教师调度和算子级加速,可实现 17% 的端到端训练加速;(2) 在推理、通用和智能体三个轨道上并行训练的多个领域特定 RL 专家,然后通过多教师在线策略蒸馏(MOPD)融合为一个通用模型——MOPD 是一种路由化的反向 KL 目标,消除了混合奖励 RL 中的“跷跷板”退化问题;(3) 混合中位长度策略优化(HMPO),一种单阶段 token 效率方法,可将推理链压缩 19–46%,且精度损失 ≤ 0.7 个百分点。Mach-Mind-4-Flash 在 AIME’26 上得分为 92.70,在 IFBench 上为 82.82,在 Behavioral-SafetyBench 上为 80.74,在 BFCL-v4 上为 75.80,在 BrowseComp-zh 上为 72.31,在 ClawBench 上为 84.20——领先或匹配激活规模大 10–30 倍的模型,而推理成本仅为其一小部分。
参见图注图 1:Mach-Mind-4-Flash 在多个能力维度上匹配或超越更大的模型。仅凭 3B 激活参数,Mach-Mind-4-Flash 在 IFBench、Behavioral-SafetyBench 和 BrowseComp-zh 上领先,同时在推理、工具使用和智能体编码方面与激活规模大 3–30 倍的模型保持竞争力。###### 目录
- 1 引言 (https://arxiv.org/html/2607.09375#S1)
- 2 相关工作 (https://arxiv.org/html/2607.09375#S2)1. 2.1 智能体基础模型与基准 (https://arxiv.org/html/2607.09375#S2.SS1) 2. 2.2 智能体后训练与强化学习 (https://arxiv.org/html/2607.09375#S2.SS2) 3. 2.3 高效且安全的智能体部署 (https://arxiv.org/html/2607.09375#S2.SS3)
- 3 基础设施 (https://arxiv.org/html/2607.09375#S3)1. 3.1 基于 RL 框架的统一 OPD 训练范式 (https://arxiv.org/html/2607.09375#S3.SS1) 2. 3.2 动态多教师可扩展架构 (https://arxiv.org/html/2607.09375#S3.SS2) 3. 3.3 训练加速与极致优化 (https://arxiv.org/html/2607.09375#S3.SS3)
- 4 后训练 (https://arxiv.org/html/2607.09375#S4)1. 4.1 监督微调 (https://arxiv.org/html/2607.09375#S4.SS1) 2. 4.2 推理与通用 RL (https://arxiv.org/html/2607.09375#S4.SS2) 3. 4.3 安全 RL (https://arxiv.org/html/2607.09375#S4.SS3) 4. 4.4 工具使用 RL (https://arxiv.org/html/2607.09375#S4.SS4) 5. 4.5 深度搜索 RL (https://arxiv.org/html/2607.09375#S4.SS5) 6. 4.6 代码智能体 RL (https://arxiv.org/html/2607.09375#S4.SS6) 7. 4.7 爪型智能体 RL (https://arxiv.org/html/2607.09375#S4.SS7) 8. 4.8 多教师在线策略蒸馏 (MOPD) (https://arxiv.org/html/2607.09375#S4.SS8) 9. 4.9 混合中位长度策略优化 (HMPO) (https://arxiv.org/html/2607.09375#S4.SS9)
- 5 实验结果 (https://arxiv.org/html/2607.09375#S5)1. 5.1 总体结果 (https://arxiv.org/html/2607.09375#S5.SS1) 2. 5.2 专家训练与 MOPD 融合的效果 (https://arxiv.org/html/2607.09375#S5.SS2) 3. 5.3 Token 效率 (HMPO) (https://arxiv.org/html/2607.09375#S5.SS3)
- 6 局限性与未来工作 (https://arxiv.org/html/2607.09375#S6)
- 7 贡献 (https://arxiv.org/html/2607.09375#S7)
- 参考文献 (https://arxiv.org/html/2607.09375#bib)
- 附录 (https://arxiv.org/html/2607.09375#Ax1)
- A 基础设施算子的加速 (https://arxiv.org/html/2607.09375#A1)
- B MOPD 目标推导 (https://arxiv.org/html/2607.09375#A2)
- C MOPD 中推理专家的消融实验 (https://arxiv.org/html/2607.09375#A3)
1 引言
扩展语言模型一直是提升能力的主要方法,但由此带来的推理成本使得万亿参数模型在延迟敏感的部署中难以实际应用。一种新兴的替代方案是扩展后训练流程,通过强化学习、专家融合和推理时效率优化来推动紧凑型基础模型达到前沿性能,而不是仅仅扩展预训练计算。Mach-Mind-4-Flash 正是我们在此方向上的贡献:一个 35B MoE 模型(3B 激活参数),其后训练流程将其提升到与激活参数多 10–30 倍的模型相同的性能水平。这一成果基于三大技术支柱:
(1) 具备算子级加速的可扩展训练基础设施。
后训练一个通用模型需要协调多个 RL 专家轨道、一个多教师蒸馏阶段和一个 token 效率阶段,这些阶段共享同一分布式基础设施。我们构建了一个统一的强化学习/在线策略蒸馏(RL/OPD)训练范式,通过单一加权损失在纯 RL、纯蒸馏和联合模式之间无缝切换。在此之上,我们设计了一种动态多教师架构,添加新专家无需侵入训练核心。在算子层面,我们深度集成了 SonicMoE 索引分组通用矩阵乘法(GEMM)内核和分段共享专家融合策略,该策略将通信与计算重叠,在 Qwen3.5-35B-A3B 训练上实现了高达 17% 的端到端加速。
(2) 先专业化再整合:多个专家,一个通用模型。
我们不使用会不可避免地导致能力“跷跷板”效应的异质奖励混合来训练单一模型,而是在三个轨道上独立训练多个 RL 专家:推理(数学、代码、STEM)、通用(指令遵循、写作、安全)和智能体(工具使用、深度搜索、代码智能体、爪型智能体)。每个专家都使用领域适当的数据合成、可验证的奖励信号和定制的训练策略进行优化(例如,针对稀疏结果领域的双阶段奖励课程,针对智能体领域的可执行多轮环境)。这些专家随后通过多教师在线策略蒸馏(MOPD)进行整合,MOPD 将每个训练样本路由到其对应的冻结教师,并通过 token 级别的反向 KL 目标在学生自己的 rollout 上监督学生。这种设计并行化专家开发,消除了顺序依赖,并产生了一个统一模型,该模型保留并且有时能超越单个专家的性能。
(3) 不牺牲准确率的 token 效率。
强大的推理模型倾向于过度思考,生成冗长的链,这增加了服务成本,却没有带来相应的准确率提升。我们通过 HMPO(混合中位长度策略优化)解决这个问题,这是一种单阶段 RL 方法,作为流程的最后一步应用。HMPO 从正确 rollouts 的中位数中推导出一个组自适应长度预算,并应用一个乘法正确性优先奖励,该奖励从数学上防止对短而错误的输出进行奖励黑客攻击。仅在数学上训练,这种压缩泛化到了代码、科学和指令遵循任务上,将生成长度减少了 19–46%,准确率损失最多为 0.7 个百分点。
结果。
得到的模型 Mach-Mind-4-Flash 证明了激进的后训练可以缩小紧凑型 35B MoE 与大幅领先的前沿模型之间的差距。在竞赛数学(AIME’26: 92.70)、代码生成(LiveCodeBench-V6: 80.91)、指令遵循(IFEval: 94.64; IFBench: 82.82)、安全(Content-SafetyBench: 98.20; Behavioral-SafetyBench: 80.74)和自主智能体任务(ClawBench: 84.20; BFCL-v4: 75.80)上,Mach-Mind-4-Flash 持续匹配或超越 120B 级别的模型,并与万亿参数系统保持竞争力——同时推理时仅需 3B 激活参数。我们发布此技术报告,详细阐述训练方法、基础设施创新和评估结果。
2 相关工作
近期的大语言模型正在从通用聊天助手转向面向生产的智能体系统,这些系统能够推理、调用工具、执行代码、与环境交互并完成长周期任务。我们从三个方面总结相关工作:智能体基础模型与基准、智能体后训练与强化学习,以及高效安全的部署。
2.1 智能体基础模型与基准
早期的语言智能体工作表明,LLM 可以通过外部工具和环境行动,而不仅仅是生成文本。ReAct [69 (https://arxiv.org/html/2607.09375#bib.bib31)] 交织推理和行动,而 Toolformer [52 (https://arxiv.org/html/2607.09375#bib.bib29)]、Gorilla [45 (https://arxiv.org/html/2607.09375#bib.bib33)]、ToolBench [47 (https://arxiv.org/html/2607.09375#bib.bib34)] 和 API-Bank [30 (https://arxiv.org/html/2607.09375#bib.bib35)] 研究工具学习、API 选择和工具增强的指令遵循。这些工作建立了选择工具、生成参数、观察结果和继续推理的基本智能体循环。
近期的技术报告进一步将基础模型定位为智能体系统。Kimi K2 [28 (https://arxiv.org/html/2607.09375#bib.bib36)] 强调开放的智能体智能,具有强大的推理、编码和工具使用能力。GLM-5 [13 (https://arxiv.org/html/2607.09375#bib.bib13)] 描述了从“氛围编码”到智能体工程的转变,针对复杂的软件工程和长周期工作流。Step-3.5-Flash [19 (https://arxiv.org/html/2607.09375#bib.bib37)] 和 MiMo-V2-Flash [63 (https://arxiv.org/html/2607.09375#bib.bib39)] 强调了高效稀疏激活在低成本智能体部署中的应用,而 Qwen3-Coder-Next [5 (https://arxiv.org/html/2607.09375#bib.bib38)] 则专注于使用可执行环境训练的编码智能体。与此同时,智能体基准也正从静态问答转向现实任务完成:BFCL [44 (https://arxiv.org/html/2607.09375#bib.bib42)] 评估函数调用,τ-bench [68 (https://arxiv.org/html/2607.09375#bib.bib44)] 评估工具-智能体-用户交互,ToolSandbox [35 (https://arxiv.org/html/2607.09375#bib.bib45)] 研究有状态工具使用,SWE-bench [25 (https://arxiv.org/html/2607.09375#bib.bib46)] 评估真实软件问题解决。这些工作表明,智能体模型应根据任务成功率、工具可靠性和长周期执行能力来评判,而非仅仅依据最终答案的准确性。
2.2 智能体后训练与强化学习
后训练已成为模型能力的主要驱动力。InstructGPT [41 (https://arxiv.org/html/2607.09375#bib.bib28)] 确立了 SFT 和 RLHF 在指令遵循方面的有效性。较新的推理模型表明,强化学习可以进一步引出长链推理和自我改进。DeepSeek-R1 [16 (https://arxiv.org/html/2607.09375#bib.bib5)] 证明 RL 可以诱导长链思维推理、验证和自我反思。Kimi k1.5 [27 (https://arxiv.org/html/2607.09375#bib.bib49)]、DAPO [71 (https://arxiv.org/html/2607.09375#bib.bib18)] 和 Skywork-OR1 [17 (https://arxiv.org/html/2607.09375#bib.bib50)] 进一步探索了可扩展的 RL 方法、基于规则的奖励以及稳定的大规模优化。
对于智能体任务,后训练必须处理多轮交互、延迟反馈、稀疏奖励和错误恢复。用于工具调用智能体的多轮 RL [37 (https://arxiv.org/html/2607.09375#bib.bib51)] 研究了中间工具行动的奖励校准,而长上下文软件工程智能体训练 [15 (https://arxiv.org/html/2607.09375#bib.bib52)] 展示了交互式 RL 在仓库级别任务中的价值。此外,诸如 DPO [49 (https://arxiv.org/html/2607.09375#bib.bib53)]、ORPO [18 (https://arxiv.org/html/2607.09375#bib.bib56)]、SimPO [36 (https://arxiv.org/html/2607.09375#bib.bib57)] 和多目标 DPO [81 (https://arxiv.org/html/2607.09375#bib.bib58)] 等偏好优化方法为将模型与偏好信号对齐提供了实用的替代方案。这些方法与 OPD/MOPD 式训练密切相关,其中多个目标(如任务成功、工具效率、token 成本和安全性)必须联合优化,而不是合并为单个奖励。
2.3 高效且安全的智能体部署
生产型智能体不仅需要强大的推理能力,还需要高效且安全的执行。智能体工作流通常包含工具模式、检索到的文档、执行轨迹、对话历史和中间观察结果,这使得长上下文推理和预填充成本成为主要瓶颈。诸如 LLMLingua [23 (https://arxiv.org/html/2607.09375#bib.bib64)]、LongLLMLingua [24 (https://arxiv.org/html/2607.09375#bib.bib65)] 和 LLMLingua-2 [42 (https://arxiv.org/html/2607.09375#bib.bib66)] 等提示压缩方法可在保留任务相关信息的同时减少 token 使用。DeepSeek-V4 [11 (https://arxiv.org/html/2607.09375#bib.bib40)] 针对百万 token 上下文效率,MiniMax-M1 [7 (https://arxiv.org/html/2607.09375#bib.bib68)] 使用闪电注意力来扩展测试时计算。在服务层面,vLLM [29 (https://arxiv.org/html/2607.09375#bib.bib69)]、DistServe [78 (https://arxiv.org/html/2607.09375#bib.bib70)] 和多 token 预测 [14 (https://arxiv.org/html/2607.09375#bib.bib73)] 改进了 KV 缓存管理、预填充/解码效率和解码速度。
安全性同样重要,因为智能体可以执行操作而不仅仅是输出文本。宪法 AI [1 (https://arxiv.org/html/2607.09375#bib.bib22)] 和基于规则的奖励 [38 (https://arxiv.org/html/2607.09375#bib.bib61)] 提供了基于原则和基于规则的对齐机制,而 Llama Guard [20 (https://arxiv.org/html/2607.09375#bib.bib62)] 支持安全分类。对于已部署的智能体,安全性必须涵盖内容安全和行为安全,包括模型是否适当地调用工具、遵守约束以及避免不安全操作。因此,实用的智能体系统需要联合优化能力、延迟、token 成本和安全性。
3 基础设施
为了提升大语言模型在后期训练阶段(包括强化学习和知识蒸馏)的训练效率和系统灵活性,我们对现有的成熟 RL 训练框架进行了系统性升级。我们提出了一种统一的 RL 和在线策略蒸馏(OPD)联合训练范式,并在此基础上构建了一个动态多教师可扩展架构。此外,我们从系统框架层面和底层算子层面两个维度进行了深入的训练加速与优化。核心技术革新详述如下:
相似文章
@sheriyuo: 仅3B活跃参数的35B参数MoE代理模型,声称通过后训练即可匹配或超越100B级模型
一个35B参数的MoE模型,仅3B活跃参数,通过后训练强化学习匹配或超越100B级模型,实现显著效率提升。
Mach-Mind-4-Flash 技术报告
本技术报告介绍了 Mach-Mind-4-Flash,一个拥有35B参数(3B激活参数)的混合专家(MoE)代理模型,仅通过后训练优化即可达到或超越100B参数级别的模型性能。它提出了一种新颖的训练基础设施,包括动态多教师调度、多教师在线策略蒸馏以及用于令牌效率的混合中位长度策略优化。
@AdinaYakup: Step-3.7-Flash 来自@StepFun_ai的新VL模型 198B/11B活跃参数 - MoE 256K上下文 3推理等级 高达400 tokens/秒
StepFun 发布了 Step-3.7-Flash,这是一个新的视觉语言 MoE 大模型,拥有 198B 参数(11B 激活),256K 上下文,推理速度高达 400 tokens/秒。
Liquid AI 发布基于 38T 训练的 8B-A1B MoE 模型
Liquid AI 发布了 LFM2.5-8B-A1B,这是一款边缘 MoE 模型,基于 38T tokens 训练,拥有 128K 上下文窗口,改进了工具调用和推理能力,可在 Hugging Face 上获取。
@nathanhabib1011: 来自 @StepFun_ai 的 Step-3.7-Flash 是一个低调的赢家。效果极为惊艳,是HuggingFace排行榜上参数量低于500B的最佳模型……
Step-3.7-Flash(来自 StepFun_ai)被突出显示为 Hugging Face 排行榜上参数量低于500B的最佳模型,具有强大的多模态性能。