Mach-Mind-4-Flash 技术报告
摘要
本技术报告介绍了 Mach-Mind-4-Flash,一个拥有35B参数(3B激活参数)的混合专家(MoE)代理模型,仅通过后训练优化即可达到或超越100B参数级别的模型性能。它提出了一种新颖的训练基础设施,包括动态多教师调度、多教师在线策略蒸馏以及用于令牌效率的混合中位长度策略优化。
arXiv:2607.09375v1 Announce Type: cross
摘要:我们呈现 Mach-Mind-4-Flash,一个拥有35B参数(3B激活参数)的混合专家(MoE)代理模型。仅通过后训练优化,无需扩展预训练计算量,该模型即可达到或超越100B参数级别模型的性能。通过引入可扩展的代理交互环境进行大规模强化学习,该模型在实际应用任务上取得了显著的性能提升。我们的流程包括三个阶段:(1)统一的RL/OPD训练基础设施,具有动态多教师调度和算子级加速,实现17%的端到端训练加速;(2)多个领域特定的RL专家在推理、通用和代理轨道上并行训练,然后通过多教师在线策略蒸馏(MOPD)融合为单一通用模型——这是一种路由反向KL目标,消除了混合奖励RL的跷跷板退化;(3)混合中位长度策略优化(HMPO),一种单阶段令牌效率方法,将推理链压缩19-46%,准确率损失≤0.7个百分点。Mach-Mind-4-Flash在AIME'26上得分为92.70,IFBench上82.82,Behavioral-SafetyBench上80.74,BFCL-v4上75.80,BrowseComp-zh上72.31,ClawBench上84.20——领先或匹配其激活规模10-30倍的模型,而推理成本仅为其一小部分。
查看缓存全文
缓存时间: 2026/07/13 07:59
# Mach-Mind-4-Flash 技术报告 来源:https://arxiv.org/html/2607.09375 ###### 摘要 我们提出 **Mach-Mind-4-Flash**,一个 35B 参数的混合专家(MoE)智能体模型,仅有 3B 激活参数。仅通过后训练优化,未增加预训练算力,该模型便达到了与 100B 参数级别模型相当或更优的性能。通过引入可扩展的智能体交互环境用于大规模强化学习,该模型在真实应用任务上取得了显著的性能提升。我们的流程包括三个阶段:(1) 统一的 RL/OPD 训练基础设施,采用动态多教师调度和算子级加速,实现 17% 的端到端训练加速;(2) 在推理、通用和智能体三大轨道上并行训练多个领域特定的 RL 专家,然后通过多教师在线策略蒸馏(MOPD)——一种路由反向 KL 散度目标,消除了混合奖励 RL 的跷跷板退化——融合成一个通用模型;(3) 混合中长策略优化(HMPO),一种单阶段令牌效率方法,可将推理链压缩 19–46%,准确率损失 ≤0.7 个百分点。Mach-Mind-4-Flash 在 AIME'26 上得分为 92.70,IFBench 为 82.82,Behavioral-SafetyBench 为 80.74,BFCL-v4 为 75.80,BrowseComp-zh 为 72.31,ClawBench 为 84.20——在推理成本仅为激活参数规模 10–30 倍模型的极小部分的情况下,领先或持平于这些模型。参见标题图 1:Mach-Mind-4-Flash 在多种能力维度上匹配或超越更大模型。仅凭 3B 激活参数,Mach-Mind-4-Flash 在 IFBench、Behavioral-SafetyBench 和 BrowseComp-zh 上领先,同时在推理、工具使用和智能体编码方面与激活参数规模 3–30 倍的模型保持竞争力。###### 目录 1. [引言](#S1) (https://arxiv.org/html/2607.09375#S1) 2. [相关工作](#S2) (https://arxiv.org/html/2607.09375#S2) 1. [智能体基础模型与基准](#S2.SS1) (https://arxiv.org/html/2607.09375#S2.SS1) 2. [智能体后训练与强化学习](#S2.SS2) (https://arxiv.org/html/2607.09375#S2.SS2) 3. [高效且安全的智能体部署](#S2.SS3) (https://arxiv.org/html/2607.09375#S2.SS3) 3. [基础设施](#S3) (https://arxiv.org/html/2607.09375#S3) 1. [基于强化学习框架的统一 OPD 训练范式](#S3.SS1) (https://arxiv.org/html/2607.09375#S3.SS1) 2. [动态多教师可扩展架构](#S3.SS2) (https://arxiv.org/html/2607.09375#S3.SS2) 3. [训练加速与极致优化](#S3.SS3) (https://arxiv.org/html/2607.09375#S3.SS3) 4. [后训练](#S4) (https://arxiv.org/html/2607.09375#S4) 1. [监督微调](#S4.SS1) (https://arxiv.org/html/2607.09375#S4.SS1) 2. [推理与通用 RL](#S4.SS2) (https://arxiv.org/html/2607.09375#S4.SS2) 3. [安全 RL](#S4.SS3) (https://arxiv.org/html/2607.09375#S4.SS3) 4. [工具使用 RL](#S4.SS4) (https://arxiv.org/html/2607.09375#S4.SS4) 5. [深度搜索 RL](#S4.SS5) (https://arxiv.org/html/2607.09375#S4.SS5) 6. [代码智能体 RL](#S4.SS6) (https://arxiv.org/html/2607.09375#S4.SS6) 7. [Claw 智能体 RL](#S4.SS7) (https://arxiv.org/html/2607.09375#S4.SS7) 8. [多教师在线策略蒸馏(MOPD)](#S4.SS8) (https://arxiv.org/html/2607.09375#S4.SS8) 9. [混合中长策略优化(HMPO)](#S4.SS9) (https://arxiv.org/html/2607.09375#S4.SS9) 5. [实验结果](#S5) (https://arxiv.org/html/2607.09375#S5) 1. [总体结果](#S5.SS1) (https://arxiv.org/html/2607.09375#S5.SS1) 2. [专家训练与 MOPD 融合的效果](#S5.SS2) (https://arxiv.org/html/2607.09375#S5.SS2) 3. [令牌高效(HMPO)](#S5.SS3) (https://arxiv.org/html/2607.09375#S5.SS3) 6. [局限性与未来工作](#S6) (https://arxiv.org/html/2607.09375#S6) 7. [贡献](#S7) (https://arxiv.org/html/2607.09375#S7) 8. [参考文献](#bib) (https://arxiv.org/html/2607.09375#bib) 9. [附录](#Ax1) (https://arxiv.org/html/2607.09375#Ax1) 10. [基础设置算子加速](#A1) (https://arxiv.org/html/2607.09375#A1) 11. [MOPD 目标推导](#A2) (https://arxiv.org/html/2607.09375#A2) 12. [MOPD 中推理专家的消融实验](#A3) (https://arxiv.org/html/2607.09375#A3) ## 1 引言 扩展语言模型一直是提升能力的主要方法,但随之而来的推理成本使得万亿参数模型在延迟敏感部署中不切实际。一种新兴替代方案是扩展**后训练**流程,通过强化学习、专家融合和推理效率优化,在不大幅增加预训练算力的情况下,将紧凑的基础模型推向前沿性能。Mach-Mind-4-Flash 正是我们沿着这一方向的贡献:一个 35B MoE 模型(3B 激活),其后训练堆栈使其性能提升至与激活参数数量多 10–30 倍的模型同一水平。这一成果基于三大技术支柱: #### (1) 具有算子级加速的可扩展训练基础设施。 训练通用模型需要协调多个 RL 专家轨道、一个多教师蒸馏阶段和一个令牌效率阶段,所有这些都共享相同的分布式基础设施。我们构建了一个统一的强化学习/在线策略蒸馏(RL/OPD)训练范式,通过单一加权损失在纯 RL、纯蒸馏和联合模式之间无缝切换。在此基础上,我们设计了一种动态多教师架构,添加新专家无需侵入训练核心。在算子层面,我们深度集成了 SonicMoE 索引的分组通用矩阵乘法(GEMM)内核以及分段共享专家融合策略,该策略将通信与计算叠加,在 Qwen3.5-35B-A3B 训练中实现了高达 17% 的端到端加速。 #### (2) 先专精后融合:多个专家,一个通用模型。 我们不在一个异构奖励混合体上训练单个模型(这不可避免地会导致能力跷跷板效应),而是独立训练多个 RL 专家,涵盖三大轨道:推理(数学、代码、STEM)、通用(指令遵循、写作、安全)和智能体(工具使用、深度搜索、代码智能体、Claw 智能体)。每个专家都使用领域适切的数据合成、可验证的奖励信号以及量身定制的训练策略进行优化(例如,针对稀疏奖励领域的两阶段奖励课程,针对智能体领域的可执行多轮环境)。然后,通过多教师在线策略蒸馏(MOPD)将这些专家整合起来,MOPD 将每个训练样本路由到其对应的冻结教师,并通过令牌级别的反向 KL 散度目标在学生自身的 rollout 上监督学生。这种设计使专家开发并行化,消除了顺序依赖,并产生一个统一模型,该模型保留甚至偶尔超越个体专家性能。 #### (3) 令牌效率,不牺牲准确性。 强大的推理模型往往过度思考,产生冗长的推理链,增加了服务成本却没有带来相应的准确率提升。我们通过 HMPO(混合中长策略优化)解决这个问题,这是一种单阶段 RL 方法,作为流程的最后一步。HMPO 从正确 rollout 的中位数推导出组自适应长度预算,并应用乘性正确性优先奖励,从数学上防止对短而错误的输出进行奖励破解。仅在数学上训练,压缩效果泛化到代码、科学和指令遵循领域,将生成长度减少 19–46%,准确率损失最多 0.7 个百分点。 #### 结果。 最终模型 Mach-Mind-4-Flash 表明,激进的 post-training 可以缩小紧凑的 35B MoE 与规模大得多的前沿模型之间的差距。在竞赛数学(AIME'26: 92.70)、代码生成(LiveCodeBench-V6: 80.91)、指令遵循(IFEval: 94.64; IFBench: 82.82)、安全(Content-SafetyBench: 98.20; Behavioral-SafetyBench: 80.74)以及自主智能体任务(ClawBench: 84.20; BFCL-v4: 75.80)上,Mach-Mind-4-Flash 始终匹配或超越 120B 级别的模型,并与万亿参数系统保持竞争力——而推理时仅需 3B 激活参数。我们发布此技术报告,以提供训练方法、基础设施创新和评估结果的详细说明。 ## 2 相关工作 最近的大语言模型正在从通用聊天助手转向面向生产的智能体系统,这些系统能够推理、调用工具、执行代码、与环境交互并完成长期任务。我们从三个方面总结相关工作:智能体基础模型与基准、智能体后训练与强化学习,以及高效且安全的部署。 ### 2.1 智能体基础模型与基准 早期的语言智能体工作表明,LLM 可以通过外部工具和环境行动,而不仅仅是生成文本。ReAct[69](https://arxiv.org/html/2607.09375#bib.bib31) 将推理和行动交错进行,而 Toolformer[52](https://arxiv.org/html/2607.09375#bib.bib29)、Gorilla[45](https://arxiv.org/html/2607.09375#bib.bib33)、ToolBench[47](https://arxiv.org/html/2607.09375#bib.bib34) 和 API-Bank[30](https://arxiv.org/html/2607.09375#bib.bib35) 研究了工具学习、API 选择以及工具增强的指令遵循。这些工作建立了选择工具、生成参数、观察结果和继续推理的基本智能体循环。 最近的技术报告进一步将基础模型框架化为智能体系统。Kimi K2[28](https://arxiv.org/html/2607.09375#bib.bib36) 强调开放的智能体智能,具有强大的推理、编码和工具使用能力。GLM-5[13](https://arxiv.org/html/2607.09375#bib.bib13) 描述了从“氛围编码”到智能体工程的转变,目标是复杂的软件工程和长期工作流。Step-3.5-Flash[19](https://arxiv.org/html/2607.09375#bib.bib37) 和 MiMo-V2-Flash[63](https://arxiv.org/html/2607.09375#bib.bib39) 强调了用于低成本智能体部署的高效稀疏激活,而 Qwen3-Coder-Next[5](https://arxiv.org/html/2607.09375#bib.bib38) 则专注于使用可执行环境训练的编码智能体。 与此同时,智能体基准也在从静态问答转向现实任务完成:BFCL[44](https://arxiv.org/html/2607.09375#bib.bib42) 评估函数调用,τ-bench[68](https://arxiv.org/html/2607.09375#bib.bib44) 评估工具-智能体-用户交互,ToolSandbox[35](https://arxiv.org/html/2607.09375#bib.bib45) 研究有状态工具使用,SWE-bench[25](https://arxiv.org/html/2607.09375#bib.bib46) 评估真实的软件问题解决。这些工作表明,智能体模型应根据任务成功、工具可靠性和长期执行来评判,而不仅仅是最终答案的准确性。 ### 2.2 智能体后训练与强化学习 Post-training 已成为模型能力的主要驱动力。InstructGPT[41](https://arxiv.org/html/2607.09375#bib.bib28) 确立了 SFT 和 RLHF 在指令遵循方面的有效性。最近的推理模型表明,强化学习可以进一步引发长链推理和自我改进。DeepSeek-R1[16](https://arxiv.org/html/2607.09375#bib.bib5) 证明了 RL 可以诱导长链思维推理、验证和自我反思。Kimi k1.5[27](https://arxiv.org/html/2607.09375#bib.bib49)、DAPO[71](https://arxiv.org/html/2607.09375#bib.bib18) 和 Skywork-OR1[17](https://arxiv.org/html/2607.09375#bib.bib50) 进一步探索了可扩展的 RL 配方、基于规则的奖励和稳定的大规模优化。 对于智能体任务,后训练必须处理多轮交互、延迟反馈、稀疏奖励和错误恢复。用于工具调用智能体的多轮 RL[37](https://arxiv.org/html/2607.09375#bib.bib51) 研究了中间工具行动的奖励校准,而长上下文软件工程智能体训练[15](https://arxiv.org/html/2607.09375#bib.bib52) 则显示了交互式 RL 在仓库级任务中的价值。此外,偏好优化方法如 DPO[49](https://arxiv.org/html/2607.09375#bib.bib53)、ORPO[18](https://arxiv.org/html/2607.09375#bib.bib56)、SimPO[36](https://arxiv.org/html/2607.09375#bib.bib57) 和多目标 DPO[81](https://arxiv.org/html/2607.09375#bib.bib58) 为使用偏好信号对齐模型提供了实用替代方案。这些方法与 OPD/MOPD 式训练密切相关,其中多个目标(如任务成功、工具效率、令牌成本和安全)必须共同优化,而不是合并为单一奖励。 ### 2.3 高效且安全的智能体部署 生产级智能体不仅需要强大的推理能力,还需要高效且安全的执行。智能体工作流通常包含工具模式、检索到的文档、执行轨迹、对话历史和中间观察结果,这使得长上下文推理和预填充成本成为主要瓶颈。提示压缩方法如 LLMLingua[23](https://arxiv.org/html/2607.09375#bib.bib64)、LongLLMLingua[24](https://arxiv.org/html/2607.09375#bib.bib65) 和 LLMLingua-2[42](https://arxiv.org/html/2607.09375#bib.bib66) 在保留任务相关信息的同时减少了令牌使用。DeepSeek-V4[11](https://arxiv.org/html/2607.09375#bib.bib40) 针对百万令牌上下文效率,MiniMax-M1[7](https://arxiv.org/html/2607.09375#bib.bib68) 使用闪电注意力来扩展测试时计算。在服务层面,vLLM[29](https://arxiv.org/html/2607.09375#bib.bib69)、DistServe[78](https://arxiv.org/html/2607.09375#bib.bib70) 和多令牌预测[14](https://arxiv.org/html/2607.09375#bib.bib73) 改进了 KV 缓存管理、预填充/解码效率和解码速度。 安全同样重要,因为智能体可以执行操作而不仅仅是输出文本。Constitutional AI[1](https://arxiv.org/html/2607.09375#bib.bib22) 和 Rule-Based Rewards[38](https://arxiv.org/html/2607.09375#bib.bib61) 提供了基于原则和基于规则的校准机制,而 Llama Guard[20](https://arxiv.org/html/2607.09375#bib.bib62) 支持安全分类。对于已部署的智能体,安全必须涵盖内容安全性和行为安全性,包括模型是否适当地调用工具、遵守约束以及避免不安全操作。因此,实用的智能体系统需要对能力、延迟、令牌成本和安全性进行联合优化。 ## 3 基础设施 为了提升大语言模型(LLM)在后训练阶段(包括强化学习(RL)和知识蒸馏)的训练效率和系统灵活性,我们对现有的成熟 RL 训练框架进行了系统性升级。我们提出了一种统一的 RL 和在线策略蒸馏(OPD)联合训练范式,并在此基础上构建了动态多教师可扩展架构。此外,我们从系统框架层面和底层算子层面两个维度进行了深入的训练加速和优化。核心技术创新详述如下:参见标题图 2:RL 和 OPD 的统一训练框架。 ### 3.1 基于强化学习框架的统一 OPD 训练范式 传统的知识蒸馏通常独立于 RL 训练流程,难以充分利用 RL 框架在分布式调度、经验采样和策略优化方面的系统优势。为此,我们将 OPD 深度集成到 RL 框架中,构建统一的联合训练范式。具体框架如图 2 所示。此部分
相似文章
@VukRosic99: 理想汽车的Mach-Mind-4-Flash:一个仅有3B活跃参数的35B MoE模型,仅通过后训练就能匹配100B级别的模型……
理想汽车的Mach-Mind-4-Flash是一个拥有3B活跃参数的35B MoE模型,通过使用统一的强化学习/在线策略蒸馏损失进行后训练优化,在多个基准测试中达到了匹配或超越100B参数模型的性能。
Nemotron 3 Ultra:用于智能体推理的高效开源混合专家Mamba-Transformer模型
Nemotron 3 Ultra 是一个550B参数的混合Mamba-Attention专家混合语言模型,在20T tokens上预训练,扩展至1M上下文,并通过SFT、RL和MOPD进行后训练。相比同等精度的一流LLM,其推理吞吐量最高可提升6倍,并已开源。
扩展视野而非参数:以35B智能体达到万亿参数性能
介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。
deepseek-ai/DeepSeek-V4-Flash-DSpark
DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。