@sheriyuo: 仅3B活跃参数的35B参数MoE代理模型,声称通过后训练即可匹配或超越100B级模型

X AI KOLs Timeline 模型

摘要

一个35B参数的MoE模型,仅3B活跃参数,通过后训练强化学习匹配或超越100B级模型,实现显著效率提升。

一个35B参数的MoE代理模型,仅3B活跃参数,声称仅通过后训练(无需额外预训练计算)即可匹配或超越100B级模型,其方法基于可扩展的代理强化学习环境和统一的RL/OPD训练栈,并采用动态多教师调度(训练加速17%)。 Mach-Mind-4-Flash技术报告 论文:http://arxiv.org/abs/2607.09375
查看原文
查看缓存全文

缓存时间: 2026/07/13 09:51

一个仅3B激活参数的35B MoE智能体模型,声称仅通过后训练(无额外预训练计算)即可达到或超越100B级别模型,依托可扩展的智能体RL环境以及统一的RL/OPD训练栈与动态多教师调度(训练速度提升17%)。

Mach-Mind-4-Flash 技术报告 论文:http://arxiv.org/abs/2607.09375


Mach-Mind-4-Flash 技术报告

来源:https://arxiv.org/html/2607.09375

摘要

我们提出 Mach-Mind-4-Flash,一个35B参数的混合专家(MoE)智能体模型,仅有3B激活参数。通过纯粹的后训练优化——不增加预训练计算量——该模型在性能上达到甚至超越了100B参数级别模型。通过引入可扩展的智能体交互环境以进行大规模强化学习,该模型在真实应用任务上取得了显著性能提升。我们的流水线包含三个阶段:(1) 统一的RL/OPD训练基础设施,配备动态多教师调度和算子级加速,实现17%的端到端训练加速;(2) 在推理、通用和智能体三大轨道上并行训练多个领域特定的RL专家,然后通过多教师在线策略蒸馏(MOPD)融合成一个通用模型——MOPD采用路由反向KL目标,消除了混合奖励RL中常见的跷跷板式性能退化;(3) 混合中长策略优化(HMPO),一种单阶段token效率方法,可将推理链压缩19–46%,同时精度损失≤0.7个百分点。Mach-Mind-4-Flash 在 AIME’26 上得分为92.70,IFBench 82.82,Behavioral-SafetyBench 80.74,BFCL-v4 75.80,BrowseComp-zh 72.31,ClawBench 84.20——在其激活规模10–30倍的模型面前保持领先或持平,而推理成本仅为后者的几分之一。

参见图1:Mach-Mind-4-Flash 在多种能力维度上达到或超越更大的模型。仅3B激活参数,Mach-Mind-4-Flash 在 IFBench、Behavioral-SafetyBench 和 BrowseComp-zh 上领先,同时在推理、工具使用和智能体编程方面与激活规模3–30倍于自身的模型保持竞争力。

目录
  1. 1 引言 (https://arxiv.org/html/2607.09375#S1)
  2. 2 相关工作 (https://arxiv.org/html/2607.09375#S2)1. 2.1 智能体基础模型与基准 (https://arxiv.org/html/2607.09375#S2.SS1) 2. 2.2 智能体后训练与强化学习 (https://arxiv.org/html/2607.09375#S2.SS2) 3. 2.3 高效且安全的智能体部署 (https://arxiv.org/html/2607.09375#S2.SS3)
  3. 3 基础设施 (https://arxiv.org/html/2607.09375#S3)1. 3.1 基于RL框架的统一OPD训练范式 (https://arxiv.org/html/2607.09375#S3.SS1) 2. 3.2 动态多教师可扩展架构 (https://arxiv.org/html/2607.09375#S3.SS2) 3. 3.3 训练加速与极致优化 (https://arxiv.org/html/2607.09375#S3.SS3)
  4. 4 后训练 (https://arxiv.org/html/2607.09375#S4)1. 4.1 监督微调 (https://arxiv.org/html/2607.09375#S4.SS1) 2. 4.2 推理与通用RL (https://arxiv.org/html/2607.09375#S4.SS2) 3. 4.3 安全RL (https://arxiv.org/html/2607.09375#S4.SS3) 4. 4.4 工具使用RL (https://arxiv.org/html/2607.09375#S4.SS4) 5. 4.5 DeepSearch RL (https://arxiv.org/html/2607.09375#S4.SS5) 6. 4.6 代码智能体RL (https://arxiv.org/html/2607.09375#S4.SS6) 7. 4.7 Claw 智能体RL (https://arxiv.org/html/2607.09375#S4.SS7) 8. 4.8 多教师在线策略蒸馏 (MOPD) (https://arxiv.org/html/2607.09375#S4.SS8) 9. 4.9 混合中长策略优化 (HMPO) (https://arxiv.org/html/2607.09375#S4.SS9)
  5. 5 实验结果 (https://arxiv.org/html/2607.09375#S5)1. 5.1 总体结果 (https://arxiv.org/html/2607.09375#S5.SS1) 2. 5.2 专家训练与MOPD融合的效果 (https://arxiv.org/html/2607.09375#S5.SS2) 3. 5.3 Token高效 (HMPO) (https://arxiv.org/html/2607.09375#S5.SS3)
  6. 6 局限性与未来工作 (https://arxiv.org/html/2607.09375#S6)
  7. 7 贡献 (https://arxiv.org/html/2607.09375#S7)
  8. 参考文献 (https://arxiv.org/html/2607.09375#bib)
  9. 附录 (https://arxiv.org/html/2607.09375#Ax1)
  10. A 基础设施算子加速 (https://arxiv.org/html/2607.09375#A1)
  11. B MOPD目标推导 (https://arxiv.org/html/2607.09375#A2)
  12. C MOPD中推理专家的消融实验 (https://arxiv.org/html/2607.09375#A3)

1 引言

扩展语言模型规模一直是实现能力提升的主流方法,但随之而来的推理成本使得万亿参数模型在延迟敏感的部署场景中不切实际。一种新兴的替代方案是扩展 后训练 流水线,通过强化学习、专家融合和推理时效率优化,将紧凑的基础模型推向前沿性能,而非仅仅依赖预训练计算量的增加。Mach-Mind-4-Flash 正是我们在此方向上的贡献:一个35B MoE模型(3B激活参数),其后训练栈使其性能提升至激活参数规模10–30倍的模型所处的水平。以下三大技术支柱支撑了这一成果:

(1) 具备算子级加速的可扩展训练基础设施。

后训练一个通用模型需要协调多个RL专家轨道、一个多教师蒸馏阶段和一个token效率阶段,所有这些共享同一个分布式基础设施。我们构建了一个统一的强化学习/在线策略蒸馏(RL/OPD)训练范式,通过单一加权损失,可以在纯RL、纯蒸馏以及混合模式之间无缝切换。在此基础上,我们设计了一种动态多教师架构,添加新专家无需对训练核心进行任何侵入式修改。在算子层面,我们深度融合了 SonicMoE 索引分组通用矩阵乘法(GEMM)核和分段共享专家融合策略,使通信与计算重叠,在 Qwen3.5-35B-A3B 的训练中实现了高达17%的端到端加速。

(2) 先专精后融合:多位专家,一个通才。

与其在异构奖励混合上训练单个模型——这不可避免地会导致能力跷跷板效应——我们独立训练了多个RL专家,覆盖三大轨道:推理(数学、代码、STEM)、通用(指令遵循、写作、安全)和智能体(工具使用、DeepSearch、代码智能体、Claw智能体)。每个专家都通过领域适配的数据合成、可验证的奖励信号以及量身定制的训练策略(例如,针对稀疏结果领域的双阶段奖励课程表,针对智能体领域的可执行多轮环境)进行优化。随后,这些专家通过多教师在线策略蒸馏(MOPD)进行整合。MOPD将每个训练样本路由到其对应的冻结教师,并通过token级别的反向KL目标,在学生自身生成的rollout上监督学生。这种设计并行化了专家开发,消除了顺序依赖,并产生了一个统一模型,该模型保留了甚至偶尔超越了单个专家的性能。

(3) 不牺牲精度的Token效率。

强大的推理模型倾向于过度思考,产生冗长的推理链,从而增加服务成本却没有相应的精度提升。我们通过 HMPO(混合中长策略优化)解决了这一问题,这是一种单阶段RL方法,作为流水线的最后一步应用。HMPO从正确rollout的中位数推导出组自适应长度预算,并应用乘性的正确优先奖励,从数学上防止对短而错误的输出进行奖励欺骗。仅在数学上训练后,这种压缩效果泛化到代码、科学和指令遵循任务,将生成长度减少19–46%,精度损失最多0.7个百分点。

结果。

最终模型 Mach-Mind-4-Flash 证明了激进的后训练可以缩小紧凑型35B MoE与规模大得多的前沿模型之间的差距。在竞赛数学(AIME’26: 92.70)、代码生成(LiveCodeBench-V6: 80.91)、指令遵循(IFEval: 94.64; IFBench: 82.82)、安全(Content-SafetyBench: 98.20; Behavioral-SafetyBench: 80.74)以及自主智能体任务(ClawBench: 84.20; BFCL-v4: 75.80)上,Mach-Mind-4-Flash 始终达到或超越120B级别的模型,并且与万亿参数系统保持竞争力——而推理时仅需3B激活参数。我们发布此技术报告,以详细阐述训练方法、基础设施创新和评估结果。

2 相关工作

近期的大语言模型正从通用聊天助手向面向生产的智能体系统转变,这些系统能够进行推理、调用工具、执行代码、与环境交互并完成长周期任务。我们从三个方面总结相关工作:智能体基础模型和基准、智能体后训练和强化学习,以及高效安全的部署。

2.1 智能体基础模型与基准

早期的语言智能体工作表明,LLM不仅能够生成文本,还能通过外部工具和环境采取行动。ReAct [69 (https://arxiv.org/html/2607.09375#bib.bib31)] 将推理和行动交织在一起,而 Toolformer [52 (https://arxiv.org/html/2607.09375#bib.bib29)]、Gorilla [45 (https://arxiv.org/html/2607.09375#bib.bib33)]、ToolBench [47 (https://arxiv.org/html/2607.09375#bib.bib34)] 和 API-Bank [30 (https://arxiv.org/html/2607.09375#bib.bib35)] 则研究了工具学习、API选择和工具增强的指令遵循。这些工作建立了基本的智能体循环:选择工具、生成参数、观察结果并继续推理。

近期的技术报告进一步将基础模型框定为智能体系统。Kimi K2 [28 (https://arxiv.org/html/2607.09375#bib.bib36)] 强调具有强推理、编码和工具使用能力的开放智能体智能。GLM-5 [13 (https://arxiv.org/html/2607.09375#bib.bib13)] 描述了从“氛围编码”到智能体工程的转变,目标指向复杂的软件工程和长周期工作流。Step-3.5-Flash [19 (https://arxiv.org/html/2607.09375#bib.bib37)] 和 MiMo-V2-Flash [63 (https://arxiv.org/html/2607.09375#bib.bib39)] 强调了用于低成本智能体部署的高效稀疏激活,而 Qwen3-Coder-Next [5 (https://arxiv.org/html/2607.09375#bib.bib38)] 则专注于使用可执行环境训练的编码智能体。与此同时,智能体基准也在从静态问答转向现实任务完成:BFCL [44 (https://arxiv.org/html/2607.09375#bib.bib42)] 评估函数调用,τ-bench [68 (https://arxiv.org/html/2607.09375#bib.bib44)] 评估工具-智能体-用户交互,ToolSandbox [35 (https://arxiv.org/html/2607.09375#bib.bib45)] 研究有状态工具使用,SWE-bench [25 (https://arxiv.org/html/2607.09375#bib.bib46)] 评估真实软件问题的解决。这些工作表明,智能体模型应根据任务成功率、工具可靠性和长周期执行能力来评判,而非仅关注最终答案的准确性。

2.2 智能体后训练与强化学习

后训练已成为模型能力的主要驱动力。InstructGPT [41 (https://arxiv.org/html/2607.09375#bib.bib28)] 确立了 SFT 和 RLHF 对于指令遵循的有效性。更近期的推理模型表明,强化学习可以进一步引出长链推理和自我改进。DeepSeek-R1 [16 (https://arxiv.org/html/2607.09375#bib.bib5)] 证明了 RL 可以诱导长思维链推理、验证和自我反思。Kimi k1.5 [27 (https://arxiv.org/html/2607.09375#bib.bib49)]、DAPO [71 (https://arxiv.org/html/2607.09375#bib.bib18)] 和 Skywork-OR1 [17 (https://arxiv.org/html/2607.09375#bib.bib50)] 进一步探索了可扩展的 RL 配方、基于规则的奖励以及稳定的大规模优化。

对于智能体任务,后训练必须处理多轮交互、延迟反馈、稀疏奖励和错误恢复。用于工具调用智能体的多轮 RL [37 (https://arxiv.org/html/2607.09375#bib.bib51)] 研究了中间工具动作的奖励校准,而长上下文软件工程智能体训练 [15 (https://arxiv.org/html/2607.09375#bib.bib52)] 则展示了交互式 RL 在仓库级任务中的价值。此外,偏好优化方法如 DPO [49 (https://arxiv.org/html/2607.09375#bib.bib53)]、ORPO [18 (https://arxiv.org/html/2607.09375#bib.bib56)]、SimPO [36 (https://arxiv.org/html/2607.09375#bib.bib57)] 和多目标 DPO [81 (https://arxiv.org/html/2607.09375#bib.bib58)] 为将模型与偏好信号对齐提供了实用的替代方案。这些方法与 OPD/MOPD 风格训练密切相关,其中多个目标(如任务成功、工具效率、token成本和安全性)需要联合优化,而不是被合并为单一奖励。

2.3 高效且安全的智能体部署

生产环境中的智能体不仅需要强大的推理能力,还需要高效安全的执行。智能体工作流通常包含工具模式、检索文档、执行轨迹、对话历史和中间观察结果,这使得长上下文推理和预填充成本成为主要瓶颈。提示压缩方法如 LLMLingua [23 (https://arxiv.org/html/2607.09375#bib.bib64)]、LongLLMLingua [24 (https://arxiv.org/html/2607.09375#bib.bib65)] 和 LLMLingua-2 [42 (https://arxiv.org/html/2607.09375#bib.bib66)] 在保留任务相关信息的同时减少了token使用。DeepSeek-V4 [11 (https://arxiv.org/html/2607.09375#bib.bib40)] 以百万token上下文效率为目标,MiniMax-M1 [7 (https://arxiv.org/html/2607.09375#bib.bib68)] 则使用闪电注意力来扩展测试时计算。在服务层面,vLLM [29 (https://arxiv.org/html/2607.09375#bib.bib69)]、DistServe [78 (https://arxiv.org/html/2607.09375#bib.bib70)] 和多token预测 [14 (https://arxiv.org/html/2607.09375#bib.bib73)] 改善了 KV 缓存管理、预填充/解码效率和解码速度。

安全性同样重要,因为智能体可以执行行动而不仅仅是输出文本。Constitutional AI [1 (https://arxiv.org/html/2607.09375#bib.bib22)] 和基于规则的奖励 [38 (https://arxiv.org/html/2607.09375#bib.bib61)] 提供了基于原则和规则的对齐机制,而 Llama Guard [20 (https://arxiv.org/html/2607.09375#bib.bib62)] 则支持安全分类。对于已部署的智能体,安全性必须涵盖内容安全和行为安全,包括模型是否恰当调用工具、遵守约束以及避免不安全操作。因此,实用的智能体系统需要对能力、延迟、token成本和安全性进行联合优化。

3 基础设施

为了提升大语言模型(LLM)在后训练阶段(包括强化学习(RL)和知识蒸馏)的训练效率与系统灵活性,我们对现有成熟的RL训练框架进行了系统性升级。我们提出了一个RL与在线策略蒸馏(OPD)的统一联合训练范式,并在此基础上构建了动态多教师可扩展架构。此外,我们从系统框架层面和底层算子层面两个维度进行了深入的训练加速与优化。核心技术创新的详细说明如下:

参见图2:RL和OPD的统一训练框架。

3.1 基于RL框架的统一OPD训练范式

传统的知识蒸馏通常是

相似文章

Hy3(1分钟阅读)

TLDR AI

腾讯发布了 Hy3,这是一个 295B 参数的 MoE 模型,拥有 21B 活跃参数,性能超越同尺寸模型,并可媲美参数规模大 2 到 5 倍的开源旗舰模型。该模型采用 Apache 2.0 许可证,可在 Hugging Face 上获取,并在 OpenRouter 上免费使用至 7 月 21 日。

HY-3 预览版

Reddit r/LocalLLaMA

腾讯发布 2950 亿参数的 MoE 模型 Hy3-preview,激活参数 210 亿,在 STEM 推理、指令遵循、编程与智能体任务上表现卓越。