cMoLLM 规模化:混合大语言模型的水平扩展定律

arXiv cs.AI 论文

摘要

介绍了 cMoLLM,一种卷积门控混合大语言模型,通过完全可微的动态卷积在端到端流中进行路由,在匹配计算下提高了困惑度和下游任务准确率。

arXiv:2607.22577v1 通知类型:新 摘要:扩展大型语言模型(LLM)推动了其成功,但密集 Transformer 将容量和计算耦合在一起:每个参数对每个令牌都被激活,这使得训练和推理成本随模型大小线性增长——当模型接近万亿参数规模时,这成为关键瓶颈。我们的目标是通过 MoE 式混合来扩展整个 LLM 管道中的容量,而不仅仅是 FFN。先前的管道级方法包括 ParaScale(引入虚拟令牌和并行流,但产生大量开销,并遭受同质化路由和梯度崩溃)和 AltUp(使用辅助预测分支,但适应性有限且收敛缓慢)。我们证明了 MoE 式混合层可以重新表述为变核动态卷积,其中每个专家对应一个 $1{\times}1$ 卷积核,路由实现输入条件化的核聚合。基于这一等价性,我们引入了 cMoLLM:一种卷积门控混合大语言模型,通过完全可微的动态卷积在端到端流中进行路由。在 FineWeb 上训练的 GPT-2 风格模型中,cMoLLM 在匹配计算下提高了语言建模困惑度以及下游 GLUE 和 SQuAD 准确率,与 ParaScale 和 AltUp 风格的基线相比,具有更好的流利用率、更稳定的优化以及有利的扩展性。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:25

# 卷积门控混合大语言模型的水平缩放法则
来源:https://arxiv.org/html/2607.22577  
Yemin Wang、Mingda Liu、Letian Li、Shuaishuai Cao、Zhengxiao He、Ryan Dong  

###### 摘要  
缩放大型语言模型(LLM)推动了其成功,但密集Transformer将容量与计算耦合:每个参数对每个Token都会被激活,使得训练和推理成本随模型大小线性增长——这是模型逼近万亿参数规模时的关键瓶颈。我们的目标是通过在整个LLM流程(而非仅FFN)中采用MoE风格的混合来缩放容量。先前的流程级方法包括ParaScale (Chen et al., 2025 (https://arxiv.org/html/2607.22577#bib.bib10)),它引入虚拟Token和并行流,但带来了大量开销,且面临路由同质化和梯度崩溃问题;以及AltUp (Baykal et al., 2023 (https://arxiv.org/html/2607.22577#bib.bib11)),它使用辅助预测分支,但适应性有限且收敛缓慢。我们建立了MoE风格混合层可以重新表述为可变核动态卷积,其中每个专家对应一个1×1卷积核,路由实现输入条件化的核聚合。基于这一等价性,我们引入了cMoLLM:一种卷积门控混合大语言模型,通过完全可微的动态卷积在端到端流上进行路由。在基于FineWeb训练的GPT-2风格模型中,cMoLLM在匹配计算量下改善了语言建模困惑度以及下游GLUE和SQuAD准确率,具有更好的流利用率、更稳定的优化,以及相对于ParaScale和AltUp风格基线更优的缩放性能。  
混合大语言模型、流程级缩放、动态卷积、卷积门控路由、大语言模型  

参见图注  
图1:cMoLLM的预告。cMoLLM通过端到端流上的卷积门控混合在流程级缩放容量,在匹配计算量下相比密集基线获得更好的困惑度和下游准确率,无需虚拟Token或辅助头。  

表1:流程级容量缩放方法的系统性定性比较:ParaScale、AltUp和cMoLLM。  

## 1 引言  
大语言模型(LLM)的巨大成功 (OpenAI, 2025 (https://arxiv.org/html/2607.22577#bib.bib42); Anthropic, 2025 (https://arxiv.org/html/2607.22577#bib.bib41); Yang et al., 2025 (https://arxiv.org/html/2607.22577#bib.bib43)) 与规模密切相关:增加模型容量持续提升各种任务的性能 (Radford et al., 2019 (https://arxiv.org/html/2607.22577#bib.bib26); Brown et al., 2020 (https://arxiv.org/html/2607.22577#bib.bib27); Kaplan et al., 2020 (https://arxiv.org/html/2607.22577#bib.bib1); Hoffmann et al., 2022 (https://arxiv.org/html/2607.22577#bib.bib2); Yang et al., 2026 (https://arxiv.org/html/2607.22577#bib.bib40); Cheng et al., 2025 (https://arxiv.org/html/2607.22577#bib.bib39))。训练和推理成本大致随模型大小线性增长,因为每个参数对每个Token都会被激活。当模型逼近万亿参数规模时,这种线性计算–容量耦合已成为主要瓶颈,激励我们探索更具参数效率的容量扩展方式。一个自然的方向是采用混合专家(MoE)风格的方法来缩放容量:将Token路由到多个子模型并组合其输出。大多数先前的MoE工作仅将其应用于前馈网络(FFN):专家是FFN块,路由通常是离散的(例如Top-K),导致专家崩溃、利用率不均和训练不稳定 (Shazeer et al., 2017 (https://arxiv.org/html/2607.22577#bib.bib5); Fedus et al., 2022 (https://arxiv.org/html/2607.22577#bib.bib6))。我们转而追求流程级混合:在整个LLM流程(或流式子模型)上进行路由,而非仅限FFN专家。有两项工作直接相关。  
AltUp (Baykal et al., 2023 (https://arxiv.org/html/2607.22577#bib.bib11)) 拓宽Token表示,并使用虚拟预测分支更新非活跃块;它以较小的参数开销增加有效容量,但依赖于固定、手工设计的结构,不具备完全自适应性,且通常收敛缓慢。ParaScale (Chen et al., 2025 (https://arxiv.org/html/2607.22577#bib.bib10)) 通过并行虚拟Token流缩放容量,但增加了序列长度从而增大了计算量;此外,路由可能在流间同质化,导致梯度崩溃和训练不稳定。我们寻求一种新的流程级缩放机制,保留子模型间MoE风格路由的直觉,同时避免虚拟Token、辅助预测头以及上述陷阱。我们的出发点是一个理论洞见:MoE风格混合层可以精确地重写为具有输入依赖(可变)核的动态卷积。形式上,每个专家对应一个1×1卷积核;路由器执行这些核的输入依赖混合(定理4.1 (https://arxiv.org/html/2607.22577#S4.Thmtheorem1))。这建立了MoE与动态卷积的等价性,并为分析稀疏条件计算提供了统一视角。然后我们近似这一理想情况:每个“流”使用不同的卷积核,我们通过软性、完全可微的门控来混合流——无需Top-K,无需低秩分解。基于此,我们提出cMoLLM:一种卷积门控混合大语言模型,将条件计算应用于整个Transformer流程(图1 (https://arxiv.org/html/2607.22577#S0.F1))。我们维护一小组端到端“流”,每个流关联自己的1×1核;一个轻量级门控网络产生输入依赖的混合权重,混合后的核通过标准(分组)逐点卷积应用。所有流通过稳定、完全可微的动态卷积组合——无需虚拟Token、辅助头、Top-K或低秩——从而利用硬件友好的卷积原语实现参数高效的流程级容量缩放。我们的贡献如下:  
- **理论**:我们建立了MoE风格混合层与可变核动态卷积之间的形式等价性(定理4.1 (https://arxiv.org/html/2607.22577#S4.Thmtheorem1))。这为分析和设计稀疏条件计算模型提供了一个统一的理论框架,超越了FFN级MoE。  
- **方法**:我们引入cMoLLM,一种流程级卷积门控混合,其核共享和流结构直接源于卷积视角。它在没有虚拟Token、辅助预测分支、Top-K路由或低秩分解的情况下实现了参数高效的缩放和训练稳定性。  
- **实证**:在基于FineWeb训练的GPT-2风格模型上,cMoLLM在可比成本下匹配或优于密集基线的困惑度、GLUE和SQuAD表现,具有更好的流利用率、更稳定的训练动态,以及相对于ParaScale和AltUp风格流程混合更优的缩放性能(参见第5.3节 (https://arxiv.org/html/2607.22577#S5.SS3))。  

参见图注  
图2:架构(图2)。cMoLLM块:输入X通过门控网络产生软混合权重{g_k};每个流有一个1×1核K_k;有效核K̃(x)=∑_k g_k(x) K_k通过分组1×1卷积应用。无虚拟Token、无Top-K、无辅助头。  

## 2 相关工作  
混合专家与流程级缩放。经典MoE方法 (Shazeer et al., 2017 (https://arxiv.org/html/2607.22577#bib.bib5); Fedus et al., 2022 (https://arxiv.org/html/2607.22577#bib.bib6); Lepikhin et al., 2021 (https://arxiv.org/html/2607.22577#bib.bib7)) 通过Top-K路由稀疏化前馈网络(FFN)层,每个Token被路由到稀疏的专家FFN块子集。大规模MoE系统如GLaM (Du et al., 2022 (https://arxiv.org/html/2607.22577#bib.bib14))、BASE Layers (Lewis et al., 2021 (https://arxiv.org/html/2607.22577#bib.bib13))、DeepSpeed-MoE (Rajbhandari et al., 2022 (https://arxiv.org/html/2607.22577#bib.bib15)) 和Vision MoE模型 (Riquelme et al., 2021 (https://arxiv.org/html/2607.22577#bib.bib33)) 主要关注FFN级稀疏性和训练推理的系统级优化。相比之下,我们针对整个LLM流的流程级混合,利用MoE–动态卷积等价性(第4.1节 (https://arxiv.org/html/2607.22577#S4.SS1))设计无需Top-K截断的卷积门控路由。最直接相关的先前工作包括ParaScale (Chen et al., 2025 (https://arxiv.org/html/2607.22577#bib.bib10)),它通过并行虚拟Token流缩放容量但增加计算量并遭受梯度崩溃;以及AltUp (Baykal et al., 2023 (https://arxiv.org/html/2607.22577#bib.bib11)),它使用手工设计的辅助预测分支但收敛缓慢。表1 (https://arxiv.org/html/2607.22577#S0.T1) 提供了系统性比较;cMoLLM避免了虚拟Token和辅助头,使用完全可微的动态卷积实现稳定、参数高效的缩放。  

动态卷积与条件计算。动态卷积 (Jia et al., 2016 (https://arxiv.org/html/2607.22577#bib.bib19); Yang et al., 2019 (https://arxiv.org/html/2607.22577#bib.bib16); Chen et al., 2020 (https://arxiv.org/html/2607.22577#bib.bib20); Wu et al., 2019 (https://arxiv.org/html/2607.22577#bib.bib17); Ma et al., 2020 (https://arxiv.org/html/2607.22577#bib.bib18); Zhang et al., 2020 (https://arxiv.org/html/2607.22577#bib.bib38)) 根据输入自适应卷积核,通常用于CNN主干或序列模型中。更广泛地,条件计算和路由网络 (Bengio et al., 2013 (https://arxiv.org/html/2607.22577#bib.bib21); Rosenbaum et al., 2018 (https://arxiv.org/html/2607.22577#bib.bib22); McGill and Perona, 2017 (https://arxiv.org/html/2607.22577#bib.bib37)) 学习根据输入选择计算路径。我们的关键理论贡献是建立了MoE风格混合层与可变核动态卷积之间的形式等价性(定理4.1 (https://arxiv.org/html/2607.22577#S4.Thmtheorem1)),这使我们能够设计一个流程级、卷积门控的LLM流混合,具备显式概率路由和负载均衡目标。  

参数高效方法与综述。参数高效微调方法如适配器 (Houlsby et al., 2019 (https://arxiv.org/html/2607.22577#bib.bib24)) 和LoRA (Hu et al., 2022 (https://arxiv.org/html/2607.22577#bib.bib23)) 在冻结主干上添加或重新参数化一小部分可训练权重,主要针对高效微调。cMoLLM则修改预训练架构以改善容量–计算权衡;这些方法是互补的,原则上可以结合。关于MoE模型及其在LLM及其他领域的应用的全面综述由Cai等人 (2025 (https://arxiv.org/html/2607.22577#bib.bib34))、Mu and Lin (2025 (https://arxiv.org/html/2607.22577#bib.bib36))、Liu等人 (2026 (https://arxiv.org/html/2607.22577#bib.bib35)) 提供,他们定位了我们在更广泛MoE格局中的贡献。  

## 3 预备知识  
我们首先介绍全文使用的符号,并简要回顾支撑我们表述的核心概念。  

### 3.1 符号与假设  
我们用粗体小写字母 (例如 x) 表示向量,粗体大写字母 (例如 W) 表示矩阵,手写体字母 (例如 S) 表示集合。Transformer的隐藏维度为 d,中间FFN维度为 d_ff,序列长度为 L,专家/流的数量为 N。对于 X∈R^{L×d},第 i 个Token记为 x_i。全文我们做出以下温和假设。  

###### 假设 3.1 (有界输入)  
存在 R>0 使得对于训练和评估中遇到的所有Token表示 x,有 ‖x‖₂ ≤ R。  

###### 假设 3.2 (Lipschitz非线性)  
激活函数 σ 是 L_σ-Lipschitz 的,且满足 σ(0)=0 (例如 ReLU 或 GELU)。  

这些条件在深度网络和MoE架构的理论分析中是标准的,它们足以建立本文的复杂性和稳定性结果。  

### 3.2 Transformer前馈网络  
标准Transformer FFN应用两个线性投影和一个非线性 (Vaswani et al., 2017 (https://arxiv.org/html/2607.22577#bib.bib25)):  
FFN(x) = W₂ σ(W₁ x + b₁) + b₂,  (1)  
其中 x∈R^d 是输入Token表示,W₁∈R^{d_ff×d},W₂∈R^{d×d_ff},σ 通常是GELU或ReLU。FFN独立应用于每个Token。  

### 3.3 混合专家层  
MoE层用一个由 N 个专家 {E_k}_{k=1}^N 和一个门控函数 G 组成的集合替换单个前馈网络,门控函数将每个输入路由到专家子集 (Shazeer et al., 2017 (https://arxiv.org/html/2607.22577#bib.bib5)):  
MoE(x) = ∑_{k=1}^N g_k(x) E_k(x),  (2)  
其中 g(x)∈R^N 表示门控产生的路由权重。实践中,g(x) 的只有 top-K 项非零,实现稀疏计算。每个专家 E_k 通常是具有自己参数的双层FFN。  

### 3.4 作为线性变换的逐点卷积  
逐点 (1×1) 卷积在Token位置之间应用相同的线性映射。给定输入序列 X∈R^{L×d_in} 和核 K∈R^{d_out×d_in},操作为:  
Conv_{1×1}(X;K) = X K^⊤,  (3)  
这对应于从 R^{d_in} 到 R^{d_out} 的相同逐Token线性投影。此观察是我们后续分析的关键构建块。  

## 4 方法:cMoLLM  
我们现在呈现主要理论结果和cMoLLM架构。  

### 4.1 MoE作为动态卷积:形式等价性  
我们展示MoE层具有等价于动态逐点卷积的解释。在本小节中,我们专注于线性专家和路由器的结构;非线性专家的扩展在附录A (https://arxiv.org/html/2607.22577#A1) 中讨论,并在推论4.2 (https://arxiv.org/html/2607.22577#S4.Thmtheorem2) 中总结。  

###### 定理 4.1 (MoE–动态卷积等价性)  
令 x∈R^d 表示一个Token表示。考虑一个具有 N 个线性专家 E_k(x)=xW_k^⊤ 的MoE层,其中 W_k∈R^{d_out×d},路由权重 {g_k(x)}_{k=1}^N 满足 ∑_{k=1}^N g_k(x)=1

相似文章

水平扩展LLM:无需权重修改的隐藏状态耦合 [R]

Reddit r/MachineLearning

残差耦合(RC)使用轻量级学习线性桥接器并行连接冻结的语言模型,实现无需权重修改的水平扩展。与MoE相比,它最多可将困惑度降低80.7%,并在TruthfulQA上提升9.1个百分点的准确率。

LLaDA MoE v2:扩展混合专家扩散语言模型

Hugging Face Daily Papers

一篇研究论文,提出了混合专家扩散语言模型的扩展定律和设计原则,并以 LLaDA MoE v2(30B-A3B)在 23.5T token 上进行训练,在多个基准测试上以更少的预训练 token 接近 Qwen3。

LLMs 现在变得复杂了

Hacker News Top

文章讨论了LLMs如何变得越来越复杂,从简单的Transformer堆栈演变为融入多种注意力变体、混合专家模型和多模态编码器,与推荐系统进行了类比,并强调了像FlexAttention这样可组合内核优化的必要性。

dMoE: 具有可学习块专家的扩散大语言模型

arXiv cs.CL

dMoE 提出了用于扩散大语言模型的块级专家路由,将唯一激活的专家数量从 69.5 降至 14.6,同时保留了 99.11% 的性能,并实现了 76-80% 的内存减少和 1.14-1.66 倍的加速。