面向混合专家模型中一致专家选择的多层级上下文建模

arXiv cs.CL 论文

摘要

本文提出了多层级上下文融合MoE(MCF-MOE)框架,通过集成跨层语义聚合和局部词元级交互,提升了混合专家模型中的路由一致性,在语言建模和理解基准测试上优于强基线。

arXiv:2607.16427v1 Announce Type: new 摘要:混合专家模型(MoE)通过将词元路由到一小部分专家,实现了Transformer模型的高效扩展。然而,现有路由通常基于浅层或孤立的词元表示进行专家选择,这往往导致跨层的路由决策不稳定且语义不一致。本文从表示角度重新审视专家选择,并指出上下文不完整是限制专家有效专业化的关键瓶颈。为解决此问题,我们提出了多层级上下文融合MoE(MCF-MoE)框架,该框架通过整合跨层语义聚合和局部词元级交互的互补信号来构建上下文感知表示,从而实现更具信息量和一致性的专家选择。在语言建模和理解基准上的实验表明,MCF-MoE在路由一致性和下游性能上持续优于强MoE基线,凸显了专家路由中上下文完整性的重要性。代码可在 https://anonymous.4open.science/r/MCFMOE 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:42

# 多级上下文建模实现混合专家模型中一致的专家选择
来源:https://arxiv.org/html/2607.16427
Shuhan Huang¹ Yuanbo Tang¹ Naifan Zhang¹ Yang Li² Wai Kin Victor Chan¹  
¹清华大学深圳国际研究生院 ²香港中文大学(深圳)人工智能学院

###### 摘要

混合专家模型(MoE)通过将令牌路由到一小部分专家,实现了Transformer模型的高效扩展。然而,现有的路由机制通常基于浅层或孤立的令牌表示来选择专家,这往往导致跨层的路由决策不稳定且语义不一致。在这项工作中,我们从表示的角度重新审视专家选择,并指出上下文不完整是限制专家有效专业化的关键瓶颈。为解决这一问题,我们提出了多级上下文融合MoE(MCF-MOE)框架,该框架通过整合跨层语义聚合和局部令牌级交互的互补信号来构建上下文感知的表示,从而实现更信息丰富且一致的专家选择。在语言建模和理解基准上的实验表明,MCF-MOE在路由一致性和下游性能上持续优于强MoE基线,突出了上下文完整性在专家路由中的重要性。代码地址:https://anonymous.4open.science/r/MCFMOE

多级上下文建模实现混合专家模型中一致的专家选择

## 1 引言

扩展密集Transformer模型会迅速导致训练和推理成本过高(Wang et al., 2024)。混合专家模型(MoE)通过仅激活每个令牌的一小部分专家来缓解这一问题,从而实现更大的参数容量,并且在相似的计算预算下通常优于密集模型(Riquelme et al., 2021b;Csordás et al., 2024;Zhang et al., 2024)。

图1:代表性MoE路由器的路由一致性分析。现有路由器的跨层一致性较低,且语义路由行为不稳定。相比之下,MCF-MOE在这两个指标上均有显著提升,实现了更稳定且语义连贯的专家分配。
MoE模型的有效性在很大程度上取决于路由器,它决定了令牌如何分配给专家(Vats et al., 2024;Du et al., 2024;Riquelme et al., 2021a)。因此,改进路由策略已成为近年来的主要研究焦点(Yue et al., 2025;Pan et al., 2025)。

稀疏混合专家模型(SMOE)(Shazeer et al., 2017;Fedus et al., 2022)已成为一种广泛采用的路由范式,每个令牌仅激活一小部分专家。然而,过度的稀疏性可能导致表示崩溃,即专家输出变得过于相似或由少数专家主导(Chi et al., 2022;Do et al., 2025)。为解决这一问题,研究者提出了几种路由策略。例如,SMOE-Dropout(Chen et al., 2023)采用随机初始化的路由器进行动态专家激活。HyperRouter(Do et al., 2023)通过固定的超网络生成路由参数。RMOE(Qiu et al., 2025)引入基于GRU的记忆来建模跨层的专家激活。

最近的研究强调了在专家选择中保持路由一致性和有效利用上下文信息的重要性。Li等人(Li et al., 2024)证明更强的路由一致性显著提高了训练稳定性和专家利用率。同时,Arnold等人(Arnold et al., 2024)揭示专家选择对上下文语义高度敏感,突显了更丰富上下文感知路由信号的需求。

尽管有这些进展,现有的MoE模型仍然难以维持一致且语义连贯的专家专业化。如图1所示,我们测量了专家分配的全局跨层一致性和局部语义一致性。结果揭示了两点关键观察。首先,专家分配表现出极低的跨层一致性,表明底层表示缺乏足够的上下文完整性,无法跨层一致捕获语义信息。这导致专家利用率碎片化且专业化模式不稳定。其次,序列内的语义连贯性在不同架构上仍然有限且不一致,表明令牌表示通常无法编码专家行为连贯所需的细粒度上下文关系。这些观察表明,根本原因不仅仅在于选择机制本身,更根本在于表示上下文的缺失。

为解决这些局限,我们提出了多级上下文融合MoE(MCF-MOE),一个明确基于多级上下文证据建模专家选择的框架。与之前专注于改进决策机制(例如通过不确定性建模)的工作不同,我们的方法解决了一个根本不同的挑战:如何构建上下文完整的表示,以更好地支持一致且语义对齐的专家专业化。具体而言,MCF-MOE整合了两种互补的上下文信息源:(1)全局跨层语义对齐,它聚合跨层上下文信号以捕获高层语义一致性;以及(2)局部语义一致性,它建模序列内令牌之间的细粒度上下文关系。通过联合建模这两个方面,MCF-MOE产生更具信息性且连贯的表示,从而在跨层和序列内实现更好的一致性,促进更有效的专家协作与专业化。

图2:MCF-MOE的整体工作流程。左:一个包含MCF-MOE门的Transformer层。中:全局-局部上下文融合模块,包含两个互补分支——(1)全局跨层上下文融合,将当前输入嵌入(查询)与缓存的历史层输出进行交叉注意;(2)局部相似性感知融合,在局部窗口内计算令牌级相似性并检索top-k相关令牌特征。右:Top-k专家选择模块,融合后的全局和局部上下文被路由到专家池以选择top-k专家。

我们的主要贡献总结如下:

- • 我们对专家分配行为进行了系统分析,并指出上下文不完整是限制MoE架构中专家有效专业化的关键瓶颈。
- • 我们提出了MCF-MOE,一个通过整合全局跨层语义对齐和局部上下文关系来显式建模多级上下文表示的框架。
- • 大量实验表明,改进的上下文建模在多个基准测试中带来了更一致的专家专业化和更好的下游性能。

## 2 相关工作

### 2.1 缓解专家表示崩溃

为了缓解SMOE(Shazeer et al., 2017;Fedus et al., 2022)架构中长期存在的表示崩溃问题,最近的研究通过强制专家激活的多样性来解决。SMOE-Dropout(Chen et al., 2023)引入随机门控与冻结路由器以平衡利用率。X-MoE(Chi et al., 2022)通过超球面投影施加几何约束,而SimSMOE(Do et al., 2025)通过余弦和CKA正则化惩罚冗余。Stable-MoE(Dai et al., 2022)通过在平衡预热后冻结路由器来提高路由稳定性,而HyperRouter(Do et al., 2023)利用超网络进行输入自适应路由。总之,这些方法通过随机门控、几何散布、冗余惩罚或动态路由来缓解崩溃,从而增强SMOE模型的专业化、鲁棒性和泛化能力。

### 2.2 提高路由稳定性和上下文感知

随着MoE模型规模增大,传统的稀疏路由往往产生不稳定的分配和较弱的语义对齐,限制性能。最近的工作通过增强稳定性和上下文敏感性来解决这些挑战。Omi等人(Omi et al., 2025)利用令牌相似性进行关系负载均衡。RMOE(Qiu et al., 2025)采用基于GRU的记忆来强制跨层一致性,而Liang等人(2025)和Arnold等人(2024)强调了局部一致性和上下文线索在专家选择中的作用。综合来看,这些研究强调了路由策略需要在MoE模型中共同促进稳定性和语义对齐的必要性。

## 3 方法

### 3.1 全局跨层上下文融合

为了克服传统MoE结构仅基于当前层输入选择专家的局限,我们设计了一种跨层注意力机制来融合来自历史层的全局语义信息。

具体而言,设当前第\(l\)层的输入表示为\(\mathbf{H}^{(l)} \in \mathbb{R}^{n \times d}\),其对应的查询矩阵为\(\mathbf{Q}^{(l)} = \mathbf{H}^{(l)} \mathbf{W}^Q\),其中\(\mathbf{W}^Q \in \mathbb{R}^{d \times d'}\)是可训练参数,\(n\)是序列长度,\(d\)是隐藏维度。我们维护一个历史输出缓存\(\mathcal{M}^{(l)} = \left\{ \mathbf{H}^{(l-1)}, \mathbf{H}^{(l-2)}, \dots, \mathbf{H}^{(l-k)} \right\}\),其中\(k\)是要考虑的历史层数,并为每个历史层引入层级索引嵌入\(\mathbf{E}^{(l-j)}\)。历史信息的拼接形式为:

\[\mathbf{C}^{(l)} = [\mathbf{H}^{(l-1)} + \mathbf{E}^{(l-1)}; \dots; \mathbf{H}^{(l-k)} + \mathbf{E}^{(l-k)}] \quad (1)\]
\[\mathbf{K}^{(l)} = \mathbf{C}^{(l)} \mathbf{W}^K; \quad \mathbf{V}^{(l)} = \mathbf{C}^{(l)} \mathbf{W}^V \quad (2)\]
其中\(\mathbf{W}^K, \mathbf{W}^V \in \mathbb{R}^{d \times d'}\)是键和值的线性变换矩阵。

为了在跨层注意力机制中保持自回归一致性,我们引入因果掩码\(\mathbf{M}_{\text{causal}}\)来约束注意力模式。因果掩码定义为:

\[\mathbf{M}_{\text{causal}}[i,j] = \begin{cases} 0 & \text{if } j \leq i \\ -\infty & \text{if } j > i \end{cases} \quad (3)\]
其中\(i\)和\(j\)是位置索引。该掩码确保每个令牌只能关注所有历史层中当前及之前的位置。

注意力分数计算变为:

\[\text{score}_{i,j} = \frac{\mathbf{Q}^{(l)}_i \cdot (\mathbf{K}^{(l)}_j)^\top}{\sqrt{d'}} + \mathbf{M}_{\text{causal}}[i,j] \quad (4)\]
其中\(j > i\)的位置被掩码以防止未来令牌信息泄露,导致softmax归一化后注意力权重为零。

结合标准的缩放点积注意力机制,跨层语义表示为:

\[\mathbf{A}^{(l)} = \mathrm{softmax}\left( \frac{\mathbf{Q}^{(l)} (\mathbf{K}^{(l)})^\top}{\sqrt{d'}} + \mathbf{M}_{\mathrm{causal}} \right) \mathbf{V}^{(l)} \quad (5)\]

### 3.2 局部相似性感知上下文融合

为了进一步增强模型对序列内部结构的感知,我们引入了一种局部相似性感知上下文融合策略,以建模输入序列中令牌之间的细粒度语义关联。具体而言,我们使用固定半径\(r\)的窗口为每个令牌构建局部邻居集:

\[\mathcal{N}(i) = \{ j \mid |i-j| \leq r, j \neq i \} \quad (6)\]
其中\(r\)是控制邻域窗口大小的局部半径参数。我们通过整个序列的点积注意力计算令牌到令牌的相似性矩阵:

\[\mathbf{S} = \mathbf{H}^{(l)} (\mathbf{H}^{(l)})^\top \in \mathbb{R}^{n \times n} \quad (7)\]
其中\(\mathbf{S}[i,j]\)表示令牌\(i\)和令牌\(j\)之间的相似性分数。应用局部窗口掩码将注意力限制在固定半径\(r\)内,然后选择top-\(k\)个最相似的令牌进行加权聚合:

\[\mathbf{S}_{\text{masked}}[i,j] = \begin{cases} \mathbf{S}[i,j] & \text{if } |i-j| \leq r \\ -\infty & \text{otherwise} \end{cases} \quad (8)\]
\[\mathcal{T}_K(i) = \text{Top-K}(\mathbf{S}_{\text{masked}}[i, :]) \quad (9)\]
其中\(K\)是为每个位置选择的最相似邻居数量。然后计算局部增强表示如下:

\[\alpha_{ij} = \frac{\exp(\mathbf{S}_{\text{masked}}[i,j])}{\sum_{k \in \mathcal{T}_K(i)} \exp(\mathbf{S}_{\text{masked}}[i,k])}, \quad j \in \mathcal{T}_K(i) \quad (10)\]
\[\tilde{\mathbf{h}}_i = \sum_{j \in \mathcal{T}_K(i)} \alpha_{ij} \cdot \mathbf{h}_j \quad (11)\]
其中\(\alpha_{ij}\)是softmax归一化的注意力权重,\(\tilde{\mathbf{h}}_i\)表示令牌\(i\)的局部增强表示。

最终的局部增强表示通过残差融合和序列级平均得到:

\[L_i^{(l)} = h_i^{(l)} + \tilde{h}_i \quad (12)\]
\[\bar{L}_i^{(l)} = L_i^{(l)} W_L \quad (13)\]
其中\(h_i^{(l)}, \tilde{h}_i \in \mathbb{R}^d\)分别是令牌\(i\)的原始表示和局部聚合表示,\(W_L \in \mathbb{R}^{d \times d'}\)将它们投影到与全局上下文相同的特征空间以供后续融合。

相似文章

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

EMO:用于涌现模块化的专家混合模型预训练

Hugging Face Daily Papers

EMO 是一种专家混合模型(Mixture-of-Experts),通过将相似领域的词元与共享专家分组实现模块化部署,在保持与标准 MoE 相当的性能的同时,支持显著的专家剪枝(保留 25% 的专家即可保留 99% 的性能)且不会导致性能下降。