分层 Copula-Gumbel-Top-\texorpdfstring{$K$}{K} 路由:固定逐词元路由律下冻结混合专家模型的双侧依赖控制

arXiv cs.LG 论文

摘要

本文介绍了分层 Copula-Gumbel-Top-K(H-CGA)路由,一种在冻结混合专家模型中控制词元路由选择之间联合依赖关系的方法,同时保持每个词元的路由律完全固定。它提供了一致性与负载分散之间的理论权衡,并通过一个小规模试点验证了该机制。

arXiv:2607.28670v1 公告类型:新 摘要:随机 Gumbel-Top-$K$ 路由器为混合专家(MoE)模型的每个词元定义一个 \emph{路由律}:一个关于有序专家列表和混合权重的分布。我们问:在保持每个个体词元的完整路由律完全固定的情况下,不同词元路由选择的哪些 \emph{联合}分布是可达到的?我们给出一个双侧构造,\emph{分层 Copula-Gumbel-Top-$K$}(\CGA{})。在相关词元组内,可交换的高斯 Copula 使每个专家坐标上的 Gumbel 扰动正相关,从而可以增加组内专家集的一致性。在不相交的组对之间,一个可调的对偶构造引入可选择的负依赖量。我们证明,这两种操作都使每个词元的有序 Top-$K$ 样本、混合权重和包含概率在分布上与独立路由相同——\emph{在以其预路由 logits 为条件的路由层上};因此条件期望专家流量得以保持。我们刻画了由此产生的权衡:相对于独立路由,组内正耦合只会增大实际专家负载的方差;而在相同的组内强度下,相对于平坦耦合,非负的跨组对置只能降低方差。因此,一致性和负载分散由不变约束曲面上的两个互补依赖旋钮控制。由于基础模型未被改动,这些旋钮可以由一个小型控制器基于冻结特征驱动,并通过评分函数估计器训练:冻结网络仅在前向方向被评估,梯度被限制在控制器内。初步的小规模试点验证了该机制和训练路径,但尚未确立任务级微调收益。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:30

# 冻结合专家混合模型中固定每词元路由律的双向依赖控制
来源:https://arxiv.org/html/2607.28670
## 层次化 Copula-Gumbel-Top-K 路由:在固定每词元路由律下对冻结合专家混合模型的双向依赖控制

Richard Yi Da Xu 香港浸会大学 及 TadReamk Limited [email protected],[email protected]

###### 摘要

一个随机 Gumbel-Top-K 路由器为混合专家(MoE)模型的每一个词元定义一个*路由律*:即在有序专家列表和混合权重上的一个分布。我们问,当每个单独词元的完整路由律被精确固定时,不同词元路由选择的*联合*分布中哪些是可以达到的。我们给出一个双向构造,*层次化 Copula-Gumbel-Top-K*(H-CGA)。在一个相关词元组内,一个可交换高斯 copula 在每个专家坐标上对 Gumbel 扰动进行正相关,这可以增加组内专家集的一致性。在不相交的组对之间,一个可调的对抗构造引入可选择数量的负依赖。我们证明,这两种操作都使得每个词元的有序 Top-K 样本、混合权重和包含概率在分布上与*在其路由前 logits 条件下的一个路由层上的*独立路由完全相同;由此,条件期望专家流量也得以保持。我们刻画了由此产生的权衡:正的组内耦合相对于独立路由只能使实现专家负载的方差膨胀,而非负的跨组对抗相对于相同组内强度下的平坦耦合只能使其降低。因此,一致性和负载离散性由不变约束曲面上的两个互补依赖旋钮控制。由于基座模型未被触碰,这些旋钮可以由一个基于冻结特征的小型控制器驱动,并可使用评分函数估计器进行训练:冻结网络仅在前向方向被求值,梯度仅限于控制器。一项初始小规模试点验证了该机制和训练路径,但并未确立任务级微调的收益。

## 1 引言

稀疏 MoE 层通过仅对每个词元评估少数专家来扩展语言模型(Shazeer 等,2017 (https://arxiv.org/html/2607.28670#bib.bib1);Lepikhin 等,2021 (https://arxiv.org/html/2607.28670#bib.bib2);Fedus 等,2022 (https://arxiv.org/html/2607.28670#bib.bib3))。现代 MoE 通常使用 top-K 路由:路由器对所有专家打分,将词元发送到其得分最高的 K 个专家,并组合它们的输出。在标准随机公式下,Gumbel-Top-K 采样(Kool 等,2019 (https://arxiv.org/html/2607.28670#bib.bib8))为每个词元分配一个路由律——即有序专家列表上的 Plackett–Luce 分布。几乎所有关于 MoE 路由的工作都修改了这个每词元律:微调改变 logits,辅助损失重塑门控,基于相似度的路由器改变个体选择(Nguyen 等,2025 (https://arxiv.org/html/2607.28670#bib.bib10);Omi 等,2025 (https://arxiv.org/html/2607.28670#bib.bib11))。

我们研究一个不同的、很大程度上未被考察的自由度。在将每个词元的路由律*精确*固定的情况下,不同词元选择的联合分布仍然是自由的:Sklar 定理将边缘分布与依赖结构分开(Sklar, 1959 (https://arxiv.org/html/2607.28670#bib.bib13);Nelsen, 2006 (https://arxiv.org/html/2607.28670#bib.bib14)),而冻结 MoE 的路由选择是一组等待依赖结构的离散边缘分布。本文问:*在这个不变约束曲面上,哪些联合路由行为是可以达到的,可达到的极端之间又存在何种权衡?*

这个问题在依赖的两个方向上都具有实践意义。*正的*跨词元依赖使得短语、实体或代码标识符中的词元更有可能复用相同的专家——局部一致性更强,每组的不同专家数更少。这可能改善专家局部性,具体取决于执行系统。但是将分组词元聚拢到共享专家上会使它们的包含计数正相关,因此在给定层上条件期望负载可证明不变的情况下,实现的每专家负载会变得更突发。*负的*跨组依赖则推动另一个方向:对不同组的需求进行反相关可降低实现负载的方差。我们表明,这两个方向在一个层次化构造中可以同时获得,并且两者都保持每个词元的路由律。

我们提出 H-CGA,如图 1 (https://arxiv.org/html/2607.28670#S1.F1) 所示。冻结路由器为词元 t 和专家 e 产生 logits \(\ell_{te}\);普通随机路由添加独立的 Gumbel 噪声并取前 K 个扰动 logits。H-CGA 在层次上组织噪声。在一个由词元组成的组 g 内,每个专家坐标处的噪声通过一个可交换高斯 copula 共享一个组隐变量 \(\zeta_{ge}\):相关词元逐专家地接收到正相关的扰动。在一个不相交组对 \((g,g')\) 之间,隐变量具有可调的对抗关系,其对抗强度为 \(\alpha_{g,g'}\in[0,1]\)。当 \(\alpha_{g,g'}=1\) 时,组对中一个成员对它的词元向专家 e 施加的随机推力,其伙伴会接收到相反的推力;当 \(\alpha_{g,g'}=0\) 时,两组独立。任何单个词元的噪声向量在整个过程中都保持其原始的 i.i.d. Gumbel 分布。

该方法保持每个词元的边缘选择分布不变,并且只作用于路由噪声的跨词元依赖:正协调提高了相关词元做出匹配随机选择的趋势,而负协调则降低不同组同时做出这种选择的趋势。对于本文研究的随机路由器,这种依赖可以在不改变任何单个词元路由律的情况下引入。

冻结隐藏状态 \(h_t\) 冻结路由器 logits \(\ell_t\) 可训练控制器 \(a_g,\rho_g,\alpha_{g,g'}\) 层次化 copula Gumbel 噪声 冻结 Gumbel-Top-K 冻结专家与加权和 图 1:H-CGA 作为路由侧依赖层。只有控制器可训练。基础路由器、专家和混合规则均被冻结。正的组内耦合和可调跨组对抗都在层次化 copula 阶段生成;配对是采样前固定的设计选择,而控制器可以设置其对抗强度 \(\alpha_{g,g'}\)。当 \(a_g=0\) 时,采样器精确等同于独立 Gumbel-Top-K 路由。

#### 贡献。

1. 我们引入 H-CGA,一个放置在冻结随机 Gumbel-Top-K MoE 路由噪声之上的层次化 copula 层,它双向控制跨词元依赖——正的组内耦合用于局部专家集一致性,可调的负跨组耦合用于负载方差控制——且不触碰路由器 logits、专家或任何每词元路由律。
2. 我们证明整个层次结构具有*完全的每词元路由律不变性*:每个词元的选择有序 Top-K 列表和基于门控的混合权重在分布上与独立 Gumbel-Top-K 路由下相同。因此,该层上的条件期望专家包含计数得以保持(定理 1 (https://arxiv.org/html/2607.28670#Thmtheorem1)、推论 1 (https://arxiv.org/html/2607.28670#Thmcorollary1) 和推论 2 (https://arxiv.org/html/2607.28670#Thmcorollary2))。
3. 我们刻画了不变曲面上的一致性–离散性权衡(命题 1 (https://arxiv.org/html/2607.28670#Thmproposition1)):相对于独立路由,平坦正耦合只能增加实现专家负载的方差;相对于相同强度下的平坦耦合,每一个非负跨组对抗强度只能减小它。所有方案中的条件期望负载都相同。
4. 我们将仅路由适配形式化为一个应用:一个小型控制器读取冻结特征并设置依赖旋钮,并且可以使用评分函数估计器训练,该估计器仅在前向方向求值冻结基础模型。

## 2 背景与问题设置

#### Top-K MoE 路由。

让一个冻结路由器将词元表示 \(h_t\) 映射到 logits \(\ell_t=(\ell_{t1},\ldots,\ell_{tE})\)。确定性 top-K 路由器选择最大的 K 个条目。我们改用标准随机 Gumbel-Top-K 律:抽取 \(\gamma_{te}\overset{\mathrm{iid}}{\sim}\mathrm{Gumbel}(0,1)\),并令

\((r_{t1},\ldots,r_{tK})=\operatorname{TopK}_{e}\{\ell_{te}+\gamma_{te}\},\qquad S_{t}=\{r_{t1},\ldots,r_{tK}\}.\) (1)

该有序列表是一个不放回的 Plackett–Luce 样本(Kool 等,2019 (https://arxiv.org/html/2607.28670#bib.bib8))。我们使用基于门控的混合权重

\(w_{te}=\frac{\exp(\ell_{te})\,\mathbf{1}[e\in S_{t}]}{\sum_{j\in S_{t}}\exp(\ell_{tj})},\qquad y_{t}=\sum_{e\in S_{t}}w_{te}f_{e}(h_{t}).\) (2)

其他作为完整 Gumbel 噪声向量的确定性函数的权重规则也可以使用。

#### “路由律”在这里的含义。

在给定词元冻结 logits 的条件下,其路由律是其有序 Top-K 列表和 (2) 中权重的联合分布。它描述了一个词元在随机路由下可能发生的情况。它并不指定两个不同词元的随机选择如何协变,也不固定实现的批次负载。

#### 保证的范围与层级。

本文中的参考路由器是*独立随机* Gumbel-Top-K,而不是确定性 top-K。确定性路由器的路由律是退化的,因此在精确保持该律的同时无法引入非平凡依赖。容量裁剪、词元丢弃和专家选择分配发生在 (1) 中的选择之后;它们不在下面的不变性结果范围内。所有不变性和期望负载声明都是*层局部的*:它们以进入一个路由层的隐藏状态和 logits 为条件。如果耦合改变了较早层的联合隐藏状态分布,则较后层的 logits 也可能会改变。因此,这些结果本身并不确立多层 MoE 的端到端不变性。

#### 与 PEFT 的关系。

传统的 MoE 参数高效微调将权重适配器附加到专家上,或学习一个额外的适配器路由器(Hu 等,2022 (https://arxiv.org/html/2607.28670#bib.bib6);Liu 等,2026 (https://arxiv.org/html/2607.28670#bib.bib9));两者都分配可训练的*表示*能力并改变单个词元的偏好。本文研究的框架暴露了一个不同的、正交的预算:当所有基础参数 \(\Theta_{\mathrm{base}}\) 被冻结——包括嵌入、注意力、路由器和专家——唯一可训练的对象是一个作用在路由随机性*依赖*上的控制器 \(\phi\),范围从每个 MoE 层一个标量到一个小型 MLP。仅路由适配(第 3.5 (https://arxiv.org/html/2607.28670#S3.SS5) 节)因此是依赖框架的一个应用,而不是其定义。它不是传统的权重适配器 PEFT 方法:按照构造,它不能改变任何词元对专家的边缘偏好或其期望包含概率。

## 3 层次化 Copula-Gumbel-Top-K

本节向随机路由器引入跨词元协调,同时保持每个词元的边缘路由律不变。这里,边缘路由律指单个词元的有序专家列表在重复路由下的分布,而联合路由律指一起路由的不同词元选择之间的依赖结构;冻结路由器固定前者,H-CGA 只作用于后者。

该构造分为四个阶段。第 3.1 (https://arxiv.org/html/2607.28670#S3.SS1) 节在抽取任何路由噪声之前形成相关词元组并固定耦合强度;第 3.2 (https://arxiv.org/html/2607.28670#S3.SS2) 节在组内引入相关 Gumbel 噪声;第 3.3 (https://arxiv.org/html/2607.28670#S3.SS3) 节确立每个词元保留其原始随机 Top-K 律;第 3.4 (https://arxiv.org/html/2607.28670#S3.SS4) 节在配对组之间引入一个可调对抗共享信号,以抵消正组内协调产生的负载突发性。

### 3.1 一个路由前耦合控制器

将一个序列划分为不相交的候选组 g。在最小版本中,这些是 m 个相邻词元的固定窗口。一个控制器只读取冻结的、路由前的特征 \(s_g\),例如平均隐藏状态、平均门控熵、组内门控相似度以及边界指示符:

\(a_{g}=\sigma(\phi(s_{g}))\in[0,1],\qquad\rho_{g}=a_{g}\rho_{\max},\qquad 0\leq\rho_{\max}<1.\) (3)

这里 \(\sigma\) 是 logistic sigmoid,因此 \(a_{g}\in[0,1]\)。采样器使用的相关性为 \(\rho_{g}\),由 \(\rho_{\max}\) 限制在 1 以下。保持 \(\rho_{\max}<1\) 使每个词元保留私有随机性,并使高斯构造保持在非退化之下。

#### 配对组之间的第二个旋钮。

一旦组被匹配为不相交的组对,控制器还可以选择一个对抗强度

\(\alpha_{g,g'}=\sigma\!\left(\phi_{\mathrm{pair}}(\operatorname{stopgrad}(s_{g}),\operatorname{stopgrad}(s_{g'}))\right)\in[0,1].\) (4)

组内强度 \(\rho_{g}\) 和组间强度 \(\alpha_{g,g'}\) 有不同的作用。\(\rho_{g}\) 使同一组中的词元共享更多随机性;\(\alpha_{g,g'}\) 决定两个组的共享随机信号彼此对抗的强度。固定任一个旋钮的值也是有效的;学习两者是可选的。

对于单个专家坐标,当一组词元的冻结路由器得分相似时,H-CGA 可以给它们分配一个朝向该专家的部分共享随机扰动。这个扰动不会提高专家的得分、改变路由器权重,也不会强迫任何词元选择该专家;它只影响原本未变的路由决策中的随机打破平局部分。当 \(\rho_{g}=0\) 时这些扰动是独立的,随着 \(\rho_{g}\) 趋近于 1,共享分量占主导,同时每个词元保持相同的边缘噪声分布。

控制器必须在抽取路由噪声之前被求值。当 \(a_{g}=0\)、\(\rho_{g}=0\) 时,该规则精确退化为独立随机 Top-K。组可以从冻结输入中自适应地选择,组也可以进一步匹配为具有可调对抗的不相交对(第 3.4 (https://arxiv.org/html/2607.28670#S3.SS4) 节),前提是组成员资格*和*配对在任何路由噪声采样之前固定,且组保持不相交。

#### 为什么需要“路由前”。

组、其耦合强度及其可选配对伙伴可以依赖于冻结模型已经可用的信息,例如隐藏状态或门控相似度。它们不能依赖于 Gumbel 抽取或所选 se

相似文章

超越几何互补性:稀疏混合专家路由中的一致性重叠

Hugging Face Daily Papers

本文引入专家子空间分离指数(ESSI),以解耦稀疏混合专家语言模型中的路由连贯性、候选质量以及候选与上下文之间的交互,揭示了一种一致性重叠模式:路由从共享的几何邻域中选择与 token 相关的专家,而多专家计算仍然有用。

通过有限专家库实现通信高效的专家路由

arXiv cs.LG

本文提出了一种针对稀疏混合专家(MoE)模型中通信高效专家路由的信息论框架,将门控机制视为随机信道,并推导实用的互信息估计器以分析有限专家库上的准确率-速率权衡。

置信自适应SwiGLU用于混合专家模型

Hugging Face Daily Papers

提出了一种置信感知的SwiGLU(κ-SwiGLU),它根据token级路由置信度调整混合专家模型中专家门控的锐度,以最小的计算开销提升了性能。