MoE路由是哈夫曼编码吗?发现思维链中的频率-多样性定律
摘要
揭示了LLM中的MoE路由遵循类似于哈夫曼编码的频率-多样性定律,并提出了子集差异剪枝(Subset Difference Pruning)来消除功能冗余,实现最优压缩。
arXiv:2607.20427v1 Announce Type: new
摘要:混合专家架构彻底改变了规模化,但其路由的底层逻辑仍然是一个黑箱。在本文中,我们揭示了一个基本主导原则:MoE路由不仅仅是选择,而是哈夫曼编码的一种体现。我们引入频率-多样性定律,发现最先进模型(如Phi-3.5-MoE和Gemma-4-27B-A4B)自发地充当信息论引擎。这些模型为常见标记分配稀疏的专家资源,同时为思维链轨迹中发现的罕见复杂任务调用高多样性的专家委员会。然而,我们在Qwen3.5-35B-A3B中发现了一个关键冗余陷阱:当有效稀疏度(k/E_eff)足够低时,负载均衡会无意中引入功能冗余,掩盖了底层的哈夫曼效率信号。为了弥补这一差距,我们提出了子集差异剪枝(Subset Difference Pruning),这是一种消除功能重复的外科手术式策略。我们证明,剪枝不会降低推理能力;相反,它释放了模型潜在的哈夫曼效率,迫使逻辑坍缩为精简的高密度路径。我们的研究结果表明,下一代MoE应从强制负载均衡转向最小描述长度(MDL)最优性,为高频信息分配更短的专家路由代码,为低频信息分配更长、更多样化的代码,从而将路由从启发式方法转变为一种有原则的压缩引擎。
查看缓存全文
缓存时间: 2026/07/24 05:15
# MoE 路由是一种哈夫曼编码吗?——发现思维链中的频率-多样性定律
来源: https://arxiv.org/html/2607.20427
###### 摘要
混合专家架构彻底改变了模型缩放,但其路由的底层逻辑仍然是一个黑箱。本文揭示了一个基本控制原理:*MoE 路由不仅仅是选择,更是哈夫曼编码的一种体现。* 我们提出了**频率-多样性定律**,揭示了 Phi-3.5-MoE、Gemma-4-27B-A4B 等先进模型自发地充当了信息论引擎。这些模型为常见 token 分配稀疏的专家资源,同时在思维链轨迹中为罕见、复杂任务调用高多样性的专家委员会。然而,我们在 Qwen3.5-35B-A3B 中发现了一个关键的冗余陷阱:当有效稀疏度 \(k/E_{\text{eff}}\) 足够低时,负载均衡会无意中引入功能冗余,掩盖了底层的哈夫曼效率信号。为了弥合这一差距,我们提出了**子集差异剪枝**,这是一种去除功能冗余的手术式策略。我们证明剪枝不会降低推理能力;相反,它释放了模型潜在的哈夫曼效率,迫使逻辑坍缩成精简、高密度的路径。我们的发现表明,下一代 MoE 应该从强制负载均衡转向**最小描述长度(MDL)最优性**,为高频信息分配更短的专家路由代码,为低频信息分配更长、更多样化的代码,从而将路由从一种启发式方法转变为一种有原则的压缩引擎。
混合专家、模型推理
## 1 引言
混合专家架构已成为扩展大规模语言模型的主导范式 (Shazeer et al., 2017 (https://arxiv.org/html/2607.20427#bib.bib34); Jiang et al., 2024 (https://arxiv.org/html/2607.20427#bib.bib2); Dai et al., 2024 (https://arxiv.org/html/2607.20427#bib.bib38)),主要在于其能够将模型容量与计算成本解耦。这一效率的核心是门控网络,它动态地选择一小部分专家来处理每个输入 token (Fedus et al., 2022 (https://arxiv.org/html/2607.20427#bib.bib37))。从根本上说,这个过程是一种**资源分配**的练习 (Clark et al., 2022 (https://arxiv.org/html/2607.20427#bib.bib39)):模型必须实时决定如何分配其有限的*活跃*参数,以最好地表征世界知识的巨大复杂性。
这种选择性激活机制与信息论的核心原理——**信源编码** (Shannon, 1948 (https://arxiv.org/html/2607.20427#bib.bib33)) 相呼应。哈夫曼编码 (Huffman, 1952 (https://arxiv.org/html/2607.20427#bib.bib32)) 作为该领域的基石之一,是数据压缩和通信效率的标杆。其精髓在于根据符号概率分配资源:为高频信息分配较短的代码,为低频信息分配较长的代码。如果将 LLM 视为一个旨在对世界知识进行“终极压缩”的预测系统 (Hutter, 2005 (https://arxiv.org/html/2607.20427#bib.bib35)),那么其 MoE 推理轨迹不应该是随机的;相反,它应该反映语义逻辑的频率分布,在信息熵和物理资源之间达到最优平衡 (Shannon, 1959 (https://arxiv.org/html/2607.20427#bib.bib36); Shazeer et al., 2017 (https://arxiv.org/html/2607.20427#bib.bib34))。
尽管存在这种自然的联系,但 MoE 路由与哈夫曼编码原则之间潜在的对齐关系仍然相对未被探索。虽然现有文献广泛研究了缩放定律 (Krajewski et al., 2024 (https://arxiv.org/html/2607.20427#bib.bib31))、专家专业化 (Zhou et al., 2022 (https://arxiv.org/html/2607.20427#bib.bib40); Xue et al., 2024 (https://arxiv.org/html/2607.20427#bib.bib50)) 和路由稳定性 (Lepikhin et al., 2021 (https://arxiv.org/html/2607.20427#bib.bib1)),但从信源编码角度对路由效率进行信息论表征的工作尚未完全建立。
为了验证我们的假设——即优化后的 MoE 模型自然会趋向于类似哈夫曼的效率,我们对 Gemma-4-27B-A4B 和 Phi-3.5-MoE 等先进模型进行了定量实验。如图 1 所示,我们发现了一个显著的**哈夫曼现象**:激活的专家数量(每层平均唯一专家数)与任务稀有度 \(-\log p(o)\) 呈现出极强的正相关性,斯皮尔曼 \(\rho = 1.00\)。这证实了,在最小化预测损失的驱动下,这些模型自动优化了路由效率:对通用逻辑使用少数核心专家,仅当遇到罕见、复杂任务时才调用更多样化的专家组合。
尽管如此,当前 MoE 设计中专家数量的确定在很大程度上仍然是经验性的 (Zoph, 2022 (https://arxiv.org/html/2607.20427#bib.bib17); Krajewski et al., 2024 (https://arxiv.org/html/2607.20427#bib.bib31))。现代训练范式通常优先考虑通过引入辅助负载均衡损失来抑制“专家崩溃”,以确保专家池之间的均匀通信 (Yang et al., 2025 (https://arxiv.org/html/2607.20427#bib.bib4); Kamath et al., 2025 (https://arxiv.org/html/2607.20427#bib.bib5); Fedus et al., 2022 (https://arxiv.org/html/2607.20427#bib.bib37); Omi et al., 2025 (https://arxiv.org/html/2607.20427#bib.bib58))。我们对 Qwen3.5-35B-A3B 的实证分析揭示,当专家稀疏度 \(k/E_{\text{eff}}\) 过小时,这些平衡压力可能会无意中迫使模型将梯度过度分配给未充分利用的参数(表 4)。这表现为**功能克隆**的增殖 (Puigcerver et al., 2023 (https://arxiv.org/html/2607.20427#bib.bib45)),即具有高语义重叠的冗余专家,它们的存在主要为了满足平衡目标,而非提供独特的信息增益。
这引出了一个关键问题:*传统上对激进负载均衡的依赖是一种最优缩放策略,还是从根本上阻碍了哈夫曼高效路由的出现?* 我们认为,路由本质上是促进压缩的:由路由器选择的专家激活模式作为 CoT 轨迹中展开的语义操作的紧凑代码 (Wei et al., 2022 (https://arxiv.org/html/2607.20427#bib.bib56))。受此观点启发,我们的调查揭示,虽然 Qwen3.5-35B-A3B 等模型保持较高的激活专家数量,但由于功能冗余,产生的代码往往效率低下。
为了测试移除这种冗余是否能释放潜在的哈夫曼效率,我们引入了**子集差异剪枝**,这是一种旨在精炼模型路由拓扑的手术式策略。我们的发现表明,策略性地移除中度冗余的专家可以有效重塑模型的推理路径。实验结果表明,尽管剪枝导致轨迹发生变化,但模型展现出鲁棒的重新编码能力,迫使逻辑坍缩成一条与哈夫曼原则更一致的精简高效路径。
本研究的贡献在于:
1. **现象**:我们识别了 MoE 路由中的**哈夫曼编码现象**,揭示了思维链过程中专家模式的时间压缩。
2. **普适性**:我们建立了**频率-多样性定律**,证明专家路由中的频率-多样性对应关系是优化后 MoE 模型的通用结构属性,而非特定模型的巧合。
3. **方法论**:我们提出了**子集差异剪枝**,并识别了路由作为真正 MDL 最优压缩引擎运行的有效稀疏度 \(k/E_{\text{eff}}\) 范围。
哈夫曼测试:\(\bar{u}^{(o)} \propto -\log p(o)\),见图注。
图 1:对 Gemma-4-27B-A4B 和 Phi-3.5-MoE 上频率-多样性定律(公式 (4))的定量测试。每个点代表一个操作类型 \(o \in \mathcal{O}\);\(x\) 轴:稀有度 \(-\log p(o)\);\(y\) 轴:每层平均唯一专家数 \(\bar{u}^{(o)}\);虚线:OLS 拟合。两个模型均达到斯皮尔曼 \(\rho = 1.00\) (\(p < 0.005\)),验证了 \(\bar{u}^{(o)} \propto -\log p(o)\)。
## 2 相关工作
### 2.1 稀疏混合专家
稀疏 MoE (Shazeer et al., 2017 (https://arxiv.org/html/2607.20427#bib.bib34)) 利用 top-k 路由实现了在恒定计算成本下的高参数量。虽然早期缩放侧重于大规模部署 (Lepikhin et al., 2021 (https://arxiv.org/html/2607.20427#bib.bib1); Fedus et al., 2022 (https://arxiv.org/html/2607.20427#bib.bib37)),但近期架构强调精细化的专家粒度。Yang 等人 (2025 (https://arxiv.org/html/2607.20427#bib.bib4)) 和 Kamath 等人 (2025 (https://arxiv.org/html/2607.20427#bib.bib5)) 引入了多样化的专家配置,例如共享专家隔离,以优化利用率。我们分析了现代基准模型:Phi-3.5-MoE (Abdin et al., 2024 (https://arxiv.org/html/2607.20427#bib.bib3))、Gemma-4-27B-A4B (Kamath et al., 2025 (https://arxiv.org/html/2607.20427#bib.bib5)) 和 Qwen3.5-35B-A3B (Yang et al., 2025 (https://arxiv.org/html/2607.20427#bib.bib4)),它们代表了专家池大小与路由稀疏度 \(k/E \in \{3.1\%, 6.25\%, 12.5\%\}\) 之间的不同平衡,为研究信息论路由属性提供了一个谱系。
### 2.2 路由可解释性与动态
可解释性研究通常将 MoE 专家视为专门的键值记忆 (Geva et al., 2021 (https://arxiv.org/html/2607.20427#bib.bib20); Elhage et al., 2022 (https://arxiv.org/html/2607.20427#bib.bib21))。先前的研究探讨了专家是否编码语义或句法特征 (Artetxe et al., 2022 (https://arxiv.org/html/2607.20427#bib.bib18); Herbst et al., 2026 (https://arxiv.org/html/2607.20427#bib.bib47)),但主要依赖于静态的单 token 快照。近期的系统性分析开始揭示路由中的宏观结构,例如逐层专业化和“语言路由隔离”,专家根据语言资源水平和语系进行划分 (Chen et al., 2026 (https://arxiv.org/html/2607.20427#bib.bib55); Zheng et al., 2026 (https://arxiv.org/html/2607.20427#bib.bib54))。然而,这些见解仍聚焦于专家在模型深度上的空间分布。我们的工作与此不同,我们分析路由的**时间动态**,特别是沿 CoT 轨迹的动态。我们通过将路由决策与哈夫曼编码联系起来,弥合了一个关键差距,证明当给予足够的专家稀疏度时,路由器会自动优化频率依赖的专家分配。
### 2.3 信息论压缩
最小描述长度原则 (Rissanen, 1978 (https://arxiv.org/html/2607.20427#bib.bib28)) 为权重剪枝 (Han et al., 2015 (https://arxiv.org/html/2607.20427#bib.bib25)) 和量化 (Frantar et al., 2022 (https://arxiv.org/html/2607.20427#bib.bib27)) 提供了统一框架。虽然 LLM 被认为是通用压缩器 (Delétang et al., 2024 (https://arxiv.org/html/2607.20427#bib.bib29)),并且像 RFID-MoE (Mi et al., 2026 (https://arxiv.org/html/2607.20427#bib.bib51)) 这样的并行工作使用路由频率进行权重-SVD 压缩,但我们的方法是独特的。我们专注于**路由路径描述长度**而非参数权重。通过借鉴最优信源编码 (Cover and Thomas, 2006 (https://arxiv.org/html/2607.20427#bib.bib30)),我们认为低效模型(如 Qwen3.5-35B-A3B)遭受功能冗余的困扰,其中强制负载均衡对路由分布施加了次优先验。我们的子集差异剪枝针对这种“路由码本”冗余,在不进一步训练的情况下恢复了 MDL 最优性。
## 3 时间上的专家组合编码:信息论分析
本节形式化 MoE 路由实现哈夫曼编码的主张。我们将专家激活模式定义为组合码字,通过互信息将其与信息论联系起来,并推导出**频率-多样性定律**作为一个可证伪的预测。然后我们展示该定律沿着单个 CoT 轨迹在时间上扩展。全文采用 Zhou 等人 (2025 (https://arxiv.org/html/2607.20427#bib.bib23)) 的思路步骤划分惯例,将以换行符分隔的 CoT 轨迹的每个片段视为一个独立的推理步骤。
#### 专家集与唯一专家计数。
对于 CoT 轨迹中的每个推理步骤 \(i\),定义其在第 \(l\) 层的**专家集**为该步骤所有 token 上激活的专家索引的并集:
\[
\mathcal{E}_{i}^{(l)} = \bigcup_{t \in \mathcal{T}_{i}} \operatorname{top-\!k}\!\left(\mathbf{g}_{t}^{(l)}\right),
\quad (1)
\]
其中 \(\mathbf{g}_{t}^{(l)}\) 是 token \(t\) 上第 \(l\) 层的门控权重向量,\(\mathcal{T}_{i}\) 表示属于步骤 \(i\) 的 token 索引。步骤 \(i\) 的**唯一专家计数**记为 \(u_{i} = |\mathcal{E}_{i}^{(l)}|\),作为下文分析中代码长度的代理变量。
唯一专家计数轨迹(MATH 按难度)
\(a\) Gemma-4-27B-A4B
\(b\) Phi-3.5-MoE
\(c\) Qwen3.5-35B-A3B
图 2:Gemma-4-27B-A4B、Phi-3.5-MoE 和 Qwen3.5-35B-A3B 在标准化推理步骤(MATH)上的唯一专家计数轨迹。
#### 路由器作为信息论编码器。
我们将 MoE 路由器解释为一个**语义编码器**:门控机制将步骤 \(i\) 的输入映射到一个离散的专家激活模式 \(\mathcal{E}_{i}^{(l)}\),该模式作为一个从专家索引集合 \(\{1, \ldots, E\}\) 中抽取的组合码字。
让 \(O \in \mathcal{O}\) 表示一个推理步骤的**语义操作类型**,其中
\[
\mathcal{O} = \{\texttt{add/subtract}, \texttt{multiply/divide}, \texttt{problem setup}, \texttt{other}\}
\]
这些四类操作是通过轻量级关键词分类器(附录 I)按步骤分类的,\(p(o)\) 表示类型 \(o \in \mathcal{O}\) 的经验频率。路由质量通过 \(O\) 与诱导激活模式 \(\mathcal{E}^{(l)}\) 之间的**互信息**来衡量:
\[
I(O; \mathcal{E}^{(l)}) = H(O) - H(O \mid \mathcal{E}^{(l)}),
\quad (2)
\]
其中 \(H(O) = -\sum_{o \in \mathcal{O}} p(o) \log p(o)\) 是语义熵,\(H(O \mid \mathcal{E}^{(l)})\) 是观察到路由模式后的残余不确定性。一个良好优化的路由器最大化 \(I(O; \mathcal{E}^{(l)})\),确保激活的专家集包含尽可能多的语义信息。相似文章
基于归因引导和覆盖最大化的结构化MoE压缩剪枝
提出了一种针对MoE模型的结构化剪枝框架,通过基于归因的近似方法最大化通道分数覆盖,在结合4比特量化时实现50%或25%的剪枝,并在Qwen3-30B-A3B上将内存占用降低5.27倍。
dMoE: 具有可学习块专家的扩散大语言模型
dMoE 提出了用于扩散大语言模型的块级专家路由,将唯一激活的专家数量从 69.5 降至 14.6,同时保留了 99.11% 的性能,并实现了 76-80% 的内存减少和 1.14-1.66 倍的加速。
通过有限专家库实现通信高效的专家路由
本文提出了一种针对稀疏混合专家(MoE)模型中通信高效专家路由的信息论框架,将门控机制视为随机信道,并推导实用的互信息估计器以分析有限专家库上的准确率-速率权衡。
BitsMoE: 基于谱能引导的MoE大语言模型高效量化比特分配
BitsMoE提出了一种基于谱能引导的比特分配框架,用于量化混合专家大语言模型,在超低位宽量化下实现了显著的精度提升和加速。
粘性路由:训练MoE模型以实现内存高效推理
StickyMoE提出了一种可微的路由一致性损失函数,鼓励相邻token在MoE模型中激活相同的专家,从而在边缘设备推理过程中将专家交换开销和缓存未命中率降低高达3.92倍,同时改善困惑度。