双语混合专家 (MoE) 语言模型中专家路由的声明性-程序性视角

arXiv cs.CL 论文

摘要

本文研究了双语混合专家 (MoE) 语言模型是否会发展出语言结构化的专家路由。研究发现,在 MoE 路由模式中会出现可解释的语言组织,并且课程训练会影响语言平衡中的专业化。

arXiv:2608.15102v1 Announce Type: new 摘要:我们研究了混合专家 (MoE) 语言模型在双语语言习得过程中是否会发展出语言结构化的专家路由。受声明性-程序性框架启发,我们分析了仅解码器的英语-德语 MoE Transformer 在顺序语言暴露下的词汇、语法和句法处理。我们构建了一个基于探针的验证集,并提取词元级路由分布,使用互信息、路由熵和 Jensen-Shannon 距离来量化类别依赖的专业化。课程训练模型在层5处显示互信息峰值为0.1148,表明跨语言类别的路由分布存在类别依赖差异。令人惊讶的是,一个在混合英语-德语数据上训练的无课程基线表现出更强的聚合专业化,在同一层达到互信息峰值0.2599。这些结果表明,即使没有顺序语言暴露,可解释的语言组织也会在 MoE 路由模式中出现。在第二个训练种子上的复制实验显示,无课程条件的专业化集中在单一语言上,其身份取决于种子,而课程始终产生稳定的、语言平衡的路由配置;分阶段的双语暴露减少单一语言主导,而不是均匀增加专业化。官方 Github 仓库:https://github.com/Amrit828/DP-Theory-MOE-Interpretability-Research
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:02

# 双语混合专家语言模型中专家路由的声明式-程序性视角  
来源:https://arxiv.org/html/2608.15102  
Raghul  
隶属机构:印度金奈Sri Sivasubramaniya Nadar工程学院  
Durairaj Thenmozhi  
隶属机构:印度金奈Shiv Nadar大学  
amrit2410182@ssn\.edu\.in, raghul2510435@ssn\.edu\.in  
thenmozhid@snuchennai\.edu\.in  

###### 摘要  
我们研究了混合专家(MoE)语言模型在双语语言习得过程中是否发展出具有语言结构化的专家路由。受声明式-程序性框架启发,我们分析了在顺序语言暴露下训练的仅解码器英德MoE Transformer中的词汇、语法和句法处理。我们构建了基于探针的验证集,并提取了词元级路由分布,通过互信息、路由熵和Jensen-Shannon距离来量化类别相关的专业化程度。课程训练模型在第5层表现出0.1148的峰值互信息,表明不同语言类别间路由分布存在类别相关的差异。令人惊讶的是,在混合英德数据上训练的无课程基线模型表现出更强的聚合专业化程度,在同一层达到了0.2599的峰值互信息。这些结果表明,即使在没有顺序语言暴露的情况下,可解释的语言组织也会出现在MoE路由模式中。第二次训练种子的复制实验显示,无课程条件的专业化集中在单一语言上,且该语言身份依赖于种子;而课程训练则始终产生稳定的、语言平衡的路由概况;分阶段双语暴露并非均匀地增加专业化,而是减少了单一语言的主导地位。  
官方Github仓库:Github链接 (https://github.com/Amrit828/DP-Theory-MOE-Interpretability-Research)  

## 1引言  
混合专家(MoE)语言模型将每个词元路由到专家网络的子集,而不是将所有词元都通过同一个前馈网络14 (https://arxiv.org/html/2608.15102#bib.bib12);8 (https://arxiv.org/html/2608.15102#bib.bib6)。这使得MoE模型不仅在扩展规模方面有用,而且可用于研究神经语言模型如何在内部选择专家。如果不同类型的语言词元被路由到不同的专家,路由机制可能在模型内部呈现出有组织的专家分布形式。  
在这项工作中,我们研究了双语MoE语言模型是否发展出对应于有意义的语言类别的路由模式。我们关注三个类别,这些类别受到语言声明式-程序性观点的启发:词汇知识、语法处理和句法结构17 (https://arxiv.org/html/2608.15102#bib.bib14);18 (https://arxiv.org/html/2608.15102#bib.bib15);19 (https://arxiv.org/html/2608.15102#bib.bib16)。在本文中,探针是从句子中选出的待检查词元。词汇探针测试词汇知识,如不规则形式。语法探针测试基于规则的形态学和一致性。句法探针是参与子句结构和句子组织的词元。  
我们不仅仅检查模型的最终预测,而是直接分析与这些探针词元相关的专家路由分布。我们使用分阶段的英德课程训练了一个稀疏的双语Transformer。训练课程从英语开始,逐渐过渡到德语,模拟了双语环境中的结构化第二语言暴露和课程学习1 (https://arxiv.org/html/2608.15102#bib.bib1);12 (https://arxiv.org/html/2608.15102#bib.bib10);22 (https://arxiv.org/html/2608.15102#bib.bib18)。我们将这种结构化课程与无结构的“无课程”设置进行比较,在后者中,英语和德语的引入没有逐步累积的暴露。这使我们能够研究MoE路由是否按语言变得有组织,以及分阶段的双语暴露是否影响这种组织在语言间的分布。  
为了衡量有组织路由模式的发展,我们使用了一个保留的验证集,其中包含英语和德语的词汇、语法和句法探针。我们检查路由器在每个MoE层对每个探针词元的专家概率分布。然后,我们使用互信息、熵、Jensen-Shannon散度和句子级置换检验13 (https://arxiv.org/html/2608.15102#bib.bib11);10 (https://arxiv.org/html/2608.15102#bib.bib7);3 (https://arxiv.org/html/2608.15102#bib.bib2)来测量专家路由与语言类别之间的关系。  
这补充了最近研究数据集和大型语言模型中行为性声明式和程序性知识的工作9 (https://arxiv.org/html/2608.15102#bib.bib8),将分析移动到内部路由层面。  
我们的结果表明,MoE路由分布包含关于语言类别成员身份的可测量信息:探针词元的类别可以从其专家概率分布中部分推断出来,因为路由和类别之间表现出非平凡的互信息。词汇、语法和句法探针的路由方式不同。最清晰的专业化出现在中间的MoE层,而后面的层路由更为分散,显示出较低的互信息。我们还发现,课程影响了语言间专业化的平衡方式。没有课程时,路由专业化严重集中在一种语言上,这种集中依赖于种子;而分阶段的L1-L2课程则产生了跨种子稳定的、语言平衡的路由组织。  
总的来说,本研究表明,双语MoE路由器发展出了语言敏感的、可量化的专家路由结构,反映了具有语言学意义的差异。这些发现表明,专家路由为理解双语语言模型如何分配不同类型语言处理的计算提供了一个有用的机制性窗口。  
本文的核心动机不是询问双语MoE模型在诊断任务上是否表现良好,而是探究其内部路由机制如何组织语言计算。我们的明确贡献是一个路由层面的分析框架,用于测试在分阶段双语暴露下,专家分配是否对词汇、语法和句法探针类别敏感。通过比较正向英德课程和无课程基线,我们分离出训练顺序如何改变路由专业化在语言间的分布。这使得该研究成为对双语MoE模型中专家路由的机制性研究,而非对语言模型准确性的通用基准测试。  

## 2相关工作  
本节将研究置于四个相关领域的背景下:语言的声明式-程序性观点、Transformer模型的语言学分析、MoE架构中的专家路由以及双语暴露的课程学习。这些领域共同引出了本文的核心问题:双语MoE模型中的专家路由是否对词汇、语法和句法差异变得敏感?此外,分阶段的语言暴露是否会改变这种路由结构?  

##### 声明式-程序性理论。  
声明式-程序性框架将语言知识分为两个主要部分17 (https://arxiv.org/html/2608.15102#bib.bib14);18 (https://arxiv.org/html/2608.15102#bib.bib15);19 (https://arxiv.org/html/2608.15102#bib.bib16)。声明式知识与存储的单词知识有关,如词汇和不规则形式。程序性知识与基于规则的语法和组合结构有关。在本文中,我们仅使用该框架作为语言学视角。我们并非声称MoE路由器与人类记忆系统相同。  

##### 大型语言模型中的声明式和程序性知识。  
最近的研究主要通过模型输出和任务表现来考察语言模型中的声明式和程序性知识9 (https://arxiv.org/html/2608.15102#bib.bib8)。我们的工作探索了模型内部的这个问题。我们不只是询问模型是否提供正确答案,而是研究一个稀疏的双语模型是否为不同类型的探针词元分配不同的计算。  

##### Transformer语言结构。  
先前的研究表明,Transformer层并不都编码相同类型的语言信息20 (https://arxiv.org/html/2608.15102#bib.bib17);16 (https://arxiv.org/html/2608.15102#bib.bib13);2 (https://arxiv.org/html/2608.15102#bib.bib3);5 (https://arxiv.org/html/2608.15102#bib.bib5)。中间层通常比非常早或非常晚的层具有更清晰的句法和语义结构。这启发了我们对MoE路由进行逐层分析。我们特别质疑中间路由层是否显示出更强的类别敏感的专家分配。  

##### 混合专家路由。  
MoE模型使用路由器将词元定向到专家子集14 (https://arxiv.org/html/2608.15102#bib.bib12);8 (https://arxiv.org/html/2608.15102#bib.bib6)。早期工作表明,专家可以根据词元统计、领域、路由设计和平衡约束进行专业化4 (https://arxiv.org/html/2008.15102#bib.bib4);7 (https://arxiv.org/html/2608.15102#bib.bib19);15 (https://arxiv.org/html/2608.15102#bib.bib20)。我们的研究与众不同之处在于专注于双语语言探针类别,并探索课程结构如何影响路由专业化在英语和德语之间的分布。  

##### 课程学习与双语暴露。  
课程学习研究训练样例的顺序如何影响学习1 (https://arxiv.org/html/2608.15102#bib.bib1);12 (https://arxiv.org/html/2608.15102#bib.bib10);22 (https://arxiv.org/html/2608.15102#bib.bib18)。在双语训练中,分阶段暴露是有用的,因为它允许我们比较两种场景:一种是模型先看到英语后看到德语,另一种是两种语言从开始就混合。这种比较帮助我们评估语言暴露的顺序是否影响路由专业化在不同语言间的发展。  

## 3路由分析框架  
模型在路由层 L=\{1,3,5,7\} L=\\\{1,3,5,7\\\} 包含MoE块,每个块有 N=8 N=8 个专家。令 EE 表示专家路由随机变量,这是一个分类变量,其值为八个专家;令 CC 表示语言类别随机变量,取三个(非二进制)值 C=\{lexical,grammatical,syntactic\} C=\\\{\\textit\{lexical\},\\textit\{grammatical\},\\textit\{syntactic\}\\\}。  
对于路由层 ll 上的词元 tt,路由器产生八个专家上的概率分布,记为 r^{\(l\)}\(t\) r^\{\(l\)\}\(t\);本文中这指的是完整的softmax后路由器分布,是在 *top-k掩码之前* 提取的,而非前向计算中使用的稀疏重归一化向量。  

##### 探针机制。  
探针词元使用解析器在每个句子中进行标注(详情见方法论和附录A (https://arxiv.org/html/2608.15102#A1))。探针词元的路由向量在推理过程中从路由器提取,并用于计算下面的路由统计量,每个路由层独立进行。  
我们检验零假设 H₀: P(E|C) = P(E) H_{0}: P(E|C)=P(E) (路由独立于类别)相对于备择假设 H₁: P(E|C) ≠ P(E) H_{1}: P(E|C)\neq P(E),等价于 H₀: MI(E,C) = 0 H_{0}: MI(E;C)=0 相对于 H₁: MI(E,C) > 0 H_{1}: MI(E;C)\>0。这涉及聚合路由分布,而非单个词元:数千个类别探针的累积专家分配仍可能与全局分配匹配,因此 H₀ H_{0} 是一个经验上可实现的状态,而非稻草人——随机路由控制几乎完美地产生它(MI≈0.002 \approx 0.002;附录G (https://arxiv.org/html/2608.15102#A7)),并且训练期间使用的负载平衡目标明确推动路由器趋向类别无关的专家使用。  

#### 3.0.1统计测试框架  
主要统计工具是专家路由分布与语言类别之间的互信息。较高的互信息表明路由器的专家概率质量与语言类别之间存在更强的关联。分配给专家 ee 的边际路由概率计算为:  

p(e) = \frac{\sum_{\tau\in T} r^{(l)}(\tau)[e]}{\sum_{e^{\prime}} \sum_{\tau\in T} r^{(l)}(\tau)[e^{\prime}]} (1)  

专家 e 与类别 c 之间的联合概率计算为:  

p(e,c) = \frac{\sum_{\tau\in T_c} r^{(l)}(\tau)[e]}{\sum_{c^{\prime}} \sum_{e^{\prime}} \sum_{\tau\in T_{c^{\prime}}} r^{(l)}(\tau)[e^{\prime}]} (2)  

其中 T 表示探针词元的完整集合,T_c 表示属于类别 c 的子集。然后计算互信息为:  

MI(E;C) = \sum_{e} \sum_{c} p(e,c) \log\left(\frac{p(e,c)}{p(e)p(c)}\right) (3)  

其中 p(e) 是分配给专家 e 的边际路由概率,p(c) 是路由词元属于类别 c 的边际概率。通过 p<0.01 p<0.01 的句子级置换检验评估鲁棒性。  

#### 3.0.2熵分析  
熵是第二个统计工具,衡量路由在专家中的分布程度:较高的熵表示专家使用分布更分散,较低的熵表示集中在较小的专家子集上。香农熵定义为:  

H(E) = -\sum_{e} p(e) \ln p(e) (4)  

其中 p(e) 是选择专家 e 的边际分布;当针对特定类别计算时,p(e) 仅根据该类别的探针词元估计,因此按类别熵衡量每个类别专家使用的集中或分散程度。  

Jensen-Shannon散度(JSD)衡量语言类别之间路由的差异,由下式给出:  

JSD\!\left(P(E|C_{i}) \;\|\; P(E|C_{j})\right) (5)  
= \frac{1}{2} D_{KL}\!\left(P(E|C_{i}) \;\|\; M\right) + \frac{1}{2} D_{KL}\!\left(P(E|C_{j}) \;\|\; M\right)  

其中 M = \frac{1}{2}\left(P(E|C_{i}) + P(E|C_{j})\right) M=\frac{1}{2}\left(P(E|C_{i}) + P(E|C_{j})\right)。  
我们在全文中报告其平方根,即 *Jensen-Shannon距离* d_{JS} = \sqrt{JSD} d_{JS}=\sqrt{JSD}:与散度本身不同,这是一个真正的度量6 (https://arxiv.org/html/2608.15102#bib.bib22),使得三个成对的类别分离可以直接比较。  

## 4方法论  

### 4.1数据集构建与探针标注  
数据集的英语部分基于FineWeb-Edu语料库11 (https://arxiv.org/html/2608.15102#bib.bib9)构建,德语部分基于mC4的德语部分21 (https://arxiv.org/html/2608.15102#bib.bib21)构建。该流程使用Stanza模块将每个句子中的单词分类为词汇、语法和句法类别。此分类的分类体系见附录A (https://arxiv.org/html/2608.15102#A1)。每个句子-类别对标注一个探针词元。一个句子可能包含属于多个语言类别的探针词元,因此可以出现在多个类别特定的数据集中。在这种情况下,该句子会在不同数据集间复制。

相似文章

混合专家语言模型中机器遗忘的路由感知专家校准

arXiv cs.CL

论文提出TRACE,一种用于混合专家语言模型中机器遗忘的方法,通过重新加权词元级保留损失来校准保留正则化,以解决遗忘-保留路由不匹配问题。实验表明,在多个MoE大语言模型上改善了遗忘-效用权衡。

通过有限专家库实现通信高效的专家路由

arXiv cs.LG

本文提出了一种针对稀疏混合专家(MoE)模型中通信高效专家路由的信息论框架,将门控机制视为随机信道,并推导实用的互信息估计器以分析有限专家库上的准确率-速率权衡。