ACE:MoE大语言模型参数高效微调的跨专家适配器整合

arXiv cs.LG 论文

摘要

ACE提出了一种方法,用于整合MoE大语言模型中跨专家的冗余适配器,以实现更高效的参数高效微调,训练速度提升最高可达1.48倍,且不增加峰值内存。

arXiv:2609.06072v1 公告类型:新 摘要:参数高效微调(PEFT)的混合专家(MoE)模型通常为每个专家附加一个独立的低秩适配器。这种专家级设计在三个方面分散了适应性:容量被分割为狭窄的低秩更新,梯度监督在稀疏路由下变得稀疏且不平衡,执行被分解为许多小型通用矩阵乘法(GEMM)。我们发现,这种专家级分离通常是不必要的,因为在微调过程中,部分LoRA适配器会变得功能相似,揭示了专家特定适配器之间的冗余。基于此冗余,我们提出了ACE(跨专家适配器整合),它将冗余专家分组,并在相同的PEFT预算下,用组共享的高秩LoRA模块替换其专家特定适配器。ACE进一步引入了分组适配器执行,将分散的专家级适配器计算整合为更少的、更大的组级通用矩阵乘法。在覆盖12个数据集和四个MoE骨干网络的评估中,ACE在三个具有完整基线覆盖的骨干网络上,实现了参数匹配的PEFT方法中最高的平均准确率,同时提供1.31倍至1.48倍的时钟训练加速,且不增加峰值内存。我们的代码可在https://github.com/UbiquitousAILab/ACE获取。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:31

# 跨专家适配器整合用于MoE大语言模型的参数高效微调
来源:https://arxiv.org/html/2609.06072
作者:Sehyun Yun、Joonha Park、Taesik Gong  
隶属机构:蔚山科学技术院 (UNIST)  
通讯地址:韩国蔚山  
邮箱:[\{ahin,nawhji,joonhapark,taesik\.gong\}@unist\.ac\.kr](mailto:)

###### 摘要
混合专家模型(MoE)的参数高效微调(PEFT)通常为每个专家附加独立的低秩适配器。这种专家级设计在三个维度上导致适应过程的碎片化:容量被分割为窄带低秩更新;在稀疏路由下梯度监督变得稀疏且不均衡;执行过程被分解为众多小型矩阵乘法(GEMM)。我们发现这种专家级分离通常并非必需,因为在微调过程中LoRA适配器子集会变得功能相似,暴露出专家特定适配器间的冗余性。基于此冗余特性,我们提出 **ACE(跨专家适配器整合)** 方法,该方法将冗余专家分组,并在相同PEFT预算下,用组共享的高秩LoRA模块替代其专家特定适配器。ACE进一步引入分组适配器执行机制,将碎片化的专家级适配器计算整合为更少、更大的组级矩阵乘法运算。在涵盖12个数据集和四个MoE骨干模型的评估中,ACE在三个具有完整基线覆盖的骨干模型上实现了参数匹配PEFT方法中的最高平均准确率,同时相比专家级LoRA实现了1.31×至1.48×的实际训练加速且未增加峰值内存占用。我们的代码已开源于https://github.com/UbiquitousAILab/ACE。

## 1 引言
混合专家(MoE)模型通过仅激活每个输入的专家子集来扩展模型容量,使其能在不按比例增加每token计算量的情况下增加参数量(Shazeer等,2017;Fedus等,2022;Du等,2022)。这种高效性使得MoE架构在大语言模型中日益流行(Grattafiori等,2024;OpenAI等,2024;Dai等,2024)。然而,将MoE模型适配到下游任务仍具挑战。尽管稀疏路由降低了每token计算量,但MoE模型在众多专家中仍包含海量参数,使得全量微调比同等规模的稠密模型更为昂贵复杂(Dai等,2024;Kim等,2021;Aminabadi等,2022)。这些挑战推动了参数高效微调(PEFT)方法的发展,如LoRA(Hu等,2022)。

LoRA最初为稠密架构设计,通常通过为每个目标模块附加独立低秩适配器实现。将其直接扩展至MoE模型的专家模块时,同样会为每个专家附加独立适配器(Hu等,2022;Meng等,2024)。虽然这种设计很自然,但与稀疏路由结合时会导致碎片化,体现在三个维度:容量、监督和执行。

首先,在固定可训练参数预算下,为众多专家分配独立适配器限制了每个专家可用的秩。其次,每个适配器仅接收路由至其专家的token产生的梯度,导致梯度监督稀疏且专家间不均衡。第三,适配器执行被分解为多个小型矩阵乘法(GEMM)运算,引发重复的启动开销和硬件利用率低下。参见图1说明。

**图1:ACE概览**
左图:标准专家级LoRA为每个专家分配独立的秩-r适配器,导致适应容量碎片化、更新稀疏并产生大量小型计算。  
右图:ACE将具有相似适配器诱导表示的专家分组,并在相同可训练参数预算下用组共享的高秩适配器替代其独立适配器。每个共享适配器由其组内所有专家更新且每组仅计算一次,从而提升容量、监督密度和执行效率。

若每个专家需要不同的任务特定适配器,这种碎片化将不可避免。但我们发现专家特定LoRA适配器常存在冗余:在微调过程中,同一MoE层内的适配器会形成功能相似的分组。基于此观察,我们提出**ACE(跨专家适配器整合)**,一种适用于MoE模型的PEFT方法,它将功能相似的专家适配器整合为组共享的高秩LoRA模块。在每个MoE层中,ACE在任务相关输入上测量适配器相似度,将相似专家分组,并在相同可训练参数预算下用共享的高秩适配器替代各组专家特定适配器。这种重新分配汇集了碎片化的适应容量,并使每个共享适配器在其组内任何专家激活时都能接收梯度。执行方面,ACE执行分组适配器计算,将碎片化的专家级适配器计算整合为更少的组级运算,减少小型GEMM开销。

图1概述了ACE及其关键组件:基于相似度的分组、秩整合、共享更新和分组适配器执行。在涵盖12个数据集和四个MoE骨干模型的评估中,ACE在参数匹配预算下持续提升适应质量和训练效率。例如在OLMoE模型上,ACE将八个常识基准的平均准确率从74.11%提升至75.61%(+1.50点),相比专家级LoRA实现了1.31×–1.48×的实际训练加速且未增加峰值内存。这些结果表明,在相同可训练参数预算下,基于相似度的适配器整合能同时提升适应质量和执行效率。

## 2 相关工作
##### 参数高效微调
参数高效微调(PEFT)通过仅训练少量额外参数来适配大型预训练模型,同时保持骨干网络冻结(Houlsby等,2019;Li和Liang,2021;Lester等,2021;Karimi Mahabadi等,2021;Li等,2024)。在众多PEFT方法中,低秩适配(LoRA)已成为标准方法,因其能高效参数化权重更新而不改变骨干架构(Hu等,2022;Dettmers等,2023)。后续工作通过秩分配或替代低秩参数化改进了固定可训练参数预算的使用(Zhang等,2023;Liu等,2024;Meng等,2024)。然而,这些方法针对稠密架构设计,其中每个适配模块接收所有输入的梯度。该假设在MoE层中失效,因适配器分布于稀疏且不均衡激活的专家中。我们的工作通过研究固定LoRA预算在此类路由下应如何组织,解决了MoE特有的结构错配问题。

##### MoE模型微调
混合专家(MoE)架构通过仅激活每个输入的专家子集来扩展模型容量(Shazeer等,2017;Fedus等,2022;Du等,2022)。然而,大量专家参数增加了下游适配微调的成本。为降低此成本,先前工作探索了MoE模型的选择性或路由适应策略,主要关注应调整哪些专家或模块。ESFT(Wang等,2024)微调与目标任务最相关的专家。PERFT(Liu等,2026)提出PERFT-R,将MoE式路由应用于LoRA适配器以进行MoE微调。EPnG(Lee等,2026)基于路由重要性在专家间重新分配LoRA容量。相比之下,ACE保持预训练专家和路由器完整,并通过将功能相似的适配器整合为共享的组级模块来解决专家级LoRA碎片化问题。

## 3 方法论
### 3.1 问题:MoE LoRA中的碎片化
我们首先识别专家级LoRA与稀疏MoE路由间的结构错配。考虑一个拥有E个专家的MoE层,路由器为输入x激活一个大小为k≪E的稀疏专家子集R(x)。直接的LoRA扩展为每个专家e分配独立的低秩更新ΔW_e,产生适配后的专家权重\(\widetilde{W}_e = W_e + \Delta W_e\),其中ΔW_e = B_e A_e。令p_e(x)表示路由器为输入x分配给专家e的概率,则层输出为:
\[
y(x) = \sum_{e \in \mathcal{R}(x)} p_e(x) (W_e x + \Delta W_e x)
\]
尽管简单,但这种专家级设计沿三个耦合维度碎片化适应过程。

#### 3.1.1 容量碎片化
在固定层级适配器预算\(\mathcal{B}\)下,专家级LoRA将参数分配至各专家。对于专家e,秩-r_e的LoRA适配器包含(d_in + d_out)r_e个可训练参数,因此层级预算为\(\mathcal{B} = \sum_{e=1}^{E} (d_{\mathrm{in}} + d_{\mathrm{out}}) r_e\)。若均匀分配该预算,每个专家获得r_e = \(\mathcal{B} / [E(d_{\mathrm{in}} + d_{\mathrm{out}})]\)。因此,专家数量线性减少每个适配器可用的秩。预算被分割为E个窄带低秩更新,而非形成更强的任务特定修正。

#### 3.1.2 梯度碎片化
稀疏路由也碎片化梯度监督。对于训练批次X = {x_n}_{n=1}^N,专家e的适配器仅接收路由至该专家的token产生的梯度:
\[
\nabla_{\Delta W_e} \mathcal{L} \propto \sum_{x_n \in \mathcal{X}} \mathbf{1}[e \in \mathcal{R}(x_n)] p_e(x_n) \nabla_{y(x_n)} \mathcal{L} \, x_n^{\top}
\]
指示函数\(\mathbf{1}[e \in \mathcal{R}(x_n)]\)将非路由token的贡献置零。若路由均衡,每个适配器平均仅被k/E比例的批次更新。实践中路由常不均衡(Shazeer等,2017;Dai等,2024),因此某些适配器接收更少更新。专家级LoRA因此不仅分割参数,还分割学习信号,产生稀疏且不均衡的适配器更新。

#### 3.1.3 执行碎片化
最后,专家级LoRA碎片化执行过程。每个激活的适配器需要两个小型GEMM运算:h_e = A_e x,ΔW_e x = B_e h_e。在批次中,这些运算为众多激活专家和路由token子集单独调用,产生大量小型适配器侧GEMM而非较少的大型矩阵乘法。此类小型GEMM在GPU上效率低下,因引发重复启动开销和利用率不足(NVIDIA Corporation,2026)。因此,即使小型LoRA预算在复制至众多专家时也可能引入不可忽略的运行时开销。

这三种效应源于专家级LoRA的共同设计选择:每个专家拥有独立适配器,而每个输入仅激活专家子集。这引出一个核心问题:*专家适配器是否必须保持独立?*

### 3.2 动机:专家LoRA适配器的功能分组
上述专家级分离在实践中常非必需。微调期间,同一MoE层内的LoRA适配器频繁形成功能相似的分组。这些组内的适配器在共享任务相关输入上产生相似的适配器诱导表示。我们通过在共享探测集上计算适配器输出的成对相似度来量化此行为,详见第3.3节。

**图2:专家LoRA适配器的功能相似性**
每个热图显示一个MoE层内的成对CKA相似度,x轴和y轴表示专家索引。值越接近1表示适配器诱导表示越相似。高相似度块揭示了具有相似LoRA修正的专家组。各子图对应OLMoE在HellaSwag数据集上的第0、4、14层门控投影层,完整细节见附录F。

图2显示了高相似度块,表明某些适配器学习了相似的任务特定修正,而其他适配器保持独特。这促使ACE将功能相似的适配器整合为共享的高秩模块,而非保留众多低秩专家特定适配器。ACE利用此功能分组结构,通过秩整合(第3.3节)汇集碎片化容量,通过共享适配器更新(第3.4节)稠密化梯度监督,并通过分组适配器执行(第3.5节)减少小型GEMM碎片化。

### 3.3 秩整合
ACE首先在每个MoE层中识别功能相似的专家适配器,并在相同可训练参数预算下整合其碎片化秩。在短时热身T_init步后,我们收集探测隐藏状态集X_probe = {x_n}_{n=1}^N,其中x_n ∈ ℝ^{d_in}。相同的探测输入被馈送至层内所有专家适配器,无论其原始路由决策如何,以使相似度反映适配器行为而非路由频率。对于专家e,我们构建适配器诱导表示矩阵:
\[
Z_e = \begin{bmatrix}
(\Delta W_e x_1)^{\top} \\
\cdots \\
(\Delta W_e x_N)^{\top}
\end{bmatrix} \in \mathbb{R}^{N \times d_{\mathrm{out}}}
\]
我们对探测样本上的每个表示矩阵进行均值中心化...

相似文章

任务感知的基于MoE大型语言模型的联邦微调

arXiv cs.LG

本文提出了FedTAR,一种针对基于MoE的大型语言模型的任务感知联邦微调方法,该方法通过将本地更新与任务偏好对齐,以在异构数据下保留专家专业化并提高性能。

MoEGen:用于实例自适应LoRA生成的专家混合方法

arXiv cs.CL

本文提出MoEGen,一种参数高效的微调框架,利用专家混合技术通过专家码和轻量级超网络生成实例自适应的LoRA更新,在不针对每个专家存储独立适配器的情况下提升了常识推理基准的性能。

ConMoE: 基于原型重分配的专家池整合实现MoE压缩

arXiv cs.AI

ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。