MoEGen:用于实例自适应LoRA生成的专家混合方法
摘要
本文提出MoEGen,一种参数高效的微调框架,利用专家混合技术通过专家码和轻量级超网络生成实例自适应的LoRA更新,在不针对每个专家存储独立适配器的情况下提升了常识推理基准的性能。
arXiv:2608.03275v1 公告类型:新
摘要:参数高效微调(PEFT)能够高效地适配大型语言模型,但现有的基于MoE的PEFT方法通常通过存储多个完整的LoRA专家来提升容量,导致适配器存储量随专家数量线性增长,并将适配限制在固定的专家池内。我们探讨基于MoE的PEFT是否能够在无需为每个专家显式存储独立LoRA模块的情况下产生实例特定的适配。为弥补这一空白,我们提出MoEGen,一种将基于MoE的PEFT从专家选择转变为专家条件参数生成的适配框架。MoEGen并非将每个专家存储为完整的LoRA适配器,而是将每个专家表示为一个小的可学习向量,称为专家码。它在这些向量上路由每个输入,并利用其加权组合来调节一个轻量级超网络,从而生成输入特定的低秩更新。该设计将专家容量与适配器存储解耦,同时实现实例条件的适配。在八个常识推理基准上的实验表明,MoEGen在三个骨干网络上相较于强静态和基于MoE的PEFT基线均取得了一致的改进。MoEGen在医学和法律领域的联合适配中也表现出色。
查看缓存全文
缓存时间: 2026/08/05 07:44
# 面向实例自适应LoRA生成的混合专家
来源:https://arxiv.org/html/2608.03275
Yiming Zeng1,∗, Lei Lu2,∗, Zexin Li3, Zhuochun Li4, Shuoqiu Li5, Shuyi Liao1, Xidong Wu6, Zeyu Zhang7, Minmei Wang1, Yu Zhao8, Tingting Yu1,†, Shangqian Gao5,†
1康涅狄格大学
2东北大学
3南洋理工大学
4匹兹堡大学
5佛罗里达州立大学
6Google
7Amazon AGI
8辛辛那提大学
###### 摘要
参数高效微调\(PEFT\)能够有效适配大型语言模型,但现有的基于MoE的PEFT方法通常通过存储多个完整的LoRA专家来提升容量,导致适配器存储量随专家数量线性增长,并且适配能力局限于固定的专家池。我们提出疑问:基于MoE的PEFT能否在不显式为每个专家单独存储LoRA模块的情况下,实现实例特异的适配?为解决这一问题,我们提出了MoEGen,一个将基于MoE的PEFT从“专家选择”转变为“专家条件参数生成”的适配框架。MoEGen不将每个专家存储为完整的LoRA适配器,而是将每个专家表示为一个小的可学习向量,称为专家代码。它根据输入对这些向量进行路由,并利用其加权组合来条件化一个轻量级超网络,该超网络生成针对特定输入的低秩更新。这种设计将专家容量与适配器存储解耦,同时实现实例条件化的适配。在八个常识推理基准上的实验表明,在三个骨干模型上,相较于强静态和基于MoE的PEFT基线,该方法均取得了一致的性能提升。MoEGen在医学和法律领域联合适配中也表现出色。
MoEGen:面向实例自适应LoRA生成的混合专家
11footnotetext:共同贡献。22footnotetext:通讯作者。参见图注
图1:传统MoE与MoEGen的对比。MoEGen用紧凑的风格嵌入和共享超网络取代完整的 feed-forward 专家,用于生成输入特的LoRA。
## 1 引言
现代预训练LLM在广泛的自然语言处理任务中表现出卓越的性能\(Fedus et al. (2022) (#bib.bib43); Touvron et al. (2023a) (#bib.bib1); Chowdhery et al. (2022) (#bib.bib42); OLMo et al. (2025) (#bib.bib45))。然而,对于挑战性的领域特定下游任务,例如代码生成和数学推理\(Rozière et al. (2024) (#bib.bib50); Lewkowycz et al. (2022) (#bib.bib46)),模型适配是进一步提升任务性能的标准方式\(OpenAI et al. (2024) (#bib.bib4); Touvron et al. (2023a) (#bib.bib1))。虽然全量监督微调是一种有效的模型适配方法,但其计算成本高昂,且需要存储每个任务特定的模型副本,在资源受限环境中不够实用\(Aghajanyan et al. (2021) (#bib.bib37); Lialin et al. (2024) (#bib.bib36))。
参数高效微调\(PEFT\)方法通过仅更新一小部分模型参数,提供了模型适配的实用替代方案\(Li et al. (2023) (#bib.bib40); Tian et al. (2024) (#bib.bib48); Hu et al. (2022) (#bib.bib25); Liu et al. (2024b) (#bib.bib29))。例如,LoRA\(Hu et al. (2022) (#bib.bib25))在保持骨干参数冻结的同时学习低秩权重更新。近期的MoE-LoRA方法通过学习路由来选择或组合多个LoRA专家,进一步扩展了适配容量\(Dou et al. (2024) (#bib.bib32); Liu et al. (2024a) (#bib.bib34); Gao et al. (2025) (#bib.bib31))。然而,由于每个专家存储一组完整的低秩参数,适配器存储量随专家池大小线性增长,使得维护庞大且多样的适配空间成本高昂。
为解决这些局限性,我们提出了MoEGen,一个轻量级即插即用的适配框架,它从组合式潜在专家代码中合成输入特异的LoRA参数。MoEGen不将每个专家表示为完整的LoRA模块,而是将专家编码为小的可学习向量,称为专家代码,这些向量与目标模块维度无关。基于提示的路由在低维潜在空间中选择并组合多个专家代码,共享超网络从得到的专家代码混合物中合成输入特异的LoRA参数更新。与传统的MoE-LoRA方法(直接对存储的LoRA参数模块进行专家组合)不同,MoEGen在参数生成之前执行组合。这使专家容量与显式的骨干特定适配器存储解耦,并通过轻量级专家代码组合实现更大的适配空间。
总体而言,我们的贡献如下:
- **轻量级专家参数化。** MoEGen将每个专家表示为低维可学习代码,而非完整的LoRA适配器,大幅降低了维护多个专家的参数和存储成本。
- **动态输入条件化LoRA生成。** MoEGen为每个适配组件动态生成输入特异的低秩矩阵。通过根据每个输入的语义特征定制低秩更新,实现更有针对性的适配。
- **一致的实证性能。** 在八个常识推理基准上,MoEGen仅更新模型参数的0.44–0.52%,相较于最强竞争基线提升了0.6–1.1个百分点。在跨领域联合基准上进一步实现了4.6–6.2个百分点的提升。
## 2 相关工作
### 2.1 参数高效微调
参数高效微调\(PEFT\)通过仅更新预训练模型的一小部分参数来适配模型。基于适配器的方法\(Houlsby et al., 2019 (#bib.bib33); Pfeiffer et al., 2021 (#bib.bib39))在冻结的Transformer中插入可训练的瓶颈模块,而前缀微调\(Li and Liang, 2021 (#bib.bib35))则在输入前添加可学习的token。这些方法可能引入推理延迟,或在复杂任务上表达能力有限\(Han et al. (2024) (#bib.bib49))。LoRA\(Hu et al., 2022 (#bib.bib25))则在与冻结权重并行的方式下学习低秩权重更新。其扩展包括AdaLoRA中的自适应秩分配\(Zhang et al., 2023 (#bib.bib30))、DoRA中的方向与幅度分解\(Liu et al., 2024b (#bib.bib29)),以及LoftQ中的量化感知初始化\(Li et al., 2023 (#bib.bib40))。稀疏替代方法如SpIEL\(Ansell et al. (2024) (#bib.bib8))和SMT\(He et al. (2025) (#bib.bib24))更新选定的参数或子矩阵。然而,这些方法通常学习固定更新并统一应用于所有输入,而MoEGen则生成输入条件化的更新。
### 2.2 混合专家
混合专家\(MoE\)通过将输入稀疏路由到专家模块来增加模型容量\(Shazeer et al., 2017 (#bib.bib41))。Switch Transformer\(Fedus et al. (2022) (#bib.bib43))和GLaM\(Du et al. (2022) (#bib.bib44))展示了这种稀疏计算的有效性。MoELoRA\(Liu et al. (2024a) (#bib.bib34))和LoRAMoE\(Dou et al. (2024) (#bib.bib32))将MoE扩展到PEFT,在多个LoRA专家之间进行路由,而HydraLoRA\(Tian et al. (2024) (#bib.bib48))则引入了非对称专家结构。这些方法存储完整的LoRA专家,并在Transformer层内部进行路由,将专家容量与适配器存储耦合在一起。相比之下,MoEGen在轻量级专家代码上执行外部路由,并通过共享超网络生成输入条件化的LoRA参数。
参见图注
图2:MoEGen概述。冻结的句子编码器将输入提示xx映射为语义嵌入zz。对于每个适配组件ll,zz与可学习的组件嵌入l(l)\ell^{(l)}拼接,并投影为h(l)=Wr[z;l(l)]h^{(l)}=W_{r}[z;\ell^{(l)}]用于稀疏专家代码路由。选定的专家代码与组件局部坐标pj(l)p_{j}^{(l)}共同条件化共享超网络,生成候选LoRA AA矩阵。这些候选被混合为Amix(l)A_{\mathrm{mix}}^{(l)},并与静态矩阵B(l)B^{(l)}结合形成动态低秩更新,应用于冻结权重W(l)W^{(l)}。
## 3 方法
### 3.1 概述
MoEGen由四个模块组成:一个冻结的预训练LLM、一个冻结的提示编码器、一个稀疏MoE路由器和一个共享的LoRA超网络。对于每个输入,提示编码器生成上下文嵌入,路由器利用该嵌入选择少量专家代码。这些专家代码不直接存储LoRA参数,而是作为紧凑的条件向量,引导超网络生成动态LoRA矩阵。
我们将MoEGen应用于每个解码器块的注意力投影,包括查询、键、值和输出投影;我们将每个适配的投影称为一个组件。对于具有冻结权重W(l)∈Rdout×dinW^{(l)}\in\mathbb{R}^{d_{\mathrm{out}}\times d_{\mathrm{in}}}的组件,MoEGen生成低秩更新ΔW(l)∈Rdout×din\Delta W^{(l)}\in\mathbb{R}^{d_{\mathrm{out}}\times d_{\mathrm{in}}},并计算适配输出为
y=W(l)x+αrΔW(l)x,y=W^{(l)}x+\frac{\alpha}{r}\Delta W^{(l)}x,(1)
其中x∈Rdinx\in\mathbb{R}^{d_{\mathrm{in}}},y∈Rdouty\in\mathbb{R}^{d_{\mathrm{out}}},rr为LoRA秩,α\alpha为LoRA缩放因子。低秩更新分解为ΔW(l)=B(l)(A(l))⊤\Delta W^{(l)}=B^{(l)}(A^{(l)})^{\top},其中B(l)∈Rdout×rB^{(l)}\in\mathbb{R}^{d_{\mathrm{out}}\times r},A(l)∈Rdin×rA^{(l)}\in\mathbb{R}^{d_{\mathrm{in}}\times r},且r≪min(din,dout)r\ll\min(d_{\mathrm{in}},d_{\mathrm{out}})。原始LLM参数从不修改。
### 3.2 基于紧凑专家代码的逐组件语义路由
MoEGen维护一个包含NN个可训练专家代码{E1,...,EN}\{E_{1},\ldots,E_{N}\}的共享池,其中Ei∈RdhE_{i}\in\mathbb{R}^{d_{h}},所有LL个组件共享该池。由于所有组件共享公共门控投影WgW_{g},路由参数保持紧凑。
对于每个输入提示xx,我们使用冻结的句子编码器\(Zhang et al. (2025) (#bib.bib10))fenc:X→Rdzf_{\mathrm{enc}}:\mathcal{X}\rightarrow\mathbb{R}^{d_{z}}获得语义上下文嵌入z=fenc(x)z=f_{\mathrm{enc}}(x)。编码器在训练期间保持固定,以保留通用语义表示并降低优化成本。然后,轻量级路由器frf_{\mathrm{r}}将此共享语义嵌入映射为组件特定的路由特征:
fr(z)\displaystyle f_{\mathrm{r}}(z)=[h(1),...,h(L)],\displaystyle=[h^{(1)},\ldots,h^{(L)}],(2)
H\displaystyle H=[(h(1))⊤⋯(h(L))⊤]⊤∈RL×dh.\displaystyle=\begin{bmatrix}(h^{(1)})^{\top}&\cdots&(h^{(L)})^{\top}\end{bmatrix}^{\top}\in\mathbb{R}^{L\times d_{h}}.
其中LL是适配LoRA组件的数量(即解码器层中的目标投影),每一行h(l)∈Rdh h^{(l)}\in\mathbb{R}^{d_{h}}表示组件ll的路由特征。
为实现组件特定特化,我们为每个组件关联一个可学习嵌入l(l)∈Rdl\ell^{(l)}\in\mathbb{R}^{d_{\ell}},并将其与共享提示嵌入拼接:
h(l)=Wr[z;l(l)],h^{(l)}=W_{r}[z;\ell^{(l)}],(3)
其中[⋅;⋅][\cdot;\cdot]表示向量拼接,Wr∈Rdh×(dz+dl)W_{r}\in\mathbb{R}^{d_{h}\times(d_{z}+d_{\ell})}为共享投影矩阵。这种表述允许路由器建模提示级语义与组件特定身份之间的交互,同时仅需要dh(dz+dl)+Ldl d_{h}(d_{z}+d_{\ell})+Ld_{\ell}个参数。
每个专家代码EiE_{i}是紧凑的条件向量,而不是完整的LoRA适配器:它编码了一种适配风格,超网络(第3.3节)随后将其扩展为组件特定的LoRA矩阵。对于每个组件ll,路由特征h(l)h^{(l)}首先通过一个非线性块,然后投影为专家logits:
h~(l)\displaystyle\tilde{h}^{(l)}=GELU(LN(h(l))),\displaystyle=\mathrm{GELU}\!\left(\mathrm{LN}\!\left(h^{(l)}\right)\right),(4)
g(l)\displaystyle g^{(l)}=Wgh~(l)+bg.\displaystyle=W_{g}\tilde{h}^{(l)}+b_{g}.
接着我们执行top-kk选择并对所选logits进行归一化:
T(l)\displaystyle\mathcal{T}^{(l)}=TopK(g(l),k),\displaystyle=\operatorname{TopK}\!\left(g^{(l)},k\right),(5)
wi(l)\displaystyle w_{i}^{(l)}=exp(gi(l))∑j∈T(l)exp(gj(l)),i∈T(l).\displaystyle=\frac{\exp\!\left(g_{i}^{(l)}\right)}{\sum_{j\in\mathcal{T}^{(l)}}\exp\!\left(g_{j}^{(l)}\right)},\quad i\in\mathcal{T}^{(l)}.
这里,T(l)⊆{1,...,N}\mathcal{T}^{(l)}\subseteq\{1,\ldots,N\}是对应于g(l)g^{(l)}中kk最大条目的索引集合。T(l)\mathcal{T}^{(l)}之外的专家权重为零。
### 3.3 专家条件化LoRA生成
对于每个适配组件ll,MoEGen动态生成LoRA的AA矩阵,同时保持可训练的静态BB矩阵。这种非对称设计使生成部分保持轻量:输入条件化部分由超网络合成,而输出投影侧在所有输入之间共享。
在MoEGen中,专家代码被用作参数生成的条件向量。我们为每个适配组件引入组件局部嵌入P(l)∈Rdin×dhP^{(l)}\in\mathbb{R}^{d_{\mathrm{in}}\times d_{h}},其中第jj行pj(l)∈Rdhp_{j}^{(l)}\in\mathbb{R}^{d_{h}}作为第jj个输入维度的可学习坐标。
给定选定的专家代码Ei∈RdhE_{i}\in\mathbb{R}^{d_{h}},我们使用共享超网络逐行生成相应的LoRA AA矩阵。该超网络在所有组件、专家和输入维度之间共享。对于第ll个目标组件的第jj个输入维度,它接收可学习坐标嵌入pj(l)∈Rdhp_{j}^{(l)}\in\mathbb{R}^{d_{h}}与专家代码EiE_{i}的拼接,并输出LoRA AA矩阵的一行:
ai,j(l)=Linear([pj(l);Ei]),ai,j(l)∈Rr.a_{i,j}^{(l)}=\mathrm{Li相似文章
HELLoRA:面向混合专家模型的热门专家层级别低秩适配
HELLoRA 为混合专家模型引入了激活感知的适配器放置策略,仅将 LoRA 附加到热门专家上,从而减少参数和 FLOPs,同时提升在推理、代码和安全任务上的性能。
ACE:MoE大语言模型参数高效微调的跨专家适配器整合
ACE提出了一种方法,用于整合MoE大语言模型中跨专家的冗余适配器,以实现更高效的参数高效微调,训练速度提升最高可达1.48倍,且不增加峰值内存。
SAMoRA:面向任务自适应学习的语义感知 LoRA 专家混合
SAMoRA 通过引入语义感知路由器和任务自适应缩放,在 MoE-LoRA 微调中提升专家专业化与动态加权,在多任务基准上显著优于现有方法。
MoE$^2$-LoRA:当MoE模型遇上MoE风格的低秩适配
MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。