MoE$^2$-LoRA:当MoE模型遇上MoE风格的低秩适配
摘要
MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。
arXiv:2607.21978v1 公告类型:新
摘要:混合专家(MoE)架构已在大型语言模型中被广泛采用,然而针对 MoE 模型的参数高效微调(PEFT)仍未被充分探索。现有的 MoE PEFT 方法要么忽视路由先验而使用统一适配器,降低了效率并增加了遗忘风险,要么依赖静态专家选择,限制了每令牌容量和跨专家特征学习。本文首次尝试以 MoE 风格的低秩适配微调 MoE 模型:我们的方法名为 MoE$^2$-LoRA,通过一个双通道路由条件投影(RCP)模块,将预训练的专家专业性与任务特定的自适应性深度融合,该模块重用基础路由激活来指导 LoRA 路由。我们还引入了一个跨所有层共享的全局 LoRA 专家池,实现了具有涌现逐层亲和性和平衡专家利用率的全模型适配。MoE$^2$-LoRA 同时受益于先验重用、动态适配器路由和全模型知识共享的优势。在多个不同规模和专家粒度的 MoE 主干网络上进行评估,MoE$^2$-LoRA 在保持更强通用能力的同时,始终取得了最先进的下游准确率。
查看缓存全文
缓存时间: 2026/07/27 07:39
# MoE2-LoRA: 当MoE模型遇上MoE风格的低秩适配 来源:https://arxiv.org/html/2607.21978 Qingyu Yang¹,²,∗ Haonan He¹,³,∗,† Minglei Li¹,⁴ Jingqi Ye¹,³ Tao Chen¹ Lei Bai¹ Peng Ye¹,⁴,⁵,‡ ¹上海人工智能实验室 ²KTH皇家理工学院 ³中国科学技术大学 ⁴复旦大学 ⁵香港中文大学 * 同等贡献。† 项目负责人。‡ 通讯作者。邮箱:[email protected] ###### 摘要 混合专家(MoE)架构已在大型语言模型中广泛采用,然而针对MoE模型的参数高效微调(PEFT)仍探索不足。现有的MoE PEFT方法要么使用统一适配器忽略路由器先验,降低效率并面临遗忘风险;要么依赖静态专家选择,限制了每token容量和跨专家特征学习。本文首次尝试使用MoE风格的低秩适配来微调MoE模型:我们的方法名为MoE2-LoRA,通过一个双通道路由条件投影(RCP)模块,将预训练的专家专长与任务特定适应性深度融合,该模块重用基础路由器激活来指导LoRA路由。我们进一步引入一个跨所有层共享的全局LoRA专家池,实现具有涌现的层间亲和性和均衡专家利用率的模型范围适应。MoE2-LoRA同时受益于先验重用、动态适配器路由和模型范围知识共享的优势。在不同规模和专家粒度的多个MoE骨干上评估,MoE2-LoRA在取得最先进的下游任务精度的同时,保持了更强的通用能力。 # MoE2-LoRA: 当MoE模型遇上MoE风格的低秩适配 Qingyu Yang¹,²,∗ Haonan He¹,³,∗,† Minglei Li¹,⁴ Jingqi Ye¹,³ Tao Chen¹ Lei Bai¹ Peng Ye¹,⁴,⁵,‡ ¹上海人工智能实验室 ²KTH皇家理工学院 ³中国科学技术大学 ⁴复旦大学 ⁵香港中文大学 * 同等贡献。† 项目负责人。‡ 通讯作者。邮箱:[email protected] ## 1 引言 混合专家(MoE)架构 (Jacobs et al., 1991 (https://arxiv.org/html/2607.21978#bib.bib17)) 对每个输入仅激活一小部分参数,由于其在推理效率和与密集模型相当的扩展性能方面的优势,最近已被大型语言模型(LLMs)如 DeepSeek-V3 (Liu et al., 2024a (https://arxiv.org/html/2607.21978#bib.bib21)) 和 Qwen3 (Yang et al., 2025 (https://arxiv.org/html/2607.21978#bib.bib35)) 广泛采用。对于基于密集架构的LLM,有效且高效的微调方法已被深入研究。例如,LoRA (Hu et al., 2022 (https://arxiv.org/html/2607.21978#bib.bib16)),一种为密集模型设计的最广泛使用的参数高效微调(PEFT)方法之一,通过将权重更新分解为低秩子空间来匹配全微调的性能。相比之下,如何高效微调MoE模型仍是一个探索不足的问题,这主要归因于其稀疏激活性质、不稳定的梯度流以及庞大的参数量,凸显了专门为MoE模型定制PEFT方法的迫切需求。 现有的MoE模型PEFT方法主要建立在将LoRA适配器应用于MoE专家上(图1 (https://arxiv.org/html/2607.21978#S1.F1)(I.a)),并进一步尝试利用MoE模型的路由先验来指导专家级别的适应,即决定哪些专家应该接受适应或接受多少适应(图1 (https://arxiv.org/html/2607.21978#S1.F1)(I.b))。例如,ESFT (Wang et al., 2024 (https://arxiv.org/html/2607.21978#bib.bib32)) 和 DAS-LoRA (Tang et al., 2026 (https://arxiv.org/html/2607.21978#bib.bib31)) 首先收集离线路由统计信息以识别关键专家子集,然后仅对这些专家应用LoRA;DR-LoRA (Deng et al., 2026 (https://arxiv.org/html/2607.21978#bib.bib7)) 基于路由频率和梯度重要性自适应地为专家分配更高的秩。虽然这些方法提高了参数效率,但它们仍然面临两个主要限制:(i) 关键专家适应不足。通过选择可训练专家子集或高秩专家,任何不属于该子集但在推理时被激活的专家都得不到足够的任务特定更新。(ii) 缺乏高层交互:独立地适应专家忽略了共同激活专家之间的协作动态以及MoE模型的跨层交互(图5 (https://arxiv.org/html/2607.21978#S5.F5)),而这本可以提升性能并减少参数冗余。 图1:(I) MoE上的PEFT方法比较:(a) 每专家LoRA,为每个MoE专家配备一个LoRA适配器;(b) 静态专家子集选择方法,离线选择专家子集使用LoRA训练;(c) MoELoRA风格方法,使用MoE风格的低秩适配器适应每个MoE模块;(d) MoE2。(II) 注释。(III) LoRA专家偏好:我们展示了MoE2全局专家池中LoRA专家的偏好层,展示了MoE2的层特定学习和跨层学习能力。 为了解决这些限制,我们寻求使用专用的MoE机制来微调MoE模型,将适应的视野从单个专家转移到每个MoE模块和整个MoE模型。这一方向与另一条研究线——将LoRA与MoE结构集成(图1 (https://arxiv.org/html/2607.21978#S1.F1)(I.c))——产生共鸣,由此产生了MoE风格的LoRA方法,如MoELoRA (Luo et al., 2024 (https://arxiv.org/html/2607.21978#bib.bib25)) 和 MoLA (Gao et al., 2025 (https://arxiv.org/html/2607.21978#bib.bib10))。然而,这些方法并非专门为MoE模型设计:它们的MoE机制独立于MoE模型固有的机制运行,因此未利用基础MoE模型中编码的专家交互和跨层交互。鉴于此,如果能够将MoE模型和MoE风格LoRA的两种MoE机制深度绑定,我们就可能缓解上述限制。这些观察自然引出一个统一的问题: **当MoE模型遇到MoE风格的低秩适配时,我们如何在MoE模块级别和MoE模型级别深度绑定这两种MoE机制,从而在保持通用能力的同时提升任务性能?** 为回答这个问题,我们引入了 MoE2-LoRA(图1 (https://arxiv.org/html/2607.21978#S1.F1)(I.d)),一种专为MoE模型定制的MoE风格低秩适配方法。其核心是路由条件投影(RCP)模块,该模块重用预训练的MoE路由激活来驱动LoRA专家选择。具体来说,RCP融合两个路由信号:携带着基础路由器激活的主通道z以及一个辅助通道hc,后者注入任务特定的校正。一个可学习矩阵Wl将拼接后的输入映射到LoRA路由空间,从而产生与基础模型专家选择耦合的LoRA专家选择。此外,为了实现模型级知识共享,我们维护一个跨所有MoE层共享的全局LoRA专家池。如图1 (https://arxiv.org/html/2607.21978#S1.F1)(III)所示,这种设计产生了一个引人注目的涌现特性:每个LoRA专家都形成了明显的层亲和性,同时仍对其他层有较小程度的贡献,并且专家在层间的总体分配高度均匀。这表明全局池实现了模型范围的跨层知识共享,具有高参数利用率,避免了层特定适配器的孤立和冗余。因此,我们的MoE2-LoRA统一了三个关键特性:预训练路由先验重用、MoE风格的LoRA专家选择,以及通过全局专家池实现的模型级跨层学习。 配备这种模型级设计后,MoE2-LoRA在四个不同规模和专家粒度的MoE骨干——OLMoE-1B-7B (Muennighoff et al., 2024 (https://arxiv.org/html/2607.21978#bib.bib27))、DeepSeek-V2-Lite (Liu et al., 2024a (https://arxiv.org/html/2607.21978#bib.bib21))、Qwen3-30B-A3B (Yang et al., 2025 (https://arxiv.org/html/2607.21978#bib.bib35)) 和 Qwen3.5-35B-A3B (Qwen Team, 2026 (https://arxiv.org/html/2607.21978#bib.bib28))——上取得了最先进的下游任务精度,在域内平均准确率上比最强的PEFT基线高出最多+2.56个百分点,同时展现出优秀的通用能力保持性。 我们的贡献总结如下: - • 我们诊断了现有MoE模型PEFT方法的两个关键限制,并引入了使用MoE风格PEFT微调MoE模型的原则,这要求深度绑定两种MoE机制并建立模块级和模型级的交互。这一原则统一了专家级、模块级和模型级适应,克服了已识别的限制,并为我们的方法设计奠定了基础。 - • 我们提出了MoE2-LoRA,通过两个关键组件实现这一洞见:(1) 路由条件投影(RCP)模块,重新利用基础路由器的激活来驱动LoRA专家选择;(2) 一个跨所有MoE层共享的单一全局LoRA专家池。如图1 (https://arxiv.org/html/2607.21978#S1.F1)(I)所示,全局池产生了涌现的层亲和性和均衡的专家利用率,实现了高效的模型范围知识共享。 - • 在四个MoE骨干(OLMoE-1B-7B、DeepSeek-V2-Lite、Qwen3-30B-A3B、Qwen3.5-35B-A3B)和多个基准(数学、代码、通用、多模态)上,MoE2-LoRA达到了最先进的下游任务性能和通用能力保持性,在任务和通用性能上都优于基础模型。 ## 2 相关工作 ### 2.1 PEFT和LoRA LLM扩展到数十亿参数使得传统的全微调在计算上不可行。这一瓶颈促进了PEFT技术的广泛采用,以LoRA为代表,因其即插即用的可部署性、强大的下游任务性能和零推理延迟。通过将更新限制在少量可训练参数上,这些方法实现了资源高效的模型适应,同时保持了模型的原始推理成本。尽管LoRA在许多场景下匹配了全微调的性能,但在科学推理和编码等挑战性任务上仍存在差距。这一差距已被最近一系列改进LoRA算法的工作广泛研究并有效缩小。例如,LoRA+ (Hayou et al., 2024 (https://arxiv.org/html/2607.21978#bib.bib12)) 解耦了低秩适配器中下投影和上投影权重的学习率,有效增强了标准LoRA的训练稳定性。GoRA (He et al., 2025 (https://arxiv.org/html/2607.21978#bib.bib13)) 基于梯度信息自适应地为适配器分配秩,从而增强了参数利用率。类似地,MoELoRA (Luo et al., 2024 (https://arxiv.org/html/2607.21978#bib.bib25))、MoLA (Gao et al., 2025 (https://arxiv.org/html/2607.21978#bib.bib10)) 和 LoRAMoE (Dou et al., 2023 (https://arxiv.org/html/2607.21978#bib.bib8)) 等方法通过集成MoE机制改进了LoRA的性能。 ### 2.2 面向MoE模型的PEFT PEFT方法主要在密集模型上实现和评估,并未针对MoE架构进行定制。现有的关于MoE模型PEFT方法的研究仍然稀少且缺乏充分的比较。尽管PERFT (Liu et al., 2026 (https://arxiv.org/html/2607.21978#bib.bib23)) 简要研究了使用LoRA训练MoE模型的各种策略,但大多数面向MoE模型的PEFT方法都集中在选择要微调的专家,或基于路由统计信息和专家重要性信息为MoE专家的适配器自适应分配秩。例如,ESFT (Wang et al., 2024 (https://arxiv.org/html/2607.21978#bib.bib32)) 分析路由器在下游任务数据上的输出概率分布,并据此选择要微调的专家子集;MoE-Sieve (Manzoni, 2026 (https://arxiv.org/html/2607.21978#bib.bib26)) 在一个小型校准数据集上统计每个专家每层接收的token数量,然后仅对选中的专家应用LoRA适配器;CEFT (Bai et al., 2025 (https://arxiv.org/html/2607.21978#bib.bib2)) 识别逐步放大对相关上下文信息关注的专家,并选择性地仅微调这些专家;DR-LoRA (Deng et al., 2026 (https://arxiv.org/html/2607.21978#bib.bib7)) 根据一个联合考虑路由频率和基于梯度的秩重要性的专家显著性分数,在专家间分配异质LoRA秩。 ## 3 方法 ### 3.1 MoE路由和LoRA 一个MoE层包含一个路由器G(·)和NE个前馈专家{Ei}i=1^NE。给定一个token表示h∈R^D,路由器产生logits z=G(h)并激活前K个专家集合Sh。MoE输出为: MoE(h) = Σ_{i∈Sh} gi(h) Ei(h) 其中gi(h)是归一化的路由权重。LoRA将预训练权重W∈R^{d_out×d_in}的低秩更新参数化为: ΔW = (α/r) B A 其中A∈R^{r×d_in},B∈R^{d_out×r},且r≪min(d_out, d_in)。在MoE上的PEFT中,预训练的路由器和专家被冻结,仅优化引入的适配器参数。 ### 3.2 路由条件投影 (Wl) MoE2-LoRA引入了一个额外的LoRA专家池{Ej^LoRA}j=1^NL,并学习对该池的每token路由pL∈R^NL。关键设计在于**路由输入**:MoE2-LoRA不使用原始隐藏状态h学习路由,也不将其硬编码为与基础路由一致,而是使用**双通道输入**: (1) 主通道:基础路由器logits z=G(h)∈R^NE。这为LoRA专家选择提供了直接预训练的路由信号,而不是从头开始完全学习路由。 (2) 辅助通道:隐藏状态的低秩投影,hc=Wh·h∈R^{db},其中db≪D。这增加了一个从头学习的信号,补充了基础路由器通道。 LoRA路由计算如下: pL = softmax(Wl · [z ; hc]) (1) 其中Wl∈R^{NL×(NE+db)}是一个可学习的每层投影矩阵。然后我们选择前KL个LoRA专家,Sh^LoRA = TopK(pL),并将它们的权重重新归一化使其和为1:p̃L,j = pL,j / Σ_{j'∈Sh^LoRA} pL,j'。
相似文章
超越 LoRA 与全参数微调:基于梯度引导优化器路由的大语言模型适配
本文提出了一种混合 LoRA 与全参数微调(MoLF)框架,利用梯度引导的优化器路由在 LoRA 和全参数微调之间进行自适应切换。旨在通过结合全参数微调的可塑性与 LoRA 的正则化特性,克服仅依赖静态适配方法的结构局限性。
HELLoRA:面向混合专家模型的热门专家层级别低秩适配
HELLoRA 为混合专家模型引入了激活感知的适配器放置策略,仅将 LoRA 附加到热门专家上,从而减少参数和 FLOPs,同时提升在推理、代码和安全任务上的性能。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
@jbhuang0604: LoRA, low-rank adaptation, is arguably the most popular parameter-efficient fine-tuning method for LLMs. But how does i…
LoRA(低秩适配)是LLM最流行的参数高效微调方法,视频介绍了LoRA及其变体(LoRA+、QLoRA、VeRA、DoRA)的工作原理。
BaLoRA:大规模模型的贝叶斯低秩适应
BaLoRA 引入了低秩适应(LoRA)的贝叶斯扩展,通过缩小与全量微调之间的差距,提供校准良好的不确定性估计并提高预测准确性。