HELLoRA:面向混合专家模型的热门专家层级别低秩适配
摘要
HELLoRA 为混合专家模型引入了激活感知的适配器放置策略,仅将 LoRA 附加到热门专家上,从而减少参数和 FLOPs,同时提升在推理、代码和安全任务上的性能。
arXiv:2605.18795v1 公告类型:新
摘要:低秩适配(LoRA)主导着大型语言模型的参数高效微调,但大多数变体针对密集架构。混合专家(MoE)模型以近乎恒定的每令牌计算量扩展参数,其稀疏激活模式为更高效的适配创造了未被开发的机会。我们提出热门专家层级别低秩适配(HELLoRA),该策略仅将 LoRA 模块附加到每一层中最频繁激活的专家上。这种简单机制减少了可训练参数和适配器引入的 FLOPs,同时提升了下游性能,我们将此效果归因于一种保留预训练专家专业化的结构化正则化形式。为了在极端参数预算下对 HELLoRA 进行压力测试,我们进一步将其与 LoRI 结合形成 HELLoRI,后者冻结上投影并使下投影稀疏化。在三个 MoE 骨干模型(即 OlMoE-1B-7B、Mixtral-8x7B 和 DeepSeekMoE)以及涵盖数学推理、代码生成和安全对齐的三个任务族上,HELLoRA 始终优于强大的 PEFT 基线。与 OlMoE 上的原始 LoRA 相比,HELLoRA 仅使用 15.7% 的可训练参数,减少了 38.7% 的适配器 FLOPs,实现了 1.9 倍的训练吞吐量,并将准确率提高了 9.2%。在 DeepSeekMoE 上,HELLoRA 仅使用 LoRA 23.2% 的可训练参数便能超越 LoRA。这些结果表明,激活感知的适配器放置是扩展 MoE 语言模型 PEFT 的一种有效且实用的途径。
查看缓存全文
缓存时间: 2026/05/20 08:34
# HELLoRA:面向混合专家模型的热专家层级低秩适配 来源:https://arxiv.org/html/2605.18795 贾维 清华大学计算机科学与技术系 北京 100084 weijia4473@tsinghua\.edu\.cn &张仲浩 西安交通大学计算机科学与技术学院 4125151020@stu\.xjtu\.edu\.cn 陈萍 浙江大学区块链与数据安全全国重点实验室 杭州高新区(滨江)区块链与数据安全研究院 zjuchenping@zju\.edu\.cn &李前阳 西安交通大学计算机科学与技术学院 liqianyang@stu\.xjtu\.edu\.cn &潘彦成 西安交通大学计算机科学与技术学院 3120105301@stu\.xjtu\.edu\.cn &王少勋 西安交通大学计算机科学与技术学院 shaoxunwang@stu\.xjtu\.edu\.cn &邱子义 清华大学计算机科学与技术系 qiuzy21@mails\.tsinghua\.edu\.cn &王龙祥 西安交通大学计算机科学与技术学院 wlx419@xjtu\.edu\.cn ###### 摘要 低秩适配(LoRA)在大语言模型的参数高效微调中占据主导地位,但大多数变体针对的是密集架构。混合专家(MoE)模型在接近恒定的每词元计算量下扩展参数规模,其稀疏激活模式为更高效的适配创造了尚未开发的机会。我们提出热专家层级低秩适配(HELLoRA),该方法仅将LoRA模块附加到每层中最频繁激活的专家上。这一简单机制减少了可训练参数和适配器引入的FLOPs,同时提升了下游性能,我们将这一效果归因于一种结构化的正则化形式,它保留了预训练的专家专化。为了在极端参数预算下对HELLoRA进行压力测试,我们进一步将其与LoRI组合形成HELLoRI,该方法冻结上投影并稀疏化下投影。在三个MoE骨干模型(OlMoE-1B-7B、Mixtral-8×7B和DeepSeekMoE)以及三个任务族(数学推理、代码生成和安全对齐)上,HELLoRA持续优于PEFT基线。在三个MoE骨干模型和三个任务族上,HELLoRA比原始LoRA实现了更强的准确率-效率权衡。相对于LoRA,HELLoRA在OlMoE、Mixtral-8×7B和DeepSeekMoE上分别仅使用16.3%、30.1%和23.2%的可训练参数,而在所有报告的指标上匹配或提升了性能。这些结果表明,激活感知的适配器放置是扩展MoE语言模型PEFT的有效且实用的途径。 ## 1 引言 混合专家(MoE)模型在保持每词元计算量近乎恒定的同时扩展参数容量(Shazeer et al.,2017 (https://arxiv.org/html/2605.18795#bib.bib15);Yun et al.,2024 (https://arxiv.org/html/2605.18795#bib.bib21))。它们在多种领域匹配或超越了计算量相当的有密度模型(Liu et al.,2024a (https://arxiv.org/html/2605.18795#bib.bib9);Jiang et al.,2024 (https://arxiv.org/html/2605.18795#bib.bib8);Muennighoff et al.,2025 (https://arxiv.org/html/2605.18795#bib.bib12))。尽管有这种效率,但将MoE模型适配到下游任务仍然代价高昂:完整的参数集很大,而直接应用LoRA(Hu et al.,2022 (https://arxiv.org/html/2605.18795#bib.bib7))会将适配器附加到所有专家上,导致较高的内存和吞吐量开销。 MoE模型的一个关键属性是稀疏激活,这意味着对于每个词元,只有一小部分专家被激活。尽管负载均衡损失在预训练期间鼓励更均匀的专家利用(Shazeer et al.,2017 (https://arxiv.org/html/2605.18795#bib.bib15)),但在下游任务上,每层内的专家激活通常变得高度倾斜,如图1 (https://arxiv.org/html/2605.18795#S1.F1)所示。少数热专家处理了大部分词元,而大量冷专家很少被激活。这些热专家的身份也随层和任务而变化(Muennighoff et al.,2025 (https://arxiv.org/html/2605.18795#bib.bib12))。 参见说明 (a)全局与第7层激活 参见说明 (b)不同层上的任务特定激活 图1:OlMoE中的专家激活模式。(a)在所有层上,专家使用看似均衡(橙色);在第7层内(绿色),前8位专家占据了超过50%的激活。(b)在同一层,不同任务激活不同的专家子集,证实了热专家既是层特定的也是任务特定的。这一观察提示了一个简单的设计原则,即不适配冷专家。将LoRA附加到冷专家上会浪费参数在那些对目标任务很少使用的权重上。更糟的是,它可能通过扰乱预训练期间学到的专家专化来损害性能,从而将梯度噪声注入到那些由稀疏且不具代表性的词元子集驱动更新的参数中。 我们将这一思想实现在HELLoRA(热专家层级低秩适配)中。HELLoRA在目标数据的一个小子集上执行轻量级预热,以分析每层中的专家激活频率。基于这些统计量,它每层选择前k位热专家,并仅在这些专家中插入LoRA适配器。标准LoRA应用于注意力和门控模块,而冷专家保持冻结。 HELLoRA具有两个互补的优势。它通过在前向和后向传播中避免冷专家的适配器计算来提高效率。这与基于掩码的方法(如LoRI (Zhang et al.,2025 (https://arxiv.org/html/2605.18795#bib.bib23)))形成对比,后者会冻结参数但仍保留前向传播开销。它还通过保留冷专家的预训练专化来改善正则化,从而减少跨任务干扰。表4 (https://arxiv.org/html/2605.18795#S4.T4)中的结果支持这一观点,其中即使是随机专家选择也略优于完整LoRA。激活感知的选择带来了额外的增益。 为了进一步减少参数预算,我们将HELLoRA与LoRI (Zhang et al.,2025 (https://arxiv.org/html/2605.18795#bib.bib23))结合,得到HELLoRI。该变体冻结矩阵,并仅更新热专家适配器中10%的条目。 贡献。我们总结主要贡献如下。 1. 1.我们识别了MoE微调中的双稀疏效应,即稀疏专家激活与LoRA更新的低秩结构相互叠加,并提出了HELLoRA,一种利用该效应的层级热专家适配器放置策略。 2. 2.我们在三个MoE骨干模型(OlMoE-1B-7B、Mixtral-8×7B、DeepSeekMoE)和三个任务族(数学推理、代码生成、安全对齐)上广泛评估了HELLoRA,证明其在标准PEFT基线(LoRA、DoRA、LoRI)和MoE特定适配器方法(LoRAMoE)上均持续取得总体提升,并对选择策略、层选择、预热需求和热专家数量进行了彻底的消融分析。 3. 3.我们展示了HELLoRA同时提升了准确率、参数效率、适配器FLOPs和端到端吞吐量,这一组合是先前基于掩码的方法所无法实现的。 ## 2 相关工作 ##### LoRA及其变体。 LoRA (Hu et al.,2022 (https://arxiv.org/html/2605.18795#bib.bib7)) 将可训练的低秩因子注入到冻结的线性层中。后续工作在多个方向上对分解进行了改进。DoRA (Liu et al.,2024b (https://arxiv.org/html/2605.18795#bib.bib10)) 将权重更新分解为独立的幅度和方向分量。PiSSA (Meng et al.,2024 (https://arxiv.org/html/2605.18795#bib.bib11)) 从预训练权重的主奇异向量初始化低秩因子。LoRA-FA (Zhang et al.,2023 (https://arxiv.org/html/2605.18795#bib.bib22)) 冻结上投影向量,同时保持准确率损失最小,大致将可训练参数减半。LoRI (Zhang et al.,2025 (https://arxiv.org/html/2605.18795#bib.bib23)) 更进一步,额外稀疏化了矩阵,在更新参数数量减少一个数量级的情况下达到了具有竞争力的准确率。这些方法都针对密集架构,并未利用MoE特定的结构。 ##### 混合专家模型。 现代MoE大语言模型,如Mixtral (Jiang et al.,2024 (https://arxiv.org/html/2605.18795#bib.bib8))、OlMoE (Muennighoff et al.,2025 (https://arxiv.org/html/2605.18795#bib.bib12)) 和 DeepSeekMoE (Liu et al.,2024a (https://arxiv.org/html/2605.18795#bib.bib9)),采用top-k路由,辅以辅助负载均衡损失,以在预训练期间鼓励均匀的专家利用。然而,当在特定下游任务上评估时,逐层专家使用变得严重倾斜 (Muennighoff et al.,2025 (https://arxiv.org/html/2605.18795#bib.bib12)),这激发了任务感知的适配器放置策略。 ##### 面向MoE模型的PEFT。 有几条工作线将LoRA与MoE结构结合。适配器混合方法,如LoRAMoE (Dou et al.,2024 (https://arxiv.org/html/2605.18795#bib.bib5)) 和 AdaMoLE (Liu et al.,2024 (https://arxiv.org/html/2605.18795#bib.bib18)),引入了LoRA专家上的混合,为适配器本身增加了路由机制。这些方法是针对有密度模型设计的。相比之下,HELLoRA利用了MoE骨干模型的原生专家结构,如我们的实验所证实。动态秩分配方法 (Wang et al.,2024a (https://arxiv.org/html/2605.18795#bib.bib16)) 在训练过程中调整各专家的LoRA秩以重新分配适配容量。这些方法要么增加了架构复杂度,要么需要在线秩调整。相比之下,HELLoRA在放置层面操作,通过一次简单的单次分析步骤,在训练开始前决定哪些专家接收适配器。这一设计使得HELLoRA与适配器混合策略和秩分配策略正交,原则上可以与任一方法族组合使用。 ## 3 方法 ### 3.1 预备知识 ##### LoRA。 给定一个预训练权重,LoRA将更新参数化为,其中,,且: (1) ##### MoE负载均衡。 一个MoE层包含个专家,采用top-k路由。辅助负载均衡损失 (Shazeer et al.,2017 (https://arxiv.org/html/2605.18795#bib.bib15)) (2) 在预训练期间鼓励均匀的专家使用。这里是指派给专家的词元分数,是平均路由概率。关键的是,广泛使用的实现(OlMoE、Mixtral)计算时使用跨所有层的拼接路由器logit,从而在特定任务上实现大致均衡的全局使用,但可能导致不平衡的逐层使用。 ### 3.2 HELLoRA:热专家层级适配器放置 如图2 (https://arxiv.org/html/2605.18795#S3.F2)所示,HELLoRA包含两个阶段:(1)一个轻量级分析阶段以识别热专家;(2)标准LoRA微调,适配器仅放置于热专家上。 ##### 阶段1:层级热专家分析。 我们在目标训练数据的随机样本上运行一次短LoRA预热(默认)。在预热过程中,我们记录每个专家在每个MoE层的激活计数。然后我们在每层内按对专家进行排序,并选择前位作为热专家。输出是每层的热专家列表。算法1 (https://arxiv.org/html/2605.18795#alg1)总结了完整过程。 ##### 阶段2:选择性适配器附加。 我们将LoRA模块附加到所有注意力投影、门控网络,以及每个MoE层中仅属于的那部分热专家上。冷专家完全保持冻结。基础模型全程冻结,仅训练适配器参数。 算法1 HELLoRA:热专家层级低秩适配 0:预训练MoE模型,目标数据集,预热比例,热专家数量 1:采样,其中 2:在上运行LoRA预热;记录每层专家激活计数 3:对于每个MoE层执行 4: 按选择前位专家 5:结束 6:将LoRA附加到:注意力投影、门控网络以及中的专家 7:在整个数据集上微调(仅适配器参数可训练) 8:返回适配后的模型 参见说明 图2:LoRA与HELLoRA的对比。标准LoRA将适配器附加到每个MoE层中的所有专家上(顶部)。HELLoRA仅将适配器附加到由预热分析阶段识别的热专家上,保持冷专家冻结(底部)。两种设置中,注意力和门控组件都接收LoRA适配器。 ##### 为什么是热专家? 我们提供两个互补的视角来说明为什么HELLoRA优于完整LoRA。 效率。从冷专家移除适配器完全消除了它们的前向和反向适配器计算。与LoRI等掩码方法不同(后者冻结参数但仍将其保留在计算图中),HELLoRA减少了实际的FLOPs和内存流量。适配器FLOPs规模为而非。 正则化。预训练的MoE模型通过专家专化嵌入任务相关知识。适配那些对目标任务很少激活的冷专家会注入由稀疏、不具代表性的词元子集计算出的噪声梯度。冻结冷专家保留了它们的预训练功能,作为一种结构化的正则化形式。经验上,即使是限制范围的随机专家选择,也比完整LoRA略有提升,而激活感知的选择带来了显著更大的增益(第4.4.1节 (https://arxiv.org/html/2605.18795#S4.SS4.SSS1))。 ### 3.3 HELLoRI:极端参数预算 为了探索可训练参数的下界,我们将HELLoRA与LoRI (Zhang et al.,2025 (https://arxiv.org/html/2605.18795#bib.bib23))组合。HELLoRI冻结(随机初始化并固定),并仅更新的条目中绝对值最大的前10%: (3) 其中是一个二进制掩码,选择前10%的条目。这产生了相对于完整微调约0.03%的可训练参数。
相似文章
MoE$^2$-LoRA:当MoE模型遇上MoE风格的低秩适配
MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。
MoEGen:用于实例自适应LoRA生成的专家混合方法
本文提出MoEGen,一种参数高效的微调框架,利用专家混合技术通过专家码和轻量级超网络生成实例自适应的LoRA更新,在不针对每个专家存储独立适配器的情况下提升了常识推理基准的性能。
SOS-LoRA: 静态正交子空间低秩适应结合固定多尺度缩放
SOS-LoRA 通过将秩预算分解为具有固定多尺度缩放的静态正交低秩专家来扩展 LoRA,在不增加推理成本的情况下提升了在推理、NLU 和数学基准上的微调性能。
通过L0正则化混合专家模型加速稠密LLMs
本文提出L0-MoE,一种使用L0正则化的轻量级混合专家模型方法,用于加速稠密LLMs,最高可实现2.5倍加速,同时保持竞争力的性能。
学习选择,而非重新学习:推理LoRA的硬路由混合
提出了Hard-Routed MoR-LoRA,一种两阶段框架,通过硬top-1路由组合冻结的推理LoRA专家,相比软路由基线,在保留专家行为的同时需要更少的可训练参数。