任务感知的基于MoE大型语言模型的联邦微调
摘要
本文提出了FedTAR,一种针对基于MoE的大型语言模型的任务感知联邦微调方法,该方法通过将本地更新与任务偏好对齐,以在异构数据下保留专家专业化并提高性能。
arXiv:2609.13395v1 发布类型:新
摘要:混合专家(MoE)已成为大型语言模型(LLM)广泛采用的架构,因为它通过稀疏专家激活提高了模型容量同时限制了计算开销。这一特性使得基于MoE的LLM在资源受限的分布式环境中特别有吸引力。然而,在异构客户端数据下,基于MoE的LLM的联邦微调仍然具有挑战性。由于客户端通常对应不同的任务偏好,直接聚合它们的本地更新可能会削弱专家专业化,并在共享专家上引入冲突的更新方向。为了应对这些挑战,我们提出了FedTAR,一种针对基于MoE的LLM的任务感知联邦微调方法。FedTAR通过路由输出建立了本地更新与任务偏好之间的关联。具体来说,我们对路由特征和本地更新都应用奇异值分解(SVD),以提取低维任务坐标和更新方向。基于任务坐标,FedTAR在具有相似任务偏好的客户端之间执行簇内聚合,并在不同任务组之间执行簇间聚合。然后通过学习到的任务到更新映射重建聚合的更新,确保最终更新保持与特定任务优化方向对齐。通过这种方式,FedTAR保留了专家专业化,并缓解了异构客户端之间的破坏性干扰。我们在不同的非独立同分布设置下对四个基准任务评估了FedTAR。实验结果表明,FedTAR始终优于强大的联邦微调基线,并达到了最先进的性能。
查看缓存全文
缓存时间: 2026/09/15 08:37
# 基于混合专家大语言模型的任务感知联邦微调
来源:https://arxiv.org/html/2609.13395
Tingqi Wang, Hongyu Ke, Haoxin Wang, Rafal Angryk, Zhipeng Cai\*
隶属机构:美国佐治亚州立大学计算机科学系,亚特兰大,佐治亚州,美国
\{twang33, hke3, haoxinwang, angryk, zcai\}@gsu\.edu
###### 摘要
混合专家(Mixture‑of‑Experts,MoE)已成为大语言模型(Large Language Models,LLMs)广泛采用的架构,它在通过稀疏专家激活限制计算开销的同时提升了模型容量。这一特性使得基于MoE的LLMs在资源受限的分布式环境中尤其具有吸引力。然而,在客户端数据异构的条件下,基于MoE的LLMs的联邦微调仍然面临挑战。由于客户端通常对应不同的任务偏好,直接聚合其本地更新可能会削弱专家的专门化,并在共享专家上引入冲突的更新方向。为应对这些挑战,我们提出了FedTAR,一种针对基于MoE的LLMs的任务感知联邦微调方法。FedTAR通过路由输出建立本地更新与任务偏好之间的关联。具体而言,我们对路由特征和本地更新都应用奇异值分解(SVD)以提取低维任务坐标和更新方向。基于任务坐标,FedTAR对具有相似任务偏好的客户端进行集群内聚合,并在不同任务组间进行跨集群聚合。随后,通过学习到的任务‑更新映射对聚合更新进行重构,确保最终更新与任务特定的优化方向保持一致。通过这种方式,FedTAR保留了专家专门化并缓解了异构客户端之间的破坏性干扰。我们在四种基准任务、不同非独立同分布(non‑IID)设置下评估了FedTAR。实验结果表明,FedTAR一致地优于强大的联邦微调基线,并达到了最先进的性能。代码可在 https://github\.com/Tingqi0708/FedTAR 获取。
###### 索引词:联邦微调,大语言模型,混合专家
11footnotetext:通讯作者
## I 引言
混合专家(MoE)作为大语言模型(LLMs)的一种流行架构,因其能够平衡模型能力和计算开销而备受关注\[1 (https://arxiv.org/html/2609.13395#bib.bib2),2 (https://arxiv.org/html/2609.13395#bib.bib4)\]。通过采用条件计算,MoE为每个令牌(token)选择性地激活一部分专家\[3 (https://arxiv.org/html/2609.13395#bib.bib5)\]。这种稀疏激活使得基于MoE的LLMs能够在不按比例增加推理成本的情况下扩展模型容量,使其非常适合资源受限的分布式环境\[4 (https://arxiv.org/html/2609.13395#bib.bib6),5 (https://arxiv.org/html/2609.13395#bib.bib8),6 (https://arxiv.org/html/2609.13395#bib.bib3)\]。
在实践中,将LLMs适配到各种特定领域任务通常需要在多个客户端拥有的有限且分散的私有数据上进行微调\[7 (https://arxiv.org/html/2609.13395#bib.bib9),8 (https://arxiv.org/html/2609.13395#bib.bib37)\]。联邦微调通过实现无需直接数据共享的协作适配,提供了一种有前景的解决方案。然而,MoE架构与异构客户端数据的结合引入了新的挑战,这些挑战在现有工作中尚未得到系统研究:(i) 专家专门化被削弱,以及 (ii) 共享专家上的更新冲突。
具体而言,具有不同任务偏好的客户端可能导致不同的更新幅度\[9 (https://arxiv.org/html/2609.13395#bib.bib10),10 (https://arxiv.org/html/2609.13395#bib.bib7)\]。在聚合过程中,这些任务特定的差异被不加区分地平均,这可能削弱跨任务的专家专门化。如图 1 (https://arxiv.org/html/2609.13395#S1.F1)(a) 所示,专注于任务 A 的客户端对专家 e₂ 的更新幅度大于对专家 e₄ 的更新,而专注于任务 B 的客户端则表现出相反的模式。在联邦微调聚合后,对 e₂ 和 e₄ 的更新被合并,而未考虑其任务特定的角色。因此,全局模型可能对任务 A 和 B 都不是最优的。此外,同一专家可能被具有不同任务偏好的客户端激活,因此接收到优化方向不一致的更新\[11 (https://arxiv.org/html/2609.13395#bib.bib11),12 (https://arxiv.org/html/2609.13395#bib.bib12),2 (https://arxiv.org/html/2609.13395#bib.bib4)\]。如图 1(b) 所示,专家 e₃ 被任务 A 和 B 共享,但其在两个任务下的收敛方向相互冲突。此类冲突可能导致全局模型更新中的破坏性干扰,并进一步降低联邦微调性能。
(图注(a)因更新被平均而导致的专家专门化削弱。图注(b)不同任务中共享专家的收敛冲突。)
图 1:基于MoE的LLMs联邦微调中的挑战示意图。
上述挑战提出了一个关键问题:在联邦MoE微调中,如何使客户端更新与其潜在的任务意图对齐?由于任务偏好不可直接观察,很难确定哪些客户端应该一起聚合,以及如何组合其更新。这促使我们引入一种能够捕获潜在任务结构的中间表示。在MoE模型中,路由输出自然反映了每个客户端的专家利用模式,从而隐式编码了潜在的任务表示。基于此观察,我们提出了FedTAR,一种新颖的、针对基于MoE的LLMs的任务感知联邦微调方法。FedTAR利用路由输出建立任务空间与更新空间之间的映射,从而实现对联邦更新的任务感知聚合和重构。据我们所知,这是首个专注于基于MoE的LLMs联邦微调的工作。
具体而言,FedTAR首先在本地微调过程中收集路由统计信息,包括每个客户端的平均专家利用率、专家共激活关系和路由置信度。然后,对路由特征和本地更新都应用奇异值分解(SVD)以提取任务坐标和主导更新方向。基于任务坐标,FedTAR在客户端集群内和跨集群执行任务感知聚合。最后,利用学习到的任务‑更新空间映射重构聚合更新,确保全局更新与任务特定方向保持一致。通过这种方式,FedTAR在保留专家专门化的同时缓解了异构客户端之间的冲突。
我们在不同数据异构性水平、任务和超参数设置下进行了全面实验\[13 (https://arxiv.org/html/2609.13395#bib.bib13)\]。结果表明,FedTAR在多个任务和设置中均达到了最先进的性能。我们的贡献总结如下:
- • 据我们所知,这是首个研究基于MoE的LLMs联邦微调的工作。我们识别出两个独特挑战:专家专门化退化,以及共享专家上的更新冲突。
- • 我们提出了FedTAR,一种针对基于MoE的LLMs的任务感知联邦微调方法。FedTAR利用路由统计推断任务表示,执行任务感知聚类和聚合,并通过学习到的任务‑更新映射重构全局更新,以保留专家专门化并缓解冲突。
- • 我们在不同数据异构水平、任务和超参数设置下进行了广泛实验。结果证明了FedTAR的有效性及其在联邦微调中的最先进性能。
## II 相关工作
在LLMs时代,联邦学习(FL)已被广泛用于无需直接数据访问的设备端微调。经典FL方法FedAvg\[14 (https://arxiv.org/html/2609.13395#bib.bib14)\]对参与客户端的模型更新进行平均。然而,FedAvg在非独立同分布(Non‑IID)数据上常常表现不佳。为解决此问题,Li等人提出了FedProx\[15 (https://arxiv.org/html/2609.13395#bib.bib15)\],它通过在本地训练中添加近端项来提高训练稳定性。SCAFFOLD通过使用控制变量来缓解客户端漂移\[16 (https://arxiv.org/html/2609.13395#bib.bib16)\]。更广泛地说,缓解FL中Non‑IID数据引起的性能下降已被广泛探索\[17 (https://arxiv.org/html/2609.13395#bib.bib17)\]。多年来,这些方法已被广泛应用于各种领域\[18 (https://arxiv.org/html/2609.13395#bib.bib18),19 (https://arxiv.org/html/2609.13395#bib.bib19)\]。
将FL扩展到LLMs面临额外挑战,主要源于模型巨大的规模和通信开销。为解决此问题,提出了参数高效微调(PEFT)方法,如低秩自适应(LoRA),以减少可训练参数的数量和计算成本\[20 (https://arxiv.org/html/2609.13395#bib.bib20)\]。近期工作通过将本地更新限制在低秩适配器中并跨客户端聚合它们,将PEFT与FL集成\[7 (https://arxiv.org/html/2609.13395#bib.bib9),21 (https://arxiv.org/html/2609.13395#bib.bib38)\]。这些方法显著提高了LLM微调的通信效率和可扩展性。作为最早将LoRA融入FL的方法之一,FFA‑LoRA采用了一种简单但有效的策略,即冻结LoRA A矩阵,仅训练和聚合LoRA B矩阵,从而减少通信开销\[22 (https://arxiv.org/html/2609.13395#bib.bib21)\]。它还考虑了聚合干扰,并在差分隐私(DP)噪声下提高了鲁棒性,增强了训练稳定性。在此基础上,FedEx‑LoRA通过引入更灵活的参数共享机制来更好地捕获客户端特定特征,进一步改进了聚合\[23 (https://arxiv.org/html/2609.13395#bib.bib22)\]。还有一些工作主要关注提高效率,例如FedBiOT\[8 (https://arxiv.org/html/2609.13395#bib.bib37)\]和FedDiAL\[24 (https://arxiv.org/html/2609.13395#bib.bib36)\]。最近,FedSVD利用客户端更新的低秩结构,通过SVD在共享子空间中执行聚合,部分缓解了更新不一致问题\[25 (https://arxiv.org/html/2609.13395#bib.bib23)\]。
随着MoE架构在LLMs中的日益普及,近期工作探索了其与FL的集成\[26 (https://arxiv.org/html/2609.13395#bib.bib39)\]。然而,这些方法主要是将MoE整合到现有的微调流程中,而非重新思考针对基于MoE模型的联邦优化过程。因此,它们未能充分利用路由机制中天然编码的任务特定结构和专家专门化。忽略此类结构信息可能导致跨客户端的兼容专家更新被聚合,特别是在异构数据分布下,从而导致全局模型次优。
## III 预备知识
### III‑A 基于MoE的LLM
在基于MoE的LLM中,每一层包含一组专家和一个路由器\[27 (https://arxiv.org/html/2609.13395#bib.bib24)\]。每个专家 \(f_e^{(l)}\) 是一个参数化的前馈网络。给定输入 \(x\),路由器将输入分配给一部分专家,仅被选中的专家被激活。第 \(l\) 层的输出为:
\[
h^{(l)}(x) = \sum_{e \in \mathcal{E}^{(l)}} g_e^{(l)}(x) f_e^{(l)}(x), \quad \|g^{(l)}(x)\|_0 \leq k,
\]
其中 \(\mathcal{E}^{(l)}\) 表示第 \(l\) 层的专家集合,\(g_e^{(l)}(x)\) 是专家 \(e\) 的路由权重,\(k\) 是被激活的专家数量。与密集型LLMs相比,MoE在模型容量和计算成本之间实现了更好的权衡。在密集模型中,所有参数在每次输入时都被激活。相比之下,MoE模型维护更大的参数集 \(\{W_e\}_{e \in \mathcal{E}}\),但对于每次输入仅激活一部分专家。因此,MoE在不成比例增加计算成本的情况下实现了更高的模型容量。
### III‑B 联邦微调
考虑一个具有 \(N\) 个客户端 \(\mathcal{C} = \{\mathcal{C}_1, \mathcal{C}_2, ..., \mathcal{C}_N\}\) 和一个服务器 \(\mathcal{S}\) 的FL系统。每个客户端 \(\mathcal{C}_i\) 拥有一个包含 \(n_i\) 个训练样本 \(\{(x_{ij}, y_{ij})\}_{j=1}^{n_i}\) 的私有数据集 \(\mathcal{D}_i\)。所有客户端可以本地部署相同的基于MoE的LLM,也可以远程托管它。我们的目标是在这 \(N\) 个客户端上微调一个全局基于MoE的LLM:
\[
\Delta \mathbf{W}^* = \arg\min_{\Delta \mathbf{W}} \sum_{i=1}^{N} p_i \mathcal{L}_i(\mathbf{W}_0 + \Delta \mathbf{W}),
\]
其中 \(p_i\) 表示客户端 \(i\) 的权重,\(\mathcal{L}_i(\cdot)\) 是在数据集 \(\mathcal{D}_i\) 上定义的本地经验风险。需要注意的是,我们的方法适用于全微调和LoRA。由于基础模型的庞大尺寸,我们使用LoRA而非训练所有参数。
(图注:FedTAR 概览。客户端侧:每个客户端执行本地LoRA微调,并提取路由特征和本地更新。服务器侧:服务器根据任务坐标对客户端进行聚类,在集群内聚合更新,并通过任务对齐子空间投影重构全局更新。)
图 2:FedTAR 概览。
## IV 方法论
### IV‑A 概述
我们提出了FedTAR,一种针对基于MoE的LLMs的任务感知联邦微调框架。我们的设计动机源于基于MoE的LLMs联邦微调中的两个主要挑战:(i) 专家专门化被削弱,以及 (ii) 由任务异构性引起的共享专家上的更新方向不兼容。为解决这些问题,FedTAR通过本地路由行为捕获任务偏好与模型更新之间的关系,从而实现对全局模型的任务感知微调。我们方法的概述如图 2 (https://arxiv.org/html/2609.13395#S3.F2) 所示。在客户端侧,经过本地微调后,路由器在本地保留数据集上计算logit,这些logit用于计算路由统计信息,如平均专家使用率和专家共激活。随后,微调更新和路由特征被上传到服务器。在服务器侧,FedTAR分别分解本地更新和路由特征以提取主要更新方向和任务坐标,然后学习它们之间的映射。随后,具有相似任务坐标的客户端通过聚类进行层次化聚合。最后,在学习到的映射指导下,在任务对齐子空间中重构聚合结果,以获得最终的全局更新。在接下来的小节中,我们将详细阐述我们的设计。
### IV‑B 本地微调
所有客户端从一个冻结的预训练MoE模型 \(\mathbf{W}_0 \in \mathbb{R}^{d \times k}\) 开始,该模型本地部署。相似文章
ACE:MoE大语言模型参数高效微调的跨专家适配器整合
ACE提出了一种方法,用于整合MoE大语言模型中跨专家的冗余适配器,以实现更高效的参数高效微调,训练速度提升最高可达1.48倍,且不增加峰值内存。
Thermo-FL:面向边缘AI的热感知鲁棒联邦大语言模型微调
Thermo-FL是一个用于边缘设备上大语言模型的联邦LoRA微调框架,它利用设备温度来调节训练和传输,并结合一种鲁棒的聚合方法以抵御对抗性攻击,从而增强稳定性和性能。
迈向LLM的下一个前沿:私有数据训练——联邦微调的跨域基准
本文提出了一个在私有数据上对大型语言模型进行联邦微调的跨域基准,评估了LoRA、QLoRA和IA3策略在医疗和金融数据集上的表现。结果表明,联邦微调接近集中式训练的性能,并优于孤立学习,证明了在数据无法共享时通过联邦微调适配LLM的可行性。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
用于通信高效联邦LoRA微调的自适应相位切换
本文介绍了一种用于通信高效联邦LoRA微调的自适应相位切换方法,在保持大型语言模型性能的同时,实现了高达40.5%的通信成本往返节省。