打破结构同一性:秩异构下的个性化联邦LoRA微调
摘要
FedRoRA是一种新颖的个性化联邦LoRA微调框架,通过将自适应解耦为共享全局方向和个性化幅度,解决了联邦学习中的秩异构和数据异构问题。
arXiv:2609.00632v1 公告类型:新
摘要:大语言模型(LLMs)在多个领域取得了显著成功,但它们对隐私敏感的分布式数据集的适配仍然是一个挑战。虽然联邦学习(FL)结合低秩自适应(LoRA)提供了一种资源高效的协同微调范式,但实际部署受到资源异构和数据异构双重挑战的阻碍。现有的秩异构方法主要关注于聚合时的维度不匹配,但通常为共享相同秩的所有客户端提供统一的全局模型,未能在非独立同分布场景中捕捉客户端特定特征。本文提出了FedRoRA(联邦秩级个性化LoRA),这是一个新颖的框架,能够在秩异构联邦中实现细粒度个性化。FedRoRA通过可学习的对角缩放将自适应解耦为共享全局方向和个性化秩级幅度。在服务器端,它通过奇异值分解(SVD)提取全局子空间,并通过个性化投影和top-$k$选择机制重新分发客户端特定初始化。在自然语言理解和生成基准上的大量实验表明,FedRoRA始终优于最先进的方法。
查看缓存全文
缓存时间: 2026/09/02 06:18
# 打破结构同质性:基于秩异构的个性化联邦LoRA微调
来源:https://arxiv.org/html/2609.00632
Lei Wang††thanks: ̃ ̃本文前两位作者贡献相等\.Jieming Bian11footnotemark:1Affiliation:University of FloridaAffiliation:Gainesville, FL 32611Email:[jieming\.bian@ufl\.edu](mailto:)Letian ZhangAffiliation:Middle Tennessee State UniversityAffiliation:Murfreesboro, TN 37132Email:[letian\.zhang@mtsu\.edu](mailto:)Jie XuAffiliation:University of FloridaAffiliation:Gainesville, FL 32611Email:[jie\.xu@ufl\.edu](mailto:)
###### 摘要
大型语言模型(LLMs)已在众多领域取得显著成功,但其在隐私敏感的分布式数据集上的适配仍面临挑战。尽管联邦学习(FL)结合低秩适配(LoRA)提供了一种资源高效的协同微调范式,但实际部署受限于资源异构性与数据异构性的双重挑战。现有的秩异构方法主要关注聚合时的维度匹配问题,但通常为共享相同秩的所有客户端提供统一的全局模型,无法捕捉非独立同分布场景下的客户端特定特征。本文提出FedRoRA(联邦秩级个性化LoRA),一种在秩异构联邦中实现细粒度个性化的新框架。FedRoRA将适配过程解耦为由可学习对角缩放矩阵控制的共享全局方向与个性化秩级幅度。在服务器端,通过奇异值分解(SVD)提取全局子空间,并通过个性化投影与Top-k选择机制重新分配客户端特定初始化。在NLU和NLG基准上的大量实验表明,FedRoRA持续优于现有最先进方法。
## 1引言
大型语言模型(LLMs)已在广泛领域展现出卓越能力Devlin et al\. \(2019\) (https://arxiv.org/html/2609.00632#bib.bib1);Touvron et al\. \(2023a\) (https://arxiv.org/html/2609.00632#bib.bib2);Achiam et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib17);Touvron et al\. \(2023b\) (https://arxiv.org/html/2609.00632#bib.bib3);Team et al\. \(2025\) (https://arxiv.org/html/2609.00632#bib.bib18)\。然而,将这些巨型模型适配到特定下游任务通常需要在领域特定数据上进行微调。当此类数据在严格隐私约束下分布于多个客户端时,联邦学习(FL)已成为一种无需共享原始本地数据即可进行协同适配的有前景范式McMahan et al\. \(2017\) (https://arxiv.org/html/2609.00632#bib.bib6);Wang et al\. \(2024a\) (https://arxiv.org/html/2609.00632#bib.bib14);Zhao et al\. \(2022\) (https://arxiv.org/html/2609.00632#bib.bib22)\。为了缓解全参数微调的巨大计算与通信开销,低秩适配(LoRA)Hu et al\. \(2022\) (https://arxiv.org/html/2609.00632#bib.bib4)已成为广泛采用的参数高效微调(PEFT)Han et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib5)方法,仅优化少量低秩参数,同时保持强大的下游性能。因此,FL与LoRA的结合已成为隐私保护LLM微调的热门框架,推动了越来越多关于联邦PEFT的研究Bian et al\. \(2025a\) (https://arxiv.org/html/2609.00632#bib.bib23)\。
联邦LoRA微调中的一个基本挑战是客户端资源的固有异构性。在实际部署中,客户端在计算和内存能力上存在显著差异,这直接限制了其能够训练的LoRA秩Cho et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib16)\。为解决这一不匹配问题,若干开创性工作提出了秩异构聚合方案。例如,HETLoRACho et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib16)对低秩客户端使用零填充以进行逐元素平均,FLoRAWang et al\. \(2024b\) (https://arxiv.org/html/2609.00632#bib.bib9)引入了基于堆叠的机制,将本地模块连接成全局聚合,Fed\-PLoRAZhang et al\. \(2026\) (https://arxiv.org/html/2609.00632#bib.bib27)利用并行单秩适配(Parallel One\-Rank Adaptation)通过“选择\-折叠”策略构建任意秩模块。虽然这些方法实现了跨秩通信,但最终为所有共享相同秩的客户端提供了统一的全局模型。这种“一刀切”式的方法已被证明不足以处理第二个同样关键的瓶颈:数据异构性。数据异构性(非独立同分布)问题在LLM时代尤为突出,因为跨客户端的数据分布可能因不同领域和任务而高度分化Wu et al\. \(2026\) (https://arxiv.org/html/2609.00632#bib.bib28);Bian et al\. \(2025a\) (https://arxiv.org/html/2609.00632#bib.bib23)\。联邦LoRA领域的最新研究强调了个性化联邦学习(pFL)的必要性,以缓解非独立同分布数据导致的性能下降Yang et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib11);Bian et al\. \(2026a\) (https://arxiv.org/html/2609.00632#bib.bib24);Wang et al\. \(2025\) (https://arxiv.org/html/2609.00632#bib.bib25);Bian et al\. \(2026b\) (https://arxiv.org/html/2609.00632#bib.bib29);Guo et al\. \(2025\) (https://arxiv.org/html/2609.00632#bib.bib10)\。然而,现有的pFL框架大多在秩同质化的假设下设计,从根本上不适用于资源异构环境。具体而言,标准双模块设计Yang et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib11);Bian et al\. \(2026a\) (https://arxiv.org/html/2609.00632#bib.bib24);Wang et al\. \(2025\) (https://arxiv.org/html/2609.00632#bib.bib25)维护独立的全局和个性化LoRA模块,使内存占用和每步前向计算均翻倍,这与引发秩异构性的严格预算约束直接冲突。另一方面,诸如FedSAGuo et al\. \(2025\) (https://arxiv.org/html/2609.00632#bib.bib10)等非对称个性化方案试图通过对一个因子(如矩阵A)进行全局平均,同时个性化另一个因子(如矩阵B)来避免此开销。然而,此类参数级操作本质上依赖于固定矩阵维度,因此在秩不同导致矩阵形状各异的秩异构组间存在几何不兼容性。一种看似自然的解决秩不匹配的方法是将客户端划分为秩同质的子联邦,并在每个独立组内孤立地应用现有pFL方法。然而,这种朴素策略严重碎片化联邦,形成通常过小的孤立子组,无法聚合足够的集体知识以实现有意义的个性化。因此,在实现无缝、秩自适应的个性化微调方面仍存在显著差距。本文研究在秩异构客户端约束下的个性化联邦LoRA微调。我们的关键观察是,非独立同分布客户端可能需要不同的秩级幅度,同时仍共享共同的适配方向。基于此洞见,我们提出FedRoRA(联邦秩级个性化LoRA),它将标准LoRA形式ΔWi=BiAi\\Delta W\_\{i\}=B\_\{i\}A\_\{i\}替换为解耦三元组ΔWi=B~iSiA~i\\Delta W\_\{i\}=\\tilde\{B\}\_\{i\}S\_\{i\}\\tilde\{A\}\_\{i\},其中B~i\\tilde\{B\}\_\{i\}和A~i\\tilde\{A\}\_\{i\}编码归一化适配方向,SiS\_\{i\}捕获可学习的秩级幅度。服务器重构本地更新,通过SVD提取共享全局子空间,并返回用于下一轮初始化的个性化三元组。因此,具有相同秩的客户端可以根据其本地任务对齐情况接收不同的方向和幅度。我们的主要贡献如下:
- •我们揭示了在现有秩异构FL\-LoRA方法中广泛使用的统一秩同质初始化在非独立同分布数据下是不足够的,因为相同秩的客户端可能需要不同的适配方向和秩级幅度。
- •我们提出FedRoRA,一种秩级个性化LoRA框架,将每个本地更新解耦为ΔWi=B~iSiA~i\\Delta W\_\{i\}=\\tilde\{B\}\_\{i\}S\_\{i\}\\tilde\{A\}\_\{i\},其中B~i\\tilde\{B\}\_\{i\}和A~i\\tilde\{A\}\_\{i\}表示归一化适配方向,SiS\_\{i\}捕获客户端特定幅度。
- •我们设计了一种个性化聚合机制,从重构的本地更新中提取共享全局子空间,并返回客户端特定的三元组用于下一轮初始化,即使在相同秩预算的客户端之间也能实现个性化。
- •在GLUEWang et al\. \(2018\) (https://arxiv.org/html/2609.00632#bib.bib20)和FLANChung et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib13)上的大量实验表明,FedRoRA在不同非独立同分布设置下持续优于最先进的秩异构FL方法。
请参阅图注图1:FedRoRA的整体框架。在客户端侧,本地更新通过即时归一化被解耦为单位范数方向基(B~,A~\\tilde\{B\},\\tilde\{A\})和可学习的秩级幅度(SS)。在服务器侧,通过截断SVD提取共享全局子空间,单个更新被投影到该子空间上,并通过秩自适应Top\-kk选择机制重新分配个性化初始化。详见第4节 (https://arxiv.org/html/2609.00632#S4)和附录A (https://arxiv.org/html/2609.00632#A1)。
## 2相关工作
使用LoRA的联邦微调。鉴于LLMs全参数微调的巨大计算和内存开销,将LoRA方法整合到联邦学习框架中已成为主流范式。早期探索,如FedITZhang et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib7)和SLoRABabakniya et al\. \(2023\) (https://arxiv.org/html/2609.00632#bib.bib19),主要关注将FedAvg算法直接应用于LoRA因子,将其视为全模型的权重替代。然而,后续研究发现了一个关键的聚合不匹配问题:乘积因子的平均值通常不等于平均值的乘积。为缓解此问题,诸如FFA\-LoRASun et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib8)、FedEx\-LoRASinghal et al\. \(2025\) (https://arxiv.org/html/2609.00632#bib.bib32)和LoRA\-FAIRBian et al\. \(2025b\) (https://arxiv.org/html/2609.00632#bib.bib12)等研究提出了专门的同步协议,以在因子空间或权重空间中对齐更新。
异构秩联邦LoRA。最近,焦点已转向解决资源异构性问题,其中客户端拥有不同的硬件约束,决定了不同的LoRA秩rir\_\{i\}。HETLoRACho et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib16)通过对低秩因子进行零填充至最大秩rmaxr\_\{max\}来促进聚合,尽管这可能引入结构偏差。FLoRAWang et al\. \(2024b\) (https://arxiv.org/html/2609.00632#bib.bib9)采用基于堆叠的连接方案来维护全局模块,而Fed\-PLoRAZhang et al\. \(2026\) (https://arxiv.org/html/2609.00632#bib.bib27)利用并行单秩适配(PLoRA)通过“选择\-折叠”策略构建任意秩模块。FlexLoRABai et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib15)利用SVD将全权重更新投影回异构低秩子空间。虽然这些方法对于跨秩通信有效,但它们通常收敛于为所有共享相同秩的客户端提供统一的全局初始化,忽视了对数据特定个性化的需求。
个性化联邦LoRA。在LoRA的背景下,个性化通常通过架构或参数级划分实现。例如,FedDPAYang et al\. \(2024\) (https://arxiv.org/html/2609.00632#bib.bib11)、FedALTBian et al\. \(2026a\) (https://arxiv.org/html/2609.00632#bib.bib24)和FedLEASEWang et al\. \(2025\) (https://arxiv.org/html/2609.00632#bib.bib25)维护包含共享全局LoRA模块和私有个性化LoRA模块的双重结构。虽然有效捕获本地特征,但维护多个模块会带来巨大的内存开销,使其对于异构秩设置中资源受限的客户端不切实际。另一方面,如FedSAGuo et al\. \(2025\) (https://arxiv.org/html/2609.00632#bib.bib10)等方法提出非对称个性化,其中特定组件(如矩阵A)被全局平均,而其他组件(如矩阵B)保持本地化。然而,这些参数级操作依赖于固定维度,无法简单地扩展到联邦中秩(从而矩阵形状)变化的情况。FedRoRA通过将适配解耦为共享全局方向和个性化秩级幅度来弥补这一差距,实现了对秩异构性稳健的细粒度个性化,且不增加本地占用。
## 3问题形式化
### 3\.1秩异构LoRA适配
我们考虑一个联邦系统,其中NN个客户端协同微调共享预训练语言模型,权重为W0∈Rdout×dinW\_\{0\}\\in\\mathbb\{R\}^\{d\_\{\\text\{out\}\}\\times d\_\{\\text\{in\}\}\}\。遵循LoRA范式,每个客户端i∈\{1,...,N\}i\\in\\\{1,\dots,N\\\}处的本地更新由两个可训练低秩矩阵的乘积参数化: ΔWi=BiAi,\\Delta W\_\{i\}=B\_\{i\}A\_\{i\},\(1\)其中Bi∈Rdout×riB\_\{i\}\\in\\mathbb\{R\}^\{d\_\{\\text\{out\}\}\\times r\_\{i\}\}且Ai∈Rri×dinA\_\{i\}\\in\\mathbb\{R\}^\{r\_\{i\}\\times d\_\{\\text\{in\}\}\}\。在我们的设置中,秩rir\_\{i\}在联邦中是异构的,由每个客户端特定的计算和内存预算决定。对于输入xx,客户端ii处的前向传播计算为: h=W0x\+BiAix\.h=W\_\{0\}x\+B\_\{i\}A\_\{i\}x\.\(2\)
### 3\.2目标:秩自适应个性化
秩自适应个性化联邦学习的目标是优化一组客户端特定更新\{ΔWi\}i=1N\\\{\\Delta W\_\{i\}\\\}\_\{i=1\}^\{N\}\。令Li\\mathcal\{L\}\_\{i\}表示本地损失函数,pip\_\{i\}是客户端ii的聚合权重,由其数据大小比例给出。目标是找到个性化低秩更新,以最小化总经验风险: min∑i=1N\{ΔWi\}i=1NpiLi\(W0\+ΔWi,Di\),\\min\_\{\\\{\\Delta W\_\{i\}\\\}\_\{i=1\}^\{N\}\}\\sum\_\{i=1\}^\{N}p\_\{i\}\\mathcal\{L\}\_\{i\}\(W\_\{0\}\+\\Delta W\_\{i\};\\mathcal\{D\}\_\{i\}\),\(3\)约束条件是每个ΔWi\\Delta W\_\{i\}符合分配的秩预算rir\_\{i\}。关键挑战在于使具有不同秩容量的客户端能够在各自的低秩子空间内有效捕获全局结构知识和本地任务特定特征。
## 4方法:FedRoRA
在本节中,我们介绍FedRoRA(联邦秩级个性化LoRA),一个用于秩异构联邦学习中细粒度个性化的框架。FedRoRA通过将LoRA适配解耦为共享方向子空间和个性化秩级幅度,同时解决资源和数据异构性问题。整体架构如图1所示。相似文章
SeFoRA:具有异构客户端秩的草图聚合联邦低秩适配
SeFoRA 是一种提出的联邦 LoRA 算法,利用草图聚合来处理异构客户端秩并缓解双线性失配问题。它包含一个具有收敛保证的秩同质变体,并在 RoBERTa-Large 微调上展示了最先进的性能。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
PFAdapter:面向个性化联邦多模态大语言模型的分层LoRA分解
本文介绍了PFAdapter,一种用于多模态大语言模型(MLLMs)个性化联邦微调的通信高效框架。它采用分层LoRA分解,将适配器参数分离为全局共享和本地私有组件,通过正交正则化实现通信成本降低近50%,同时提升个性化性能。
FoRA: Fisher正交秩适应实现参数高效微调
FoRA提出了一种参数高效微调方法,通过Fisher评分选择任务相关层,并在Stiefel流形上训练LoRA下投影,在保持精度的同时减少参数。
FedWeave: 重新思考异构联邦MoE-LoRA中专精化的单元
FedWeave针对联邦MoE-LoRA提出非对称聚合方法,通过分离专家聚合与路由器优化来处理任务异构性,从而实现更好的专精化与性能。