RW-LoRA:通过随机游走实现通信高效的去中心化LoRA微调
摘要
本文介绍了RW-LoRA,这是一种利用随机游走减少通信和计算成本的去中心化LoRA微调方法,同时在NLP任务上实现竞争性性能。
arXiv:2609.00078v1 Announce Type: new
摘要:参数高效微调方法,如LoRA,已成为适应大型基础模型的标准方法。将微调应用于分布式设置面临若干挑战。大多数现有分布式LoRA方法依赖集中式聚合,而基于gossip的去中心化LoRA需要在多个模型副本之间进行重复同步。这两种方法都会导致显著的通信开销,并由于同时聚合多个模型更新而引入错误。在本文中,我们采取不同的视角,提出了一种基于随机游走的LoRA微调方案。与维护多个模型副本不同,一个单一模型令牌遍历网络,并使用本地微调目标进行顺序更新。这种设计消除了全局同步的需要,显著降低了通信和计算成本,并避免了聚合错误。我们在标准假设下,为非凸目标提供了严格的收敛保证。通过对多个NLP任务和图拓扑的实证结果,我们表明所提出的方法在任务性能上具有竞争力,同时比基于gossip的LoRA显著减少了通信和计算。
查看缓存全文
缓存时间: 2026/09/02 06:08
# RW-LoRA:基于随机游走的通信高效去中心化LoRA微调
来源:https://arxiv.org/html/2609.00078
Rohit BhagatGhadir AyacheRawad BitarYanmin GongSalim El Rouayheb††thanks:Xingran Chen is with the Engineering Systems and Design Pillar, Singapore University of Technology and Design, Singapore 487372 \(E\-mail: xingranc@ieee\.org\)\. Ghadir Ayache is with the LinkedIn, New York, NY 10118, USA \(E\-mail: ayache\.ghad@gmail\.com\)\. Rawad Bitar is with the Chair of Communications Engineering, Technical University of Munich, 80333 Munich, Germany \(E\-mail: rawad\.bitar@tum\.de\)\. Yanmin Gong is with School of Engineering Medicine and the Department of Computer Science, Texas A&M University, College Station, TX 77843, USA \(E\-mail: yanmin\.gong@tamu\.edu\)\. Rohit Bhagat and Salim El Rouayheb are with Department of Electrical and Computer Engineering, Rutgers University, Piscataway Township, NJ 08854, USA \(E\-mail: \{rb1395, sye8\}@scarletmail\.rutgers\.edu\)\. This paper has been accepted by IEEE ITW 2026\.
###### 摘要
参数高效微调方法(如LoRA)已成为适配大型基础模型的标准方案。将微调应用于分布式场景面临多重挑战。现有分布式LoRA方法大多依赖中心化聚合,而基于八卦协议的去中心化LoRA则需要多个模型副本间进行重复同步。这两种方法均导致显著的通信开销,并因同时聚合多个模型更新而引入误差。本文从不同视角出发,提出一种基于随机游走的LoRA微调方案。该方案不维护多个模型副本,而是让单个模型令牌遍历网络,并利用本地微调目标进行顺序更新。此设计消除了全局同步需求,大幅降低了通信与计算成本,并避免了聚合误差。我们在标准假设下为非凸目标提供了严格的收敛性保证。通过对多项NLP任务和图拓扑结构的实证研究表明,所提方法在通信与计算开销显著低于八卦协议LoRA的同时,实现了具有竞争力的任务性能。
## I 引言
GPT‑4\[1 (https://arxiv.org/html/2609.00078#bib.bib23)\]、LLaMA\[2 (https://arxiv.org/html/2609.00078#bib.bib22)\]和BERT\[3 (https://arxiv.org/html/2609.00078#bib.bib21)\]等基础模型已变革人工智能领域,在从翻译到摘要生成等广泛任务中表现出色\[4 (https://arxiv.org/html/2609.00078#bib.bib12),5 (https://arxiv.org/html/2609.00078#bib.bib20)\]。为在特定领域任务中取得优异性能,这些模型常需使用本地或任务特定数据进行适配。然而,其规模通常介于10810^\{8\}至101110^\{11\}参数之间,使得全量微调计算成本高昂、通信开销巨大且易过拟合。参数高效微调方法,尤其是低秩自适应,通过仅更新少量额外参数而冻结主干模型来应对此挑战\[6 (https://arxiv.org/html/2609.00078#bib.bib11)\]。因此,LoRA显著降低了微调的计算与通信成本。
LoRA的优势在分布式和资源受限应用(如医疗健康、边缘个性化及企业AI)中尤为重要,这些场景中的隐私、带宽和数据主权约束常阻碍原始数据集中化。在此类环境中,微调必须通过多数据所有者或边缘节点间的分布式协作完成。其中,联邦LoRA方法\[7 (https://arxiv.org/html/2609.00078#bib.bib18),8 (https://arxiv.org/html/2609.00078#bib.bib19),9 (https://arxiv.org/html/2609.00078#bib.bib17),10 (https://arxiv.org/html/2609.00078#bib.bib16),11 (https://arxiv.org/html/2609.00078#bib.bib15),12 (https://arxiv.org/html/2609.00078#bib.bib14),13 (https://arxiv.org/html/2609.00078#bib.bib13)\]已成为主流方法。但这些方法依赖通过参数服务器进行的中心化聚合,这引入了通信与内存开销,并造成单点故障。为消除中心协调需求,Ghiasvand等人\[4 (https://arxiv.org/html/2609.00078#bib.bib12)\]近期提出一种基于八卦协议的去中心化LoRA方法。然而,八卦协议方法要求节点与邻居反复交换模型更新,在密集或带宽受限网络上仍可能导致显著的通信开销。
更重要的是,LoRA更新具有W=BAW=BA的形式,其中模型W∈Rd1×d2W\\in\\mathbb\{R\}^\{d\_\{1\}\\times d\_\{2\}\}被分解为两个低秩矩阵A∈Rr×d2A\\in\\mathbb\{R\}^\{r\\times d\_\{2\}\}和B∈Rd1×rB\\in\\mathbb\{R\}^\{d\_\{1\}\\times r\},且r≪min\{d1,d2\}r\\ll\\min\\\{d\_\{1\},d\_\{2\}\\\}。在联邦学习和八卦协议学习中,节点的本地模型WiW\_\{i\}需要在每轮进行平均。为避免传输其本地Wi=BiAiW\_\{i\}=B\_\{i\}A\_\{i\},节点发送其分解矩阵AiA\_\{i\}和BiB\_\{i\}。聚合可通过两种方式进行,各有缺陷:(i)直接平均分解矩阵会导致*双线性失配*\[14 (https://arxiv.org/html/2609.00078#bib.bib33),15 (https://arxiv.org/html/2609.00078#bib.bib34),16 (https://arxiv.org/html/2609.00078#bib.bib35),17 (https://arxiv.org/html/2609.00078#bib.bib36)\],因为∑iBiAi≠\(∑iBi\)\(∑iAi\)\\sum\_\{i\}B\_\{i\}A\_\{i\}\\neq\(\\sum\_\{i\}B\_\{i\}\)\(\\sum\_\{i\}A\_\{i\}\);(ii)先计算Wi=BiAiW\_\{i\}=B\_\{i\}A\_\{i\},平均后再进行奇异值分解以获得W的低秩分解,这增加了计算量并可能引入截断误差。
为解决这些局限,我们倡导基于令牌的随机游走学习作为可扩展的替代方案。一个包含当前低秩因子对\(At,Bt\)\(A\_\{t\},B\_\{t\}\)的令牌,在图中通过每次迭代从当前节点移动到随机选择的邻居节点来遍历网络,并利用该节点的本地数据进行更新\[18 (https://arxiv.org/html/2609.00078#bib.bib27),19 (https://arxiv.org/html/2609.00078#bib.bib26),20 (https://arxiv.org/html/2609.00078#bib.bib28)\]。随机游走学习不同于基于共识和八卦协议的方法\[7 (https://arxiv.org/html/2609.00078#bib.bib18),4 (https://arxiv.org/html/2609.00078#bib.bib12)\]:它不维护和同步存储在各节点的本地模型,而是通过网络传播单个模型。这带来两大优势。首先,在每次迭代中,通信与计算资源用于推进单个模型轨迹,而非更新和协调本地模型。其次,在访问的每个节点上对模型进行顺序更新,避免了同时聚合多个更新带来的弊端。虽然其固有的顺序特性在需要快速收敛的应用中可能不占优势,但随机游走方法为后台运行或需要在低通信与计算开销下收敛的应用提供了一种有吸引力的替代方案。
我们的贡献总结如下:
1. \(i\)我们提出基于随机游走的LoRA微调作为八卦协议LoRA\[4 (https://arxiv.org/html/2609.00078#bib.bib12)\]的低通信开销替代方案。该设计实现了无需参数服务器或同步邻居聚合的去中心化微调。我们还为非凸目标提供了严格的收敛保证(定理1 (https://arxiv.org/html/2609.00078#Thmtheorem1))。
2. \(ii\)我们在若干GLUE基准任务上使用完整和环形通信图进行实验。训练数据以*i\.i\.d\.*方式划分到各节点。与基于八卦协议的去中心化LoRA基线\[4 (https://arxiv.org/html/2609.00078#bib.bib12)\]相比,RW‑LoRA在保持可比准确率的同时,显著降低了通信与计算开销(图1 (https://arxiv.org/html/2609.00078#S6.F1))。
## II 系统模型
我们考虑一组协作微调大型模型的节点。节点持有可用于微调的本地独立同分布数据集111将RW‑LoRA扩展至非*i\.i\.d\.*数据是未来工作。且仅能与其邻居通信。我们将通信网络表示为一个图,其中每个顶点对应一个节点,每条边表示两个相应节点可直接通信。携带模型参数的令牌在该图中从节点传递至节点。
###### 定义 1(通信拓扑与随机游走)。
通信拓扑定义为有限无向图G≜\(V,E\)\\mathcal\{G\}\\triangleq\(\\mathcal\{V\},E\),其中节点集V=\[N\]\\mathcal\{V\}=\[N\],边集E⊆\(V2\)E\\subseteq\\binom\{\\mathcal\{V\}\}\{2\}。该图上的随机游走\{vt\}t⩾0:Ω→VZ\+\\left\\\{v\_\{t\}\\right\\\}\_\{t\\geqslant 0\}:\\Omega\\to\\mathcal\{V\}^\{\\mathbb\{Z\}\_\{\+\}\}可由通用转移概率矩阵P:V→M\(V\)P:\\mathcal\{V\}\\to\\mathcal\{M\}\(\\mathcal\{V\}\)定义,其中在时刻t∈Z\+t\\in\\mathbb\{Z\}\_\{\+\}从节点u到节点v的单步转移概率为Puv≜Pr\(vt\+1=v|vt=u\)P\_\{uv\}\\triangleq\\mathrm\{Pr\}\\left\(v\_\{t\+1}=v\\,\\middle\|\\,v\_\{t\}=u\\right\)。
不失一般性,我们假设对于图G\\mathcal\{G\}中与节点u相连的所有节点v,Puv>0P\_\{uv\}>0。
平稳分布描述了随机游走长期停留在各节点的时间比例。令PP为定义1中定义的转移矩阵。概率π\\pi称为平稳分布,若π=πP\\pi=\\pi P。
令π0\\pi\_\{0\}表示初始分布,πt=Ptπ0\\pi\_\{t\}=P^\{t\}\\pi\_\{0\}表示时间步t的分布。对于ε>0\\epsilon>0,\{vt\}t⩾0\\left\\\{v\_\{t\}\\right\\\}\_\{t\\geqslant 0\}的混合时间τmix(ε)\\tau\_\{\\mathrm\{mix\}\}\(\\epsilon\)定义为\[18 (https://arxiv.org/html/2609.00078#bib.bib27), 定义 2\]:
τmix(ε)=inf\{t⩾1|∀π0,dTV(Ptπ0,π)⩽ε\},\\displaystyle\\tau\_\{\\mathrm\{mix\}\}\(\\epsilon\)=\\inf\\left\\\{t\\geqslant 1|\\forall\\pi\_\{0\},d\_\{\\text\{TV\}\}(P^\{t}\\pi\_\{0\},\\pi)\\leqslant\\epsilon\\right\\\},其中dTV(⋅,⋅)d\_\{\\text\{TV\}\}(\\cdot,\\cdot)为全变差距离,π0\\pi\_\{0\}是初始分布。
我们考虑去中心化随机优化
minwf(w)=minwEv∼π[fv(w)],\\displaystyle\\min\_\{\\bf w\}\\,f(\{\\bf w\})=\\min\_\{\\bf w\}\\,\\mathbb\{E\}\_\{v\\sim\\pi\}\\left\[f\_\{v\}(\{\\bf w\})\\right\],(1)其中w\{\\bf w\}表示待微调的参数集(详细信息见第III‑A节和第IV节),π\\pi是节点集V\\mathcal\{V\}上的概率分布。在我们的设置中,ff是全局微调目标,而fvf\_\{v\}是与存储在节点v的数据相关的本地微调目标。令Dv\\mathcal\{D\}\_\{v\}表示与用户v相关的本地数据分布,则本地微调目标fvf\_\{v\}的随机形式为:
fv(w)=Eξv∼Dv[Fv(w,ξv)].\\displaystyle f\_\{v\}(\{\\bf w\})=\\mathbb\{E\}\_\{\\xi\_\{v\}\\sim\\mathcal\{D\}\_\{v\}}\\left\[F\_\{v\}(\{\\bf w\};\\xi\_\{v\})\\right\].(2)令\{vt\}t⩾0\\\{v\_\{t\}\\\}\_\{t\\geqslant 0\}为V\\mathcal\{V\}上具有平稳分布π\\pi的随机游走。在时刻t,模型令牌位于节点vtv\_\{t\},仅利用该节点的本地目标进行更新\[18 (https://arxiv.org/html/2609.00078#bib.bib27),19 (https://arxiv.org/html/2609.00078#bib.bib26),20 (https://arxiv.org/html/2609.00078#bib.bib28)\]:
wt\+1=wt−η∇fvt(wt),\\displaystyle\{\\bf w\}\_\{t\+1\}=\{\\bf w\}\_\{t\}\-\\eta\\nabla f\_\{v\_\{t\}\}(\{\\bf w\}\_\{t\}),(3)其中η>0\\eta>0为步长。公式(3)仅提供了基于随机游走学习的一般随机游走更新规则。其适配LoRA设置的详细方案见第IV节。
## III LoRA基础
### III‑A 低秩自适应
考虑一个预训练模型Φ0\\Phi\_\{0\},由多个参数化为权重矩阵的层组成。令W0∈Rd1×d2W\_\{0\}\\in\\mathbb\{R\}^\{d\_\{1\}\\times d\_\{2\}\}表示某一层的权重矩阵。在全量微调中,将学习一个更新矩阵ΔW∈Rd1×d2\\Delta W\\in\\mathbb\{R\}^\{d\_\{1\}\\times d\_\{2\}\}并使用W=W0\+ΔWW=W\_\{0\}\+\\Delta W。为提高微调效率,LoRA保持W0W\_\{0\}固定,并将更新限制为低秩形式\[6 (https://arxiv.org/html/2609.00078#bib.bib11)\]ΔW=BA\\Delta W=BA,其中A∈Rr×d2A\\in\\mathbb\{R\}^\{r\\times d\_\{2\}\},B∈Rd1×rB\\in\\mathbb\{R\}^\{d\_\{1\}\\times r\},且r≪min\{d1,d2\}r\\ll\\min\\\{d\_\{1\},d\_\{2\}\\\}。因此,适配后的权重矩阵变为
W=W0\+BA.\\displaystyle W=W\_\{0\}\+BA\.(4)在微调阶段,LoRA优化因子(也称为适配器)AA和BB,而非直接更新ΔW\\Delta W。这将可训练参数数量从d1d2d\_\{1\}d\_\{2\}减少至r(d1\+d2)r(d\_\{1\}\+d\_\{2\}),从而降低了所需的计算与内存资源\[7 (https://arxiv.org/html/2609.00078#bib.bib18)\]。本文中,我们将r称为LoRA秩,通常从\{2,4,8,16\}\\\{2,4,8,16\\\}中选取。
### III‑B 基于联邦LoRA的微调
LoRA已成为适配基础模型的流行方法\[6 (https://arxiv.org/html/2609.00078#bib.bib11)\]。为实现跨分布式数据源的高效微调,LoRA近期被融入联邦学习。代表性方法包括FLoRA\[7 (https://arxiv.org/html/2609.00078#bib.bib18)\]、FedALT\[8 (https://arxiv.org/html/2609.00078#bib.bib19)\]、FedLoRA\[9 (https://arxiv.org/html/2609.00078#bib.bib17)\]、FRLoRA\[10 (https://arxiv.org/html/2609.00078#bib.bib16)\]、FedSA‑LoRA\[11 (https://arxiv.org/html/2609.00078#bib.bib15)\]、FedEx‑LoRA\[12 (https://arxiv.org/html/2609.00078#bib.bib14)\]和FedMomentum\[13 (https://arxiv.org/html/2609.00078#bib.bib13)\]。这些方法主要差异在于如何在客户端间聚合或个性化LoRA适配器。例如,FLoRA、FedALT和FedLoRA通过堆叠、个性化组件或全局‑本地知识交换处理异构或个性化LoRA适配器。其他方法包括FRLoRA、FedSA‑LoRA、FedEx‑LoRA和FedMomentum,通过残差更新、选择性因子共享、精确性保持校正或基于动量的聚合来提高聚合效率或稳定性。现有大多数联邦LoRA方法仍依赖通过服务器的中心化聚合。因此,它们继承了经典联邦学习的通信与协调瓶颈,这对大型基础模型而言日益成为限制。
### III‑C 基于令牌的随机游走学习
去中心化学习绕过了中心节点协调过程的需求。与本研究最接近的是近期工作\[4 (https://arxiv.org/html/2609.00078#bib.bib12)\]。作者研究了完全去中心化的、基于八卦协议的LoRA微调算法。他们在标准假设下为非凸目标建立了收敛保证。相比之下,我们的工作研究了一种基于随机游走的LoRA方法,避免了重复相似文章
LoRA-Diffusion:基于低秩轨迹分解的参数高效微调
LoRA-Diffusion 提出了一种针对扩散语言模型的参数高效微调方法,通过对去噪轨迹而非模型权重进行低秩分解,仅使用 1.2% 的轨迹适配器参数即可获得具有竞争力的性能。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
Echo-LoRA:通过跨层表示注入实现参数高效微调
本文介绍了 Echo-LoRA,这是一种新的参数高效微调方法,它将来自深层源层的跨层表示注入到浅层 LoRA 模块中,从而在不增加推理开销的情况下提升性能。
CARE-LoRA: 基于压缩激活重建的内存高效LoRA微调框架
CARE-LoRA提出了一种压缩激活重建框架,通过利用低秩投影来减少LoRA微调过程中的内存消耗。该方法在降低内存占用的同时,实现了具有竞争力的性能。
AQLoRA:一种快速量化LoRA微调的零搜索方案
AQLoRA是一种零搜索方法,通过自适应地将高NF4重构误差的层保持为fp16格式,加速量化LoRA微调,实现最高11%的训练速度提升,且精度损失极小。