用于通信高效联邦LoRA微调的自适应相位切换

arXiv cs.LG 论文

摘要

本文介绍了一种用于通信高效联邦LoRA微调的自适应相位切换方法,在保持大型语言模型性能的同时,实现了高达40.5%的通信成本往返节省。

arXiv:2609.13512v1 公告类型:新 摘要:使用低秩适配的大型语言模型联邦微调减少了每个客户端的可训练参数,但客户端到服务器通信仍然是主要成本。现有的联邦LoRA协议核算忽略了当协议改变聚合模式时的非对称转换轮次,并报告了忽略分组查询注意力形状的节省。本文测量了双向仅B联邦LoRA协议的每轮上传和下载字节数,并将五种方法,其中三种来自先前工作,置于单个通信质量前沿上。该前沿有一个拐点,自适应相位切换聚合器ReverseAdaptive通过监控全局训练损失的相对改进相对于无量纲阈值来定位,而不是预先固定相位边界。在TinyLlama-1.1B-Chat与Alpaca上,ReverseAdaptive在保持指令跟随损失成本为0.0063的情况下,实现了40.5%的测量往返节省,优于FLoRA。它在保持损失上比FFA-LoRA高出0.0182,后者在初始化时冻结了两个LoRA因子中的第一个,这一差异是每方法种子标准差最大值的二十倍以上,因此在冻结之前学习该因子会产生更好的适配器。相同的阈值无需调整即可跨模型规模转移,并且在测试的两个数据集上,转换的质量成本是稳定的。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:42

# 用于通信高效联邦LoRA微调的自适应相位切换  
来源:https://arxiv.org/html/2609.13512  
{IEEE关键词}  
通信效率,联邦学习,大语言模型,低秩适应,参数高效微调  

###### 摘要  
基于低秩适应的大语言模型联邦微调虽然减少了每个客户端的可训练参数,但客户端到服务器的通信仍然是主要开销。现有联邦LoRA协议的开销计算忽略了协议切换聚合模式时的非对称转换轮次,且其报告的节省量未考虑分组查询注意力的形状。本文测量了一种双向仅B联邦LoRA协议每轮的上行与下行数据量,并将五种方法(其中三种来自先前研究)置于同一通信-质量前沿上。该前沿存在一个拐点,自适应相位切换聚合器ReverseAdaptive通过监测全局训练损失的相对改进是否达到无量纲阈值来定位该拐点,而非预先固定相位边界。在TinyLlama-1.1B-Chat模型与Alpaca数据集上,ReverseAdaptive相比FLoRA实现了40.5%的实测往返节省,其保留指令跟随任务损失的成本仅为0.0063。相比在初始化时冻结两个LoRA因子中第一个的FFA-LoRA方法,ReverseAdaptive的保留损失低0.0182,这一差距是该指标上各方法种子标准差最大值的二十倍以上,表明在冻结前先训练该因子能生成更优的适配器。该阈值无需重新调优即可在不同模型规模间迁移,且在测试的两个数据集上转换过程的质量损失保持稳定。  

††通信作者:Jerry Adams Franklin(邮箱:[email protected])。ORCID: 0009-0006-8470-8349。  
††注:本研究未获得外部资助。作者声明无利益冲突。本文已提交至IEEE计算机学会开放期刊进行同行评审。  

## 1 引言  
\\IEEEPARstart  
联邦学习使得在不共享原始数据的情况下跨分布式客户端进行模型训练成为可能,这使其在大语言模型的隐私敏感应用中备受青睐。使用LoRA进行微调显著减少了每个客户端的可训练参数数量,但联邦LoRA聚合每轮仍需传输相当可观的数据量。若有10个客户端参与每轮训练,共进行15轮,则累积通信成本决定了协议在带宽受限环境中的部署可行性。  

现有联邦LoRA方法在聚合内容和聚合时机上各不相同。FedIT直接将FedAvg应用于LoRA的AA和BB矩阵,每轮支付完整的双向通信成本。FFA-LoRA在初始化时冻结AA,因此客户端从第一轮起仅训练并传输BB,理论上可节省50%的上行数据。FLoRA通过堆叠客户端LoRA模块并使用SVD压缩,在维持乘积空间语义的同时支付完整的双向通信成本。FlexLoRA支持异构客户端秩,与本文研究的通信协议正交。这四种方法均以参数数量比而非实测字节数来报告通信节省;更新的研究已开始直接测量传输数据量。  

尚未明确表征的是协议在聚合模式之间切换时出现的非对称轮次,以及使用自适应信号来选择切换时机。本文通过三项贡献解决这些空白。  

**带实测字节追踪的双向仅B协议。** 该协议为Two-Phase和ReverseAdaptive聚合器实现了上行和下行的仅B传输。每轮上行和下行的兆字节数基于实际传输的张量进行记录。转换轮次(即服务器从客户端上传中获取其冻结的AA)被明确计入,这导致在下载节省开始与上行节省开始之间产生一轮的不对称性。  

**ReverseAdaptive:自适应相位切换聚合器。** 该聚合器从FLoRA模式开始,监测全局训练损失的*相对*每轮改进。当该相对改进在预热期后首次低于无量纲阈值τ时,聚合器永久切换到FFA-LoRA模式。改变τ所遍历的通信-质量前沿与固定的K值Two-Phase家族相同,但无需预先选择K值。  

**五种方法的前沿及其拐点。** 五种协议(其中三种来自先前研究)在Alpaca数据集上、TinyLlama-1.1B规模下被置于同一实测前沿上;其中三种还在Dolly-15k数据集上以及在LLaMA-3.2-3B规模下进行了比较。质量评估采用保留指令跟随损失,而非零样本基准测试,因后者在较小规模下无法区分不同协议。该前沿在ReverseAdaptive处存在一个拐点:超过该点后,每单位节省所需的质量代价大约增加五倍。  

**主要数字:** Two-Phase K=8相比FLoRA节省了27.7%(TinyLlama-1.1B)和26.0%(LLaMA-3.2-3B)。ReverseAdaptive分别节省了40.5%和30.0±4.0%。FFA-LoRA在TinyLlama规模下节省了61.9%,但其保留损失比ReverseAdaptive高0.0182。在LLaMA-3.2-3B规模下,ReverseAdaptive与Two-Phase K=8的最终损失差异为1.25×10^{-5},比1.1B规模下的差异小约350倍。  

复现所有图表和表格所需的代码、配置文件和脚本已公开发布;参见附录11。  

## 2 相关工作  
### 2.1 LoRA与参数高效微调  
参数高效微调方法通过仅训练一小部分参数来降低适应大型预训练模型的成本。适配器调优在Transformer层之间插入小型可训练模块。LoRA将权重更新分解为低秩乘积BA,其中B为d×r,A为r×k,r远小于min(d, k)。这大幅减少了可训练参数,使得无需修改基础权重即可微调大型模型。QLoRA通过将冻结的基础模型量化为4位,同时在16位精度下训练LoRA适配器,进一步降低了内存占用。由此产生的LoRA适配器紧凑且可组合,非常适合存储和通信均受限的联邦环境。  

### 2.2 联邦LoRA聚合  
FedIT将标准FedAvg应用于LoRA矩阵:全局AA和BB矩阵由客户端AA和BB矩阵的加权平均计算得出。这种聚合引入了一种失配:最优全局更新是乘积BA,而非分别平均后的B和A的乘积。独立平均引入的聚合误差随客户端异构性增加。FFA-LoRA通过在初始化时冻结AA并在所有客户端上仅训练BB来解决聚合失配问题。由于AA恒定,服务器可直接聚合BB矩阵而不产生乘积空间失真。理论上的上行节省为50%。该原始工作还从差分隐私角度论证了冻结AA设计的合理性。与本文协议的关键区别:FFA-LoRA在初始化时冻结AA,而双向仅B协议允许在冻结前通过FLoRA阶段学习AA,以初始开销更长为代价恢复了表达能力。FLoRA通过水平堆叠客户端LoRA模块并应用截断SVD来恢复全局低秩适配器,保留了乘积空间语义,减少了FedIT中存在的聚合偏差。权衡在于通信成本:FLoRA每轮在两个方向上传输完整的A+B负载。FLoRA是本文实验中的全状态基准。FedSA-LoRA做出了相反的选择,仅共享AA,理由是AA承载通用知识而BB是客户端特定的;根据第3-3.4节的字节计数,在TinyLlama上共享AA而非BB传输的是完整状态的64%而非36%。FlexLoRA将联邦LoRA扩展到异构秩设置,其中不同客户端根据本地计算预算使用不同的LoRA秩。FlexLoRA的贡献与本文正交;双向仅B协议同样适用于同构秩客户端。  

### 2.3 通信高效的联邦学习  
联邦学习中的通信效率自FedAvg引入本地多步更新以减少通信轮次以来一直是一个核心关注点。Kairouz等人综述了联邦学习中开放问题的更广泛挑战。后续工作通过梯度压缩追求每轮负载减少。QSGD通过随机量化降低传输梯度的位宽。深度梯度压缩应用了激进的稀疏化,每轮仅发送0.1%的梯度并带有误差反馈。FedPAQ将周期性平均与量化相结合,表明8位传输导致的精度损失可忽略不计。这些技术与本文研究的仅B协议正交,原则上可与其组合以实现额外节省。  

### 2.4 自适应聚合与调度  
多种联邦学习方法根据观察到的训练动态调整其行为。FedProx在本地目标函数中添加了自适应近端项,控制其对全局模型的偏离。FedNova通过有效步数对本地梯度进行归一化,自适应地校正异构本地训练。FedAdam和FedYogi在服务器层面应用自适应矩估计,将聚合的伪梯度作为Adam风格更新的输入。联邦学习中的课程调度在训练过程中调整聚合频率,在结构上与ReverseAdaptive的相位切换相关,因为两种方法在训练早期和后期的行为不同。据作者所知,先前的联邦LoRA工作均未使用损失平台信号来在训练期间切换不同的聚合模式。  

## 3 方法  
### 3.1 背景与符号  
每个客户端N持有一个本地数据集。共享基础模型具有权重矩阵W。LoRA将参数化更新表示为ΔW=BA,其中B为d×r,A为r×k。在每个联邦轮次中,客户端训练其本地适配器一个周期,向服务器上传某种表示,并接收全局状态。一轮的通信成本是上行字节数与下行字节数之和。完整状态中仅B部分的比例并非简单参数计数所暗示的50%,因为分组查询注意力固定了BB与AA参数的比例;第3-3.4节推导出TinyLlama-1.1B的精确比例为36%,LLaMA-3.2-3B为40%。  

### 3.2 双向仅B协议  
**阶段1(FLoRA,第1至K轮):** 服务器运行FLoRA聚合:客户端状态被堆叠并通过SVD压缩,以生成全局(A_global, B_global)。上行和下行负载均为完整状态。  
**转换(第K+1轮):** 客户端仍然上传完整状态(A_i, B_i),因为服务器需要AA矩阵来计算和缓存A_frozen。服务器首次运行FFA-LoRA聚合,缓存A_frozen,并广播完整的全局状态。  
**阶段2稳态(第K+2轮起):** 客户端仅上传B_i;服务器在聚合前将完整状态重构为(A_frozen, B_i)。服务器仅广播B_global;客户端在本地保留A_frozen。  
**前瞻下行计数:** 这产生了一轮的不对称性:下载节省比上行节省早一轮开始。实验运行器一致记录此情况,确保报告的总数据量准确而非乐观。  
算法1规定了服务器每轮的决策逻辑。  

### 3.3 ReverseAdaptive聚合器  
ReverseAdaptive用自适应损失平台信号替代了固定的边界K。在预热期W轮(默认W=5)之后,它监测*相对*每轮损失改进ρ_r = (ℓ_{r-1} - ℓ_r) / ℓ_{r-1}。当ρ_r首次低于τ时,聚合器立即永久切换到FFA-LoRA模式,无中间阶段。由于ρ_r是损失的比值,τ是一个无量纲的分数而非损失差值,其解释不依赖于给定模型或数据集的绝对损失规模;第5节表明,这种无尺度的构造使得单一的τ值无需重新调优即可在不同模型规模间迁移。  

一个互补的稳定性检测器会在切换后损失增加超过10%时恢复到FLoRA模式。在本文报告的所有ReverseAdaptive运行中(跨两个数据集、两个模型规模、所有三种分区设置和完整的阈值消融研究),均未发生恢复。  

τ的选择在通信节省与最终训练损失之间进行权衡。较小的τ延迟切换;较大的τ在预热期后的第一个合格轮次即触发切换。第4-4.7节从经验上表征了这一权衡。

相似文章

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。