关于基于推送的异步联邦学习:一种偏差纠正聚合方法

arXiv cs.LG 论文

摘要

本文提出了PushCen-ADFL,一种通信高效的异步去中心化联邦学习框架,它使用基于质心的消息传递和偏差纠正,在异构条件下提高准确性并降低通信开销。

arXiv:2605.26162v1 公告类型:新 摘要:异步去中心化联邦学习(ADFL)消除了中心协调和全局同步,使其适用于大规模异构系统。然而,频繁的点对点通信、有向拓扑上的异步更新以及非独立同分布数据共同导致过高的通信开销、有偏聚合和严重的模型漂移。我们提出了PushCen-ADFL,一种通信高效的ADFL框架,可在非对称通信和客户端延迟参与下实现稳定训练。PushCen-ADFL将通信、聚合和局部稳定耦合在一个共享的质心表示空间中,形成压缩和优化之间的闭环。客户端交换质心形式的消息,应用保持平均的push-sum混合来纠正聚合偏差,并使用轻量级的质心正则化(锚定在同一质心空间)来减轻异构性和陈旧性下的漂移。一个有界、发送者去重缓冲区进一步提高了不规则异步到达下的鲁棒性。在视觉数据集上的实验表明,PushCen-ADFL在数据异构性下将准确率提高了高达6%,同时将每次推送的通信成本降低了超过80%,实现了有利的准确率-通信权衡。
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:04

# 基于推送的异步联邦学习:一种偏差校正聚合方法
Source: https://arxiv.org/html/2605.26162 Jiahui BaiSchool of Computer Technologies, RMIT UniversityMelbourneVICAustraliajiahui\.bai2@student\.rmit\.edu\.au (https://arxiv.org/html/2605.26162v1/mailto:[email protected])Hai DongSchool of Computer Technologies, RMIT UniversityMelbourneVICAustraliahai\.dong@rmit\.edu\.au (https://arxiv.org/html/2605.26162v1/mailto:[email protected])andA\.K\. QinSchool of Science, Computing and Engineering Technologies, Swinburne University of TechnologyHawthornVICAustraliakqin@swin\.edu\.au (https://arxiv.org/html/2605.26162v1/mailto:[email protected]) (2026) ###### 摘要。异步去中心化联邦学习(ADFL)消除了中心协调和全局同步,使其对大规模和异构系统具有吸引力。然而,频繁的点对点通信、有向拓扑上的异步更新以及非独立同分布数据共同导致过度的通信开销、有偏的聚合和严重的模型漂移。我们提出PushCen-ADFL,一种通信高效的ADFL框架,能够在非对称通信和延迟客户端参与下实现稳定训练。PushCen-ADFL在共享的质心表示空间中将通信、聚合和局部稳定耦合在一起,形成压缩与优化之间的闭环。客户端交换质心形式的消息,应用保持平均的推和混合来校正聚合偏差,并利用锚定在同一质心空间的轻量级质心正则化来缓解异构性和陈旧性下的漂移。一个带边界、去重发送方的缓冲区进一步增强了在异步非规律到达情况下的鲁棒性。在视觉数据集上的实验表明,PushCen-ADFL在数据异构性下将准确率提高了最多6%,同时将每次推送的通信成本降低了80%以上,实现了良好的准确率-通信权衡。联邦学习,去中心化优化,异步通信,分布式机器学习††journalyear:2026††copyright:cc††conference:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V\.2; August 09–13, 2026; Jeju Island, Republic of Korea††booktitle:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V\.2 \(KDD ’26\), August 09–13, 2026, Jeju Island, Republic of Korea††doi:10\.1145/3770855\.3817925††isbn:979\-8\-4007\-2259\-2/2026/08††ccs:Computing methodologies Neural networks††ccs:Computing methodologies Regularization††ccs:Computing methodologies Massively parallel algorithms††ccs:Computing methodologies Self\-organization††ccs:Computing methodologies Mobile agents## 1\.引言

联邦学习(FL)已成为一种保护隐私的分布式机器学习范式,能够在数据无法集中共享时实现协作模型训练(McMahan等人,2017(https://arxiv.org/html/2605.26162#bib.bib14);Li等人,2018(https://arxiv.org/html/2605.26162#bib.bib15);Mughal等人,2024(https://arxiv.org/html/2605.26162#bib.bib16))。通过在本地设备上执行训练并仅交换模型更新,FL允许在不直接访问原始数据的情况下有效利用分布式数据资源,并在移动智能、物联网和跨组织协作等应用中展现出显著潜力(Li等人,2023(https://arxiv.org/html/2605.26162#bib.bib17);Liu等人,2023(https://arxiv.org/html/2605.26162#bib.bib18))。然而,大多数现有的联邦学习框架采用集中式和同步训练范式,其中中央服务器收集所有客户端的模型更新并在每个训练轮次中进行聚合。尽管这种设计在理想网络条件下表现良好,但在现实世界中面临多重挑战。首先,中央服务器引入了单点瓶颈和故障,由于通信带宽、计算能力和可靠性的限制,在大规模部署中限制了可扩展性(Dai等人,2022(https://arxiv.org/html/2605.26162#bib.bib19))。其次,同步训练要求客户端在轮次边界严格对齐,使系统容易受到设备异构性和系统变异性的影响,导致众所周知的落伍者问题,显著降低训练效率(Lang等人,2024(https://arxiv.org/html/2605.26162#bib.bib20);Jiang等人,2022(https://arxiv.org/html/2605.26162#bib.bib21))。最后,集中式架构在跨组织或跨领域场景中往往难以部署,与对无需信任和自主系统日益增长的需求相冲突(Dai等人,2022(https://arxiv.org/html/2605.26162#bib.bib19);Yuan等人,2024(https://arxiv.org/html/2605.26162#bib.bib22))。为了克服这些局限性,去中心化联邦学习(DFL)吸引了越来越多的关注。在DFL中,客户端仅与它们的邻居节点交换模型信息,而不依赖中央服务器,从而提高了系统的鲁棒性和可扩展性(Sun等人,2023(https://arxiv.org/html/2605.26162#bib.bib23);Yuan等人,2024(https://arxiv.org/html/2605.26162#bib.bib22))。尽管如此,大多数现有的去中心化方法仍然依赖同步更新机制,假设客户端在逻辑训练轮次之间保持对齐,这一假设在动态网络环境中难以满足(Bornstein等人,2023(https://arxiv.org/html/2605.26162#bib.bib1);Liu等人,2024a(https://arxiv.org/html/2605.26162#bib.bib24))。因此,异步去中心化联邦学习(ADFL)已被认为是更实用的实际部署训练范式(Liu等人,2024a(https://arxiv.org/html/2605.26162#bib.bib24);Dhasade等人,2025(https://arxiv.org/html/2605.26162#bib.bib25))。ADFL允许客户端在不同时间进行本地更新和通信,无需全局同步,同时仅通过邻居到邻居通信支持模型协作(Liu等人,2022(https://arxiv.org/html/2605.26162#bib.bib26);Jeong和Kountouris,2025(https://arxiv.org/html/2605.26162#bib.bib27))。这种设置自然适应设备异构性、网络变异性和部分参与,使客户端能够在任意时间加入训练过程(Rivero-Angeles等人,2022(https://arxiv.org/html/2605.26162#bib.bib29);Ameur等人,2022(https://arxiv.org/html/2605.26162#bib.bib28))。因此,ADFL非常适合边缘计算、点对点网络和大规模分布式系统,在系统吞吐量、容错性和部署灵活性方面具有显著优势。尽管有这些优势,这种高度灵活的训练范式也引入了新的挑战。具体来说,ADFL系统往往同时面临三个根本性困难。首先,由于客户端仅与邻居通信,且模型交换可能频繁发生,直接传输完整模型参数会带来巨大的通信开销,这在带宽受限或大规模系统中难以维持(McMahan等人,2017(https://arxiv.org/html/2605.26162#bib.bib14);Chen等人,2021(https://arxiv.org/html/2605.26162#bib.bib30))。与集中式设置相比,去中心化架构缺乏统一的通信调度和聚合,使得通信效率成为一个更突出的问题(Yuan等人,2024(https://arxiv.org/html/2605.26162#bib.bib22);Lalitha等人,2018(https://arxiv.org/html/2605.26162#bib.bib31))。其次,异步更新与非对称通信拓扑相结合可能导致有偏的聚合(Kempe等人,2003(https://arxiv.org/html/2605.26162#bib.bib32);Assran等人,2019(https://arxiv.org/html/2605.26162#bib.bib33))。在实践中,客户端可能在不同时间推送模型,通信链路可能不平衡,在这种情况下,简单的邻居平均无法保证无偏的一致性(Jeong和Kountouris,2025(https://arxiv.org/html/2605.26162#bib.bib27);Franceschelli等人,2009(https://arxiv.org/html/2605.26162#bib.bib34))。最后,各客户端之间普遍存在的统计异构性(非独立同分布数据)在异步去中心化环境中被进一步放大(Liu等人,2024a(https://arxiv.org/html/2605.26162#bib.bib24),2022(https://arxiv.org/html/2605.26162#bib.bib26);Ma等人,2024(https://arxiv.org/html/2605.26162#bib.bib3))。在非相同分布数据上计算的本地更新往往会导致显著的模型漂移,而异步通信可能延迟或错配这些更新,加剧训练不稳定性并降低最终性能(Wang等人,2024(https://arxiv.org/html/2605.26162#bib.bib35);Liu等人,2024b(https://arxiv.org/html/2605.26162#bib.bib36))。这些挑战并非相互独立。通信约束需要压缩。压缩会放大非独立同分布数据下的客户端漂移。异步性进一步延迟和扭曲这些更新。这些效应共同加剧了去中心化训练中的聚合偏差。因此,本文解决的中心研究问题是:*我们如何在非对称通信和非独立同分布数据下,联合设计压缩、去偏聚合和本地更新稳定化,以实现准确且稳定的ADFL?*为了解决这一研究问题,我们提出了一个新的ADFL框架,称为PushCen-ADFL(推和质心异步去中心化联邦学习)。所提出的框架围绕轻量级质心结构构建,并整合了基于质心的压缩与推和聚合,其中聚合和本地优化都在相同的质心表示空间中进行约束,从而在不依赖中央服务器或全局同步的情况下实现通信高效且稳定的联邦训练。我们的主要贡献总结如下:
- •我们提出了PushCen-ADFL,一个异步框架,将基于质心的通信、推和去偏以及缓冲邻居聚合统一到一个单一的去中心化训练管道中,其中聚合和本地优化都在相同的质心表示空间中进行。
- •我们设计了一种保持平均的推和聚合,具有质量分割和去重有界缓冲区,减轻了非对称信息流带来的偏差,并防止过时消息主导聚合。
- •我们开发了一种与质心对齐的近端正则化器,在与通信所使用的相同压缩质心空间中稳定本地更新。这种对齐通过将局部轨迹收缩到一个共享的压缩参考,从而减轻非独立同分布数据分布的影响。
- •我们提供了PushCen-ADFL的收敛性分析,并在CIFAR-10、CIFAR-100和Tiny-ImageNet上进行了验证,与通信高效的基线相比,准确率提高了最多6%,同时每次推送的传输载荷减少了超过80%(相比全模型通信)。

## 2\.相关工作

### 2\.1\.异步去中心化联邦学习

一个代表性方向是设计*免等待*或完全异步的通信机制以减轻落伍者效应。SWIFT提出了一种免等待的去中心化联邦学习算法,允许每个客户端在没有同步障碍的情况下继续进行,同时保持标准的迭代复杂度保证(Bornstein等人,2023(https://arxiv.org/html/2605.26162#bib.bib1))。作为补充,A2CiD2从优化角度研究异步去中心化深度学习,并引入连续局部动量以加速随机闲聊风格的通信(Nabli等人,2023(https://arxiv.org/html/2605.26162#bib.bib2))。除了通信原语,第二条工作线明确处理ADFL中出现的*陈旧性*和*异构性*问题。Ma*等人*提出了去中心化拓扑中ADFL的动态陈旧性控制,旨在通过调节容忍陈旧程度并推导具有理论支持的调度/控制策略,来平衡训练效率与模型质量(Ma等人,2024(https://arxiv.org/html/2605.26162#bib.bib3))。针对异构设备,Liao*等人*开发了AsyDFL,它整合了邻居选择和梯度推送,以减少非独立同分布数据和系统异构性下的通信成本和完成时间(Liao等人,2024(https://arxiv.org/html/2605.26162#bib.bib4))。最近,DSpodFL通过将本地更新和成对交换都建模为稀疏随机事件,提供了一个统一视角,从而捕捉随时间变化的计算/通信模式(Zehtabi等人,2025(https://arxiv.org/html/2605.26162#bib.bib5))。此外,AEDFL提出了一个ADFL框架,利用强化学习在异构、无服务器的训练设置中进行邻居模型选择(Liu等人,2024a(https://arxiv.org/html/2605.26162#bib.bib24))。尽管取得了这些进展,大多数现有的ADFL方法侧重于异步调度或陈旧性控制,同时假设全精度通信,因此未能共同解决频繁的点对点交换、非对称通信下的聚合偏差以及非独立同分布数据下的模型漂移,限制了它们在通信受限的去中心化系统中的实用性。

### 2\.2\.通信高效的联邦学习

一个突出的研究方向利用*知识蒸馏*来减少通信载荷。FedKD采用本地教师-学生方案,仅传输紧凑的学生(或蒸馏知识),通过蒸馏大幅降低上行/下行成本,同时保持准确性(Wu等人,2022(https://arxiv.org/html/2605.26162#bib.bib6))。另一个方向利用*稀疏性*来缩小通信更新:SpaFL通过可训练阈值以低开销诱导结构化稀疏性,同时减少通信和计算(Kim等人,2024(https://arxiv.org/html/2605.26162#bib.bib7))。此外,*低精度*方法降低了本地训练和传输更新的位宽;Li*等人*表明低精度本地训练在联邦学习中已经可以达到有竞争力的准确性(Li等人,2024(https://arxiv.org/html/2605.26162#bib.bib8))。在异步去中心化设置下也探索了通信效率:DivShare每次交互交换模型片段,以更好地容忍落伍者和带宽异构性,从而改善了点对点训练中的实际收敛时间(Biswas等人,2025(https://arxiv.org/html/2605.26162#bib.bib9))。总体而言,先前的通信高效联邦学习方法降低了通信成本,但并非为处理完全异步去中心化环境中聚合偏差和训练不稳定性的耦合挑战而设计。

## 3\.问题形式化

我们考虑一个包含NN个客户端的ADFL系统,记为V={1,2,...,N}\\mathcal\{V\}=\\\{1,2,\\dots,N\\\}。客户端通信由异步闲聊诱导的有向图G=(V,E)\\mathcal\{G\}=\(\\mathcal\{V\},\\mathcal\{E\}\)建模,其中(j→i)∈E\(j\\rightarrow i\)\\in\\mathcal\{E\}表示客户端ii可以从客户端jj接收信息。通信拓扑可以是非对称和失衡的,并且没有中央服务器;客户端仅与它们的邻居通信。我们将客户端ii的入邻居和出邻居分别记为Ni−\\mathcal\{N\}\_\{i\}^\{\-\}和Ni\+\\mathcal\{N\}\_\{i\}^\{\+\}。每个客户端ii持有一个私有的本地数据集Di\\mathcal\{D\}\_\{i\},数据分布可能具有异构性(非独立同分布),并维护一个本地模型副本wiw\_\{i\}。令fi(w)f\_\{i\}\(w\

相似文章

准确且资源高效的联邦持续学习

arXiv cs.LG

FedRAN是一种资源感知的分析型联邦持续学习框架,用紧凑的随机特征统计量替代基于梯度的更新,在显著降低通信与计算成本的同时实现高精度。

联邦学习

ML at Berkeley

本文解释了联邦学习作为一种保护隐私的机器学习技术的概念,该技术通过在本地设备而非中央服务器上训练模型来实现。文章详细描述了加密参数更新和聚合的过程,旨在降低数据泄露风险,同时保持模型性能。