面向异构优化器的无服务器半去中心化联邦学习

arXiv cs.LG 论文

摘要

提出SSD-FL,一种无服务器半去中心化联邦学习方法,通过有效损失函数和基于Cheeger不等式的迭代聚类优化异构环境中的聚类形成,提升了收敛速度和通信效率。

arXiv:2606.06687v1 公告类型:新 摘要:我们研究了去中心化联邦学习(FL)中异构机器学习(ML)优化器下的聚类形成问题,涉及聚类的数量和组成。虽然集中式FL中的聚类实现了可扩展性和资源节省,但其在完全去中心化环境中的价值和开发仍有待探索。在此类环境中优化聚类形成具有挑战性,尤其是因为网络图结构、本地数据异构性和不同本地ML模型优化器之间的复杂耦合。为了应对这些挑战,我们提出了一种无服务器半去中心化联邦学习(SSD-FL)方法,该方法无需持久化的服务器基础设施。在SSD-FL中,聚类形成通过一次轻量级的设备到设备(D2D)初始化阶段完成,此后实际的ML模型训练(以及共识和收敛过程)完全无服务器。在功能上,SSD-FL将全局轮次划分为簇内和簇间阶段,通过新颖的“有效损失函数”确保全局收敛和共识,该函数将设备特定的ML优化器与基于网络图的正则化相结合。接下来,SSD-FL利用Cheeger不等式产生的共识差距,开发了一种迭代聚类算法,并基于我们推导的收敛和共识边界进行评估,该边界包含一个独特的评分指标,用于量化设备间的数据和优化器异构性。最后,针对三类去中心化FL方法的实验评估验证了SSD-FL在各种网络图、数据集和本地优化器机制下均能提升收敛速度和通信效率。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:17

# 面向异构优化器的无服务器半去中心化联邦学习

来源:https://arxiv.org/html/2606.06687

Su Wang , Mung Chiang, , 和 H. Vincent Poor

Su Wang 和 H. Vincent Poor 就职于普林斯顿大学电气与计算机工程系,新泽西州普林斯顿,美国。邮箱:{hw5731, poor}@princeton.edu。Mung Chiang 就职于普渡大学电气与计算机工程系,西拉斐特,印第安纳州,美国。邮箱:[email protected]。

###### 摘要

本文针对采用异构机器学习(ML)优化器的去中心化联邦学习(FL),研究了涉及集群数量与组成的集群形成问题。尽管在中心化FL中,聚类已实现可扩展性和资源节约,但其在完全去中心化环境中的价值和发展仍有待探索。在此类环境中优化集群形成颇具挑战性,尤其是因为网络图结构、本地数据异构性以及不同本地ML模型优化器之间存在复杂的耦合关系。为应对这些挑战,我们提出了无服务器半去中心化联邦学习(SSD-FL),该方法无需持久服务器基础设施。在SSD-FL中,集群形成通过轻量级、一次性的设备到设备(D2D)初始化阶段完成,此后实际的ML模型训练(伴随共识与收敛过程)完全是无服务器的。从功能上讲,SSD-FL将全局轮次划分为集群内和集群间两种模式,通过新颖的“有效损失函数”确保全局收敛与共识,该函数将设备特定的ML优化器与基于网络图的正则化相结合。接着,SSD-FL利用Cheeger不等式通过共识间隙开发了一种迭代聚类算法,该算法根据我们推导出的收敛与共识边界进行评估,其中包含一个独特的评分指标,用于量化设备间的数据与优化器异构性。最后,针对三类去中心化FL方法的实验评估证实,SSD-FL在不同网络图、数据集和本地优化器配置下,均能提高收敛速度并改善通信效率。

## I 引言

基于边缘/雾网络,FL方法[51, (https://arxiv.org/html/2606.06687#bib.bib18) 12, (https://arxiv.org/html/2606.06687#bib.bib19) 43 (https://arxiv.org/html/2606.06687#bib.bib5)]被划分为中心化FL和去中心化FL[25 (https://arxiv.org/html/2606.06687#bib.bib17)],如图1 (https://arxiv.org/html/2606.06687#S1.F1)所示。中心化FL依赖服务器协调ML模型训练过程[41 (https://arxiv.org/html/2606.06687#bib.bib20),40 (https://arxiv.org/html/2606.06687#bib.bib21)],而去中心化FL[53 (https://arxiv.org/html/2606.06687#bib.bib8)]则依赖D2D通信逐步传播ML模型更新,最终同时实现共识与收敛。然而,在大规模边缘/雾网络中,两类FL都可能遇到困难,因为设备之间以及设备与服务器之间可能相距甚远(尤其对于中心化FL),导致延迟、收敛和共识方面的可扩展性挑战。为此,现有工作[52 (https://arxiv.org/html/2606.06687#bib.bib6),18 (https://arxiv.org/html/2606.06687#bib.bib1),1 (https://arxiv.org/html/2606.06687#bib.bib3)]引入了集群形成,即根据数据分布或网络属性对设备进行分组,以提升FL在大规模边缘/雾网络中的可扩展性。这些方法被称为半去中心化FL(SD-FL),通过利用预定义的集群实现了更快的收敛和更高的效率。但由于集群是先验给定的,我们仍然不了解有效集群形成的性质,即集群数量及其内部设备的组成。有效的集群形成需要在以下两者之间取得平衡:(i)宏观网络属性,如图连通性和变化的设备密度,以及(ii)微观设备属性,如异构数据集和ML优化器(这两者都会影响FL中的协作ML模型训练[41 (https://arxiv.org/html/2606.06687#bib.bib20),38 (https://arxiv.org/html/2606.06687#bib.bib23),19 (https://arxiv.org/html/2606.06687#bib.bib24)])。这些挑战在去中心化边缘/雾网络中更加严峻,因为此类网络缺乏持续的中心服务器同步。相反,去中心化边缘/雾网络通常被视为单个集群[36 (https://arxiv.org/html/2606.06687#bib.bib25),24 (https://arxiv.org/html/2606.06687#bib.bib26)],这在大型边缘/雾网络表现出广泛异构性时可能效率低下。拥有多个集群可能更高效,这样整体集群数据分布彼此相似,或者集群具有相似程度的图连通性。为将这些想法具体化,考虑以下潜在应用:

- • 去中心化能源电网依赖D2D通信且无需全局/中心控制,例如涉及D2D太阳能交易的电网[37 (https://arxiv.org/html/2606.06687#bib.bib9),17 (https://arxiv.org/html/2606.06687#bib.bib10)]。在这类边缘/雾网络中利用去中心化FL可能存在问题,因为D2D链路和密度高度异构,例如带有本地储能的新住宅区与较旧的分区相比。通过精心设计设备集群,SSD-FL既能实现(i)更快的局部化/相关共识,最小化频繁的长距离或昂贵D2D链路的成本,又能(ii)简化全网范围的协调,因为集成(局部)同步的集群可能比大量未协调的边缘/雾设备更容易。
- • 用于灾难恢复通信[28 (https://arxiv.org/html/2606.06687#bib.bib28),44 (https://arxiv.org/html/2606.06687#bib.bib29)]或多域无人车网络[29 (https://arxiv.org/html/2606.06687#bib.bib30),55 (https://arxiv.org/html/2606.06687#bib.bib31)]的Ad Hoc无线传感器网络同样是大规模分布式,且依赖高度异构的D2D通信链路。在自然灾害通信[28 (https://arxiv.org/html/2606.06687#bib.bib28),44 (https://arxiv.org/html/2606.06687#bib.bib29)]的情况下,边缘/雾网络的特点是设备密度和D2D连接存在高密度和低密度区域,例如散布在乡村平原之间的地震热点,或配备中继设备以覆盖其通信限制的无人机/无人车。SSD-FL通过精细的集群形成,可以使去中心化边缘/雾网络利用周期性的集群间通信,而不是频繁且总延迟更高的全局同步,从而整体上提高ML训练收敛速度。

参见图注
图1:基于网络去中心化程度的FL架构。从左到右,FL从由中心化全局服务器控制转变为完全去中心化的设备。SSD-FL在去中心化网络中引入集群,在去中心化边缘/雾网络中提供异构D2D协作密度。

为支持这些示例应用及其他应用,我们寻求回答如何在去中心化边缘/雾网络中以及何时形成集群。在这方面,集群形成涉及理解两个深度耦合的权衡:(i)全局级网络结构,它影响最优集群数量;以及(ii)局部级集群组成,它决定每个集群内的具体设备。集群数量直接控制局部收敛速度,但以牺牲全局共识为代价,例如,更多集群意味着更快的局部训练,但需要多轮多跳D2D通信才能达成全局共识。相反,每个集群内的设备选择定义了局部通信拓扑、数据分布(非独立同分布的程度)以及局部ML优化器集合,所有这些都影响集群内收敛特性。因此,为实现有效的集群形成,我们必须联合考虑集群数量及其组成。

我们提出的SSD-FL方法在不依赖持久服务器基础设施的情况下解决了这些耦合的权衡。这里的“无服务器”特指模型训练,所有协调完全通过D2D通信进行。尽管SSD-FL需要在训练前对网络设备进行一次轻量级、一次性的协调,但这与需要持续服务器管理的传统中心化FL以及SD-FL方法(即服务器是分布式训练过程的核心)形成根本性对比。因此,通过形式化这种无服务器集群形成,SSD-FL填补了在大规模边缘/雾网络中实现完全去中心化、无服务器FL的核心空白。

### I-A 内容概述与贡献总结

接下来,我们首先在第II节 (https://arxiv.org/html/2606.06687#S2)回顾相关文献,并在第III节 (https://arxiv.org/html/2606.06687#S3)介绍SSD-FL的系统模型及理论背景。然后,我们在第IV节 (https://arxiv.org/html/2606.06687#S4)推导所提SSD-FL方法的收敛与共识性质,随后在第V节 (https://arxiv.org/html/2606.06687#S5)介绍SSD-FL的聚类算法。接着,我们在第VI节 (https://arxiv.org/html/2606.06687#S6)通过实验验证SSD-FL相对于基线的性能,最后在第VII节 (https://arxiv.org/html/2606.06687#S7)总结关键要点。我们的主要贡献总结如下:

- • 面向去中心化FL的集群驱动方法:我们引入SSD-FL,该方法通过集群形成将服务器边缘/雾网络中的FL结构分解为集群内和集群间两种模式。为进行原则性的集群形成,SSD-FL提出了“有效损失函数”,其中包含(i)通过使用集群和全局拉普拉斯矩阵进行正则化而体现的网络结构异构性,以及(ii)不同设备ML优化器(即SGD、带动量的SGD和近端SGD)。
- • 集群内与集群间模式的集成收敛:我们刻画了集群内和集群间模式的理论收敛速率和共识间隙,证明了(i)具有异构优化器的非凸一阶驻点,以及(ii)由于通过图拉普拉斯矩阵进行正则化而导致的连通性驱动收敛。这些结果源自我们的有效损失函数,该函数同时处理动量项、近端项以及图正则化,需要扩展标准光滑性论证。最后,我们展示了SSD-FL的整体(集群内和集群间相结合)收敛,其中ML过程以及网络/集群图结构都是显式的。
- • 共识-收敛引导的集群形成:我们提出的SSD-FL方法通过一次性的部署前初始化步骤,利用网络图构和设备属性,确定最优集群数量及其组成。利用我们推导出的理论共识条件,我们通过Cheeger不等式将这些系统特性映射到明确的集群和图传导率阈值,然后将其用于划分网络并优化集群。
- • SSD-FL的实验验证:我们在不同架构、规模、连通性和异构性(即一致的和独特的本地ML优化器)的网络中,评估了SSD-FL在ML训练速度和质量方面的表现。这些实验表明,相对于三类去中心化FL基线,SSD-FL在FMNIST和CIFAR10数据集上提供了更好的最终准确度和更快的收敛速度。

## II 相关工作

我们将SSD-FL置于中心化FL的聚类方法和去中心化FL的相关进展中进行背景分析。特别地,我们希望强调,现有文献尚未提出FL中精确集群形成(即集群数量及其设备)的方法,即使在中心化边缘/雾网络中也是如此。因此,我们的研究旨在理解有效的聚类,进而弥合中心化FL中审慎的网络结构操作与完全去中心化边缘/雾场景之间的空白。

### II-A 中心化FL中的聚类

中心化FL中聚类的动机来自大规模边缘/雾网络,其中边缘设备可能远离中心服务器。现有文献并未强制要求设备到服务器的传输带来高延迟,而是提出了半去中心化FL[18 (https://arxiv.org/html/2606.06687#bib.bib1),1 (https://arxiv.org/html/2606.06687#bib.bib3),52 (https://arxiv.org/html/2606.06687#bib.bib6),47 (https://arxiv.org/html/2606.06687#bib.bib4)],其中设备被分组为集群。在这些集群内,设备遵循基于gossip的协议(类似于去中心化FL方法[32 (https://arxiv.org/html/2606.06687#bib.bib32),15 (https://arxiv.org/html/2606.06687#bib.bib36)])以实现集群内共识,之后每个集群中的单个设备与服务器通信以完成全局聚合。实际上,这些技术扩展了中心化FL的覆盖范围,连接了大规模网络的“边缘”,同时降低了整个FL过程的延迟。在分层FL[20 (https://arxiv.org/html/2606.06687#bib.bib33),4 (https://arxiv.org/html/2606.06687#bib.bib34),42 (https://arxiv.org/html/2606.06687#bib.bib22),11 (https://arxiv.org/html/2606.06687#bib.bib35)]中也有类似的研究路线。虽然这些方法也涉及集群形成,但其集群在局部以星形拓扑运行,由一个设备管理并同步其他设备,从而减少了网络设备到服务器通信的整体约束。然而,大规模边缘/雾网络的基本可扩展性问题依然存在,尤其是当设备距离其分配集群的“中心”设备较远时。此外,只有有限的一组可能的D2D连接被使用,即仅涉及每个集群中“中心”设备的那些D2D连接,因此,通过在整个集群中集成D2D协作,可进一步获得性能/延迟增益。

更广泛地说,现有的半去中心化和分层FL方法依赖于对集群的限制性假设。通常,集群要么是预先确定的[18 (https://arxiv.org/html/2606.06687#bib.bib1),33 (https://arxiv.org/html/2606.06687#bib.bib2),47 (https://arxiv.org/html/2606.06687#bib.bib4)],要么完全从统计属性(例如余弦相似度[1 (https://arxiv.org/html/2606.06687#bib.bib3)]或训练进度[45 (https://arxiv.org/html/2606.06687#bib.bib38),10 (https://arxiv.org/html/2606.06687#bib.bib39)])推导而来。尽管这类方法确实相对于标准的中心化FL在延迟和收敛方面有所改善,但它们仍然忽视了大尺度边缘/雾网络的结构异构性,即可用D2D连接的数量和质量。仅基于设备计算和统计特征进行聚类,会忽略这些底层网络属性,而这些属性本可以被利用来提升性能和可扩展性。鉴于这些局限性,我们提出的SSD-FL方法旨在通过引入有效损失函数,实现集成网络结构和设备统计异构性(包括本地ML优化器的选择)的集群形成。此外,

相似文章

Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients

arXiv cs.LG

This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.

面向智能服务的漂移稳定量子联邦学习

arXiv cs.LG

本文提出DUQFL-Prox,一种漂移稳定的量子联邦学习框架,采用深度展开局部优化,结合自适应SPSA更新和近端项,以改善异构分布式环境中的稳定性、泛化能力和客户端公平性。