HASA:面向计算受限的异构模型联邦学习的子网分配
摘要
本文提出了HASA,一种面向异构模型联邦学习的异构感知子网分配方法,该方法在固定计算预算下根据客户端异构性分数分配子网宽度,从而提升平均准确率和最差客户端准确率。
查看缓存全文
缓存时间: 2026/06/09 08:51
# HASA:面向计算受限与模型异构联邦学习的子网分配
来源:https://arxiv.org/html/2606.07621
Ahmed M. Abdelmoniem伦敦大学玛丽女王学院,英国
Mahdi Taheri勃兰登堡工业大学科特布斯-森夫滕贝格,德国
塔林理工大学,塔林,爱沙尼亚
Samira Nazari赞詹大学,伊朗
Christian Herglotz勃兰登堡工业大学科特布斯-森夫滕贝格,德国
###### 摘要
边缘服务越来越多地使用联邦学习来个性化设备端模型,同时将敏感数据保留在本地。在实践中,部署必须同时处理客户端资源和本地数据分布的异构性。模型异构联邦学习通过允许每个客户端训练共享超网的一个子网来降低客户端成本,但大多数子网分配策略由设备约束驱动,并未明确考虑统计异构性。本文提出异构感知子网分配(HASA),一种仅基于训练的规则,根据从本地训练数据计算的客户端异构性得分分配子网宽度,同时强制执行固定大小加权的计算预算。该设计使得能够与替代分配策略进行预算匹配的比较。在一个包含七个客户端的文章标题下一个词预测基准上,在10个匹配种子的统一分配基础上,HASA提高了未加权平均客户端测试准确率,将平均客户端测试准确率从13.82%提升至14.32%,并平均提高了最差客户端的准确率。在与代表性部分训练基线的匹配预算比较中,HASA在此基准上实现了最强的最差客户端和尾部客户端准确率。方向性消融实验表明,将较小的子网分配给异构性更强的客户端会降低平均和尾部性能。跨域图像分类研究进一步表明,异构感知分配的有效性取决于异构性得分反映客户端对额外模型宽度需求的程度。
## I 引言
边缘计算已成为现代服务的核心范式,这些服务必须通过将计算靠近最终用户和数据源来满足延迟、带宽和数据本地化要求[23 (https://arxiv.org/html/2606.07621#bib.bib45),24 (https://arxiv.org/html/2606.07621#bib.bib46),22 (https://arxiv.org/html/2606.07621#bib.bib50)]。许多此类服务越来越多地使用设备端学习,例如在移动键盘上的下一词预测等个性化任务中,交互数据对隐私敏感且本质上分布在多个设备上[5 (https://arxiv.org/html/2606.07621#bib.bib32)]。联邦学习(FL)通过协调的本地更新来训练共享模型,而无需集中收集原始数据,从而实现了这种设置[20 (https://arxiv.org/html/2606.07621#bib.bib12),2 (https://arxiv.org/html/2606.07621#bib.bib8)]。在大型部署中,通常使用诸如安全聚合之类的隐私保护聚合协议来进一步限制信息暴露[6 (https://arxiv.org/html/2606.07621#bib.bib33),5 (https://arxiv.org/html/2606.07621#bib.bib32)]。
尽管有这些优势,实际的FL系统必须解决两种异构性[2 (https://arxiv.org/html/2606.07621#bib.bib8),3 (https://arxiv.org/html/2606.07621#bib.bib4)]。首先,系统异构性源于客户端资源的可变性,包括计算、内存、能量和网络条件,这限制了每个设备可以执行的本地训练量[1 (https://arxiv.org/html/2606.07621#bib.bib3)]。其次,统计异构性源于客户端之间非独立同分布和不平衡的数据分布,这可能导致客户端漂移并在标准联邦平均(FedAvg)下减慢或破坏训练稳定性[20 (https://arxiv.org/html/2606.07621#bib.bib12)]。现有的方法如FedProx和SCAFFOLD通过修改优化动态来缓解这些影响,但它们主要侧重于稳定共享全局模型的训练,而不是确定异构客户端之间的子网宽度分布[17 (https://arxiv.org/html/2606.07621#bib.bib2),12 (https://arxiv.org/html/2606.07621#bib.bib9)]。
另一条互补的工作线通过模型异构FL来解决系统异构性,其中客户端在共享超网内训练不同宽度的子网。诸如Federated Dropout和HeteroFL之类的方法通过训练部分模型并将其聚合到全局模型中来减少客户端工作量[8 (https://arxiv.org/html/2606.07621#bib.bib13),9 (https://arxiv.org/html/2606.07621#bib.bib14)]。Slimmable网络框架进一步在统一参数化中支持多个子网宽度[28 (https://arxiv.org/html/2606.07621#bib.bib16)]。然而,在大多数现有系统中,子网分配主要由设备约束驱动,而统计异构性则通过优化或重加权技术单独处理。
这种分离使得子网宽度分配在很大程度上独立于固定训练资源边缘部署中客户端数据的统计结构。那些本地数据与全局训练混合体偏差更大的客户端可能需要额外的模型宽度才能达到可比的准确率,特别是当目标强调客户端级质量(包括下尾性能)而不是仅聚合示例性能时。
为了弥合这一差距,HASA(异构感知子网分配)在预算化的模型异构FL中使用仅基于训练的客户端异构性得分来分配子网宽度。每个得分从相应客户端的本地训练数据计算得出。在主要实例化中,得分是本地和全局token分布之间的Jensen-Shannon散度。由此产生的分配被归一化和重新缩放,以满足固定大小加权的计算预算,从而实现跨分配策略的预算匹配比较。这种固定预算公式将客户端到宽度的分配效果与总训练成本的增加隔离开来。图1 (https://arxiv.org/html/2606.07621#S1.F1)总结了训练和部署流程。
参照图例
图1:HASA在边缘联邦环境中的高层概述。客户端将原始数据保留在本地,计算仅基于训练的异构性统计量,在共享预算下接收固定的子网宽度分配,参与联邦训练轮次,并使用其分配的子网进行设备端推理。
评估涵盖了三种设置。在文章标题下一词预测任务上,HASA在相同预算下与10个匹配种子的统一分配进行比较。然后,一个匹配预算基准将HASA与基于HeteroFL、Federated Dropout和FedRolex的代表性模型异构部分训练基线进行比较,这些基线在具有共同训练协议的相同可缩小LSTM上实现。跨域图像分类研究评估了性能如何取决于异构性得分与客户端容量需求之间的对齐程度。
主要贡献是:
- 在固定大小加权计算预算下制定模型异构联邦学习,从而能够在子网分配策略之间进行公平的预算匹配比较。
- 引入HASA(异构感知子网分配),一种仅基于训练的异构感知分配规则,将客户端异构性得分映射到子网宽度,同时强制执行固定的全局预算。
- 开发了一个匹配预算评估框架,在统一训练协议下,在共享可缩小超网上集成了HeteroFL风格、FedDropout风格和FedRolex风格的部分训练策略。
- 设计分配方向和跨域分析,以研究在不同非独立同分布条件下异构性代理对齐和子网宽度分配的影响。
第二部分回顾相关工作。第三部分介绍问题表述和评估指标。第四部分描述HASA。第五部分详细介绍实验设置。第六部分报告结果。第七部分讨论局限性和实际考虑。第八部分总结。
## II 相关工作
边缘计算将计算靠近数据源,以满足分布式服务中的延迟、带宽和本地化要求[26 (https://arxiv.org/html/2606.07621#bib.bib30),25 (https://arxiv.org/html/2606.07621#bib.bib31)]。联邦学习(FL)通过实现协作模型训练同时将原始数据保留在设备或组织内部来补充这一设置,这在隐私和法规敏感的应用中特别有吸引力[16 (https://arxiv.org/html/2606.07621#bib.bib6),5 (https://arxiv.org/html/2606.07621#bib.bib32)]。在大型部署中,通常使用诸如安全聚合之类的隐私保护聚合协议,以便服务器可以组合客户端更新而无需直接观察单个更新[6 (https://arxiv.org/html/2606.07621#bib.bib33)]。然而,实际的边缘FL系统必须同时解决两个挑战:由非独立同分布客户端数据引起的统计异构性[2 (https://arxiv.org/html/2606.07621#bib.bib8)],以及由计算、内存、能量和网络资源差异引起的系统异构性[15 (https://arxiv.org/html/2606.07621#bib.bib7),27 (https://arxiv.org/html/2606.07621#bib.bib5)]。
统计异构性方法主要修改优化过程。非独立同分布数据可能导致标准联邦平均(FedAvg)下的客户端漂移和不稳定收敛[20 (https://arxiv.org/html/2606.07621#bib.bib12)]。FedProx通过为异构设置设计的近端正则化项来稳定本地训练[17 (https://arxiv.org/html/2606.07621#bib.bib2)],而SCAFFOLD使用控制变量来减少客户端漂移[12 (https://arxiv.org/html/2606.07621#bib.bib9)]。这些方法改进了共享全局模型的优化,但并未直接解决在固定训练成本下客户端之间的子网宽度分布问题。
系统异构性方法通过允许客户端训练更小的子模型来减少客户端工作量[15 (https://arxiv.org/html/2606.07621#bib.bib7),27 (https://arxiv.org/html/2606.07621#bib.bib5)]。Federated Dropout通过训练模型参数的子集来减少本地计算[8 (https://arxiv.org/html/2606.07621#bib.bib13)],而HeteroFL训练不同宽度的嵌套子网络并将它们聚合到共享全局模型中[9 (https://arxiv.org/html/2606.07621#bib.bib14)]。FedRolex通过滚动子模型提取来提高服务器模型随时间推移的覆盖率[4 (https://arxiv.org/html/2606.07621#bib.bib15)],ScaleFL根据客户端资源约束调整模型大小[11 (https://arxiv.org/html/2606.07621#bib.bib18)]。基于超网的方法为此类方法提供了实践基础:可缩小网络和一次训练多次使用网络支持共享参数化内的多个宽度[28 (https://arxiv.org/html/2606.07621#bib.bib16),7 (https://arxiv.org/html/2606.07621#bib.bib35)],SlimFL进一步考虑了该设置中的通信和无线方面[29 (https://arxiv.org/html/2606.07621#bib.bib22)]。这些工作主要将子网宽度视为与设备能力相关的系统级决策。
子网提取和子网分配是分开的设计选择。一种方法可以允许客户端在每轮只训练服务器模型的一部分,同时仍然需要一种策略来跨客户端分配较大和较小的子网。本文研究的分配问题使用仅基于训练的异构性得分,在固定全局预算下进行子网宽度分配。对HeteroFL风格、FedDropout风格和FedRolex风格基线的匹配预算比较,将异构感知宽度分配与部分训练的实现细节分离开来。
其他工作线使用共享超网内预算化子网宽度分配之外的机制来解决异构性。基于蒸馏的方法如FedMD和FedDF通过聚合预测而非平均参数来启用异构客户端模型之间的协作[14 (https://arxiv.org/html/2606.07621#bib.bib36),19 (https://arxiv.org/html/2606.07621#bib.bib37)]。面向公平性的方法改变训练目标以改善服务不足的客户端;例如,不可知联邦学习(AFL)优化最差情况客户端混合目标,q-FFL修改联邦目标以更重视本地性能较差的客户端[21 (https://arxiv.org/html/2606.07621#bib.bib38),18 (https://arxiv.org/html/2606.07621#bib.bib10)]。基于聚类的方法如IFCA为具有相似数据分布的客户端组学习多个模型[10 (https://arxiv.org/html/2606.07621#bib.bib39)]。本文研究的分配规则在固定预算下将客户端异构性得分映射到子网宽度,从而可以分析客户端到宽度的分配,而不会将其与总训练成本的增加混为一谈。
## III 问题设置与评估指标
考虑K个客户端。客户端i的训练数据集大小为,局部目标函数为:
F_i(w) = E_{(x,y)~D_i}[ℓ(w; x,y)] (1)
其中x是输入样本,y是目标输出,w是模型参数,ℓ(w; x,y)是每个样本的损失。令
N = ∑_{i=1}^K n_i (2)
联邦平均(FedAvg)最小化的全局目标为:
F(w) = ∑_{i=1}^K (n_i / N) F_i(w) (3)
### III-A 超网与客户端特定子网
令w表示共享超网的参数。客户端i被分配一个子网宽度比率,该比率激活完整模型宽度的比例,得到子网。在实践中,分配限制在区间[,],⊂(0,1],稍后在实验设置中指定。每个客户端仅训练其分配的子网,而服务器将客户端更新聚合到共享超网中。
### III-B 固定计算预算
为了公平比较子网分配策略,公式施加一个固定的预算水平B,定义为客户端大小加权的平均子网宽度比率:
B = ∑_{i=1}^K (n_i / N) r_i (4)
对于文章标题LSTM实验(主要基准家族),B是预先固定的,所有比较的分配策略必须满足公式(4)。除非另有说明,假设完全参与,因此公式(4)定义了在按大小比例加权的客户端权重下的每轮计算预算。跨域CNN研究使用基于的加权均值的单独架构特定计算代理,该代理在V-C节中说明。
通信节省需要仅传输活动子网参数。这是部分模型训练的实现结果,而非公式(4)中预算定义的一部分。
### III-C 评估指标
令表示客户端i在其分配的子网宽度时的测试准确率。报告以下客户端级指标:
MeanAcc = (1/K) ∑_{i=1}^K Acc_i(r_i) (5)
WorstAcc = min_{1≤i≤K} Acc_i(r_i) (6)相似文章
Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients
This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.
同质与异构数据分布下联邦学习聚合策略的比较研究
本文对各种联邦学习聚合策略进行了全面的实验比较,分析了它们在homogeneous和heterogeneous数据分布下的性能和效率。
HERO: 一个面向异质性感知的联邦持续学习基准库
介绍HERO,一个面向联邦持续学习的异质性感知基准库,它将任务划分、客户端数据划分和客户端任务序列分开,以实现可复现且考虑场景设定的评估。
面向异构优化器的无服务器半去中心化联邦学习
提出SSD-FL,一种无服务器半去中心化联邦学习方法,通过有效损失函数和基于Cheeger不等式的迭代聚类优化异构环境中的聚类形成,提升了收敛速度和通信效率。
关于基于推送的异步联邦学习:一种偏差纠正聚合方法
本文提出了PushCen-ADFL,一种通信高效的异步去中心化联邦学习框架,它使用基于质心的消息传递和偏差纠正,在异构条件下提高准确性并降低通信开销。