在异构环境中基于相似性的个性化联邦学习

arXiv cs.LG 论文

摘要

本文提出了SAPE-FL,一种基于相似性的个性化联邦学习框架,通过将模型锚定到全局模型和对等平均模型来适应异构环境,从而提高鲁棒性和性能。

arXiv:2609.02241v1 公告类型:新 摘要:联邦学习(FL)允许多个分散的客户端在保护数据隐私的同时协同训练模型。然而,客户端之间的分布不匹配常常导致全局泛化能力差和本地客户端性能下降。在这种情况下,一些仅基于本地数据训练本地模型的客户端可能表现优于全局学习模型,从而抵消了协同联邦学习的益处。为了解决这个问题,我们提出了SAPE-FL(基于相似性的个性化联邦学习),这是一种新颖的个性化框架,将每个客户端的模型锚定到全局模型和基于相似性加权的对等平均模型。通过结合基于模型相似性和输出相似性的动态、客户端特定正则化,SAPE-FL自适应地平衡全局知识传递和对等协作,同时过滤掉不相似的客户端。这种双重锚定缓解了负迁移,并在异构设置中增强了鲁棒性。我们从理论上分析了我们的算法,建立了其收敛保证,并通过实证表明SAPE-FL在高统计异质性和低客户端数据环境下优于最先进的方法。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:17

# 异构环境中的相似性感知个性化联邦学习  
来源:https://arxiv.org/html/2609.02241  
Arun Kumar A V, Sunil Gupta, Dang Ngyuen, Bao Duong, Dat Phan Trong††  
††通讯作者邮箱:[email protected]  

###### 摘要  
联邦学习(FL)允许去中心化的客户端在保护数据隐私的同时协同训练模型。然而,客户端之间的分布不匹配常常导致全局泛化能力差和客户端级别的局部性能下降。在此类场景中,一些仅基于本地数据训练局部模型的客户端可能表现优于全局学习模型,从而抵消了协同联邦学习的益处。为了解决这个问题,我们提出了SAPE-FL(相似性感知个性化联邦学习),这是一个新颖的个性化框架,它将每个客户端的模型锚定到全局模型和相似性加权的对等平均模型。通过引入基于模型相似性和输出相似性的动态、客户端特定的正则化,SAPE-FL自适应地平衡全局知识迁移和对等协作,同时过滤掉不相似的客户端。这种双重锚定缓解了负向迁移,并增强了在异构环境中的鲁棒性。我们从理论上分析了该算法,建立了其收敛保证,并通过实验证明SAPE-FL在高统计异质性和低客户端数据情况下优于最先进的方法。  
*关键词* 机器学习⋅\cdot联邦学习⋅\cdot相似性感知FL⋅\cdot异构环境  

## 1 引言  
随着智能手机、可穿戴传感器和物联网设备等边缘设备的快速普及和计算能力的不断增强,训练机器学习模型正从集中数据到单一位置转向直接在分散设备上进行。联邦学习(FL)McMahan等人(2017) (https://arxiv.org/html/2609.02241#bib.bib2)使多个客户端无需共享原始数据即可协同训练全局模型,从而保护隐私。FL的去中心化和隐私保护特性在医疗健康Dayan等人(2021) (https://arxiv.org/html/2609.02241#bib.bib38)、金融Long等人(2020) (https://arxiv.org/html/2609.02241#bib.bib40)和边缘计算Abreha等人(2022) (https://arxiv.org/html/2609.02241#bib.bib41)等多个领域都具有吸引力。与传统的分布式学习方法(如Boyd等人(2011) (https://arxiv.org/html/2609.02241#bib.bib37)中的交替方向乘子法(ADMM))相比,FL方法展现出了更优越的可扩展性和通信效率。  
尽管传统的FL方法展示了巨大的前景,但现实部署常常因异质性Li等人(2020a) (https://arxiv.org/html/2609.02241#bib.bib42)而面临重大挑战,包括统计异质性(客户端间的数据分布多样)、模型异质性(模型训练方法的差异)和通信异质性(不一致的网络条件和资源约束)。其中,客户端间的统计异质性(分布不匹配,以下简称非独立同分布(non-IID))构成重大挑战,常常降低全局模型性能。标准的FL方法如FedAvg McMahan等人(2017) (https://arxiv.org/html/2609.02241#bib.bib2),最初是为独立同分布(IID)数据设计的,无法有效地在多样化的客户端群体中泛化Zhao等人(2018) (https://arxiv.org/html/2609.02241#bib.bib14),这促使了能够更好地使模型与本地客户端数据对齐的个性化方案的开发。  
为了解决数据异质性和个性化问题,许多研究重新构建了传统FL方法的优化目标。FedProx Li等人(2020b) (https://arxiv.org/html/2609.02241#bib.bib6)在FedAvg中添加了一个近端项以限制本地更新偏离全局模型的程度。然而,正如Jiang等人(2019) (https://arxiv.org/html/2609.02241#bib.bib29)所指出的,仅为全局准确性进行优化可能会阻碍客户端级别的有效个性化。为了克服这一点,个性化联邦学习(PFL)Sim等人(2019) (https://arxiv.org/html/2609.02241#bib.bib43); Li等人(2021b) (https://arxiv.org/html/2609.02241#bib.bib1)已成为一种范式,它在全局协作和客户端特定适应之间取得平衡。PFL不依赖于单一的全局模型,而是允许每个客户端根据本地数据和偏好定制其模型Kulkarni等人(2020) (https://arxiv.org/html/2609.02241#bib.bib44),通常遵循两阶段策略:全局训练后进行局部微调。  
然而,现有的PFL方法采用静态正则化权重Fallah等人(2020) (https://arxiv.org/html/2609.02241#bib.bib27); Li等人(2021b) (https://arxiv.org/html/2609.02241#bib.bib1)或固定的基于相似性的聚合Chen等人(2024) (https://arxiv.org/html/2609.02241#bib.bib4),未能考虑训练过程中客户端漂移、数据分布和模型可靠性的动态变化。这种僵化可能导致次优的个性化,甚至在高度非IID数据的情况下产生负向迁移。  
受静态个性化和统一聚合策略局限性的启发,我们提出了**相似性感知个性化联邦学习(SAPE-FL)**,这是一个新颖的框架,联合优化全局协作和客户端特定适应。SAPE-FL引入了一种两级锚定机制,其中每个客户端将其模型与全局模型和基于相似性加权的对等模型平均值对齐。这种双重锚定由客户端特定的自适应正则化指导,该正则化通过基于模型输出和权重的相似性计算得出。我们的度量结合了基于模型输出和模型权重的相似性,使其对客户端间的结构和功能差异具有鲁棒性。虽然基于权重的相似性捕捉结构对齐,但输出相似性则识别尽管参数不同但功能相似的模型。  
为了构建这样的可靠锚点,每个客户端使用相似性阈值过滤掉不相似的对等模型,确保只有相关的对等信息影响个性化。在服务器端,SAPE-FL执行基于相似性的客户端模型更新加权聚合,其中每个客户端的贡献根据其与对等共识的一致性进行缩放。这抑制了噪声或错位的更新,并增强了全局模型的质量。  
我们在多样化的任务上评估了SAPE-FL与最先进的方法,包括在非IID或统计异质性下的合成数据分类、人类活动识别和图像分类。我们的实证结果表明,SAPE-FL框架始终优于基线方法,特别是在高统计异质性和有限客户端数据可用性的设置中。这些发现突出表明,我们新颖的基于相似性的个性化和聚合策略有效地将联邦学习个性化到每个客户端的独特特征。本文的主要贡献如下。  
- • 我们提出了SAPE-FL,一个新颖的相似性感知个性化FL框架,它将客户端模型锚定到全局模型和对等平均模型,并使用一种基于客户端更新与对等共识的一致性进行缩放的聚合方案,以防止负向迁移。  
- • 我们设计了一种自适应个性化方案,根据模型输出和权重相似性计算客户端特定的正则化系数,实现与全局模型和对等模型的选择性对齐。  
- • 我们从理论上洞悉了我们方法的收敛行为和性能保证。  
- • 我们通过经验验证了SAPE-FL在高统计异质性下多样化数据集上的有效性。通过这些创新,SAPE-FL通过基于相似性的优化和聚合联合实现全局知识共享和客户端特定适应,推动了个性化联邦学习的最新进展。  

## 2 相关工作  
最近,联邦学习(FL)在研究界获得了关注,产生了大量且不断增长的文献Nevrataki等人(2023) (https://arxiv.org/html/2609.02241#bib.bib39)。联邦学习最初由McMahan等人(2017) (https://arxiv.org/html/2609.02241#bib.bib2)提出,能够在保护数据隐私的同时实现去中心化模型训练。所提出的FedAvg算法允许客户端执行多轮本地随机梯度下降(SGD)Ruder(2016) (https://arxiv.org/html/2609.02241#bib.bib9),然后再与服务器同步,与集中式训练相比减少了通信开销。自诞生以来,FL受到了越来越多的关注,推动了通信效率Konečnỳ等人(2016) (https://arxiv.org/html/2609.02241#bib.bib10)、隐私保证Agarwal等人(2018) (https://arxiv.org/html/2609.02241#bib.bib11)、加密保护Bonawitz等人(2017) (https://arxiv.org/html/2609.02241#bib.bib12)以及资源约束下的优化Wang等人(2019) (https://arxiv.org/html/2609.02241#bib.bib13)等方面的进步。  
尽管具有强大的理论和实证性能Li等人(2020c) (https://arxiv.org/html/2609.02241#bib.bib49),FedAvg在统计异质性下表现不佳。Zhao等人(2018) (https://arxiv.org/html/2609.02241#bib.bib14)表明,非IID数据由于冲突的梯度更新可能导致性能下降。为了缓解这些问题,已经提出了自适应FL方法。Wang等人(2019) (https://arxiv.org/html/2609.02241#bib.bib13)根据客户端资源调整本地更新频率,特别适用于边缘环境。LoAdaBoost Huang等人(2020) (https://arxiv.org/html/2609.02241#bib.bib15)有选择性地为表现不佳的客户端继续训练,减少开销并提高效率。基于梯度的聚类方法,如CFL Sattler等人(2020) (https://arxiv.org/html/2609.02241#bib.bib16),基于更新相似性形成集群以缓解异质性。  

### 2.1 自适应客户端选择方法  
在FL中优化客户端选择对于降低通信和计算成本至关重要。Chen等人(2022) (https://arxiv.org/html/2609.02241#bib.bib17)提出了高效客户端参与的算法,尽管未完全解决异质性问题。FedNorm Zhao等人(2022) (https://arxiv.org/html/2609.02241#bib.bib18)优先考虑具有高信息价值的客户端,提高通信效率。FedMarl Zhang等人(2022) (https://arxiv.org/html/2609.02241#bib.bib19),受多智能体强化学习启发,根据运行时性能动态选择客户端。CSFedAvg Zhang等人(2021) (https://arxiv.org/html/2609.02241#bib.bib20)通过偏好非IID数据较少的客户端来提高收敛性。RIPFL Qin等人(2023) (https://arxiv.org/html/2609.02241#bib.bib21),利用Dempster–Shafer理论Sensoy等人(2018) (https://arxiv.org/html/2609.02241#bib.bib22),量化客户端可靠性以进行鲁棒选择。  

#### 联邦学习中的多任务和元学习  
多任务和元学习方法因其处理异构数据分布的能力而在FL中受到关注。MOCHA Smith等人(2017) (https://arxiv.org/html/2609.02241#bib.bib23)联合学习客户端特定模型和任务相似性矩阵以捕获客户端间关系。VIRTUAL Corinzia等人(2019) (https://arxiv.org/html/2609.02241#bib.bib30)通过变分多任务框架建模任务间变异性与依赖关系。Jiang等人(2019) (https://arxiv.org/html/2609.02241#bib.bib29)建立了FedAvg与模型无关元学习(MAML)Finn等人(2017) (https://arxiv.org/html/2609.02241#bib.bib28)之间的联系,这启发了像Per-FedAvg Fallah等人(2020) (https://arxiv.org/html/2609.02241#bib.bib27)这样的方法,将元学习目标整合到FL训练中。其他工作包括ARUBA Khodak等人(2019) (https://arxiv.org/html/2609.02241#bib.bib24),它改进了基于梯度的元学习,以及Peterson等人(2019) (https://arxiv.org/html/2609.02241#bib.bib26),它利用混合专家(MoE)Nowlan和Hinton(1990) (https://arxiv.org/html/2609.02241#bib.bib25)进行个性化模型插值。  

### 2.2 个性化联邦学习方法  
由于非IID客户端数据带来的挑战,个性化已成为FL的核心焦点。方法范围从本地微调Mansour等人(2020) (https://arxiv.org/html/2609.02241#bib.bib31)到高级的基于分解的方法Arivazhagan等人(2019) (https://arxiv.org/html/2609.02241#bib.bib32); Yin和Mao(2025) (https://arxiv.org/html/2609.02241#bib.bib52)以及基于聚类的解决方案Ghosh等人(2020) (https://arxiv.org/html/2609.02241#bib.bib47)。最近提出的LCFed Zhang等人(2025) (https://arxiv.org/html/2609.02241#bib.bib48)引入了一个高效的聚类框架,通过使用基于余弦的距离度量形成紧凑的客户端集群,提高了在异构环境中的性能和通信效率。基于超网络的方法如PeFLL Scott等人(2024) (https://arxiv.org/html/2609.02241#bib.bib33)使用学习到的嵌入在一次前向传播中生成个性化模型,而FedRod Chen和Chao(2022) (https://arxiv.org/html/2609.02241#bib.bib34)、Scaffold Karimireddy等人(2020) (https://arxiv.org/html/2609.02241#bib.bib35)和MOON Li等人(2021a) (https://arxiv.org/html/2609.02241#bib.bib36)施加正则化或相似性约束以在本地更新期间改善个性化。FedPAC Xu等人(2023) (https://arxiv.org/html/2609.02241#bib.bib50)对齐本地和全局特征嵌入,尽管它在标签分布偏移下最有效。  
模型插值仍然是一种突出的技术:FedProx Li等人(2020b) (https://arxiv.org/html/2609.02241#bib.bib6)添加近端项以解决客户端漂移问题;Ditto FL Li等人(2021b) (https://arxiv.org/html/2609.02241#bib.bib1)明确分离全局和个性化模型并使用固定正则化。FedACS Chen等人(2024) (https://arxiv.org/html/2609.02241#bib.bib4)结合了注意力加权对等模型聚合,而FedPer Arivazhagan等人(2019) (https://arxiv.org/html/2609.02241#bib.bib32)在神经网络架构中分离个性化(顶层)层和全局共享(基础)层。  
尽管取得了进展,现有方法在处理客户端异质性和个性化方面仍然困难Yang等人(2024) (https://arxiv.org/html/2609.02241#bib.bib51)。许多方法依赖于静态正则化、低效的聚合或聚类,在动态数据偏移下表现不佳。SAPE-FL通过将客户端模型锚定到全局和对等平均模型,并使用基于模型权重和输出的混合相似性度量来解决此问题。这实现了鲁棒的对等匹配和聚合,确保了有效的个性化。  

## 3 数学基础  
传统的FL方法McMahan等人(2017) (https://arxiv.org/html/2609.02241#bib.bib2); Collins等人(2022) (https://arxiv.org/html/2609.02241#bib.bib3)旨在通过聚合多个客户端的本地更新来协同训练全局模型,而无需将每个客户端的敏感数据汇集到中央位置。考虑一个具有 $C$ 个分布式客户端的FL设置,每个客户端持有从本地分布抽取的数据 $\mathcal{D}_c$,即 $\mathcal{D}_c=\{(\mathbf{x}_j^c, y_j^c)\}_{j=1}^{n_c}$。

相似文章

联邦学习

ML at Berkeley

本文解释了联邦学习作为一种保护隐私的机器学习技术的概念,该技术通过在本地设备而非中央服务器上训练模型来实现。文章详细描述了加密参数更新和聚合的过程,旨在降低数据泄露风险,同时保持模型性能。

良性及对抗性客户端异质性下航空发动机预测的鲁棒与个性化联邦学习

arXiv cs.LG

本文针对良性及对抗性客户端异质性下的航空发动机剩余使用寿命预测,对联邦学习进行了受控研究,评估了个性化和拜占庭鲁棒聚合方法。研究发现,共享表示个性化缩小了本地与集中式准确率之间的绝大部分差距;使用Krum的鲁棒聚合能有效缓解后门攻击;将两者结合可形成组合防御,在攻击成功率较低的同时,仅付出较小的准确率代价。

异构时间分辨率下脉冲神经网络的联邦学习

arXiv cs.LG

本文提出了一种针对脉冲神经网络的联邦学习框架,解决了边缘设备上异构时间分辨率的挑战,能够在处理时间不匹配的同时实现无需共享原始数据的协作训练。