FedImp:通过基于杂质的加权提升联邦学习收敛性
摘要
FedImp是一种新颖的联邦学习算法,它使用基于杂质的加权来提升非独立同分布数据设置下的收敛速度,与基线方法相比,在通信轮次上显示出显著减少。
arXiv:2608.14654v1 公告类型:新
摘要:联邦学习(FL)是一种协作范式,允许多个设备在保护本地数据隐私的同时训练全局模型。FL中的一个主要挑战是数据跨设备的非独立同分布(non-IID)特性,这阻碍了训练效率并减慢了收敛速度。为了解决这个问题,我们提出了联邦杂质加权(FedImp),这是一种新颖的算法,它根据每个设备本地数据的信息量来量化其贡献。这些贡献被归一化,以计算全局模型更新的不同聚合权重。在EMNIST和CIFAR-10数据集上的广泛实验表明,FedImp显著提高了收敛速度,与FedAvg、FedProx和FedAdp相比,在EMNIST上分别减少了多达64.4%、27.8%和66.7%的通信轮次,在CIFAR-10上减少了44.2%、44%和25.6%。在高度不平衡的数据分布下,FedImp优于所有基线方法,并实现了最高的准确性。总体而言,FedImp提供了一种有效的解决方案,以提升非独立同分布设置下的FL效率。
查看缓存全文
缓存时间: 2026/08/18 10:21
# FedImp:基于不纯度加权的联邦学习收敛增强方法 来源:https://arxiv.org/html/2608.14654 Cuong Ta, Truong X. Tran[![[未标注图片]](https://arxiv.org/html/2608.14654v1/ORCIDiD_icon64x64.png)](https://orcid.org/0000-0002-3214-010X)\\ IEEE会员,高级会员,Hai‑Anh Tran 和 Cuong Ta 就职于越南河内科技大学信息与通信技术学院(SOICT)。电子邮件:[email protected], [email protected] Truong X. Tran 就职于美国宾夕法尼亚州立大学哈里斯堡分校科学、工程与技术学院。电子邮件:[email protected] 通讯作者:Truong X. Tran;电子邮件:[email protected] ©2025 IEEE。允许个人使用此材料。若用于广告或促销目的、创建新的集体作品、转售或重新分发至服务器或列表,或在其他作品中重复使用本作品的任何受版权保护的组件,则需获得IEEE的所有其他使用许可。 ###### 摘要 联邦学习(FL)是一种允许多个设备在保护本地数据隐私的同时协同训练全局模型的范式。FL面临的一个主要挑战是设备间数据的非独立同分布(non-IID)特性,这阻碍了训练效率并减慢了收敛速度。为解决此问题,我们提出了**联邦不纯度加权(FedImp)**——一种新颖的算法,它根据每个设备本地数据的信息量来量化其贡献。这些贡献经过归一化,用于计算全局模型更新时的不同聚合权重。在EMNIST和CIFAR-10数据集上的大量实验表明,FedImp显著提升了收敛速度。相较于FedAvg、FedProx和FedAdp,在EMNIST上通信轮次分别减少了高达64.4%、27.8%和66.7%,在CIFAR-10上分别减少了44.2%、44%和25.6%。在高度不平衡的数据分布下,FedImp优于所有基线方法并达到了最高的准确率。总体而言,FedImp为提升非IID环境下FL效率提供了一种有效解决方案。 \{IEEEImpStatement\} 联邦学习(FL)在不损害数据隐私的前提下训练模型方面发挥着至关重要的作用。这项工作为自适应联邦学习技术的未来发展铺平了道路,确保AI模型能够在多样化和去中心化的数据源上更高效、更公平地进行训练。通过确保更快、更可靠的收敛,FedImp提升了FL在大规模部署中的可行性,尤其是在移动网络、物联网系统和医疗诊断等资源受限的环境中。 \{IEEEkeywords\} 联邦学习,快速收敛率,模型聚合,协作式机器学习 ## 1 引言 人工智能和机器学习驱动着许多数据驱动的应用,但传统的集中式训练引发了隐私和安全方面的担忧。联邦学习(FL)通过在设备间进行去中心化的模型训练且无需共享原始数据来解决这些问题[10](https://arxiv.org/html/2608.14654#bib.bib1)。这种方法保护了隐私,减少了数据传输,并且非常适用于对保密性有严格要求的行业。 FL过程通过一系列迭代的模型更新展开[6](https://arxiv.org/html/2608.14654#bib.bib2)。每个本地节点(客户端节点、设备)根据其独特的数据计算本地模型更新,捕捉本地模式。这些更新随后被聚合(例如,通过加权平均)成一个统一的全局模型,从而有效地从所有参与设备的多样化数据中学习。 FL算法面临的一个关键挑战是去中心化设备之间存在非独立同分布(non-IID)的数据[16](https://arxiv.org/html/2608.14654#bib.bib3)。在FL环境中,由于位置或用户行为等因素,数据往往是非IID的,这使得有效聚合本地模型变得更加困难,导致收敛缓慢和泛化能力差。 为了缓解非IID数据的影响,采用了多种策略。**加权聚合**允许拥有更高质量或更相关数据的设备对全局模型产生更大影响。**数据增强**人为扩大本地数据集的多样性,提高模型的泛化能力。此外,**自适应学习率**允许模型根据每个设备非IID数据的独特特征调整其学习过程。 有多种算法将本地模型聚合成全局模型以获得最佳结果[9](https://arxiv.org/html/2608.14654#bib.bib4)。其中,FedAvg[11](https://arxiv.org/html/2608.14654#bib.bib5)被广泛使用,它对参与节点的模型参数进行平均。然而,在非IID环境下,由于节点贡献可能差异显著,它通常存在收敛缓慢和准确率降低的问题。 为了改进这一点,FedAdp[14](https://arxiv.org/html/2608.14654#bib.bib6)根据本地梯度和全局梯度之间的角度分配权重。然而,当许多节点是非IID时,全局梯度可能会产生误导,无法反映全局目标的真实下降方向。在这种情况下,本地梯度可能导致聚合梯度指向远离全局最小值的方向,从而减慢学习速度或导致不稳定。这就需要一种能更好捕捉本地数据信息性和多样性的替代方案,例如FedImp所采用的方法。 本研究旨在通过引入一种称为**联邦不纯度加权(FedImp)**的新颖算法,来解决与两种FL算法FedAvg和FedAdp相关的已知局限性。我们的观察强调了节点在全局模型聚合中的不同贡献。我们通过使用熵评估其数据中的信息不纯度来衡量节点的贡献。然后将这些贡献归一化,成为用于聚合的不同权重。所提出的策略增强了跨多样化数据分布的泛化能力,并缓解了为数据不具代表性的节点分配高权重的问题。FedImp旨在防止此类偏见,确保在FL中实现更平衡和有效的全局模型聚合。 本文包含以下贡献: - • **确定传统FL算法的局限性**:初步贡献是对FedAvg和FedAdp算法进行批判性审查,并指出它们在某些非IID数据场景下的局限性。 - • **新颖的聚合策略**:引入FedImp,这是一种新的FL算法,使用熵来量化每个客户端数据的信息丰富度(不纯度)。 - • **增强的FL收敛性和准确性**:通过解决非IID数据分布带来的挑战,所提出的方法可以提高全局模型的收敛速度和整体准确率。 我们实现了所提出的算法,并使用EMNIST和CIFAR-10数据集在各种FL场景下进行了实验以评估其性能。结果表明,在非IID数据的FL中,FedImp的收敛速度显著快于FedAvg[9](https://arxiv.org/html/2608.14654#bib.bib4)、FedProx[8](https://arxiv.org/html/2608.14654#bib.bib17)和FedAdp[11](https://arxiv.org/html/2608.14654#bib.bib5)。实验显示,在EMNIST数据集上,与FedAvg、FedProx和FedAdp相比,通信轮次分别减少了高达64.4%、27.8%和66.7%。对于CIFAR-10数据集的测试,FedImp也能减少通信轮次,与FedAvg、FedProx和FedAdp相比,减少幅度分别高达44.2%、44%和25.6%。在具有高度本地不平衡数据节点的实验中,FedAdvantage尤为突出,通常成为唯一能达到目标准确率的算法。 本文的其余部分组织如下:第2节[讨论相关工作。第3节提供FL和算法的基础:FedAvg、FedProx和FedAdp。第4节介绍所提出的算法。第5节展示实验实现和结果,结论在第6节。 ## 2 相关工作 已有许多方法被提出用于将本地模型整合成单一的全局模型以达到预期的结果。McMahan等人[11](https://arxiv.org/html/2608.14654#bib.bib5)引入了联邦平均(FedAvg)算法,其中客户端在其本地数据集上执行多轮随机梯度下降(SGD),并将模型发送给服务器,服务器对其进行平均以形成新的全局模型。然而,每个客户端存在的非IID数据会对FedAvg算法的性能产生负面影响,包括收敛速度慢和准确率低。解决这一挑战对于提高FL方法的有效性至关重要,因此已提出了各种解决方案。 Li等人[8](https://arxiv.org/html/2608.14654#bib.bib17)引入了FedProx,这是FedAvg的一个扩展,旨在处理联邦网络中的异质性。虽然其修改很小,但效果显著。实验表明,在真实世界数据集上,FedProx比FedAvg实现了更好的收敛性,测试准确率平均提高了22%,尤其是在高度异构的环境中。 带动量的SGD通过随时间累积梯度历史来抑制振荡,在集中式机器学习方法中已被证明能有效加速网络训练。利用这一思想,Hsu等人[5](https://arxiv.org/html/2608.14654#bib.bib7)提出了带动量的联邦平均(FedAvgM)算法。这尤其适用于FL,因为参与方可能只拥有标签的小子集和稀疏分布的数据。在CIFAR-10上的实验表明,在一系列不同的非同质性设置下,FedAvgM的分类性能优于FedAvg,在最偏斜的设置中,分类准确率从30.1%提高到76.9%。 此外,Yeganeh等人[15](https://arxiv.org/html/2608.14654#bib.bib8)提出了IDA(逆距离聚合),这是一种基于元信息的新颖自适应加权方法,用于处理不平衡和非IID数据。IDA方法使用模型参数距离来最小化异常值的影响并改善收敛。结果表明,在非IID场景下,IDA在分类准确率上优于FedAvg,并且对客户端节点的低质量或有害数据具有弹性。与假设拥有更多数据的客户端具有更好分布的FedAvg不同,IDA允许对齐的客户端排除分布外的模型。 最小化本地损失函数并不能保证最小化全局损失。为了在非IID数据中解决这个问题,Acar等人引入了FedDyn[1](https://arxiv.org/html/2608.14654#bib.bib9),它动态地正则化每个客户端的损失以与全局损失对齐。这使得FedDyn对不同程度的异质性具有鲁棒性,允许每个客户端进行完全的最小化。在凸和非凸设置中,它实现了O(1/T)的收敛率,在强凸设置中实现了线性收敛率,并且对设备异质性保持未知,对大规模、不平衡和部分参与的设备具有弹性。 实现全局模型的个性化对于处理非IID数据带来的挑战变得至关重要。Vahidian等人[13](https://arxiv.org/html/2608.14654#bib.bib10)引入了基于剪枝的个性化FL(Sub-FedAvg)。Sub-FedAvg通过使用混合剪枝(结构化和非结构化)为每个客户端识别一个小的子网络来提高效率。与FedAvg平均所有参数不同,它只平均每个客户端子网络中剩余的参数。 在涉及非IID数据的场景中,参与节点对训练过程的贡献是不平等的。为了解决这个问题,Wu等人在其工作中引入了联邦自适应加权(FedAdp)算法[14](https://arxiv.org/html/2608.14654#bib.bib6)。该算法根据每个节点在每一轮训练中的贡献,为更新全局模型分配动态权重。作者已经证明,与FedAvg算法相比,使用FedAdp的FL在MNIST数据集上可以减少高达54.1%的通信轮次,在FashionMNIST数据集上可以减少高达45.4%的通信轮次。 虽然FedAdp提供了改进,但在非IID环境下,它在全局梯度对齐方面存在困难。当节点缺乏标签多样性时,本地梯度会偏离,导致次优的全局更新。对具有相似梯度的节点进行过度加权可能会进一步降低性能。 近年来,隐私保护技术已被广泛探索以增强FL的安全性。Fotohi等人[3](https://arxiv.org/html/2608.14654#bib.bib18)提出了一种使用差分隐私的轻量级框架,以防止客户端更新被对抗性重建。区块链集成是另一种提供去中心化信任和安全的方法。启用区块链的FL模型可以使用智能合约和加密验证来防止对抗性篡改[4](https://arxiv.org/html/2608.14654#bib.bib19)。虽然这些以隐私为导向的方法超出了FedImp的主要范围(其专注于非IID条件下的收敛),但我们在此提及它们是为了突出FL安全领域的更广泛背景和持续进展。我们将在实验结果的讨论部分进一步讨论潜在的隐私考虑和对我们提出方法的未来增强。 总之,最近的FL研究通过自适应加权机制(例如FedAdp, IDA)、个性化技术(例如Sub-FedAvg)和基于正则化的收敛策略(例如FedDyn)取得了实质性进展。虽然这些方法各自解决了异质性的某些方面,但它们通常依赖于梯度相似性、参数距离或客户端特定架构。相比之下,FedImp通过使用熵量化本地数据集的信息丰富度,引入了一个根本不同的视角,允许独立于模型特定信号的数据驱动加权。这使FedImp成为一种通用且轻量级的方法,无需修改模型结构或优化方法即可在非IID环境下提高收敛性。 ## 3 联邦学习算法的基础知识 本节介绍FL的基本概念,并讨论FedAvg、FedProx和FedAdp算法的原理。此外,它还审视了FedAdp和FedAvg的局限性,为提出一个更全面的算法提供了动机。 ### 3.1 联邦学习算法概述 FL是一种分布式学习方法,客户端在不共享原始数据的情况下训练共享模型。它的目标是在多个通信轮次中优化全局损失函数 F(w),该函数聚合了各个客户端的损失。在每一轮通信 t 中,选择一个由 K 个节点组成的子集,并将上一轮通信的全局模型 w(t-1) 传输给选定的节点。随后,每个参与节点 i 执行随机梯度下降(SGD)训练以最小化其本地损失 F_i(w): w_i(t) = w(t-1) - η ∇F_i(w(t-1))
相似文章
FedLBW:无线网络中非独立同分布数据下基于损失的联邦学习加权策略
本文提出FedLBW,一种联邦学习聚合策略,该策略使用验证损失的倒数而非数据集大小来加权客户端更新,提高了在无线网络中应对非独立同分布数据和客户端掉线时的准确性和鲁棒性。
FedFIbOS:基于Fisher重要性的异构联邦学习最优子建模
FedFIbOS提出了一种基于Fisher重要性的方法,用于异构联邦学习中的最优子模型选择,该方法具有理论基础,并在非独立同分布设置下比现有最先进方法准确率提高约10%。
关于基于推送的异步联邦学习:一种偏差纠正聚合方法
本文提出了PushCen-ADFL,一种通信高效的异步去中心化联邦学习框架,它使用基于质心的消息传递和偏差纠正,在异构条件下提高准确性并降低通信开销。
FedUP: 基于质心引导的可插拔过滤器的一次性联邦遗忘
FedUP提出了一种一次性联邦遗忘框架,利用差分私有类质心引导的轻量级可插拔过滤器,无需多轮通信即可高效移除特定知识,实现了低延迟和内在可逆性。
QFedPolyp:一种通信与推理高效的联邦学习框架用于息肉分割
QFedPolyp 提出了一种用于息肉分割的联邦学习框架,该框架利用量化感知训练来降低通信成本并实现更快的推理,同时保护隐私。