SCOPE-FL: 一种抗策略的基于链的最优帕累托高效联邦学习系统
摘要
本文介绍了SCOPE-FL,一种分层联邦学习框架,使用Top Trading Cycle算法来确保客户端选择中的抗策略性和帕累托最优性,通过Shapley值近似进行奖励分配,并基于区块链执行。
arXiv:2606.18384v1 Announce Type: new
Abstract: 分层联邦学习(HFL)能够在跨分布式设备间进行可扩展的协作模型训练,同时保护数据隐私。然而,现有的HFL客户端选择机制存在根本性的策略低效问题。由于优先考虑稳定性而非帕累托最优性(PE),它们产生次优的资源分配,并且缺乏抗策略性(SP)会激励参与者歪曲其真实偏好,这两种缺陷在实践中都会在帕累托意义上降低系统的整体福利。为解决此问题,我们提出SCOPE-FL(抗策略的基于链的最优帕累托高效联邦学习),一种同步HFL框架,将客户端选择表述为通过Top Trading Cycle(TTC)算法求解的双边学校选择问题,该算法同时保证PE和SP。在奖励分配方面,SCOPE-FL采用基于一轮重构(OR)的可扩展Shapley值近似,确保补偿与每个客户的贡献成正比。整个机制通过区块链智能合约执行,提供了SP保证在实践中得以实现的防篡改环境。在MNIST、Fashion-MNIST和CIFAR-10上的综合评估表明,SCOPE-FL在模型准确率、收敛速度和奖励效率方面均优于现有先进方法(包括DA、IAS等),同时实现了与DA相当的通信延迟,并且在大规模场景下区块链开销显著低于DA。
查看缓存全文
缓存时间: 2026/06/18 05:42
# SCOPE-FL: 一种策略证明的、基于链的最优帕累托高效联邦学习系统 来源:https://arxiv.org/html/2606.18384 Seyed Salar Ghazi、Kaiwen Zhang、Mehdi Feizi 和 Hans\-Arno JacobsenSeyed Salar Ghazi 和 Kaiwen Zhang 任职于加拿大魁北克蒙特利尔高等技术学院(ÉTS)软件与IT工程系,邮编 H3C 1K3(电子邮件:seyed\-salar\.ghazi\.1@ens\.etsmtl\.ca;kaiwen\.zhang@etsmtl\.ca)。Mehdi Feizi 任职于伊朗马什哈德菲尔多西大学经济与行政科学学院经济学系(电子邮件:feizi@um\.ac\.ir)。Hans\-Arno Jacobsen 任职于加拿大多伦多大学电气与计算机工程系,邮编 M5S 3G4(电子邮件:jacobsen@eecg\.toronto\.edu)。 ###### 摘要 分层联邦学习(HFL)能够在分布式设备上实现可扩展的协作模型训练,同时保护数据隐私。然而,现有的HFL客户端选择机制存在根本性的策略低效问题。由于优先考虑稳定性而非帕累托效率(PE),它们会产生次优的资源分配;同时,由于缺乏策略证明性(SP),参与者有动机谎报其真实偏好,这两种缺陷在实践中都会从帕累托意义上降低系统的整体福利。为了解决这一问题,我们提出了SCOPE-FL(策略证明的基于链的最优帕累托高效联邦学习),这是一个同步HFL框架,它将客户端选择建模为一个双边学校选择问题,并通过顶级交易循环(TTC)算法求解,该算法同时保证了PE和SP。在奖励分配方面,SCOPE-FL采用了一种基于单轮重构(OR)的可扩展Shapley值近似方法,确保补偿与每个客户端的贡献成比例。整个机制通过区块链智能合约执行,提供了SP保证在实践中成立所需的防篡改环境。在MNIST、Fashion-MNIST和CIFAR-10上的全面评估表明,SCOPE-FL在模型准确率、收敛速度和奖励效率方面均优于现有最先进方法(包括DA、IAS等),同时通信延迟与DA相当,且在大规模场景下区块链开销显著低于DA。 ## I 引言 跨分布式设备的协作机器学习在通信效率、数据隐私以及客户端选择中的策略低效方面提出了根本性挑战,即参与者谎报真实偏好,而现有机制无法确保基于汇报偏好的帕累托效率,从而未能优化客户端的福利。联邦学习(FL)通过允许在无需共享原始数据的情况下跨多个设备协作训练机器学习模型,解决了前两个问题。在每个训练轮次中,选定的客户端接收当前全局模型,在本地数据上进行训练,并将模型更新返回给中央服务器,由中央服务器将其聚合为改进后的全局模型。这一迭代过程持续进行直至收敛[5 (https://arxiv.org/html/2606.18384#bib.bib1),24 (https://arxiv.org/html/2606.18384#bib.bib2)]。虽然单服务器FL在中规模部署中已被证明有效,但随着参与设备数量的增加,它引入了关键瓶颈。单个中央服务器是单点故障、通信瓶颈以及安全攻击的集中目标。分层联邦学习(HFL)通过引入分层架构来解决这些结构性问题,在该架构中,边缘服务器在将局部更新转发到主服务器进行全局聚合之前,先聚合来自附近客户端的更新[46 (https://arxiv.org/html/2606.18384#bib.bib4),37 (https://arxiv.org/html/2606.18384#bib.bib7)]。这种分层设计显著降低了通信开销,提高了可扩展性和容错能力,使得HFL特别适用于客户端广泛分散且网络条件变化较大的地理分布式环境[46 (https://arxiv.org/html/2606.18384#bib.bib4),22 (https://arxiv.org/html/2606.18384#bib.bib21)]。尽管具有这些结构优势,现有HFL系统的客户端选择机制存在一个根本性缺陷——称为策略低效——这阻碍了它们充分发挥潜力,并且它们未能实现PE。主流设计哲学优先考虑稳定性,确保没有客户端-服务器对希望偏离当前分配,但这直接牺牲了帕累托效率(PE)[37 (https://arxiv.org/html/2606.18384#bib.bib7),44 (https://arxiv.org/html/2606.18384#bib.bib6)]。稳定匹配通常不是帕累托最优的,这意味着系统接受了一种分配,在这种分配下,所有参与者的总效用可以在不损害任何人的情况下得到改善。从福利角度看,面向稳定性的机制在每个训练轮次中都留下了模型质量、资源利用率和经济结果方面的潜在增益未能实现[13 (https://arxiv.org/html/2606.18384#bib.bib8),7 (https://arxiv.org/html/2606.18384#bib.bib10),19 (https://arxiv.org/html/2606.18384#bib.bib30)]。对于在大量客户端群体和多个服务器上运行的HFL系统而言,这种系统性的福利牺牲会随着轮次累积,逐步降低学习性能和参与者满意度。然而,单纯追求PE在实践中不足以保证系统福利。如果没有策略证明性(SP),自利的参与者有动机谎报其真实偏好(基于奖励、延迟、能力等参数)和能力,以获得更有利的分配。客户端可能会少报其计算成本,以显得对高奖励服务器更具吸引力。当参与者谎报时,输入匹配机制的偏好档案被破坏,由此产生的分配仅相对于虚假输入是帕累托最优的,这在现实中意味着福利损失和策略低效。因此,在实践中实现帕累托最优结果要求PE和SP不是作为独立目标,而是作为不可分割的属性。PE定义了福利目标,而SP则确保参与者揭示实现该目标所需的信息[7 (https://arxiv.org/html/2606.18384#bib.bib10),19 (https://arxiv.org/html/2606.18384#bib.bib30)]。现有方法解决了这一问题的部分方面,但没有一个能全面解决。面向稳定性的机制,如延迟接受(DA)[7 (https://arxiv.org/html/2606.18384#bib.bib10),37 (https://arxiv.org/html/2606.18384#bib.bib7),44 (https://arxiv.org/html/2606.18384#bib.bib6)],保证了稳定匹配,但正如上文所述,牺牲了PE。帕累托高效机制,如带跳过的即时接受(IAS)[7 (https://arxiv.org/html/2606.18384#bib.bib10),19 (https://arxiv.org/html/2606.18384#bib.bib30)],实现了效率但完全缺乏SP,使系统易受操纵。基于拍卖和契约理论的激励机制[18 (https://arxiv.org/html/2606.18384#bib.bib16),4 (https://arxiv.org/html/2606.18384#bib.bib42)]优化了服务器端效用,但不提供SP保证。基于声誉的系统[4 (https://arxiv.org/html/2606.18384#bib.bib42)]随时间推移提高了信任度,但无法保证任何给定轮次中的PE。除了匹配之外,评估异构客户端对全局模型的贡献仍然是一个持久瓶颈,因为包括Shapley值计算在内的方法在大规模场景下在组合上难以处理[34 (https://arxiv.org/html/2606.18384#bib.bib29),6 (https://arxiv.org/html/2606.18384#bib.bib11)],而轻量级近似要么在非凸设置中牺牲准确性,要么忽略了客户端之间的联盟效应[6 (https://arxiv.org/html/2606.18384#bib.bib11)]。最后,即使在看似去中心化的HFL架构中,匹配过程通常仍然集中在单个主服务器上,从而产生了单点故障、操纵和偏见[37 (https://arxiv.org/html/2606.18384#bib.bib7),44 (https://arxiv.org/html/2606.18384#bib.bib6),39 (https://arxiv.org/html/2606.18384#bib.bib9)]。为了解决这些局限性,我们提出了SCOPE-FL(策略证明的基于链的最优帕累托高效联邦学习),这是一种新颖的同步HFL框架,通过将客户端选择建模为双边学校选择问题并使用顶级交易循环(TTC)算法[7 (https://arxiv.org/html/2606.18384#bib.bib10),19 (https://arxiv.org/html/2606.18384#bib.bib30)]求解,从而保证了帕累托最优分配。学校选择公式自然地捕捉了HFL客户端选择的双边性质,其中客户端和服务器基于奖励、延迟和贡献质量相互持有偏好。尽管HFL服务器协作生成单个全局模型,但学校选择类比并不要求它们成为竞争对手。在经典公式[1 (https://arxiv.org/html/2606.18384#bib.bib31)]中,学校不是战略主体,而是供学生“消费”的对象,仅持有容量和优先级,而只有学生持有偏好并采取战略行为。此外,每个服务器奖励高贡献客户端;争夺理想客户端等同于争夺那些最大程度改进共享模型的客户端。这种不对称并不意味着服务器的利益被忽视。服务器端目标(贡献质量、通信延迟和价格)直接编码在机制作为输入接收的优先级配置文件中,因此TTC过程在结构上偏好服务器高度重视的配对。因此,SCOPE-FL的理论保证(帕累托效率和策略证明性)是针对客户端侧陈述的,而服务器侧和系统级结果(如全局模型准确率和收敛速度)则在评估部分用实验验证。TTC是该设置中唯一已知能同时保证PE和SP并具有最小不稳定性(在所有SP和PE机制中阻塞对数量最少)的机制[12 (https://arxiv.org/html/2606.18384#bib.bib34)],确保系统达到帕累托最优分配,同时激励所有参与者如实汇报其偏好和能力。为了准确衡量每个参与者对全局模型的边际贡献,SCOPE-FL采用了一种基于单轮重构(OR)的可扩展启发式Shapley值方法[34 (https://arxiv.org/html/2606.18384#bib.bib29)],并针对HFL框架进行定制,以实现公平透明的奖励分配,而无需精确Shapley计算的组合复杂性。整个分配机制通过区块链智能合约执行,提供了SP保证在实践中可信所需的防篡改执行环境,并消除了集中式设计中固有的单点故障。 1. 1\.帕累托最优的客户端选择。我们是首个将HFL客户端选择建模为双边学校选择问题并使用TTC求解的工作,将原本面向稳定性、牺牲福利的过程转变为保证客户端帕累托最优分配的过程。这从单方面、以服务器为中心的选择转向了双边模型,其中客户端和服务器的偏好和优先级共同驱动匹配结果。 2. 2\.同时实现PE和SP。SCOPE-FL是开创性的HFL框架,同时保证了PE和SP并具有最小不稳定性。这种独特的双重保证确保了PE,同时使如实汇报成为所有参与者的主导策略,从而使福利增益在实践中得以实现,而不仅仅是理论上的。 3. 3\.可扩展的贡献评估。为了确保基于性能的公平补偿,SCOPE-FL采用了一种基于OR的可扩展启发式Shapley值方法,准确衡量每个客户端对全局模型改进的边际贡献。这种与贡献成比例的补偿确保了对全局模型改进最大的客户端获得最多奖励,从而在个体参与激励与系统整体福利最大化之间形成自我强化的对齐。 4. 4\.去中心化防篡改执行。整个匹配和奖励机制通过区块链智能合约实现,消除了中心化风险,确保了透明、抗操纵的操作。我们还识别出存储写入复杂度(通过EVM上的SSTORE操作量化)作为区块链上匹配算法的关键效率指标,这是以往工作中系统性忽视的贡献[23 (https://arxiv.org/html/2606.18384#bib.bib12)]。 5. 5\.全面的实证验证。我们使用MNIST、Fashion-MNIST和CIFAR-10进行了广泛评估,证明SCOPE-FL在模型准确率、收敛速度、奖励效率、Gas消耗和通信延迟方面均优于DA、IAS和其他基线方法。 本文的后续部分结构如下:第II节 (https://arxiv.org/html/2606.18384#S2)深入探讨相关工作。第III节 (https://arxiv.org/html/2606.18384#S3)提供本研究所需的背景知识,而第IV节 (https://arxiv.org/html/2606.18384#S4)展示所采用的系统模型。第V节 (https://arxiv.org/html/2606.18384#S5)涵盖实验设置和结果。最后,第VI节 (https://arxiv.org/html/2606.18384#S6)讨论结论和未来研究方向。 ## II 相关工作 接下来,我们综述FL系统中客户端选择和激励机制、多服务器FL和HFL框架、区块链赋能的FL系统以及客户端贡献评估方面的相关工作。 ### II-A FL系统中的客户端选择和激励机制 客户端选择已被广泛认为是FL系统中系统福利的关键决定因素,但现有机制仅部分地解决了福利问题。基于优化、重要性驱动、聚类和强化学习的方法主要最大化服务器端效用,同时将选择视为单方面决策,忽略了客户端偏好和双边福利[26 (https://arxiv.org/html/2606.18384#bib.bib3),33 (https://arxiv.org/html/2606.18384#bib.bib45),28 (https://arxiv.org/html/2606.18384#bib.bib46),2 (https://arxiv.org/html/2606.18384#bib.bib47)]。博弈论方法更接近双边建模,例如,Yellampalli等人提出了MAAIM,一种基于DA的激励机制,通过学习质量估计实现稳定的客户端-服务器配对,在稳定性方面表现出色,但并不旨在实现PE。[44 (https://arxiv.org/html/2606.18384#bib.bib6)]。类似地,Wehbi等人采用匹配博弈论进行基于准确率和奖励的双边选择,后来将其扩展为基于相互信任的框架,显著减少了不可信客户端的参与,但没有PE或SP保证[37 (https://arxiv.org/html/2606.18384#bib.bib7),38 (https://arxiv.org/html/2606.18384#bib.bib22)]。Qu等人提出了COCS,一种针对HFL特定客户端选择的上下文组合多臂老虎机策略,处理不确定的网络条件和预算约束,在最大化参与客户端数量方面表现出色,但不旨在实现双边偏好满足或帕累托最优匹配[31 (https://arxiv.org/html/2606.18384#bib.bib43)]。对于贡献评估和奖励分配,Zahra等人引入了Block-RACS
相似文章
面向异构优化器的无服务器半去中心化联邦学习
提出SSD-FL,一种无服务器半去中心化联邦学习方法,通过有效损失函数和基于Cheeger不等式的迭代聚类优化异构环境中的聚类形成,提升了收敛速度和通信效率。
Auto-FL-Research:面向联邦学习算法的代理搜索
Auto-FL-Research 引入了一种受约束的编码代理工作流,用于自动搜索和评估联邦学习算法配方,在多个医疗健康和 LEAF 任务上展示了性能提升,同时也揭示了种子敏感和搜索选择的失败案例。
PRoVeFL: 联邦学习中私密、鲁棒且可验证的聚合
PRoVeFL 是一个新颖的联邦学习框架,通过使用多密钥全同态加密实现了隐私保护、拜占庭鲁棒和可验证的聚合,相比之前的工作提供了高达100倍的运行时间改进。
基于层的联邦表示学习
本文介绍了基于层的联邦表示学习(SFRL),这是一个通过可学习的层限制映射和二次粘合正则化器来对齐异构局部表示的框架,无需假设共享的全局潜在空间。提出了一种具有收敛保证的分散式算法(Sheaf-FRL),并证明其在与数据异构和模型异构下的协作分类中优于基线方法。
QSplitFL:基于能力感知的深度Q学习在分割联邦学习中的最优分割点选择
QSplitFL提出了一种基于DQN的框架,用于在分割联邦学习中选择最优分割点,利用客户端硬件指标适应异构设备。实验表明,在多个数据集和架构上,该方法提高了收敛速度和准确率。