Flower Hub:一个用于联邦学习模拟与部署的可复现基准测试平台

arXiv cs.LG 论文

摘要

Flower Hub 是一个可复现的联邦学习基准测试平台,支持在模拟和部署运行时环境中执行和评估任务。

arXiv:2608.25114v1 Announce Type: new 摘要:联邦学习已成为跨分散数据训练模型的关键方法,但其基准测试仍难以复现、比较和扩展。现有评估通常依赖定制化基础设施,以不完整的研究代码形式发布,并主要在模拟环境中进行,这限制了其可移植性和实际应用价值。我们提出 Flower Hub,这是一个用于发布、发现和执行去中心化及联邦应用程序的平台。我们展示了该平台如何通过将基准测试打包为带有标准化元数据、固定依赖项和明确评估工作流的可执行、版本化应用程序,从而实现可复现的基准测试。我们通过一个涵盖跨设备与跨机构设置的多领域基准测试套件实例化了这一方法,其中包括医学影像、金融表格学习、法律指令微调、网络钓鱼URL检测和音频标记等任务。我们进一步证明,相同的基准测试应用程序无需修改代码即可在模拟和部署运行时环境中运行,从而能够在不同的学习环境中进行统一评估。除了模型质量外,我们的基准测试设计还支持系统感知报告,包括运行时和通信指标。这项工作推动了联邦学习场景下的基准测试从临时的代码工件向可移植、可执行和可重用的基准测试应用程序发展。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:33

# Flower Hub:面向联邦学习模拟与部署的可复现基准测试平台  
来源:https://arxiv.org/html/2608.25114  
Mohammad Naseri (Flower Labs)  
Javier Fernandez-Marques (Flower Labs / 剑桥大学)  
Dimitris Stripelis (Flower Labs)  
Lorenzo Sani (Flower Labs / 剑桥大学)  
Davide Eynard (Mozilla.ai)  
Fan Zhang (剑桥大学)  
Hong Jia (奥克兰大学)  
Ting Dang (墨尔本大学)  
D. B. Emerson (Vector Institute)  
Fatemeh Tavakoli (Vector Institute)  
Ole Werger (弗劳恩霍夫IMSL)  
Lars Wulfert (弗劳恩霍夫IMSL)  
Petros Demetrakopoulos (NetCompany)  
Sofia Tsekeridou (NetCompany)  
InSeo Song (嘉泉大学)  
KangYoon Lee (嘉泉大学)  
Honghao Li (Owkin)  
Lingjuan Lyu (Sony AI)  
John P Dickerson (Mozilla.ai)  
Daniel Janes Beutel (Flower Labs)  
Nicholas D. Lane (Flower Labs / 剑桥大学)  

###### 摘要  
联邦学习(FL)已成为跨去中心化数据训练模型的关键方法,但其基准测试仍难以复现、比较和扩展。现有评估通常依赖定制化基础设施,以不完整研究代码形式发布,且主要在模拟环境中进行,限制了可移植性和实际应用价值。本文提出Flower Hub平台,用于发布、发现和执行去中心化与联邦应用程序。我们展示了如何通过将基准测试打包为带有标准化元数据、固定依赖项和明确评估工作流的可执行版本化应用程序,实现可复现的基准测试。我们构建了涵盖跨孤岛与跨设备场景的多领域基准套件,包含医学影像、金融表格数据学习、法律指令微调、钓鱼URL检测和音频标注等任务。进一步证明,同一基准测试应用程序无需修改代码即可在模拟与部署运行时环境中运行,实现跨不同学习环境的统一评估。除模型质量外,我们的基准设计还支持系统级报告,包括运行时与通信指标。本工作推动了联邦学习基准测试从临时代码工件向可移植、可执行、可重用的基准应用程序发展。  

## 1 引言  
许多现代机器学习应用依赖于因隐私、法规或带宽限制而无法集中化的分布式数据\[10 (https://arxiv.org/html/2608.25114#bib.bib10), 39 (https://arxiv.org/html/2608.25114#bib.bib39), 45 (https://arxiv.org/html/2608.25114#bib.bib45), 49 (https://arxiv.org/html/2608.25114#bib.bib49)\]。这一现象存在于医疗、边缘设备、金融和法律服务等领域\[16 (https://arxiv.org/html/2608.25114#bib.bib16), 39 (https://arxiv.org/html/2608.25114#bib.bib39), 45 (https://arxiv.org/html/2608.25114#bib.bib45), 50 (https://arxiv.org/html/2608.25114#bib.bib50)\]。联邦学习(FL)\[25 (https://arxiv.org/html/2608.25114#bib.bib25), 28 (https://arxiv.org/html/2608.25114#bib.bib28), 29 (https://arxiv.org/html/2608.25114#bib.bib29), 49 (https://arxiv.org/html/2608.25114#bib.bib49)\]已成为无需移动原始数据至中央位置即可跨去中心化数据集训练模型的关键范式。近年来,FL研究发展迅速,新算法、优化方法、隐私机制和系统架构的提出速度不断加快\[17 (https://arxiv.org/html/2608.25114#bib.bib17), 49 (https://arxiv.org/html/2608.25114#bib.bib49)\]。随着FL方法数量持续增长,在统一基准设置下的公平比较与验证日益重要。  

尽管如此,基准测试FL系统固有其挑战。与集中式机器学习实验不同,FL研究通常需要跨多方协作训练的基础设施。因此,研究者不仅需管理评估算法,还需处理底层分布式系统逻辑。许多现有FL基准是基础设施与应用代码紧密耦合的独立项目\[4 (https://arxiv.org/html/2608.25114#bib.bib4), 20 (https://arxiv.org/html/2608.25114#bib.bib20), 26 (https://arxiv.org/html/2608.25114#bib.bib26), 32 (https://arxiv.org/html/2608.25114#bib.bib32), 46 (https://arxiv.org/html/2608.25114#bib.bib46)\]。因此,共享基准常需移交整个基础设施堆栈,而非仅模型、数据集和算法组件。这种耦合使基准难以复用、扩展和重现。跨团队复现FL结果需大量工程投入与系统专业知识,这损害了可复现性——任何基准的核心要求。  

另一局限在于FL评估仍以模拟为主导\[5 (https://arxiv.org/html/2608.25114#bib.bib5), 18 (https://arxiv.org/html/2608.25114#bib.bib18)\]。模拟虽适用于初步算法评估,但从模拟转向实际联邦部署常需大量代码修改与工程开销。更重要的是,FL缺乏标准化的基准打包格式。现有基准通常以研究仓库、自定义脚本和部分文档化的流程形式发布,缺乏统一的训练代码、评估协议、分布式配置和运行时环境的打包方式。因此,每个新基准往往成为又一个孤立项目,限制了FL基准测试工作的可扩展性与长期可用性。  

最后,许多FL论文仍在CIFAR-10和MNIST等集中式数据集上评估方法\[23 (https://arxiv.org/html/2608.25114#bib.bib23), 24 (https://arxiv.org/html/2608.25114#bib.bib24), 35 (https://arxiv.org/html/2608.25114#bib.bib35), 51 (https://arxiv.org/html/2608.25114#bib.bib51)\]。尽管这些数据集适用于初步实验,但无法充分反映实际FL部署的特性,如统计异构性、去中心化数据所有权、领域特定约束与实际系统限制。  

参考图注  
图1:Flower Hub概述。Flower Hub是面向联邦与去中心化学习的开源基准测试平台,将应用逻辑与基础设施解耦,支持轻量、可移植且可共享的基准应用程序。此设计使研究者专注于算法开发与评估。应用程序可在模拟与实际部署设置间无缝执行,无需修改代码,从而加速从开发到部署的过渡。每个发布的基准应用遵循标准化包结构,增强可复现性并促进共享、复用与扩展。集成的系统监控器实时跟踪关键性能指标。这些特性共同将Flower Hub定位为协作式联邦基准测试生态的基础。  

为应对这些挑战,我们提出Flower Hub——一个面向联邦与去中心化AI的可执行、可复现基准测试平台。Flower Hub通过底层Flower FL基础设施\[3 (https://arxiv.org/html/2608.25114#bib.bib3)\]将基础设施逻辑与应用逻辑解耦。此设计使研究者专注于核心工作组件(如模型训练、算法设计与评估),同时使基准因无需定制基础设施代码而易于共享。Flower Hub通过统一命令实现跨模拟与部署设置的可移植性,并引入标准化基准包,规范训练、评估、系统配置与版本控制,提升跨基准的可复现性与可重用性。此外,Flower Hub为用户提供测量系统级指标(如通信成本与延迟)的工具。这些特性共同确立了Flower Hub作为开源社区生态的地位,研究者可在此发布可执行的联邦基准,供他人运行、评估与扩展。就此而言,Flower Hub代表了联邦与去中心化基准测试的“应用商店时刻”。  

为证明Flower Hub的实用性,我们引入五个涵盖医疗、金融、安全、汽车和法律服务的现实FL基准任务。所选基准亦覆盖文本、表格数据、影像和音频等多种数据模态。利用这些基准,我们在模拟与部署设置中评估六种广泛采用的FL优化算法。所得分析为FL算法在现实场景中部署的可行性与有效性提供了见解。更广泛而言,这些基准可加速开发面向现实应用的包容性、隐私保护与领域专业化模型。  

## 2 Flower Hub  
Flower Hub111https://flower.ai/apps是一个面向联邦学习的开源基准测试平台,支持跨模拟与部署环境的基准测试发现、分发与执行。在Flower Hub中,每个基准表示为可执行应用程序,用户可通过统一接口发布、下载和运行基准。此设计将FL基准测试从孤立、一次性的研究工作转向促进可复现性与可重用性的协作生态(图1 (https://arxiv.org/html/2608.25114#S1.F1))。使用Flower Hub的更多细节见附录C (https://arxiv.org/html/2608.25114#A3)。  

### 2.1 应用逻辑与基础设施解耦  
Flower Hub构建于Flower基础设施之上,其中长运行的SuperLink进程代表中央服务器,多个长运行的SuperNode进程代表联邦客户端。Flower基础设施的更多细节见附录A (https://arxiv.org/html/2608.25114#A1)。通过依赖此共享基础设施层,Flower Hub使研究者能完全专注于应用逻辑。具体而言,ServerApp定义整体FL工作流,包括聚合策略及适用的集中评估;ClientApp定义本地训练、本地评估及相应数据管道。因此,Flower Hub上的基准应用仅需包含ServerApp和ClientApp。此设计使应用易于分发,并让研究者无需实现或维护基础设施代码即可专注于算法与实验设计。  

### 2.2 跨模拟与部署的一键可移植性  
Flower Hub上的基准应用可使用统一命令flwr run在模拟与部署设置中无代码修改地执行。模拟模式下,Flower Simulation Engine通过本地启动SuperLink和多个SuperNode运行完整FL工作流,即使在单机上也能高效实验。部署模式下,相同工作流在分布式环境中执行,独立启动的SuperNode连接至SuperLink。应用下载后无需修改即可运行,显著缩小开发与实际部署的差距。为支持两种模式,每个基准提供专用数据加载逻辑。模拟使用Flower Datasets库(附录B (https://arxiv.org/html/2608.25114#A2))进行灵活划分,部署则从磁盘加载本地数据。一致的划分与预处理确保模拟与部署设置的对齐。  

### 2.3 标准化基准包  
Flower Hub上的每个基准应用遵循具有特定模式、明确配置、固定依赖项和机器可读元数据的标准化包结构。配置文件包含任务相关与系统相关设置。任务相关配置指定数据集、模型架构、训练超参数和聚合策略;系统相关配置指定模拟的划分方案、客户端参与率、训练轮数及客户端资源要求。在单个配置文件中定义这些组件提升可复现性,并使基准更易于共享、复用与扩展(示例见附录D (https://arxiv.org/html/2608.25114#A4))。  

Flower Hub还为基准应用提供灵活的版本控制机制。发布者可发布基准更新版本,用户可从Hub下载并运行特定版本。此外,Flower Hub可根据用户本地环境自动识别兼容的应用版本,进一步提升跨系统的可用性与可复现性。  

### 2.4 系统与机器学习性能监控  
监控对FL至关重要,既能确保可靠执行,又能理解算法行为。Flower Hub提供用于实时系统级指标的专用监控框架,包括端到端轮次延迟、客户端训练时间、服务器聚合时间、通信成本及客户端CPU与GPU内存利用率。此类测量使研究者能在基准测试期间评估系统健康状况、诊断性能瓶颈,并更好理解不同FL配置的实际权衡。同时,基准应用可通过其ServerApp和ClientApp逻辑报告特定任务的机器学习指标,包括本地/集中式损失或准确性、收敛统计、类别性能,以及与梯度或伪梯度相关的噪声度量等算法特异性量。此分离维护了Flower Hub作为通用基准测试与执行平台的角色,同时允许每个基准暴露与其任务和方法最相关的机器学习可观测变量。系统级与机器学习级测量共同为评估联邦学习基准提供了更完整的基础。  

## 3 基准开发  
为证明Flower Hub的实用性,我们引入五个现实的FL基准任务:医学图像分割、金融欺诈检测、法律指令微调、钓鱼URL检测和设备端音频标注。这些任务涉及跨机构或用户设备的敏感分布式数据,使FL成为协作训练的自然框架。这些基准共同涵盖跨孤岛与跨设备FL场景,覆盖影像、表格、音频和文本模态。对每个任务,我们建立完整的训练与评估管道,并在标准化实验设置下用其基准测试六种广泛采用的FL优化算法。  

表1:联邦学习基准数据集概览,包括应用领域、数据模态、样本数、客户端数及FL设置。  

### 3.1 FL数据集构建  
我们精心选择五个旨在反映实际部署环境的现实FL数据集。每个基准的详细描述如下,所提数据集概览见表1 (https://arxiv.org/html/2608.25114#S3.T1)。基准任务的训练与评估管道概览见表2 (https://arxiv.org/html/2608.25114#S3.T2)。

相似文章

Auto-FL-Research:面向联邦学习算法的代理搜索

arXiv cs.AI

Auto-FL-Research 引入了一种受约束的编码代理工作流,用于自动搜索和评估联邦学习算法配方,在多个医疗健康和 LEAF 任务上展示了性能提升,同时也揭示了种子敏感和搜索选择的失败案例。