CRAD:基于类别的可靠性感知蒸馏用于去中心化异构联邦学习

arXiv cs.LG 论文

摘要

本文提出了CRAD,一种用于去中心化联邦学习的基于类别的可靠性感知蒸馏方法,以处理异构架构和非独立同分布数据,在图像分类基准测试上实现了更高的准确率。

arXiv:2609.00446v1 公告类型:新 摘要:传统的联邦学习(FL)依赖于参数平均,这迫使客户端具有双重同质性:它要求相同的架构,并在非独立同分布数据下性能下降。现实世界的部署通常会打破这两个假设。我们通过构建一个去中心化的知识蒸馏框架来规避这两个问题,在这个框架中,每个客户端在其本地数据上评估其对等方的模型快照,并从结果软预测中进行蒸馏。因为知识是通过共享的类别后验传输的,客户端可以自由运行不同的架构;并且因为每个教师都是在学生自己的设备上评估的,原始数据永远不会离开客户端,无需中央服务器或公共数据集。在这种设定下,我们识别并解决了一个尚未充分研究的问题:如何组合对等教师的预测。现有方法,如均匀平均,忽略了知识可靠性在教师和类别之间的变化。我们提出了基于类别的可靠性感知蒸馏(CRAD),它按类别进行,首先丢弃与对等共识不一致的教师,然后对其余教师进行加权平均,每个教师的权重基于其按类别的可靠性(精确度,或逆方差)。由于来自$n$个样本的准确率的方差与$1/n$成正比,支持度自动进入:在通过过滤的教师中,一个教师在某个类别上的可信度取决于其准确性和证据的充分性。在三个图像分类基准测试(CIFAR-10、CIFAR-100和PathMNIST结肠病理)上,跨越严重非独立同分布偏斜下的异构架构,CRAD在全局准确率上始终优于竞争方法。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:13

# CRAD:面向去中心化异构联邦学习的类级可靠性感知蒸馏
来源:https://arxiv.org/html/2609.00446
孟辰帆* 单位:阿拉巴马大学伯明翰分校计算机科学系,美国阿拉巴马州伯明翰 耿宝成* 单位:阿拉巴马大学伯明翰分校计算机科学系,美国阿拉巴马州伯明翰 田庆* 单位:阿拉巴马大学伯明翰分校计算机科学系,美国阿拉巴马州伯明翰

###### 摘要

传统联邦学习(FL)依赖参数平均法,这要求客户端必须具备双重同质性:需要完全一致的模型架构,并且在非独立同分布数据下性能会下降。现实部署通常打破了这两个假设。我们通过构建一个去中心化知识蒸馏框架来规避这两个限制,该框架中每个客户端在自己的本地数据上评估其他客户端的模型快照,并从得到的软预测中蒸馏知识。因为知识通过共享的类别后验概率进行传递,客户端可以自由运行不同的架构;又因为每位教师模型都是在学生模型所在的本地设备上进行评估的,原始数据永远不会离开客户端,也无需中央服务器或公共数据集。在此设定下,我们识别并解决了一个尚待深入研究的问题:如何结合来自其他客户端的教师模型预测。现有方法(如均匀平均)忽略了知识可靠性在不同教师和类别之间的差异。我们提出类级可靠性感知蒸馏(CRAD),该方法按类别进行处理:首先剔除与同伴共识不一致的教师,然后对剩余教师进行加权平均,权重为每位教师在该类上的可靠性(精确度,或方差的倒数)。由于来自n个样本的准确率估计的方差与1/n成正比,样本支持量会自动体现:在通过筛选的教师中,一个教师在某类别上获得的信任程度取决于其准确性和证据充分性。在三个图像分类基准(CIFAR-10、CIFAR-100 和 PathMNIST 结肠病理图像)上,面对异构架构和严重的非独立同分布偏差,CRAD 在全局准确率上始终优于竞争方法。

¹¹ 脚注:这些作者贡献相等。²² 脚注:通讯作者:[email protected] ## 1 引言

联邦学习(FL)使得在分布式客户端之间协作训练机器学习模型成为可能,同时保持原始数据本地化[27 (https://arxiv.org/html/2609.00446#bib.bib27), 26 (https://arxiv.org/html/2609.00446#bib.bib26)]。然而,在实际部署中的一个根本限制是由参数平均施加的架构同质性假设[8 (https://arxiv.org/html/2609.00446#bib.bib8), 28 (https://arxiv.org/html/2609.00446#bib.bib28), 18 (https://arxiv.org/html/2609.00446#bib.bib18)]。在现实世界的FL系统中,这个假设很少被满足[18 (https://arxiv.org/html/2609.00446#bib.bib18), 30 (https://arxiv.org/html/2609.00446#bib.bib30), 38 (https://arxiv.org/html/2609.00446#bib.bib38)]。考虑一个医院网络协作训练诊断成像模型的场景。每个医院有不同的硬件和数据条件:大型城市医院可能在GPU服务器上运行大规模网络,而农村诊所只能在低功耗设备上运行小型模型。由于这些机构无法跨司法管辖区共享患者数据,FL是自然的解决方案[15 (https://arxiv.org/html/2609.00446#bib.bib15), 1 (https://arxiv.org/html/2609.00446#bib.bib1)]。但标准的FL在此失效:对不同架构进行平均是没有定义的,因为权重张量的形状和语义不同[8 (https://arxiv.org/html/2609.00446#bib.bib8), 22 (https://arxiv.org/html/2609.00446#bib.bib22)]。这种不兼容性带来三重问题:没有单一架构能在不过度配置弱设备或未充分利用强设备的情况下适合所有机构[30 (https://arxiv.org/html/2609.00446#bib.bib30), 38 (https://arxiv.org/html/2609.00446#bib.bib38)];存储在不兼容权重空间中的知识无法有意义地组合[8 (https://arxiv.org/html/2609.00446#bib.bib8), 22 (https://arxiv.org/html/2609.00446#bib.bib22)];即使在共享架构下,对各自适应了偏斜数据的模型进行平均,也可能产生比任何单一专家模型更差的结果[39 (https://arxiv.org/html/2609.00446#bib.bib39), 2 (https://arxiv.org/html/2609.00446#bib.bib2), 14 (https://arxiv.org/html/2609.00446#bib.bib14)]。

现有的FL方法分为两类,均不适用于此场景。参数空间共识方法[21 (https://arxiv.org/html/2609.00446#bib.bib21), 16 (https://arxiv.org/html/2609.00446#bib.bib16), 34 (https://arxiv.org/html/2609.00446#bib.bib34)]可抑制非独立同分布数据下的客户端漂移,但仍然在共享模型空间内组合权重,因此仍不适用于不兼容的架构[28 (https://arxiv.org/html/2609.00446#bib.bib28), 18 (https://arxiv.org/html/2609.00446#bib.bib18)]。知识蒸馏方法[22 (https://arxiv.org/html/2609.00446#bib.bib22), 12 (https://arxiv.org/html/2609.00446#bib.bib12), 20 (https://arxiv.org/html/2609.00446#bib.bib20)]则交换与架构无关的软预测,规避了同质性约束,但通常重新引入共享公共数据集或中央服务器[28 (https://arxiv.org/html/2609.00446#bib.bib28), 3 (https://arxiv.org/html/2609.00446#bib.bib3)],这恰恰是FL旨在避免的隐私和中心化成本[25 (https://arxiv.org/html/2609.00446#bib.bib25), 29 (https://arxiv.org/html/2609.00446#bib.bib29)]。这些观察启发了我们的方法:一个完全去中心化、点对点的知识蒸馏(KD)框架,客户端无需参数平均即可协作。每个客户端共享模型快照,将其他客户端实例化为本地教师,在自己的数据上评估它们,并从其组合的软预测中蒸馏知识,无需公共传输集和中央协调器。这种去中心化、无需公共数据的蒸馏方式具有吸引力,因为它天然兼容异构架构,并且让每个客户端可以学习到其罕见或从未见过的类别[18 (https://arxiv.org/html/2609.00446#bib.bib18)]。但实现这个设定时,浮现了一个FL蒸馏文献中很大程度上未明确的问题:一旦客户端拥有一组来自同伴教师的预测,应如何组合这些预测来指导学生模型?

默认的答案,源自集成蒸馏[22 (https://arxiv.org/html/2609.00446#bib.bib22)],是对所有同伴进行均匀平均。在存在异质性的情况下,这是一个糟糕的选择,因为教师的可靠性和类别表现不均。因此,我们工作的核心问题是:客户端应如何按类别为同伴教师分配权重,同时考虑每位教师的准确性以及其证据充分性(仅有少量样本支持的类别准确率本身也不可靠),而无需服务器、公共数据或昂贵的调参。

我们用类级可靠性感知蒸馏(CRAD)来回答。除了模型快照,每个客户端还共享一个紧凑的类别级统计向量,总结每个类别它拥有多少验证样本以及正确分类的频率。接收到同伴的这些统计信息后,客户端按类别进行处理:首先剔除持有该类别样本过少的教师,或预测偏离同伴类别共识最远的教师,然后对剩余教师进行逆方差(精确度)加权平均,使得每位教师的权重与其类别准确率估计背后的统计证据成比例。由于来自n个样本的准确率估计的方差与1/n成正比,样本支持量会自动进入权重:通过筛选且在该类别上既准确又证据充分的教师会获得较大权重,而仅凭少数样本猜测的教师权重会被降低。我们的贡献如下:

- •我们提出了一个去中心化、无需公共数据的FL框架,同时处理模型和数据异质性:不同架构的客户端仅通过共享的C维类别后验概率进行同伴蒸馏进行协作。在此框架中,我们揭示了如何组合同伴教师预测这一尚待研究的问题,并表明,由于教师的可靠性在不同同伴和类别间不均,通常的均匀平均是一个糟糕的选择。
- •作为我们核心的方法论贡献,我们提出CRAD,该方法按类别先过滤掉与同伴共识不一致的教师,然后根据其类别准确率估计的逆方差(精确度)对剩余教师进行加权,这(在平滑常数范围内)是每个估计量的Fisher信息量:代表教师在该类别上能力背后的统计证据量。它同时奖励准确性和样本支持,需要调整的超参数很少,且仅在通信中增加一个紧凑的类别级统计向量。
- •在CIFAR-10、CIFAR-100和PathMNIST图像分类基准上,面对异构架构和非独立同分布偏差,CRAD在保持强大本地准确率的同时,达到了所有比较方法中最佳的全局准确率。

图注 图1:所提CRAD框架概览。(1)去中心化异构设定:运行不同架构的客户端在非独立同分布的私有数据上协作,无中央服务器和公共数据集;任何两个客户端之间唯一的共享接口是C维类别后验概率。(2)同伴知识传递:学生客户端接收其同伴的模型快照以及一个紧凑的类别级统计向量,并在自己的本地批次上运行每个同伴以获得软预测q_j,因此原始(通常是私有的)数据永远不会离开客户端。(3)类级可靠性感知聚合:对于每个类别,CRAD首先剔除与同伴共识不一致的教师(一种自适应的类别级中值滤波器),然后通过其类别准确率估计的精确度(逆方差)对剩余教师进行加权组合,使得果断、证据充分的教师主导聚合后的蒸馏目标\overline{q}。然后学生模型通过最小化其本地标签上的交叉熵损失和针对此目标的蒸馏损失的组合来更新其模型。 ## 2 相关工作

### 2.1 联邦学习中的数据异质性

FL在数据异质性(即非独立同分布数据问题)下性能下降[39 (https://arxiv.org/html/2609.00446#bib.bib39)]。之前缓解此退化的努力主要集中在参数空间正则化以限制客户端漂移,例如FedProx[21 (https://arxiv.org/html/2609.00446#bib.bib21)],或通过控制变量进行方差缩减,例如SCAFFOLD[16 (https://arxiv.org/html/2609.00446#bib.bib16)],以稳定收敛。另一系列工作强调模型个性化,允许客户端通过部分参数共享、元学习或个性化目标函数来适应本地分布,例如pFedMe和APFL[6 (https://arxiv.org/html/2609.00446#bib.bib6), 5 (https://arxiv.org/html/2609.00446#bib.bib5)]。然而,所有这些方法都在共享参数空间内操作,无论是通过全局、近端还是个性化聚合[8 (https://arxiv.org/html/2609.00446#bib.bib8)],因此仍然与架构不同的模型不兼容[8 (https://arxiv.org/html/2609.00446#bib.bib8), 30 (https://arxiv.org/html/2609.00446#bib.bib30)],而这种场景在实践中很常见。

### 2.2 联邦学习中的知识蒸馏

KD通过传递软预测而非平均权重向量来规避同质性约束;预测在共享的标签空间上可跨架构保持可比性[28 (https://arxiv.org/html/2609.00446#bib.bib28), 31 (https://arxiv.org/html/2609.00446#bib.bib31)]。为了将这些预测融合成一个共同的目标,基于KD的联邦方法依赖辅助基础设施:共享公共数据集、中央服务器或两者兼有。第一组方法在共享的公共代理数据集上对齐客户端,将每个客户端蒸馏到基于共同输入形成的共识上,如FedMD[20 (https://arxiv.org/html/2609.00446#bib.bib20)]。这可以跨架构传递知识,但需要一个任务相关的公共数据集,引发了可用性和隐私方面的担忧[3 (https://arxiv.org/html/2609.00446#bib.bib3)]。第二组方法通过中央服务器路由融合,该服务器将客户端的模型或预测蒸馏到全局共识中并广播回去,如集成蒸馏[22 (https://arxiv.org/html/2609.00446#bib.bib22)]。这通常在服务器自己的公共或生成数据上运行,转移了依赖而非移除它,并重新引入了中央协调器,这是FL旨在避免的瓶颈和单点故障[18 (https://arxiv.org/html/2609.00446#bib.bib18), 29 (https://arxiv.org/html/2609.00446#bib.bib29)]。最近的服务器中心变体遵循相同模式:Sun等人的多教师FedMKD[32 (https://arxiv.org/html/2609.00446#bib.bib32)]将客户端模型蒸馏到一个服务器端的学生模型中,每位教师对应一个置信度标量;Lin等人的个性化FedMKD[23 (https://arxiv.org/html/2609.00446#bib.bib23)]通过在参数空间混合全局模型和客户端自己的前一轮模型来初始化每个客户端。两者都需要中央服务器和架构相同的客户端。相关的自蒸馏路线[19 (https://arxiv.org/html/2609.00446#bib.bib19), 10 (https://arxiv.org/html/2609.00446#bib.bib10), 9 (https://arxiv.org/html/2609.00446#bib.bib9)]选择性地将全局模型蒸馏到本地模型中,按类别(甚至在[9]中按样本)过滤或重新加权其知识,但它在FedAvg框架内操作,只有一个服务器聚合的教师,客户端架构相同,并且在[10]中使用服务器端辅助集来评估全局模型。第三组方法两者都不需要:客户端通过点对点蒸馏相互学习,无需服务器和共享集,如DFML[18 (https://arxiv.org/html/2609.00446#bib.bib18), 13 (https://arxiv.org/html/2609.00446#bib.bib13)],这也是我们的框架所运行的场景。

### 2.3 组合教师预测

在几乎所有基于KD的联邦方法中,同伴预测是通过对可用教师进行均匀平均或使用从FedAvg继承的固定数据量加权来融合的[22 (https://arxiv.org/html/2609.00446#bib.bib22), 20 (https://arxiv.org/html/2609.00446#bib.bib20)]。这假设每位教师在每个类别上都同样可信,当教师容量不同且在高度非独立同分布的划分上训练时,这是不合理的,因为某个同伴可能在其数据充足的类别上可靠,而在其他类别上则严重校准不足。一种自然的替代方案(用于中心化多教师蒸馏[36 (https://arxiv.org/html/2609.00446#bib.bib36)])是根据预测置信度或熵来加权教师,但置信度在分布偏移下是正确性的较差代理,并且此类方案忽略了实际支持每个教师信念的数据量。基于可靠性的加权通常假设在可信服务器上有保留的验证数据或可访问共享传输集,而在我们的设定中两者都不存在。如何在完全去中心化、无需公共数据、非独立同分布的设定中,根据可靠性为教师分配权重,同时考虑从有限本地数据估计可靠性的统计不确定性,这仍然是一个很大程度上开放的问题。我们的工作正针对这一空白:我们保持去中心化、无需公共数据的KD主干,并提出一种按类别聚合方法,该方法首先根据一致性过滤教师,然后根据逆方差进行加权。

相似文章

TallyTrain: 通信高效的联邦蒸馏

arXiv cs.LG

本文介绍了TallyTrain,一种通信高效的联邦蒸馏方法,该方法仅传输每个探针的argmax类索引(硬标签共识),而非完整的softmax向量,从而将带宽减少多达三个数量级,同时匹配或超越软标签蒸馏的性能,并帕累托优于FedAvg、FedProx和FedDF等标准联邦学习基线。