面向联邦长尾图学习:一种能量引导的双解耦方法

arXiv cs.AI 论文

摘要

本文介绍了FedEPD,一个用于长尾数据分布下联邦图学习的框架。它采用能量引导的双解耦方法,将拓扑纯化与语义重校准分离,在基准测试中实现了最先进的性能,准确率提升高达4.97%。

arXiv:2606.24237v1 公告类型:新 摘要:联邦图学习有助于在保护数据隐私的同时,跨分布式客户端进行协作图建模。然而,现实世界的数据类别经常呈现长尾分布。这种统计稀缺性通过两种方式严重降低性能:它使全局模型偏向多数类,并通过将少数节点淹没在异质、头部主导的邻域中使其在结构上孤立。现有方法尝试与拓扑无关的统计补偿,但通常在数据稀缺的情况下失败。它们未能恢复尾部节点,反而过度拟合来自相邻主导类的结构噪声,导致表示退化。为了解决这些局限性,我们提出了FedEPD,这是一个建立在双解耦范式上的框架,将拓扑纯化与语义重校准分离。具体来说,FedEPD利用分布感知的Dirichlet能量剪枝来过滤空间异质边。然后,它通过从拓扑中心节点提取鲁棒的全局原型来克服非独立同分布偏移,并通过空间低通原型注入将其整合到局部表示中。此外,一种两阶段交替优化策略在提高少数类准确性的同时严格保护多数类决策边界。大量实验表明,FedEPD在多种长尾基准测试中取得了最先进的性能,在准确率上绝对提升高达4.97%,在Macro-F1上绝对提升高达5.48%。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:45

# 迈向联邦长尾图学习:一种能量引导的双解耦方法
来源: https://arxiv.org/html/2606.24237
\credit

概念化、方法论、软件、数据整理、调查、形式分析、撰写 – 初稿

\credit

软件、撰写 – 审阅与编辑

\credit

方法论、可视化、监督、撰写 – 审阅与编辑

\cormark

[1]\credit监督

\cormark

[1]\credit监督

Yuan Gen Zhongzheng [email protected]
Xunkai Li [email protected]
Meixia Qu [email protected]
Wenyu Wang [email protected]
山东大学,空天科学与工程学院,威海 264209,中国
北京理工大学,计算机科学与技术学院,北京 100081,中国

###### 摘要

联邦图学习在保护数据隐私的同时,促进了跨分布式客户端的协同图建模。然而,现实世界的数据类别通常呈现长尾分布。这种统计稀缺性通过两种方式严重损害性能:它使全局模型偏向多数类,并通过将少数节点淹没在异质性、头部主导的邻域中,使其在结构上被隔离。现有方法尝试与拓扑无关的统计补偿,但在数据稀缺情况下常常失效。它们没有恢复尾部节点,反而过度拟合来自相邻主导类别的结构噪声,导致表示退化。为解决这些限制,我们提出了FedEPD,一个基于双解耦范式的框架,该范式将拓扑净化与语义重校准分离。具体来说,FedEPD利用分布感知的狄利克雷能量剪枝来过滤空间异质性边。然后,它通过从拓扑中心节点提取鲁棒的全局原型来克服非独立同分布(Non-IID)偏移,并通过空间低通原型注入将这些原型整合到局部表示中。此外,一种两阶段交替优化策略严格保护多数分类边界,同时提高少数分类准确性。大量实验表明,FedEPD在多种长尾基准测试中实现了最先进的性能,在准确率上取得了高达4.97%的绝对提升,在宏F1得分上取得了5.48%的提升。

###### 关键词:

联邦图学习\sep联邦长尾学习\sep图神经网络\sep长尾数据\sep非独立同分布

## 1 引言

联邦学习建立了一种分布式范式,使得多个客户端能够在保护本地数据隐私的同时进行协作机器学习优化[9 (https://arxiv.org/html/2606.24237#bib.bib9), 19 (https://arxiv.org/html/2606.24237#bib.bib19)]。将这种去中心化框架扩展到复杂的图数据,联邦图学习(FGL)使得图神经网络(GNN)的分布式训练成为可能。这种方法克服了协作图挖掘中的数据隔离困境,使去中心化实体能够综合结构信息和关系依赖,同时不暴露原始拓扑或节点属性。因此,FGL已经成为需要数据治理的各领域不可或缺的技术。最近的部署已将FGL集成到银行业的风险管理[26 (https://arxiv.org/html/2606.24237#bib.bib26)]、协作药物发现的分子属性预测[36 (https://arxiv.org/html/2606.24237#bib.bib36), 7 (https://arxiv.org/html/2606.24237#bib.bib7)]以及机密医疗信息学[25 (https://arxiv.org/html/2606.24237#bib.bib25)]中。然而,传统FGL研究中假定的统计平衡数据分布与经验条件存在差异。经验图网络遵循幂律分布,如图1 (https://arxiv.org/html/2606.24237#S1.F1)所示,表现为多类长尾分布,其中少数头部类支配拓扑结构,导致尾部少数类出现数据稀缺[14 (https://arxiv.org/html/2606.24237#bib.bib14)]。在去中心化的非独立同分布环境中,这种统计不平衡被局部放大,导致数据稀疏,使得单个客户端缺乏特定尾部类别的结构样本[34 (https://arxiv.org/html/2606.24237#bib.bib34)]。此外,这种统计稀缺性的主要挑战因图异质性而进一步加剧,这是一种经验网络中连接节点具有不同语义标签的结构条件[39 (https://arxiv.org/html/2606.24237#bib.bib39), 17 (https://arxiv.org/html/2606.24237#bib.bib17)]。因此,尾部节点的表示学习受到结构冲突的约束:这些节点不仅在统计上罕见,而且它们的表示还因源自相邻多数类的异质性结构噪声而退化。

引用图注图1:CoraFull中多类长尾分布说明,类别按样本数降序排列。节点类别遵循陡峭的幂律动态。引用图注图2:联邦图学习中类别分布与多数-少数优化冲突的实证分析。(a) CoraFull和Amazon-Electronics数据集内的极端多类长尾分布,其中类别按局部节点频率排列。(b)-(d) 四种代表性联邦基线在(b)头部、(c)中间和(d)尾部划分上的准确率和F1得分对比评估。

当前为不平衡学习设计的方法在解决联邦图环境中的多类长尾分布时表现出局限性[37 (https://arxiv.org/html/2606.24237#bib.bib37)]。现有解决方案的一个局限性是它们倾向于将长尾挑战视为统计稀缺性,忽视了少数类别的结构缺陷。具体而言,空间过采样技术试图通过特征插值来合成尾部节点[38 (https://arxiv.org/html/2606.24237#bib.bib38)],而操作在特征空间中的方法,如DULL[22 (https://arxiv.org/html/2606.24237#bib.bib22)],则通过潜在特征解耦和部分遗忘来解决不平衡问题。然而,在数据稀缺的孤立客户端子图中,在没有足够结构上下文的情况下合成或解耦少数特征,会产生不一致的表示,从而改变底层的拓扑流形。或者,联邦统计校准方法依赖于与类别稀缺性成正比的逻辑调整[34 (https://arxiv.org/html/2606.24237#bib.bib34)]。最近的联邦策略如FedYoYo[30 (https://arxiv.org/html/2606.24237#bib.bib30)]在此基础上,通过结合自主知识蒸馏和分布自适应逻辑调整,减少了集中式和联邦范式之间的性能差异。这些方法独立于拓扑,导致分类器扩大尾部类别的决策边界。当这些少数节点与多数类相邻时,这种扩展会导致对局部结构噪声的过拟合。

为了实证验证这种表示退化,我们在两个具有代表性的长尾图数据集(CoraFull和Amazon-Electronics)上进行了初步研究。根据类别频率将节点划分为头部、中间和尾部类别,如图2 (https://arxiv.org/html/2606.24237#S1.F2)所示的实验结果揭示了性能差异:标准模型在多数类上保持高准确率,但在尾部类别上的性能下降。我们将此现象归因于现有模型无法协调统计频率与拓扑结构。具体而言,我们识别了当前联邦图学习中的两个局限性,并提出了联邦能量剪枝与解耦(FedEPD)框架,通过一个形式化的双解耦范式来解决它们:

**局限性1. 统计-拓扑失调。** 现有方法假设长尾分布可以通过数值调整来解决。然而,在长尾和异质性环境中,这些与拓扑无关的调整迫使分类器过度拟合结构噪声,扭曲来自相邻多数类的决策边界,导致更高的误分类率。

**解决方案1. 通过能量进行拓扑净化。** 为解决此问题,FedEPD将结构去噪与语义学习解耦。我们引入了一种分布感知的狄利克雷能量剪枝机制,用于过滤空间域中的异质性边。这确保了在表示学习发生之前,基础拓扑在结构上是去噪的。

**局限性2. 多数-少数优化冲突。** 观察到的经验差异需要对尾部类别进行补偿,但直接将这些调整与特征提取器耦合会导致折衷。现有方法面临优化困境:在没有架构解耦的情况下尝试提升少数性能,会降低多数类的表示,阻碍统一的性能提升。

**解决方案2. 双解耦。** 为解决这一冲突,FedEPD在模型和表示两个维度上执行双解耦策略。在模型层面,它采用两阶段交替优化流水线,在校准期间冻结图编码器,从而保护基础表示免受面向尾部的逻辑调整的影响。在表示层面,它通过服务器辅助的局部共识构建鲁棒的全局原型,并选择性地将其注入局部节点的低频语义分量中。这种空间低通原型注入将语义补偿与高频结构特异性分离开来,从而在保持多数类决策边界的同时提高少数类的准确率。

总之,本文的主要贡献总结如下:

- • **新视角。** 我们将长尾图学习的焦点从频率不平衡转移到结构干扰。我们阐明了数值调整为何在长尾异质图中失败,为少数类的性能退化提供了解释。
- • **新颖范式与框架。** 我们提出了FedEPD,一个实现双解耦范式的框架。通过将分布感知的狄利克雷能量剪枝与两阶段交替优化和空间低通原型注入相结合,我们的框架在不引入显著计算开销的情况下缓解了梯度冲突并提高了收敛稳定性。
- • **卓越性能。** 在长尾图数据集上的实验证实,FedEPD解决了性能冲突。它保持了头部和中间类别的分类稳定性,同时为尾部类别提供了高达11.89%的绝对准确率提升。

## 2 预备知识与相关工作

### 2.1 符号说明与问题形式化

令 \({\mathcal{G}}=({\mathcal{V}},{\mathcal{E}},{\mathbf{X}},{\mathbf{Y}})\) 表示一个无向全局图,其中 \({\mathcal{V}}\) 是 \(N\) 个节点的集合,\({\mathcal{E}}\) 表示边,其邻接矩阵为 \({\mathbf{A}}\in\{0,1\}^{N\times N}\)。对于任意节点 \(v_i\in{\mathcal{V}}\),其拓扑邻域记为 \({\mathcal{N}}_i=\{v_j\in{\mathcal{V}}\mid (v_i,v_j)\in{\mathcal{E}}\}\)。\({\mathbf{X}}\in\mathbb{R}^{N\times d}\) 是节点特征矩阵,\({\mathbf{Y}}\in\{0,1\}^{N\times C}\) 表示 \(C\) 个类别的独热标签矩阵。在具有 \(K\) 个客户端的标准联邦子图系统中,全局图被划分为 \(K\) 个分布式子图 \(\{{\mathcal{G}}_1,{\mathcal{G}}_2,\dots,{\mathcal{G}}_K\}\)。对于客户端 \(k\),其局部子图记为 \({\mathcal{G}}_k=({\mathcal{V}}_k,{\mathcal{E}}_k,{\mathbf{X}}_k,{\mathbf{Y}}_k)\),其中 \(n_k=|{\mathcal{V}}_k|\) 且 \(\sum_{k=1}^K n_k=N\)。由于隐私约束,跨客户端边是不可观测的。每个客户端仅使用其局部拓扑 \({\mathcal{E}}_k\) 和特征 \({\mathbf{X}}_k\) 协作训练一个由 \(\Theta\) 参数化的全局图神经网络。

在这个去中心化的背景下,我们形式化了经验长尾场景,其中全局类别频率呈现幂律衰减[32 (https://arxiv.org/html/2606.24237#bib.bib32)]。令 \(N_c\) 表示属于类别 \(c\in\{1,2,\dots,C\}\) 的节点总数。我们通过不平衡比率 \(\text{IR}={\max_c N_c}/{\min_c N_c}\) 来量化类别不平衡。假设类别按频率降序排列,即 \(N_1\geq N_2\geq\dots\geq N_C\),则将类别集合划分为三个互不相交的子集:头部类 \({\mathcal{C}}_H\)、中间类 \({\mathcal{C}}_M\) 和尾部类 \({\mathcal{C}}_T\)[15 (https://arxiv.org/html/2606.24237#bib.bib15)]。经验幂律分布满足 \(|{\mathcal{C}}_H|\ll|{\mathcal{C}}_T|\) 但 \(\sum_{c\in{\mathcal{C}}_H}N_c\gg\sum_{c\in{\mathcal{C}}_T}N_c\)。这种统计稀缺性导致了尾部类别的结构缺陷[32 (https://arxiv.org/html/2606.24237#bib.bib32)]。对于少数节点 \(v_i\in{\mathcal{C}}_T\),缺乏同质邻域导致不同类别之间的连接。因此,其局部邻域 \({\mathcal{N}}_i\) 因来自相邻多数类 \(v_j\in{\mathcal{C}}_H\) 的异质结构噪声而退化。这种在去中心化非独立同分布设置下被放大的结构冲突,改变了局部消息传递过程,这激发了我们的双解耦范式。

### 2.2 联邦长尾学习

联邦长尾学习(FedLT)将分布式优化扩展到以统计不平衡为特征的经验场景,其中全局数据分布遵循幂律[3 (https://arxiv.org/html/2606.24237#bib.bib3)]。与集中式学习不同,FedLT面临一个复合挑战:跨客户端的局部数据异质性(非独立同分布)与全局类别不平衡交织在一起。因此,少数类别在全局范围内稀缺,并且通常在某些客户端上缺失,这加剧了梯度方差、局部过拟合以及聚合过程中的全局客户端漂移。虽然某些集中式方法引入了结构感知来补偿少数类别,包括合成节点和边的生成[38 (https://arxiv.org/html/2606.24237#bib.bib38)]以及潜在特征解耦[22 (https://arxiv.org/html/2606.24237#bib.bib22)],但直接将这些方法应用于联邦环境存在固有的局限性。由于严格的隐私约束和缺乏全局数据视图,在数据稀缺的客户端上部署局部拓扑过采样通常会放大异质噪声,而不是准确重建少数结构。

为了缓解这个问题,近期的研究通过自适应梯度平衡器[29 (https://arxiv.org/html/2606.24237#bib.bib29)]或自主蒸馏[33 (https://arxiv.org/html/2606.24237#bib.bib33)]等机制重建全局先验来指导局部训练。其他对策通过自适应逻辑调整[16]来解决耦合的非独立同分布和不平衡挑战。

相似文章

联邦图学习中的广义类别发现

arXiv cs.LG

本文介绍了 GCD-FGL,这是一种专为动态环境中的广义类别发现而设计的联邦图学习框架。该框架解决了邻域吸收效应和全局语义不一致性等挑战,从而提高了跨分布式客户端对新类别的检测能力。

双注意力头用于ECG分类中的个性化联邦学习

arXiv cs.LG

本文提出了FedDualAtt,一种用于ECG分类的个性化联邦学习方法,该方法将Transformer注意力头分为全局聚合和局部私有分支,以处理临床站点间的数据异质性。在FedCVD基准上的实验表明,其性能优于现有方法。