FedFIbOS:基于Fisher重要性的异构联邦学习最优子建模

arXiv cs.LG 论文

摘要

FedFIbOS提出了一种基于Fisher重要性的方法,用于异构联邦学习中的最优子模型选择,该方法具有理论基础,并在非独立同分布设置下比现有最先进方法准确率提高约10%。

arXiv:2609.19559v1 公告类型:新 摘要:异构联邦学习要求具有不同计算能力的客户端协作训练全局模型,其中每个客户端训练一个容量受限的子模型。现有方法使用启发式重要性度量选择子模型参数——最突出的是参数大小——而没有理论依据支持这些度量为何支持收敛。我们发现了一个根本性差距:现有参数选择标准在收敛框架中缺乏理论基础,部分客户端参与在Fisher分数中引入了额外的估计效应。我们提出了 \textbf{FedFIbOS}:基于Fisher重要性的异构联邦学习最优子建模,使用Fisher信息在一个原则性标准中推导出最小化子模型掩码误差。%我们正式确立当幅度选择等同于Fisher选择在非IID异构联邦学习中失败时。我们通过Fisher加权的二次掩码代理在理论上形式化子模型选择,并表明FedFIbOS实现的原始Fisher top-$k$规则在Fisher主导排名条件下解决了此代理。所得方法保留了底层掩码联邦优化界的收敛结构。Fisher分数通过使用平方梯度的经验对角Fisher信息高效估计,实现稳定且自适应的参数选择,无需额外优化开销。在CIFAR-10、CIFAR-100和AGNews上的实验,在病理性和Dirichlet非独立同分布设置下,表明FedFIbOS实现 ${\approx}10\%$ 高于最先进方法的准确率,并且在更强的异构性下改进更为明显。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:00

# FedFIbOS:基于Fisher重要性的异构联邦学习最优子模型方法
来源:https://arxiv.org/html/2609.19559
###### 摘要

异构联邦学习要求计算能力各异的客户端协同训练全局模型,其中每个客户端需训练一个受容量限制的子模型。现有方法通过启发式重要性度量(最典型的是参数幅值)选择子模型参数,却缺乏这些度量如何支持收敛的理论依据。我们发现一个根本性缺口:现有参数选择标准在收敛框架中缺乏理论基础,且部分客户端参与会在Fisher分数中引入额外的估计效应。我们提出FedFIbOS:基于Fisher重要性的异构联邦学习最优子模型方法,利用源自最小化子模型掩蔽误差的严谨准则中的Fisher信息。我们通过Fisher加权二次掩蔽代理问题对子模型选择进行理论形式化,并表明FedFIbOS实现的原始Fisher top-k规则在Fisher主导排序条件下可求解该代理问题。所得方法保留了底层掩蔽联邦优化界的收敛结构。Fisher分数通过梯度平方从经验对角Fisher信息高效估计,实现了稳定且自适应的参数选择,无需额外优化开销。在CIFAR-10、CIFAR-100和AGNews上进行病态与Dirichlet非独立同分布设置的实验表明,FedFIbOS比当前最优方法准确率提高约10%({\\approx}10\%),且在强异构性下改进更为显著。

1奥塔哥大学计算学院,新西兰

2新南威尔士大学计算机科学与工程学院,澳大利亚

afzya097@student\.otago\.ac\.nz, jeremiah\.deng@otago\.ac\.nz, haibo\.zhang@unsw\.edu\.au

## 引言

联邦学习(FL)可在不共享私有数据的情况下实现分布式客户端的协同模型训练(McMahan等,2017)。实际部署的核心挑战是*模型异构性*:客户端横跨不同硬件,在计算、内存和通信预算上差异巨大(Fang等,2025;Pfeiffer等,2023;Chen等,2023)。模型异构联邦学习(MHFL)通过为每个客户端分配从全局模型派生并针对其资源约束定制的子模型来解决此问题。提取的子模型质量可直接影响收敛速度和最终准确率(Liao等,2023;Yi等,2024)。

现有MHFL方法主要采用三种策略构建客户端子模型:静态切片(Diao等,2021)、动态滚动提取(Alam等,2022;Liao等,2025)和基于重要性的选择(Wu等,2024;Chen等,2023;Liao等,2023;Yi等,2024)。静态和动态策略根据预定义的架构规则而非优化相关性确定子模型,可能导致次优的参数分配、更大的梯度不匹配以及在异构数据分布下增加的客户端漂移。基于重要性的方法部分解决了此问题,但现有方法通过幅值对参数排序,这一标准与每个客户端的本地数据分布无关,因此无法提供最小化掩蔽近似误差(直接决定收敛)的理论保证(Wu等,2024)。

为解决这些限制,我们提出FedFIbOS(基于Fisher重要性的异构联邦学习最优子模型提取),该方法通过根据使用Fisher信息估计的重要性选择参数来构建客户端特定子模型。FedFIbOS不基于参数在网络中的位置进行选择,而是在尊重每个客户端计算容量的同时,保留对其最具优化相关性的参数。如图1所示(https://arxiv.org/html/2609.19559#Sx1.F1),彩色连接表示所选参数的相对Fisher重要性。红色边对应排名最高的参数,这些参数对损失的估计影响最大,因此被优先纳入子模型。黄色边表示重要性中等的参数,在有模型容量时会纳入。绿色边代表排名较低的参数,仅分配给具有足够计算资源的高容量客户端。因此,低容量客户端仅接收最重要的(红色)参数,中容量客户端接收红色和黄色参数,而高容量客户端接收所有三组的参数。

#### 主要贡献

我们的主要贡献总结如下。

- •Fisher引导子模型提取。我们提出一种基于Fisher重要性的最优子模型方法,采用经验对角Fisher信息来识别异构联邦学习中子模型提取的最具信息性的参数。
- •Fisher引导选择的理论基础。我们形式化子模型选择问题(SSP),确定不同重要性标准等价的条件,并在Fisher主导排序条件下,证明在SSP形式化中原始Fisher选择的最优性。
- •收敛分析。我们证明Fisher引导选择保持标准O(1/T)\\mathcal{O}(1/\\sqrt{T})收敛速率(T为通信轮数),同时产生的与选择相关的收敛界项不大于基于幅值的选择,且在对应掩蔽误差系数不同时具有严格改进。
- •广泛的实验验证。在CIFAR-10、CIFAR-100和AGNews上,针对多种模型和数据异构性设置的实验表明,该方法始终优于当前最优MHFL方法,并验证了理论分析。

参考图片描述图1:FedFIbOS中用于模型训练的子模型提取概述。

## 先前工作及其局限性。

#### 静态子模型提取。

早期异构FL方法如HeteroFL(Diao等,2021)及相关方法(Horváth等,2021;Li等,2021;Li等,2020)为客户端分配具有预定义或客户端特定结构的子网络或掩码,减少了计算和通信,但限制了提取的子模型对动态训练过程的适应性。

#### 动态子模型提取。

FedRolex(Alam等,2022)跨轮次以通道为单位滚动子模型选择,确保每个通道获得平等训练机会。然而,在方形通道张量上,滚动简化为对角循环,无论轮次多少,都会留下大量参数区域永久未训练。FedBRB(Liao等,2025)通过将全局模型划分为块并按块滚动来解决此问题,通过加权广播加速子模型间的信息共享,实现了FedRolex无法保证的全参数覆盖。尽管有此改进,这两种方法仍与数据无关:它们不询问在每个客户端本地数据分布下哪些参数对损失最重要。受容量约束的客户端训练滚动计划分配的任何切片,而非对收敛最重要的切片(Wen等,2022;Liao等,2023)。

#### 重要性感知子模型提取。

FIARSE(Wu等,2024)通过基于幅值选择参数并在部分参与下建立模型异构FL的首个收敛保证,推动了重要性感知子模型提取。但其收敛分析将掩蔽误差视为有界黑盒项,未分析其结构或底层选择标准的最优性。FedLAGC(Hu等,2026)通过引入由梯度范数引导的层自适应重要性解决了相关但不同的限制,但其选择标准仍是启发式的,与决定收敛的量无关联。选择标准与决定收敛量之间的关联在所有现有方法中均未建立,使得子模型选择缺乏严谨的理论基础。

#### 用于模型压缩的Fisher信息。

经典剪枝方法使用曲率量化参数重要性。最优脑损伤(LeCun等,1989)使用对角Hessian近似,而最优脑外科(Hassibi和Stork,1992)通过Hessian逆矩阵考虑参数相互作用。在标准正则条件下,Fisher信息提供了基于梯度的半正定Hessian代理,促进了其在高效重要性估计中的使用(Molchanov等,2019)。近期工作将基于Fisher的重要性扩展到模型稀疏化,包括用于大语言模型的FisherLAS(Sun等,2026)。在联邦学习中,Fed-HeLLo(Zhang等,2025)使用逐层Fisher信息进行异构LoRA分配,而其他工作探索Fisher引导剪枝、参数选择和隐私感知优化(Chen等,2024;Liu等,2024)。FedFIbOS则使用Fisher信息在非独立同分布异构性和部分参与下进行子模型选择,并具有形式化收敛保证。

## 问题形式化

考虑一个包含NN个客户端的FL系统,每个客户端n的本地数据集从分布\\{P\_\{n\}\\}\_{n=1}^{N}中抽取。在每轮t,采样客户端子集A⊆\\[N\\mathcal{A}\\subseteq[N]参与训练。每个客户端n具有计算容量\\gamma\_{n}\\in(0,1]\\gamma\_{n}\\in(0,1],并被分配一个包含kn=⌈γnd⌉k\_{n}=\\lceil\\gamma\_{n}d\\rceil个参数的子模型,这些参数来自全局模型~x∈Rd\\tilde{\\mathbf{x}}\\in\\mathbb{R}^{d}。二元掩码M(n)∈{0,1}dM^{(n)}\\in\\{0,1\\}^{d}(其中‖M(n)‖0=kn\\|M^{(n)}\\|\_{0}=k\_{n})指定子模型中包含的参数。全局学习目标是最小化

F⁡(x~)=1N∑n=1NE(x,y)∼Pn[L⁡(x~,x,y)]。\\mathcal{F}(\\tilde{\\mathbf{x}})=\\frac{1}{N}\\sum_{n=1}^{N}\\mathbb{E}_{(\\mathbf{x},y)\\sim P_{n}}[\\mathcal{L}(\\tilde{\\mathbf{x}};\\mathbf{x},y)]。(1)

当客户端n在~x t⊙M(n)\\tilde{\\mathbf{x}}_{t}\\odot M^{(n)}而非完整模型上训练时,本地梯度计算产生*掩蔽近似误差*:

et(n)≜‖∇Fn(x~t)⊙M(n)−∇x~tFn(x~t⊙M(n))‖22。e_{t}^{(n)}\\;\\triangleq\\;\\bigl\\|\\nabla F_{n}(\\tilde{\\mathbf{x}}_{t})\\odot M^{(n)}-\\nabla_{\\tilde{\\mathbf{x}}_{t}}F_{n}(\\tilde{\\mathbf{x}}_{t}\\odot M^{(n)})\\bigr\\|_{2}^{2}。

遵循Wu等(2024),我们将此误差界限定为:

et(n)≤δt2‖x~t‖22,e_{t}^{(n)}\\;\\leq\\;\\delta_{t}^{2}\\,\\|\\tilde{\\mathbf{x}}_{t}\\|_{2}^{2},(2)

其中δt2≥0\\delta_{t}^{2}\\geq 0是使不等式(2)成立的最小常数。参数子集M(n)M^{(n)}直接决定et(n)e_{t}^{(n)}。Fisher引导选择纳入那些排除会导致最大梯度差异的参数,从而最小化et(n)e_{t}^{(n)}并收紧收敛界。选择标准决定δt2\\delta_{t}^{2}:更小的δt2\\delta_{t}^{2}意味着更紧的界,且本地优化更忠实于完整模型。

此误差直接决定收敛。掩蔽异构FL的界(Wu等,2024)形式为:

mint∈[T]⁡‖∇F(x~t)‖22≤C1(T)⏟→0+C2⏟异构性+32NT∑tδt2‖x~t‖22⏟掩蔽误差(项3),\\min_{t\\in[T]}\\|\\nabla F(\\tilde{\\mathbf{x}}_{t})\\|_{2}^{2}\\leq\\underbrace{C_{1}(T)}_{\\to\\,0}+\\underbrace{C_{2}}_{\\text{异构性}}+\\underbrace{\\frac{32N}{T}\\sum_{t}\\delta_{t}^{2}\\|\\tilde{\\mathbf{x}}_{t}\\|_{2}^{2}}_{\\text{掩蔽误差(项3)}},(3)

其中C1(T)→0C_{1}(T)\\to 0且C2C_{2}仅取决于数据异构性。项3是唯一受SS选择控制的项:最小化δt2\\delta_{t}^{2}直接收紧收敛邻域。

为获得可处理的选择标准,令Δt(S)=x~t⊙MS−x~t\\Delta_{t}(S)=\\tilde{x}_{t}\\odot M_{S}-\\tilde{x}_{t}。本地梯度的一阶展开给出

∇Fn(x~t⊙MS)≈∇Fn(x~t)+Hn(x~t)Δt(S)。\\nabla F_{n}(\\tilde{x}_{t}\\odot M_{S})\\approx\\nabla F_{n}(\\tilde{x}_{t})+H_{n}(\\tilde{x}_{t})\\Delta_{t}(S)。

在驻点附近,残差项∇Fn(x~t)⊙(1−MS)\\nabla F_{n}(\\tilde{x}_{t})\\odot(1-M_{S})可忽略,因此选择相关的掩蔽差异可局部近似为

‖Hn(x~t)Δt(S)‖22。\\|H_{n}(\\tilde{x}_{t})\\Delta_{t}(S)\\|_{2}^{2}。

在对角Hessian近似和局部Fisher-Hessian对应下,这产生二次代理

εt(n)(S)≜∑j∉S(Ft,j(n))2x~t,j2。\\epsilon_{t}^{(n)}(S)\\triangleq\\sum_{j\\notin S}\\left(F^{(n)}_{t,j}\\right)^{2}\\tilde{x}_{t,j}^{2}。(4)

此代理提供了选择相关掩蔽误差的可处理近似。

由此产生的子模型选择问题(SSP)为:

S⋆(n,t)=arg⁡minS⊆[d],|S|=knεt(n)(S)。S^{\\star(n,t)}=\\arg\\min_{S\\subseteq[d],\\,|S|=k_{n}}\\epsilon_{t}^{(n)}(S)。(5)

其精确解为Fisher加权top-k选择:

S⋆(n,t)=TopKkn⁡((Ft,j(n))2x~t,j2)。S^{\\star(n,t)}=\\operatorname{TopK}_{k_{n}}\\left(\\left(F_{t,j}^{(n)}\\right)^{2}\\tilde{x}_{t,j}^{2}\\right)。(6)

现有基于幅值的方法(Wu等,2024)改为最小化∑j∉Sx~t,j2\\sum_{j\\notin S}\\tilde{x}_{t,j}^{2},省略了Fisher权重(Fj(n))2(F_{j}^{(n)})^{2},且无法保证求解(5)。

相似文章

面向模态异质性下的鲁棒联邦多模态图学习

arXiv cs.LG

本文提出FedMPO,一种鲁棒的联邦多模态图学习方法,通过拓扑感知的跨模态生成、缺失感知的专家路由和可靠性感知的聚合来解决模态异质性和缺失模态问题,在多个数据集上实现了性能提升。