基于Fisher路由的专家混合模型用于联邦类增量学习

arXiv cs.LG 论文

摘要

本文提出FedFMX,一种基于Fisher路由的专家混合框架,用于联邦类增量学习,通过自适应专家特化解决容量冲突、灾难性遗忘和数据异质性。

arXiv:2606.28835v1 公告类型:新 摘要:联邦学习(FL)作为一种有前景的分布式机器学习范式而兴起。然而,将FL扩展到类增量学习场景引入了独特的挑战:1)共享模型过载导致的容量冲突和灾难性遗忘,2)非独立同分布(Non-IID)数据带来的异质性,以及3)同步的类别错位。在本文中,我们提出 \textbf{F}isher-Routed \textbf{M}i\textbf{X}ture of Experts 用于 \textbf{Fed}erated Class-Incremental Learning (\textsc{FedFMX}),这是一个通过客户端间自适应专家特化来应对这些挑战的新颖框架。关键洞察是将每个样本路由到一个专家子集,该子集共同优化知识获取与保留。具体来说,我们引入了一个Fisher路由专家评分(FRES)模块,通过基于Fisher的稳定性代价和基于梯度的可塑性增益来估计专家重要性。然后,我们设计了一个自适应专家选择(AES)模块,通过量化边际贡献来自适应确定专家子集。最后,通过路由感知正则化(RAR),我们实现了负载均衡和高效的FL训练。我们从理论上证明了$\mathcal{O}(T^{-1})$的收敛速率。在多个基准上与最先进方法的广泛实验证明了\textsc{FedFMX}的优越性。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:29

# 用于联邦类增量学习的 Fisher-Routed MoE 框架

来源: arXiv:2606.28835 [查看原始论文](https://arxiv.org/html/2606.28835)

11 机构: 香港大学电气与电子工程系, 香港特别行政区, 中国  
22 机构: 中山大学人工智能学院, 中国  
邮箱: [email protected], [email protected]

###### 摘要

联邦学习 (FL) 已成为一种极具前景的分布式机器学习范式。然而,将 FL 扩展到类增量学习场景会引入独特的挑战:1) 共享模型过载导致的容量冲突与灾难性遗忘;2) 非独立同分布 (Non-IID) 数据带来的异质性;3) 同步类别错位。本文提出 **FedFMX**(用于联邦类增量学习的 Fisher-Routed MoE 框架),这是一个通过跨客户端自适应专家专业化来解决这些挑战的新颖框架。其关键洞察在于:将每个样本路由到一个专家子集,该子集共同优化知识获取与保留。具体来说,我们引入了 Fisher-Routed 专家评分 (FRES) 模块,通过基于 Fisher 的稳定性代价和基于梯度的可塑性增益来估计专家重要性。然后,我们设计了一个自适应专家选择 (AES) 模块,通过量化边际贡献来动态确定专家子集。最后,通过路由感知正则化 (RAR),我们实现了负载均衡和高效的 FL 训练。我们从理论上证明了 O(T⁻¹) 的收敛速率。在多个基准数据集上与最先进方法的广泛实验验证了 FedFMX 的优越性。

## 1 引言

联邦学习 (FL) [McMahan 2017, Kairouz 2021, Li 2020, Fan 2025] 已成为一种极具前景的分布式学习范式,它使得多个地理上分散的客户端能够在不暴露原始数据的情况下共同学习一个共享的全局模型。然而,传统的 FL 方法通常假设标签分布在训练过程中保持静态和一致 [Zhang 2025, Liang 2025],这在现实应用中很少成立 [Feng 2025, Geng 2020, Yang 2024]。实际上,由于动态环境,客户端数据分布会发生变化,客户端会不断接收到含有此前未见类别的新类别数据 [Dong 2022, Shi 2021],从而使得上述理想假设失效。此外,由于客户端通常资源受限(存储和计算能力有限)[Li 2025],保持完整的历史数据是不可行的,这加剧了灾难性遗忘的风险 [Babakniya 2023, Yu 2024]。

为了克服静态标签分布假设的局限性,近期的研究工作推动了联邦类增量学习 (FCIL) 范式的发展 [Feng 2025, Dong 2023],使客户端能够在协作更新全局模型的同时增量学习新类别 [Liang 2025]。然而,联邦范式与增量范式的交叉引入了几个内在且关键性的挑战 [Dong 2022, Zhang 2025]:(i) **容量冲突与灾难性遗忘**:由于共享的全局模型被异质性数据增量式地过载,学习到的表征被覆盖,导致灾难性遗忘和泛化性能下降 [You 2025, Ke 2025];(ii) **统计异质性**:客户端拥有动态演化的 Non-IID 数据,导致梯度方向不一致和局部更新有偏,损害全局收敛 [Guo 2024, Gao 2024];(iii) **同步类别错位**:客户端在不同阶段遇到新引入的类别,导致标签空间的时间不一致,加剧模型漂移 [Zhang 2025, Guan 2025]。

为了缓解 FCIL 中的灾难性遗忘,先前的工作采用了全局正则化、记忆重放或免重放技术 [Dong 2022, Yu 2024, Sun 2025]。然而,这些方法默认全局模型是一个单一整体,缺乏精细的机制来调节稳定性与可塑性,这在需要跨模型参数进行差异化处理的异质性场景中尤为突出。基于这些分析,我们提出**关键问题 I**:如何在 FCIL 中平衡稳定性与可塑性,使得全局模型既能保留先验知识,又能适应跨异质性客户端的增量涌现类别?

另一个根本性挑战来自于统计异质性与时间类别漂移的复合效应。客户端在不同阶段动态地接收到新类别,导致了**同步类别错位**问题——客户端间类别分布的语义不一致会损害收敛稳定性和泛化能力 [Dong 2022, Yu 2024, Zhang 2025]。尽管最近的工作引入了个性化方法来缓解异质性 [Yi 2026],但忽略基于客户端演化任务特征的自定义协作,限制了可扩展性。因此,我们提出**关键问题 II**:在客户端异质性和时间上分散的类别更新下,如何实现稳定有效的协作,确保鲁棒且高效的训练?

为了解决这些问题,我们提出了一种新颖的解决方案:**用于联邦类增量学习的 Fisher-Routed MoE 框架 (FedFMX)**,它引入了专家模块化以及自适应激活和路由,以解耦演化和异质的客户端动态。针对问题 I,我们在 §3.2 中设计了一个 **Fisher-Routed 专家评分 (FRES)** 模块,通过 Fisher 信息量化每个专家的稳定性代价和可塑性增益来估计其适用性,从而实现上下文感知的路由。针对问题 II,我们在 §3.3 中引入了一个**自适应专家选择 (AES)** 模块,该模块将专家子集选择形式化为一个协作博弈,并通过对稳定性-可塑性权衡的边际贡献来动态激活专家。为了增强路由鲁棒性并缓解专家利用偏颇,我们在 §3.4 中提出了一种**路由感知正则化 (RAR)** 方案。我们的主要贡献总结如下:

- 我们识别了 FCIL 中的显著挑战,并提出了 **FedFMX**,通过将每个样本路由到一个动态的专家子集来缓解灾难性遗忘和异质性,实现了细粒度的专业化和鲁棒的知识整合。
- 我们设计了 FRES 模块,通过稳定性-可塑性权衡来量化专家适用性,评估每个专家的边际贡献并确定自适应专家子集,从而实现跨时间错位类别的有效专家协作。通过 RAR 策略,我们促进了稳定且公平的专家利用。
- 在 CIFAR-10、CIFAR-100 [Krizhevsky 2009] 和 Tiny-ImageNet [Le 2015] 数据集上的大量实验验证了 FedFMX 的有效性,显示出相对于最先进方法的一致提升。

## 2 相关工作

### 2.1 联邦类增量学习

联邦类增量学习 (FCIL) [Dong 2022] 将 FL 范式扩展到持续学习,在增量获取新类别时进行训练 [Gao 2024, Li 2024],这带来了关键挑战,例如异步任务到达 [Zhang 2025, Ke 2025, Li 2025] 和 Non-IID 数据 [Wang 2024, Liang 2025],导致灾难性遗忘和不平衡更新 [Yu 2024, You 2025, Feng 2025]。为了解决这些问题,人们提出了基于正则化的方法 [Feng 2025, Tan 2024] 来约束更新以保留先前获取的知识。例如,CGoFed [Feng 2025] 和 LGA [Dong 2023] 包含了组感知正则化以缓解灾难性遗忘。同时,许多方法采用基于重放的策略 [Li 2025, Ke 2025, Sun 2025, Nori 2025] 来维护本地记忆缓冲区或合成生成器以重放过去的样本。相比之下,免重放方法 [Sun 2025, Li 2025, He 2025] 通过依赖参数隔离或提示调优来消除记忆存储以保留先验知识。个性化 [Wu 2025, Liu 2025] 和自适应 [Yu 2025, Zhong 2025] 方法通过任务相关的模型自适应 [Li 2025] 或动态聚合 [Nori 2025] 来解决异质性。pFedMxF [Zhang 2025] 和 SpaPFCIL [Zhong 2025] 通过选择性地结合本地适应与全局协调来平衡个性化和任务连续性。然而,现有的大多数 FCIL 方法依赖于传统的朴素参数聚合策略,倾向于覆盖先前类别的知识边界,导致跨阶段和跨客户端的性能不稳定。

### 2.2 基于 MoE 的联邦学习

混合专家 (MoE) [Yuksel 2012, Zhou 2022, Masoudnia 2014] 已成为一种强大的架构,用于解决 FL 中客户端异质性和可扩展性的挑战 [Feng 2025, Yi 2024, Zhuang 2025, Xie 2025],它通过专家模块化和任务路由增强了模型容量 [Mei 2024, Liang 2025]。然而,将 MoE 集成到 FL 中引入了独特的挑战,例如无法适应异质性客户端和演化任务 [Chen 2025],以及主导专家负载不均衡 [Chi 2022, Qiu 2025]。为了解决这些问题,最近的研究探索了基于 MoE 的聚合 [Mei 2024, Zhan 2024],其采用全局共享的专家池,每个客户端或任务激活。动态路由和增强的门控方法 [Miao 2025, Farhat 2025, Radwan 2025] 根据梯度或奖励反馈选择专家。个性化 MoE 结构 [Zhuang 2025, Yi 2024, Feng 2025] 提供客户端特定的子专家集以增强专业化。尽管取得了这些进展,现有的基于 MoE 的方法未能调和类增量设置中的适应性与知识保留,也无法适应异步任务到达,这促使需要一个能够动态路由知识而不损害先前获取表征的框架。

参考图例

图 1: 所提出的 FedFMX 框架的概述图。

## 3 方法论

在本节中,我们详细介绍 FedFMX 的方法论。我们从 §3.1 中 FCIL 的预备知识开始,并在 §3.2 中详细阐述 FRES 模块设计。我们在 §3.3 中描述带有边际贡献度量的 AES 模块。最后,我们在 §3.4 中介绍路由感知正则化。整体框架如图 1 所示。

### 3.1 预备知识

我们将标准的类增量学习 (CIL) 扩展到联邦设置。给定 N 个分布式客户端协作地增量式训练一个共享的全局模型,每个客户端 i ∈ I = {1, ..., N} 接收到一系列流式任务 {T_i^(t)}_{t=1}^T,其中 T_i^(t) = {X_i^(t), Y_i^(t)} 引出本地数据集 D_i^(t) = {(x_{i,j}^(t), y_{i,j}^(t))}_{j=1}^{n_i^(t)},这里 n_i^(t) = |D_i^(t)|,输入样本 x_{i,j}^(t) ∈ X 和标签 y_{i,j}^(t) ∈ Y_i^(t) ⊆ Y,使得不同任务中不同阶段的每个客户端的标签是不相交的,即 Y_i^(t) ∩ Y_i^(t′) = ∅ 对于 t ≠ t′。对于每个客户端 i,当在 D_i^(t) 上训练时,之前任务 {T_i^(k)}_{k=1}^{t-1} 的数据是不可访问的。令 f(·; w) 表示全局模型。优化目标可以描述为:

min_w 1/D ∑_{t=1}^T ∑_{i=1}^N ∑_{j=1}^{n_i^(t)} L(f(x_{i,j}^(t); w), y_{i,j}^(t)),   (1)

其中 D = ∑_{t=1}^T ∑_{i=1}^N n_i^(t),L 表示任务损失。

### 3.2 Fisher-Routed 专家评分设计

在 FCIL 中,Non-IID 数据和跨客户端的异步类别到达加剧了灾难性遗忘和梯度干扰。来自各种任务的梯度在共享的参数空间中纠缠在一起,限制了表征能力。为了缓解此类冲突,我们将模型分解为一个共享骨干和多个专家特定的参数子空间,从而实现基于路由的优化。注意,专家子空间并非静态地绑定到特定客户端或类别;相反,它们在样本级别被动态激活,从而促进跨任务的自适应和协作知识分配。然而,仅基于损失或固定的 Top-K 门控的路由可能导致过度专业化并加剧遗忘。为了解决这个问题,我们提出了一种 **Fisher-Routed 专家评分 (FRES)** 模块,该模块将路由构建为稳定性-可塑性的权衡。对于每个输入样本,FRES 构造了一个 Fisher 知情适用性分数,该分数联合评估了**可塑性增益**(反映专家吸收新信息的能力)和**稳定性代价**(量化破坏与先前任务相关的曲率敏感方向的风险)。

具体而言,我们通过将参数分解为一个共享骨干 f_θ 和 K 个专家特定子空间 {Θ_k}_{k=1}^K 来实例化分解,其中每个 Θ_k 包含一个专用主体 E_{φ_k} 和一个分类头 W_{ψ_k},形成独立的适应通道,而不是仅仅附加个性化的头部。给定任意输入样本 x,专家 k 产生 logits h_k(x) = W_{ψ_k}(E_{φ_k}(f_θ(x))),损失 ℓ_k(x,y) = CE(h_k(x), y) [Shazeer 2017, Mu 2025]。我们通过经验 Fisher 信息矩阵 E[g_k g_k^⊤] 近似参数重要性,其中 g_k = ∇_{ψ_k} ℓ_k(x,y),这捕获了每个专家子空间的局部曲率。与将 Fisher 统计量用作更新正则化器的经典整合方法不同 [Tan 2026, Kirkpatrick 2017],我们将其用作更新前的路由准则,以评估传入梯度与专家子空间之间的兼容性。为了提高效率,我们采用**对角近似**并维护一个平方梯度的**指数移动平均**,如下所示:

F_k ← ρ F_k +

相似文章