OmniISR: 一种通过中间监督与正则化实现集中式与联邦学习的统一框架

arXiv cs.LG 论文

摘要

OmniISR提出了一种统一框架,通过在隐藏层引入中间监督与正则化,将集中式学习和联邦学习相结合,提供了理论收敛保证,并将CL-FL差距缩小了22.60%。

arXiv:2605.20276v1 Announce Type: new Abstract: 边缘智能的全球部署运行在异构的法律框架下。虽然一些地区允许通过云端数据聚合进行集中式学习(CL),但其他地区则强制实施严格的数据本地化,从而需要联邦学习(FL)。这种操作上的二分法引入了两种不兼容的优化机制(即CL中无偏的全局梯度但伴随内部协变量偏移,与FL中有偏且易于漂移的局部更新),导致任何简单的两者融合都缺乏严格的理论保证。为填补这一空白,我们提出了OmniISR,这是一个统一框架,通过在多个隐藏层配备中间监督与正则化(ISR)信号,融合了纯CL、纯FL以及混合CL-FL训练模式。具体来说,我们提出:(i) 使用互信息(MI)作为中间监督,以对齐CL中变化的内部协变量和FL中客户端漂移的表征;(ii) 采用负熵(NE)作为中间正则化项,惩罚过度自信的预测,保持表征不确定性,并避免设备特定的坍缩。在理论方面,我们推导出:(i) 一个统一的、与ISR无关且非渐近的 O(1/sqrt(T)) 收敛界,表明所引入的ISR不会破坏标准SGD的收敛性;(ii) 一个联邦漂移界,量化了ISR减少的客户端漂移;(iii) 一个梯度对齐保证,确保在温和偏差下CL和FL更新不会冲突;(iv) 一个显式的逃逸时间界,表明CL-FL混合增大了有效随机性并加速了从严格鞍点逃逸。大量实验表明,OmniISR在集中式和联邦范式中均能持续提升模型性能,将CL-FL差距缩小22.60%,并在多个FL算法上取得了37/48的配对指标胜利。
查看原文
查看缓存全文

缓存时间: 2026/05/21 06:21

# OmniISR:通过中间监督与正则化实现集中式与联邦学习的统一框架

来源:https://arxiv.org/html/2605.20276

Wei-Bin Kou, Guangxu Zhu, Ming Tang, Chen Zhang, Lisheng Wu, Lei Zhou, Yujiu Yang*

Wei-Bin Kou 和 Yujiu Yang 就职于清华大学深圳国际研究生院,中国深圳。Guangxu Zhu 就职于深圳大数据研究院,中国深圳。Ming Tang 就职于南方科技大学计算机科学与工程系,中国深圳。Chen Zhang 就职于香港大学电机电子工程系,中国香港。Lisheng Wu 和 Lei Zhou 就职于银网智能科技有限公司,中国深圳。通讯作者:Yujiu Yang。

###### 摘要

边缘智能(如自动驾驶)的全球部署跨越了不同的法律框架。一些地区允许通过云端数据聚合进行集中式学习(CL),而另一些地区则强制执行严格的数据本地化,从而需要联邦学习(FL)。这种运行二元性导致了两种根本不相容的优化机制(即CL中无偏的全局梯度但与内部协变量偏移耦合并存,与FL中有偏的、易发生漂移的局部更新),这使得任何两者间的简单集成都缺乏严格的理论保证。为填补这一空白,我们提出了OmniISR,一个通过在多个隐藏层配备中间监督与正则化(ISR)信号来融合纯CL、纯FL以及混合CL-FL训练模式的统一框架。具体地,我们提出 (i) 使用互信息(MI)作为中间监督,以对齐CL中偏移的内部协变量和FL中客户端漂移的表征,以及 (ii) 采用负熵(NE)作为中间正则化器,以惩罚过度自信的预测、保持表征的不确定性,并避免设备特定的崩塌。在理论方面,我们推导出 (i) 一个统一的、与ISR无关的、非渐近的O(1/√T)收敛界,表明引入的ISR不会违反标准SGD收敛;(ii) 一个联邦漂界,量化了ISR减少的客户端漂移;(iii) 一个梯度对齐保证,确保在温和偏差下CL和FL更新非冲突;(iv) 一个明确的逃逸时间界,表明CL-FL混合扩大了有效随机性并加速了从严格鞍点的逃逸。跨多种模型架构、数据集和FL算法的大量实验表明,OmniISR在集中式和联邦范式下均持续提升模型性能,将CL-FL差距缩小22.60%,并在跨多种FL算法的配对指标比较中取得37/48胜。

###### 索引词:统一学习框架,理论保证,中间监督,中间正则化,联邦客户端漂移控制,鞍点逃逸时间界,ε-平稳性复杂度分析

## 1 引言

边缘智能的出现彻底改变了大规模分布式系统,其中自动驾驶(AD)是首要应用[1,2,3]。为了持续优化AD模型,AD车队需要收集大量的驾驶数据。然而,数据收集日益受到不同数据治理和隐私法规的约束。在某些司法管辖区,数据可以在云端聚合用于集中式学习(CL)。相反,在受严格隐私框架(例如欧盟的通用数据保护条例GDPR和中国的数据安全法)约束的地区,原始数据被归类为敏感信息,严格禁止跨设备或跨境传输。在这些监管领域,联邦学习(FL)[4,5,6]成为模型增强的法律合规方法。因此,全球部署的边缘智能系统必须在兼容的训练范式下运行。这需要一个统一的优化框架,能够无缝集成CL和FL,确保在多样化的国际市场中模型性能的一致性和鲁棒性。

然而,构建这样一个统一框架绝非易事。这两种范式在数据分布和优化动态方面根本不同。在没有原则性协调的情况下,简单地在集中式和联邦式更新之间交替无法提供收敛保证,并且可能引入病态的梯度干扰。严格统一必须面对贯穿学习过程理论和结构维度的三个深刻交织的挑战。

首先,CL和FL之间根本不同的优化动态阻碍了统一训练。在纯CL中,数据通常被假设为独立同分布(IID),允许优化器(如Adam、SGD)沿着损失曲面平滑下降。相比之下,边缘场景中的FL以高度非IID数据分布[7,8]和系统异构性(如掉队者)[9,10,11]为特征。制定统一机制需要严格回答:我们如何在数学上保证跨越这些截然不同的优化曲面的收敛?此外,必须证明来自集中式数据的精确梯度不会与来自联邦客户端的聚合伪梯度发生“梯度冲突”,而是协同工作以加速逃离局部最优。

参照图注
图1:提出的OmniISR框架中中间监督与正则化的机制概览。

其次,非IID数据加剧了FL中分布式客户端间潜在表征的独立漂移[12]。在深度学习架构中,监督仅应用于输出层。虽然这种单点监督对于集中式IID数据足够,但在联邦非IID上下文中,缺乏对隐藏层的显式约束导致不同客户端的潜在特征独立漂移。这种表征漂移严重降低了聚合全局模型的性能,而仅限输出层的监督在数学上无法解决这个问题。

第三,仅靠中间监督会损害泛化能力。针对表征漂移的一个看似直观的解决方案是在中间层引入监督以锚定隐藏特征。然而,强制执行严格的中间监督会迫使隐藏表征变得高度场景或任务相关。这种确定性特征对齐降低了模型的灵活性,使其过拟合于训练客户端的特定分布,并急剧降低其在未见场景中的泛化能力。

为了系统地解决这三个挑战,我们提出了OmniISR,一个为边缘智能设计的统一训练框架,可在纯CL、纯FL和混合CL-FL范式中无缝运行。OmniISR的核心设计原则是,部署在异构分布上的深度网络需要在隐藏层而非仅在输出层获得显式的、多样化的指导。具体地,OmniISR体现了包含以下三个整体策略的中间监督与正则化(ISR)机制。

1. 1. 架构无关的中间层选择:我们基于架构无关的标准(例如块之间的过渡层,如ResNet阶段或Transformer层、下采样层、瓶颈层或特征融合层)在网络中选择多个ISR层,确保适用于基于CNN、基于Transformer和混合架构,无需特定于架构的重新设计。
2. 2. 中间层的异构监督:在每个选定的中间点,OmniISR计算潜在特征与真实标签之间的互信息(MI),将其作为不同于输出层交叉嫡目标的异构监督信号。通过最大化隐藏表示与任务标签之间的共享信息,MI监督引导中间层学习具有判别性且层次多样化的特征,有效约束表征漂移而不损害学习过早的隐藏特征。
3. 3. 中间激活的负熵(NE)正则化:OmniISR在每个选定的中间层对潜在激活分布施加NE正则化,明确惩罚尖峰、过度自信的隐藏特征,并注入必要的不确定性,显著增强其对未见场景的泛化能力。

这三个整体策略在图1中说明。

参照图注
图2:提出的OmniISR框架的三种模式说明。

提出的OmniISR在三种模式下运行上述ISR机制:纯CL、纯FL和混合CL-FL。在CL模式下,所有中间损失和正则化器与输出层损失组合成一个单一目标,并优化至收敛。在FL模式下,训练在多个通信轮次上进行。在每个轮次内,每个客户端首先在其私有数据上最小化中间损失、正则化器和最终损失的加权组合,进行若干次本地迭代,之后中央服务器聚合所有参与者的更新后的本地模型,而不暴露原始数据。在混合CL-FL模式下,每次更新通过混合权重将精确云梯度与联邦伪梯度混合,通过三种策略之一进行调度:在纯CL轮次和FL轮次之间交替、固定混合比、或基于梯度相似性调整的自适应权重。除了利用更大的数据量外,这种混合过程结合了集中式和联邦噪声源,增加了有效随机性,从而帮助模型逃离鞍点并更有效地探索损失曲面。这三种模式在图2中说明。

在理论方面,我们为OmniISR在CL、FL和混合模式下推导出一个统一的、与ISR无关的、非渐近的O(1/√T)收敛界,证明OmniISR保持了标准的非凸SGD速率。我们的分析明确刻画了有限时间常数如何随中间点数量M及其相关权重{α_m, λ_m}_{m=1}^{M}缩放。在FL设置中,我们建立了一个O(E²H)漂移界,其中E表示本地轮次,H量化非IID数据异质性,并证明ISR通过稳定隐藏表征减少了有效客户端漂移。对于混合模式,该界分离了由云-设备表征性差距引起的显式偏差基底B_eff,以及由混合噪声源导致的有效方差σ²_eff。此外,我们证明了在集中式和联邦数据分布重叠的温和假设下,CL和FL梯度满足E[⟨g_CL, g_FL⟩] ≥ 0。这证实了两个梯度源合作以逃离局部最优,为混合范式训练提供了首个形式化理由。最终,这些理论保证将超参数(如M、E和混合权重α)转化为稳定统一训练的可操作设计原则。

总之,本工作的主要贡献如下:

- • 我们提出了OmniISR,一个在单一目标下用于CL、FL和混合CL-FL训练的统一优化框架,具有架构无关的ISR引入。这直接针对训练模式因区域政策而异的实际部署。
- • 我们引入了一个耦合的中间设计,结合了异构MI监督(而非输出层CE的复制)和NE正则化。这种耦合旨在联合解决非IID训练中的两个竞争性需求:抑制表征漂移和保持泛化能力。
- • 理论上,我们证明了 (i) OmniISR 保证无论工作模式如何,ISR 不违反 SGD 收敛;(ii) OmniISR 减少了异质性引起的客户端漂移;(iii) 云和设备混合更新协同而非破坏性工作;(iv) 混合CL-FL的组合随机性加速了逃离次优鞍点。
- • 实证上,我们在多种模型架构、数据集和FL算法上评估了OmniISR。除了绝对收益外,OmniISR将CL-FL性能差距缩小了22.60%,在配对比较中显示出广泛的跨FL算法正向迁移能力,37/48 指标胜出,并通过全面的消融实验阐明了中间点数量、间距和位置对OmniISR有效性的影响。

本文的其余部分组织如下。第2节回顾相关工作。第3节详细描述提出的OmniISR及其理论保证。第4节展示实验和消融研究。第5节总结全文。

## 2 相关工作

### 2.1 集中式学习优化

集中式学习(CL)优化包含一套在高维参数空间上最小化损失函数的广泛算法。随机梯度下降(SGD)和反向传播奠定了基础[13],而自适应方法如Adam[14]和RMSprop提供了自适应学习率,提高了跨架构的收敛稳定性。正则化策略,包括dropout[15]、L1/L2惩罚[16]和锐度感知最小化[17],对于防止过拟合和确保鲁棒泛化至关重要。归一化技术如批量归一化[18]和层归一化[19]进一步稳定了训练动态。尽管取得了这些进展,训练非常深的网络仍然面临梯度逐渐减弱[20,21]和中间特征优化不足[22]的问题,特别是当监督仅应用于输出层时。这激发了中间监督的研究,接下来讨论。

### 2.2 联邦学习优化

联邦学习(FL)[23,24,25]作为一种隐私保护范式出现,其核心目标是优化一个全局模型而无需跨设备传输原始数据。在FL中,每个客户端使用其本地数据执行几步SGD更新,之后服务器聚合客户端模型(通常是平均参数)以形成新的全局模型。重复此过程直至收敛。标准算法FedAvg[4]在多个本地步骤后对模型参数进行平均,从经验上表现良好,但其收敛性仅在强假设下得到证明[26,27]。后续工作通过引入服务器端动量[28]、自适应学习率[29]和二阶方法[30]改进了FedAvg。许多变体也考虑了客户端异质性,如FedProx[7]添加近端项以约束本地更新,以及SCAFFOLD[31]使用方差减少来纠正客户端漂移。然而,这些FL方法仍然仅依赖于输出层监督,在高度非IID设置中无法完全缓解表征漂移。

相似文章

迈向LLM的下一个前沿:私有数据训练——联邦微调的跨域基准

arXiv cs.LG

本文提出了一个在私有数据上对大型语言模型进行联邦微调的跨域基准,评估了LoRA、QLoRA和IA3策略在医疗和金融数据集上的表现。结果表明,联邦微调接近集中式训练的性能,并优于孤立学习,证明了在数据无法共享时通过联邦微调适配LLM的可行性。