面向物联网降雨预测的联邦分裂学习中的自适应联合压缩与同步
摘要
本文提出了一种面向联邦分裂学习的自适应联合压缩与同步机制,用于减少物联网降雨预测中的通信开销,在不显著损失预测质量的前提下实现了显著的流量减少。
arXiv:2606.25003v1 Announce Type: new
摘要:联邦分裂学习(FSL)使得在带宽受限的物联网设备间进行协作训练成为可能,但反复的激活和梯度交换造成了通信瓶颈。先前的工作分别优化激活压缩或同步频率。本文提出了一种面向物联网降雨预测的FSL框架,通过服务器上的延迟驱动调度器结合每客户端EMA平滑,联合调节激活压缩和同步间隔ρ。该系统基于11个气象站的小时级ERA5数据,通过17场景仿真矩阵和四场景的树莓派(Raspberry Pi)实际广域网部署进行评估。仿真矩阵验证了调度器在低、高和混合延迟场景下的切换性能,而树莓派部署验证了相同策略选择的高延迟端点。AUPRC在不同配置间变化很小(模拟中0.6381-0.6484;树莓派上变化在0.011以内),表明在此场景下,激进的量化和更稀疏的聚合并未实质性降低预测质量。在树莓派上,所选端点(int8且ρ=3)相比float32基线,激活上传负载减少了87%,同步流量减少了54%,同时运行时抖动从±688秒降低到±10秒。
查看缓存全文
缓存时间: 2026/06/25 05:11
# 面向物联网降雨预测的自适应联合压缩与同步的联邦分割学习
来源:https://arxiv.org/html/2606.25003
Wenjie Ding, Yi Sin Lin, Jiale Liu, Baoyi Liu, Guanghua Liu, Zhuolu Li, Suleiman Sabo, Chuadhry Mujeeb Ahmed, Aydin Abadi, Rehmat Ullah, Rajiv Ranjan
###### 摘要
联邦分割学习(FSL)能够在带宽受限的物联网设备上实现协作训练,但反复的激活和梯度交换造成了通信瓶颈。已有工作要么单独优化激活压缩,要么单独优化同步频率。本文提出一种面向物联网降雨预测的FSL框架,通过服务器上的延迟驱动调度器(结合每客户端EMA平滑)联合调节激活压缩和同步间隔ρ。该系统在11个气象站每小时的ERA5数据上进行了评估,采用包含17种场景的仿真矩阵以及在实际广域链路上基于树莓派的四种场景部署。仿真矩阵验证了调度器在低延迟、高延迟和混合延迟配置下的切换能力,而树莓派部署则验证了同一策略选出的高延迟端点。AUPRC在各配置间变化很小(仿真中0.6381–0.6484;树莓派上变化幅度在0.011以内),表明在此场景下激进的量化和更稀疏的聚合并不会显著降低预测质量。在树莓派上,所选端点(int8且ρ=3)相比float32基线减少了87%的激活上传负载和54%的同步流量,同时将运行时抖动从±688秒降至±10秒。
## I. 引言
物联网传感网络广泛应用于智慧城市和环境监测,产生大量时间序列观测数据,例如降雨量、温度和湿度[1,2],支持数据驱动的降雨预测[3,4]。然而,传统的集中式机器学习需要将原始数据频繁传输到云服务器,这引发隐私担忧,并在带宽受限的物联网环境中带来高通信开销[5,6]。联邦学习(FL)和联邦分割学习(FSL)作为分布式范式,能够在无需共享原始数据的情况下实现协作训练[5,7,8],但FSL本身引入了通信瓶颈,因为客户端在训练期间反复传输中间激活并接收梯度[8,7]。这种开销主要由两个耦合因素决定:激活负载大小和客户端-服务器同步频率。每个因素都决定了通信成本与模型保真度或收敛性之间的权衡。现有方法通常独立处理这些因素[9,10],在多节点FSL系统中联合自适应控制的有效性尚未得到充分探索。为填补这一空白,我们提出一种面向物联网降雨预测的FSL框架,探索通信效率与预测性能之间的权衡,并配备自适应机制,根据运行时延迟信号联合调整压缩和同步间隔。仿真场景在受控的异构条件下评估运行时切换,而树莓派部署则在真实设备上测试同一策略选出的高延迟端点。本工作的主要贡献总结如下:
1. 一种面向降雨预测的通信高效联邦分割学习框架,使用分布式物联网气象数据。
2. 一种联合优化方法,结合激活压缩与可调同步间隔,减少激活上传负载和服务器聚合工作量。
3. 一种自适应调度机制,根据运行时延迟信号调整通信参数,并在真实硬件上验证所选高延迟端点。
4. 实验评估分析了通信效率、端到端运行时间和预测性能之间的权衡。
## II. 相关工作
### II-A. 通信高效的联邦分割学习
在FL中,通信主要来自客户端与服务器之间模型更新的重复交换。FedAvg通过在聚合之前执行多个本地SGD轮次来减少这种开销,从而减少通信轮数[5]。联邦分割学习(FSL)中的通信有所不同:客户端传输中间激活(也称为压缩数据)并在反向传播期间接收其梯度[8,7]。由于成本取决于切分层、激活形状和批量大小,面向FL的压缩方法不能总是直接应用于FSL。近期研究探索了用于SL和SplitFed系统的通信高效压缩。SplitFedZip引入了用于SplitFed学习中特征和梯度的学习率失真压缩[9]。SL-ACC通过利用熵估计通道重要性实现自适应逐通道量化[10],而SL-FAC则使用频率分解和基于频率的量化来保留重要的频谱分量[11]。这些方法表明,压缩数据压缩可以减少通信开销,但它们主要关注压缩本身,而非在运行时联合控制压缩和同步频率。
### II-B. 自适应调度与系统级优化
除了激活压缩,另一个重要方向是FSL中的系统级通信控制。一些研究通过联合考虑模型划分、通信资源和计算资源来降低整体训练成本。例如,Liang等人[12]提出了一种联合切割点选择、通信分配和计算分配策略,以平衡收敛性、延迟、隐私和资源约束。然而,这类工作主要关注资源管理和分割点优化,而当激活高维时,频繁交换压缩激活和梯度仍可能主导训练成本。另一个相关方向是动态激活传输控制。SplitCom[13]利用大语言模型分割联邦微调中激活的时间冗余,并通过自适应阈值控制决定是上传新激活还是重用缓存。这减少了激活传输频率,但专注于大语言模型微调,而非多节点物联网时间序列学习,且未联合调整压缩级别和同步间隔。Zhang等人[14]提出了一种轻量级FedSL方案,包括客户端模型剪枝、梯度量化、激活丢弃和周期性聚合。他们推导了一个收敛上界,刻画了剪枝率、量化精度、聚合间隔和分割层选择的联合效应。他们的结果表明,更频繁的聚合(更小的I)有助于收敛,因为剪枝和量化充当隐式正则化器,其效果在I=1时最好。然而,聚合间隔在训练前固定,不随运行时条件变化,且评估主要基于仿真。总体而言,现有研究要么优化资源分配,要么减少激活传输频率,要么分析固定聚合间隔。在实际多节点物联网FSL系统中,联合运行时控制激活压缩和同步间隔的工作仍然有限。
### II-C. 物联网环境中的降雨预测机器学习
机器学习已广泛用于使用物联网数据的降雨预测和环境感知[15]。然而,由于时间变化性和降雨量的偏态分布(强降雨事件远少于小雨或中雨),降雨预测仍然困难。许多研究关注准确性,而未考虑通信成本、设备异构性或在FSL下的分布式训练约束。
## III. 方法论
### III-A. 系统概述
所提出的FSL系统包括11个边缘客户端和一个中央服务器,它们通过gRPC进行通信。四个RPC定义了训练生命周期:Register用于客户端标识,Forward用于每步激活交换,Synchronize用于每ρ个本地轮次后的FedAvg聚合,以及NotifyCompletion用于终止。在每次Forward调用中,客户端发送压缩的压缩激活并报告延迟;服务器计算损失,在服务器头部执行反向传播,并返回切割层梯度以及调度指令。通信控制位于服务器端,因此Forward响应中的策略变化能够一致地传播,而无需客户端侧的调度决策。
参见图说明
图1:FSL系统架构:服务器协调器带有自适应调度器和服务器端模型;边缘客户端带有编码器、压缩模块和延迟分析器。
### III-B. 分割模型设计
分割模型遵循编码器-预测器分解:客户端模块产生固定大小的压缩激活,服务器端模块完成预测。
#### III-B1. 客户端编码器
客户端ClientLSTM是一个两层LSTM,将每个输入窗口(形状为(batch,48,5),表示48小时步长的5个气象特征)映射为固定大小的压缩激活(形状为(batch,64))。64维输出是经过刻意设计的:在float32表示下,每个激活向量正好占用64×4=256字节,使得每步激活上传负载完全确定。
#### III-B2. 服务器端预测头部
服务器端ServerHead是一个两分支MLP,接收64维压缩激活,联合输出降雨事件分类器和辅助降雨量回归输出。辅助回归损失仅应用于具有正降雨标签的样本,以在大降雨量(回归目标的偏态分布,与近乎平衡的事件标签不同)的长尾上正则化共享表示。这种双头部设计增加了服务器端计算量,但不改变传输的激活。
### III-C. 训练协议
训练协议在两个层面运行:在III-A节中描述的每步Forward RPC流程,以及一个用于全局聚合的每轮外部循环。一个本地轮次包括10个本地优化步骤,ρ控制同步检查之间的本地轮次数。在每个本地轮次结束时,客户端评估条件:
(e+1) mod ρ_current = 0, (1)
其中e是零索引的轮次计数器。如果满足条件,客户端发起Synchronize RPC,发送其本地编码器权重、这些权重所基于的全局模型轮次以及自上次刷新以来完成的本地轮次数。服务器维护一个基于超时的聚合屏障。在报告的实验中,法定人数是所有11个活跃客户端,因此静态策略通常表现为严格的同步FedAvg。然而,实现不会无限等待:一旦屏障窗口过期,服务器聚合当前为该轮缓冲的更新,并立即广播生成的全局编码器。在此超时后到达的客户端接收最新的全局权重;只有当其更新所依据的基础轮次在有限的陈旧度窗口内时,才接受该更新,否则仅作为刷新同步处理。这对于联合自适应场景很重要,因为不同客户端可能同时以不同的ρ值运行,因此提交可能引用更早的服务器轮次。对于每个接受的更新,聚合采用陈旧度折扣的本地轮次加权FedAvg:
w_i = e_i / (1 + s_i), (2)
其中e_i是客户端完成的本地轮次数,s_i是其陈旧度;超过S_max的更新被拒绝,客户端仅刷新到最新全局编码器。当S_max=0时,这退化为标准本地轮次加权FedAvg,Li等人已证明其在有界梯度方差下的非独立同分布收敛性[16];当S_max>0时,该协议共享Nguyen等人分析的缓冲异步聚合中有限陈旧度设置[17];我们在自适应场景中使用S_max=3以吸收最多三轮由ρ引起的漂移。两个调度器输出以不同粒度应用:压缩模式立即在下一次前向步骤生效,而更新后的ρ仅影响下一个轮次边界处的同步检查,因为在轮次中间更改聚合计划会破坏屏障一致性保证。
### III-D. 压缩模式
三种压缩模式对称地应用于每次Forward RPC的两个张量方向:float32(32位IEEE 754,每个64维激活256字节)、float16(16位半精度,128字节)和int8(8位均匀量化,带4字节缩放因子,68字节)。对称应用意味着服务器返回给客户端的切割层梯度使用与激活上传相同的模式。本文报告的负载指标计算上传的压缩激活。由于返回的切割层梯度具有相同的形状和编码,一次前向和后向步骤的双向张量负载大约是报告激活上传值的两倍,不包括RPC帧开销。
### III-E. 自适应调度器
自适应调度器运行在服务器端,在每个前向步骤调整压缩模式和同步间隔ρ。每个客户端的延迟通过EMA独立跟踪:
l̂_t = { l_t 如果 l̂_{t-1}=0; α l_t + (1-α) l̂_{t-1} 否则 } (3)
平滑因子α=0.2。EMA仅在报告的延迟l_t>0时更新,对于报告零延迟的客户端(例如,无分析器场景),状态保持不变;第一个有效观测值用于初始化估计,以避免从零初始化的EMA产生的冷启动偏差。每客户端跟踪确保异构网络条件不会掩盖个别落后节点。平滑后的延迟通过三级规则映射到压缩模式:
模式 = { float32 如果 l̂_t < L_low; float16 如果 L_low ≤ l̂_t < L_high; int8 如果 l̂_t ≥ L_high } (4)
其中L_low和L_high是用户指定的阈值(在实验中使用L_low=0.5秒,L_high=1.0秒)。
类似地,同步间隔ρ根据延迟调整:
ρ = { ρ_min 如果 l̂_t < L_low; ρ_mid 如果 L_low ≤ l̂_t < L_high; ρ_max 如果 l̂_t ≥ L_high } (5)
其中ρ_min对应更频繁的聚合,ρ_max对应更稀疏的聚合。这种设计允许系统在延迟低时采用更精确但通信开销更大的配置,而在延迟高时切换到更激进压缩且通信更少的配置,从而在运行时动态平衡模型保真度和通信效率。相似文章
基于意见动力学的异构物联网系统联邦学习联盟形成
本文介绍了一种基于Hegselmann-Krause意见动力学的方法,用于联邦学习中的联盟形成,以解决物联网系统中的数据异质性问题,在水消耗预测中实现了显著的误差降低。
QSplitFL:基于能力感知的深度Q学习在分割联邦学习中的最优分割点选择
QSplitFL提出了一种基于DQN的框架,用于在分割联邦学习中选择最优分割点,利用客户端硬件指标适应异构设备。实验表明,在多个数据集和架构上,该方法提高了收敛速度和准确率。
用于目标检测的联邦学习:无需集中数据即可实现协作无人机学习
将联邦学习应用于无人机编队的目标检测,无需集中航拍图像即可实现协作训练,在保护隐私和降低带宽的同时,性能接近集中式训练。
FedLBW:无线网络中非独立同分布数据下基于损失的联邦学习加权策略
本文提出FedLBW,一种联邦学习聚合策略,该策略使用验证损失的倒数而非数据集大小来加权客户端更新,提高了在无线网络中应对非独立同分布数据和客户端掉线时的准确性和鲁棒性。
面向物联网系统多变量时间序列异常检测的联邦低秩Koopman学习
提出FedKAD,一种面向物联网系统中多变量时间序列的联邦Koopman异常检测框架,采用轻量级滑动窗口Koopman表示和Stiefel-ADMM算法实现高效通信和推理。