边缘设备上多模态联邦学习的熵引导张量压缩

arXiv cs.LG 论文

摘要

论文介绍了MESH-FL,一种用于边缘设备上多模态联邦学习的熵引导矩阵乘积态压缩框架。它自适应地分配每层和每种模态的压缩秩,在异构树莓派集群上实现了高达56.8倍的压缩,并在最终准确率上比未压缩的FedAvg提升了2.01%。

arXiv:2607.06651v1 公告类型:新 摘要:在移动和边缘设备上的联邦学习越来越多地涉及多模态模型,其中客户端在感知能力和计算能力上均存在差异。现有的更新压缩方案通常跨层和设备应用统一策略,而未考虑模态特定的谱结构和可压缩性差异。我们提出了MESH-FL,一种用于资源受限设备上模态异构联邦学习的熵引导矩阵乘积态(MPS)更新压缩框架。MESH-FL通过截断奇异值分解估计每个逐层更新的谱熵,并在每个客户端的载荷预算下自适应地跨层、模态和设备分配MPS压缩秩。我们表明,在奇异值能量分布的优超序下,较高的谱熵需要更高的重建秩。基于这一结果,我们证明了所提出的熵引导分配解决了一个凸替代秩分配问题,在精确载荷模型下保持单调性,并以显式的压缩相关误差项实现收敛。在由15个异构Raspberry Pi~4/5节点组成的模态异构客户端集群上的实验表明,MESH-FL实现了高达$56.8\times$压缩,同时在最终准确率上超过未压缩的FedAvg基线最多2.01%,并将达到收敛所需的总传输数据量减少了多达$66\times$。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:42

# 面向边缘设备多模态联邦学习的熵引导张量压缩
来源:https://arxiv.org/html/2607.06651
Quoc Bao Phan![[无标题图片]](https://arxiv.org/html/2607.06651v1/x1.png)\{\}^\{\\href https://orcid\.org/0009\-0002\-5643\-3828\{\}\},IEEE研究生会员,以及Tuy Tan Nguyen![[无标题图片]](https://arxiv.org/html/2607.06651v1/x2.png)\{\}^\{\\href https://orcid\.org/0000\-0002\-9485\-7720\{\}\},IEEE高级会员本研究由佛罗里达州立大学 FAMU-FSU 工程学院电气与计算机工程系、先进电力系统中心支持。(通讯作者:Tuy Tan Nguyen.)作者单位:佛罗里达州立大学 FAMU-FSU 工程学院电气与计算机工程系、先进电力系统中心,地址:美国佛罗里达州塔拉哈西市 32310。(电子邮箱:[email protected], [email protected]).

###### 摘要

联邦学习在移动和边缘设备上的应用日益涉及多模态模型,其中客户端在感知能力和计算能力方面各不相同。现有的更新压缩方案通常跨层和设备应用统一策略,而未考虑模态特定的谱结构和可压缩性差异。我们提出了 MESH-FL,一种面向资源受限设备上模态异构联邦学习的熵引导矩阵乘积态(MPS)更新压缩框架。MESH-FL 通过截断奇异值分解估计每层更新的谱熵,并在每客户端负载预算下,跨层、模态和设备自适应地分配 MPS 压缩秩。我们证明,在奇异值能量分布的优序支配下,较高的谱熵需要更高的重建秩。基于这一结果,我们证明所提出的熵引导分配解决了一个凸替代秩分配问题,在精确负载模型下保持单调性,并实现了带有显式压缩相关误差项的收敛性。在一个包含15个节点、模态异构客户端的 Raspberry Pi 4/5 异构集群上的实验表明,MESH-FL 实现了高达 56.8 倍的压缩,同时最终准确率比未压缩的 FedAvg 基线高出 2.01%,并将达到收敛所需的传输数据总量减少了高达 66 倍。

## 第一章 引言

联邦学习已成为一种重要的框架,用于在大量移动和边缘设备上训练模型,而无需集中原始数据[20, 5]。其吸引力尤其在传感应用中显著,因为数据在用户设备上持续生成,且通常受到隐私、带宽和存储约束[17]。同时,许多边缘应用本质上是多模态的。人类活动识别、移动健康、智能环境以及音视频感知通常依赖于多个传感流,而参与训练的设备的传感硬件可能并不相同[1]。因此,实际的联邦学习部署越来越多地在模态异构性下运行,其中客户端不仅在计算和通信资源上不同,在训练期间可以观察和贡献的模态上也不同。

这种设置带来了一个比传统联邦学习结构更复杂的通信问题。在跨设备系统中,传输模型更新已占训练成本的很大一部分,尤其是当客户端资源受限并通过无线链路通信时[7]。在多模态设置中,这一挑战更为突出,因为模型的不同分支可能产生具有不同统计和结构特性的更新。因此,适用于一种模态的压缩策略可能对另一种模态过于激进或不足。多模态联邦学习中的通信效率因此不仅是一个系统问题,也是一个表示问题:压缩机制应反映被传输的逐层更新的结构。

现有的更新压缩方法,包括稀疏化、量化和低秩近似,已表明在联邦学习中可以实现通信量的大幅减少[10, 28]。然而,大多数现有方案在层或客户端之间应用大致统一的压缩策略,很少考虑更新结构或设备能力的差异[3]。在异构边缘环境中,这种统一性可能在两个方面是低效的。首先,它可能错误地分配压缩预算,将不同复杂度的更新同等对待,尽管有些更新允许更强的压缩。其次,它可能忽略每设备的资源约束,使得相同的压缩选择在弱设备和强设备上均为次优。这些限制在模态异构联邦学习中尤其相关,其中模型结构和硬件可变性共同塑造了通信瓶颈[4]。

我们的工作源于如下观察:逐层更新矩阵的谱熵,由归一化奇异值能量分布导出,提供了一个紧凑的可压缩性度量:低熵表示能量集中在少数模式中,而高熵反映更分散的谱和对低秩近似的更大阻力。基于这一观点,我们表明,在奇异值能量分布的自然优序支配下,较高的谱熵通常需要更高的重建秩,这启发了跨层、模态和设备的熵引导秩选择。基于此原理,我们开发了 MESH-FL,一种面向模态异构联邦学习的熵引导且设备感知的压缩框架,它在统一的流程中结合了每层熵估计、每客户端负载预算下的自适应秩分配以及基于矩阵乘积态(MPS)的更新压缩。MESH-FL 不强加跨所有客户端和模型组件的统一压缩级别,而是使压缩适应更新复杂度和设备能力;我们进一步通过显式的压缩相关近似项分析其优化行为,并在一个异构边缘测试平台和多模态基准上评估它,结果表明在减少通信的同时,最终准确率超过了未压缩的基线。

我们的主要贡献总结如下:

- • 我们制定了联合模态和设备异构下的通信高效联邦学习,阐明了为何统一压缩与异构边缘设置不匹配。
- • 我们引入了一种谱熵引导的更新压缩视角,并证明在优序支配下,较高的谱熵意味着需要更大的重建秩。
- • 我们开发了 MESH-FL,一种熵引导的 MPS 压缩框架,在每客户端负载预算下跨层、模态和客户端自适应地分配秩。
- • 我们提供了带有显式压缩相关误差项的收敛性分析,并在异构 Raspberry Pi 硬件上验证了 MESH-FL,展示了与基线相比的通信减少和准确率提升。

本文的其余部分组织如下。第二章回顾了更新压缩和异构联邦学习的相关工作与背景。第三章定义了问题表述。第四章介绍了 MESH-FL 框架和算法。第五章提供了理论分析。第六章报告了实验结果。第七章总结了本文。

## 第二章 相关工作

### II-A 联邦学习中的更新压缩

减少联邦学习中每轮通信成本的方法包括稀疏化、量化和低秩近似。稀疏化方法仅传输通过幅度阈值或随机采样选出的更新坐标子集[15, 22]。通过误差反馈,这些方法能够以与密集通信相当的速度收敛,但它们独立对待每个坐标,无法利用权重矩阵内的结构冗余。量化减少了传输值的比特宽度。QSGD[2] 提供了具有方差有界收敛保证的随机舍入;TernGrad[26] 将量化推进到三个级别以实现极值压缩。两者均对更新的谱组织方式不敏感,也未提供按层复杂度成比例分配精度的机制。

低秩近似方法在结构上更接近我们的方法。PowerSGD[25] 通过随机幂迭代压缩梯度矩阵,并在大规模模型上展示了强大的经验压缩比。FedPAQ[21] 结合了周期平均和量化。然而,现有方法大多在层和设备之间应用统一的秩或预算策略,而不适应逐层谱结构或每客户端资源约束。MESH-FL 通过使用谱熵在层、模态和异构设备之间自适应地分配 MPS 秩,打破了这种统一性。

### II-B 神经网络与联邦学习中的张量分解

张量分解已广泛用于压缩神经网络权重[18, 12],最近也用于压缩分布式优化中的梯度。MPS,也称为张量列(TT)分解[19],将重塑后的权重或梯度张量分解为三维核心链,使得压缩比随张量阶数有利地缩放。文献中的作者[24] 将 TT 分解应用于循环权重;[29] 将其扩展到用于边缘部署的全连接层。对于三阶重塑,传输的 MPS 负载直接取决于通过核心大小选择的键秩,使得秩选择成为控制通信-重建权衡的主要机制。在联邦学习中,基于张量的压缩已在服务器端聚合和模型剪枝的背景下被探索,但先前的工作全局固定分解秩,并不适应逐层谱复杂度或每设备负载预算。MESH-FL 将熵引导的自适应 MPS 秩选择与设备感知的预算分配相结合,用于模态异构联邦学习。

### II-C 异构联邦学习

系统异构,即客户端在计算速度和通信带宽上存在差异,已通过异步聚合[27]、部分模型训练[6] 和近端正则化[14] 得到解决。统计异构(非独立同分布数据分布)已通过方差减少[11]、梯度校正和数据共享策略[30] 进行研究。这些工作仅单独处理计算或统计维度的异构性,并未解决每客户端负载约束下的异构更新压缩问题。

联邦学习中的模态异构,即客户端传感硬件不同,研究较少。已有并行工作考虑了跨孤岛设置中的部分模态参与和模态丢弃[23],但未涉及自适应压缩。MESH-FL 在一个统一框架内联合处理模态异构、设备异构和通信效率,提供对模态合格客户端的逐层聚合以及尊重设备特定负载限制的熵引导秩分配。

## 第三章 问题表述

### III-A 联邦学习目标

考虑一个包含中央服务器和 K 个客户端(以 K = {1,2,...,K} 索引)的联邦学习系统。每个客户端 k 持有包含 n_k 个样本的本地数据集 D_k,且数据集跨客户端以非独立同分布方式分布。全局学习目标为:

min_w F(w) = sum_{k=1}^K (n_k / n) F_k(w), (1) 其中 F_k(w) = (1 / n_k) sum_{i in D_k} l(w; x_i) 是客户端 k 的经验局部目标,n = sum_{k=1}^K n_k 是总样本数,l(w; x_i) 是每个样本的损失,w ∈ R^d 表示全局模型参数。在通信轮次 t,服务器将当前全局模型 w^t 广播给选定的参与客户端子集 S^t ⊆ K。每个客户端 k ∈ S^t 从 w^t 开始执行 E 步本地随机梯度下降,产生本地更新后的模型 w_k^t。传输的本地更新是累积模型差值

Δw_k^t = w^t - w_k^t, (2) 它捕获了 E 步本地步骤后净参数变化。服务器仅对参与客户端的这些差值进行聚合:

w^{t+1} = w^t - sum_{k in S^t} (n_k / n_{S^t}) Δw_k^t, (3) 其中 n_{S^t} = sum_{k in S^t} n_k 是轮次 t 参与客户端持有的总样本数。对于每一层 l,令 G_k^{(l)} ∈ R^{m_l × n_l} 表示本地更新的逐层分量,定义为该层在 E 步后全局参数与本地更新参数之间的差值。此逐层更新矩阵在传输前被压缩。

### III-B 模态异构客户端

我们考虑客户端在感知能力上存在差异的设置。令 M 表示可用模态集合。每个客户端 k 根据其硬件配置可访问一个子集 M_k ⊆ M。全局模型由特定模态的编码器分支和一个共享融合模块组成。形式化地,

w = { w^{(l)} }_{l=1}^L, (4) 其中 L 是总层数,每个 w^{(l)} 要么属于一个特定模态的编码器(即 w^{(l)} ∈ {w_m}^{(l')} 对于某模态 m 和层 l'),要么属于融合模块。客户端将更新仅发送到与其观察到的模态对应的那些编码器层,以及融合层。

相似文章

EdgeDetect:用于联邦入侵检测的重要性感知梯度压缩与同态聚合

Hugging Face Daily Papers

# 论文页面 - EdgeDetect:用于联邦入侵检测的重要性感知梯度压缩与同态聚合 来源:[https://huggingface.co/papers/2604.14663](https://huggingface.co/papers/2604.14663) ## [https://huggingface.co/papers/2604.14663#edgedetect-importance-aware-gradient-compression-with-homomorphic-aggregation-for-federated-intrusion-detection](https://huggingface.co/papers/2604.14663#edgedetect-importance-aware-gradient-compression-fo

Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients

arXiv cs.LG

This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.

联邦轻量级微调

arXiv cs.LG

本文介绍了FLITE(联邦低秩迭代训练引擎),一种联邦微调方法,通过使用冻结的仿射映射网络,从一个小型可训练潜变量和低秩可种子重生的因子分解生成权重,将每轮每客户端的通信量降至每轮1280个浮点数(约5KB)——相比于全权重FedAvg减少了8718倍。在CIFAR-100数据集上使用ResNet-18进行测试,准确率与全权重FedAvg相差在0.5个百分点以内。