Thermo-FL:面向边缘AI的热感知鲁棒联邦大语言模型微调

arXiv cs.LG 论文

摘要

Thermo-FL是一个用于边缘设备上大语言模型的联邦LoRA微调框架,它利用设备温度来调节训练和传输,并结合一种鲁棒的聚合方法以抵御对抗性攻击,从而增强稳定性和性能。

arXiv:2608.21172v1 公告类型:新 摘要:联邦微调使大语言模型能够在边缘设备上适应,无需集中私有数据,但实际部署必须同时解决硬件不稳定和对抗性更新损坏的问题。受热约束的客户端可能会节流、减慢本地训练或延迟同步聚合,而拜占庭客户端和通信层对手可以破坏用于形成全局模型的更新。为了解决这些挑战,我们提出了Thermo-FL,一个热感知的联邦LoRA微调框架,它使用设备温度作为本地适配器训练和稀疏更新传输的主动控制信号。在客户端,Thermo-FL根据设备温度调整活跃的LoRA层比例和传输的更新密度,以在热压力下减少工作负载。在服务器端,Thermo-FL引入了TERRA,一个用于动态稀疏LoRA更新的鲁棒聚合管道,它结合了范数过滤、掩码感知方向验证、自适应活跃坐标裁剪和掩码感知聚合。我们使用大规模模拟器和基于Jetson的物理测试平台评估了Thermo-FL。在模拟器中,Thermo-FL在对抗性稀疏聚合下提高了鲁棒性,并在干净和攻击设置中实现了最强的BoolQ准确率,同时在GSM8K上保持竞争力。在物理原型中,Thermo-FL稳定了设备温度,通过位图稀疏编码减少了压缩上传大小,并在符号翻转/缩放和MITM干扰下保持了GSM8K的效用。这些结果表明,安全的边缘LLM适应应综合考虑硬件行为、工作负载调节、稀疏通信和聚合鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:37

# Thermo-FL:面向边缘人工智能的大型语言模型热感知鲁棒联邦微调  
来源:https://arxiv.org/html/2608.21172  
Shiva Shrestha¹,Kazi Shaharair Sharif¹,Zongxing Xie¹,Jiajing Huang²,Anhao Xiang³,Honghui Xu³  
所属机构:¹美国乔治亚州玛丽埃塔市肯尼索州立大学计算机科学系,邮编30060  
\{sshres16,ksharif2\}@students\.kennesaw\.edu  
zxie1@kennesaw\.edu  
²肯尼索州立大学数据分析学院,玛丽埃塔市,邮编30060  
jhuang24@kennesaw\.edu  
³肯尼索州立大学信息技术系,玛丽埃塔市,邮编30060  
\{axiang,hxu10\}@kennesaw\.edu  

###### 摘要  
联邦微调使大型语言模型能够在边缘设备上适应任务而无需集中私有数据,但实际部署必须同时应对硬件不稳定性和对抗性更新破坏。受热约束的客户端可能降频、延迟本地训练或延后同步聚合,而拜占庭客户端和通信层对手可能破坏用于构建全局模型的更新。为此,我们提出Thermo-FL——一种热感知联邦LoRA微调框架,利用设备温度作为本地适配器训练和稀疏更新传输的主动控制信号。在客户端,Thermo-FL根据设备温度变化动态调整活跃LoRA层比例和传输更新密度,在热压力下减轻工作负载。在服务器端,Thermo-FL引入TERRA——针对动态稀疏LoRA更新的鲁棒聚合流水线,结合范数过滤、掩膜感知方向验证、自适应活跃坐标裁剪及掩膜感知聚合。我们通过大规模模拟器和基于Jetson的物理测试平台评估Thermo-FL。模拟器中,Thermo-FL在对抗性稀疏聚合下提升鲁棒性,并在清洁与攻击场景中均取得最优的BoolQ准确率,同时在GSM8K上保持竞争力。物理原型测试中,Thermo-FL稳定设备温度,通过位图稀疏编码减少压缩上传大小,并在符号翻转/缩放与中间人攻击扰动下保持GSM8K效用。这些结果表明,安全的边缘LLM适配需协同考虑硬件行为、工作负载调控、稀疏通信与聚合鲁棒性。  

## I 引言  
大型语言模型(LLMs)的日益普及,已将复杂的语言理解与生成能力直接带入移动设备、无人机、机器人、车载系统、医疗设备及工业传感器等边缘设备[41] [39]。这一转变催生了利用集中式云服务器环境外生成的数据,将LLMs个性化适配至领域特定任务的迫切需求。对于个人用户,本地数据可捕捉偏好、写作风格、语言习惯和交互模式;对于小型组织、诊所、外勤团队和工业操作员,本地数据可能包含难以因隐私、成本和法规约束而集中化的领域词汇、操作流程、敏感记录、内部报告等。这一需求在大规模移动系统中已初现端倪——联邦学习(FL)被用于改进设备端键盘与语言模型行为,而无需收集用户原始数据文本[18]。  

联邦学习为这一场景提供了可行路径:允许多个客户端协作调整共享模型,无需将原始数据上传至中央服务器[35]。特别是,当与参数高效微调(PEFT)技术(如低秩适应LoRA)结合时,联邦学习使资源受限设备能够协作调整LLMs,而无需更新整个模型[21]。然而,边缘设备上的联邦学习并非基于云的分布式训练的简单缩小版[38]。与云服务器不同,边缘设备运行在有限功率、受限散热和不稳定运行条件下,这可能延迟训练过程、减少客户端参与并增加通信开销。同时,与受控数据中心内的云服务器不同,边缘设备部署在物理开放且常缺乏监控的环境中,可能使联邦过程暴露于对抗性威胁,包括但不限于受损的客户端更新与通信层扰动[2] [6] [24] [10]。  

这些现实情况施加了同步需求:系统必须在尊重硬件限制的同时,保护全局模型免受不可靠或恶意更新的影响。现有联邦LLM微调方法虽分别处理该问题的个别方面,但很少将硬件约束与对抗鲁棒性视为耦合的设计要求。PEFT通过减少可训练参数数量,使边缘设备即使在资源受限环境中也能微调LLMs[37] [40]。鲁棒聚合方法可在服务器端缓解受损或恶意更新[42] [7] [12] [45]。然而,这些方法通常独立开发:硬件条件被视作外部运行时状况,鲁棒性则被视作对接收更新的服务器端过滤问题。在实际边缘环境中,该假设可能失效:受热压力客户端可能出现降频、训练延迟或参与度降低[34] [16],而对抗性客户端或通信层扰动可能产生异常更新,这些更新在服务器看来同样不可靠[2] [10] [6]。  

因此,边缘联邦微调框架需在减轻资源受限客户端负担的同时,保护服务器端聚合免受不可靠或恶意更新影响。这推动了一种客户端硬件感知、服务器端鲁棒的框架开发。为填补这一空白,我们提出Thermo-FL——一种针对热约束边缘设备上LLMs的LoRA微调的硬件感知与鲁棒联邦学习框架。在客户端,Thermo-FL使用设备温度作为控制信号,调节本地LoRA适应与稀疏更新传输。当客户端处于热压力状态时,该框架减少该客户端的计算与通信负载;当温度保持在安全热范围内时,则可更充分地参与。在服务器端,Thermo-FL引入TERRA(热增强鲁棒轮次聚合)——一个通过幅值过滤、方向验证和自适应裁剪保护全局模型的鲁棒聚合层。这些客户端与服务器端机制共同使Thermo-FL适应硬件引起的异常,同时保持对对抗攻击的鲁棒性。  

本文主要贡献总结如下:  
- • 提出Thermo-FL——一种针对热约束边缘设备的联邦LoRA微调的硬件感知与鲁棒框架。  
- • 制定基于温度的客户端策略,根据设备热状态动态调整LoRA训练与稀疏更新传输。  
- • 设计TERRA作为针对动态稀疏LoRA更新的鲁棒聚合层,结合幅值控制、方向验证与自适应裁剪以缓解受损更新。  

本文结构安排如下:第II节介绍联邦学习与LoRA背景[2];第III节定义系统与威胁模型;第IV节描述Thermo-FL与TERRA;第V节呈现评估结果;第VI节讨论意义与局限性;第VII节回顾相关工作;第VIII节总结全文。  

## II 预备知识  
本节形式化系统中使用的联邦学习(FL)目标,阐述参数高效微调(PEFT)在所提架构中如何通过LoRA实例化,并介绍本文使用的稀疏更新表示法。  

### II-A 联邦学习形式化  
考虑一个由中央聚合器 $\mathcal{S}$ 和 $K$ 个边缘客户端组成的分布式训练设置。每个客户端 $k \in \{1,\dots,K\}$ 维护一个私有数据集 $\mathcal{D}_k = \{(\mathbf{x}_i, y_i)\}_{i=1}^{|\mathcal{D}_k|}$,该数据集永不与服务器共享[35]。系统主要目标是最小化加权全局目标,协同优化全局参数状态 $W \in \mathbb{R}^d$:  
$$\min_{W} J(W) = \sum_{k=1}^{K} p_k F_k(W), \qquad \text{其中 } p_k = \frac{|\mathcal{D}_k|}{\sum_{j=1}^{K} |\mathcal{D}_j|} \tag{1}$$  
此处,局部损失 $F_k(W)$ 表示客户端 $k$ 上基于 $\mathcal{D}_k$ 计算的经验风险,$p_k$ 根据各客户端本地数据集大小或重要性赋予权重。每次通信轮次 $t$ 中,服务器广播当前全局模型状态 $W^{(t)}$ 至所有参与客户端。每个客户端随后执行本地优化(通常使用随机梯度下降SGD),生成模型增量 $\Delta_k^{(t)}$。服务器将接收更新聚合为 $\bar{\Delta}^{(t)}$ 并更新全局模型:$W^{(t+1)} = W^{(t)} + \bar{\Delta}^{(t)}$,该结果将在后续通信轮次重新分发。  

### II-B 联邦LoRA微调  
由于内存、计算与通信约束,大型语言模型(LLMs)的全参数微调在边缘硬件上通常不可行。参数高效微调(PEFT)方法通过仅更新少量可训练参数(而非全模型权重)来减轻负担[19] [30] [32]。本工作采用低秩适应(LoRA)作为本地微调机制[21] [46] [27] [5]。LoRA假设适应/训练过程中的权重更新位于低内在子空间中。对于预训练权重矩阵 $\mathbf{W}_0 \in \mathbb{R}^{d \times k}$,更新参数化为低秩分解:$\Delta \mathbf{W} = \mathbf{BA}$,其中 $\mathbf{B} \in \mathbb{R}^{d \times r}$,$\mathbf{A} \in \mathbb{R}^{r \times k}$,秩 $r \ll \min(d,k)$。实践中,这将适应约束在紧凑子空间内,同时保留冻结主干的表示能力。因此前向计算修改为:  
$$\mathbf{h} = \mathbf{W}_0 \mathbf{x} + \frac{\alpha}{r} \mathbf{BA} \mathbf{x} \tag{2}$$  
其中 $\alpha$ 为缩放常数。本地优化期间,$\mathbf{W}_0$ 保持固定,仅 $\mathbf{A}$ 和 $\mathbf{B}$ 接受梯度更新。在联邦LoRA微调中,每个被选客户端 $k$ 从当前全局LoRA状态初始化,并在私有数据集 $\mathcal{D}_k$ 上微调LoRA参数。轮次 $t$ 本地训练后,客户端生成LoRA更新 $\Delta_k^{(t)}$,代表其可训练LoRA参数的变化。服务器将接收的LoRA更新聚合为 $\bar{\Delta}^{(t)}$,并将结果应用于全局LoRA状态以供下一通信轮次使用。这使客户端能在避免全参数训练且不共享原始本地数据的前提下,协作调整LLMs。  

## III 硬件分析与威胁模型  
本节描述本研究中使用的硬件限制与对抗框架。这些约束至关重要,因为本地微调可能升高设备温度并延迟客户端更新,而对抗性客户端或通信层扰动可能破坏用于聚合的更新。因此,我们的方法包含对问题两方面的建模:第一,影响客户端训练与同步的硬件条件;第二,影响服务器端聚合的完整性威胁。  

### III-A 动态电压频率调节(DVFS)  
LoRA减少了可训练参数数量,但本地微调仍需在边缘硬件上执行重复矩阵运算、优化器更新与内存移动。在无风扇或散热受限的边缘设备上,持续训练可能导致热积累与运行速度下降[36] [17] [14] [16]。现代嵌入式平台通常依赖动态电压频率调节(DVFS)在温度接近临界工作区域时降低时钟频率。我们通过简单的两状态模型抽象此行为:$f(t) = \begin{cases} f_{\max} & T(t) \leq T_{\text{th}} \\ f_{\text{low}} & T(t) > T_{\text{th}} \end{cases}$(3),其中 $T_{\text{th}}$ 为节流阈值。当温度超过 $T_{\text{th}}$ 时,设备频率从 $f_{\max}$ 降至 $f_{\text{low}}$,导致本地训练变慢并可能产生延迟。这种动态行为意味着客户端性能与温度呈非线性关系,促使框架在热压力下调整参与度。  

### III-B 热约束与可训练层控制  
持续训练使边缘设备温度升高,触发DVFS节流甚至强制停机。为形式化此问题,设 $T_k^{(t)}$ 为客户端 $k$ 在轮次 $t$ 的温度。我们定义热节流函数 $\kappa_k^{(t)}$:  
$$\kappa_k^{(t)} = \begin{cases} 1.0, & T_k^{(t)} < T_{\text{low}} \\ \kappa_{\text{mid}}, & T_{\text{low}} \leq T_k^{(t)} < T_{\text{high}} \\ \kappa_{\text{crit}}, & T_k^{(t)} \geq T_{\text{high}} \end{cases} \tag{8}$$  
其中 $0 < \kappa_{\text{crit}} \leq \kappa_{\text{mid}} < 1$ 为节流常数。本地微调期间仅最后 $\kappa_k^{(t)}$ 比例的LoRA层可训练。当设备运行于下限热阈值 $T_{\text{low}}$ 以下时,所有LoRA层均被训练。在中等热区域,Thermo-FL框架冻结部分适配器,仅更新最后 $\kappa_{\text{mid}}$ 比例的LoRA层。在高热压力下,训练限制于最后 $\kappa_{\text{crit}}$ 比例。此离散控制策略避免了可训练层集合的频繁变更,同时在设备接近更高工作温度时减少本地反向传播工作负载。设 $M_k^{(t)}$ 表示由 $\kappa_k^{(t)}$ 引起的层冻结掩膜。

相似文章

联邦轻量级微调

arXiv cs.LG

本文介绍了FLITE(联邦低秩迭代训练引擎),一种联邦微调方法,通过使用冻结的仿射映射网络,从一个小型可训练潜变量和低秩可种子重生的因子分解生成权重,将每轮每客户端的通信量降至每轮1280个浮点数(约5KB)——相比于全权重FedAvg减少了8718倍。在CIFAR-100数据集上使用ResNet-18进行测试,准确率与全权重FedAvg相差在0.5个百分点以内。

迈向LLM的下一个前沿:私有数据训练——联邦微调的跨域基准

arXiv cs.LG

本文提出了一个在私有数据上对大型语言模型进行联邦微调的跨域基准,评估了LoRA、QLoRA和IA3策略在医疗和金融数据集上的表现。结果表明,联邦微调接近集中式训练的性能,并优于孤立学习,证明了在数据无法共享时通过联邦微调适配LLM的可行性。

在日用设备上启用隐私保护型 AI 训练

MIT News — Artificial Intelligence

麻省理工学院研究人员开发了一种名为 FTTE 的新框架,将隐私保护型联邦学习的速度提升了 81%,使得在智能手表和传感器等资源受限的边缘设备上高效进行 AI 训练成为可能。

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。