D-FROST:基于最优传输的去中心化联邦提示调优方法,用于处理非IID和不平衡数据

arXiv cs.LG 论文

摘要

D-FROST引入了一种使用最优传输的去中心化联邦提示调优算法,以解决非IID和不平衡数据带来的挑战,确保基础模型的收敛性和有效性。

arXiv:2609.01802v1 公告类型:新 摘要:提示调优提供了一种参数高效的方法,通过冻结预训练骨干网络并仅更新一小部分可学习提示来适应基础模型(FMs)。这一特性使得提示调优特别适用于去中心化联邦学习(DFL),在DFL中,交换完整模型更新的成本可能极高。然而,DFL中的提示调优引入了新的挑战。从异构本地数据中学习到的提示集可能在索引上不对齐,使得标准的去中心化平均方法不适用。此外,算法应在理论上保证能够实现共识并向共享目标取得进展。在这项工作中,我们首次研究了DFL中的提示调优。我们将去中心化提示调优表述为一个基于Wasserstein的优化问题,涉及提示度量,这捕捉了提示的集合值结构。然后我们提出了D-FROST,一个基于最优传输(OT)的去中心化提示调优算法,通过传输匹配将邻域提示合并为紧凑的代表性提示集。我们进一步分析了D-FROST,通过约束跨客户端的Wasserstein共识误差,并建立网络级提示重心收敛到平稳点邻域。在异构客户端数据下的实验表明了D-FROST在去中心化提示调优中的有效性。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:10

# D-FROST:基于最优传输的非独立同分布与非平衡数据去中心化联邦提示调优
来源:https://arxiv.org/html/2609.01802
通讯作者:###### 摘要
提示调优通过冻结预训练主干网络并仅更新少量可学习提示参数,为适应基础模型(FMs)提供了一种参数高效的方法。这一特性使得提示调优特别适用于去中心化联邦学习(DFL),因为在这种场景下交换全模型更新的成本可能极高。然而,DFL中的提示调优引入了新的挑战。从异构本地数据学习到的提示集可能在索引上不对齐,使得标准的去中心化平均不再适用。此外,算法在理论上应保证达成共识并朝着共享目标取得进展。在这项工作中,我们首次研究了DFL中的提示调优。我们将去中心化提示调优表述为一个基于沃瑟斯坦距离的提示度量优化问题,该问题捕捉了提示的集合值结构。然后,我们提出了D-FROST,一种基于最优传输(OT)的去中心化提示调优算法,该算法通过基于传输的匹配将邻域提示合并为紧凑的代表性提示集。我们进一步通过限制客户端间的沃瑟斯坦共识误差,并建立网络级提示重心收敛至稳定点邻域的收敛性来分析D-FROST。在异构客户端数据下的实验证明了D-FROST在去中心化提示调优方面的有效性。
1美国佛罗里达州佛罗里达大学,2美国华盛顿州华盛顿州立大学
通讯作者:[email protected]

## 1 引言
基础模型(FMs)已成为现代AI系统的主导基础,但当必须微调所有模型参数时,将其适应到下游任务仍然成本高昂。提示调优通过冻结预训练主干网络并仅优化少量可学习提示参数(Li and Liang 2021 (https://arxiv.org/html/2609.01802#bib.bib4);Lester et al. 2021 (https://arxiv.org/html/2609.01802#bib.bib5))提供了一种参数高效的替代方案。这使得提示调优在联邦学习(FL)中尤其具有吸引力,因为FL中的数据分布在客户端之间,通信成本是主要瓶颈。联邦提示调优不传输完整的模型更新,而是只交换轻量级的提示参数。随着最先进的模型越来越多地依赖于微调像LLMs和Vision Transformers这样的基础模型,FL中的提示调优已成为一种有前景的方式,可以在分布式数据上微调大型预训练模型,而无需集中原始信息。(Zhao et al. 2023 (https://arxiv.org/html/2609.01802#bib.bib6);Che et al. 2023 (https://arxiv.org/html/2609.01802#bib.bib7);Weng et al. 2024 (https://arxiv.org/html/2609.01802#bib.bib8))。
去中心化联邦学习(DFL)是FL的一种无服务器变体,客户端仅与图邻居通信。对于DFL中的预训练模型适应,提示调优提供了一种通过仅交换轻量级提示参数来减少通信的自然方式。然而,DFL中的提示调优引入了两个挑战。首先,DFL中的提示调优算法必须确保收敛,即本地提示状态达成共识,且网络级模型朝着共享目标取得进展。据我们所知,此前没有工作研究DFL中提示调优的收敛性。现有的全模型DFL收敛研究不能直接适用,因为它们依赖于坐标对齐的参数向量和欧几里得平均,而提示调优DFL在无序的提示集上操作(Yuan et al. 2016 (https://arxiv.org/html/2609.01802#bib.bib9);Lian et al. 2017 (https://arxiv.org/html/2609.01802#bib.bib1);Tang et al. 2018 (https://arxiv.org/html/2609.01802#bib.bib2);Koloskova et al. 2020 (https://arxiv.org/html/2609.01802#bib.bib3))。其次,从异构数据学习到的提示可能不对齐,导致提示错位问题,即直接按索引平均提示可能会合并无关的提示方向。在文献中,PFPT(Weng et al. 2024 (https://arxiv.org/html/2609.01802#bib.bib8))在集中式FL中通过概率提示聚合解决了这个问题。然而,将这个想法扩展到去中心化通信并非易事,因为每个客户端仅观察局部的邻域提示,而非全局集合。
**贡献。** 据我们所知,这是首次研究去中心化联邦学习中的提示调优。本文的关键贡献和见解总结如下:
- (i) 我们将*去中心化提示调优*表述为一个基于沃瑟斯坦距离的提示度量优化问题。这个表述保留了学习共享模型状态的标准DFL目标,同时用沃瑟斯坦提示度量共识取代了欧几里得参数共识。因此,它自然捕捉了客户端提示的集合值结构。
- (ii) 我们提出了D-FROST,一种基于OT的去中心化提示调优算法。每个客户端首先更新其本地提示,然后应用一个基于OT的`Merge`函数将邻域提示总结为紧凑的代表性提示集。这个合并操作避免了直接的按索引平均,并通过根据提示在提示嵌入空间中的几何结构进行匹配来解决提示错位问题。
- (iii) 我们提供了D-FROST的收敛性分析。我们首先表明,随着内部OT步骤数量的增加,基于OT的局部`Merge`求解器变得稳定。然后我们确定D-FROST能够控制客户端间的沃瑟斯坦共识误差,并且网络级提示重心收敛至共享提示调优目标的稳定点邻域。
- (iv) 我们在经验上评估了D-FROST,并与基于现有DFL技术的各种去中心化联邦提示调优基线进行了比较。通过在八个不同视觉数据集的组合上进行的广泛实验,我们的结果一致表明,我们的方法在去中心化联邦提示调优中的数据不平衡和极端异构场景下是有效的。

## 2 相关工作
### 2.1 提示调优与联邦提示调优
提示调优旨在通过优化少量可学习的提示参数同时保持主干模型冻结,来适应预训练模型。早期的代表性工作包括前缀调优,它为生成任务优化连续前缀(Li and Liang 2021 (https://arxiv.org/html/2609.01802#bib.bib4)),以及软提示调优,它学习特定任务的连续提示,并随着模型规模的增加变得与全微调相媲美(Lester et al. 2021 (https://arxiv.org/html/2609.01802#bib.bib5))。最近的工作将提示调优扩展到联邦学习。FedPrompt聚合提示参数而非完整模型,以减少通信和存储成本(Zhao et al. 2023 (https://arxiv.org/html/2609.01802#bib.bib6)),而PFPT使用概率提示聚合来解决非独立同分布和不平衡数据(Weng et al. 2024 (https://arxiv.org/html/2609.01802#bib.bib8))。然而,这些方法依赖于集中式服务器聚合,没有考虑图邻居之间的去中心化通信。此外,异构客户端可能学习到不对齐的提示集,使得按索引平均容易结合不匹配的提示方向。
### 2.2 去中心化联邦学习
与集中式FL不同,去中心化FL移除了服务器,让客户端仅通过图上的邻居进行通信。早期的方法,如分布式次梯度下降和去中心化梯度下降,将局部优化与邻居平均相结合(Yuan et al. 2016 (https://arxiv.org/html/2609.01802#bib.bib9))。后来的去中心化SGD分析在适当的混合条件下确立了具有竞争力的收敛性(Lian et al. 2017 (https://arxiv.org/html/2609.01802#bib.bib1);Tang et al. 2018 (https://arxiv.org/html/2609.01802#bib.bib2);Koloskova et al. 2020 (https://arxiv.org/html/2609.01802#bib.bib3))。DFedAvgM(Sun et al. 2022 (https://arxiv.org/html/2609.01802#bib.bib12))将多次本地SGD迭代的FedAvg方法应用于去中心化设置。DFedSAM(Shi et al. 2023 (https://arxiv.org/html/2609.01802#bib.bib13))采用尖锐度感知最小化优化器来减少本地模型的不一致性。NTK-DFL(Thompson et al. 2025 (https://arxiv.org/html/2609.01802#bib.bib14))通过神经切线核动力学提高了对数据异构性的鲁棒性,但不能很好地扩展到CNN或Transformer。大多数去中心化学习方法假设客户端状态是坐标对齐的模型参数向量,因此`Merge`是通过混合矩阵进行加权平均来实现的。这个假设对于去中心化提示调优不成立,因为提示形成无序且可能不对齐的集合。因此,我们的工作用基于OT的合并取代了参数平均,以实现沃瑟斯坦共识。

## 3 预备知识
### 3.1 去中心化联邦学习(DFL)
DFL考虑了一个客户端网络,它们在不依赖中央服务器的情况下协作优化学习目标。客户端通过通信图G=(V,E)连接,其中每个节点u∈V代表一个客户端,每条边(u,v)∈E表示直接通信。每个客户端u拥有一个私有数据集D_u,数据分布在客户端之间可以是异构的。令N(u)={v∈V:(u,v)∈E}表示客户端u的邻居集。通信拓扑通常由一个混合矩阵W∈R^{m×m}表示,其中W_{uv}>0仅当v=u或v∈N(u)。图的连通性由ρ:=‖W - (1/m)11^⊤‖_2刻画,其中对于连通图,ρ<1。较小的ρ表示信息混合更快,客户端间的共识更强。一轮去中心化学习包括两个步骤:`LocalUpdate`和`Merge`。每个客户端首先使用其私有数据更新其本地状态,然后与邻居客户端交换状态并聚合接收到的信息。在经典的全模型去中心化训练中,本地状态是共享架构的参数向量。因此,`LocalUpdate`通常执行一个或多个随机梯度步骤,而`Merge`对邻居参数应用混合矩阵加权平均(Lian et al. 2017 (https://arxiv.org/html/2609.01802#bib.bib1);Tang et al. 2018 (https://arxiv.org/html/2609.01802#bib.bib2);Koloskova et al. 2020 (https://arxiv.org/html/2609.01802#bib.bib3))。在本文中,我们研究带有提示调优的DFL,其中预训练主干网络被冻结,仅更新少量可学习的提示参数。因此,客户端状态是一个提示集,而不是完整的模型参数向量,并且`LocalUpdate`和`Merge`都采取了与全模型去中心化训练不同的形式。
### 3.2 度量空间与沃瑟斯坦距离
在我们的设置中,每个客户端维护一组可学习的提示作为其状态。一个更自然的视角是将每个提示集视为提示嵌入空间上的分布。在这种视角下,比较两个提示集变成了比较两个概率度量的问题。令P(R^d)表示R^d上的概率度量空间,并令P_2(R^d)表示具有有限二阶矩的概率度量子集:P_2(R^d) := {μ ∈ P(R^d) : ∫_{R^d} ‖x‖^2 dμ(x) < ∞}。这个空间为研究在欧几里得嵌入空间(如提示嵌入)上的分布提供了几何设置。给定两个概率度量μ, ν ∈ P_2(R^d),它们之间的一个耦合是一个联合概率度量π ∈ P(R^d × R^d),其边缘分布是μ和ν。我们用Π(μ, ν)表示所有此类耦合的集合:Π(μ, ν) := {π ∈ P(R^d × R^d) : π(A × R^d) = μ(A), π(R^d × B) = ν(B)}。μ和ν之间的平方2-沃瑟斯坦距离定义为W_2^2(μ, ν) := inf_{π ∈ Π(μ, ν)} ∫_{R^d × R^d} ‖x - y‖^2 dπ(x,y)。直观地说,W_2^2(μ, ν)衡量了在平方欧几里得成本下,将μ的质量移动以匹配ν所需的最小传输成本。对于经验度量,μ = ∑_{a=1}^N r_a δ_{x_a}, ν = ∑_{i=1}^M c_i δ_{y_i},其中r_a, c_i ≥ 0, ∑_{a=1}^N r_a = 1, 且 ∑_{i=1}^M c_i = 1,耦合可以用一个传输矩阵P ∈ R_+^{N×M}表示。可行集是Π(r, c) := {P ∈ R_+^{N×M} : P 1_M = r, P^⊤ 1_N = c}。在这种离散情况下,平方2-沃瑟斯坦距离是:W_2^2(μ, ν) = min_{P ∈ Π(r, c)} ∑_{a=1}^N ∑_{i=1}^M P_{ai} ‖x_a - y_i‖^2。因此,沃瑟斯坦距离通过优化它们支持点之间所有可能的匹配来比较两个经验分布,而不是假设固定的顺序。这个特性对于提示集特别有用,因为其中的元素并非天然有序,并且在客户端之间可能不对齐。

## 4 去中心化沃瑟斯坦提示调优
在本节中,我们首先介绍去中心化提示调优的设置。然后,我们将全局目标定义为学习沃瑟斯坦空间中的共享提示度量。最后,我们提出了一种基于OT的算法来近似解决去中心化提示调优问题。
### 4.1 设置
设G=(V,E)是一个具有|V|=M个客户端的无向通信图。每个客户端u∈V拥有一个私有本地数据集D_u。客户端协作地适应预训练主干模型F,同时保持主干参数固定。因此,每个客户端仅维护和更新一个本地提示集。在通信轮次t,客户端u维护ω_u^{(t)} = {ω_{u1}^{(t)}, ..., ω_{un}^{(t)}}, ω_{ui}^{(t)} ∈ R^d,其中n是提示数量,d是提示维度。我们将此集合视为经验概率度量μ_u^{(t)} := (1/n) ∑_{i=1}^n δ_{ω_{ui}^{(t)}}。这种表示将提示状态视为提示嵌入空间中无序的支持点集合。令N(u) = {v ∈ V : (u,v) ∈ E}表示客户端u的邻居集。由于每个客户端使用其自身的...

相似文章

FedOPAL: 基于解析视觉提示调整的单次联邦学习

arXiv cs.AI

FedOPAL 提出了一种框架,将视觉提示适配为特征校正器,用于单次联邦学习,通过解析方法实现高效的无梯度聚合,在零服务器端训练成本下,性能显著优于现有解析方法,并可与迭代方法相媲美。

联邦轻量级微调

arXiv cs.LG

本文介绍了FLITE(联邦低秩迭代训练引擎),一种联邦微调方法,通过使用冻结的仿射映射网络,从一个小型可训练潜变量和低秩可种子重生的因子分解生成权重,将每轮每客户端的通信量降至每轮1280个浮点数(约5KB)——相比于全权重FedAvg减少了8718倍。在CIFAR-100数据集上使用ResNet-18进行测试,准确率与全权重FedAvg相差在0.5个百分点以内。

通过约束混合策略GroupDRO实现公平的系统提示选择

arXiv cs.CL

本文介绍了一种用于公平系统提示选择的约束混合策略GroupDRO框架,通过为现有提示分配权重,最小化不同人口统计组和指标上的最坏情况信息质量损失。在五个大语言模型上,针对双语医学和金融基准的实验表明,该方法在保持平均性能的同时,一致地降低了最坏情况下的质量下降。