预算协调:少标签联邦主动学习
摘要
本文研究低预算环境下的联邦主动学习,揭示了由于异质性反转,同质数据需要更强的协调。它提出了一种利用联邦表示学习的框架,以实现全局协调的主动选择,性能优于现有方法。
arXiv:2608.18634v1 宣布类型:新
摘要:联邦主动学习(FAL)解决了数据隐私和标签稀缺的双重挑战,缺乏全局数据视图为协调查询选择带来了额外障碍。我们研究低预算环境下的跨孤岛FAL,其中注释决策最为关键。我们从理论和实证两方面描述了异质性反转:在低预算设置中,同质(IID)数据需要更强的协调以避免冗余查询,而异质数据自然促进多样性;这种趋势在高预算下会反转。因此,与标准联邦学习(FL)中异质性是主要挑战的叙述相反,我们表明在FAL中,IID设置对查询选择更具挑战性。
基于这些发现,我们提出了一种新的FAL框架,利用联邦表示学习将客户端数据对齐到一个共享嵌入空间中。这使得服务器能够在可选混淆的客户端嵌入上进行全局协调的主动选择,同时注释保持在每个客户端本地。尽管我们的框架运行在更具挑战性的低预算环境中,它实现了超越现有FAL方法的性能,即使当后者被赋予更大的注释预算时,这证明了在隐私约束下集中协调的价值。
查看缓存全文
缓存时间: 2026/08/20 10:31
# 预算有限的协调:少标签联邦主动学习
来源:https://arxiv.org/html/2608.18634
Daphna Weinshall所属单位:计算机科学与工程学院所属单位:希伯来大学,耶路撒冷 91904,以色列电子邮件:[\{liam\.mohr,daphna\}@mail\.huji\.ac\.il](mailto:)
摘要
联邦主动学习(FAL)同时应对数据隐私和标签稀缺的双重挑战,缺乏全局数据视图为协调查询选择带来了额外障碍。我们在低预算环境下研究跨孤岛FAL,此时标注决策至关重要。我们从理论和实证两个角度刻画了一种*异质性反转*现象:在低预算设置中,同质(IID)数据需要更强的协调以避免冗余查询,而异质数据则自然地促进多样性;这种趋势在高预算时发生逆转。因此,与标准联邦学习(FL)中异质性是主要挑战的叙述相反,我们表明在FAL的查询选择中,IID设置更具挑战性。
基于这些发现,我们提出一个新的FAL框架,利用联邦表示学习在共享嵌入空间中对齐客户端数据。这使得服务器能够通过对可选混淆的客户端嵌入进行全局协调的主动选择,而标注则保持在每个客户端本地进行。尽管我们的框架运行在更具挑战性的低预算环境中,但其性能超越了现有FAL方法——即使这些方法被赋予了大得多的标注预算,从而证明了在隐私约束下集中协调的价值。
## 1引言
现代机器学习系统越来越多地部署在数据分散且受严格隐私与治理约束的环境中。在医疗保健、金融和电信等领域,数据分布在不同机构中,由于监管或运营限制而无法共享。联邦学习(FL)通过无需访问原始数据即可进行协作模型训练来解决这一挑战。然而,FL通常假设拥有标签数据,而实际上未标注数据丰富,但标注成本高昂且稀缺。
主动学习(AL)通过选择性查询最具信息量的样本进行标注,提供了一种互补的解决方案。然而,经典的AL依赖于对未标注池的集中访问,允许模型全局比较候选样本。在联邦设置中,这一假设被打破:数据仍分散在各客户端,协调受到隐私和通信约束的限制。这催生了*联邦主动学习*(FAL)这一场景,其中查询选择必须在不直接访问全局数据视图的情况下进行。
FAL的一个核心挑战是协调跨客户端的选择,以避免冗余或次优查询。虽然数据异质性传统上被视为联邦学习的主要障碍,但我们在低预算环境中发现了一种相反的现象。具体来说,我们观察到*异质性反转*:当客户端具有相似(IID)数据分布时,独立选择会导致冗余查询和较差的全局覆盖,使得协调变得至关重要。相反,异质(non-IID)数据自然地促进所选样本的多样性,减少了对协调的需求。这种趋势在高预算时发生逆转,因为非IID数据会引入不确定性估计的偏差,回归到经典的FL挑战。我们在第3节(https://arxiv.org/html/2608.18634#S3)中形式化了这种相互作用,表明协调的价值取决于数据异质性和标注预算的共同作用。表1(https://arxiv.org/html/2608.18634#S1.T1)总结了由此产生的多样性驱动与不确定性驱动环境之间的反转。
请参阅标题图1:拟议的联邦主动学习流程概述。联邦特征提取器首先在客户端之间诱导共享嵌入空间。每个客户端计算局部嵌入,并在传输到服务器之前可能应用混淆机制。服务器在聚合的嵌入空间中执行集中式主动选择,而选定的样本由相应的客户端在本地进行标注,并用于后续的联邦训练。表1:协调与异质性。在低预算环境中,IID数据需要协调以确保多样性,使其比非IID数据更具挑战性——这与标准FL设置相反。
我们的分析揭示了现有FAL方法的一个关键局限性:它们没有明确考虑数据分布与标注预算之间的相互作用。一个自然的基线是在每个客户端独立应用主动学习,仅在标注后依赖联邦训练,如先前的低预算FAL流程[ono2025exploring]。然而,这将客户端间的协调限制在模型训练阶段,使得查询选择在各客户端之间解耦,未能充分利用主动学习与联邦学习之间的潜在协同作用。
我们通过全局协调的查询选择来解决这一局限性。联邦学习的特征提取器对齐客户端嵌入,使得服务器能够跨客户端比较候选样本并协调选择,同时原始数据保留在本地。选定的样本随后在本地进行标注,并用于下游的联邦训练(见图1(https://arxiv.org/html/2608.18634#S1.F1))。
虽然这种设计实现了有效的跨客户端协调,但也引入了潜在的隐私风险,因为共享的嵌入可能会泄露底层数据的信息;在视觉领域,特征表示可能容易受到反转或重建攻击[chatzikokolakis2013broadening,feyisetan2020privacy,sun2021soteria]。为应对这一挑战,我们研究了两种隐私保护方法,一种使用受控的嵌入扰动,另一种使用基于质心的聚合,并研究了隐私保护与主动选择性能之间的权衡。
##### 我们的贡献包括:
- •我们识别并分析了联邦主动学习中的*异质性反转*:在低预算环境中,IID数据导致冗余采样,比异质数据需要更强的协调。
- •我们提出了一种使用共享联邦嵌入进行*全局协调查询选择*的新框架,并包含两种用于数据保护的差分隐私机制。
- •我们证明,全局协调在低预算环境中显著提高了标签效率,同时即使在嵌入混淆下也保留了大部分优势,从而实现了有利的隐私-性能权衡。
## 2相关工作
##### 低预算主动学习。
在AL过程早期,基于不确定性的方法,如熵采样[wang2014new]、最低置信度[lewis1994sequential]和边界采样[scheffer2001active],通常表现不佳,因为模型的预测信号质量较低[hacohen2022active]。为了缓解这一问题,近期方法利用自监督表示。例如,*TypiClust* [hacohen2022active]优先选择来自高密度集群的代表性样本。类似地,*ProbCover* [yehuda2022active]和*MaxHerding* [bae2024maxherding]将主动选择构建为概率覆盖问题,策略性地选择样本以最大化在给定预算约束内跨越未标注数据流形的概率。
##### 联邦学习。
联邦学习(FL)支持在分布式客户端之间进行协作模型训练,同时保持数据本地化,主要解决隐私、通信效率和统计异质性问题[mcmahan2017communication,kairouz2021advances]。大量研究致力于缓解非IID数据分布和有限通信带宽带来的挑战[li2020federated,karimireddy2020scaffold]。
相比之下,我们的工作考虑了少量具有相对同质数据分布的客户端,使我们能够隔离另一个瓶颈:标注数据稀缺及其与分布式主动选择的相互作用。这一视角通过突出即使在通信约束和数据异质性不明显时也会出现的挑战,补充了现有的FL研究。
##### 联邦对比表示学习。
在监督目标(如交叉熵)下对联邦学习有效的方法,对于对比学习则效果显著降低,因为全局自监督目标不能分解为局部目标的总和[zhuang2021divergence]。这种不匹配在应用标准联邦平均时可能导致表示退化。先前工作提出了基于原型的对齐或修改对比目标等适应方法来缓解这一问题[ye2021fedproto,li2021federatedcontrastive]。大量工作致力于解决非IID客户端分布对FCRL的对抗性影响[dong2021federated,zhuang2021divergence,jing2024fedsc,han2022fedx,seo2024relaxed,louizosmutual]。差分隐私下的对比学习也有探索,如[li2022dpcl]。
##### 联邦主动学习。
大多数联邦主动学习(FAL)方法依赖基于模型的评分来估计样本的信息量,这使得它们主要在高预算环境中有效,而在低预算时性能下降。早期工作如[ahmed2020active]采用*分离*AL(S-AL)范式,在每个客户端本地执行选择。相比之下,F-AL [ahn2024federated]支持协作评估,但仅在高预算时显示出明显收益(例如,CIFAR-100上每类150–200个标签)。其他方法通过选择对局部和全局目标都有信息量的样本来解决这种不匹配[kim2022lg,cao2023knowledge,kim2023re],通常关注非IID设置,其中异质性使不确定性估计复杂化[zhang2023affectfal]。最后,在主动联邦学习(AFL)中,决策关注*哪些客户端*进行训练,而不是标注哪些样本[goetz2019active]。
据我们所知,唯一在低预算环境中仍有效的FAL方法是[ono2025exploring]。该方法遵循分离主动学习(S-AL)范式,在每个客户端本地执行样本评估。通过利用针对低预算设置定制的选择标准[hacohen2022active],它在联邦场景中表现良好,并优于现有的FAL基线[ono2025exploring]。因此,我们在实验中将其作为主要基线。
## 3异质性与客户端间协调
标准主动学习平衡两个标准:促进特征空间覆盖的*多样性*和针对低置信度区域的*不确定性*。在联邦设置中,客户端间协调的价值关键取决于数据异质性。我们在主动学习查询选择标准的背景下分析这种相互作用,并强调两个关键效应:
1. 1\.以多样性为中心的选择:在IID数据下,独立客户端倾向于选择重叠样本,需要强有力的协调以避免冗余。相反,异质数据自然地划分空间,减少了对协调的需求。
2. 2\.以不确定性为中心的选择:在IID数据下,独立客户端倾向于学习相似的模型。相反,在非IID数据下,本地模型成为全局不确定性的有偏估计器,使得协调成为必要。这与经典的FL结果[mcmahan2017communication]一致,其中异质性诱导模型分歧。
这些效应共同揭示了联邦主动学习中的*反转脆弱性*:在*IID数据*下,协调对多样性最关键;在*非IID数据*下,协调对不确定性最关键。我们在第3.2节(https://arxiv.org/html/2608.18634#S3.SS2)中形式化了这一关系,重点讨论多样性环境,此时这种反转偏离了标准FL,并在第5.2节(https://arxiv.org/html/2608.18634#S5.SS2)和第5.4节(https://arxiv.org/html/2608.18634#S5.SS4)中进行了实证验证,详细结果见附录C(https://arxiv.org/html/2608.18634#A3)。
### 3\.1符号与预备知识
令X⊆Rd\\mathcal\{X\}\\subseteq\\mathbb\{R\}^\{d\}表示特征空间,Y\\mathcal\{Y\}表示标签空间。考虑KK个客户端,其中客户端k∈\{1,...,K\}k\\in\\\{1,\\ldots,K\\\}拥有局部数据分布Pk\\mathcal\{P\}\_\{k\} over X×Y\\mathcal\{X\}\\times\\mathcal\{Y\}。令
Xk=supp\(PkX\)\\mathcal\{X\}\_\{k\}=\\operatorname\{supp\}\(\\mathcal\{P\}\_\{k\}^\{X\}\)表示客户端k的特征边际的支撑集。
###### 定义 1(协调差距)。
令Φ\(S\)\\Phi\(S\)表示集合S⊆XS\\subseteq\\mathcal\{X\}的选择效用。令bkb\_\{k\}表示客户端k的标注预算,满足
∑k=1Kbk=B\.\\sum\_\{k=1\}^\{K\}b\_\{k\}=B\.定义最优协调效用为
ΦB⋆=maxSk⊆Xk,\|Sk\|=bkk=1,...,KΦ\(⋃k=1KSk\)\.\\Phi\_\{B\}^\{\\star\}=\\max\_\{\\begin\{subarray\}\{c\}S\_\{k\}\\subseteq\\mathcal\{X\}\_\{k\},\\ \|S\_\{k\}\|=b\_\{k\}\\\\ k=1,\\ldots,K\\end\{subarray\}\\}\\Phi\\left\(\\bigcup\_\{k=1\}^\{K}S\_\{k\}\\right\)\。对于每个客户端,令
Sk⋆∈argmaxS⊆Xk\|S\|=bkΦ\(S\)S\_\{k\}^\{\\star\}\\in\\arg\\max\_\{\\begin\{subarray\}\{c\}S\\subseteq\\mathcal\{X\}\_\{k\}\\\\ \|S\|=b\_\{k\}\\end\{subarray\}\\}\\Phi\(S\)表示其局部最优选择。协调差距为
ΔK=ΦB⋆−Φ\(⋃k=1KSk⋆\)\.\\Delta\_\{k\}=\\Phi\_\{B\}^\{\\star\}\-\\Phi\\left\(\\bigcup\_\{k=1\}^\{K}S\_\{k\}^\{\\star\}\\right\)\。\(1\)
### 3\.2数据异质性与多样性
我们表明,协调的效用随着客户端间选择重叠的增加而增加,当异质性分隔了它们的可达区域时则消失。我们使用单元覆盖模型形式化这种关系。
令共享嵌入空间被划分为MM个单元C=\{C1,...,CM\},\\mathcal\{C\}=\\\{C\_\{1\},\\ldots,C\_\{M\}\\\},代表诸如集群或高密度邻域之类的区域。定义覆盖效用
Φ\(S\)=∑m=1M1\{S∩Cm≠∅\}\.\\Phi\(S\)=\\sum\_\{m=1\}^\{M\}\\mathbf\{1\}\\\{S\\cap C\_\{m\}\\neq\\emptyset\\\}\。\(2\)对于每个客户端,定义可达单元集
Ak=\{m:Cm∩Xk≠∅\},A\_\{k\}=\\\{m:C\_\{m\}\\cap\\mathcal\{X\}\_\{k\}\\neq\\emptyset\\\},\(3\)以及单元选择概率
ak,m=Pr\(Sk⋆∩Cm≠∅\)\.a\_\{k,m\}=\\Pr\(S\_\{k\}^\{\\star\}\\cap C\_\{m\}\\neq\\emptyset\)\。\(4\)因此,当m∉Akm\\notin A\_\{k\}时,ak,m=0a\_\{k,m\}=0。
我们从期望协调差距Δ ̄K\\bar\{\\Delta\}\_\{k\}开始:
Δ ̄K\\displaystyle\\bar\{\\Delta\}\_\{k\}=\\displaystyle=E\[ΔK\]=E\[ΦB⋆\]−E\[Φ\(⋃k=1KSk⋆\)\]\\displaystyle\\mathbb\{E\}\[\\Delta\_\{k\}\]=\\mathbb\{E\}\[\\Phi\_\{B\}^\{\\star\}\]\-\\mathbb\{E\}\[\\Phi\(\\\bigcup\_\{k=1\}^\{K}S\_\{k\}^\{\\star\}\\\}\)\]\(5\)=\\displaystyle=E\[ΦB⋆\]−∑k=1KE\[Φ\(Sk⋆\)\]\\displaystyle\\mathbb\{E\}\[\\Phi\_\{B\}^\{\\star\}\]\-\\sum\_\{k=1\}^\{K\}\\mathbb\{E\}\[\\Phi\(S\_\{k\}^\{\\star\}\)\]\+∑k=1KE\[Φ\(Sk⋆\)\]−E\[Φ\(⋃k=1KSk⋆\)\]\\displaystyle\+\\sum\_\{k=1\}^\{K\}\\mathbb\{E\}\[\\Phi\(S\_\{k\}^\{\\star\}\)\]\-\\mathbb\{E\}\[\\Phi\(\\\bigcup\_\{k=1\}^\{K}S\_\{k\}^\{\\star\}\\\}\)\]\(6\)式(5) (https://arxiv.org/html/2608.18634#S3.E5)中的表达式捕捉了两种方法优化的目标之间的差异。在极低预算环境中,我们假设每次选择——无论是局部还是全局——都是高效的,每个单元最多选择一个点。因此,未协调但高效的选择产生E\[ΦB⋆\]≈∑k=1KE\[Φ\(Sk⋆\)\]\\ma相似文章
一轮足矣:面向任务异构多标签医学图像分类的解析联邦学习
提出了一种解析联邦学习框架,仅需一轮或两轮通信即可完成任务异构下的多标签医学图像分类,在ChestXray14数据集上以高达18.44的BACC和13.24的AUC分数优于现有方法。
同质与异构数据分布下联邦学习聚合策略的比较研究
本文对各种联邦学习聚合策略进行了全面的实验比较,分析了它们在homogeneous和heterogeneous数据分布下的性能和效率。
生成位置的重要性:面向标签偏斜联邦学习的预算感知合成增强
提出FedEAS,一种用于联邦学习中合成数据增强的预算感知策略,为每个客户端分配一个熵自适应的每类生成预算,在将生成成本降低94.1%的同时,恢复大部分完全类别平衡的准确性增益。
用于目标检测的联邦学习:无需集中数据即可实现协作无人机学习
将联邦学习应用于无人机编队的目标检测,无需集中航拍图像即可实现协作训练,在保护隐私和降低带宽的同时,性能接近集中式训练。
联邦嵌套学习:用于测试时自适应的自指记忆协同训练
提出联邦嵌套学习(FedNL)框架,将联邦学习重构成三级嵌套优化系统,实现自指记忆的协同训练以支持测试时自适应,从而处理非独立同分布数据和长尾分布。