SWB-DM:用于部分参与下拜占庭鲁棒联邦学习的校准切片-瓦瑟斯坦重心聚合器与延迟动量缓存

arXiv cs.LG 论文

摘要

本文介绍了SWB-DM,一种用于联邦学习的鲁棒聚合方法,该方法结合了切片瓦瑟斯坦重心和延迟动量缓存,以有效处理拜占庭攻击和部分参与问题。

arXiv:2609.16099v1 公告类型:新 摘要:联邦学习的鲁棒聚合方法悄然依赖于一个脆弱的假设:即在给定轮次中出现的参与者是完整人口的公平样本。实际上,它们很少如此。当每轮只有少数客户端参与时,即使是一小部分对手也能主导该样本,并悄无声息地使坐标中位数、Krum、Bulyan和裁剪均值所依赖的有限样本保证失效。 我们引入SWB-DM来直接解决这个问题。SWB将客户端更新的每个切片视为一维分布,跨客户端计算裁剪的瓦瑟斯坦重心,并通过基于中位点的规范固定步骤恢复坐标身份——这是我们开发的一种启发式方法,我们不声称它属于标准最优传输理论。然后,DeMoA风格的延迟动量每轮缓存整个客户端群体的更新,将鲁棒性与恰好被采样的参与者解耦。裁剪比例校准不是表面功夫:在腐败水平下,欠裁剪会导致崩溃,而一个正确校准的模型则能生存。 在448种CIFAR-10配置、CIFAR-100、FEMNIST以及一个500客户端可扩展性运行中,我们发现了几种机制上不同的失败模式。偶数样本坐标中位数退化为确定性错误答案。Krum悄无声息地违反了其自身n大于2f+2的前提条件并无声地发散。Bulyan的n大于等于4f+3阈值产生了一个清晰的通过/失败边界。在攻击方面,IPM比ALIE更可靠地击败了顺序统计防御——包括SWB——这一点通过δ空间测量与收敛边界得到证实。 SWB-DM的缓存确实带来了预热成本,但将所有基线扩展到相同的轮次预算后,其CIFAR-10增益显得异常巨大。在CIFAR-100上,FLTrust受益更多——原因与缓存完全无关。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:41

# SWB-DM:一种用于部分参与下拜占庭鲁棒联邦学习的、带有延迟动量缓存的校准切片Wasserstein重心聚合器
来源:https://arxiv.org/html/2609.16099
1Saranraj S\. 人工智能与机器学习系,Vel Tech Rangarajan Dr\. Sagunthala 科技研发学院,金印度,印度saranrajsnkr@gmail\.com
2Saranya M\. S\. 人工智能与机器学习系助理教授,Vel Tech Rangarajan Dr\. Sagunthala 科技研发学院,金印度,印度saranyams@veltech\.edu\.in
3Alex David S\. 人工智能与机器学习系教授,Vel Tech Rangarajan Dr\. Sagunthala 科技研发学院,金印度,印度adstechlearning@gmail\.com
4Ajay Kumar A\. 人工智能与机器学习系,Vel Tech Rangarajan Dr\. Sagunthala 科技研发学院,金印度,印度vtu24379@veltech\.edu\.in

###### 摘要

大多数用于联邦学习的鲁棒聚合方法都是在一个隐含假设下设计和进行基准测试的:即在任何给定轮次中采样的客户端大致代表了完整总体。在实践中,部分参与打破了这一假设。即使拜占庭客户端的总体比例不大,每轮的小样本也很容易被对手主导——这足以悄然违反坐标中值、Krum、Bulyan和修剪均值等方法所依赖的有限样本保证。我们引入了SWB-DM,它结合了两种思想。第一种是SWB,一种随机切片聚合器,它将客户端更新向量的每个块视为一个一维经验分布,跨客户端计算修剪后的Wasserstein重心,然后通过基于中值点的校准步骤恢复坐标恒等性——这是我们自己开发的一种启发式方法,我们并不声称它属于标准最优传输理论。第二种是DeMoA风格的延迟动量缓存,每轮聚合整个客户端总体,而不仅仅是碰巧被采样的客户端。将SWB的修剪率校准到假设的腐败水平至关重要,而非装饰性的:在腐败水平下,修剪不足会导致崩溃,而适当校准的版本则能承受。我们在448种CIFAR-10配置(7种方法,16种攻击-腐败组合,2种参与率,2个种子)上评估了SWB-DM,并辅以CIFAR-100、FEMNIST和一个500客户端的可扩展性实验。浮现出来的并非单一的失败模式,而是几种机制上不同的模式:当样本量小且为偶数时,中值会退化为确定的错误答案;Krum可能会悄无声息地违反其自身的 n>2f+2 前提条件并无预警地发散;而Bulyan的 n≥4f+3 阈值则产生了尖锐且可复现的通过/失败边界。在攻击方面,IPM比ALIE更可靠地击败了顺序统计防御——包括SWB——这一发现我们通过针对半形式化收敛界限的delta空间误差测量加以证实。SWB-DM的缓存确实带来了真实的预热成本:所有64种CIFAR-10和所有8种CIFAR-100配置在获得更多轮次后都有所改进,且这种成本的规模恰好如缓存机制预测的那样与参与率和任务难度相关。为提供参考,我们将所有基线方法扩展到相同的轮次预算,发现SWB-DM在CIFAR-10上的增益不成比例地大——不过在CIFAR-100上,FLTrust从额外轮次中获益更多,原因与缓存完全无关。

###### 索引关键词:

联邦学习,拜占庭鲁棒性,切片最优传输,延迟动量,鲁棒聚合,部分参与,对抗性机器学习

††题注:## I引言

联邦学习的承诺在于,可以在众多客户端之间训练一个共享模型,而无需汇集他们的原始数据——但其反面是,服务器必须接受无法独立验证的梯度更新\[2 (https://arxiv.org/html/2609.16099#bib.bib2)\]。标准的回应是用旨在限制少数腐败客户端影响结果的聚合规则取代FedAvg的简单加权平均\[1 (https://arxiv.org/html/2609.16099#bib.bib1)\]:坐标中值或修剪均值\[3 (https://arxiv.org/html/2609.16099#bib.bib3)\],Krum的最近邻选择\[2 (https://arxiv.org/html/2609.16099#bib.bib2)\],Bulyan将两者分层组合的方法\[4 (https://arxiv.org/html/2609.16099#bib.bib4)\],或者FLTrust使用服务器持有的参考进行余弦相似度评分的方法\[5 (https://arxiv.org/html/2609.16099#bib.bib5)\]。每一种都带有一个前提条件——一个关于在场对手数量的假设上界,并且在某些情况下,修剪参数必须超过真实腐败比例——而这些前提条件几乎总是针对完整客户端总体陈述的,而非实际参与任何单轮的更小组。

在部分参与下,这一区别至关重要。总体腐败比例 β 告诉我们关于实际进入单轮样本 n 中的攻击者数量的信息为零,而样本 n 通常远小于完整总体 N。简单的采样噪声很容易在任何给定轮次中将有效腐败推高到远超 β 的水平——而一个策略性地跳过不利轮次的主动攻击者会造成更大的问题。

在这两种情况下,聚合器的安全前提条件都会悄然失效,即使你使用精确的总体参数配置了系统。Otsuka、Takezawa 和 Yamada 通过延迟动量聚合(DeMoA)直接应对此问题\[8 (https://arxiv.org/html/2609.16099#bib.bib8)\]:通过缓存每个客户端的最新更新,并每轮在整个缓存上进行聚合,服务器完全从样本大小方程中移除了选择运气。

我们的贡献如下:

1. 1\. SWB,一种新的聚合器,它获取客户端更新的一个旋转块,将其视为一维经验分布,并计算跨客户端的修剪后Wasserstein重心。坐标恒等性——在使一维传输可处理的排序步骤中丢失——通过一个我们预先声明的*Wasserstein-中值点校准*步骤来恢复:这是我们自己的启发式方法,而非借鉴自成熟的切片最优传输文献(第IV节 (https://arxiv.org/html/2609.16099#S4))。
2. 2\. SWB-DM,将SWB与DeMoA风格的缓存配对,并展示将修剪率校准到假设的腐败水平并非可选——修剪不足的变体在腐败水平下会崩溃,而适当校准的版本能轻松处理。
3. 3\. 一个系统的448种配置的CIFAR-10研究(7种方法,16种受约束的攻击-腐败组合,2种参与率,2个种子),辅以CIFAR-100和FEMNIST泛化实验以及一个500客户端的可扩展性试验。至关重要的是,我们跟踪了每轮诊断指标——准确率、参数范数、预测类别直方图——这使我们能够剖析中值、Krum和Bulyan的失败机制,而不是将它们都埋没在一个总的准确率数字下。
4. 4\. 一个半形式化收敛界限,通过两种结构不同的自适应攻击(ALIE和IPM)进行验证,揭示了它们的误差特征在性质上不同:ALIE的是非单调的,而IPM的是严格递增的,这在很大程度上解释了为什么IPM在我们的网格中击破了更多防御。
5. 5\. 对SWB-DM缓存预热成本的诚实核算,通过将所有六个基线方法扩展到相同的轮次预算来置于背景中。在CIFAR-10上,SWB-DM的增益不成比例地大;然而在CIFAR-100上,FLTrust获益更多——原因完全与缓存无关。

## II相关工作

FedAvg与鲁棒聚合。FedAvg\[1 (https://arxiv.org/html/2609.16099#bib.bib1)\]简单地对客户端更新按样本数加权平均,即使对单个无界对抗性贡献也零保护。坐标中值和修剪均值\[3 (https://arxiv.org/html/2609.16099#bib.bib3)\]限制了每个坐标的影响,但它们需要一定数量的诚实样本来实现这一点:当 n 小且为偶数时,中值惯例只是选择两个中间值中较低的一个,这是确定性的,没有真正的鲁棒性。Krum\[2 (https://arxiv.org/html/2609.16099#bib.bib2)\]选择与其 n-f-2 个最近邻的总距离最小的单个更新,仅当 n>2f+2 时能容忍 f 个对手。Bulyan\[4 (https://arxiv.org/html/2609.16099#bib.bib4)\]在修剪均值之上叠加迭代式Krum选择,将要求收紧至 n≥4f+3。FLTrust\[5 (https://arxiv.org/html/2609.16099#bib.bib5)\]采用根本不同的方法:它通过每个客户端与服务器在自身数据上计算的小微参考更新的余弦相似度进行评分,然后在平均之前重新缩放通过的客户端更新以匹配服务器参考范数。与其他方法不同,它不依赖于最小样本量才能运作。

拜占庭攻击。标签翻转、符号翻转和加性高斯噪声在不适应防御的情况下损坏更新。ALIE\[6 (https://arxiv.org/html/2609.16099#bib.bib6)\]计算在给定 (n,f) 下,保持在鲁棒统计量接受带内的最大扰动。IPM\[7 (https://arxiv.org/html/2609.16099#bib.bib7)\]反转诚实梯度方向并匹配范数。尽管ALIE具有分析复杂性,但IPM在我们的实验中击败了更多聚合器。

延迟动量聚合。DeMoA\[8 (https://arxiv.org/html/2609.16099#bib.bib8)\]是最直接相关的先前工作。它在服务器端维护每个客户端最新更新的缓存;每轮只有被采样的客户端刷新其条目。然后聚合器在包含 N 个条目的完整缓存上运行,无论采样运气如何,都将有效腐败保持在总体水平 β 附近。这是我们为SWB-DM采用的缓存机制。我们的贡献是将其与不同的内部聚合器配对,并描述由此产生的预热动态。

切片Wasserstein重心。形式化的SWB\[10 (https://arxiv.org/html/2609.16099#bib.bib10)\]在投影到随机1D直线上的 N 个概率分布上计算重心,其中最优传输具有闭合形式。联邦聚合并不适合此框架——每个客户端贡献一个点,而不是一个分布。第IV节 (https://arxiv.org/html/2609.16099#S4) 描述了我们通过在块内切片*坐标*如何解决此问题。这样做产生了一个先前传输工作中未解决的坐标恒等性问题;我们在第IV节 (https://arxiv.org/html/2609.16099#S4) 提出了解决方案。

## III威胁模型

一个服务器协调 N 个客户端进行 T 轮通信。在每一轮中,一个大小为 n=pN 的子集 S_t 以参与率 p 被采样。总体中固定比例 β 是拜占庭式的,并且在整个运行过程中保持不变,尽管那些对手中哪些碰巧进入 S_t 从轮到轮各不相同。对于任何对可容忍对手数量有前提条件的聚合器(Krum、Bulyan),我们设置 f=⌊nβ⌋——这是一个固定、总体级别的估计值,是在无法访问真实每轮攻击者数量的情况下计算出来的。赋予防御者关于每轮谁真正恶意的先知知识是不现实的,并且会不公平地使那些保证依赖于知道数量的方法获得优势。

图1:提议的SWB-DM框架的架构,集成了部分客户端参与、拜占庭威胁注入、延迟动量全总体缓存和校准切片Wasserstein重心聚合。图1 (https://arxiv.org/html/2609.16099#S3.F1) 展示了整体架构。每一轮通信,全局服务器选择一部分客户端参与。本地训练后,样本中的任何拜占庭客户端都可能使用标签翻转、符号翻转、高斯噪声、ALIE或IPM攻击来破坏其更新。延迟动量缓存随后刷新参与客户端的条目,同时保留其他所有人的最新更新。SWB通过一个包含分块、随机正交旋转、逐行排序、校准修剪、基于中值点的校准、逆旋转和多视图平均的流水线处理完整的缓存总体。所得的鲁棒聚合结果将替代进入下一轮的全局模型。

## IV方法

### IV-A SWB:一种随机切片的、Wasserstein启发的聚合器

给定 n 个客户端向量 {δ1,...,δn}⊂RD(在我们的实现中,这些是提交用于聚合的完整本地训练模型状态,而非与全局模型的增量)——我们将它们分成大小为 C 的块。对于每个块,让 X∈Rn×C 是堆叠 n 个客户端值的矩阵。SWB 然后按如下步骤进行:

1. 1\. 绘制一个随机正交矩阵 Q∈RC×C(通过对高斯随机矩阵进行QR分解获得)并投影:Y=XQ。
2. 2\. 独立排序每个客户端的 Y 行。这是使一维最优传输可处理的步骤:单个客户端块内的 C 个投影值被视为来自一个经验分布的样本。
3. 3\. 在每个排序位置跨客户端计算修剪均值,丢弃顶部和底部 ⌊n⋅r⌋ 个值,以在排序秩空间中产生一个重心行 b∈RC。
4. 4\. 中值点校准。步骤2中的排序破坏了每个客户端从坐标到秩的原始映射。为了解决这个问题,我们识别中值点客户端 m=argmin_i ‖sort(Yi)−b‖2——即其排序块最接近重心的客户端——并借用该客户端的秩到坐标的置换,将 b 放回正确的坐标位置,然后用 Q⊤ 旋转回去。

我们重复此过程 P=2 次独立随机旋转并平均结果。修剪率设置为 r=min(0.45,β+0.05),直接将其与假设的腐败水平挂钩(第VI节 (https://arxiv.org/html/2609.16099#S6))。

步骤4是针对我们场景的;标准的SWB文献在无序点云上操作,坐标恒等性不是问题。一种替代方法——通过根据原始坐标秩对重心重新排序来恢复恒等性——未能产生可用的聚合结果。中值点方法从最近的真实客户端借用秩到坐标的置换。它在经验上表现良好,但缺乏形式化保证。我们在全文中称SWB为*启发自*形式化SWB框架,而非其实例。

### IV-B 延迟动量缓存

让 ci(t) 表示服务器在第 t 轮缓存的客户端 i 的最新本地训练模型状态副本:对于 i∈St,ci(t)←si(t),其中 si(t) 是客户端 i 提交的训练状态;否则 ci(t)=ci(t−1)。然后服务器*用*在完整缓存上的聚合结果*替换*全局模型,w(t+1)=Agg({c1(t),...,cN(t)}),对于任何基础聚合器 Agg(⋅)。SWB-DM 使用 SWB 作为该基础聚合器;我们也测试了一个使用普通中值的延迟动量基线,以区分缓存的贡献与内部统计量的贡献。

## V理论分析

我们采用标准...

相似文章

量子联邦学习的稳定聚合方法

arXiv cs.AI

本文提出了一种新颖的自洽中点聚合方法,用于实现稳定的量子联邦学习,解决了数据异质性和量子噪声等挑战,并在真实量子机器上进行了验证。

Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients

arXiv cs.LG

This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.