在时序网络上的去中心化联邦学习:异质性的作用

arXiv cs.LG 论文

摘要

本文分析了时序网络上去中心化联邦学习中结构和时间异质性的影响,表明忽略这些异质性会导致不切实际的快速收敛,而真实网络会减慢扩散速度。

arXiv:2607.03171v1 公告类型: 新 摘要: 基于点对点通信的去中心化联邦学习越来越多地被提出用于设备上的机器学习模型训练,它承诺保护隐私、通信高效的训练过程,且没有单点故障风险。然而,在这种完全去中心化环境中,结构和时间不均匀性的作用仍未被充分理解。本文研究了在聚合过程中模型参数局部平均时这些不均匀性的影响。我们表明,去中心化联邦学习过程在早期阶段和后期稳态极限中,都受与时序网络上惰性随机游走扩散过程相同的动力学支配。基于这一映射,我们证明去中心化联邦学习中使用的典型实验场景会导致不切实际的快速收敛,因为它忽略了通信网络中固有的时间和结构不均匀性。我们分析了真实世界的时序网络,发现不均匀性通常会显著减慢扩散速度,从而减慢收敛过程。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:41

# 时序网络上的去中心化联邦学习:异质性的作用

来源:https://arxiv.org/html/2607.03171

Arash Badie\-Modiri, Chiara Boldrini, Lorenzo Valerio, János Kertész 和 Márton Karsai

Arash Badie\-Modiri, Chiara Boldrini 和 Lorenzo Valerio 任职于国家研究委员会(比萨)  
Arash Badie\-Modiri, János Kertész 和 Márton Karsai 任职于中欧大学(维也纳)  
Arash Badie\-Modiri 任职于阿尔托大学(埃斯波)  
Márton Karsai 任职于匈牙利科学院 Rényi 数学研究所(布达佩斯)

###### 摘要

基于点对点通信的去中心化联邦学习,越来越多地被提议用于在设备本地训练机器学习模型,它有望实现隐私保护、通信高效且无单点故障风险的训练过程。然而,在这种完全去中心化的场景中,结构性和时序性不均匀性的作用仍未被充分理解。在此,我们研究了当模型参数在聚合过程中被局部平均时这些不均匀性的影响。我们证明,无论是在早期阶段还是在平稳极限下,去中心化联邦学习过程都受控于与时序网络上的惰性随机游走扩散过程相同的动力学。基于这一映射,我们证明,由于忽略了通信网络中固有的时序和结构性不均匀性,去中心化联邦学习中常用的典型实验场景会导致不切实际的快速收敛。我们分析了真实世界的时序网络,发现不均匀性通常会显著减慢扩散速度,从而减慢收敛过程。

## I. 引言

去中心化联邦学习已成为一种强大的范式,它允许各实体在不共享原始数据或无需中央协调的情况下联合训练机器学习模型[1](https://arxiv.org/html/2607.03171#bib.bib1)。这种方法通常被研究用于数据中心场景,例如在医疗环境中,多个中心贡献患者数据以联合训练模型,而无需直接共享敏感信息[2](https://arxiv.org/html/2607.03171#bib.bib2), [3](https://arxiv.org/html/2607.03171#bib.bib3)。然而,去中心化联邦学习对于终端用户设备(如智能手机、物联网设备[4](https://arxiv.org/html/2607.03171#bib.bib4)或自动驾驶车辆[5](https://arxiv.org/html/2607.03171#bib.bib5))也可能非常有益,这些设备可以利用本地数据为模型训练做贡献,而无需共享原始和私有数据。与数据中心场景(其中强大的网络基础设施支持可靠、持久和高带宽连接)不同,边缘设备以机会方式进行通信:它们不可预测地离线、在空间中移动,并且可能仅在物理邻近或共享基础设施允许的情况下进行交互。这些限制使得通信的结构和时序具有固有的不规则性和异质性。

早期的工作在理想化假设下处理了该场景,即基于简单网络拓扑的同步点对点通信[6](https://arxiv.org/html/2607.03171#bib.bib6), [7](https://arxiv.org/html/2607.03171#bib.bib7)。尽管最近的研究开始通过结合结构性和时序异质性的各个方面来放松这些假设[8](https://arxiv.org/html/2607.03171#bib.bib8), [9](https://arxiv.org/html/2607.03171#bib.bib9), [10](https://arxiv.org/html/2607.03171#bib.bib10), [11](https://arxiv.org/html/2607.03171#bib.bib11),但所考虑的形式仍然范围狭窄。这些工作强调了异质性(如异质度分布、社区结构和间歇性通信故障)对去中心化学习系统收敛行为的影响。然而,先前的工作在很大程度上将异质性视为静态拓扑变化(不规则但固定的图)或一次性随机诱导的中断(例如,链路或节点独立随机失效)。这两种情况都无法捕捉真实世界时序网络中存在的更丰富的动力学,在这些网络中,通信模式可能是突发性的、时序相关的,并且受到具有记忆性的过程的影响,这些过程以非平凡的方式耦合了结构和时序。

与此同时,网络科学文献已经发展出对复杂网络上动力学过程的丰富理论理解,包括在具有复杂结构性和时序模式的系统上的扩散和传播(参见[12](https://arxiv.org/html/2607.03171#bib.bib12))。尽管这些模型为分析信息在现实网络中的传播提供了强大工具,但它们通常独立于去中心化学习等特定应用进行研究。要弥合这一差距,需要将学习动态与时序网络上扩散过程的良好理解行为联系起来。

在这项工作中,我们通过将去中心化联邦学习建模为时序通信网络上的扩散过程来建立这种联系。我们分析了局部模型参数如何通过随时间变化的连接性进行传播,在一个统一框架内同时捕捉异步通信和复杂的时序异质性。我们通过两个互补的分析来完成这项工作:(i) 在早期同步阶段,其中聚合主导局部学习,我们通过时序网络上的随机游走来描述模型收敛的速度;(ii) 在平稳状态下,我们将局部训练步骤引入的扰动建模为独立扩散的脉冲,这些脉冲受相同的扩散动力学支配。我们在合成网络(分别引入空间嵌入、爆发性更新过程和自激振荡时序动态)以及来自三个不同部署场景的真实世界接触网络上验证了该框架,并使用微正则随机化参考模型[13](https://arxiv.org/html/2607.03171#bib.bib13)来分离特定异质性类别的贡献。

我们的分析得出三个关键发现:

- 无论是早期阶段还是平稳阶段,学习参数的传播都受控于与底层时序网络上的惰性随机游走扩散过程相同的动力学,为两个区域中去中心化联邦学习的收敛提供了统一且可解析处理的描述。
- 结构性和时序异质性普遍会减慢这一扩散过程:较低维度的空间嵌入、更重尾的间隔事件时间分布以及更强的自激振荡都会将收敛推向更慢的区域,并且在多个异质性同时出现的真实世界网络中,它们的影响会叠加。
- 去中心化联邦学习研究中使用标准实验设置(具有规则通信间隔的随机图)系统性地偏向于不切实际的快速收敛;在我们研究的真实世界网络中,一个具有相同节点数、连接数和总事件数的完全随机化基线,其混合速度比经验网络快数十倍到一百倍以上。

综上所述,这些结果表明网络异质性并不是一个次要的建模细节,而是收敛速度的主要决定因素,对系统设计、协议评估以及基于仿真的基准测试的解释具有直接影响。

本文的其余部分组织如下。第二节[II](https://arxiv.org/html/2607.03171#S2)回顾了去中心化联邦学习和时序网络上动力学过程的相关工作。第三节[III](https://arxiv.org/html/2607.03171#S3)介绍了系统模型,形式化了去中心化联邦学习设置和时序网络框架。第四节[IV](https://arxiv.org/html/2607.03171#S4)建立了去中心化联邦学习与惰性随机游走扩散之间的联系,涵盖了早期同步动态和平稳阶段对局部学习扰动的响应。第五节[V](https://arxiv.org/html/2607.03171#S5)展示了我们在合成网络和真实世界网络上的实验结果,量化了结构性和时序异质性对收敛的影响。最后,第六节[VI](https://arxiv.org/html/2607.03171#S6)讨论了我们的发现对未来的影响以及未来工作的方向。

## II. 相关工作

去中心化联邦学习基于真实世界的通信网络,这些网络通常同时包含多种类型的时序和结构性异质性[14](https://arxiv.org/html/2607.03171#bib.bib14)。对时序网络的研究表明,仅考虑节点间接触的时序和顺序(而不是使用聚合的静态网络作为替代),就可能强烈影响传播过程的速度[15](https://arxiv.org/html/2607.03171#bib.bib15), [16](https://arxiv.org/html/2607.03171#bib.bib16)。这一点对于扩散过程(如随机游走)也同样成立,但与流行病传播过程不同,扩散过程中“传播者”的数量是守恒的[17](https://arxiv.org/html/2607.03171#bib.bib17)。时序异质性通常表现为突发性和/或相关的通信动态以及整体激活频率的异质性,在现实世界中经常出现[18](https://arxiv.org/html/2607.03171#bib.bib18), [19](https://arxiv.org/html/2607.03171#bib.bib19)。为了理解这些系统的行为,我们必须揭示时序不均匀性在其动力学中的作用[16](https://arxiv.org/html/2607.03171#bib.bib16), [20](https://arxiv.org/html/2607.03171#bib.bib20)。类似地,大量关于复杂网络的文献致力于理解结构性异质性的作用。几十年来,网络的异质度序列[21](https://arxiv.org/html/2607.03171#bib.bib21), [22](https://arxiv.org/html/2607.03171#bib.bib22)、优先连接[23](https://arxiv.org/html/2607.03171#bib.bib23)和小世界特性[24](https://arxiv.org/html/2607.03171#bib.bib24), [25](https://arxiv.org/html/2607.03171#bib.bib25)一直是网络科学家关注的焦点。其他工作研究了空间限制对网络的影响,表明许多真实世界网络的结构和连接性受到这些系统嵌入有限维空间这一事实所带来的限制[26](https://arxiv.org/html/2607.03171#bib.bib26)。这一研究通过网络中观结构的作用分析得到了补充,例如模体(过度表现的局部连接模式)[27](https://arxiv.org/html/2607.03171#bib.bib27), [28](https://arxiv.org/html/2607.03171#bib.bib28)和社区结构[29](https://arxiv.org/html/2607.03171#bib.bib29), [30](https://arxiv.org/html/2607.03171#bib.bib30)。

结构性和时序异质性可以结合。例如,时序模体捕捉的是过度表现的*时序和结构*连接模式,这些模式不一定能在网络的静态聚合中检测到[31](https://arxiv.org/html/2607.03171#bib.bib31)。

现在,我们概述去中心化联邦学习(DFL)的相关文献,它用点对点通信取代了经典FL的客户端-服务器架构,其中客户端交替进行局部训练和在图上的邻域模型混合。从算法上讲,DFL与去中心化随机优化密切相关:收敛将随机梯度与混合算子的连接性和谱性质联系起来。规范的基线方法如D-PSGD[6](https://arxiv.org/html/2607.03171#bib.bib6)和D2[7](https://arxiv.org/html/2607.03171#bib.bib7)形式化了这种耦合,后续工作通过压缩交换来研究通信约束[32](https://arxiv.org/html/2607.03171#bib.bib32)。实证和方法论研究进一步表明,即使在静态图中,结构性异质性(例如瓶颈、模块化)也可能主导早期对齐并影响鲁棒性和最终准确率[9](https://arxiv.org/html/2607.03171#bib.bib9), [11](https://arxiv.org/html/2607.03171#bib.bib11),从而推动了拓扑感知评估和无协调协议[33](https://arxiv.org/html/2607.03171#bib.bib33)以及面向中断的分析[8](https://arxiv.org/html/2607.03171#bib.bib8);调查总结了协议选择和开放性挑战[1](https://arxiv.org/html/2607.03171#bib.bib1)。

混合步骤根植于控制和分布式计算。平均共识理论将一致速率与平均权重的谱性质联系起来[34](https://arxiv.org/html/2607.03171#bib.bib34),而DFL中使用的随机成对交换与经典的gossip方案一致[35](https://arxiv.org/html/2607.03171#bib.bib35)。切换拓扑共识建立了条件(例如,时间窗口内的联合连接性),通过这些条件,随机矩阵的乘积保证了在时变交互下的一致性[36](https://arxiv.org/html/2607.03171#bib.bib36), [37](https://arxiv.org/html/2607.03171#bib.bib37)。相关的分布式优化方法明确分离了优化误差和不一致性误差[38](https://arxiv.org/html/2607.03171#bib.bib38);然而,它们的规律性假设(有界延迟、足够频繁的交换、良好的切换行为)可能不适用于经验接触轨迹。

在DFL内部,多项工作从协议层面解决了通信异质性和时间变化问题。Hu *等人*提出分段gossip以更好地利用无服务器训练下的异质链路容量[39](https://arxiv.org/html/2607.03171#bib.bib39),而Hegedűs *等人*经验证明gossip学习在不同场景下可与集中式FL相媲美[40](https://arxiv.org/html/2607.03171#bib.bib40)。针对移动性驱动的变化,Lu *等人*通过Metropolis-Hastings权重和秘密共享研究了时变图上的隐私保护DFL[41](https://arxiv.org/html/2607.03171#bib.bib41)。在无线环境中,Jeong *等人*提出了对故障鲁棒的异步去中心化学习[42](https://arxiv.org/html/2607.03171#bib.bib42),Nguyen *等人*使用梯度追踪和动量(DSGTm-TV)结合行/列随机混合分析了时变*有向*网络[43](https://arxiv.org/html/2607.03171#bib.bib43)。除了“在给定网络上的DFL”之外,Zhang *等人*设计了用于节能DFL的时变混合矩阵[44](https://arxiv.org/html/2607.03171#bib.bib44),Li *等人*针对时变和异构的移动计算网络[45](https://arxiv.org/html/2607.03171#bib.bib45)。

本手稿提供了一个互补的网络科学视角:它将成对DFL混合建模为时序网络上的扩散,并将限制收敛的行为与时间混合和局部化联系起来。基于早期静态图中同步受惰性随机游走混合支配的观察[11](https://arxiv.org/html/2607.03171#bib.bib11),本文将其推广到异步接触序列,并提出逆参与率(IPR)的衰减作为时间扩散中弛豫和局部化的诊断指标。这一参照系解释了为什么常见的评估集(均匀随机图中的规则通信)可能通过抑制真实轨迹中观察到的结构性和时序异质性而高估收敛速度,并激励了在异构时序环境中采用拓扑/时间自适应的通信策略。

相似文章

异构时间分辨率下脉冲神经网络的联邦学习

arXiv cs.LG

本文提出了一种针对脉冲神经网络的联邦学习框架,解决了边缘设备上异构时间分辨率的挑战,能够在处理时间不匹配的同时实现无需共享原始数据的协作训练。

FoggyTrust: 基于分层信任网络的鲁棒联邦学习

arXiv cs.LG

FoggyTrust是FLTrust的分层扩展,它将信任计算本地化到雾节点,提升了异构联邦学习场景下对拜占庭攻击的鲁棒性,在CIFAR-10上针对Krum和Trim等具有挑战性的攻击实现了超过50%的性能提升。

扩散模型的时间差分学习

arXiv cs.LG

本文提出了一种用于扩散模型的时间差分(TD)学习目标,该目标在去噪轨迹上强制跨时间一致性。它将去噪重新表述为强化学习中的策略评估问题,展示了在样本质量(FID)上的显著改进,尤其适用于少步采样器。