面向异构分布式系统隐私保护建模的个性化联邦层级高斯过程

arXiv cs.LG 论文

摘要

本文介绍了pFedHGP,一种个性化的联邦学习方法,使用层级高斯过程对异构分布式系统进行概率建模,同时通过联邦变分推断保护隐私。

arXiv:2609.19337v1 公告类型:新 摘要:我们提出了个性化联邦层级高斯过程(pFedHGP),用于在数据分布在异构客户端时进行概率回归和分类。每个客户端的潜在函数分解为:(i) 一个共享全局组件,(ii) 一个共享全局核结构的客户端特定偏差,以及(iii) 一个灵活的局部残差。稀疏诱导变量近似和联邦变分推断保持原始数据本地化,而服务器仅同步共享组件的低维统计信息。完整的预测分布支持不确定性感知决策。在应用研究中,pFedHGP在使用13.77%标记循环的压力吨位监控中实现了完美的故障分类,并在联邦空气质量建模中恢复了地理区域,无需集中站点级时间序列。一个瞬时线性混合模型的观点将层级与多输出高斯过程联系起来,用于相关传感器。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:51

# 个性化联邦分层高斯过程:隐私保护下的异构建模方法  
来源:https://arxiv.org/html/2609.19337  
Hao Yan†† thanks: Arizona State University\. Email: haoyan@asu\.edu\.  

###### 摘要  
我们提出**个性化联邦分层高斯过程(pFedHGP)**,用于在数据分布式存储于异构客户端的场景中进行概率回归与分类。每个客户端的隐函数分解为三个部分:(i) 共享全局组件,(ii) 与全局核结构一致的客户端特有偏差,以及(iii) 灵活的局部残差。通过稀疏诱导变量近似与联邦变分推断,原始数据始终保留在客户端,服务器仅同步共享组件的低维统计量。完整的预测分布支持不确定性感知决策。在应用研究中,pFedHGP在压力机吨位监测中仅使用13.77%的标注周期即实现完美的故障分类,并在联邦空气质量建模中无需集中站点时间序列数据即可恢复地理分区。基于瞬态线性混合模型的视角,我们建立了该分层结构与多输出高斯过程在关联传感器建模中的联系。  

**关键词**:联邦学习、高斯过程、分层模型、不确定性量化、分布式传感、个性化建模  

**资助**:本研究由美国能源部核能大学计划(DOE NEUP DE\-NE0009383)资助。  

---

## 1 引言  
隐私保护的分布式测量学习已成为现代工业与城市分析的核心需求(Kontar等人,2021)。随着物联网设备——包括分布式环境传感器、制造设备监控器与智慧城市基础设施——的快速普及,许多部署自然采用联邦架构,数据保留在边缘设备本地。在此场景下,模型需捕捉总体规律,同时尊重数据本地性、带宽限制与异构运行条件。典型应用领域包括智能医疗、工业制造预测性维护以及智慧城市车联网。  

分布式系统的一个根本挑战在于处理异构性:物理系统常因运行条件、环境因素、设备差异或局部扰动而表现出站点特有行为。当从非独立同分布(non\-i\.i\.d\.)联邦客户端学习共享模型时,这种异构性可能显著降低预测质量,并导致不确定性校准不良。核心矛盾在于:既要保留共同动力学的总体表征,又要允许客户端特有的系统性偏移与灵活的局部残差。  

为解决异构性问题,个性化学习(包括个性化联邦学习、个性化PCA与个性化Tucker分解)的一系列研究聚焦于将客户端数据分解为共享全局组件与本地个性化组件。这些方法通常提取联合低秩子空间表示全局结构,同时允许客户端在互补子空间中产生特有变化。本质上,它们通过识别共享基及客户端特定系数实现潜在线性子空间分解,从而在集体表征与个体化适应间取得平衡。  

受此分解范式启发,我们的目标是开发一种联邦概率框架,在关联多传感器输出的场景中分离共享结构与客户端特有变化。这类场景出现在具有多应变通道的制造系统、城市环境监测网络及其他分布式传感栈中。我们利用高斯过程(GP)通过核函数自然编码依赖关系,提供有原则的不确定性量化,并在数据稀缺场景中保持灵活性。严格的不确定性估计在安全约束下的监测与规划中尤为重要。GP在代理建模、时空预测、机器人学与传感器网络中已取得显著成果。  

尽管已有努力,开发适用于联邦异构环境的GP模型仍面临三大挑战:  
- • **缺乏显式分层校准结构**:许多联邦GP方法依赖单一共享核进行本地微调,未明确分解为共享全局结构、结构化客户端偏差与灵活局部残差。  
- • **对关联多传感器客户端支持不足**:现有联邦GP方法常将输出视为独立或依赖全局池化,限制了客户端内跨传感器依赖性的显式建模。  
- • **不确定性感知适应不足**:许多联邦方法无法提供平衡全局一致性与客户端特异性适应的校准不确定性,这在异构风险感知决策中至关重要。  

为填补这些空白,我们提出**个性化联邦分层高斯过程(pFedHGP)**,采用隐私保护的联邦变分推断进行训练。pFedHGP内嵌三级分层分解:(1) 捕捉总体结构的全局GP,(2) 共享全局核几何结构的客户端特有偏差GP,(3) 具有独立核与诱导几何的客户端局部残差GP。基于**瞬态线性混合模型(ILMM)**视角阐明了关联多传感器输出的潜变量混合机制(详见3.9节)。我们总结贡献如下:  
- • **异构联邦客户端的分层分解**:将每个客户端的隐函数分解为共享全局结构、共享基上的结构化偏差与灵活局部残差,实现非独立同分布客户端下的可解释监测。  
- • **隐私保护的联邦变分推断**:开发两阶段变分流程,服务器仅同步紧凑全局统计量,客户端在私有数据上更新局部变分因子。  
- • **不确定性感知的多传感器扩展**:完整高斯预测律支持输出间的边缘与联合不确定性;ILMM关联揭示了向量值传感如何映射到分层结构。  

联邦公式的必要性源于三方面:首先,原始传感器轨迹天然由本地客户端拥有,可能包含专有或受治理限制的信息;其次,高分辨率时间序列在集中式处理时会产生通信与存储成本;第三,客户端具有统计异构性,纯池化模型可能掩盖局部系统性偏移。pFedHGP通过保持原始观测本地化、仅传输共享表示的模型级更新、并通过偏差与局部组件保留客户端特有行为来解决这些问题。本文所述“隐私保护”指数据本地性层面;本工作未提供形式化差分隐私或安全聚合保证。  

---

## 2 背景与文献综述  
高斯过程从集中式模型向分布式与联邦架构的演进,受计算可扩展性与数据隐私双重需求驱动。我们将现有文献分为五大领域:基于GP的校准与模型偏差方法(2.1节),假设集中数据访问;分布式GP方法(2.2节),优先考虑可扩展性而非隐私;联邦GP方法(2.3节),保护隐私但难以应对客户端异构性;个性化联邦学习(2.4节),结合全局与本地适应;先进联邦架构(2.5节),以增加复杂性为代价处理多输出与多保真数据。  

### 2.1 用于校准与模型偏差的高斯过程  
高斯过程为模型校准、不确定性量化及模拟模型与物理观测间偏差修正提供概率框架。Chakraborty等人强调GP代理在桥接高保真仿真与噪声传感器数据中的作用。在结构动力学中,研究者利用GP作为逆映射模型更新物理参数并量化校准不确定性。这些集中式方法利用GP灵活性建模系统偏差(即模型偏差函数),捕捉理想化物理模型与观测数据的差异。然而传统校准方法通常假设集中数据访问,这在数据隐私至关重要的分布式工业场景中存在问题。  

### 2.2 分布式高斯过程  
早期分布式GP方法主要针对标准GP的三次计算复杂度设计。这些方法通常将数据分区至多节点以实现并行计算。Tresp引入贝叶斯委员会机(BCM),通过逆协方差加权聚合独立GP专家的预测。Deisenroth与Ng将其扩展为分布式变分框架,支持专家预测的鲁棒聚合。类似地,其他研究者提出混合专家模型,基于层级或信息论标准将数据分配至本地专家。在信号处理领域,研究者开发了分布式递归算法用于无线流量与传感器网络,聚焦高效超参数同步。通过利用异步更新与随机变分推断,进一步提升了GP处理大规模数据集的可扩展性。  

分布式GP的主要局限在于假设数据独立同分布或为计算便利性人工分区。它们常依赖共享全局核或诱导点,缺乏建模自然联邦场景中固有异构性的机制。此外,这些方法优先考虑可扩展性而非隐私,常需交换可能泄露敏感信息的梯度或统计量。  

### 2.3 联邦高斯过程  
随着隐私问题兴起,研究重心转向数据保留在本地的联邦学习(FL)。联邦GP旨在不共享原始数据的情况下学习全局GP模型。Yu等人提出联邦贝叶斯神经回归,利用随机特征近似可扩展全局核。Yurochkin等人引入贝叶斯非参数联邦学习,概率匹配客户端间神经网络权重。近期研究探索了去中心化方法:研究者开发了面向多智能体的完全去中心化GP;另一团队引入鲁棒在线去中心化GP以适应动态环境;还有工作为标准FedAvg算法提供概率扩展,通过聚合客户端分布矩量化全局不确定性。  

这些方法虽提升隐私性,但通常强制所有客户端使用单一全局模型。这种“一刀切”方式在客户端呈现显著统计异构性时效果不佳:单一全局核无法捕捉许多现实应用中固有的多样化客户端特有模式,导致个体参与者性能次优。  

### 2.4 个性化联邦学习  
为解决异构性,个性化联邦学习(PFL)将全局知识与客户端特异性适应相结合。高斯过程提供一种个性化途径,而更广泛的PFL框架已探索多种分解策略:研究者提出个性化PCA,显式解耦客户端数据为共享全局特征与独特本地特征,实现场景下的鲁棒降维;另一团队提出针对张量数据的个性化Tucker分解,通过共享核心张量建模共性,同时通过客户端特有因子矩阵捕捉特性。在GP领域,pFedGP的开创性工作结合深度核学习(DKL)与本地GP:全局学习神经网络特征提取器(深度核),每个客户端在提取特征上维护本地GP,实现共享表示学习与本地灵活性保留。后续研究进一步优化了这一范式;例如Yan…

相似文章

在线自适应核混合的高斯过程决策制定

arXiv cs.LG

本文介绍 HACK GPs,这是一种使用专家建议在线学习的方法,用于高斯过程中的核选择,增强在序贯决策任务(如贝叶斯优化和主动学习)中的鲁棒性。

联邦哈希投影潜在因子学习

arXiv cs.LG

本文提出了一种联邦哈希投影潜在因子(FHPLF)模型,该模型将哈希学习集成到联邦学习中,以降低通信成本并增强隐私保护,通过使用二值类梯度矩阵和投影汉明距离来提高准确性和效率。

基于Gaussian Graphical Models的私有自适应协方差估计

arXiv cs.LG

本文介绍了PACE-GGM,一种差分隐私的协方差估计方法,它自适应地选择和测量经验协方差矩阵中信息量最大的条目,并使用Gaussian Graphical Models进行重构。该方法在真实世界数据上显示出相对于基线方法的改进估计误差,特别是在高维设置中。