面向模态异质性下的鲁棒联邦多模态图学习

arXiv cs.LG 论文

摘要

本文提出FedMPO,一种鲁棒的联邦多模态图学习方法,通过拓扑感知的跨模态生成、缺失感知的专家路由和可靠性感知的聚合来解决模态异质性和缺失模态问题,在多个数据集上实现了性能提升。

arXiv:2605.12584v1 公告类型:新 摘要:近期,多模态图学习(MGL)因整合多样化的模态信息和结构化上下文以支持各类网络应用而备受关注。然而,现实中的图数据往往因多方之间的数据共享限制而孤立存在,且其模态经常不完整。这凸显了迫切需要开发一种鲁棒的联邦学习方法。但研究发现,现有方法仍显不足。一方面,处理缺失模态的集中式多模态图学习方法忽视了联邦场景中的知识共享和泛化。另一方面,尽管联邦多模态图学习方法已日趋成熟,但它们主要针对非图数据。基于这些技术,我们识别出一条两阶段流水线:客户端补全重建缺失模态,服务端聚合整合客户端更新的模态生成器和骨干模型的参数。尽管这是一种通用解决方案,我们发现了实现更高鲁棒性面临的两个主要挑战:(1)拓扑孤立的本地补全:客户端模态生成难以有效利用全局语义。(2)可靠性不均衡的全局聚合:服务端多方协作受到客户端更新的阻碍,这些更新具有不同的模态可用性和恢复可靠性。为应对这些挑战,我们提出\textsc{FedMPO},该方法利用拓扑感知的跨模态生成,通过综合的图上下文恢复缺失特征;利用缺失感知的专家路由,在本地过滤掉噪声恢复信号;利用可靠性感知的聚合,适当降低不可靠更新的权重。在6个数据集上的3项任务上进行的大量实验表明,FedMPO优于基线方法,在高缺失和非独立同分布设置下实现了高达4.10%和5.65%的性能提升。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:16

# 面向模态异质性下的鲁棒联邦多模态图学习  
来源:https://arxiv.org/html/2605.12584  

Sirui Zhang Haonan Wang Xunkai Li Zekai Chen Shumeng Li Hongchao Qin Rong‑Hua Li Guoren Wang  
北京理工大学  

###### 摘要  

近年来,多模态图学习(MGL)因整合多种模态信息与结构化上下文以支持各类网络应用而备受关注。然而,现实中的图数据常因多方数据共享限制而孤立存在,且其模态往往不完整。这凸显了开发一种鲁棒联邦方法的迫切需求。但我们发现现有方法仍存在不足。一方面,处理缺失模态的集中式MGL方法忽视了联邦场景中的知识共享与泛化能力。另一方面,虽然联邦MGL方法已日趋成熟,但它们主要针对非图数据。基于这些技术,我们识别出一个两阶段流程:客户端补全重建缺失模态,服务端聚合整合客户端更新后的模态生成器与骨干模型参数。尽管这是一种通用解决方案,但我们发现实现更高鲁棒性面临两个主要挑战:(1) 拓扑孤立的本地补全:客户端侧模态生成难以有效利用全局语义。(2) 可靠性失衡的全局聚合:服务端多方协作因客户端更新中模态可用性与恢复可靠性的差异而受阻。为应对这些挑战,我们提出**FedMPO**,该方法利用拓扑感知的跨模态生成,借助全面的图上下文恢复缺失特征;利用缺失感知的专家路由在本地过滤噪声恢复信号;利用可靠性感知的聚合适当降低不可靠更新的权重。在6个数据集上的3项任务中,大量实验表明**FedMPO**优于现有基线,在高缺失率和非IID设置下性能提升分别高达4.10%和5.65%。

## 1 引言

多模态图学习通过联合利用图拓扑与异构模态(如文本和图像)对现实系统进行建模(Wei 等人,2019;Tao 等人,2020;Zhu 等人,2025)。实践中,由于隐私约束、商业竞争或平台专属所有权,此类图数据常常跨客户端孤立存在,使得集中式训练不可行(McMahan 等人,2017;Li 等人,2026)。联邦学习方法(McMahan 等人,2017;Li 等人,2020)能够在无需共享原始数据的情况下实现协作,但模态因异构采集、存储限制、隐私限制或用户行为差异而常常不完整。因此,针对联邦多模态图的缺失模态鲁棒学习,成为现实分布式图应用中一个关键但尚未充分探索的问题。

参考图注  
图1:缺失模态学习范式及所提FedMPO概览。

如图1所示,现有研究提供了两个互补但不完整的方向。集中式不完整多模态图学习在后续图学习之前,利用图拓扑与多模态属性生成缺失模态(Jia 等人,2023;He 等人,2025;Wan 等人,2026;Wang 等人,2023;Wu 等,2024)。它使用图上下文作为节点级模态生成的依据,但假设数据可集中访问,无法受益于跨客户端知识。相比之下,联邦缺失模态学习方法在服务端聚合本地更新的模态生成器,并将全局知识广播回客户端(Che 等人,2024;Nguyen 等人,2024),通过协作改进本地模态生成。然而,它们主要针对非图数据,忽略了拓扑感知的图上下文。当适应联邦多模态图时,形成一种生成–聚合管线:客户端进行本地模态生成与图学习,服务端聚合模态生成器与图骨干的更新。由于每个客户端仅观察其自有子图,缺失特征是从局部有偏的图上下文和部分模态观测中生成,而非基于全局一致的跨客户端结构语义。因此,该管线仍受限于客户端隔离的本地生成与可靠性偏斜的全局聚合。

我们识别出该管线中的两个关键挑战:
(1) **拓扑孤立的本地补全**:模态生成在客户端自有子图内进行,难以利用本地图上下文之外的全局语义。尽管本地拓扑提供了有用的图上下文,但稀疏观测和有偏的客户端子图仍可能生成与跨客户端结构语义不一致的特征,进一步误导图消息传递。
(2) **可靠性失衡的全局聚合**:由于客户端在模态可用性、缺失模式与生成可靠性上存在差异,基于数据大小的聚合可能使共享的模态生成器与图骨干偏向于不可靠的生成信号或主导模态模式。

为应对这些挑战,我们提出**FedMPO**,一个针对联邦多模态图的统一缺失模态鲁棒框架。**FedMPO**遵循四阶段管线:
(1) **客户端侧特征与图上下文编码**:区分自然缺失与训练时掩码,构建邻域引导的结构锚点作为模态生成的拓扑先验(第3.1节)。
(2) **客户端侧拓扑感知跨模态生成**:通过查询跨模态上下文库与图上下文恢复缺失特征,解决拓扑孤立的本地补全问题(第3.2节)。
(3) **客户端侧缺失感知的混合专家路由**:估计生成不确定性,融合观测、生成与结构信号,在本地更新前过滤噪声恢复信号(第3.3节)。
(4) **服务端侧可靠性感知聚合**:聚合客户端更新的模态生成器与图骨干参数,并利用可靠性统计降低不可靠更新的权重,缓解可靠性失衡的全局聚合(第3.4节)。

我们的贡献:
(1) **新问题**:研究联邦多模态图的缺失模态鲁棒学习,这是一个实用但尚未充分探索的问题,其中图结构多模态数据分布式存在且常不完整。
(2) **新方法**:提出**FedMPO**,将拓扑感知跨模态生成、缺失感知专家路由与可靠性感知聚合整合到统一的客户端–服务工作流中,以提升本地模态生成可靠性与全局鲁棒性。
(3) **最先进性能**:在六个数据集上,于高缺失和高非IID条件下对三个下游任务进行实验,证明**FedMPO**的有效性,在高缺失和高非IID设置下分别实现高达4.10%和5.65%的性能提升。

## 2 预备知识与相关工作

### 2.1 符号说明与问题形式化

我们研究联邦多模态图上的缺失模态鲁棒学习。考虑一个包含K个客户端与一个中心服务端的联邦系统。每个客户端k拥有一个私有多模态图G_k = (V_k, E_k),其中节点表示本地实体,边编码关系依赖。每个节点v_{k,i} ∈ V_k关联M个模态特定属性x_{k,i} = {x_{k,i}^{(1)}, ..., x_{k,i}^{(M)}},其中x_{k,i}^{(m)}表示模态m的特征。由于隐私约束与数据所有权,客户端不能直接交换原始节点属性、模态内容或本地图结构。它们还可能呈现异构的特征、标签、拓扑与缺失分布,导致跨多模态图客户端的耦合非IID挑战。

为描述不完整观测,我们定义模态可用性掩码r_{k,i} ∈ {0,1}^M,其中r_{k,i}^{(m)}=1表示模态m被观测到,否则为0。因此,节点v_{k,i}的可访问输入由其观测模态与本地图上下文组成,表示为~\mathbf{x}_{k,i} = {x_{k,i}^{(m)} | r_{k,i}^{(m)}=1}。缺失可能在客户端级与节点级发生。我们将自然缺失与训练时掩码区分开:自然缺失模态无真实特征,而人工掩码的观测模态提供重建监督。对于下游任务T(如节点分类、链接预测或模态检索),学习过程遵循三个步骤:

首先,每个客户端通过利用可用模态与图邻域,在其私有不完整多模态图上进行本地学习。  
其次,缺失模态在本地被恢复或表示,但其可靠性可能因不同客户端的模态可用性与结构上下文而异。  
第三,服务端聚合客户端更新以获得全局模型,并广播回下一通信轮次。

该形式化突出了两个核心需求:在本地,缺失模态恢复应是拓扑感知的,因为节点语义由其自身观测模态与邻域通过局部结构上下文共同塑造;在全局,联邦聚合应是可靠性感知的,因为基于数据大小的聚合可能过度强调由不可靠恢复信号主导的客户端更新。因此,**FedMPO**的目标是在不共享原始多模态属性或图结构的情况下,从不完整多模态图中学习鲁棒的本地表示,并将所得客户端更新整合为可靠的全局模型。

### 2.2 相关工作

**图与多模态图学习**  
GNN通过聚合邻域信息学习节点表示,代表性模型包括GCN、GraphSAGE、GAT与GIN(Kipf and Welling, 2017; Hamilton 等人,2017; Veličković 等人,2018; Xu 等人,2019)。多模态图学习进一步将异构属性(如文本与图像)融入图表示学习(Wei 等人,2019; Tao 等人,2020; Jia 等人,2023; He 等人,2025)。在此类图中,拓扑不仅连接相关实体,还提供上下文证据以解决模态歧义并增强不完整节点语义。近期基准研究强调了多模态图场景中跨模态对齐、模态融合与图拓扑的重要性(Zhu 等人,2025; Wan 等人,2026)。然而,大多数现有方法假设集中数据访问以及完整或可直接使用的模态,使其不适用于存在缺失模态的隐私约束联邦环境。

**联邦图与多模态联邦学习**  
联邦学习使分布式客户端能够在无需共享原始数据的情况下协作训练,FedAvg、FedProx与SCAFFOLD等方法解决了数据异质性下的优化问题(McMahan 等人,2017; Li 等人,2020; Karimireddy 等人,2020)。联邦图学习将此范式扩展到图数据,主要关注结构异质性、客户端漂移与通信效率(Li 等人,2025)。多模态联邦学习研究模态异质性与部分模态客户端(Che 等人,2024; Nguyen 等人,2024; Peng 等人,2024b; Wu 等人,2024; Xie 等人,2024)。然而,大多数FGL方法假设完整节点特征,而多模态FL方法通常独立处理样本,忽略图结构依赖。近期基准研究进一步表明,FGL与多模态FL的朴素组合不足以应对存在不完整模态的实际多模态图场景(Li 等人,2026)。

**缺失模态学习**  
不完整多模态学习通过跨模态重建、生成式填充、共享–特定表示学习与缺失感知融合来处理部分缺失模态(Ma 等人,2021, 2022; Wang 等人,2023; Reza 等人,2024; Wu 等,2024)。尽管在集中式或非图设置中有效,这些方法未显式建模邻域依赖语义或跨客户端聚合偏差,尤其是在异构客户端级模态缺失下。在多模态图中,不可靠的恢复特征可能通过消息传递传播,并因联邦聚合而被进一步放大。**FedMPO**通过将拓扑感知补全、缺失感知路由与可靠性感知聚合整合到统一的联邦多模态图学习框架中,填补了这一空白。

## 3 方法论

我们提出**FedMPO**,一个针对联邦多模态图学习的缺失模态鲁棒框架。模态不完整性既影响本地图表示学习,也影响全局联邦优化:在本地,缺失模态应利用邻域结构与语义证据,而非独立恢复;在全局,缺失严重或恢复不可靠的客户端可能使模型聚合产生偏差。如图2所示,**FedMPO**采用四阶段管线。每个客户端首先将可用模态与图上下文编码到共享空间中,然后利用跨模态证据生成缺失模态。

相似文章

MMFGU: Multimodal Federated Graph Unlearning

arXiv cs.LG

The paper proposes MMFGU, a multimodal federated graph unlearning framework that decouples target-specific representations to handle entity, modality, and pairing removal requests while preserving retained utility, achieving a 41.5x speedup over full retraining.

LongMoE:基于轨迹感知的混合专家模型的纵向多模态学习

arXiv cs.LG

LongMoE提出了一个统一框架,同时解决多模态临床学习中的模态缺失和纵向动态问题,利用上下文感知插补、注意力令牌化、轨迹感知编码和稀疏混合专家路由。在ADNI、OASIS-3和MIMIC-IV上的实验表明,在缺失模态情况下鲁棒性得到提升,同时在完整模态设置下仍具有竞争力。