面向联邦多模态图基础模型:一种拓扑感知的多模态对齐框架

arXiv cs.LG 论文

摘要

提出了FedGAMMA,一种联邦多模态图基础学习框架,通过两阶段预训练和基于提示的微调,对齐多模态属性和图拓扑,在多个数据集上取得了显著提升。

arXiv:2607.15687v1 公告类型:新 摘要:多模态属性图(MAGs)的节点携带图像和文本等模态以及拓扑结构,现在广泛应用于社交平台、电子商务和生物医学网络等应用中,提供比单模态图更丰富的语义信号。在实践中,此类图分散在不同平台和机构拥有的隐私受限的数据孤岛中,因此在其上学习一个广泛可迁移的模型需要协作训练,且绝对不能暴露原始数据。这使得该任务处于多模态图学习和联邦学习的交叉点,但现有方法仅覆盖了其中一方面。为了应对这两个视角带来的挑战,我们提出了FedGAMMA,将联邦多模态图基础学习视为一个两阶段的语义-结构对齐问题,包括联邦预训练和基于提示的微调。在预训练阶段,一个共享-私有语义增强器通过最优传输将跨模态共性从模态特定信息中分离出来并进行对齐;一个拓扑感知的图融合模块通过语义残差图和双位置编码解耦语义和结构视图;一个双通道亲和度感知聚合机制通过特征质心和图质心估计客户端相似性,而不暴露原始数据。在微调阶段,FedGAMMA通过轻量级的图感知提示、具有受控探索的共享提示池以及通道级提示同步来适配预训练编码器。在十二个多模态图数据集上的实验表明,FedGAMMA在下游任务中持续超越广泛的基线,提升幅度高达12.96%。FedGAMMA还在少样本学习场景下,在多个任务的多领域数据集上以高达5.71%的优势超越竞争基线。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:30

# 迈向联邦多模态图基础模型:一种拓扑感知的多模态对齐框架  
来源:https://arxiv.org/html/2607.15687  

Xunkai Li, Guohao Fu, Yuming Ai, Zhengyu Wu, Hongchao Qin, Rong-Hua Li, Guoren Wang  

Xunkai Li、Guohao Fu、Yuming Ai、Zhengyu Wu、Hongchao Qin、Rong-Hua Li 和 Guoren Wang 均任职于北京理工大学,北京,100811,中国。(电子邮件:[email protected]; [email protected]; [email protected]; [email protected]; [email protected]; [email protected]; [email protected])  

###### 摘要  

多模态属性图(MAGs)的节点除拓扑结构外,还携带图像和文本等多模态信息,现已广泛应用于社交平台、电子商务和生物医学网络,与单模态图相比提供了更丰富的语义信号。在实际应用中,这些图分散在由不同平台和机构拥有的隐私受限孤岛中,因此学习一个可广泛迁移的模型需要在不暴露原始数据的情况下进行协同训练。这使得任务处于多模态图学习与联邦学习的交汇点,但现有方法仅覆盖了其中一方面。在客户端内部,一个有效的模型必须将每个节点上的多种模态与周围图拓扑融合为一致的表示。在客户端之间,图来自异构领域,其模态和结构分布差异很大,因此简单地对局部模型进行平均会纠缠不相容的跨领域知识。为解决这两方面挑战,我们提出 FedGAMMA(联邦图与多模态对齐),将联邦多模态图基础学习视为一个两阶段语义-结构对齐问题,包括联邦预训练和基于提示的微调。预训练阶段,一个共享-私有语义增强器通过最优传输将跨模态共性从模态特定信息中分离并对齐;拓扑感知图融合模块通过语义残差图和双位置编码解耦语义和结构视图;双通道亲和感知聚合机制通过特征和图质心估计客户端相似性,且不暴露原始数据。微调阶段,FedGAMMA 通过轻量图感知提示、带有可控探索的共享提示池以及通道式提示同步来适配预训练编码器。在十二个多模态图数据集上的实验表明,FedGAMMA 在下游任务中持续超越广泛的基线方法,性能提升高达 12.96%。在小样本学习场景下,FedGAMMA 在多个多领域数据集上的多个任务中进一步优于竞争基线,最高提升 5.71%。  

## I 引言  

现实应用中的图结构数据越来越多地与异构多模态属性相关联。例如,电商图中的产品节点可能同时包含视觉外观和文本规格,而社交平台中的用户节点则包含个人资料图像和传记描述。这类多模态属性图(MAGs)中,节点携带从冻结编码器(如 CLIP [31])中提取的图像和文本特征对,以及拓扑结构,比单模态图提供更丰富的语义信号,从而支持跨模态检索和多模态推理等任务。图基础模型(GFMs)[25, 7, 46] 已显示出通过预训练后适配来学习可迁移表示的前景。然而,现有的大多数多模态 GFM 假设集中式设置,缺乏跨模态交互机制。例如,在医疗和金融领域,MAG 数据分布在不同组织中,由于法规限制无法集中处理 [14, 13]。联邦图学习(FGL)[52, 1] 能够在不共享原始数据的情况下进行协同训练,但当前的 FGL 方法和联邦 GFM [56, 45] 仍局限于单模态属性。将这两种范式结合起来远非易事。现有方法既没有提供融合多模态节点内容与图结构的机制,也没有协调数据分布不同的客户端之间的表示。因此,在多模态图学习与联邦学习的交叉领域存在明显的空白。设计一个联邦多模态图基础模型面临三个根本性挑战:  
(C1) 隐私约束下的跨模态对齐:图像和文本模态具有不同的特征分布,对齐必须在隐私约束下在本地保持跨模态关系一致性。  
(C2) 语义-结构接地:MAGs 结合了模态驱动的语义和拓扑驱动的结构,但现有目标往往过度强调其中一方而忽视另一方。  
(C3) 异构感知聚合:联邦客户端在图规模、模态质量和语义分布上有所不同,但服务器无法检查原始数据来估计跨客户端相似性。因此,隐私保护的数据摘要对于通道感知聚合和个性化至关重要。  
为说明这些挑战,图 1(见 §IV)对比了朴素的和原则性的联邦多模态 GFM,揭示了三个局限性。首先,将图像和文本特征拼接会抹去模态特定信号,使其分布趋于一致。相反,分离共享的跨模态流与模态私有流能够保留下游任务所依赖的互补多样性。其次,联合编码语义和结构会使语义覆盖拓扑,连接不同社区中语义相似但结构相距甚远的节点。在融合前将它们解耦为独立视图可以防止这种连接。第三,在特征通道统计上相似的客户端往往在图通道统计上不同,因此单一相似性权重会在通道间错误分配更新。这些观察结果引出了指导我们架构的三个原则。  
基于这些原则,我们提出 FedGAMMA,一个联邦图与多模态对齐框架,将联邦多模态图基础学习视为一个两阶段语义-结构对齐问题。对于跨模态对齐(C1),FedGAMMA 采用共享-私有语义增强器,包含对称交叉注意力和基于最优传输(OT)的分布对齐 [4, 3]。对于语义-结构接地(C2),拓扑感知图融合模块通过语义残差图和双位置编码解耦语义和结构表示。对于异构感知聚合(C3),双通道亲和机制将客户端总结为特征和图质心,在不暴露原始数据的情况下进行通道式个性化聚合。FedGAMMA 还引入了基于提示的微调,包含共享提示池和通道式同步,用于轻量级下游适配。  

贡献:  
(1) **新视角**:我们形式化了联邦多模态图基础学习,将多模态图表示、隐私保护联邦学习和可迁移预训练统一到一个框架中。  
(2) **新框架**:我们提出 FedGAMMA,一个两阶段联邦多模态图基础模型,集成了共享-私有跨模态增强、拓扑感知图融合、双通道亲和感知聚合和基于提示的微调。  
(3) **最先进性能**:大量实验证实,FedGAMMA 在 12 个多模态图数据集上优于所有竞争基线,相比最佳方法提升高达 12.96%。在准确性之外,它以 2-5 倍更少的通信轮次达到最强性能,突出了其有效性和高效性。  

## II 预备知识  

### II-A 多模态属性图学习  

多模态属性图定义为 \(\mathcal{G} = (\mathcal{V}, \mathcal{E}, \mathcal{X}^I, \mathcal{X}^T)\),其中 \(\mathcal{V}\) 是节点集,\(|\mathcal{V}| = N\);\(\mathcal{E} \subseteq \mathcal{V} \times \mathcal{V}\) 是边集;每个节点 \(v_i \in \mathcal{V}\) 关联一个图像特征向量 \(\mathbf{x}_i^I \in \mathbb{R}^d\) 和一个文本特征向量 \(\mathbf{x}_i^T \in \mathbb{R}^d\)。特征矩阵 \(\mathcal{X}^I, \mathcal{X}^T \in \mathbb{R}^{N \times d}\) 通过将原始模态输入到冻结的预训练编码器(如 CLIP [31],输出维度 \(d=768\))获得。邻接矩阵记作 \(\mathbf{A} \in \{0,1\}^{N \times N}\),其中若 \((v_i, v_j) \in \mathcal{E}\) 则 \(\mathbf{A}_{ij}=1\),否则 \(\mathbf{A}_{ij}=0\)。  
多模态图学习 [30, 44] 旨在学习一个节点表示函数 \(f: \mathcal{V} \to \mathbb{R}^{d'}\),通过 GNN [17] 联合编码来自多种模态和图拓扑的信息。形式化地,给定 \(\mathcal{G}\),目标是学习编码器 \(f_\Theta\),使得输出表示矩阵 \(\mathbf{Z} = f_\Theta(\mathcal{X}^I, \mathcal{X}^T, \mathbf{A}) \in \mathbb{R}^{N \times d'}\) 捕获跨模态语义关系与拓扑结构。学习到的表示支持多种下游任务:节点分类 \(\hat{y}_i = g(\mathbf{z}_i)\),链接预测 \(\hat{e}_{ij} = \sigma(\mathbf{z}_i^\top \mathbf{z}_j)\),以及跨模态检索 \(\text{sim}(\mathbf{z}_i^I, \mathbf{z}_j^T)\),其中 \(g\) 和 \(\sigma\) 分别表示分类头和 sigmoid 函数。  

### II-B 联邦多模态图基础模型  

考虑 \(K\) 个客户端,客户端 \(k\) 持有本地图 \(\mathcal{G}_k = (\mathcal{V}_k, \mathcal{E}_k, \mathcal{X}_k^I, \mathcal{X}_k^T)\),来自分布 \(\mathcal{D}_k\),在图规模、拓扑、模态质量和语义分布上表现出复合异构性 [14]。原始数据从不共享。目标是协同训练一个可迁移的编码器 \(f_\Theta\),通过两阶段流程:联邦预训练 [29] 和基于提示的微调 [19, 53]。  

**联邦预训练**:每个客户端本地优化一个自监督目标 [6],然后将参数 \(\Theta_k\) 和紧凑消息 \(\mathbf{C}_k^f, \mathbf{C}_k^g\) 上传到服务器。服务器计算分离的权重并执行加权聚合:
\[
\Theta^g \leftarrow \sum_{k=1}^K \frac{N_k}{\sum_j N_j} \cdot \mathbf{W}_k \odot \Theta_k,
\]
其中 \(\mathbf{W}_k\) 表示权重,\(N_k\) 是本地实例数量。预训练目标要求 \(f_\Theta\) 同时满足以下条件:  
① 模拟 \(\mathcal{X}^I\) 与 \(\mathcal{X}^T\) 之间的跨模态交互,以捕获模态间的互补信息;  
② 保留来自 \(\mathbf{A}\) 的语义和结构信息,确保拓扑驱动模式不被模态驱动特征覆盖;  
③ 在聚合过程中考虑跨客户端异构性,避免由于对不同客户端分布进行均匀平均而导致负迁移 [26]。  

**微调**:预训练后,全局编码器 \(\Theta^g\) 被冻结并分发给所有客户端。下游适配通过图到提示生成、提示池选择和通道式提示同步进行,因此只需更新和通信轻量参数 \(\phi\),且 \(|\phi| \ll |\Theta^g|\)。骨干网络冻结后,客户端 \(k\) 仅对提示模块参数 \(\phi\) 和任务头参数 \(\psi\) 进行最小化:
\[
\min_{\phi, \psi} \; \mathcal{L}_{\text{task}} \bigl( \mathcal{G}_k, \mathcal{Y}_k; \Theta^g, \phi, \psi \bigr),
\]
其中 \(|\phi| + |\psi| \ll |\Theta^g|\)。本地训练后,每个客户端上传其任务头和提示模块参数,以及紧凑提示质心。服务器应用与预训练阶段相同的双通道亲和规则,对这些参数进行通道式聚合,在保留通道特定个性化的同时实现提示空间中的联邦知识迁移。  

## III 相关工作  

### III-A 联邦图基础模型  

FedGFM [56] 在 GNN 编码器内解耦结构和语义组件,并应用对比图-文本对齐,成为首个将图基础预训练与联邦学习结合的模型。FedBook [45] 通过向量量化将对齐的表示投影到共享离散码本上,实现客户端间的域内和跨域知识迁移。FedGALA [59] 则倾向于 GNN 与冻结语言模型之间的连续潜在对齐,随后进行本地基于提示的微调用于下游适配。它们的多模态扩展只是简单地将图像和文本特征融合后输入原始单模态流程。这些方法本质上是单模态的,其多模态扩展通过特征级融合丢弃了模态特定信息;FedGFM 和 FedBook 进一步因离散码本投影而引入量化误差。没有方法同时处理跨模态融合、语义-结构接地和通道感知聚合。  
在图数据之外,跨模态联邦学习 [49] 在客户端之间分离模态无关和模态特定表示,联邦特征对齐 [54] 缓解跨客户端特征偏移,但二者均未建模图拓扑。更广泛的联邦图学习方法 [24, 12, 57, 47, 35, 23, 52, 43, 28, 50]

相似文章

面向模态异质性下的鲁棒联邦多模态图学习

arXiv cs.LG

本文提出FedMPO,一种鲁棒的联邦多模态图学习方法,通过拓扑感知的跨模态生成、缺失感知的专家路由和可靠性感知的聚合来解决模态异质性和缺失模态问题,在多个数据集上实现了性能提升。

MMFGU: Multimodal Federated Graph Unlearning

arXiv cs.LG

The paper proposes MMFGU, a multimodal federated graph unlearning framework that decouples target-specific representations to handle entity, modality, and pairing removal requests while preserving retained utility, achieving a 41.5x speedup over full retraining.

面向车辆网络的联邦基础模型

arXiv cs.LG

本文提出了将多模态多任务联邦基础模型(M3T FedFMs)集成到车辆网络中的愿景,讨论了训练原理、应用场景、挑战以及基于Waymo开放数据集的案例研究。