多模态属性图的上下文感知模态-拓扑协同对齐
摘要
提出CoMAG,一个用于多模态属性图的统一骨干网络,它学习任务自适应可靠上下文并执行模态保持对齐,在图级预测、模态匹配和图条件生成上达到最先进结果。
arXiv:2606.14172v1 公告类型:新
摘要:多模态属性图(MAGs)通过将图拓扑与文本和图像等异质属性耦合来建模现实世界实体。它们支持需要结构和类别判别性表示的图中心任务,以及需要细粒度跨模态对应的模态中心任务。然而,现有的MAG方法通常依赖固定图上下文或统一融合表示,导致任务无关传播和过度压缩融合,阻碍了多样化任务需求和模态特定证据保留。为解决此问题,我们提出CoMAG,一个统一的MAG骨干网络,它学习任务自适应可靠上下文并在其中执行模态保持对齐。CoMAG首先通过从多模态语义一致性估计边可靠性、用语义邻居补充原始拓扑、以及通过任务感知门选择上下文组件来进行可靠上下文学习。然后,它通过维护模态特定的多跳轨迹、跨模态匹配模态跳词元、以及解耦共享和私有表示来执行模态保持跳词元对齐。因此,CoMAG在一次前向传递中产生图和模态表示,同时保留模态特定线索。我们进一步分析了稳定传播、缓解过度平滑和模态崩塌控制。在九个OpenMAG数据集上的实验将CoMAG与仅特征、仅图、多模态和统一MAG基线在图级预测、模态匹配和图条件生成上进行了比较。结果表明,CoMAG达到了最佳报告性能,展示了任务自适应可靠上下文和模态保持对齐改善了结构预测、跨模态匹配和图条件生成,同时保持了稀疏边线性复杂度。
查看缓存全文
缓存时间: 2026/06/15 09:11
# 上下文感知的模态-拓扑协同对齐用于多模态属性图
来源:https://arxiv.org/html/2606.14172
###### 摘要
多模态属性图(MAGs)通过将图拓扑结构与文本、图像等异构语义属性相结合,对现实世界实体进行建模。这种数据结构天然适用于两类任务:需要结构和类别判别性表示的以图为中心的任务,以及需要细粒度跨模态对应关系的以模态为中心的任务。然而,现有的MAG方法通常依赖固定的图上下文或统一融合的多模态表示。这种设计会导致任务无关的上下文传播和过度压缩的跨模态融合,难以满足不同任务需求同时保留模态特定证据。为解决这一挑战,我们提出CoMAG(上下文感知的模态-拓扑协同对齐),一种统一的MAG主干网络,能够学习任务自适应的可靠上下文,并在这些上下文中执行模态保持的对齐。具体而言,CoMAG首先通过从多模态语义一致性估计边可靠性、用语义邻居补充原始拓扑、以及通过任务感知门选择上下文组件,来执行可靠上下文学习。然后,它通过维护模态特定的多跳轨迹、跨模态匹配模态-跳(hop)标记、以及使用共享-私有表示解耦从同一次前向传播中产生图表示和模态表示,来执行模态保持的跳-标记对齐。我们还提供了稳定传播、缓解过平滑和模态坍塌控制的理论分析。在九个OpenMAG数据集上的实验将CoMAG与仅特征、仅图、多模态和统一MAG基线进行了比较,涵盖图级预测、模态匹配和图条件生成任务。结果表明,CoMAG在对比方法中取得了最佳报告性能,显示任务自适应的可靠上下文和模态保持的对齐共同增强了结构预测、跨模态匹配和图条件生成,同时保持稀疏边的线性复杂度。代码可在https://anonymous.4open.science/r/CoMAG获取。
## I. 引言
多模态属性图(MAGs)为现实世界实体提供了一种自然抽象,这些实体的关系依赖和语义属性密不可分。在电子商务中[43 (https://arxiv.org/html/2606.14172#bib.bib3)],产品通过共同购买关系连接,同时由标题、评论和图像描述。在蜂窝网络中[9 (https://arxiv.org/html/2606.14172#bib.bib4)],蜂窝基础设施可以被建模为连接节点,这些节点由异构属性描述,如无线电信号和地理上下文。因此,MAG学习旨在共同利用图拓扑和由现代视觉、语言或视觉-语言模型编码的多模态语义[50 (https://arxiv.org/html/2606.14172#bib.bib8),44 (https://arxiv.org/html/2606.14172#bib.bib9)]。这种设置支持两个互补的任务族。以图为中心的任务,如节点分类、链接预测和节点聚类,评估表示是否保留了结构、关系和类别判别信息。以模态为中心的任务,如跨模态检索、模态匹配、模态对齐和图条件生成,评估表示是否捕获了跨模态的细粒度语义对应。因此,期望统一的MAG主干网络能够从相同的表示学习流程中同时支持图推理和多模态语义匹配。
尽管取得了显著进展,现有的MAG方法仍然受限于一种假设:单一的图上下文或单一的融合表示可以服务所有下游目标。(1) 任务无关的上下文传播。以图为中心和以模态为中心的任务通常需要不同的邻域。分类可能偏好标签一致的邻居,链接预测可能依赖结构互补性,聚类可能需要紧凑且可分离的社区,而检索可能受益于在原始图中未直接连接但语义对齐的节点。然而,许多方法在原始拓扑或统一学习的拓扑上传播,这可能会放大噪声边、忽略缺失的语义关系,并以相同方式处理任务冲突的边。(2) 过度压缩的跨模态融合。现有的融合或对齐机制通常鼓励不同模态坍缩到一个共同的表示空间。虽然这种压缩可以突出共享语义,但也可能移除对检索、匹配、生成和细粒度对齐至关重要的模态特定细节。最近的邻域分词化、模态感知传播、任务特定拓扑和共享-私有解缠等研究提供了有用的组件[8 (https://arxiv.org/html/2606.14172#bib.bib17),16 (https://arxiv.org/html/2606.14172#bib.bib16),17 (https://arxiv.org/html/2606.14172#bib.bib15),49 (https://arxiv.org/html/2606.14172#bib.bib52),28 (https://arxiv.org/html/2606.14172#bib.bib42),57 (https://arxiv.org/html/2606.14172#bib.bib12),12 (https://arxiv.org/html/2606.14172#bib.bib13)],但它们并未完全解决如何在学习任务自适应图上下文的同时保留模态特定证据的问题。
因此,我们将本研究聚焦于以下问题:MAG主干网络如何针对不同任务学习可靠上下文,同时在不抹除模态独特信息的情况下对齐模态?我们的出发点是上下文构建和模态对齐应被视为两个耦合但不同的问题。模型不应直接从原始图聚合所有邻居,而应识别哪些结构边是可靠的、恢复原始图缺失的语义邻居关系,并将生成的上下文适应到目标任务。模型不应将所有模态强制到一个融合嵌入中,而应维护模态特定的传播轨迹,并以更细粒度对齐它们,从而同时保留跨模态共识和模态私有证据。这一视角将MAG学习从简单的拓扑-模态融合转向上下文感知的模态-拓扑协同对齐。
为此,我们提出CoMAG(面向多模态属性图的上下文感知模态-拓扑协同对齐),一个统一的框架,旨在通过共享主干网络服务于以图为中心和以模态为中心的任务。CoMAG建立在两个技术支柱上。可靠上下文学习从多模态语义一致性估计边可靠性,用语义邻居补充原始图,并根据任务选择合适的上下文。模态保持的跳-标记对齐将每个模态沿学习到的上下文作为多跳轨迹进行传播,将每个模态-跳对视为对齐标记,并将结果表示解耦为共享共识和模态特定残差分量。共享组件支持面向图导向的推理,而模态特定组件保留了检索、匹配和生成所需的判别信息。在OpenMAG协议下,这些设计选择在评估方法中取得了最佳报告性能,涵盖图级预测和模态级匹配与生成,表明可靠拓扑、语义上下文恢复和模态私有证据对于统一的MAG学习是互补的。我们的主要贡献总结如下。
1. 问题重构。我们将统一MAG表示学习识别为任务自适应上下文构建和模态保持对齐的问题,而非图聚合或多模态融合的直接扩展。
2. 新颖框架。我们引入CoMAG,将可靠上下文学习、模态特定跳轨迹、跳-标记跨模态匹配和共享-私有解耦集成到一个统一的MAG主干网络中。
3. SOTA性能。我们通过广泛评估验证CoMAG,展示其相对于竞争基线的优越性能,以及针对各种挑战场景的鲁棒性。
## II. 相关工作
### II-A 多模态属性图学习
多模态属性图学习考虑节点携带异构语义证据的关系数据。最近的综述将此设定视为一个通用的多模态图学习问题,而非仅推荐系统的公式化[7 (https://arxiv.org/html/2606.14172#bib.bib6),36 (https://arxiv.org/html/2606.14172#bib.bib7)]。新基准进一步扩展了MAG评估,涵盖异构模态、以图为中心的预测和以模态为中心的推理[47 (https://arxiv.org/html/2606.14172#bib.bib1),58 (https://arxiv.org/html/2606.14172#bib.bib2),54 (https://arxiv.org/html/2606.14172#bib.bib5)]。代表性模型将模态感知卷积、注意力和推荐目标注入消息传递[50 (https://arxiv.org/html/2606.14172#bib.bib8),44 (https://arxiv.org/html/2606.14172#bib.bib9),18 (https://arxiv.org/html/2606.14172#bib.bib10),11 (https://arxiv.org/html/2606.14172#bib.bib11)]。其他研究针对聚类、生物医学分析或多模态图结构上的架构搜索[57 (https://arxiv.org/html/2606.14172#bib.bib12),12 (https://arxiv.org/html/2606.14172#bib.bib13),21 (https://arxiv.org/html/2606.14172#bib.bib23),1 (https://arxiv.org/html/2606.14172#bib.bib24)]。最近的图Transformer和统一嵌入方法进一步在共享空间中绑定多模态图信号[14 (https://arxiv.org/html/2606.14172#bib.bib14),17 (https://arxiv.org/html/2606.14172#bib.bib15),16 (https://arxiv.org/html/2606.14172#bib.bib16)]。基础模型和生成方向将此线扩展为图增强的多模态理解、图语言助手和从MAGs生成图像[8 (https://arxiv.org/html/2606.14172#bib.bib17),33 (https://arxiv.org/html/2606.14172#bib.bib18),55 (https://arxiv.org/html/2606.14172#bib.bib22)]。这些工作共同确认了需要联合建模拓扑和模态语义,但大多数仍依赖任务特定架构或固定图上下文。CoMAG保留广泛的MAG目标,同时在一次前向流程中学习任务自适应的可靠上下文和模态保持的输出。
### II-B 可靠图上下文与多跳传播
图神经网络提供了在关系结构上传播信息的标准机制。经典的消息传递模型通过卷积、注意力、采样或高阶聚合聚合局部邻域[19 (https://arxiv.org/html/2606.14172#bib.bib25),5 (https://arxiv.org/html/2606.14172#bib.bib26),45 (https://arxiv.org/html/2606.14172#bib.bib27),13 (https://arxiv.org/html/2606.14172#bib.bib28),53 (https://arxiv.org/html/2606.14172#bib.bib31)]。后续分析识别了过平滑和深度限制,而残差和可逆设计改善了深度传播[24 (https://arxiv.org/html/2606.14172#bib.bib29),34 (https://arxiv.org/html/2606.14172#bib.bib30),2 (https://arxiv.org/html/2606.14172#bib.bib32),22 (https://arxiv.org/html/2606.14172#bib.bib36)]。传播-过滤方法进一步控制信号如何在多跳中积累[20 (https://arxiv.org/html/2606.14172#bib.bib33),51 (https://arxiv.org/html/2606.14172#bib.bib34),4 (https://arxiv.org/html/2606.14172#bib.bib35)]。异质性研究和图Transformer变体表明,有用上下文可能与局部同质邻域大不相同[32 (https://arxiv.org/html/2606.14172#bib.bib37),25 (https://arxiv.org/html/2606.14172#bib.bib38),29 (https://arxiv.org/html/2606.14172#bib.bib40),38 (https://arxiv.org/html/2606.14172#bib.bib41)]。在MAGs中,上下文可靠性更加依赖任务,因为只有当边的结构关系与多模态语义兼容时才应信任该边。任务特定的拓扑修改和多模态图Transformer表明,上下文应适应目标[28 (https://arxiv.org/html/2606.14172#bib.bib42),16 (https://arxiv.org/html/2606.14172#bib.bib16),17 (https://arxiv.org/html/2606.14172#bib.bib15)]。CoMAG遵循这一原则,在传播前构建可靠性门控结构图、语义补充图和任务条件上下文混合,使上下文学习成为主干网络本身的一部分。
### II-C 跨模态对齐与共享-私有表示学习
跨模态对齐旨在寻求异构模态之间的可比表示,同时保留每个源独有的证据。视觉-语言预训练和多模态绑定模型提供了强大的对齐先验[40 (https://arxiv.org/html/2606.14172#bib.bib43),10 (https://arxiv.org/html/2606.14172#bib.bib44),3 (https://arxiv.org/html/2606.14172#bib.bib45)],而现代文本和视觉编码器为MAGs提供了表达性节点属性[6 (https://arxiv.org/html/2606.14172#bib.bib46),35 (https://arxiv.org/html/2606.14172#bib.bib47),42 (https://arxiv.org/html/2606.14172#bib.bib48),41 (https://arxiv.org/html/2606.14172#bib.bib49),27 (https://arxiv.org/html/2606.14172#bib.bib50)]。图感知对齐方法将关系证据注入图像-文本匹配、多模态路径对齐和图增强的多模态理解[26 (https://arxiv.org/html/2606.14172#bib.bib51),49 (https://arxiv.org/html/2606.14172#bib.bib52),33 (https://arxiv.org/html/2606.14172#bib.bib18),8 (https://arxiv.org/html/2606.14172#bib.bib17)]。图对比预训练同样通过对比上下文信号学习鲁棒表示[56 (https://arxiv.org/html/2606.14172#bib.bib53),39 (https://arxiv.org/html/2606.14172#bib.bib54),46 (https://arxiv.org/html/2606.14172#bib.bib55),37 (https://arxiv.org/html/2606.14172#bib.bib56)],而掩码图建模从周围上下文重建隐藏证据[15 (https://arxiv.org/html/2606.14172#bib.bib57),23 (https://arxiv.org/html/2606.14172#bib.bib58)]。然而,将所有模态强制到一个融合嵌入可能会掩盖模态特定线索,这也是共享特定和缺失模态学习中研究的问题[48 (https://arxiv.org/html/2606.14172#bib.bib59),31 (https://arxiv.org/html/2606.14172#bib.bib60),30 (https://arxiv.org/html/2606.14172#bib.bib61),52 (https://arxiv.org/html/2606.14172#bib.bib62)]。这个问题在MAGs中尤为明显,因为跨模态一致性可能在不同传播深度出现。文本邻域可能在几跳后变得类别判别性,而视觉证据可能保持局部且由外观驱动。仅最终嵌入对齐无法判断一致性是来自共享语义还是来自应该保留的有用的模态私有证据。因此,统一的MAG主干网络需要足够细粒度的对齐,以比较模态-跳证据,同时仍然将共识与模态特定残差信息分离,以便用于\(z_i^g\)和\(e_i^{(m)}\)。
## III. 预备知识
### III-A 多模态属性图
多模态属性图(MAG)表示为\(\mathcal{G}=(\mathcal{V},\mathcal{E},\{X^{(m)}\}_{m=1}^M)\),其中\(\mathcal{V}\)包含\(N=|\mathcal{V}|\)个节点,\(\mathcal{E}\subseteq\mathcal{V}\times\mathcal{V}\)由邻接矩阵\(A\in\mathbb{R}^{N\times N}\)表示,而\(X^{(m)}\in\mathbb{R}^{N\times d_m}\)相似文章
面向联邦多模态图基础模型:一种拓扑感知的多模态对齐框架
提出了FedGAMMA,一种联邦多模态图基础学习框架,通过两阶段预训练和基于提示的微调,对齐多模态属性和图拓扑,在多个数据集上取得了显著提升。
面向模态异质性下的鲁棒联邦多模态图学习
本文提出FedMPO,一种鲁棒的联邦多模态图学习方法,通过拓扑感知的跨模态生成、缺失感知的专家路由和可靠性感知的聚合来解决模态异质性和缺失模态问题,在多个数据集上实现了性能提升。
面向高效联邦多模态图学习:通过导航多方面异质性
提出FedTCR,这是首个系统的联邦多模态图学习算法,通过拓扑感知的跨模态路由和三水平对比学习来处理任务、模态和拓扑异质性,在7个领域上优于基线方法。
GoCoMA:基于双曲 Poincaré 球嵌入的大语言模型生成代码溯源多模态表征融合
GoCoMA 是一个多模态框架,采用双曲 Poincaré 球嵌入来融合代码文体学和二进制可执行产物图像,用于对大语言模型生成的代码进行溯源,在两个基准数据集上优于单模态和欧几里得基线方法。
MoCA:隐式社会情境分析
介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。