MGDT:MLLM引导的扩散Transformer结合关系自适应混合专家模型用于多模态知识图谱补全

arXiv cs.AI 论文

摘要

提出了M2GDT,一种新颖的MKGC框架,它利用MLLM引导的扩散Transformer与关系自适应混合专家模型来对齐和去噪多模态特征,在三个基准数据集上优于基线方法。

arXiv:2607.15592v1 公告类型:新 摘要:多模态知识图谱补全(MKGC)需要从结构、文本和视觉线索中推断缺失实体。现有的基于扩散的MKGC方法通常直接在原始多模态特征上进行去噪。这种设计迫使去噪器同时执行关系相关的线索选择、跨模态语义对齐和结构感知的实体生成,这为扩散引入了噪声和语义不一致的条件,从而导致次优的补全性能。为了解决这一局限性,我们提出了MGDT:MLLM引导的扩散Transformer与关系自适应混合专家模型(MGDT),这是一种基于先对齐后扩散范式的新型MKGC框架。MGDT首先采用关系自适应语义路由混合专家模型(RASR-MoE)模块来选择与关系相关的多模态语义变换路径,并抑制不相关模态的干扰。然后,MGDT使用冻结的多模态大语言模型(MLLM)作为语义锚点,将路由后的多模态表示对齐到统一的潜在空间,并减少跨模态语义异质性。最后,知识图谱扩散Transformer(KGDT)在对齐空间中执行图条件去噪生成,以产生缺失的实体表示。在三个基准数据集上的实验表明,MGDT始终优于强基线方法。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:22

# MLLM引导的扩散变换器结合关系自适应混合专家用于多模态知识图谱补全
来源:https://arxiv.org/html/2607.15592  
梁美玉 1,黄伟 2,3,李雅文 3,薛哲 1,刘武 4,叶冠华 1,石磊 5,卢康康 3  

1 北京邮电大学计算机学院  
2 浙江大学  
3 北京邮电大学  
4 中国科学技术大学  
5 中国传媒大学  

(2026)

###### 摘要

多模态知识图谱补全(MKGC)需要从结构、文本和视觉线索中推断缺失实体。现有的基于扩散的MKGC方法通常直接在原始多模态特征上进行去噪。这种设计迫使去噪器同时执行关系相关的线索选择、跨模态语义对齐和结构感知的实体生成,从而给扩散过程引入了噪声大且语义不一致的条件,最终导致补全性能次优。为解决这一局限,我们提出了 **M2GDT**:**M**LLM引导的扩散变换器结合**R**elation-**A**daptive **M**ixture-**o**f-**E**xperts(M2GDT),一种基于“先对齐后扩散”范式的新型MKGC框架。M2GDT首先采用**R**elation-**A**daptive **S**emantic **R**outing **M**ixture-**o**f-**E**xperts(RASR-MoE)模块来选择关系相关的多模态语义变换路径,并抑制无关模态干扰。然后,M2GDT使用冻结的多模态大语言模型(MLLM)作为语义锚点,将路由后的多模态表示对齐到统一的潜在空间,减少跨模态语义异质性。最后,**K**nowledge **G**raph **D**iffusion **T**ransformer(KGDT)在对齐空间中执行图条件去噪生成,产生缺失实体的表示。在三个基准数据集上的实验表明,M2GDT持续优于强基线。

多模态知识图谱,多模态语言模型,扩散模型,混合专家

††版权:ACM授权  
††期刊年份:2026  
††DOI:XXXXXXX.XXXXXXX  
††会议:第34届ACM国际多媒体会议论文集;2026年11月10-14日;巴西里约热内卢  
††ISBN:978-1-4503-XXXX-X/2018/06  
††CCS:计算方法学 关于信念和知识的推理  

## 1. 引言

![参见说明](Figure 1)  
图1. MKGC的核心挑战。结构、文本和视觉特征存在跨模态语义异质性以及关系相关的多模态线索选择。实线表示模态内关系,虚线表示模态间关系。因此,原始多模态表示并不能为关系条件下的实体补全构成一个可靠的统一推理空间。

多模态知识图谱补全(MKGC)旨在通过联合利用结构关系、文本描述和视觉线索,推断知识图谱中缺失的实体或链接。与传统的知识图谱补全相比,MKGC在现实场景中更具实用性,因为实体通常不仅包含符号三元组,还关联着丰富的多模态属性。在此设定下,模型必须通过基于图结构及异构多模态观测的推理,回答诸如 \((h,r,?)\) 或 \((?,r,t)\) 之类的关系条件查询。这使得MKGC比单模态补全更具挑战性,因为模型不仅要识别正确的实体,还要确保补全后的三元组在语义上有意义且结构上一致。

具体而言,MKGC主要面临两个交织的困难。第一是**跨模态语义异质性**:结构、文本和视觉特征由不同的编码器和优化目标生成,导致它们处于不兼容的语义空间。即使描述同一实体,不同模态也常常强调不同的语义方面,造成显著的跨模态语义鸿沟。如图1所示,这使得原始多模态表示既不能直接比较,也无法作为统一的推理基底可靠地组合。第二个困难是**关系相关的多模态线索选择**:不同的关系往往依赖不同的语义线索。某些情况主要靠结构上下文解决,而另一些则更依赖于文本语义或视觉线索。因此,有效的MKGC不仅需要跨模态对齐,还需要在补全之前以关系感知的方式利用多模态知识。

现有的判别式方法从不同角度应对这两个挑战。早期方法如IKRL(Xie等人,2017)和TransAE(Wang等人,2019)主要通过将多模态属性投影到结构嵌入空间中进行三元组评分,从而初步缓解第一个挑战。近年来的方法进一步改进了针对语义异构输入的多模态表示学习。例如,OTKGE(Cao等人,2022)更明确地处理跨模态不一致性,引入最优传输来更好地对齐多模态表示;而MyGo(Zhang等人,2025)则通过离散码本改进多模态实体建模,为排序提供更丰富的多模态表示。相比之下,MoMoK(Zhang等人,2024)主要解决第二个挑战,采用专家风格的模态选择,在不同关系下有选择性地强调不同模态。尽管这些方法改进了多模态实体排序,但它们的目标本质上是判别式的:评估候选实体的兼容性得分,而非显式建模在多模态不确定性下缺失实体补全的生成式精炼过程。

受扩散模型在复杂条件生成中近期成功的启发(Nichol等人,2021;Saharia等人,2022;Rombach等人,2022),研究者最近开始探索基于扩散的多模态知识图谱补全方法。通过将潜在变量逐步去噪至目标实体表示,扩散为不确定性下的迭代精炼提供了一种自然机制,特别适用于多模态实体补全。近期工作如DiffusionCom(Huang等人,2025)和FDM(Long等人,2024)展示了扩散在建模知识图谱复杂关系结构方面的潜力。然而,现有的基于扩散的MKGC方法通常将原始多模态特征直接注入去噪过程,隐含假设原始多模态特征空间已经适合扩散。这种设计使得去噪器需要同时处理上述两个挑战(即跨模态语义异质性和关系相关的多模态线索选择),同时还要进行结构感知的实体生成。先前的基于扩散的公式实际上是在原始多模态条件下进行去噪,从而将多模态线索选择、语义对齐和实体生成纠缠在一个过程中。

因此,我们认为,有效的MKGC扩散应建立在**关系依赖且语义对齐的**

---

**MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion**  
**中文译名:MLLM引导的扩散变换器结合关系自适应混合专家用于多模态知识图谱补全**  
我将继续翻译剩余部分,包括方法、实验等。由于内容较长,请允许我分段进行完整翻译。

相似文章

MMDiff: 扩展扩散变换器以实现多模态生成

Hugging Face Daily Papers

MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。

强化多模态掩码扩散模型的生成顺序

arXiv cs.LG

本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。