RHEA:面向稳健多模态属性图聚类的可靠性协调重建与分配

arXiv cs.LG 论文

摘要

本文提出RHEA,一种面向多模态属性图聚类的可靠性感知框架。该框架通过邻域一致性估计节点特定的模态可靠性,重建不可靠模态,并使用可靠性感知融合和最优传输聚类。在四个基准上的实验显示出一致的性能提升,尤其在属性含噪或缺失的情况下。

arXiv:2608.00621v1 公告类型:新 摘要:多模态属性图(MAGs)的节点在关系结构上承载文本和图像等异构属性,已成为无标签实体分组任务的基础载体,包括社区发现和产品细分。现有的MAG聚类方法在属性干净且完整时能有效整合互补模态,但在属性含噪或缺失时性能大幅下降,因为它们隐式地假设所有节点的模态可靠性相同。实际上,模态可靠性本质上是节点特定的:图像可能损坏或缺失,而文本描述可能不完整或含噪声。我们认为,在属性同质性下,图邻域自然为估计节点特定的模态可靠性提供了无需监督的证据。基于这一洞察,我们提出了RHEA,一种面向MAG聚类的可靠性感知框架,它从邻域一致性中估计节点特定的模态可靠性,并在整个聚类流程中传播这一信号。RHEA从图邻域中重建不可靠或缺失的模态,在可靠性感知融合过程中自适应地为模态加权,并执行拓扑感知的最优传输聚类,结合可靠性感知的传输分配和邻域一致性分配蒸馏。此外,重建表示的置信度被纳入聚类目标,使不确定的重建能在优化过程中按比例贡献。在五种属性条件下对四个MAG基准的实验表明,RHEA持续优于最强基线,且随着属性质量下降,NMI增益增大。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:42

# 面向鲁棒多模态属性图聚类的可靠性协调重建与分配

Yinlin Zhu1, Di Wu1, Ziyu Han2, Zekai Chen3, Wang Luo1, Miao Hu1, Guocong Quan1

###### 摘要

多模态属性图(MAGs)的节点在关系结构上承载文本和图像等异构属性,已成为社区发现、产品细分等无标签实体分组任务的基础数据形式。现有的 MAG 聚类方法在属性干净且完整时能够有效整合互补模态,但在属性含噪或缺失时性能显著下降,因为它们隐含地假设所有节点的模态可靠性相同。实际上,模态可靠性本质上是节点特定的:图像可能被破坏或缺失,而文本描述可能不完整或含噪。我们认为,在属性同质性下,图邻域自然提供了无监督证据,可用于估计节点特定的模态可靠性。基于这一见解,我们提出 RHEA,一个面向 MAG 聚类的可靠性感知框架,它从邻域共识中估计节点特定的模态可靠性,并将这一信号传播到整个聚类流程。RHEA 从图邻域重建不可靠或缺失的模态,在可靠性感知融合中自适应地对模态加权,并执行具有可靠性感知传输分配和邻居共识分配蒸馏的拓扑感知最优传输聚类。此外,重建表示的置信度被纳入聚类目标,使得不确定的重建在优化过程中按比例贡献。在四个 MAG 基准上的五种属性条件下的实验表明,RHEA 始终优于最强的基线,且随着属性质量下降,NMI 增益增大。

## 1 引言

多模态属性图(MAGs)中,节点在关系结构上与文本和图像等异构属性相关联,已成为推荐系统、电子商务目录、引文网络和社交社区的基本数据模型([Guo et al. 2025](https://arxiv.org/html/2608.00621#bib.bib2);[Zheng et al. 2025](https://arxiv.org/html/2608.00621#bib.bib1);[Peng et al. 2021](https://arxiv.org/html/2608.00621#bib.bib11))。MAG 上的一项基本任务是节点聚类,其目标是在无需人工标注的情况下发现语义连贯的节点簇,应用于社区发现、产品细分和冷启动分类体系构建等场景。最近的多模态图聚类方法通过联合建模图拓扑和多模态属性来学习节点表示,在所有模态的属性干净且完整时取得了优异性能([Guo et al. 2025](https://arxiv.org/html/2608.00621#bib.bib2);[Zheng et al. 2025](https://arxiv.org/html/2608.00621#bib.bib1))。

然而,这一假设在真实世界的 MAG 中很少成立。产品图像可能被破坏或缺失,文本描述往往含噪或不完整,且最有信息量的模态在不同节点之间可能有很大差异。现有方法([Guo et al. 2025](https://arxiv.org/html/2608.00621#bib.bib2);[Zheng et al. 2025](https://arxiv.org/html/2608.00621#bib.bib1))在表示学习过程中仍然隐含地假设每个模态对所有节点具有相同的可靠性。结果,被破坏的模态污染了融合后的表示,缺失的模态无法得到有效补偿,聚类性能随属性质量下降而恶化。这个问题在无监督场景下尤其具有挑战性,因为无法从标签推断模态可靠性。这引出了一个基本问题:*如何在无监督条件下估计节点特定的模态可靠性,以支持鲁棒的多模态属性图聚类?*

我们认为图结构本身提供了答案。在广泛观察到的属性同质性原则下([McPherson et al. 2001](https://arxiv.org/html/2608.00621#bib.bib41)),相邻节点往往表现出相似的语义属性。因此,与邻域一致的模态比持续偏离局部共识的模态更可能是可靠的。这一观察使得直接从图中进行无监督的节点特定模态可靠性估计成为可能。我们不是将可靠性视为所有节点共享的模态级属性,而是将其建模为随节点和模态变化的潜在变量,为鲁棒多模态表示学习提供统一信号。

基于这一见解,我们提出**可靠性协调重建与分配**(Reliability-Harmonized Reconstruction and Assignment,RHEA),一个面向 MAG 聚类的可靠性感知框架。RHEA 从邻域共识估计节点特定的模态可靠性,并利用它来重建不可靠模态、自适应融合多模态表示,以及引导拓扑感知最优传输聚类。一个统一的可靠性信号将这些组件连接起来,使得在属性损坏和缺失的情况下都能进行鲁棒的表示学习。在四个基准数据集上的五种属性条件下进行的大量实验表明,RHEA 始终优于现有方法,且随着属性质量的下降,改进幅度变得更大。此外,学习到的可靠性估计能够准确恢复合成注入的属性损坏,所有数据集上的 AUROC 均超过 0.95,验证了所提可靠性建模的有效性。

我们的贡献。(1)**有价值的见解**。我们识别出*节点特定的模态可靠性*是鲁棒多模态属性图聚类所缺少的关键要素,并证明图邻域为估计这种可靠性提供了无监督证据。(2)**新方法**。我们提出 RHEA,一个统一的可靠性感知框架,其中共享的邻域共识可靠性信号同时引导基于图的模态重建、自适应多模态融合和拓扑感知最优传输聚类。(3)**最先进性能**。在四个基准数据集上的大量实验表明,在多种损坏和缺失设置下,RHEA 始终优于最先进的方法。

## 2 相关工作

#### 属性图聚类。

属性图聚类已在单一属性模态的图上得到广泛研究。早期方法将图自编码器与聚类目标耦合,通过双分支架构、注意力机制或精炼图编码器逐步改进结构-特征融合([Bo et al. 2020](https://arxiv.org/html/2608.00621#bib.bib9);[Tu et al. 2021](https://arxiv.org/html/2608.00621#bib.bib10);[Peng et al. 2021](https://arxiv.org/html/2608.00621#bib.bib11);[Wang et al. 2019](https://arxiv.org/html/2608.00621#bib.bib12);[Liu et al. 2022b](https://arxiv.org/html/2608.00621#bib.bib13);[Cui et al. 2020](https://arxiv.org/html/2608.00621#bib.bib14);[Liu et al. 2023a](https://arxiv.org/html/2608.00621#bib.bib15),[2022a](https://arxiv.org/html/2608.00621#bib.bib16))。较新的方法则依赖自监督目标,包括对比学习([Zhu et al. 2021](https://arxiv.org/html/2608.00621#bib.bib24);[You et al. 2020](https://arxiv.org/html/2608.00621#bib.bib25);[Xia et al. 2022](https://arxiv.org/html/2608.00621#bib.bib26);[Liu et al. 2023b](https://arxiv.org/html/2608.00621#bib.bib19);[Yang et al. 2023](https://arxiv.org/html/2608.00621#bib.bib20);[Liu et al. 2024b](https://arxiv.org/html/2608.00621#bib.bib21))以及基于模块度优化的可微图划分([Tsitsulin et al. 2023](https://arxiv.org/html/2608.00621#bib.bib23);[Newman 2006](https://arxiv.org/html/2608.00621#bib.bib36);[Liu et al. 2024a](https://arxiv.org/html/2608.00621#bib.bib22))。将聚类扩展到多模态属性图仍相对缺乏探索。现有方法主要通过解耦([Guo et al. 2025](https://arxiv.org/html/2608.00621#bib.bib2))、图滤波与对比对齐([Zheng et al. 2025](https://arxiv.org/html/2608.00621#bib.bib1))、特征融合([Lin et al. 2024](https://arxiv.org/html/2608.00621#bib.bib3);[Pan and Kang 2021](https://arxiv.org/html/2608.00621#bib.bib4);[Ke et al. 2023](https://arxiv.org/html/2608.00621#bib.bib7))或更具表达力的多模态架构([Zhu et al. 2026](https://arxiv.org/html/2608.00621#bib.bib5);[Li et al. 2025b](https://arxiv.org/html/2608.00621#bib.bib6),[a](https://arxiv.org/html/2608.00621#bib.bib8),[2026](https://arxiv.org/html/2608.00621#bib.bib46);[Lin and Hu 2022](https://arxiv.org/html/2608.00621#bib.bib33))来改进跨模态表示学习。尽管存在差异,这些方法在所有节点上采用共享的融合策略,隐含地假设每个模态的贡献相同,而不管真实场景中局部模态质量如何。

#### 不完整多模态学习。

我们的工作与在缺失或不可靠模态下的学习密切相关。现有的不完整多视角方法通常通过对比预测、特征对齐或生成式补全来恢复缺失视角([Lin et al. 2021](https://arxiv.org/html/2608.00621#bib.bib27);[Xu et al. 2023](https://arxiv.org/html/2608.00621#bib.bib28)),其他方法则使用证据学习、信息瓶颈或最优传输来自适应地对模态加权([Han et al. 2023](https://arxiv.org/html/2608.00621#bib.bib30);[Yan et al. 2024b](https://arxiv.org/html/2608.00621#bib.bib31);[Cuturi 2013](https://arxiv.org/html/2608.00621#bib.bib32);[Peyré and Cuturi 2019](https://arxiv.org/html/2608.00621#bib.bib43);[Xue et al. 2025](https://arxiv.org/html/2608.00621#bib.bib29))。在图领域,最近的方法通过图传播([Malitesta et al. 2026](https://arxiv.org/html/2608.00621#bib.bib49);[Roh et al. 2025](https://arxiv.org/html/2608.00621#bib.bib50))、图去噪([Zhou and Shen 2023](https://arxiv.org/html/2608.00621#bib.bib52))、基于扩散的模态生成([Jiang et al. 2024](https://arxiv.org/html/2608.00621#bib.bib51))或不确定性感知聚合([Shim et al. 2019](https://arxiv.org/html/2608.00621#bib.bib53);[Wang and others 2025](https://arxiv.org/html/2608.00621#bib.bib54);[Chen et al. 2025](https://arxiv.org/html/2608.00621#bib.bib55))来扩展这些思想。相比之下,我们既不训练专门的生成式补全模型,也不假设一个全局共享的模态级可靠性估计。相反,我们研究在异构模态质量下的多模态图聚类,其中可靠性是节点特定的,不可靠模态直接从图邻域中修复。我们的评估遵循 MAGB 和 OpenMAG 的标准化协议([Yan et al. 2024a](https://arxiv.org/html/2608.00621#bib.bib44);[Wan et al. 2026](https://arxiv.org/html/2608.00621#bib.bib45));关于不完整图学习的更广泛讨论可见于综述([Xia et al. 2025](https://arxiv.org/html/2608.00621#bib.bib47);[Wu et al. 2024](https://arxiv.org/html/2608.00621#bib.bib48))。

## 3 预备与问题定义

#### 多模态属性图(MAG)。

我们考虑一个 MAG,$\mathcal{G}=(\mathbf{A},\{\mathbf{X}^{(m)}\}_{m\in\mathcal{M}})$,包含 $N$ 个节点。其中 $\mathbf{A}\in\{0,1\}^{N\times N}$ 是邻接矩阵,$\mathcal{M}$ 索引属性模态,在我们的情况下为文本和图像($|\mathcal{M}|=2$)。每个模态关联一个属性矩阵 $\mathbf{X}^{(m)}\in\mathbb{R}^{N\times d_m}$,其行 $\mathbf{x}_i^{(m)}$ 保存节点 $i$ 的模态 $m$ 属性,这些属性由标准预训练编码器获得([Vaswani et al. 2017](https://arxiv.org/html/2608.00621#bib.bib37);[Radford et al. 2021](https://arxiv.org/html/2608.00621#bib.bib42))。我们用 $\mathbf{D}$ 表示度矩阵,$\tilde{\mathbf{A}}=\mathbf{D}^{-1/2}\mathbf{A}\mathbf{D}^{-1/2}$ 表示对称归一化邻接矩阵,$\mathcal{N}(i)$ 表示节点 $i$ 的图邻居。

#### MAG 聚类。

我们考虑在异构模态质量下的 MAG 聚类,其中对于未知的节点子集,某个模态要么缺失(其缺失是可观察的),要么存在但无信息量(其不可靠性是潜在的,必须被推断)。目标是在没有标签的情况下将 $N$ 个节点划分为 $K$ 个簇,为每个节点 $i$ 产生硬分配 $\hat{y}_i\in\{1,\dots,K\}$。

#### 可靠性场。

我们定义一个节点特定的*模态可靠性场* $\rho_{i,m}\in[0,1]$,它捕捉模态 $m$ 对节点 $i$ 的可信程度,并按节点归一化,使得 $\sum_{m\in\mathcal{M}}\rho_{i,m}=1$。值得注意的是,值越大表示可靠性越高。

## 4 方法

图1:RHEA 总览。RHEA 包含四个阶段:(1)估计:从邻居共识学习节点特定的模态可靠性;(2)表示:重建不可靠模态并执行可靠性感知融合;(3)聚类:通过可靠性感知最优传输获得拓扑一致的分配;(4)优化:联合训练聚类和表示目标。一个统一的可靠性场连接所有阶段。

在本节中,我们提出 RHEA,一个用于鲁棒多模态图聚类的可靠性感知框架。如图 [图1](https://arxiv.org/html/2608.00621#S4.F1) 所示,RHEA 以完全无监督的方式从邻域共识中估计节点特定的模态可靠性,并将这一可靠性场传播到表示学习、融合和聚类中。

### 4.1 邻居共识可靠性估计

RHEA 建立在"模态可靠性本质上是节点特定的"这一观察之上。RHEA 不是假设每个模态在所有节点上具有相同的可靠性,而是基于邻域共识估计节点特定的模态可靠性场。在属性同质性下,可靠模态应与相邻节点提供的语义证据一致,而被破坏的模态往往偏离这一共识。

具体地,令 $\mathbf{z}_i^{(m)}=f_m(\mathbf{X}^{(m)},\mathbf{A})\in\mathbb{R}^{d}$ 为节点 $i$ 在模态 $m$ 下经过 $\ell_2$ 归一化的嵌入,由逐模态图编码器 $f_m$(例如 GCN([Kipf and Welling 2017](https://arxiv.org/html/2608.00621#bib.bib34))或 GAT([Veličković et al. 2018](https://arxiv.org/html/2608.00621#bib.bib35)))得到。对于节点 $i$ 和模态 $m$,我们度量模态内邻居一致性,其计算方式如下:

\[
a_{i,m} \;=\; \frac{1}{|\mathcal{N}(i)|}\sum_{j\in\mathcal{N}(i)}\big\langle \mathbf{z}_i^{(m)},\,\mathbf{z}_j^{(m)}\big\rangle,
\]
(1)

其中 $\langle\cdot,\cdot\rangle$ 是对 $\ell_2$ 归一化嵌入的余弦相似度。一致性分数度量在结构同质性下,节点 $i$ 的模态 $m$ 与其局部邻域的对齐程度。

随后,我们将逐模态一致性转换为逐节点可靠性,公式如下:

\[
\rho_{i,m} \;=\; \frac{\exp(a_{i,m}/\tau)}{\sum_{m^{\prime}\in\mathcal{M}}\exp(a_{i,m^{\prime}}/\tau)},
\]
(2)

其中 $\tau$ 是温度参数,$\rho_{i,m}$

相似文章

面向模态异质性下的鲁棒联邦多模态图学习

arXiv cs.LG

本文提出FedMPO,一种鲁棒的联邦多模态图学习方法,通过拓扑感知的跨模态生成、缺失感知的专家路由和可靠性感知的聚合来解决模态异质性和缺失模态问题,在多个数据集上实现了性能提升。

基于角色感知聚类的异构图压缩

arXiv cs.LG

本文提出了一种基于角色感知的异构图压缩框架HGC-RC,该框架利用轻量级传播和混合聚类策略生成紧凑的异构图,从而在不牺牲性能的情况下实现大规模图上的高效HGNN训练。