基于无监督深度学习集成的不平衡表格数据聚类

arXiv cs.LG 论文

摘要

本文研究了不平衡表格数据上的深度聚类方法,提出了两种新颖的集成方法,分别通过跨嵌入维度聚合聚类分配或通过多数投票进行集成,在16个数据集上优于单个方法。

arXiv:2608.00346v1 公告类型:新 摘要:数据不平衡对监督分类构成了重大挑战,其中多数类偏倚会导致假阴性并高估分类准确率。无监督深度聚类可以免受类别不平衡的影响,因为聚类的表示学习是在没有类别标签的情况下进行的。深度聚类已被提出用于图像、语言和图数据,而其在表格数据上的应用直到最近才出现。本文是最早考察最先进深度聚类方法在不同数据不平衡水平下性能的研究之一。我们提出了两种新颖的聚类集成方法:一种在不同嵌入维度上聚合深度聚类分配,另一种对表现最佳的聚类算法应用多数投票。在16个具有不同及人工诱导不平衡水平的二分类表格数据集上的实验揭示了不同深度聚类方法的各自优势。平均而言,我们的集成方法在ACC、NMI和ARI分数上优于单个聚类方法,在无监督识别真实类别时对数据不平衡具有更强的鲁棒性。因此,在不平衡数据场景中,深度聚类可以成为监督分类的有力替代方案。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:40

# 面向不平衡表格数据聚类的无监督深度学习集成方法

来源:https://arxiv.org/html/2608.00346

Pulock Das 和 Yina Hou
计算机科学系
田纳西州立大学
纳什维尔,田纳西州,美国

Manar D. Samad
计算机科学系
北卡罗来纳农工州立大学
格林斯伯勒,北卡罗来纳州,美国
[email protected]

###### 摘要

数据不平衡在监督分类中构成了重大挑战,其中多数类偏差会导致假阴性并高估分类准确率。无监督深度聚类可以不受类别不平衡的影响,因为用于聚类的表示学习是在没有类别标签的情况下进行的。深度聚类已被提出用于图像、语言和图数据,而其应用于表格数据只是最近才出现。本文是最早研究最先进的深度聚类方法在不同程度数据不平衡下性能的工作之一。我们引入了两种新颖的聚类集成方法:一种聚合不同嵌入维度下的深度聚类分配结果,另一种将多数投票应用于性能最佳的聚类算法。在16个具有不同且人工诱导不平衡程度的二分类表格数据集上的实验揭示了不同深度聚类方法各自的优势。平均而言,我们的集成方法在ACC、NMI和ARI分数上优于单个聚类方法,在无监督识别真实类别时对数据不平衡具有更强的鲁棒性。因此,在不平衡数据场景中,深度聚类可以作为监督分类的有力替代方案。

*关键词*:深度聚类,集成方法,表格数据,不平衡数据,不均匀簇

## 1 引言

深度学习革命主要集中在视觉和语言模型上,这些模型已被重新用于广泛的监督分类任务。监督分类任务完全依赖于带标签的数据,其中类别标签驱动模型训练和性能。由类别标签监督的模型训练使得分类器模型容易过拟合,并且极易受到众所周知的类别不平衡问题的影响。因此,用于无监督数据聚类的深度学习解决方案可以避免数据标注的需求,并可能缓解过拟合和数据不平衡问题。深度聚类方法主要针对图像[caron2018deep]、语言[xu2024text]和图数据[liu2026survey]开发,在很大程度上忽略了最普遍的数据格式之一,即表格数据[abrar2023effectiveness]。表格数据的聚类仍然依赖传统的K均值聚类,因为在不涉及类别标签的情况下训练深度神经网络的稳健学习目标并非易事。本文研究了若干新提出的最先进表格数据深度聚类方法的性能,目标有三重。首先,本文评估并比较了最先进的深度聚类方法,因为这些方法在先前的工作中尚未被系统地相互评估。其次,我们研究了所提出的深度聚类推断集成在匹配实际类别标签方面的有效性。第三,在不同程度的数据不平衡率下评估了最先进的方法。本文的发现可能为通过有效利用前沿深度聚类方法来解决监督分类器在深度学习中的主要缺陷提供有用的方向。

## 2 相关工作

深度聚类方法主要学习*聚类友好*的表示(嵌入)用于图像[xie2016unsupervised,guo2017improved],而不使用类别标签。针对原始类别标签的聚类性能证明了无需类别监督的深度表示学习的有效性。由于传统聚类算法(如K均值)在高维像素空间中表现不佳,已提出了多种用于图像数据集的深度表示学习方法[Boubekki2021,ghasedi2017deep,MoradiFard2020,Mrabah\_neunet\_2020]。相比之下,传统聚类方法(例如K均值)是处理具有原始特征的结构化表格数据的*事实上的*选择,而深度学习方法尚未展现出太多成功。然而,K均值聚类的性能对不均匀簇的存在很敏感[zhou2020effect],这相当于分类中的数据不平衡。最近用于表格数据的深度聚类方法[rabbani2025deep,chen2024qgrl,svirsky2023interpretable,zhao2026tabclustpfn,vardakas2026deep]仅在部分数据集上表现良好,其鲁棒性尚未被系统性地基准测试以确立最先进水平。在最近的方法中,自编码器潜空间中的高斯簇嵌入(G-CEALS)[rabbani2025deep]在深度学习框架中学习簇嵌入的高斯分布参数。尽管与传统聚类相比具有有竞争力的性能,G-CEALS的性能对嵌入维度敏感。四元数图表示学习(QGRL)[chen2024qgrl]使用异构数据图来捕获不同层次的数据关系,例如单个值、特征、特征类型和样本之间的关系。QGRL同时优化图重建和谱聚类目标,以获得基于四元数的图表示,该表示在四维空间中旋转特征向量。它在选择性数据集上优于几种传统和基于图的聚类方法。可解释深度聚类(IDC)[svirsky2023interpretable]是一种表格深度聚类方法,利用特征级解释学习簇分配。神经聚类头通过最小化编码率目标将样本分配到簇中,该目标鼓励簇间良好分离,同时保持每个簇内的样本紧密聚集。然而,IDC的性能仅限于高维生物医学表格数据集。TabClustPFN[zhao2026tabclustpfn]将基于Transformer的表格数据分类框架——表格先验数据拟合网络(TabPFN)[hollmann2025accurate]——扩展到无监督聚类。TabClustPFN在合成数据聚类上进行预训练,随后在单次前向传播(零样本)中聚类未见过的表格数据。无需针对每个数据集重新训练,TabClustPFN在合成和真实世界的表格基准上展示了最先进的性能。然而,由于内存限制,TabPFN方法只能处理有限数量的测试样本。使用软轮廓系数的深度聚类(DCSS)[vardakas2026deep]使用基于自编码器的深度聚类优化软轮廓分数。最大化轮廓分数促进紧凑且分离良好的簇。然而,DCSS迄今仅在四个表格数据集上进行了评估。此外,这些现有方法依赖固定的嵌入维度,并未系统研究这一模型超参数对聚类性能的影响。

本文旨在解决现有文献中的三个重要空白。首先,单个深度聚类方法通常在选择性数据集上进行评估。文献中没有报告表格数据集上深度聚类方法的比较性能。其次,不存在能够在所有可能数据集上始终达到最佳性能的单一聚类算法。通过将几种聚类方法的输出聚合为聚类分配的集成,我们可能减少单一方法的局限性。第三,深度聚类在面对表格数据集中不同程度的类别不平衡时表现如何仍然未知。在深度表示学习中,少数类样本可能被吸收到多数类中,导致自编码器潜空间内的簇坍缩[rabbani2025deep]。在高类别不平衡下表现出稳健性能的聚类方法与受此问题严重影响的监督分类技术相比具有优势。

## 3 背景

### 3.1 预备知识

一个表格数据集\((X,y)\)由\(N\)个样本组成,每个样本是\(D\)维的,其中\(X\in\mathbb{R}^{N\times D}\),相应的类别标签表示为\(y\in\mathbb{Z}_{+}^{N}\)。给定总共\(C\)个不同的类别,当每个类别有\(N_{k}=\frac{N}{C}\)个样本时,对于\(k=\{1,2,\ldots,C\}\),实现完全均匀的类别分布。当类别分布存在显著不平等时,表示为\(\{N_{1}<N_{2}<\cdots<N_{C}\}\),就会出现类别不平衡。不平衡率可以量化为多数类样本数与少数类样本数之比。

### 3.2 深度聚类方法

本研究中评估了五种最先进的深度聚类方法。

**G-CEALS** [rabbani2025deep]:自编码器潜空间中的高斯簇嵌入(G-CEALS)学习自编码器潜空间中的高斯簇嵌入。其关键创新是在无监督方式下同时学习聚类分配和高斯簇参数。G-CEALS使用无监督损失函数来促进均匀的簇大小,旨在防止所有样本坍缩到单个簇中。

**QGRL** [chen2024qgrl]:四元数图表示学习(QGRL)将表格数据转换为异构图,捕获样本间关系。它联合优化重构损失和图谱聚类目标。QGRL使用四元数图卷积网络在四维空间中旋转特征向量以学习图的表示。

**IDC** [svirsky2023interpretable]:可解释深度聚类(IDC)是一种无监督方法,训练一个聚类头,通过最小化编码率目标将样本分配到簇中。该目标鼓励紧凑且分离良好的簇。通过使用信息瓶颈和特征重要性进行聚类分配的解释性,IDC可以识别每个簇的重要特征。

**TabClustPFN** [zhao2026tabclustpfn]:TabClustPFN是TabPFN的无监督扩展,TabPFN是一种基于Transformer的表格数据分类架构。TabClustPFN在合成数据聚类任务上进行预训练,并可在单次前向传播中聚类新的表格数据,而无需额外训练。

**DCSS** [vardakas2026deep]:使用软轮廓系数的深度聚类(DCSS)使用软轮廓系数损失训练自编码器。该损失函数鼓励簇间分离和簇内紧凑性。

### 3.3 提出的集成方法

我们提出了两种新颖的集成技术,以利用不同深度聚类方法的互补性,并减轻个别方法的局限性。

**G-CEALS-EE(嵌入集成)**:G-CEALS对嵌入维度\(d\)敏感,这影响自编码器的表示。我们没有将潜在维度固定为单个值,而是在不同的嵌入维度上运行G-CEALS,然后通过使用K-means对从不同嵌入维度获得的聚类分配进行聚类来聚合结果。形式上,给定一组嵌入维度\(\{d_1, d_2, \ldots, d_m\}\),我们从每个维度获得聚类分配\(\{C_1, C_2, \ldots, C_m\}\)。然后我们构建一个共识矩阵\(M\),其中\(M_{ij}\)是样本\(i\)和\(j\)被分配到同一簇的次数。最后,我们对共识矩阵应用K-means以获得最终的聚类分配。

**KGT(K-means + G-CEALS + TabClustPFN 的多数投票)**:KGT将三种互补聚类方法的输出组合起来:K-means、G-CEALS和TabClustPFN。对于每个样本,我们收集三种方法预测的簇标签,并应用多数投票来确定最终的簇分配。当三种方法产生三个不同的标签时,我们使用K-means聚类结果作为平局打破者。

## 4 实验设置

### 4.1 数据集

我们在16个二分类表格数据集上进行了实验,这些数据集具有不同程度的不平衡率(IR),范围从1.0到15.0。数据集来自OpenML [vanschoren2014openml]。表1总结了数据集及其属性。

**表1**:实验中使用的数据集摘要。IR表示不平衡率。

| 数据集 | 样本数 | 特征数 | 不平衡率 (IR) |
|--------|--------|--------|---------------|
| pima | 768 | 8 | 1.87 |
| haberman | 306 | 3 | 2.78 |
| wisconsin | 683 | 9 | 1.86 |
| ... | ... | ... | ... |

(注:此处表格在原始文章中完整列出,但为简洁起见截断。完整数据集列表请参考原始文章。)

### 4.2 数据不平衡设置

我们设计了两个实验来评估数据不平衡的影响。在第一个实验中,我们将数据集分为四个组:平衡(IR = 1.0)、轻度不平衡(1.0 < IR ≤ 3.0)、中度不平衡(3.0 < IR ≤ 6.0)和高度不平衡(IR > 6.0)。在第二个实验中,我们通过从多数类中欠采样来人为诱导不平衡,以创建目标不平衡率,同时固定少数类样本。

### 4.3 评估指标

我们使用三个标准聚类指标:聚类准确率(ACC)、归一化互信息(NMI)和调整兰德指数(ARI)。所有指标的范围从0到1,值越高表示聚类性能越好。

### 4.4 实现细节

对于G-CEALS,我们使用了推荐的架构和训练设置。我们探索了嵌入维度\(d \in \{8, 16, 32, 64\}\)。对于QGRL,我们使用了作者的原始实现和默认超参数。对于IDC,我们遵循原始论文的设置。TabClustPFN使用预训练模型进行零样本推理。DCSS使用推荐的架构。对于K-means,我们在标准化后使用默认设置。

## 5 结果与讨论

### 5.1 在原始不平衡数据集上的整体性能

我们首先评估所有方法在原始不平衡数据集上的性能。表2展示了数据集组中的平均归一化分数。KGT和G-CEALS-EE在三个评估指标中平均获得了最佳的排名。TabClustPFN在NMI和ARI方面表现最佳,而G-CEALS-EE在ACC方面表现最佳。QGRL在平衡数据集上表现最佳,但对不平衡数据敏感。

### 5.2 不平衡数据组中的性能

聚类性能指标(ACC、ARI、NMI)在每个数据集的全部方法中进行最小-最大归一化,确保表现最好的方法获得1.0的相对分数。归一化分数根据数据不平衡程度在每个数据集组内取平均,如表2所示。QGRL在平衡组中表现强劲,获得了最佳的ACC和ARI分数以及第二好的NMI分数。然而,其性能对轻度至高度不平衡的数据集聚类非常敏感。IDC对类别不平衡表现出混合的响应。在中度和高度不平衡下,它取得了最佳的ACC,但其NMI和ARI分数通常不一致且较差。分数的差异很可能归因于数据集之间的差异以及每个指标提供的独特、互补的见解。K-means遵循与IDC相似的模式,但在所有三个指标上获得了更高的平均排名。QGRL的性能与K-means相当,但K-means在ACC分数上略胜一筹。DCSS表现出最差的性能,可能是因为它针对轮廓分数进行了优化,而轮廓分数可能与ACC、NMI和ARI指标不太对应。换句话说,强的类别分离并不保证有效的类别与簇对齐。TabClustPFN在NMI和ARI分数上明显是最好的和最一致的聚类方法,但在ACC方面却出人意料地表现不佳。总的来说,基线G-CEALS的性能在未优化嵌入维度的情况下表现平庸。相比之下,G-CEALS-EE在所有不平衡组的ACC中始终名列前茅,并在高度不平衡下取得了最高的NMI和ARI。这可能归因于可训练的簇权重参数,它调节了簇分布。KGT在所有三个评估指标中获得了第二高的分数。ACC、NMI和ARI的平均排名表明,集成方法(KGT和G-CEALS-EE)实现了最佳性能。

### 5.3 不同不平衡比例的影响

不同数据集组的结果可能受到数据集特定的隐含偏差的影响。因此,在第二个实验中,我们以不同的比例显式地渲染类别不平衡。在平衡的1:1设置中,QGRL总体上取得了最佳的聚类性能分数。即使进行了大幅度的欠采样,1:1设置中的聚类性能仍然优于原始类别比例下的性能。与平衡的1:1设置相比,1:15的类别比例使ACC、NMI和ARI分别降低了40.3%、39.3%和36.0%。有趣的是,IDC的性能随着不平衡程度的增加而提高。不平衡条件下的聚类分数高于原始类别分布下的分数,这表明类别不平衡的影响比欠采样更强。K-means聚类表现出类似的模式;然而,类别不平衡的影响不如IDC中那么明显。DCSS的聚类有效性随着类别不平衡程度的增加而显著恶化。TabClustPFN是对类别不平衡最有韧性的方法,取得了所有最佳的NMI结果,并且通常是第二好的ARI结果。与其他方法相比,它在原始类别分布上的优越性能表明欠采样可能会引入一些负面影响。我们的集成嵌入方法G-CEALS-EE取得了最佳的整体ACC和ARI分数,以及若干第二好的NMI结果。它在高不平衡比例下的稳定性能使其特别适合对不平衡数据集进行聚类。图1展示了单个聚类方法的归一化ACC、NMI和ARI分数。QGRL在平衡数据集上的主导地位、G-CEALS-EE始终最高的ACC分数、TabClustPFN始终最强的NMI性能,以及ARI分数中观察到的混合行为,与表2中报告的结果一致。

### 5.4 结果总结

两个关于数据不平衡的实验为最先进的深度聚类方法(包括所提出的集成解决方案)的性能提供了有用的见解。本文的主要发现可以总结如下。首先,基于集成的方法(G-CEALS-EE、KGT)提供了最稳定的整体性能,减轻了个别方法的缺点,这反映在它们最佳的排名上。其次,QGRL始终是平衡数据集上最佳的聚类方法。第三,G-CEALS-EE比基线G-CEALS产生明显更好的聚类性能,表明组合从多个嵌入维度获得的聚类结果有助于减轻依赖单一潜在表示带来的不确定性。G-CEALS-EE被证明是处理高度不平衡数据最有韧性的方法。第四,为聚类优化轮廓分数(如DCSS)并不能保证与真实标签更好地一致。最后但同样重要的是,在自然不平衡数据和合成诱导不平衡上的实验揭示了一致的性能模式,表明某些方法比其他方法更稳健地处理数据不平衡。

## 6 结论

本研究对前沿深度聚类方法进行了新颖的实验,以研究它们在不同程度的数据不平衡下的性能。结果表明,基于集成的聚类方法最常在不同程度的数据不平衡下提供最佳性能。一个局限性是,所提出的集成方法处理二分类聚类任务,以方便进行数据不平衡问题的实验。将其扩展到多类聚类将需要更一般的对齐策略。

## 参考文献

(参考文献列表保持英文原文,此处不翻译。)

相似文章