K-IPO:面向不平衡表格数据的肯德尔约束重要性保持过采样方法

arXiv cs.LG 论文

摘要

提出了K-IPO,一种先生成后选择的过采样框架,在增强不平衡表格数据时保留原始数据的特征重要性排序(以肯德尔τ系数衡量),在20个数据集上展现出更优的重要性保持、解释一致性和预测性能。

arXiv:2607.16478v1 公告类型:新 摘要:过采样广泛用于解决表格分类中的类别不平衡问题,但现有方法可能扭曲模型解释背后的特征重要性排序。尽管近期研究通过比较真实数据与合成数据量化了这种扭曲,但尚未有方法主动加以预防。本文介绍肯德尔约束重要性保持过采样方法(K-IPO),这是一种与生成器无关的“先生成后选择”框架,在数据增强过程中保留原始数据的特征重要性排序。K-IPO迭代生成少数类候选样本,仅当加入后仍能保持与参考排序之间用户定义的最小肯德尔τ(τ)相关性时才予以接受。可选地,还可对排名最高的特征施加更严格的约束。我们在20个不平衡二分类数据集上,使用三种分类器和多种解释方法对K-IPO进行了评估。在大多数情况下,K-IPO在特征重要性保持、解释一致性和类别可分性方面取得了最佳或并列最佳结果。同时,它在保持竞争性计算开销的前提下普遍提升了预测性能。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:48

# K-IPO: 基于Kendall约束的重要性保持过采样方法用于非平衡表格数据

来源: https://arxiv.org/html/2607.16478

Marios Tyrovolas¹,²,³,\*, Argiris Sofotasios³,⁴, Dimitris Metaxakis³,⁴, Georgios Mermigkis²,³,⁴, George Georgoulas¹,⁵, Panagiotis Hadjidoukas²,⁴, Chrysostomos Stylios¹,²

¹ 希腊约阿尼纳大学信息学与电信系
² 希腊帕特雷雅典娜研究中心工业系统研究所
³ 希腊雅典雅典娜研究中心阿基米德单元
⁴ 希腊帕特雷大学计算机工程与信息学系
⁵ 希腊帕特雷大学机械工程与航空学系

\* 通讯作者: [email protected] (https://arxiv.org/html/2607.16478v1/mailto:[email protected])

###### 摘要

过采样广泛用于解决表格分类中的类别不平衡问题,但现有方法可能扭曲模型解释背后的特征重要性排序。尽管近期研究已通过比较真实数据和合成数据来量化这种扭曲,但尚无研究主动寻求避免它。本文提出基于Kendall约束的重要性保持过采样(K-IPO),这是一种生成器无关的"先生成后选择"框架,可在数据增强过程中保留原始数据的特征重要性排序。K-IPO迭代生成少数类候选样本,仅在其纳入后与参考排序保持用户定义的最小Kendall tau(τ)相关性时,才接受该候选集。可选地,可对排名最高的特征施加更严格的约束。我们使用三个分类器和多种解释方法,在20个非平衡二分类表格数据集上评估了K-IPO。在大多数情况下,K-IPO在特征重要性保持、解释一致性和类别可分性方面取得了最佳或持平的最佳结果。它还普遍提升了预测性能,同时保持了具有竞争力的计算开销。

## 1 引言

类别不平衡,即观测值在类别标签上分布不均,仍是监督分类中的重大挑战[8](https://arxiv.org/html/2607.16478#bib.bib1)。在不平衡数据上训练的模型倾向于偏好多数类模式,导致决策边界倾斜、对少数类的敏感性降低以及具有误导性的性能估计[30](https://arxiv.org/html/2607.16478#bib.bib2)。当少数类代表罕见但高影响事件(如欺诈、疾病、安全事故或设备故障)时,这一问题尤为关键[49](https://arxiv.org/html/2607.16478#bib.bib3),从而限制了这些模型在现实世界中的适用性。

解决类别不平衡的常见方法包括数据级重平衡、代价敏感或类别加权学习、阈值调整、集成方法以及混合策略[30](https://arxiv.org/html/2607.16478#bib.bib2), [13](https://arxiv.org/html/2607.16478#bib.bib59), [67](https://arxiv.org/html/2607.16478#bib.bib54), [43](https://arxiv.org/html/2607.16478#bib.bib55), [66](https://arxiv.org/html/2607.16478#bib.bib62)。然而,后三者通常需要任务或分类器特定的代价校准,或引入额外的训练和调优复杂度。因此,数据级重平衡仍是广泛采用的策略,其中过采样是一种实用选择,因为它与模型无关、易于集成到标准训练流程中,且无需修改下游分类器。相应地,大量过采样方法已被提出,范围从随机复制[2](https://arxiv.org/html/2607.16478#bib.bib6)和局部插值[7](https://arxiv.org/html/2607.16478#bib.bib4)到概率[1](https://arxiv.org/html/2607.16478#bib.bib16)和深度生成方法[62](https://arxiv.org/html/2607.16478#bib.bib9), [39](https://arxiv.org/html/2607.16478#bib.bib10), [52](https://arxiv.org/html/2607.16478#bib.bib63)。

尽管这些方法可以改善类别平衡和预测性能,但它们的首要目标是优化样本放置、分布保真度或下游效用,而非明确保持塑造模型推理的特征-目标关系[27](https://arxiv.org/html/2607.16478#bib.bib11)。当评估不仅考虑预测性能,还考虑分类器是否依赖适当的特征-目标关系(而不仅仅是实现准确预测)时,这一局限性变得尤为重要[50](https://arxiv.org/html/2607.16478#bib.bib57)。合成样本可能改善少数类指标,同时改变哪些预测因子对训练模型显得最有影响力。

先前研究表明,合成表格数据可能无法保持更深层的结构性质,包括逻辑或功能依赖关系以及特征重要性排序[58](https://arxiv.org/html/2607.16478#bib.bib12), [21](https://arxiv.org/html/2607.16478#bib.bib13), [42](https://arxiv.org/html/2607.16478#bib.bib61)。这类差异对可解释人工智能(XAI)有直接影响,其中特征重要性是模型解释、审计、领域验证和决策支持的主要工具[22](https://arxiv.org/html/2607.16478#bib.bib14)。如果过采样改变了有影响力预测因子的排序,模型可能仍然准确,但其产生的解释将不再反映原始的预测任务。在高风险领域(如医疗、制造和金融),这种解释漂移可能损害信任、可重复性和实际可靠性。

近期框架已认识到需要超越预测效用,通过纳入结构保真度和解释感知标准来评估合成数据[65](https://arxiv.org/html/2607.16478#bib.bib17), [35](https://arxiv.org/html/2607.16478#bib.bib21)。然而,现有方法仍主要是诊断性的,即在合成数据生成后测量特征重要性漂移,而非在数据增强过程中主动防止它。这留下了一个方法论空白:过采样不仅应生成合理且有用的少数类样本,还应保持源自原始数据的特征重要性结构。

为填补这一空白,我们提出基于Kendall约束的重要性保持过采样(K-IPO),这是一种用于非平衡表格分类的"先生成后选择"框架。K-IPO使用选定的过采样方法或表格生成器迭代生成少数类候选样本,仅接受那些纳入后能保持原始数据特征重要性排序的候选集。排序保持通过Kendall等级相关系数τ[36](https://arxiv.org/html/2607.16478#bib.bib25)来强制执行,并可选择对前k个特征施加更严格的约束。因此,K-IPO将解释稳定性直接集成到过采样过程中,而非仅在事后进行评估。

利用20个非平衡二分类表格数据集,我们从特征重要性排序保持和生成数据的类别可分性,以及基于增强数据训练的分类器的预测性能和解释一致性等方面评估了K-IPO。与代表性基线的比较表明,K-IPO在预测-解释综合性能上达到最强,同时可接受额外的计算开销。

本文其余部分组织如下:第2节(https://arxiv.org/html/2607.16478#S2)综述了不平衡学习、表格数据生成和解释感知评估的相关工作。第3节(https://arxiv.org/html/2607.16478#S3)提出了K-IPO,第4节(https://arxiv.org/html/2607.16478#S4)描述了实验设置,包括数据集、预处理、基线过采样方法、分类器、可解释性方法和评估指标。第5节(https://arxiv.org/html/2607.16478#S5)展示了实证结果,第6节(https://arxiv.org/html/2607.16478#S6)通过讨论所提框架的局限性并指出未来研究方向来总结本文。

## 2 文献综述

本节从特征重要性保持的角度综述非平衡表格数据分类的过采样方法。现有方法大致可分为基于复制的过采样、局部插值、分布学习方法和深度生成模型。尽管这些类别在生成少数类观测值的方式上存在差异,但它们通常优先考虑类别平衡、局部几何结构、分布保真度或下游预测效用,而非保持模型解释所依赖的特征-目标关系。

### 2.1 基于复制和插值的过采样

随机过采样是解决类别不平衡的最简单数据级方法,通过复制少数类观测值直到达到期望的类别比例来实现。尽管这种方法增加了少数类的表示,但它并未引入关于少数分布的新信息,并且在可用少数观测值较少时可能导致过拟合[2](https://arxiv.org/html/2607.16478#bib.bib6), [30](https://arxiv.org/html/2607.16478#bib.bib2)。这一局限性促使了合成方法的发展,例如合成少数类过采样技术(SMOTE)[7](https://arxiv.org/html/2607.16478#bib.bib4)。SMOTE通过在观测值与其最近少数类邻居之间插值来生成少数类样本,使其与分类器无关且易于集成到标准学习流程中。

尽管取得了成功,SMOTE假设少数类观测值之间的局部线性插值能够产生合理的样本。当少数区域稀疏、多模态、包含噪声或与多数类重叠时,这一假设可能失效。在这种情况下,合成样本可能连接不同的少数子簇、填充模糊区域或以扭曲原始学习问题的方式平滑少数分布[16](https://arxiv.org/html/2607.16478#bib.bib15)。为此,已提出多种SMOTE变体来改进生成或选择过程。例如,Borderline-SMOTE专注于决策边界附近的少数观测值[25](https://arxiv.org/html/2607.16478#bib.bib5),ADASYN为更难学习的少数观测值分配更多合成样本[29](https://arxiv.org/html/2607.16478#bib.bib7),混合方法(如SMOTE-Tomek和SMOTE-ENN)将过采样与清除模糊、噪声或边界观测值的清理机制相结合[2](https://arxiv.org/html/2607.16478#bib.bib6)。带有Boosting的SMOTE(SMOTEWB)类似地将噪声检测与Boosting引导的生成相结合[51](https://arxiv.org/html/2607.16478#bib.bib53)。具体而言,它利用Boosting导出的权重来确定应在何处生成样本,并自适应地为每个观测值选择邻居数量。基于聚类的方法,如KMeans-SMOTE,将生成限制在选定的少数区域以减少噪声并解决类内不平衡[12](https://arxiv.org/html/2607.16478#bib.bib8)。尽管如此,这些方法仍主要受几何、邻域或启发式标准指导,并未评估合成观测值是否保持了源自原始训练数据的全局特征重要性排序。

### 2.2 表格合成的分布学习方法

分布学习方法显式建模少数类分布。它们不是在相邻观测值之间插值,而是估计数据的统计特性,并从学习到的分布中采样新记录。Copula方法是其中的典型代表,因为它们将边缘分布与依赖结构分离,从而能够比仅基于欧几里得邻域的方法更灵活地对异质变量进行建模[1](https://arxiv.org/html/2607.16478#bib.bib16)。这种灵活性在变量可能具有不同尺度、类型和依赖结构的表格数据中尤为宝贵。

然而,在类别不平衡条件下,分布学习仍具有挑战性,因为少数观测值数量有限,使得边缘分布和依赖结构的可靠估计变得复杂。常见的Copula公式也可能难以捕捉非线性依赖、高阶交互和少数类特定结构[18](https://arxiv.org/html/2607.16478#bib.bib30), [34](https://arxiv.org/html/2607.16478#bib.bib19)。因此,这些方法可能重现少数类的某些统计规律,但无法保持塑造模型行为和特征归因的交互关系。

### 2.3 深度生成过采样与表格扩散模型

深度生成模型在生成合成表格数据方面日益突出,这得益于它们捕捉非线性依赖、处理混合连续和分类变量以及建模复杂特征交互的能力。生成对抗网络(GANs)、变分自编码器(VAEs)和扩散模型均已用于此目的[53](https://arxiv.org/html/2607.16478#bib.bib20)。CTGAN和TVAE是表格合成的广泛使用的深度学习基线。CTGAN适配GAN框架以解决现实世界表格数据的两个常见特性:非高斯或多模态连续变量以及高度不平衡的分类变量。它将连续列的模式特定归一化与分类列的条件生成和按训练采样相结合,改善了频繁和稀有类别的表示[62](https://arxiv.org/html/2607.16478#bib.bib9)。同一研究中引入的TVAE为混合类型表格数据提供了基于VAE的替代方案。它不使用对抗训练,而是学习观测行的潜在概率表示,并通过从该空间解码样本来生成新记录[62](https://arxiv.org/html/2607.16478#bib.bib9)。TabDDPM将去噪扩散概率模型扩展到表格数据,将生成过程表述为适应包含连续和离散变量的异质特征空间的逐步去噪过程。因此,它代表了将表格合成与更广泛的基于扩散的生成建模成功联系起来的一个重要现代基线[39](https://arxiv.org/html/2607.16478#bib.bib10)。

尽管这些模型是过采样的有力候选者,但其目标并不保证特征重要性的保持。GAN优化对抗性不可区分性,VAE强调重建和潜在似然目标,而扩散模型则优化去噪。因此,即使是能提升下游性能的真实感合成样本,也可能削弱相关依赖关系、放大虚假关联或改变有影响力预测因子的排序。这种风险在类别不平衡条件下尤为突出,因为少数类结构必须从有限的、可能稀疏、有噪声或重叠的观测值中推断出来。实证研究进一步表明,深度生成过采样的收益相对于其复杂性可能是适度的,且强烈依赖于数据集特征[6](https://arxiv.org/html/2607.16478#bib.bib22), [17](https://arxiv.org/html/2607.16478#bib.bib29), [9](https://arxiv.org/html/2607.16478#bib.bib23)。因此,深度生成模型是有价值的候选生成器,但预

相似文章

KLip-PPO: 从逐样本KL角度解读PPO-Clip

arXiv cs.LG

本文表明,近端策略优化(PPO)中裁剪替代目标的梯度可以被一个具有可变系数的逐样本KL散度惩罚项精确重现,揭示了裁剪替代目标的结构特性,并提出了新的设计方向。

当数据不平衡有益:通过捷径饱和实现鲁棒泛化

arXiv cs.LG

本文挑战了平衡数据集以避免虚假相关性的标准做法,表明在涉及两层Transformer的合成求和奇偶性任务中,高数据不平衡(虚假比率0.9)促进了鲁棒泛化,而低不平衡(0.5)则阻碍了它,其机制是通过捷径饱和。