通过同质训练-测试分割方法增强自动机器学习

arXiv cs.LG 论文

摘要

本文系统评估了五种用于AutoML的训练-测试分割策略,表明基于几何的方法在保持分布相似性方面不如随机/分层分割有效,并提出了Optimised-Distribution方法,实现了89%的相似度。

arXiv:2607.26625v1 Announce Type: new 摘要: 机器学习中的准确模型评估关键取决于数据集如何分割为训练和测试子集。标准随机分割假设两个分区共享相同的底层分布,这一假设在存在类别不平衡、自然聚类或空间自相关的数据集中常常被违反。本文研究了训练-测试分割中统计相似性的作用及其对AutoML模型评估的影响。在十五个UCI基准数据集上比较了五种已有策略:随机分割、分层采样、Kennard-Stone、Duplex和SPXY。使用卡方检验、Kolmogorov-Smirnov检验和最大均值差异(MMD)检验评估相似性。基于几何的方法始终产生接近零的MMD分数,给下游性能估计带来不稳定性。所提出的Optimised-Distribution方法将相似性作为显式优化目标,并在所有评估策略中实现了最高的平均MMD相似度,即89.0%。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# 通过同质化训练-测试划分方法增强自动化机器学习
来源:https://arxiv.org/html/2607.26625
(*已接受于 UKCI'26 – 预审版本,2026年5月*)

###### 摘要

机器学习中的准确模型评估高度依赖于数据集如何划分为训练子集和测试子集。标准的随机划分假设两个子集共享相同的基础分布,但在存在类别不平衡、自然聚类或空间自相关性的数据集中,这一假设经常被违反。本文研究了训练-测试划分中统计相似性的作用及其对自动化机器学习模型评估的影响。通过在十五个 UCI 基准数据集上比较五种既定策略:随机划分、分层抽样、Kennard-Stone、Duplex 和 SPXY。使用卡方检验、Kolmogorov-Smirnov 检验和最大均值差异(MMD)检验评估相似性。基于几何的方法始终产生接近零的 MMD 分数,给下游性能估计带来不稳定性。所提出的优化分布方法将相似性视为显式优化目标,在所有评估策略中实现了最高平均 MMD 相似性,达到 89.0%。

## 1 引言

机器学习已成为众多行业决策不可或缺的一部分,包括医疗保健、安全和化学过程工程[17 (https://arxiv.org/html/2607.26625#bib.bib6)]。机器学习系统的可靠性高度依赖于准确的性能估计,通常通过将数据集划分为训练和测试子集来进行[8 (https://arxiv.org/html/2607.26625#bib.bib7)]。随机训练-测试划分的一个基本假设是两个子集在统计上代表相同的基础数据分布。当由于数据集偏移、类别不平衡或空间自相关性[13 (https://arxiv.org/html/2607.26625#bib.bib8),16 (https://arxiv.org/html/2607.26625#bib.bib1)]而违反这一假设时,性能估计变得不可靠[13 (https://arxiv.org/html/2607.26625#bib.bib8)]。

在自动化机器学习中,这个问题尤为关键。自动化机器学习系统自动选择算法、预处理数据并优化超参数。如果数据以有偏或不一致的方式划分,自动化机器学习管道可能会过拟合训练特性,并产生误导性强的评估指标,从而破坏模型选择和泛化能力[9 (https://arxiv.org/html/2607.26625#bib.bib9)]。

诸如分层抽样之类的传统方法保留了类别比例,但不能保证特征空间的相似性。基于几何的方法,如 Kennard-Stone 算法[10 (https://arxiv.org/html/2607.26625#bib.bib10)]和 SPXY[6 (https://arxiv.org/html/2607.26625#bib.bib11)],最大化特征空间的覆盖范围,但设计上使得训练集在分布上与测试集不同。尚无先前工作在自动化机器学习背景下,使用统一的分布相似性框架跨不同表格基准数据集系统评估这些权衡。

本文填补了这一空白。我们的主要贡献是:

1. 1. 使用卡方检验、KS 检验和 MMD 相似性检验,在十五个 UCI 数据集上对五种既定划分策略进行系统比较评估
2. 2. 证据表明,基于几何的方法在多变量分布相似性上始终不如随机划分和分层划分
3. 3. 改进的优化分布划分方法,通过迭代的相似性引导样本交换,显式最大化统计相似性。

## 2 背景与相关工作

### 2.1 训练-测试划分问题

标准随机划分以均匀概率将样本分配给训练集和测试集。虽然计算效率高,但不能保证所得分区在统计上相似[11 (https://arxiv.org/html/2607.26625#bib.bib12)]。这种现象称为分布偏移,可能由类别不平衡、自然聚类或数据中的结构化空间模式引起。后果包括过于乐观或误导性悲观的性能估计,以及部署时模型可靠性降低[13 (https://arxiv.org/html/2607.26625#bib.bib8)]。

### 2.2 现有划分策略

分层抽样在分区之间保留目标类别比例,因此对于不平衡分类任务尤其相关[19 (https://arxiv.org/html/2607.26625#bib.bib13)]。然而,它不能确保分层变量之外的特征空间覆盖。Kennard-Stone 算法[10 (https://arxiv.org/html/2607.26625#bib.bib10)]是一种确定性方法,通过最远点采样迭代选择训练样本以最大化特征空间覆盖。测试集由剩余样本组成,不直接优化。

SPXY 算法[6 (https://arxiv.org/html/2607.26625#bib.bib11)]通过将特征空间 \(X\) 和响应空间 \(Y\) 都纳入距离标准,扩展了 KS 算法,使其在目标范围多样性重要时非常有用。Duplex 算法[18 (https://arxiv.org/html/2607.26625#bib.bib14)]交替将最远的未选样本对分配给训练集和测试集,旨在使两个分区都代表完整的特征空间。

尽管有这些进展,一个关键限制仍然存在:这些方法都没有将训练集和测试集之间的分布相似性作为显式优化目标。KS 和 SPXY 侧重于训练集覆盖;Duplex 旨在覆盖两个集合,但并未直接最小化分布散度度量。

### 2.3 统计相似性度量

本研究使用了三种互补检验。卡方同质性检验评估两组在分类变量分布上是否存在差异[5 (https://arxiv.org/html/2607.26625#bib.bib15)]。Cramér's \(V\)[2 (https://arxiv.org/html/2607.26625#bib.bib2)] 衍生自卡方统计量,用于量化效应大小。Kolmogorov-Smirnov 检验是一种非参数检验,比较连续经验分布函数[12 (https://arxiv.org/html/2607.26625#bib.bib16)]。最大均值差异[7 (https://arxiv.org/html/2607.26625#bib.bib17)]是一种基于核的双样本检验,在再生核希尔伯特空间中测量分布距离,通过组合 RBF/Delta 核实现混合类型数据的多变量比较。考虑了 PSI 和对数线性分析,但由于其变量独立性假设和指数计算复杂度而分别被排除。

### 2.4 自动化机器学习框架

选择 PyCaret 作为主要的自动化机器学习框架,因为它在自动化、计算效率和与自定义训练-测试划分策略的兼容性之间提供了实用的平衡[3 (https://arxiv.org/html/2607.26625#bib.bib18)]。其管道支持自动预处理、模型比较、超参数调整和评估,同时允许将外部生成的分区整合到实验工作流中。scikit-learn[14 (https://arxiv.org/html/2607.26625#bib.bib3)] 与 PyCaret[1 (https://arxiv.org/html/2607.26625#bib.bib4),3 (https://arxiv.org/html/2607.26625#bib.bib18)] 一起用于实现划分程序、预处理工具和基于核的相似性计算。表 1 总结了框架选择过程中考虑的自动化机器学习工具。

| 工具 | 运行时 | 适用性 |
|------|--------|--------|
| PyCaret | 中等 | 自动化/效率/灵活性的平衡合适 |
| AutoGluon | 快 | 强大的预测性能,但 GPU 要求限制了可重复性 |
| Auto-sklearn | 中等-长 | 灵活,但计算需求比 PyCaret 更高 |
| H2O AutoML | 长 | 训练时间较长且偶有运行失败 |
| TPOT | 最长 | 初步测试中完成率低;重复实验不切实际 |

表 1:评估的自动化机器学习工具比较。

## 3 方法论

### 3.1 研究问题

本研究由五个研究问题指导:

- • RQ1: 常见的训练-测试划分方法在分布相似性上有多大差异?
- • RQ2: 高级方法是否比随机划分产生更具代表性的分区?
- • RQ3: 能否开发一种显式优化统计相似性的改进方法?
- • RQ4: 改进的相似性是否导致更可靠的自动化机器学习性能估计?
- • RQ5: 数据集属性如何调节相似性与性能之间的关系?

### 3.2 数据集

从 UCI 机器学习库中选取了十五个分类数据集,选择标准是其在规模、维度和特征类型(数值、分类和混合[4 (https://arxiv.org/html/2607.26625#bib.bib19)])上的多样性。数据集大小从 150 个实例(Iris, UCI 53)到 253,680 个实例(CDC 糖尿病健康指标, UCI 891)不等,特征维度从 4 到 169。所有实验均使用固定的 70:30 训练-测试划分比例。表 2 给出了总结。

表 2:来自 UCI 机器学习库的基准数据集。
### 3.3 划分策略

评估了六种策略。随机划分作为基线,均匀随机分配样本。分层抽样使用 scikit-learn 的 `train_test_split` 并启用分层,以保留目标类别比例。Kennard-Stone 算法迭代选择训练样本,以最大化特征空间覆盖。数值特征经过标准化,分类特征在进行成对距离计算前进行独热编码。对于大数据集,快速变体将工作集上限设为 500 个样本。SPXY 在每个类别层内应用分层最远点选择。Duplex 在每个类别内交替将最远的样本对分配给训练集和测试集。优化分布方法(提出的方法)在 3.5 节中描述。

### 3.4 评估框架

使用三种检验评估统计相似性,每种检验转换为统一的 0-100% 尺度,数值越高表示相似性越大。对于具有 1-3 个分类特征的数据集,使用 Cramér's \(V\) 的卡方检验:

\[
\text{Similarity}_{\chi^{2}} = (1 - V) \times 100.
\tag{1}
\]

对于具有 1-3 个连续特征的数据集,使用 KS 检验:

\[
\text{Similarity}_{\text{KS}} = (1 - D) \times 100,
\tag{2}
\]

其中 \(D\) 是 KS 统计量。

对于高维或混合类型数据集,使用带有混合 RBF/Delta 核的 MMD,采用 50 次重采样的排列检验和 z-score 标准化:

\[
\text{Similarity}_{\text{MMD}} = \exp(-\max(z, 0)) \times 100.
\tag{3}
\]

90% 的阈值被视为高质量分区的目标。

下游性能使用 PyCaret 在所得分区上进行评估。对于每个数据集-方法组合,对逻辑回归、决策树、随机森林、梯度提升、极端随机树、k-近邻、朴素贝叶斯和 SVM 运行模型比较。对按加权 F1 得分的最佳模型进行调整,并在保留的测试集上进行评估。报告准确率和加权 F1;鉴于多个数据集存在类别不平衡,加权 F1 是主要指标。

### 3.5 提出的优化分布划分方法

所提出的方法从分层划分开始,然后通过在每个类别内交换训练和测试分区之间的候选样本来迭代优化。仅当交换降低复合目标时才接受:

\[
\mathcal{L} = \text{MMD} + \lambda \sum_{c} \left\| \hat{p}_{\text{train}}(c) - \hat{p}_{\text{test}}(c) \right\|,
\tag{4}
\]

其中 MMD 在 \(n_{\text{repeats}} = 5\) 个独立子样本(每个分区最多 500 个样本)上平均,\(\lambda = 2.0\) 是类别比例惩罚权重,\(\hat{p}(c)\) 是经验类别比例。优化最多运行 `max_iter = 50` 次迭代,每次迭代评估 `candidates_per_iter = 20` 次交换。当找不到改进的交换时,方法提前终止。

## 4 结果与讨论

### 4.1 统计相似性

表 3 给出了每种方法在所有适用检验-数据集组合上的平均相似性分数。优化分布方法实现了最高平均 MMD 相似性,其次是分层和随机。Kennard-Stone 和 SPXY 在几乎所有数据集上的 MMD 分数接近零。

表 3:所有方法的平均统计相似性分数。

Kennard-Stone 和 SPXY 的接近零的 MMD 分数反映了它们的空间填充设计:两种方法都有意将训练集偏向极端和多样化的样本,产生与测试集根本不同的训练分布。这是一种故意的非对称性,在 MMD 下得分较低。一个显著的例外是 UCI 529,其中 Kennard-Stone 实现了 100% 的 MMD 相似性,可能是因为该数据集的适中大小(520 个实例和 16 个特征)限制了空间填充选择可能引入的分布散度。

Duplex 产生中间结果:其 MMD 分数在不同数据集间波动很大,从 UCI 159 的 0.0% 到 UCI 53、74 和 857 的 100%,反映了对数据集结构的敏感性。在高相似性方法中,随机和分层划分在大多数情况下达到了 90% 的 KS 阈值。值得注意的是,在 UCI 891、UCI 264 和 UCI 222 上,分层划分尽管 KS 和卡方得分近乎完美,但 MMD 得分较低(分别为 28.7%、18.6% 和 20.4%),表明当类别边界与底层特征分布不一致时,类别分层可能引入多变量特征空间不平衡。

优化分布方法在 15 个数据集中的 13 个上实现了 100% 的 MMD 相似性,与分层划分相比,最大的改进出现在 UCI 264(从 18.6% 到 100%)和 UCI 367(从 47.8% 到 100%)。在 UCI 891 和 UCI 222 上,改进较小,分别达到 11.9% 和 23.5%,受限于这些非常大数据集上的优化预算。

### 4.2 下游模型性能

表 4 报告了每种划分方法在所有数据集上的平均准确率和加权 F1。优化分布方法实现了最高平均 F1,其次是 SPXY、分层、Kennard-Stone、随机和 Duplex。这些总体差异不大,部分原因是几个数据集(包括 UCI 419、UCI 529 和 UCI 857)在所有方法下都产生近乎完美的分数,产生了天花板效应。

表 4:15 个数据集上的平均下游自动化机器学习性能。

最重要的差异出现在更困难、非平凡可分离的数据集上。UCI 264 显示出最大的单一差距:Kennard-Stone 产生的 F1 为 0.701,而随机和分层均为 0.964,与其在该数据集上接近零的 MMD 相似性一致。在 UCI 159 上,SPXY 的 F1 降至 0.756,而随机为 0.879;在 UCI 891 上,SPXY 产生的 F1 为 0.706,而随机为 0.796。这些模式反映了 SPXY 倾向于将极端样本集中在训练集中,留下不具有代表性的测试集。

然而,这种关系对于基于几何的方法并非完全负面。在 UCI 519 上,SPXY 和 Kennard-Stone 取得的 F1 分数分别为 0.909 和 0.887,而随机为 0.760;在 UCI 891 上,Kennard-Stone 取得了所有方法中的最高准确率 0.927。

相似文章

通过同质-异质分割的合成图像生成后策展

arXiv cs.LG

本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。