无泄漏的堆叠集成方法用于多类分类

arXiv cs.LG 论文

摘要

本文提出LFS-FRAME,一种无泄漏的堆叠集成框架,结合Kolmogorov-Arnold网络与XGBoost实现稳健的多类分类,在主要类别上达到89.85%的准确率,在子类别上达到81.74%。

arXiv:2607.22081v1 公告类型:新论文 摘要:多类分类是广泛领域中的一个基本问题。由于存在高类别间相似性、类别不平衡数据集以及数据分布的可变性,该问题仍然具有挑战性。基于规则的分类器(如XGBoost)通常在结构化特征上表现更强,但在捕捉变量之间的平滑函数关系方面存在局限。同样,神经网络模型能够表示复杂的非线性交互,但常常面临过拟合和泛化问题。为了解决这些局限,我们提出LFS-FRAME,一种无泄漏的堆叠集成框架,该框架通过Kolmogorov-Arnold网络(KAN)进行函数学习,并通过XGBoost进行基于规则的学习,以实现稳健的多类分类。 该框架通过采用严格的折外堆叠策略来构建无偏的元特征,确保训练数据和验证数据完全隔离,从而防止性能泄漏。通过学习异构基学习器的概率输出,元分类器有效利用了复杂数据中的全局函数模式和尖锐决策边界。在多类数据集上的实验评估表明,与强单模型基线相比,LFS-FRAME在性能指标上有所提升,在识别主要类别时总体准确率达到89.85%,在识别子类别时达到81.74%。这些结果突显了无泄漏的函数与规则堆叠方法在可靠且可泛化的多类分类中的有效性。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:43

# 一种用于多分类的无泄漏堆叠集成方法
原文链接:https://arxiv.org/html/2607.22081
S P Sharmila1,2,∗, and Aruna Tiwari1 1印度印多尔理工学院,中央邦,印度。2印度卡纳塔克邦图马库尔,西达甘加理工学院。电子邮件:\{phd2201101012, artiwari\}@iiti.ac.in, [email protected]

###### 摘要

多分类是众多领域中的一个基本问题。由于存在高类别间相似性、类别不平衡数据集以及数据分布的可变性,该问题仍具挑战性。诸如XGBoost之类的基于规则的分类器在结构化特征上通常表现更强,但它们在捕捉变量间的平滑函数关系方面存在局限。同样,神经网络模型可以表示复杂的非线性交互作用,但经常遭受过拟合和泛化问题。为了解决这些局限性,我们提出了LFS-FRAME,一种无泄漏的堆叠集成框架,该框架集成了基于Kolmogorov-Arnold网络(KAN)的函数学习与基于XGBoost的规则学习,以实现稳健的多分类。所提出的框架通过采用严格的折外堆叠策略,确保训练数据和验证数据完全隔离,从而构建无偏的元特征,防止性能泄漏。通过在异构基学习器的概率输出上进行学习,元分类器有效地利用了复杂数据中存在的全局函数模式和锐利决策边界。在多类别数据集上的实验评估表明,与强单模型基线相比,LFS-FRAME在识别主要家族时的总体准确率达到89.85%,在识别子家族时达到81.74%,从而提升了性能指标。这些结果突显了无泄漏的函数与规则堆叠在实现可靠且可泛化的多分类方面的有效性。

## I 引言

集成学习已成为现代机器学习的基石,它能够组合多个模型,从而实现比单个学习器更优越的预测性能[1 (https://arxiv.org/html/2607.22081#bib.bib1)]。集成方法最初通过bagging(例如随机森林)和boosting(例如AdaBoost、梯度提升)在20世纪90年代末和21世纪初流行起来,通过利用偏差-方差权衡、减少过拟合以及提高复杂数据集上的泛化能力而崭露头角。随着计算资源和大规模数据的可用性,其发展加速,从而在计算机视觉(例如深度集成CNN)[2 (https://arxiv.org/html/2607.22081#bib.bib2)]、金融(风险建模)[3 (https://arxiv.org/html/2607.22081#bib.bib3),4 (https://arxiv.org/html/2607.22081#bib.bib4),5 (https://arxiv.org/html/2607.22081#bib.bib5)]、医疗保健(诊断分类器)[6 (https://arxiv.org/html/2607.22081#bib.bib6)]和网络安全(恶意软件检测)[7 (https://arxiv.org/html/2607.22081#bib.bib7),8 (https://arxiv.org/html/2607.22081#bib.bib8),9 (https://arxiv.org/html/2607.22081#bib.bib9)]等领域得到广泛应用。

在高级集成技术中,堆叠以其元学习方法脱颖而出,其中第二层模型学习如何最佳地融合来自不同基分类器的预测。Wolpert[16 (https://arxiv.org/html/2607.22081#bib.bib16)]于1992年正式提出了堆叠,这不仅重新引起了人们对多分类设置的兴趣,也引起了人们对入侵检测和多标签恶意软件分类的兴趣[17 (https://arxiv.org/html/2607.22081#bib.bib17)],其中它利用来自RF、SVM和XGBoost等基分类器的类别概率向量,将准确率比单模型提升5-15%。尽管有这些优势,堆叠集成,特别是用于多分类的堆叠集成,面临几个关键挑战,如果不加以解决,可能会削弱其有效性。

多分类堆叠集成中的关键问题:

堆叠引入了复杂性,这种复杂性被多分类问题中高维概率输出(\(B \times C\)个特征)所放大。1. **数据泄漏**:在样本内基预测上训练元学习器会泄漏标签信息,从而不切实际地夸大性能指标。2. **元学习器过拟合**:高维元特征会导致过拟合,除非进行正则化(例如通过简单的逻辑回归)。3. **基模型多样性不足**:相关的基分类器提供冗余信号,削弱了堆叠的增益。4. **计算开销**:基于交叉验证的折外预测随着\(B\)、\(C\)和折数的增加而扩展性差。除此之外,其他问题包括类别不平衡和可解释性,这需要根据先前的分析进行仔细设计。

为了解决这些问题,本文中我们提出了一种无泄漏的多分类堆叠集成,结合了函数模型和基于规则的模型¹¹本文发表于2026年6月21-26日在荷兰马斯特里赫特举行的IEEE世界计算智能大会(WCCI)。与传统的堆叠集成不同,所提出的框架是函数学习器和规则学习器的结构化集成,专门为无泄漏的概率级多分类而设计。其新颖之处在于互补归纳偏差的原则性融合以及对不断变化的多类别家族的动态适应性。

## II 背景与相关工作

多分类(MCC)是机器学习中的一个基本问题,在模式识别、医疗分析、生物信息学和面向安全的数据分析中有着广泛的应用。随着类别数量的增加,分类器面临着显著挑战,如类别间相似性、重叠的决策区域以及严重的类别不平衡,这常常导致泛化不稳定和性能下降。传统的单模型方法在这种高基数设置中经常力不从心,从而促使采用集成学习技术来提高鲁棒性和预测准确性[10 (https://arxiv.org/html/2607.22081#bib.bib10),11 (https://arxiv.org/html/2607.22081#bib.bib11),30 (https://arxiv.org/html/2607.22081#bib.bib30),29 (https://arxiv.org/html/2607.22081#bib.bib29)]。

基于树的集成方法,特别是梯度提升决策树,在结构化和表格数据上表现出了强大的经验性能。XGBoost尤其成为一个广泛采用的模型,因为它能够学习稀疏的非线性决策规则,同时通过正则化来减轻过拟合[12 (https://arxiv.org/html/2607.22081#bib.bib12)]。多项研究报告了XGBoost在多分类学习场景中的有效性;然而,在我们提出的工作中,其依赖于分段常数近似的局限性通过采用函数学习得到了弥补。

基于神经网络的模型通过连续变换逼近复杂的函数映射,提供了一种互补的视角。深度学习方法已被应用于多分类,并取得了不同程度的成功,但它们常常受到超参数调优敏感性、有限数据下的过拟合以及可解释性降低等问题的困扰[13 (https://arxiv.org/html/2607.22081#bib.bib13)]。最近,Kolmogorov-Arnold网络(KAN)被提出作为一种基于Kolmogorov-Arnold表示定理的理论基础的函数学习范式,能够通过单变量非线性函数的组合来实现多变量函数逼近[14 (https://arxiv.org/html/2607.22081#bib.bib14)]。KANs还因其对生成对抗攻击的鲁棒性而表现出色[15 (https://arxiv.org/html/2607.22081#bib.bib15),26 (https://arxiv.org/html/2607.22081#bib.bib26),27 (https://arxiv.org/html/2607.22081#bib.bib27)]。虽然KANs提供了更好的参数效率和可解释性,但它们在单独使用时可能不足以建模高度判别任务中所需要的锐利决策边界。

堆叠泛化最初由Wolpert[16 (https://arxiv.org/html/2607.22081#bib.bib16)]引入,旨在通过在多个基模型的预测上训练元分类器来克服单个学习器的局限性。已经提出了许多基于堆叠的框架,包括同质集成、异质学习器和概率级融合策略[18 (https://arxiv.org/html/2607.22081#bib.bib18)]。尽管如此,许多现有的堆叠方法无意中引入了信息泄漏,因为元分类器通常在用于训练基模型的相同数据上生成的预测上进行训练。这种泄漏会导致过于乐观的性能估计和较差的真实世界泛化能力,特别是在错误传播被放大的多分类设置中[19 (https://arxiv.org/html/2607.22081#bib.bib19)]。

最近的研究强调了折外(OOF)预测策略在减轻泄漏和确保无偏元特征构建方面的重要性[20 (https://arxiv.org/html/2607.22081#bib.bib20)]。另外,结合神经网络和基于树的模型的混合集成显示出潜在的益处;然而,这些方法通常缺乏原则性的集成策略和理论基础,并且很少有研究以系统的方式明确解决泄漏预防问题。

## III 问题定义

**定义:无泄漏多分类堆叠框架**  
针对数据集 \(D = \{(x_i, y_i)\}_{i=1}^N\) 构建的多分类堆叠框架,如果样本 \(x_i\) 的元特征向量被构建为:
\[
z_i = [\hat{p}_i^{(1)}, \hat{p}_i^{(2)}, \dots, \hat{p}_i^{(M)}]
\]
其中每个 \(\hat{p}_i^{(m)}\) 是由第 \(m\) 个基学习器产生的折外类别概率向量,并且在生成 \(z_i\) 的任何分量时,不允许任何分类器观察到 \(y_i\),则该框架被称为无泄漏。

设训练集为 \(\mathcal{D} = \{(x_i, y_i)\}_{i=1}^n\),其中 \(x_i \in \mathcal{X}\) 是特征向量,\(y_i \in \{1, \dots, C\}\) 是真实多分类标签(共 \(C\) 个类别)。假设我们有 \(B\) 个基分类器 \(\{f_b\}_{b=1}^B\),每个映射 \(f_b: \mathcal{X} \to [0,1]^C\),因此 \(f_b(x_i)\) 是一个关于 \(C\) 个类别的概率向量。元学习器 \(g\) 是一个分类器,它将基模型输出的拼接作为输入:
\[
z_i = [f_1(x_i)^\top, f_2(x_i)^\top, \dots, f_B(x_i)^\top]^\top \in [0,1]^{B \times C}
\]
并预测最终类别 \(\hat{y}_i = g(z_i)\)。

在泄漏版本中,每个基模型 \(f_b\) 在整个训练集 \(\mathcal{D}\) 上训练:\(f_b = \mathcal{A}_b(\mathcal{D})\),其中 \(\mathcal{A}_b\) 是基模型 \(b\) 的学习算法。然后元层训练集被构建为:
\[
\mathcal{Z} = \{(z_i, y_i)\}_{i=1}^n \quad \text{其中} \quad z_i = [f_1(x_i)^\top, \dots, f_B(x_i)^\top]^\top.
\]
元学习器训练为 \(g = \mathcal{A}_g(\mathcal{Z})\)。这里的泄漏在于,\(f_b(x_i)\) 是在一个已经在训练期间见过 \((x_i, y_i)\) 的模型上计算的。也就是说,标签 \(y_i\) 已经影响了 \(f_b\) 的学习参数,因此概率向量 \(f_b(x_i)\) 以在未见的新数据上不会成立的方式与 \(y_i\) 相关。这意味着,\(\text{Cov}(y_i, f_b(x_i))\) 在 \(\mathcal{D}\) 上被夸大了,但这种协方差在测试数据 \(\mathcal{D}_{\text{test}}\) 上会缩小,导致元学习器过拟合于训练特定的模式,从而产生过于乐观的样本内性能。

## IV 所提出的方法

为了消除泄漏,我们采用了折外(OOF)预测,描述如下:将 \(\mathcal{D}\) 分成 \(K\) 折 \(\{\mathcal{D}_k\}_{k=1}^K\)。对于每一折 \(k\),我们执行以下操作:
- 在 \(\mathcal{D} \setminus \mathcal{D}_k\) 上训练每个基模型 \(f_b^{(k)}\):\(f_b^{(k)} = \mathcal{A}_b(\mathcal{D} \setminus \mathcal{D}_k)\)。
- 仅在 \(\mathcal{D}_k\) 上计算预测:
  \[
  z_i^{(k)} = [f_1^{(k)}(x_i)^\top, \dots, f_B^{(k)}(x_i)^\top]^\top, \quad (x_i, y_i) \in \mathcal{D}_k.
  \]
- 将所有OOF预测拼接成元层训练集:
  \[
  \mathcal{Z}_{\text{oof}} = \{(z_i^{(k)}, y_i)\}_{(x_i, y_i) \in \mathcal{D}_k, k=1}^K.
  \]
- 训练元学习器:\(g = \mathcal{A}_g(\mathcal{Z}_{\text{oof}})\)。

此外,对于每个样本 \(x_i\),向量 \(z_i^{(k)}\) 由从未在训练期间见过 \((x_i, y_i)\) 的基模型 \(f_b^{(k)}\) 生成,因此在条件 \(\mathcal{D} \setminus \mathcal{D}_k\) 下,\(f_b^{(k)}(x_i) \perp y_i\),这意味着标签信息没有直接泄漏到元层特征中。在测试时,对于一个未见的新样本 \(x^*\),我们执行以下操作:
- 在整个 \(\mathcal{D}\) 上重新训练每个基模型:\(f_b^{\text{full}} = \mathcal{A}_b(\mathcal{D})\)。
- 计算元特征:
  \[
  z^* = [f_1^{\text{full}}(x^*)^\top, \dots, f_B^{\text{full}}(x^*)^\top]^\top.
  \]
- 预测:\(\hat{y}^* = g(z^*)\)。

由于 \(g\) 仅在未泄漏标签的OOF预测上训练,并且测试预测 \(f_b^{\text{full}}(x^*)\) 在未见数据上生成,因此在我们提出的方法中,元层模型不存在标签泄漏,性能估计更可靠地泛化。

在算法1 (https://arxiv.org/html/2607.22081#alg1) 中,我们提出了一个无泄漏的多分类堆叠框架,该框架集成了KAN和XGBoost作为互补的基学习器。选择这种组合的理由已在第II节 (https://arxiv.org/html/2607.22081#S2) 中给出。数据集首先使用分层K折交叉验证进行划分,以保持各折之间的类别分布。对于每一折,KAN和XGBoost模型仅在特定折的训练子集上训练,并且仅对相应的验证子集生成类别概率预测。这些折外(OOF)概率估计被存储起来,随后拼接成一个元特征矩阵,确保元分类器在训练时使用的预测来自在训练期间从未见过相同样本的模型,从而消除信息泄漏。然后,在这些OOF特征上训练一个多项元分类器,以学习基模型之间的最优融合权重。最后,在整个数据集上重新训练KAN和XGBoost,通过训练好的元分类器融合它们对未见测试样本的概率输出,以产生最终的多分类预测。这种设计确保了稳健的泛化、无偏的性能估计,以及

相似文章

基于线性判别树集合的可解释多模态分类

arXiv cs.AI

本文提出了一种基于线性判别树集合的可解释多模态分类框架,该框架在准确性和可解释性之间取得平衡,在F1-mod增益和人工标注者一致性分数上优于Transformer模型。

基于层的联邦表示学习

arXiv cs.LG

本文介绍了基于层的联邦表示学习(SFRL),这是一个通过可学习的层限制映射和二次粘合正则化器来对齐异构局部表示的框架,无需假设共享的全局潜在空间。提出了一种具有收敛保证的分散式算法(Sheaf-FRL),并证明其在与数据异构和模型异构下的协作分类中优于基线方法。