统计优势是否值得付出成本?KAN与MLP在结构化数据分类上的实证比较

arXiv cs.LG 论文

摘要

本研究对Kolmogorov-Arnold网络(KANs)和多层感知器(MLPs)在结构化表格分类任务上进行了实证比较,发现KANs在统计上优于MLPs,但计算成本更高。

arXiv:2607.13413v1 公告类型:新 摘要:本研究对Kolmogorov-Arnold网络(KANs)和多层感知器(MLPs)在结构化表格分类任务上进行了实证基准比较。鉴于KANs作为替代函数逼近架构日益受到关注,我们在十二个公开数据集上评估了其开箱即用的性能,涵盖二分类、多分类、多标签和序数问题。两个模型均在标准化预处理、架构和固定超参数设置下训练,性能评估采用测试准确率和F1分数、配对假设检验以及效应量分析。结果显示,KANs在二分类和多分类领域统计上优于MLPs,并在所有数据集上实现了显著的总体优势。然而,观察到的中效应量(d = -0.46)提出了一个重要的成本效益考量:虽然KANs通过自适应样条映射提供了更好的泛化能力,但相比MLP基线,这一优势伴随着显著更高的参数和计算复杂度。这些发现表明,KANs是高精度应用的首选,而MLPs在资源受限环境中仍是一种鲁棒且高效的选择。未来工作应将该分析扩展到其他数据模态,以进一步完善这些架构选择标准。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:21

# 统计优势是否值得成本?KAN与MLP在结构化数据分类上的实证比较
来源:https://arxiv.org/html/2607.13413
11institutetext:菲律宾洛斯巴尼奥斯大学计算机科学研究所
22institutetext:菲律宾洛斯巴尼奥斯大学机器学习与人工智能应用实验室
22email:\{mptoledo2, jhjacinto2, vcchambal, rccamaclang1, jngojocruz, rcrecario\}@up\.edu\.phJustine Raphael H\. JacintoVivekjeet Singh ChambalRodolfo C\. Camaclang IIIJamlech Iram N\. Gojo CruzReginald Neil C\. Recario

###### 摘要

本研究针对结构化表格分类任务,对Kolmogorov\-Arnold网络 (KAN) 与多层感知机 (MLP) 进行了实证基准比较。受KAN作为一种替代函数逼近架构日益受到关注的启发,我们在十二个公开数据集上评估了其开箱即用性能,涵盖二分类、多分类、多标签和有序分类问题。两种模型均在标准化预处理、架构和固定超参数设置下进行训练,并使用测试准确率和F1分数、配对假设检验以及效应量分析评估性能。结果显示,KAN在二分类和多分类领域统计上优于MLP,并在所有数据集上取得了显著的总体优势。然而,观察到的中等效应量 (d=−0.46d=-0.46) 引发了一个重要的成本效益考虑:尽管KAN通过自适应样条映射提供了更优的泛化能力,但这一优势相对于MLP基线带来了显著更高的参数和计算复杂度。这些发现表明,KAN是高精度应用的首选,而MLP在资源受限环境中仍然是稳健高效的选择。未来工作应将此分析扩展到其他数据模态,以进一步完善这些架构选择标准。

## 1 引言

结构化表格数据仍是生产级机器学习系统中最广泛使用的输入格式之一,涵盖从医疗到金融等领域。在这些场景中,准确性、可靠性和训练效率至关重要,模型架构的选择往往直接影响实际决策[15 (https://arxiv.org/html/2607.13413#bib.bib1)]。尽管深度学习持续进步,但尚无单一架构被确立为表格分类明确且一致的最佳选择[7 (https://arxiv.org/html/2607.13413#bib.bib2),14 (https://arxiv.org/html/2607.13413#bib.bib3)],模型表达能力与计算成本之间的权衡仍然是实践者持续关注的问题[30 (https://arxiv.org/html/2607.13413#bib.bib5)]。

近期进展引入了Kolmogorov\-Arnold网络 (KAN) 作为多层感知机 (MLP) 的理论驱动替代方案,提供了一种根本上不同的函数逼近方法[22 (https://arxiv.org/html/2607.13413#bib.bib4)]。尽管初步结果令人鼓舞,但这种架构差异是否能在真实世界的表格任务中转化为有意义且计算上合理的性能优势,仍是一个开放的经验问题。现有的大多数比较范围有限,且实验条件差异很大,因此难以得出一般性结论[22 (https://arxiv.org/html/2607.13413#bib.bib4),26 (https://arxiv.org/html/2607.13413#bib.bib20)]。

本研究通过标准化的实验设置,在多样化的结构化表格分类任务中实证比较KAN和MLP,来填补这一空白。通过这样做,不仅评估了原始性能差异,还检验了其统计显著性和实际效应量,并将这些收益与KAN的额外计算成本进行权衡。具体而言,本研究旨在:

1. 1. 实现并训练具有可比架构和固定、未调优超参数的KAN与MLP模型,涵盖不同分类任务类型(二分类、多分类、多标签和有序分类);
2. 2. 使用测试准确率和F1分数作为主要指标评估并比较其性能;
3. 3. 通过配对假设检验确定KAN与MLP之间观察到的性能差异的统计显著性;
4. 4. 分析总体和每任务趋势,以权衡预测收益与架构复杂度。

## 2 背景与相关工作

结构化表格数据仍然是机器学习中的主要输入格式,广泛应用于医疗、教育、金融和遥感等领域[6 (https://arxiv.org/html/2607.13413#bib.bib6)]。这些数据集建模具有挑战性,因为它们通常包含异构特征类型、缺失值、非线性关系和有限的样本量。因此,传统的决策树集成方法(如随机森林和梯度提升树)仍然是许多表格学习问题的首选,因为它们能有效处理特征异质性和隐式特征交互,且预处理要求最低[20 (https://arxiv.org/html/2607.13413#bib.bib7)]。然而,尽管这些方法仍具有竞争力,但人们对提供表达性建模、可扩展性以及集成到深度学习流水线中的神经架构兴趣日益增长,这重新将前馈网络作为表格任务的实际替代方案提上了议程。

在前馈架构中,多层感知机仍然是最常见且经典的架构[27 (https://arxiv.org/html/2607.13413#bib.bib8)]。MLP通过在隐藏层中应用连续的线性变换和固定的非线性激活函数,并通过基于梯度的方法优化参数来学习[29 (https://arxiv.org/html/2607.13413#bib.bib9),12 (https://arxiv.org/html/2607.13413#bib.bib10)]。其理论普遍性和强大的实证表现使其成为许多研究和基准测试中的标准基线[19 (https://arxiv.org/html/2607.13413#bib.bib11),13 (https://arxiv.org/html/2607.13413#bib.bib12),2 (https://arxiv.org/html/2607.13413#bib.bib13),32 (https://arxiv.org/html/2607.13413#bib.bib14)]。然而,固定激活函数和标量权重的使用限制了MLP在不增加网络深度或宽度的情况下捕获局部非线性效应的能力,这可能导致更高的计算成本和调优复杂度[18 (https://arxiv.org/html/2607.13413#bib.bib15)]。这些局限性推动了研究向自适应激活机制和基于函数的表示方向发展,这些方法直接从数据中学习非线性变换,以提高灵活性和可解释性[5 (https://arxiv.org/html/2607.13413#bib.bib16),11 (https://arxiv.org/html/2607.13413#bib.bib17)]。

其中一个方向是Kolmogorov Arnold网络,其灵感来自关于多元函数表示的Kolmogorov\-Arnold定理[21 (https://arxiv.org/html/2607.13413#bib.bib18),3 (https://arxiv.org/html/2607.13413#bib.bib19)]。该定理表明,任何连续的多元函数都可以写成更简单的连续一元函数的有限和,这意味着复杂的高维关系理论上可以从更简单的一维变换构建。网络中的每个连接对应一个小的参数化函数,通常使用样条插值来学习输入如何沿各个维度进行变换。KAN用网络连接上可学习的一元函数取代了固定激活,从而将表达能力从节点激活转移到基于边的映射,并实现了局部非线性建模。这种与MLP的根本性架构背离,使得两者之间的直接实证比较成为一个自然而重要的研究问题。

实证研究表明,KAN在表格和科学数据集上可以匹配或超过MLP的性能,同时在某些情况下提供改进的可解释性和更快的收敛速度[22 (https://arxiv.org/html/2607.13413#bib.bib4),26 (https://arxiv.org/html/2607.13413#bib.bib20)]。现有的基准测试在数据集、超参数选择和任务覆盖范围方面差异很大,因此难以得出一般性结论[22 (https://arxiv.org/html/2607.13413#bib.bib4),26 (https://arxiv.org/html/2607.13413#bib.bib20),9 (https://arxiv.org/html/2607.13413#bib.bib21)]。大多数先前的工作集中在二分类和多分类上,而多标签和有序分类的设置在很大程度上尚未探索[9 (https://arxiv.org/html/2607.13413#bib.bib21)]。这一差距限制了对KAN如何在分类范式中泛化的理解,并促使在标准化条件下进行系统评估,以确定KAN是否在广泛的表格分类任务中提供一致且成本合理的优势,特别是在可解释性和可靠性至关重要的医疗决策支持等领域[15 (https://arxiv.org/html/2607.13413#bib.bib1),1 (https://arxiv.org/html/2607.13413#bib.bib22)]。

## 3 方法

### 3.1 数据集与任务类别

本研究在四种分类范式下对KAN与传统MLP的性能进行基准测试:二分类、多分类、多标签和有序分类。为确保严格且可重复的评估,从公开的仓库中选取了十二个数据集,包括加州大学欧文分校 (UCI) 机器学习库、Kaggle以及用于多标签学习的MULAN库。这些数据集旨在代表结构化表格数据的多样化横截面,涵盖不同的样本量、特征模态和问题领域。这些领域涵盖医疗、教育、生物学和物理科学等。因此,所选数据集按四种主要任务类型分类,如表1 (https://arxiv.org/html/2607.13413#S3.T1)所示。

表 1:用于评估的数据集汇总
### 3.2 数据预处理

对所有数据集应用了统一的预处理流程。缺失值通过列删处理,或使用数值特征的均值以及类别特征的众数进行插补来处理。名义属性经过独热编码,有序特征保留其固有顺序,所有数值特征都标准化为零均值和单位方差。目标变量根据任务类型进行处理,多标签目标保留为二元指示向量。对于标准任务,数据集采用分层抽样分为70%训练集、15%验证集和15%测试集;对于多标签任务,由于分层多标签数据的计算复杂性,采用80-20的训练-测试拆分。

### 3.3 模型配置与评估

为确保可比性和公平性,每个数据集都经过相同的预处理、模型配置和训练条件,实验在统一的硬件环境中进行,除非计算约束要求偏离。此标准化流水线被故意保持固定,以按原样评估每种架构,不进行调优,确保观察到的任何差异反映的是架构属性而非优化工作。为确保有意义的比较而不引入调优这一混淆变量,两种模型都采用了基础文献中建立的"vanilla"配置,总结于表2 (https://arxiv.org/html/2607.13413#S3.T2)。这些配置在保持等效参数复杂度的同时,隔离了固定节点激活与自适应样条映射之间的差异。

表 2:模型架构与训练配置汇总。性能评估使用了准确率(衡量整体预测正确性)和F1分数(提供精确率和召回率的平衡评估),并根据每种分类范式采用特定的计算策略。对于二分类、多分类和有序任务,使用加权F1分数来应对类别不平衡,而多标签任务则使用子集准确率和样本平均F1分数。所有模型都进行了五次独立运行,并报告平均指标。为了确认性能差异代表的是系统性的架构优势而非随机噪声,在α=0.05\\alpha=0.05的水平下进行了配对假设检验,检验的选择由Anderson-Darling正态性检验决定。效应量使用Cohen的dd(用于t检验)和秩双列相关 \(rrbr\_\{rb\}\)(用于Wilcoxon符号秩检验)来报告。

## 4 结果与讨论

### 4.1 计算效率与资源需求

表3 (https://arxiv.org/html/2607.13413#S4.T3)显示了每个数据集上KAN和MLP的参数数量、训练时间和推理时间的汇总。数据一致表明KAN比MLP在计算上更"昂贵"。

表 3:按分类类型分组的12个基准数据集上MLP和KAN模型的参数数量与平均计算时间汇总。在架构复杂度方面,MLP每个连接只需要一个标量权重,导致参数复杂度为O\(N^2L\)O\(N^\{2\}L\),其中NN是网络宽度,LL是深度。KAN则将每个权重替换为一个可学习的样条函数,导致参数复杂度为O\(N^2GL\)O\(N^\{2\}GL\),而对于大小为BB的训练批次,计算复杂度为O\(2kBN^2GL\)O\(2kBN^\{2\}GL\),其中GG是网格大小,kk是样条阶数[22 (https://arxiv.org/html/2607.13413#bib.bib4)]。参数复杂度中额外的GLGL因子直接解释了表3 (https://arxiv.org/html/2607.13413#S4.T3)中观察到的KAN参数数量显著更高,在标准任务中KAN始终需要大约16倍于MLP的参数。

此外,由阶数为kk的样条递归求值产生的计算复杂度因子2k2k,解释了不成比例地更高的训练和推理时间:KAN在所有数据集上的训练时间都超过30秒,而MLP训练很少超过5秒;KAN推理延迟经常超过100毫秒,而MLP保持在3毫秒。这些理论复杂度共同为经验观察到的计算开销提供了原则性解释,并直接推动了第4.4节中提出的成本效益分析。

参见图注图1:从上到下:KAN和MLP在各类数据集上的训练和验证准确率,来自二分类(上行)、多分类(中行)、多标签(第三行)和有序分类(下行)任务。
### 4.2 性能评估:准确率与F1分数

图1 (https://arxiv.org/html/2607.13413#S4.F1)显示了每个数据集上KAN和MLP的训练和验证准确率。对于大多数数据集,两者的训练和验证准确率都稳步提高,并达到相似的上限,除了Emotions、Birds和Enron数据集。然而,对于大多数数据集,KAN比MLP更快达到上限并更早稳定,除了Emotions、Birds和Enron数据集。

表4 (https://arxiv.org/html/2607.13413#S4.T4)展示了KAN和MLP模型在所有数据集上的评估结果。在测试准确率方面,在二分类和多分类的三个数据集中,KAN的测试准确率均高于MLP。对于多标签分类,KAN仅在一个数据集上测试准确率高于MLP,而MLP在Birds和Enron数据集上表现更好。与此同时,KAN在有序分类的三个数据集中有两个的测试准确率高于MLP

相似文章

面向小语言模型的Kolmogorov--Arnold网络

arXiv cs.AI

本文评估了Kolmogorov--Arnold网络(KAN)作为可解释组件以及Transformer前馈网络在小语言模型中的替代方案,发现虽然KAN提供了实用的审计接口,但与MLP基线相比,它们并未显示出持续一致的基准优势。

通过Kolmogorov-Arnold网络在FPGA上实现超快机器学习

Hacker News Top

本文介绍了作者的硕士论文,该论文利用Kolmogorov-Arnold网络(KAN)在FPGA上实现超快机器学习,通过自定义硬件架构实现亚微秒级推理和在线学习。文章引用了两篇已接收的论文:基于LUT评估的KANELÉ(FPGA 2026最佳论文奖)以及一种在FPGA上进行在线学习的方法(ICML 2026)。

几何感知R结构Kolmogorov-Arnold网络

arXiv cs.LG

提出几何感知R结构KAN(GRS-KAN),一种将R函数集成到KAN中以编码几何和逻辑约束的混合神经架构,在含不连续性的回归基准上实现了高达67%的RMSE降低。

STKAN:用于时空预测的Kolmogorov-Arnold Networks

arXiv cs.LG

本文介绍了STKAN,一种集成泰勒多项式Kolmogorov-Arnold网络模块以实现空间和时间令牌混合的时空预测架构。在五个交通基准上的实验显示出竞争性表现,表明非线性函数逼近器可以补充架构设计。