ER-KANs:用于数据稀缺科学机器学习的高效鲁棒 Kolmogorov-Arnold 网络

arXiv cs.LG 论文

摘要

ER-KAN 是一种新的 Kolmogorov-Arnold 网络变体,专为数据稀缺且有噪声的科学机器学习设计,在鲁棒性和效率方面优于现有 KAN 变体。

arXiv:2608.14773v1 公告类型:新 摘要:高效 KAN 文献——涵盖原始 Kolmogorov-Arnold 网络的切比雪夫、小波和径向基函数变体——几乎完全基于干净数据进行基准测试。我们表明,这一选择掩盖了架构之间的巨大能力差异:当训练数据被 sigma=0.1 的噪声干扰时,ChebyKAN 的测试均方误差(相对于干净真实值评估)增加了 10.6 倍,而 vanilla KAN 为 7.9 倍,标准 MLP 为 1.7 倍,我们提出的 ER-KAN 仅为 1.4 倍。 ER-KAN 结合了针对噪声、数据稀缺环境的三种设计选择:在层中所有边上共享高斯径向基函数(Gaussian RBF)基(提供局部性和高效参数化),训练过程中的课程噪声注入(明确教导噪声鲁棒性),以及熵加权自适应正则化(在小 N 时防止过拟合)。结果是一个拥有 595 个参数的网络,在中等噪声下匹配 MLP 的准确度,而在噪声增大时衰减更为平缓。 我们在八个解析函数(N 在 {50, 200, 500} 中,sigma 在 {0, 0.03, 0.1} 中)、一个阻尼谐振子物理信息神经网络(其中 ER-KAN 实现了比 MLP 低 4.2 倍的解均方误差)以及一个 Burgers 方程 PINN(其中所有模型都未能收敛——我们报告了这一真实局限性而非抑制)上进行了评估。我们引入了噪声退化比作为简单的补充指标,并建议它成为高效 KAN 论文的标准报告要求。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:28

# 高效鲁棒的Kolmogorov-Arnold网络用于数据稀缺的科学机器学习
来源:https://arxiv.org/html/2608.14773
###### 摘要

高效-KAN文献——涵盖原始Kolmogorov-Arnold网络的Chebyshev、小波和径向基函数变体——几乎完全在干净数据上进行基准测试。我们表明,这种选择掩盖了架构之间的巨大能力差异:当训练数据被σ=0.1噪声污染时,ChebyKAN的测试MSE(基于干净真值评估)增加了10.6倍,而原始KAN增加7.9倍,标准MLP增加1.7倍,我们提出的ER-KAN仅增加1.4倍。

ER-KAN结合了三种针对噪声、数据稀缺场景的设计选择:层内所有边共享高斯基函数(提供局部性和高效参数化)、训练过程中的课程噪声注入(显式地训练噪声鲁棒性)以及熵加权自适应正则化(防止小神经网络过拟合)。结果是一个拥有595个参数的网络,在中等噪声水平下匹配MLP的精度,而在噪声增长时性能下降更为平缓。

我们在八个解析函数(N∈{50,200,500},σ∈{0,0.03,0.1})上、一个阻尼谐振子物理信息神经网络中(ER-KAN比MLP低4.2倍的解MSE)以及一个Burgers方程PINN中(所有模型都未能收敛——我们如实报告了这一局限性而非掩饰)进行了评估。我们引入*噪声退化比*作为一个简单的补充指标,并建议将其作为高效-KAN论文的标准报告要求。

## 1 引言

Kolmogorov-Arnold网络[Liu et al. 2024 (https://arxiv.org/html/2608.14773#bib.bib8)]带着一个吸引人的理念而来:用可学习的边函数替换固定的、基于节点的激活函数,在不失去表达能力的同时获得可解释性。原始的B-spline实现在小型基准上验证了这一点,但通过完整的B-spline层进行前向传播速度很慢——每次调用都需要在网格上评估每条边的样条。几个月内,多个团队提出了更快的基函数:Chebyshev多项式[SynodicMonth 2024 (https://arxiv.org/html/2608.14773#bib.bib16)]、小波[Bozorgasl and Chen 2024 (https://arxiv.org/html/2608.14773#bib.bib2)]、反射线性函数[Noutsos and Roumeliotis 2024 (https://arxiv.org/html/2608.14773#bib.bib10)]和高斯RBF[Li 2024 (https://arxiv.org/html/2608.14773#bib.bib7)]。所有这些都在干净数据上进行了基准测试。

科学机器学习很少有干净的数据。传感器噪声、模拟离散化误差和实验不确定性通常会破坏5-20%的训练目标。而且数据通常很稀缺:从少量昂贵的模拟运行中构建代理模型在计算生物学、材料科学和地球物理学[Willard et al. 2022 (https://arxiv.org/html/2608.14773#bib.bib19)]中是标准做法。在这种情况下,基函数的选择被证明非常重要。

我们的核心发现总结在图2 (https://arxiv.org/html/2608.14773#S5.F2)和表2 (https://arxiv.org/html/2608.14773#S5.T2)中:Chebyshev多项式尽管在干净数据上具有最佳的近似能力(在N=50时几何平均RMSE为0.025,而所有其他模型为0.030–0.132),但会将σ=0.1噪声的影响放大10.6倍。原始B-spline KAN性能下降7.9倍。ER-KAN的高斯基函数仅下降1.4倍——接近参数匹配的MLP的1.7倍,是KAN家族模型中最好的。

ER-KAN并非我们实验中统一的最佳模型。在干净数据上,Chebyshev和原始KAN明显优于它;即使在σ=0.1时,ChebyKAN仍然实现了更低的绝对RMSE(0.083 vs ER-KAN的0.158),因为它起始的干净基线非常低。因此,ER-KAN的主张不是“在任何地方都使用”,而是:在任何噪声水平不确定、部署噪声将高于训练噪声或物理信息学习完全移除标注数据的设置中——ER-KAN是更安全的架构选择。

贡献:
- 我们引入了ER-KAN,一种轻量级的KAN变体(595个参数),结合了共享的高斯RBF基函数、课程噪声注入和自适应正则化。
- 我们首次对四种KAN家族架构加MLP进行了系统的噪声数据比较:8个函数×3种样本大小×3种噪声水平×5个种子=每个模型480次运行。
- 我们引入了*噪声退化比*DR作为补充评估指标,并表明它揭示了干净数据RMSE无法察觉的7倍能力差异。
- 我们报告了两个结果相反的PINN实验——ER-KAN在平滑振荡器上获胜,所有模型在激波主导的Burgers方程上失败——并解释了原因。

## 2 背景与相关工作

### 2.1 Kolmogorov-Arnold网络

Liu et al. 2024 (https://arxiv.org/html/2608.14773#bib.bib8)通过在**边**上放置可学习的单变量函数引入了KAN,遵循Kolmogorov-Arnold表示定理[Kolmogorov 1957 (https://arxiv.org/html/2608.14773#bib.bib5), Sprecher 1965 (https://arxiv.org/html/2608.14773#bib.bib14)]。每条边函数φ_ij被参数化为B-spline基函数的线性组合:

φ_ij(x) = w_b b(x) + ∑_k c_k B_k(x), (1)
其中b(x)是残差SiLU激活函数,B_k是固定网格上的三次B-spline基函数,c_k, w_b是可训练的。层输出 h_j^(l+1) = ∑_i φ_ij(h_i^(l)) 替代了MLP的标准点积加激活。

### 2.2 高效KAN变体

公式(1)中的B-spline评估代价高昂,因为它需要为每个样本、每条边、每一层查找网格值。高效变体用解析上更廉价的基函数替代:

FastKAN[Li 2024 (https://arxiv.org/html/2608.14773#bib.bib7)]使用固定的高斯RBF中心——是与ER-KAN最接近的前身。关键区别在于FastKAN为每条边分配独立的中心集,而ER-KAN在层内所有边**共享**一组中心,将参数数量减半,并且(如消融实验所示,表7 (https://arxiv.org/html/2608.14773#S5.T7))显著降低了噪声敏感性。

ChebyKAN[SynodicMonth 2024 (https://arxiv.org/html/2608.14773#bib.bib16)]通过三项递推公式 T_n = 2x T_{n-1} - T_{n-2} 计算d次Chebyshev多项式,每个元素仅需O(d)次乘法。它在干净数据上快速且准确,但我们证明其导数界 ∥T_d'(x)∥ ≤ d^2 导致扰动的输入放大与d^2成正比。

WaveKAN[Bozorgasl and Chen 2024 (https://arxiv.org/html/2608.14773#bib.bib2)]和FasterKAN[Noutsos and Roumeliotis 2024 (https://arxiv.org/html/2608.14773#bib.bib10)]分别使用小波和反射线性基函数;我们未将其纳入主要比较,但退化比框架直接适用。

### 2.3 物理信息神经网络

PINNs[Raissi et al. 2019 (https://arxiv.org/html/2608.14773#bib.bib11)]将控制PDE编码为残差损失,从而能够在没有标注解数据的情况下进行训练。Wang et al. 2022 (https://arxiv.org/html/2608.14773#bib.bib17)表明,谱偏差——MLP倾向于拟合低频分量——是一个关键失败模式。基于KAN的PINN已被Shukla et al. 2024 (https://arxiv.org/html/2608.14773#bib.bib12)探索,结果具有问题依赖性;我们的实验证实了这一点。

### 2.4 函数逼近中的噪声鲁棒性

多项式插值对输入扰动的敏感性在理论上已有充分理解(龙格现象、Chebyshev稳定性分析)。在神经网络文献中,噪声鲁棒性通常通过数据增强[Simard et al. 1998 (https://arxiv.org/html/2608.14773#bib.bib13)]或输入dropout[Srivastava et al. 2014 (https://arxiv.org/html/2608.14773#bib.bib15)]来研究。据我们所知,之前没有工作专门通过噪声退化的视角比较KAN基函数。

## 3 ER-KAN架构

### 3.1 动机:为什么RBF在噪声下退化更少

对于d次Chebyshev基,经典界 ∥T_d'(x)∥ ≤ d^2 意味着输入空间中的扰动ε可能为权重为w_d的单个项产生高达w_d d^2 ε的输出变化。对于d=8(我们的ChebyKAN基线),高次项的导数高达输入扰动的64倍。

对于高斯RBF基函数 φ_g(x) = exp(-(x-c_g)^2/(2σ_g^2)),导数为 ∥φ_g'(x)∥ = |x-c_g|/σ_g^2 · φ_g(x) ≤ 1/(σ_g √e)。对于我们的默认值σ_g=0.1,该界约为3.7——比8次Chebyshev界小一个数量级。这个分析性论证预测RBF基具有更低的噪声敏感性,实证退化比(表2 (https://arxiv.org/html/2608.14773#S5.T2))证实了这一点。

### 3.2 共享高斯RBF基

对于具有n_in个输入和n_out个输出的层,我们在[-1,1]内均匀放置G个高斯RBF中心{c_g}_{g=1}^G。这些中心在**所有**n_in × n_out条边之间**共享**;每条边只有G个标量权重。第j个单元的输出为:

h_j = ∑_{i=1}^{n_in} [∑_{g=1}^{G} w_{ijg} φ_g(x_i)] + b_j,
φ_g(x) = exp(-(x-c_g)^2/(2σ_g^2)), (2)
其中σ_g是可训练的宽度(初始化为1/G)。消融实验表明这种共享是ER-KAN最重要的组件:没有它,几何平均MSE比率会恶化到完整模型的1.54倍(表7 (https://arxiv.org/html/2608.14773#S5.T7))。

### 3.3 课程噪声注入

我们在第e个epoch扰动训练输入:

x̃ = x + ε, ε ~ N(0, σ_e^2 I),
σ_e = σ_base (1 - e/E)^2, (3)
其中σ_base匹配预期的噪声水平,E是总epoch数。二次衰减提供了从激进增强(首先学习大规模结构)到干净训练(微调)的平滑过渡。移除该组件会使几何平均MSE增加7%(表7 (https://arxiv.org/html/2608.14773#S5.T7))。

### 3.4 自适应正则化

我们用熵加权的ℓ1项惩罚边权重:

R(W) = λ ∑_{i,j} H_{ij} · ∥w_{ij·}∥_1, (4)
其中H_{ij}是边(i,j)在当前批次上的激活熵,鼓励在小数据集上产生稀疏激活。有趣的是,消融实验表明该组件在我们的设置中没有可测量的效果(比率1.00×);我们保留它作为正则化保障,但并不声称它是贡献因素。

### 3.5 架构和参数数量

表1 (https://arxiv.org/html/2608.14773#S3.T1)比较了参数数量和推理延迟。ER-KAN使用2个隐藏层,宽度为32,G=8个RBF中心,产生595个参数。1D和2D输入变体仅在第一层参数数量上有所不同。

表1:参数数量和CPU上每个epoch的训练时间(500个观测值,5个种子)。推理延迟以每样本微秒计。ER-KAN每个epoch的训练速度比原始KAN快2.7倍,推理延迟低8倍。它比MLP慢(每个epoch 2倍),考虑到高斯评估开销,这是预期的;推理差距(1.76 vs 1.07μs)在实践中可以忽略不计。

### 3.6 训练协议

我们使用Adam[Kingma and Ba 2015 (https://arxiv.org/html/2608.14773#bib.bib4)]进行训练,学习率从10^{-3}到10^{-5}采用余弦退火,批大小64,早停(耐心500 epochs)在20%的保留验证集上。对于PINNs,不使用标注数据划分;而是训练固定的epoch数,使用物理损失、初始条件损失和边界条件损失。完整伪代码在算法1 (https://arxiv.org/html/2608.14773#alg1)中。

算法1 ER-KAN训练
0:数据 {(x_n, y_n)},σ_base,epochs E
1:for e = 1 to E do
2:  σ_e ← σ_base (1 - e/E)^2
3:  for each batch B do
4:    扰动:x̃ = x + N(0, σ_e^2)
5:    损失:ℒ = MSE(f_θ(x̃), y) + R(θ)
6:    对θ执行Adam步进
7:  end for
8:  验证;更新最佳检查点
9:end for

## 4 实验设置

### 4.1 解析函数套件

我们在八个函数上进行测试:sin(πx),Runge函数1/(1+25x^2),|x|,xe^{-3x}(高斯-余弦包络),阶跃函数,xe^{-3x} sin(3x),以及两个二维函数x_1^2 + x_2^2(二次函数)和sin(πx_1) cos(πx_2)。这些涵盖了振荡、代数、平滑指数和不连续类行为。

训练输入从[-1,1]^d中均匀抽取;测试输入是一个固定的2000点网格。测试标签总是干净的(无噪声);只有训练标签被破坏。我们使用N∈{50,200,500},σ∈{0,0.03,0.1},5个种子,每个模型共8×3×3×5=360次运行(四个模型共1440次)。

### 4.2 噪声退化比

对于模型m、函数f、样本数量N,我们定义:

D_R(m, f, N, σ) = MSE(m, f, N, σ) / MSE(m, f, N, 0), (5)
即在σ噪声数据上训练时,与在干净数据上训练相比,*干净测试*MSE的乘法增加。我们报告在固定N和σ下,八个函数上D_R的几何平均值。D_R ≈ 1的模型对训练噪声不敏感;D_R >> 1意味着模型不仅收敛更慢,而且在定性上受到噪声的影响,这种影响在整个函数套件中叠加。

### 4.3 PINN实验

阻尼谐振子。我们求解:
ẍ + 2ζωẋ + ω²x = 0, x(0) = 1, ẋ(0) = 0, ζ = 0.15, ω = 2.0, (6)
在t∈[0,10]上使用200个配置点,物理、初始位置和初始速度的损失权重分别为1:10:5。我们训练5000个epoch。

Burgers方程。我们求解:
u_t + u u_x = ν u_xx, u(x,

相似文章

几何科爾莫戈羅夫-阿諾德網絡 (GeoKAN)

arXiv cs.LG

本文介紹了幾何科爾莫戈羅夫-阿諾德網絡 (GeoKAN),這是一個幾何感知模型家族,通過學習黎曼度量來適應坐標,從而實現更優函數近似和物理感知學習。

几何感知R结构Kolmogorov-Arnold网络

arXiv cs.LG

提出几何感知R结构KAN(GRS-KAN),一种将R函数集成到KAN中以编码几何和逻辑约束的混合神经架构,在含不连续性的回归基准上实现了高达67%的RMSE降低。