[R] SineKAN:基于正弦激活函数的Kolmogorov-Arnold网络

Reddit r/MachineLearning 论文

摘要

SineKAN 提出了一种基于正弦激活函数的 Kolmogorov-Arnold 网络变体,在基准任务上,与基线 KAN 模型相比,显示出相当或更好的性能,并有显著的速度提升。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/17 02:09

# 使用正弦激活函数的柯尔莫哥洛夫-阿诺德网络
来源:https://arxiv.org/html/2407.04149
## SineKAN:使用正弦激活函数的柯尔莫哥洛夫-阿诺德网络
感谢:引用:E.A.F. Reinhardt1, P.R. Dinesh, H.V. Nguyen, S. Gleyzer。SineKAN:使用正弦激活函数的柯尔莫哥洛夫-阿诺德网络。

Eric A. F. Reinhardt¹ 单位:物理学与天文学系 单位:阿拉巴马大学 单位:图斯卡卢萨,阿拉巴马州 邮箱:[[email protected]](mailto:) P. R. Dinesh 单位:物理学与天文学系 单位:阿拉巴马大学 单位:图斯卡卢萨,阿拉巴马州 邮箱:[[email protected]](mailto:) Sergei Gleyzer 单位:物理学与天文学系 单位:阿拉巴马大学 单位:图斯卡卢萨,阿拉巴马州 邮箱:[[email protected]](mailto:)

###### 摘要

近期的研究确立了柯尔莫哥洛夫-阿诺德网络(KAN)作为传统多层感知机神经网络的替代方案。通用的KAN框架在计算图的边上使用可学习的激活函数,随后在节点上进行求和。原始实现中的可学习边激活函数是基样条函数(B样条)。在此,我们提出一种模型,其中可学习的B样条激活函数网格被重新加权的正弦函数网格(SineKAN)所替代。我们在一个基准视觉任务上评估了模型的数值性能。我们证明,我们的模型性能优于或可与B样条KAN模型以及基于表示傅里叶级数的周期余弦和正弦函数的另一种KAN实现相媲美。此外,我们证明SineKAN具有可与密集神经网络(DNN)相当的数值精度扩展能力。与两个基线KAN模型相比,SineKAN在所有隐藏层大小、批量大小和深度上都实现了显著的加速。我们讨论了由于硬件和软件优化,DNN当前的优势以及理论扩展性。此外,还讨论了SineKAN相对于其他KAN实现的特性及其当前局限性。

## 1引言

多层感知机(MLP)是当前许多领先神经网络的基本组成部分[1 (https://arxiv.org/html/2407.04149#bib.bib1), 2 (https://arxiv.org/html/2407.04149#bib.bib2)]。它们通常与特征提取工具结合使用,例如卷积神经网络[3 (https://arxiv.org/html/2407.04149#bib.bib3), 4 (https://arxiv.org/html/2407.04149#bib.bib4), 5 (https://arxiv.org/html/2407.04149#bib.bib5)]和多头注意力[6 (https://arxiv.org/html/2407.04149#bib.bib6)],以创建许多性能最佳的模型,例如Transformer。使MLP如此强大的关键机制之一在于,其层通常以非线性激活函数结束,这使得仅使用一个足够宽的层就能实现从任何任意输入空间到任何任意输出空间的通用逼近[7 (https://arxiv.org/html/2407.04149#bib.bib7)]。虽然MLP能够实现这种任意映射,但实现该映射所需的神经元数量也可能任意大。

近期工作[8 (https://arxiv.org/html/2407.04149#bib.bib8)]提出了一种基于柯尔莫哥洛夫-阿诺德表示定理[9 (https://arxiv.org/html/2407.04149#bib.bib9), 10 (https://arxiv.org/html/2407.04149#bib.bib10), 11 (https://arxiv.org/html/2407.04149#bib.bib11)]的MLP架构替代方案,相应地被称为柯尔莫哥洛夫-阿诺德网络(KAN)[8 (https://arxiv.org/html/2407.04149#bib.bib8)]。在早期的开创性工作[9 (https://arxiv.org/html/2407.04149#bib.bib9), 10 (https://arxiv.org/html/2407.04149#bib.bib10)]中,已确立任何任意多变量函数都可以用单变量连续函数的和来逼近。在[8 (https://arxiv.org/html/2407.04149#bib.bib8)]中,表明这种逼近可以推广到神经网络架构,从而在通常显著更小的模型尺寸下与MLP具有竞争力的性能[1 (https://arxiv.org/html/2407.04149#bib.bib1)][2 (https://arxiv.org/html/2407.04149#bib.bib2)]。在本工作中,我们将使用一种具有可学习B样条激活函数(B样条KAN)[12 (https://arxiv.org/html/2407.04149#bib.bib12)]的KAN高效实现,其数值上与原始KAN实现一致,但比原始实现[8 (https://arxiv.org/html/2407.04149#bib.bib8)]快约三到五倍,用于性能比较。

如图1 (https://arxiv.org/html/2407.04149#S1.F1)所示,传统MLP中的操作顺序是:边上权重乘法、节点求和、添加偏置,然后应用激活函数。在KAN中,操作顺序是:边上可学习激活函数、节点求和以及可选的节点偏置添加。这种替代的操作顺序满足了柯尔莫哥洛夫-阿诺德表示定理,并可能允许与MLP相比显著更小的计算图[8 (https://arxiv.org/html/2407.04149#bib.bib8)]。

参见标题图1:操作流程。上:MLP 下:KAN确立KAN作为可行模型的工作[8 (https://arxiv.org/html/2407.04149#bib.bib8)]探索了使用B样条作为可学习激活函数。选择B样条有强烈的动机。使用B样条,可以在不影响模型本身的情况下改变层中样条系数网格的大小,从而实现下游微调。还可以通过修剪低影响样条项的过程来稀疏化模型。此外,可以符号化地确定模型的函数形式。[8 (https://arxiv.org/html/2407.04149#bib.bib8)]发现B样条模型在广泛的任务上取得了与MLP层相竞争的结果。然而,选择B样条并非没有代价,因为B样条KAN层明显慢于MLP,虽然最近的实现有助于缩小差距,但MLP仍然快得多。此外,在[8 (https://arxiv.org/html/2407.04149#bib.bib8)]提出的许多任务中,MLP仍然优于B样条KAN。最近的工作表明,在公平比较下,B样条KAN的替代方案可以取得有竞争力的性能[13 (https://arxiv.org/html/2407.04149#bib.bib13)]。在本文中,我们提出SineKAN,一种使用正弦激活函数的KAN实现,旨在通过用周期正弦函数替换B样条函数来解决常见KAN模型的大小和速度限制。我们还将与现有的周期KAN模型FourierKAN[14 (https://arxiv.org/html/2407.04149#bib.bib14)]进行比较。

在这项工作中,我们将介绍新颖的SineKAN模型函数形式,并提供经验证据表明它可以达到与B样条KAN模型相当的性能,并在一些常见基准任务上优于FourierKAN模型。我们还表明,它在持续学习中可以部分避免灾难性遗忘,这一特性有助于推动对其他KAN模型的兴趣。在第3节 (https://arxiv.org/html/2407.04149#S3)中,我们描述了SineKAN架构,它是否满足通用逼近,并概述了一种与不同网格大小一致扩展并在多层模型中稳定数值性能的权重初始化策略。在第4节 (https://arxiv.org/html/2407.04149#S4)中,我们展示了模型推理速度和在MNIST基准上的性能结果,并将其与B样条KAN和FourierKAN实现进行比较。我们在第5节 (https://arxiv.org/html/2407.04149#S5)讨论我们的结果,并在第6节 (https://arxiv.org/html/2407.04149#S6)总结我们的发现。

## 2相关工作

许多替代B样条的单变量函数已被探索用于KAN,包括小波[15 (https://arxiv.org/html/2407.04149#bib.bib15)]、切比雪夫多项式[16 (https://arxiv.org/html/2407.04149#bib.bib16)]、分数函数[17 (https://arxiv.org/html/2407.04149#bib.bib17)]、有理雅可比函数[18 (https://arxiv.org/html/2407.04149#bib.bib18)]、径向基函数[19 (https://arxiv.org/html/2407.04149#bib.bib19)],甚至是傅里叶展开的变体[14 (https://arxiv.org/html/2407.04149#bib.bib14)],这些将在第3.2节 (https://arxiv.org/html/2407.04149#S3.SS2)中详细讨论。

神经网络中的周期激活函数已被广泛研究,并被证明可以为广泛的问题类别提供强大的近似。此类问题包括通用函数建模[20 (https://arxiv.org/html/2407.04149#bib.bib20)]、图像分类[21 (https://arxiv.org/html/2407.04149#bib.bib21), 22 (https://arxiv.org/html/2407.04149#bib.bib22)]以及[23 (https://arxiv.org/html/2407.04149#bib.bib23), 24 (https://arxiv.org/html/2407.04149#bib.bib24)]用于一般分类任务。使用正弦表示网络的工作[25 (https://arxiv.org/html/2407.04149#bib.bib25)]表明,正弦激活函数在连续域问题[26 (https://arxiv.org/html/2407.04149#bib.bib26)]以及可能的不连续域问题[27 (https://arxiv.org/html/2407.04149#bib.bib27), 28 (https://arxiv.org/html/2407.04149#bib.bib28)]上表现出强劲的性能。这些正弦激活的有希望的结果促使我们考虑将正弦函数作为KAN中其他已探索激活函数的潜在有力替代方案。

## 3 SineKAN

### 3.1 正弦激活函数

在这里,我们提出了一种替代第1节 (https://arxiv.org/html/2407.04149#S1)中描述的B样条KAN架构的方案,该方案基于正弦函数。数学上,每一层可以表示为:

yᵢ=∑ⱼ,ₖ Aᵢⱼₖ sin(ωₖ xⱼ + φⱼₖ) + bᵢ   (1)

其中 yᵢ 是层输出特征,xⱼ 是层输入特征,φⱼₖ 是网格和输入维度上的相移,ωₖ 是网格频率,Aᵢⱼₖ 是振幅权重,bᵢ 是偏置项。正弦的基本函数形式是固定的,而正弦激活的函数形式是通过在固定相位的网格上执行的可学习频率和振幅项来学习的。

### 3.2 网格相移

在先前使用傅里叶级数的工作中,KAN网络使用完整傅里叶级数展开的形式,表示为以下形式[14 (https://arxiv.org/html/2407.04149#bib.bib14)]:

yᵢ=∑ⱼ ∑ₖ [Aᵢⱼₖ sin(k xⱼ) + Bᵢⱼₖ cos(k xⱼ)] + bᵢ   (2)

其中 yᵢ 是层输出特征,xⱼ 是层输入特征,Aᵢⱼₖ 和 Bᵢⱼₖ 是傅里叶权重矩阵,bᵢ 是偏置。这里,与SineKAN相比,多了一个三维权重矩阵:

yᵢ=∑ⱼ,ₖ Aᵢⱼₖ sin(ωₖ xⱼ + φⱼₖ) + bᵢ   (3)

通过引入可学习的频率 ωₖ,并在具有固定相移 φⱼₖ 和输入维度的网格上,我们将可学习参数的数量从 O(2oig) 减少到 O(oig+g),其中 o 是输出维度,i 是输入维度,g 是网格大小。我们稍后在第3.4节 (https://arxiv.org/html/2407.04149#S3.SS4)中推测,在大模型极限下,这仍然满足通用逼近。

参见标题图2:∑ᵢ₌₁ᵍ sin(x + i/(g+1)) 的值作为 x 的函数,颜色比例表示 g+1 处的和与 g 处的和的比值。从左到右:g=2, g=10, g=20。
根据模型第一层的初始假设,初始化网格权重的一种朴素方法是覆盖完整的相移范围,其中网格相移项将是0到π之间的值范围。然而,可以证明,对于以下情况:

∑ᵢ₌₁ᵍ sin(x + i/g)   (4)

其中 g 是网格大小,总和作为 g 的函数非线性增加。最重要的是,总和与输入值 x 无关。这使得找到合适的网格权重缩放在不同输入类型和网格维度之间不一致。我们提出了一种替代策略,其中网格权重初始化为:

∑ᵢ₌₁ᵍ sin(x + i/(g+1))   (5)

在频率都固定为相同常数值的情况下,该和收敛于:

∑ᵢ₌₁ᵍ sin(x + i/(g+1)) = C(g) sin(x + 1/2)   (6)

其中 C(g) 是一个随 g 缩放的常数。这意味着,对于固定的频率,模型输出的缩放行为将与 x 无关。

此外,我们发现,沿输入特征数量轴引入额外的输入相位项(值范围从零到π)可以带来更强的模型性能。

最后,为了稳定不同网格大小下的模型缩放,我们找到了一种函数形式,有助于将总和随网格维度的缩放作为相位项的比率:

R = Ag⁻ᴷ + C φ_{g+1} = φ_g R(g)   (7)

其中 A=0.97241,K=0.988440,C=0.999450,R 是当网格大小从1向上增加时所有相位项相乘的比例因子,φ_g 是特定网格大小下的相位。为了确定 A、K 和 C,我们执行以下函数的最小二乘最小化:

L(g,x) = σ²( f(g+1,x) / f(g,x) ) + ( 1 - μ( f(g+1,x) / f(g,x) ) )²   (8)

其中 L 是代价函数,f(g,x) 是从 -π 到 π 所有输入值正弦的和,μ 是平均值,σ² 是标准差。

使用此函数形式,我们可以通过在递归公式中使用指数表达式来初始化具有任意网格大小的层,同时初始化网格相位权重。由此产生的正弦和比率如图3 (https://arxiv.org/html/2407.04149#S3.F3)所示。

参见标题图3:∑ₖ₌₁ᵍ sin( x + kπ/(g+1) R(g) ) ,颜色比例表示 g+1 处的和与 g 处的和的比值。从左到右:g=2, g=10, g=20。
参见标题图4:(a) 应用网格大小缩放的递归函数的相同大小 (N=1000) 层的输出。(b) 未应用网格大小缩放的递归函数的相同大小 (N=1000) 层的输出。
在图4 (https://arxiv.org/html/2407.04149#S3.F4)(b) 中,我们看到了未应用递归网格大小相位缩放时后续连接层的输出。在图4 (https://arxiv.org/html/2407.04149#S3.F4)(a) 中,我们看到了应用递归网格大小相位缩放的相同场景,并看到不同网格大小下层输出的相似性增加。

### 3.3 相位项随网格大小的缩放

我们发现了一种权重初始化策略,可以在更深的模型中带来强大的性能和稳定性。对于第一层,权重初始化为均值为0、标准差为0.4的随机分布,对于后续层,权重从均匀分布初始化。

相似文章

SechKAN: 基于双曲正割函数的Kolmogorov-Arnold网络

arXiv cs.LG

SechKAN 是一种新颖的 Kolmogorov-Arnold 网络架构,使用双曲正割函数作为基函数,在函数拟合、偏微分方程问题和图像分类任务中取得了具有竞争力的性能,同时保持了与多层感知机相当的参数效率。

几何科爾莫戈羅夫-阿諾德網絡 (GeoKAN)

arXiv cs.LG

本文介紹了幾何科爾莫戈羅夫-阿諾德網絡 (GeoKAN),這是一個幾何感知模型家族,通過學習黎曼度量來適應坐標,從而實現更優函數近似和物理感知學習。

几何感知R结构Kolmogorov-Arnold网络

arXiv cs.LG

提出几何感知R结构KAN(GRS-KAN),一种将R函数集成到KAN中以编码几何和逻辑约束的混合神经架构,在含不连续性的回归基准上实现了高达67%的RMSE降低。