@Memoirs: 几何约束 Kolmogorov-Arnold 网络:通过 Banach 对偶性学习边几何 K S Sesh Kumar https://arxiv…

X AI KOLs Timeline 论文

摘要

介绍了通过 Banach 对偶性学习边几何的几何约束 Kolmogorov-Arnold 网络,在符号回归任务中展示了优越性能,特别是在测量噪声下。

几何约束 Kolmogorov-Arnold 网络:通过 Banach 对偶性学习边几何 K S Sesh Kumar https://t.co/frcSgYwUwx [𝚌𝚜.𝙻𝙶 𝚜𝚝𝚊𝚝.𝙼𝙻] https://t.co/51fDySQIsY
查看原文
查看缓存全文

缓存时间: 2026/08/30 00:12

几何约束Kolmogorov-Arnold网络:通过巴拿赫对偶学习边缘几何 K S Sesh Kumar https://t.co/frcSgYwUwx [cs.LG stat.ML] https://t.co/51fDySQIsY

通过巴拿赫对偶学习边缘几何

来源:https://arxiv.org/html/2608.25807

几何约束Kolmogorov–Arnold网络:通过巴拿赫对偶学习边缘几何

K. S. Sesh Kumar 所属机构:Brevan Howard金融分析中心 所属机构:帝国理工学院商学院 电子邮件:[email protected] 2026年8月26日

摘要

Kolmogorov–Arnold网络(KAN)用可学习的单变量边缘函数替代深度架构中的固定激活函数,使得边缘参数化方式的选择成为核心问题。现有变体依赖于样条、多项式或傅里叶特征等固定基函数,这在观察数据之前就强加了函数空间的几何结构。我们引入了几何约束KAN,这是一族源自巴拿赫对偶映射的边缘激活函数,其中几何本身通过每条边的一个标量指数p>1来学习。该指数控制定性响应:亚欧几里得值产生类似于L_1(LASSO)几何的尖锐、阈值式行为;p=2恢复线性区域;更大的值在原点附近产生更平坦的响应。在50个符号回归目标(其中40个来自AI Feynman基准测试,10个为合成压力测试)上,几何约束KAN在中位数NRMSE上匹配或超越所有固定基线(Banach-KAN为0.030,与切比雪夫并列,并优于样条);在平均排名上,Banach-KAN在18方程核心集上表现最佳(2.00),并在完整基准测试上与最强样条在统计上持平(2.32 vs. 2.34)。最显著的增益出现在测量噪声下:当\sigma从0增长到1时,\ell^p-KAN仅退化3.7\times——甚至低于交叉验证的样条(约11\times)——而未正则化的样条退化21.6\times;Banach-KAN退化8.8\times,与调优后的样条相当,但比未正则化的样条稳定得多。Banach-KAN在小样本情况下也取得了最多的单方程胜利,固定基模型仅在训练集增长时才赶上。学习到的指数提供了一个可解释的相对信号:在固定初始化下,它们揭示了跨方程族和输入维度的一致的、依赖于目标的几何排序。

1引言

许多科学回归问题由低维非线性依赖关系支配:摆的周期依赖于振幅,辐射定律依赖于温度,交通速度依赖于密度。Kolmogorov-Arnold网络(KAN)正是为此场景设计,它用可学习的单变量边缘函数替代标准神经网络中的固定激活函数,并在每个节点处对其响应求和。因此,KAN中的核心建模决策是边缘函数的选择。现有方法通过基函数固定这一选择:B-样条、径向基函数、小波、切比雪夫多项式、雅可比多项式或傅里叶特征。每个基函数都隐式地在观察到任何数据之前强加了一种函数空间几何结构——如平滑性、周期性或局部性。这种选择并非无关紧要。图1显示,即使在匹配的参数预算下,不同的固定基函数在拟合Heaviside阶跃或多级阶梯等简单不连续目标时,也会以不同的方式失败。没有任何固定基在两项任务上都表现均匀良好。局限性不在于表示能力,而在于几何失配:平滑基函数通过将间断分散到系数中来近似它们,从而导致振荡或偏差。请参阅图注。

图1:固定基锁定了几何。所有列均使用匹配的21个可训练参数预算,每个目标从N=2000个样本中拟合,标签噪声为\sigma=0.03,因此每个面板都是有噪声的拟合,而非无噪声插值。不同的基在同一目标上失败方式不同,因此没有任何单一的固定几何结构在两项任务上都普遍适用;几何自适应的\ell^p-KAN能适应每种情况,而不是固守一种。在参数集合\{13,21,41,125\}上的预算扫描报告见附录M。

这些观察表明,关键的建模选择不是基本身,而是它所诱导的几何结构。我们不希望先验地固定这种几何结构,而是寻求一种将其适应数据的方法。函数类的行为——其平滑性、尖锐性和增长性——受其所在空间的几何结构支配,而该几何结构由其底层的范数决定。参数化此类几何的一种自然方式是通过一个单参数族,该族在定性不同的区域之间连续插值。这一视角引出了\ell^p族(第2.4节),其中单个指数p控制几何结构。我们不是选择基函数,而是使用与该族相关的对偶映射来参数化每条边,并直接从数据中学习p我们的目标不是建立一个完整的泛化理论,而是提供函数空间几何的最小化、可解释的参数化,并研究其经验效应。 这产生了几何约束KAN:其形式由底层几何固定、但几何本身是可适应的边缘激活函数。指数p成为一个简单、可解释的控制参数,可使每条边在尖锐、线性和饱和区域之间移动。

贡献

  • • 我们引入了几何约束KAN,其中边缘激活函数源自具有可学习指数的对偶映射。
  • • 我们提供了KAN边缘函数的统一解释,将其视为几何控制的映射而非基展开。
  • • 我们通过实验证明,学习几何(i)提高了在测量噪声下的鲁棒性——\ell^p边缘比交叉验证的样条正则化退化更少——并且(ii)在小样本情况下产生了比基于基的KAN更好的近似性能,优于固定基和显式样条正则化。
  • • 我们从几何推导出一个可测试的预测——一个可训练深度条件p > 3/2(命题1)——并通过匹配预算控制将几何效应从通用参数灵活性中分离出来(第5.1节)。
  • • 我们证明,学习到的指数提供了一个可解释的、以初始化为锚点的信号,反映了底层任务的结构。

2背景与几何

我们发展了关于KAN的几何视角,其中边缘函数的选择被理解为函数空间几何的选择。这一观点使我们能够从固定的基构造转向几何本身被学习的参数化方式。

2.1 Kolmogorov–Arnold网络

Kolmogorov–Arnold网络(KAN)用边缘上的可学习单变量函数替代固定的非线性激活函数。一层定义为: (\Phi_{\ell}(x))_j = \sum_{i=1}^{d_{\ell-1}} \phi_{j,i}^{(\ell)}(x_i), \qquad j=1,\dots,d_{\ell}, \tag{1} 因此模型类别由边缘函数\phi_{j,i}决定。与固定激活函数并学习仿射权重的标准神经网络相反,KAN固定聚合方式并学习非线性变换。

2.2 固定基作为隐式几何

现有的KAN变体使用固定基展开来参数化\phi_{j,i},包括B-样条、径向基函数、小波、切比雪夫多项式、雅可比多项式和傅里叶特征。尽管这些构造不同,但它们共享一个共同的局限性:函数空间在观察任何数据之前就被固定了。每个基编码了一种特定的归纳偏置——如平滑性、周期性或局部性——这决定了函数如何被表示。图1展示了其后果。即使在匹配的参数预算下,不同的基在拟合阶跃和阶梯等不连续目标时表现出不同的失败模式。平滑基通过将间断分布到系数中来近似它们,导致振荡或偏差。这反映了强加的几何结构与目标结构之间的失配。

图2:几何诱导激活。凸势函数定义了几何,其梯度充当激活函数,单位球则展示了几何如何变化。

2.3 自适应激活

另一相关方向是使激活函数本身可训练:自适应激活方法在固定形状的非线性函数\sigma(ax)内部学习一个输入斜率,这加速了收敛而不离开激活的正则性类别。我们发展的构造在本质上不同。指数p改变了形状和正则性类别本身——当p \to 1时类似阈值,在p=2时为线性,对于大的p则变平——因此适应的是诱导的几何,而不是输入尺度。因此,可学习形状参数的想法并不新颖,但适应几何而非斜率是新颖的;我们在第5.1节中实证区分了这两种效应,在那里,在匹配的每条边预算下,斜率自适应的边缘从未能与几何自适应的边缘竞争。

2.4 几何、对偶与激活函数

为了超越固定基,我们在更根本的层面考虑几何。让我们考虑巴拿赫空间,其中几何由范数诱导:范数决定了单位球的形状,因此也决定了距离、变化和梯度的度量方式。范数还诱导一个编码该几何的规范凸势函数。对于\ell^p族,这个势函数是 \Psi_p(z) = \tfrac{1}{p} \|z\|^p, 其水平集与缩放的单位球重合。这个势函数的梯度定义了相关的对偶映射: J_p(z) = \nabla \Psi_p(z) = \operatorname{sign}(z) (\|z\| + \varepsilon)^{p-1}, 它将几何结构转化为非线性变换。这建立了一个直接的对应关系:范数 \Rightarrow 几何 \Rightarrow 凸势函数 \Rightarrow 激活函数。

图2可视化了这种关系。凸势函数定义了几何,它们的梯度定义了激活函数,单位球则说明了几何如何随p变化。较小的p值产生更尖锐的响应,而较大的值在原点附近使行为变平并放大尾部。这种视角超越了\ell^p几何。例如,凸势函数\Psi(z) = \log \cosh(z)诱导激活函数\nabla \Psi(z) = \tanh(z)。与\ell^p的幂律增长不同,这个势函数在原点附近二次增长,在尾部线性增长,导致有界的、饱和的激活函数。如图2所示,这两种几何诱导了定性上不同的响应行为。

综上所述,这产生了一个统一的观点:激活函数源于由几何决定的凸势函数的梯度。人们不是直接选择激活函数,而是选择一种几何,激活函数随之而定。因此,学习指数p对应于学习底层的几何结构。

2.5 设计缺口

前面的讨论突出了现有方法中的一个结构性局限。当前的KAN变体通过选择基函数隐式地固定了底层的函数空间几何结构,而标准神经网络固定激活函数并学习仿射权重。在这两种情况下,几何都是先验指定的,并在训练过程中保持不变。这是有局限性的:图1中的实验表明,没有任何单一的固定几何结构能很好地适应不同的目标行为。平滑基难以处理间断,而有界激活无法捕获无界增长。这些局限性并非源于容量不足,而是源于强加的几何与数据结构之间的失配。

这表明关键的建模选择不是基函数或激活函数本身,而是它所诱导的几何结构。一种更灵活的方法是允许这种几何在学习过程中适应。具体来说,我们寻求一种参数化方式,该方式:

  • • 保留KAN简单的逐边结构,
  • • 避免离散的基选择或架构搜索,
  • • 通过少量连续、可解释的参数暴露几何。

在下一节中,我们将展示这可以通过将指数p提升为每条边上的可学习参数来实现,从而得到几何约束KAN。

3 几何约束KAN

图3:(a)两种对偶映射比较:Orlicz对偶(\tanh)在\pm 1处饱和,提供有界表达能力;球对偶(J_{2.5})按\|z\|^{1.5}增长,提供自适应的幂律几何。(b)Banach-KAN边缘函数通过组合两者来涵盖多种形状:饱和曲线(由Orlicz主导)、幂律增长(由球主导)、非单调函数(混合)、不对称响应(高p值)。

我们现在定义三种KAN架构,它们构成一个受控的族,每种都隔离了几何-表达能力权衡的一个特定方面(参见图2和3)。在所有三种情况下,方程(1)中的边缘函数\phi_{j,i}都采用带有仿射前激活z = wx + b的参数化单变量激活函数的形式。

3.1 Tanh-KAN:无几何自适应的表达能力

每条边的函数是 \phi(x) = a \cdot \tanh(wx + b) + d, \tag{2} 每条边有4个可学习参数\{a, w, b, d\}。如第2节所讨论,\tanh源自Orlicz对偶,也是实践中研究和应用最广泛的激活函数之一:LSTM和GRU单元中的经典门控非线性、经典前馈训练研究中的理论分析对象,以及S型网络的通用近似器。由于Banach-KAN包含此分支作为其a_2=0的特殊情况(表1),该族继承了通用近似性,因此表达能力而非普适性成为焦点。


相似文章

几何科爾莫戈羅夫-阿諾德網絡 (GeoKAN)

arXiv cs.LG

本文介紹了幾何科爾莫戈羅夫-阿諾德網絡 (GeoKAN),這是一個幾何感知模型家族,通過學習黎曼度量來適應坐標,從而實現更優函數近似和物理感知學習。

几何感知R结构Kolmogorov-Arnold网络

arXiv cs.LG

提出几何感知R结构KAN(GRS-KAN),一种将R函数集成到KAN中以编码几何和逻辑约束的混合神经架构,在含不连续性的回归基准上实现了高达67%的RMSE降低。

SechKAN: 基于双曲正割函数的Kolmogorov-Arnold网络

arXiv cs.LG

SechKAN 是一种新颖的 Kolmogorov-Arnold 网络架构,使用双曲正割函数作为基函数,在函数拟合、偏微分方程问题和图像分类任务中取得了具有竞争力的性能,同时保持了与多层感知机相当的参数效率。