Kolmogorov--Arnold网络在硬约束循环物理信息模型中的嵌入式RISC-V评估

arXiv cs.LG 论文

摘要

本文在嵌入式RISC-V平台上评估了Kolmogorov–Arnold网络(KAN)与MLP作为硬约束循环物理信息网络中残差分支的性能,发现KAN运行更慢、能耗更高,且在INT8量化下可靠性较低。

arXiv:2608.00737v1 公告类型:新 摘要:硬约束循环物理信息网络(HRPINNs)将已知动力学嵌入循环数值积分器中,并限制神经分支仅学习第一性原理模型未捕获的残差动力学。Kolmogorov--Arnold网络(KANs)被提出作为此类残差分支中多层感知机(MLPs)的参数高效替代方案,但其可学习的B样条激活遵循截然不同的执行特性。在先前工作的基础上——该工作描述了朴素B样条KAN作为HRPINN残差分支在发现精度上何时匹配或不如MLP——本文探讨这种参数效率在部署时是否仍然成立。使用相同的训练权重,我们在不带向量扩展的RISC-V RV64GC平台(StarFive VisionFive~2,SiFive U74)上,测量了闭合循环回路中的执行延迟、每积分步能耗以及训练后量化下的可靠性。对于两对精度相当的模型,KAN残差分支的执行速度分别慢$13.5\times$和$8.0\times$,每个积分步的能耗分别高$11.3\times$和$5.6\times$(最小的一对为3.7\,$\mu$J对比0.33\,$\mu$J);在所有四个参数匹配的规模层级中,范围分别为$4.7\times$--$14.5\times$和$4.7\times$--$18.7\times$。在INT8量化下,KAN轨迹的发散时间比匹配的MLP早多达$43\times$;损害可追溯到权重量化,而非输入侧节点区间错误分配。这些结果表明,KANs所报告的参数效率并未转化为标量嵌入式内核上的部署成本优势,并且除非采用特定的量化协同设计,否则MLP残差分支是嵌入式HRPINN部署中更可靠的默认选择。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:43

# 嵌入式RISC-V上的硬约束循环物理信息模型中Kolmogorov–Arnold网络的评估

来源:https://arxiv.org/html/2608.00737

###### 摘要

硬约束循环物理信息网络(HRPINNs)将已知动力学嵌入循环数值积分器中,并将神经分支限制为仅学习第一性原理模型未捕获的残差动力学。Kolmogorov–Arnold网络(KANs)已被提议作为此类残差分支中多层感知器(MLPs)的参数高效替代方案,但其可学习的B样条激活具有明显不同的执行特征。在先前工作(该工作刻画了朴素B样条KAN作为HRPINN残差分支在发现精度方面何时匹配或不如MLP)的基础上,本文探讨的是这种参数效率是否能在部署中幸存。我们使用相同的训练权重,在无向量扩展的RISC-V RV64GC平台(StarFive VisionFive 2,SiFive U74)上,测量了闭环循环中的执行延迟、每积分步能量以及训练后量化下的可靠性。对于两对精度相当的模型,KAN残差分支的执行速度分别慢13.5×和8.0×,每积分步能耗分别为11.3×和5.6×(最小一对为3.7μJ对0.33μJ);在所有四个参数匹配的规模层级中,范围为4.7×–14.5×和4.7×–18.7×。在INT8量化下,KAN轨迹发散时间比匹配的MLP早最多43×;损坏可追溯到权重量化,而非输入侧节点区间错误分配。这些结果表明,KANs所报告的参数效率并不能转化为标量嵌入式内核上的部署成本,并且除非使用特定的量化协同设计,否则MLP残差分支是嵌入式HRPINN部署中更可靠的默认选择。

## I 引言

现代信息物理系统(CPS)越来越依赖其自身物理的可执行模型来进行预测、异常检测和控制。当这种模型在系统本身上运行,并受到实时和能量预算的约束时,其预测还必须保持可信赖性,因为一个在部署条件下性能退化的学习组件可能会传播到它所支撑的控制决策中[2](https://arxiv.org/html/2608.00737#bib.bib5)。硬约束架构通过结构性的方式而非训练压力来解决这个问题,即将施加的约束嵌入计算本身而不是损失项中(第II节](https://arxiv.org/html/2608.00737#S2))。混合循环物理信息神经网络(HRPINN)[17](https://arxiv.org/html/2608.00737#bib.bib11)将此原理应用于循环设置:已知动力学和数值积分器固定在更新规则内部,神经分支仅学习第一性原理模型未捕获的残差动力学,因此所施加的结构对该分支的任何行为都成立;类似的方法也已在CPS prognostics中研究,包括电池健康和剩余使用寿命估计[12](https://arxiv.org/html/2608.00737#bib.bib19),  [14](https://arxiv.org/html/2608.00737#bib.bib20)。

由于该残差分支是唯一的学习组件,为其选择的架构决定了模型的部署成本。Kolmogorov–Arnold网络(KANs)[10](https://arxiv.org/html/2608.00737#bib.bib1)已被提议作为科学机器学习中MLP的替代方案。它们用每条边上的可学习单变量B样条函数替代固定节点激活,并在每个节点求和,在恢复动力系统中的隐藏项方面显示出潜力(第II节](https://arxiv.org/html/2608.00737#S2))。在先前的工作[18](https://arxiv.org/html/2608.00737#bib.bib12)中,总结于第III节](https://arxiv.org/html/2608.00737#S3),我们刻画了朴素B样条KAN作为HRPINN残差分支在发现精度和训练稳定性方面何时匹配或不如MLP。该刻画关注的是精度而非执行成本。关于KAN硬件实现的研究一致报告B样条评估相对于参数数量而言代价高昂[5](https://arxiv.org/html/2608.00737#bib.bib3),  [7](https://arxiv.org/html/2608.00737#bib.bib4),但它们将KANs刻画为通用函数逼近器,没有包含物理信息积分器,也没有附加所测量具体模型的精度数据。这留下了一个问题,也即本文的动机:KANs在可分离残差上表现出的参数效率是否能在部署后转化为计算效率,还是B样条公式引入了抵消该效率的执行和精度层面的成本?

我们研究三个假设。**H1**:KAN残差分支比精度相当的MLP产生更高的每步执行延迟。**H2**:该延迟差异转化为更高的每积分步能量。**H3**:在闭环循环内部的训练后量化下,KAN分支比MLP更早失去轨迹保真度,而这种量化场景中,内存和指令集约束通常使得整数执行成为唯一选择。检验这些假设需要一个能够直接暴露每种计算拓扑成本的平台。我们瞄准StarFive VisionFive 2(SiFive U74,RV64GC)[19](https://arxiv.org/html/2608.00737#bib.bib18),该平台没有向量扩展,因此MLP的矩阵乘积和KAN的样条递归都编译为标量指令序列,二者都无法利用供应商调优的向量内核;因此测得的差异反映了两种拓扑自身的操作混合和内存访问模式。

因此,本文的贡献为:(i) 在无向量扩展的RISC-V核心上,使用相同的训练权重,进行延迟和能量测量,包括一种部署优化的KAN变体,以量化比较对实现工作的敏感性;(ii) 在闭环中训练后量化下的可靠性评估,并附带归因分析以确定哪种量化步骤驱动了架构间的差异;(iii) 为嵌入式物理信息CPS中选择残差分支架构提供部署指导。推理引擎、训练好的模型和测量脚本均公开可用。¹¹所有资源公开可见于https://github.com/enzoniko/khrpinn

## II 相关工作

物理信息神经网络将物理定律作为损失惩罚项[15](https://arxiv.org/html/2608.00737#bib.bib7),这使约束满足在推理时得不到保证;架构级强制则使约束成为结构性的,例如通过投影层处理线性等式约束[3](https://arxiv.org/html/2608.00737#bib.bib6),而HRPINN[17](https://arxiv.org/html/2608.00737#bib.bib11)将已知动力学和积分器都固定在循环单元内部,此类保证的更广泛动机由Brunke等人综述[2](https://arxiv.org/html/2608.00737#bib.bib5)。在这一设置中,KANs已被应用于动力系统,主要作为神经ODE主干来恢复隐藏物理、符号源项和结构化潜状态[10](https://arxiv.org/html/2608.00737#bib.bib1),  [8](https://arxiv.org/html/2608.00737#bib.bib2),  [9](https://arxiv.org/html/2608.00737#bib.bib13)。实用指南中记录的超参数敏感性[13](https://arxiv.org/html/2608.00737#bib.bib8)促使了第III节](https://arxiv.org/html/2608.00737#S3)所总结的稳定性刻画,而一项物理信息KAN基准测试独立报告称,原始的B样条参数化在精度和效率方面均不如基于MLP的PINNs,并且对随机种子保持敏感[16](https://arxiv.org/html/2608.00737#bib.bib21);本文在此记录基础上增加了部署维度。许多变体用Chebyshev、算子网络或混合循环公式替代B样条基[11](https://arxiv.org/html/2608.00737#bib.bib15),  [1](https://arxiv.org/html/2608.00737#bib.bib16),  [20](https://arxiv.org/html/2608.00737#bib.bib17),但所有这些都保留了逐边单变量函数评估后求和这一基本原语,因此本文评估的是基线朴素公式,作为优化后代必须击败的参考。在硬件方面,Huang等人[5](https://arxiv.org/html/2608.00737#bib.bib3)表明,即使将B样条映射到查找表仍需要大量电路资源,并提出了算法-硬件协同设计;而Khalid等人[7](https://arxiv.org/html/2608.00737#bib.bib4)则推导了跨基变体的平台无关复杂度公式;两者都在专用或抽象硬件上将KANs评估为通用函数逼近器,而这正是本文所填补的空白。

## III 背景与先前结果

HRPINN通过硬约束显式欧拉单元推进状态向量 \(s_t=[x_t,v_t]^\top \in \mathbb{R}^2\),其中 \(x_t\) 是位置,\(v_t\) 是归一化坐标系中的速度:

\(\dot{v}_t = a_{\mathrm{known}}(s_t) + R_\theta(s_t)\),
\(x_{t+1}=x_t+\Delta t\, v_t\),
\(v_{t+1}=v_t+\Delta t\, \dot{v}_t\)。

\(a_{\mathrm{known}}\) 和 \(R_\theta\) 都以完整状态向量为参数;对于下面的Van der Pol系统,已知项仅依赖于 \(x_t\),而残差项依赖于两者。积分器为显式(前向)欧拉,与先前研究[18](https://arxiv.org/html/2608.00737#bib.bib12)一致,这使训练好的模型及其报告的精度可直接迁移到本评估中,同时也是最便宜的选择,每步仅需一次残差分支评估(相比之下,\(p\) 阶Runge–Kutta格式需要 \(p\) 次)。就本文报告的比较而言,决定性属性是积分器在两种架构中完全相同且固定:它为每次测量贡献一个加性常数,并在所有架构间的比率中抵消。学习分支每步评估一次,其余项是少量浮点运算的闭式表达式,因此每步成本由分支主导;如果第一性原理项本身代价高昂(例如需要隐式求解或大型表查找),本文报告的成本仅界定了预算中学习部分的开销。

只有 \(R_\theta\) 通过时间反向传播(BPTT)在20步窗口上进行训练。由于当残差分支架构改变时,只有 \(R_\theta\) 发生变化,因此在此单元下比较两种架构可将比较隔离到分支本身。基准系统为Duffing振荡器(\(\dot{v}=-x-0.2v-0.3x^3\);已知部分 \(-x-0.2v\),残差 \(-0.3x^3\))和Van der Pol振荡器(\(\dot{v}=-x+(1-x^2)v\);已知部分 \(-x\),残差 \((1-x^2)v\))。两者都具有单位自然频率,给出特征周期 \(T=2\pi \approx 6.28\) s,因此步长 \(\Delta t=0.05\) s 对应于 \(T/126\),该分辨率下显式欧拉对这些动力学保持稳定,而20步训练窗口跨越1.0 s,即 \(T/6\),足够长以使得复合误差出现在损失中,同时保持展开图足够小以获得稳定梯度。将它们表示为系统时间尺度的分数,可使结果迁移到具有不同自然频率的被控对象。发现精度报告为学习曲面 \(R_\theta(x,v)\) 与解析残差在 \([−2,2]^2\) 上的 \(50\times 50\) 网格之间的 \(R^2\)。

残差分支实现为ReLU MLP或朴素B样条KAN。KAN层将MLP的每个固定标量激活替换为可学习的单变量函数,实现为阶数 \(k\)、网格区间数 \(G\) 的B样条,组合基路径和样条路径为

\(\phi(x)=w_b\,\mathrm{SiLU}(x)+w_s\sum_j c_j B_j(x)\),

其中 \(B_j\) 是该边节点向量上的 \(k\) 阶基函数,\(c_j\) 为学习系数[10](https://arxiv.org/html/2608.00737#bib.bib1)。每个输出节点对其入边求和,因此单层加性地组合其输入,而诸如Van der Pol残差 \((1-x^2)v\) 这样的乘法交互只能通过跨深度的组合来表示;Van der Pol基准正是探测这一点。默认配置使用网格大小 \(G=5\) 和样条阶数 \(k=3\),训练中应用网格更新,因此节点向量通常是非均匀的,且特定于训练好的模型。

先前研究进行了两次消融,每次使用100个随机种子,并带有95%自助法置信区间。对固定KAN架构(\([2,8,1]\))进行网格大小、样条尺度权重、稀疏正则化和网格更新频率的配置消融,发现精度对这些超参数高度敏感:七个配置中有三个在Van der Pol上产生负的 \(R^2\),最差为 −5.23,而337参数MLP参考为0.77;这种敏感性在MLP中不存在,且与所报告的KAN实践一致[13](https://arxiv.org/html/2608.00737#bib.bib8);两个最稳定的设置 \(G=5\) 和 \(G=3\) 被保留为KAN默认值。对四个KAN和四个MLP宽度与深度(表II](https://arxiv.org/html/2608.00737#S6.T2))的参数效率消融显示了三种为本评估奠定框架的行为:小型KAN在可分离的单变量Duffing残差上匹配或超过相似大小的MLP;KANs始终无法恢复乘法性的Van der Pol交互,而MLPs则随参数数量优雅扩展;Wide和Deep KAN配置不稳定,在大多数种子上在Duffing上无法收敛。

## IV 嵌入式推理框架

训练在x86-64开发主机上使用PyTorch离线进行;部署通过导出为紧凑二进制、验证数值等价性,并由仅依赖C++17标准库和libm、静态链接的标量推理引擎执行,因此部署只是将两个文件复制到最小Linux镜像上。基准可执行文件占用893 KB,模型文件从511 B(MLP Tiny)到17.8 KB(MLP Large),而PyTorch运行时为数百MB,这证明了不在目标平台上训练是合理的。导出文件是扁平的、小端序的、位置式二进制:固定头部(幻数、版本、架构和系统标识符、\(\Delta t\)、状态归一化器)后跟逐层记录,对于MLP,记录包含权重矩阵、偏置向量和激活标志;对于KAN,记录包含节点向量、基权重和样条系数,且逐边尺度已折叠其中,因此推理路径中无需缩放乘法。每条记录还携带量化路径使用的逐张量校准范围,因此量化部署无需运行时校准数据;权重以内核迭代所采用的布局存储,因此加载是一次连续的读取,无需动态分配。所有模型都适合U74的32 KB L1数据缓存,使延迟比较成为对计算而非内存层次行为的度量。

两个分支都是分配

相似文章

面向小语言模型的Kolmogorov--Arnold网络

arXiv cs.AI

本文评估了Kolmogorov--Arnold网络(KAN)作为可解释组件以及Transformer前馈网络在小语言模型中的替代方案,发现虽然KAN提供了实用的审计接口,但与MLP基线相比,它们并未显示出持续一致的基准优势。

通过Kolmogorov-Arnold网络在FPGA上实现超快机器学习

Hacker News Top

本文介绍了作者的硕士论文,该论文利用Kolmogorov-Arnold网络(KAN)在FPGA上实现超快机器学习,通过自定义硬件架构实现亚微秒级推理和在线学习。文章引用了两篇已接收的论文:基于LUT评估的KANELÉ(FPGA 2026最佳论文奖)以及一种在FPGA上进行在线学习的方法(ICML 2026)。

几何科爾莫戈羅夫-阿諾德網絡 (GeoKAN)

arXiv cs.LG

本文介紹了幾何科爾莫戈羅夫-阿諾德網絡 (GeoKAN),這是一個幾何感知模型家族,通過學習黎曼度量來適應坐標,從而實現更優函數近似和物理感知學習。