KAN-MLP-Mixer: 关于使用 Kolmogorov-Arnold Networks (KANs) 改进基于 IMU 的人类活动识别的全面研究
摘要
本文系统地探索了混合 KAN 和 MLP 架构用于基于 IMU 的人类活动识别,相比纯 MLP 基线实现了 5.33% 的平均宏 F1 改进。
arXiv:2605.19031v1 公告类型: 新
摘要: Kolmogorov-Arnold Networks (KANs) 在干净、低维数据上学习复杂函数方面表现出卓越的能力,但在有噪声和不完美的真实世界数据集上难以保持性能。相比之下,传统的多层感知器 (MLPs) 对噪声的容忍度要高得多,并且计算效率更高。在 HAR 模型中将所有 MLP 组件替换为 KAN 通常会降低准确性和计算效率,凸显出一个开放挑战:如何结合 KAN 的精度与 MLP 的噪声鲁棒性和效率。为了解决这个问题,我们系统地探索了深度 HAR 网络中 KAN 模块的各种放置位置,并提出了一种混合架构,该架构战略性地协同了两种范式的优势,使用基于 KAN 的输入嵌入层,保留 MLP 层用于中间特征混合,并引入专门的 LarctanKAN 模块用于最终活动分类。在八个公开 HAR 数据集上,混合 KAN-MLP 模型相比纯 MLP 模型实现了 5.33% 的平均宏 F1 分数相对提升,显著优于单独的 KAN 和 MLP 基线。此外,将这种混合策略集成到其他最先进的 HAR 架构中,能持续提升它们的性能。我们的研究结果表明,精心组合 KAN、MLP 或其他常规神经组件,能够为真实世界的可穿戴传感环境生成更鲁棒、更准确的 HAR 模型。
查看缓存全文
缓存时间: 2026/05/20 08:27
# 一种关于利用Kolmogorov–Arnold网络(KANs)改进基于IMU的人类活动识别方法的全面研究 来源:https://arxiv.org/html/2605.19031 \(2009年6月5日\) ###### 摘要。Kolmogorov–Arnold网络(KANs)在干净的、低维数据上展现了出色的学习复杂函数的能力,但在处理含噪声和不完美的真实世界数据集时性能下降。相比之下,传统的多层感知器(MLPs)对噪声的容忍度要高得多,且计算效率更高。在HAR模型中用KANs替换所有MLP组件通常会降低准确率和计算效率,这凸显了一个开放性挑战:如何将KANs的精度与MLPs的噪声鲁棒性和效率结合起来。为解决这一问题,我们系统地探索了KAN模块在深度HAR网络中的各种放置位置,并提出了一种混合架构,该架构策略性地协同利用了两种范式的优势:使用基于KAN的输入嵌入层,保留MLP层用于中间特征混合,并引入一个专门的LarctanKAN模块用于最终活动分类。在八个公开HAR数据集上,混合KAN-MLP模型相比纯MLP模型的平均宏F1分数相对提升了5.33%,显著优于单独的KAN和MLP基线。此外,将这种混合策略集成到其他先进的HAR架构中,也持续提升了它们的性能。我们的研究表明,精心组合KAN、MLP或其他传统神经组件,能够为现实世界的可穿戴传感环境生成更鲁棒、更准确的HAR模型。请勿使用此代码,为您的论文填写正确的术语 ††copyright:acmlicensed††journalyear:2018††doi:XXXXXXX.XXXXXXX††conference:务必从您的权利确认邮件中输入正确的会议标题;2018年6月3-5日;纽约州伍德斯托克††isbn:978-1-4503-XXXX-X/2018/06††ccs:请勿使用此代码为您的论文生成正确的术语††ccs:请勿使用此代码为您的论文生成正确的术语††ccs:请勿使用此代码为您的论文生成正确的术语††ccs:请勿使用此代码为您的论文生成正确的术语## 1.引言
从身体佩戴传感器进行准确的人类活动识别(Human Activity Recognition, HAR)是普适计算的基石,支撑着从智能手表上的个性化健康监测和健身追踪(Abbas et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib2); Yin et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib53))到智能环境中的上下文感知交互(Abdel-Salam et al.,2021 (https://arxiv.org/html/2605.19031#bib.bib3); Bian et al.,2022 (https://arxiv.org/html/2605.19031#bib.bib9))等多种应用。惯性测量单元(Inertial Measurement Units, IMUs)通常嵌入在可穿戴设备中,提供丰富的运动数据。然而,有效利用这些数据具有挑战性:真实世界的IMU信号非常复杂,并且受到噪声、传感器漂移、佩戴位置变化以及受试者间差异的困扰,阻碍了鲁棒、通用HAR系统的开发(Tseng and Wen,2023 (https://arxiv.org/html/2605.19031#bib.bib49))。
深度学习模型已成为解决HAR问题的标准方法,能够自动从传感器数据中学习特征(Chen et al.,2021 (https://arxiv.org/html/2605.19031#bib.bib15))。其中,多层感知器(MLPs)及其变体仍然出奇地有效(Ojiako and Farrahi,2023 (https://arxiv.org/html/2605.19031#bib.bib37); Zhou et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib57))。虽然可能不如CNN或RNN复杂,但MLPs不仅因其表示能力,更重要的是其**对噪声的鲁棒性**和**计算效率**而受到重视(Le et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib29))。这种效率对于部署在电池寿命和处理能力有限的资源受限可穿戴设备上至关重要。事实上,最近的研究表明,纯MLP架构,如为HAR适配的MLP-Mixers和MLPHAR,可以用比更重模型少得多的参数达到最先进或具有竞争力的性能(Ojiako and Farrahi,2023 (https://arxiv.org/html/2605.19031#bib.bib37); Zhou et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib57); Miyoshi et al.,2025 (https://arxiv.org/html/2605.19031#bib.bib36)),使其在可穿戴和普适计算领域非常实用。
最近,Kolmogorov–Arnold网络(KANs)作为一种新型神经网络范式出现,提供了显著的理论潜力(Liu et al.,2024c (https://arxiv.org/html/2605.19031#bib.bib34))。受Kolmogorov-Arnold表示定理的启发,KANs用网络边上的可学习单变量函数替换了MLPs的固定激活和线性权重。这种设计赋予了它们极大的灵活性,使其能够以高保真度逼近复杂函数,通常在干净的、低维的数学或物理任务上超越传统网络(Liu et al.,2024c (https://arxiv.org/html/2605.19031#bib.bib34); Drokin,2024 (https://arxiv.org/html/2605.19031#bib.bib19); Poeta et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib40); Jamali et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib25)),包括用于量子机器学习的新型高效架构(Werner et al.,2025 (https://arxiv.org/html/2605.19031#bib.bib50); Ivashkov et al.,2026 (https://arxiv.org/html/2605.19031#bib.bib24))。然而,将KANs的理论承诺转化为可穿戴传感器数据的混乱现实面临重大障碍。越来越多的证据表明,KANs对**噪声和数据缺陷表现出相当大的敏感性**(Shen et al.,2025 (https://arxiv.org/html/2605.19031#bib.bib44); Cang et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib12); Ibrahum et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib23))。它们复杂的函数拟合机制虽然在处理干净信号时很强大,但似乎容易受到野外采集的IMU数据中固有的可变性和噪声的影响。此外,KANs基于目标函数连续的假设;如果违反这一假设,模型可能无法有效逼近函数(Liu et al.,2024c (https://arxiv.org/html/2605.19031#bib.bib34)),如图1 (https://arxiv.org/html/2605.19031#S1.F1) 所示。正如我们所见,KANs可以更好地拟合平滑周期信号,而MLPs在阶梯函数等决策边界上表现更优。在既定的HAR流程中直接用KANs替换MLPs通常会导致准确率大幅下降,并且由于复杂的样条计算和调优需求,可能抵消可穿戴应用中追求的效率优势(Le et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib29)),包括我们自己的初步发现(见表3 (https://arxiv.org/html/2605.19031#S3.T3))。这给旨在利用前沿架构的HAR研究人员带来了一个关键困境:**我们如何在利用KANs对复杂活动模式的潜在函数逼近能力的同时,又不牺牲对真实世界可穿戴HAR系统至关重要的鲁棒性和计算效率?**
虽然对混合KAN模型的初步探索已经存在(Liu et al.,2024a (https://arxiv.org/html/2605.19031#bib.bib32); Yang and Wang,2024 (https://arxiv.org/html/2605.19031#bib.bib52); Bodner et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib10)),但缺乏系统性的研究来探讨如何最好地将KAN组件集成到专门设计用于有效且高效地处理真实世界传感器流的HAR架构中。为填补这一空白,我们首先在一个强大、高效的纯MLP架构(MLPHAR (Zhou et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib57)))中对策略性地集成KANs及其变体进行了系统的实证研究。我们的分析揭示,KAN模块的放置位置至关重要:它们在初始数据嵌入方面表现出色,但在中间特征混合角色中表现不佳,而特定的变体在分类方面显示出潜力。基于这些见解,我们提出了**KAN-MLP-Mixer**,一种新颖的混合架构,协同结合了以下组件:
- 1. 一个**EfficientKAN**模块用于自适应数据嵌入,选择它是因为能够捕捉输入复杂性同时管理计算开销。
- 2. 标准**MLP层**用于中间特征混合,保留了基线的鲁棒性和效率。
- 3. 一个**LarctanKAN**模块用于分类,选择它是因为其平滑、有界的激活函数可能在最终预测阶段提供更强的抗噪声稳定性。
我们在八个不同的可穿戴和普适HAR数据集上严格评估了KAN-MLP-Mixer。我们的结果表明,这种有针对性的混合方法比鲁棒的MLPHAR基线实现了5.33%的显著平均宏F1分数提升,并且大幅优于天真的全KAN替换策略。本研究的主要贡献如下:
- • 对基于MLP的HAR框架中不同KAN集成策略进行了**系统性实证分析**,识别出在真实世界IMU传感器数据上的性能权衡。
- • 提出了**KAN-MLP-Mixer**,一种新颖的混合架构,专门设计用于在实用HAR中平衡KAN的表达能力与MLP的鲁棒性和效率。
- • 性能提升的实证,表明KAN-MLP-Mixer在八个不同的公开HAR数据集上以平均5.33%的宏F1分数持续优于MLPHAR基线。
- • 提供了证据表明**策略性混合**,而非全面替换,为在普适计算中常见的具有挑战性的真实世界基于传感器的应用中有效利用KANs等先进架构提供了一条可行路径。
- • 将混合设计策略**扩展到不同的神经骨干、窗口大小和传感模态**,证明了通过策略性混合在不同条件下的一致性能提升。
- • 提供了从全面的实证发现中衍生出的**一套实用设计指南**,以指导KANs在基于传感器的HAR任务中的有效应用。
尽管针对更广泛的HAR最新技术进行全面基准测试以及针对设备端部署的详细计算性能分析仍然是重要的未来步骤,但我们的发现为精心构建的KAN-MLP混合体的潜力提供了强有力的证据。这项工作为开发更准确、更鲁棒且最终更实用的、满足下一代可穿戴和移动技术需求的HAR系统铺平了道路。
参阅标题 (a) 在阶梯函数上的预测。LarctanKAN以仅593个参数实现了最低误差(RMSE = 0.018),优于MLP和KAN,后者由于其基于样条的公式化而表现出过冲,并使用5440个参数。这展示了LarctanKAN在建模不连续决策边界方面的优势。
参阅标题 (b) 在平滑周期函数 \(f(x)=\sin(2\pi x)\cos(2\pi x)\) 上的预测。KAN实现了最低RMSE(0.001),精确捕捉了波形。MLP和LarctanKAN由于表达能力有限而欠拟合,突显了KAN在嵌入平滑传感器信号方面的优势。
图1. 模型在代表传感器数据典型特征的合成函数上的预测比较。阶梯函数模拟分类边界,而周期函数模拟连续IMU信号模式。结果突显了我们混合架构的动机:在嵌入层使用KAN,在分类器中使用LarctanKAN。
## 2. 相关工作
表1. KAN变体的比较总结
| KAN类型 | 基函数 | 函数形式 | 主要特征 |
| :--- | :--- | :--- | :--- |
| KAN (Liu et al.,2024c (https://arxiv.org/html/2605.19031#bib.bib34)) | B-样条 | \(\phi(x)=w\left(\text{silu}(x)+\sum_{i}c_{i}B_{i}(x)\right)\) | 高可解释性 |
| EfficientKAN (Cao,2024 (https://arxiv.org/html/2605.19031#bib.bib13)) | B-样条 | \(\phi(x)=w\left(\text{silu}(x)+\sum_{i}c_{i}B_{i}(x)\right)\) | GPU优化,内存高效 |
| FastKAN (Li,2024 (https://arxiv.org/html/2605.19031#bib.bib30)) | 高斯RBF | \(\phi(x)=\sum_{i=1}^{K}c_{i}\exp\left(-\frac{(x-\mu_{i})^{2}}{2\sigma^{2}}\right)\) | 计算快速 |
| WavKAN (Bozorgasl and Chen,[[n.d.]](https://arxiv.org/html/2605.19031#bib.bib11)) | 小波 | \(\phi(x)=\sum_{j=0}^{J}\sum_{k=0}^{2^{j}-1}w_{j,k}\psi_{j,k}(x)\) | 多分辨率分析 |
| FourierKAN (Xu et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib51)) | 正弦和余弦 | \(\phi(x)=\sum_{k=1}^{g}(a_{k}\cos(kx)+b_{k}\sin(kx))\) | 平滑且可微 |
| LarctanKAN (Chen and Zhang,2024a (https://arxiv.org/html/2605.19031#bib.bib16)) | Arctan | \(\phi(x;k)=\arctan(kx)\) | 紧凑、高效的激活 |
| MLP | – | \(\phi(x)=f_{act}(Wx+b)\) | 简单,广泛使用 |
本节回顾与我们工作相关的先前研究,重点关注KANs、MLPs在HAR中的作用以及该领域混合架构的演变。
### 2.1. Kolmogorov–Arnold网络(KANs):潜力与挑战
KANs受Kolmogorov–Arnold表示定理(Kolmogorov,1957 (https://arxiv.org/html/2605.19031#bib.bib28); Arnold,1963 (https://arxiv.org/html/2605.19031#bib.bib5),2009 (https://arxiv.org/html/2605.19031#bib.bib6))启发,代表了神经网络设计的最新转变(Liu et al.,2024c (https://arxiv.org/html/2605.19031#bib.bib34))。KANs不在节点处使用固定激活,而是在网络边上采用可学习的单变量函数(通常是样条)。这赋予了它们显著的理论表达能力,使其能够精确逼近复杂函数,有时比传统MLPs使用更少的参数,特别是在诸如符号回归或物理建模等干净、结构良好的任务上(Liu et al.,2024c (https://arxiv.org/html/2605.19031#bib.bib34); Toscano et al.,2025 (https://arxiv.org/html/2605.19031#bib.bib48); Liu et al.,2024b (https://arxiv.org/html/2605.19031#bib.bib33); Koenig et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib27); Genet and Inzirillo,2024 (https://arxiv.org/html/2605.19031#bib.bib22))。这种捕捉复杂关系的潜力对于从传感器数据中建模复杂的人体运动模式很有吸引力。
然而,从理论承诺到普适计算中的实际应用面临着障碍。KANs依赖于精细的可学习激活函数,使得它们对噪声和数据不规则性敏感(Somvanshi et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib45); Shen et al.,2025 (https://arxiv.org/html/2605.19031#bib.bib44); Cang et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib12))。这种敏感性对于可穿戴传感器HAR是一个主要问题,因为IMU信号由于现实世界条件而固有地存在噪声和变化性(Tseng and Wen,2023 (https://arxiv.org/html/2605.19031#bib.bib49))。此外,与训练和评估基于样条的KANs相关的计算开销可能很大(Le et al.,2024 (https://arxiv.org/html/2605.19031#bib.bib29)),可能与可穿戴设备的严格资源约束(功耗、内存、计算)相冲突。正在进行的研究旨在通过EfficientKAN(Cao,2024 (https://arxiv.相似文章
面向小语言模型的Kolmogorov--Arnold网络
本文评估了Kolmogorov--Arnold网络(KAN)作为可解释组件以及Transformer前馈网络在小语言模型中的替代方案,发现虽然KAN提供了实用的审计接口,但与MLP基线相比,它们并未显示出持续一致的基准优势。
统计优势是否值得付出成本?KAN与MLP在结构化数据分类上的实证比较
本研究对Kolmogorov-Arnold网络(KANs)和多层感知器(MLPs)在结构化表格分类任务上进行了实证比较,发现KANs在统计上优于MLPs,但计算成本更高。
Kolmogorov--Arnold网络在硬约束循环物理信息模型中的嵌入式RISC-V评估
本文在嵌入式RISC-V平台上评估了Kolmogorov–Arnold网络(KAN)与MLP作为硬约束循环物理信息网络中残差分支的性能,发现KAN运行更慢、能耗更高,且在INT8量化下可靠性较低。
通过Kolmogorov-Arnold网络在FPGA上实现超快机器学习
本文介绍了作者的硕士论文,该论文利用Kolmogorov-Arnold网络(KAN)在FPGA上实现超快机器学习,通过自定义硬件架构实现亚微秒级推理和在线学习。文章引用了两篇已接收的论文:基于LUT评估的KANELÉ(FPGA 2026最佳论文奖)以及一种在FPGA上进行在线学习的方法(ICML 2026)。
[R] SineKAN:基于正弦激活函数的Kolmogorov-Arnold网络
SineKAN 提出了一种基于正弦激活函数的 Kolmogorov-Arnold 网络变体,在基准任务上,与基线 KAN 模型相比,显示出相当或更好的性能,并有显著的速度提升。