面向小语言模型的Kolmogorov--Arnold网络
摘要
本文评估了Kolmogorov--Arnold网络(KAN)作为可解释组件以及Transformer前馈网络在小语言模型中的替代方案,发现虽然KAN提供了实用的审计接口,但与MLP基线相比,它们并未显示出持续一致的基准优势。
arXiv:2607.15525v1 公告类型:交叉\n摘要:Kolmogorov--Arnold网络(KAN)用学习到的一维边缘函数替换固定节点激活,提供了明确的解释接口,并成为Transformer前馈网络的可能替代方案。我们分别验证了这些主张。在一个六层、10M参数的B样条KAN中,我们重建了所有884,736个前馈边缘:87.8\%超过(NLS>0.1),0.4\%处于非活跃状态。剪除最低活跃度的20–25\%会导致损失增加可忽略不计,尽管结构化MLP神经元剪枝可容忍类似的稀疏性。该审计在BabyLM上复现,但网格尺寸扫描显示,近乎完全的fPCA压缩和高闭式拟合覆盖率是低容量grid-2基的性质,并非KAN的普遍行为。对于替代方案,我们在BabyLM上评估了MLP、SwiGLU、分组Chebyshev和有理GR-KAN网络。KAN系列和门控变体在验证损失上优于GELU MLP,但这种排序并未迁移到标准化基准上:在十个种子和59,875个BLiMP对中,准确率落在62.4–63.1\%之间,EWoK仍处于随机水平,而GR-KAN在BLiMP上的(+0.7)点效应在补充测试中发生逆转。更大规模的测试也值得警惕:参数匹配的MLPEdge在Wikitext-103上表现不如MLP,而286M参数的GR-KAN在稳定后仍低于SwiGLU ClimbMix基线。因此,小基KAN提供了一个实用且可跨语料迁移的接口,用于审计学习的标量变换,但所测试的替代方案在强MLP基线上并未显示出持续一致的基准、质量或延迟优势。
查看缓存全文
缓存时间: 2026/07/20 09:26
# Kolmogorov–Arnold 网络用于小语言模型 来源: https://arxiv.org/html/2607.15525
Felippe Alves
TELUS 数字研究中心 – CIAAM
数学、统计与计算机科学研究所
圣保罗大学
felippe\.pereira@usp\.br
Renato Vicente
TELUS 数字研究中心 – CIAAM
数学、统计与计算机科学研究所
圣保罗大学
rvicente@usp\.br
###### 摘要
Kolmogorov–Arnold 网络(KANs)用学习到的一维边函数替代了固定的节点激活函数,这使得它们既可作为可解释组件,也可作为 Transformer 前馈网络的潜在替代方案而具有吸引力。我们分别评估了这两个前提。关于可解释性,在一个六层、约 1000 万参数的 B 样条 KAN 中,所有 884,736 个前馈边函数都可以被重建并按活跃度排序:大多数是活跃且非线性的(87.8% 超过非线性阈值 NLS > 0.1,仅 0.4% 是非活跃的),且最低活跃度 20–25% 的边可以被剪枝,验证损失增加可忽略不计,远优于随机剪枝——尽管一个结构化的 MLP 神经元剪枝基线也能容忍类似的稀疏度,因此优雅的 FFN 剪枝并非 KAN 独有。网格尺寸扫描显示,最强的功能主成分分析和闭式拟合摘要特性是低容量网格-2 基(那里每条边函数空间只有六维)的属性,而非 KAN 的普遍行为;完整的审计在 BabyLM 网格-2 KAN 上重现,表明边统计量并非特定于一个语料库。关于替代前提,我们从狭窄的自定义语料库转向标准化测试平台,未发现一致的基准优势。在 BabyLM 验证损失上,门控和 KAN 家族前馈网络(SwiGLU、分组切比雪夫、rationalGR-KAN)均略优于普通的 GELU MLP。然而,在标准化零样本基准上,本研究的精度下各架构在基准上等价:跨十个随机种子和 59,875 个 BLiMP 最小对比对,准确率仅覆盖 62.4–63.1% 且置信区间重叠;EWoK 对所有模型均接近随机水平;唯一稳健的效果——主要 BLiMP 套件上 GR-KAN 领先 +0.7 个百分点——在 BLiMP 补充集上反转,那里 MLP 最高。验证交叉熵不能预测基准排名。更大规模的应力测试仍具警示性:参数匹配的 MLPEdge Transformer 在 Wikitext-103 上表现不如 MLP;修正后的 2.86 亿参数 GR-KAN 运行即使在稳定延续后仍低于 SwiGLU MLP ClimbMix 基线。因此,最强有力的结论范围虽窄但已标准化:KAN 为小型语言模型中的学习到的标量变换提供了一个实用且可跨语料库迁移的审计接口,而测试的 KAN 家族替代品在标准化基准、质量和延迟上,与强 MLP 基线相比未显示一致优势——且与之在基准上等价。
问题:KAN 前馈块能制造可用的语言模型吗?
边审计:884,736 个重建的标量函数
标准化替换测试:BabyLM BLiMP/EWoK,n = 10 个种子,MLP/SwiGLU/Chebyshev/GR-KAN
规模应力测试:GPT-2-small MLPEdge 和 2.86 亿 rational GR-KAN
答案:可解释且对诊断有用;在标准化测试上无一致基准优势;无替换胜出
图 1:图形摘要。本研究将可解释性主张与替换主张分开。在小语言模型中,KAN 的边函数可以重建并全面总结。在带有十个种子和公开评估流程的标准化 BabyLM 测试平台上,测试的 KAN 家族前馈网络在 BLiMP 和 EWoK 上相对于强 MLP 基线未显示一致基准优势,且更大规模的应力测试仍具警示性。
## 1 引言
Transformer 语言模型依赖前馈子层,这些子层在注意力之后展开、变换和压缩每个 token 表示[1](https://arxiv.org/html/2607.15525#bib.bib1)。这些块通常实现为具有固定非线性的稠密仿射映射,因此速度快且理解充分,但在标量计算层面难以检验。Kolmogorov–Arnold 网络提供了一种不同的设计点:KAN 不是在每个隐藏单元应用固定激活函数,而是在单元之间的边上学习单变量函数[4](https://arxiv.org/html/2607.15525#bib.bib4)。这赋予了架构显式的函数分解,原则上可以使内部计算更容易重建、剪枝或符号化总结。核心问题是,当 KAN 被置于语言模型内部时,这种可解释性前提是否仍然有用,以及它是否带来足够的预测或效率优势,以证明用其替换标准 MLP 前馈块是合理的。答案并非由先前的 KAN 工作隐含得出。KAN 的原始证据在科学回归和符号发现任务上最强[4](https://arxiv.org/html/2607.15525#bib.bib4), [5](https://arxiv.org/html/2607.15525#bib.bib5);KAN 变体调查确定了许多基函数族和工程缺口,但并非受控的语言模型边函数审计[7](https://arxiv.org/html/2607.15525#bib.bib7), [8](https://arxiv.org/html/2607.15525#bib.bib8)。Kolmogorov–Arnold Transformer 工作表明,分组的 rational KAN 单元可以在视觉 Transformer 中成功替换 MLP 块[6](https://arxiv.org/html/2607.15525#bib.bib6),但图像分类在激活统计量、序列长度、优化目标和吞吐量瓶颈方面与 token 预测不同。我们围绕三个具体问题提出实证评估。第一,语言模型中学习到的 KAN 边函数能否被重建并全面分析,而不仅仅是轶事式抽样?第二,当 KAN 式的前馈替换在带有足够种子的标准化小语言模型基准上进行评估时,它们在验证损失、标准化语言能力基准或延迟上是否优于强 MLP 基线?第三,有希望的小规模变体能通过更强的规模测试吗?由此产生的图景是刻意保守的。KAN 作为可解释性工具是有用的,因为它们的标量边函数可以在完整小模型层面上进行测量,并揭示低维平滑结构。作为通用的 MLP 替换,标准化证据指向 *无一致优势*:在 BabyLM Strict-Small 基准上,测试的 KAN 家族和门控 MLP 前馈网络与本研究的精度下普通 MLP 在基准上等价——BLiMP 和 EWoK 上的差异在 1 个百分点以内,十个种子的置信区间重叠,且唯一稳健的主要 BLiMP 效果在补充集上反转。伴随一个启发性的负面结果:验证交叉熵 *不* 能预测基准排名,因此这些变体相对于普通 MLP 表现出的微小验证损失优势并未转化为标准化基准的增益。测试的较大规模 MLPEdge 和修正后的 GR-KAN 配置同样落后于匹配的 MLP 对照,或在稳定化后仍低于可用的 MLP 端点。
## 2 相关工作
#### KAN 及高效变体。原始的 KAN 架构使用学习到的 B 样条边激活,并激发了用于科学发现的剪枝-符号化流程[4](https://arxiv.org/html/2607.15525#bib.bib4)。KAN 2.0 通过乘法节点、树转换以及从符号公式到 KAN 权重的编译器扩展了这一方向[5](https://arxiv.org/html/2607.15525#bib.bib5)。这些论文确立了可解释性动机,但并未测量边函数在 Transformer 语言模型内部学习到什么。后来的调查和实践指南将设计空间扩展到 FastKAN 式的高斯/RBF 基、有理 KAN、傅里叶和小波基、多项式基以及紧支撑变体[7](https://arxiv.org/html/2607.15525#bib.bib7), [8](https://arxiv.org/html/2607.15525#bib.bib8)。诸如 FastKAN[11](https://arxiv.org/html/2607.15525#bib.bib11) 和 EfficientKAN[10](https://arxiv.org/html/2607.15525#bib.bib10) 等高效实现用闭式基评估替换了 B 样条递归,在保持边向可解释性的同时弥补了部分 GPU 效率差距。Wav-KAN[12](https://arxiv.org/html/2607.15525#bib.bib12) 引入了小波基,为信号类数据提供局部多分辨率分析。这些变体识别了朴素 B 样条 KAN 的持续 GPU 效率差距:不规则的基评估和大的边函数张量可能使参数匹配的 KAN 比稠密 MLP 慢得多。这激发了我们的基函数筛选以及我们对参数匹配声明与计算感知声明的分离。
#### 有理和分组 KAN。Kolmogorov–Arnold Transformer (KAT) 用多项式递归评估的分组共享有理激活替换 B 样条,并在参数/FLOP 预算匹配的情况下报告了 ImageNet 的强结果[6](https://arxiv.org/html/2607.15525#bib.bib6)。这使得 rational GR-KAN 成为语言模型 FFN 替换的自然候选。然而,KAT 评估的是视觉 Transformer 而非自回归 token 预测器。语言模型对内存带宽、激活异常值、序列长度和基准敏感性施加了不同的压力。因此,我们修正后的 GR-KAN 规模运行应被视为对源自视觉的有前景想法进行语言特定压力测试,而非对图像分类证据的否定。更广泛的有理 KAN 文献,包括 rKAN 的 Padé 和有理-雅可比基[13](https://arxiv.org/html/2607.15525#bib.bib13),表明将分母参数化视为实现关键的细节,而非偶然的编码选择。
#### 基函数选择与小语言模型评估。高斯/RBF KAN 变体很有吸引力,因为它们保留了局部标量函数且无需 B 样条递归,但尺度选择本身是一个超参数:过宽的高斯基会使第一层特征矩阵坍缩,而过窄的基会导致欠平滑[9](https://arxiv.org/html/2607.15525#bib.bib9)。切比雪夫多项式 KAN 提供了递归友好的替代方案,具有全局支持和简单的 GPU 内核[14](https://arxiv.org/html/2607.15525#bib.bib14)。我们包含非样条基,因为公平的语言模型研究不应将 B 样条视为唯一的 KAN 实现。小语言模型的证据也对数据集、分词器、目标和评估框架敏感。DataComp-LM 强调用于语言模型比较的受控语料库和评估设计[24](https://arxiv.org/html/2607.15525#bib.bib24);nanochat 式实验同样将数据混合、分词器谱系和下游 CORE 评估视为一等实验工件[25](https://arxiv.org/html/2607.15525#bib.bib25)。BabyLM 和 TinyStories 基准表明,当评估与训练分布匹配时,领域特定的小语料库可以产生出奇强的迁移[26](https://arxiv.org/html/2607.15525#bib.bib26), [27](https://arxiv.org/html/2607.15525#bib.bib27)。TinyLlama[31](https://arxiv.org/html/2607.15525#bib.bib31)、MiniCPM[32](https://arxiv.org/html/2607.15525#bib.bib32) 和 OLMo[33](https://arxiv.org/html/2607.15525#bib.bib33) 建立了具有透明训练流程的强开放小语言模型基线,使其成为任何声称改进小规模稠密 Transformer 架构的有用参考点。
#### MLP 基线与可解释性。现代 Transformer 的 FFN 不仅仅是通用的稠密层:GELU、SwiGLU 及相关 GLU 变体是将表达能力与高效稠密内核相结合的强基线[15](https://arxiv.org/html/2607.15525#bib.bib15)。特别是 SwiGLU 已成为大规模生产模型中的默认 FFN,因为它在匹配参数预算下优于 GELU[16](https://arxiv.org/html/2607.15525#bib.bib16), [17](https://arxiv.org/html/2607.15525#bib.bib17)。因此,替换声明必须在质量和吞吐量上都胜出,而不仅仅是参数数量。最近关于 Transformer FFN 可解释性的工作表明,单个 MLP 神经元表现出多语义性和叠加,使得单神经元解释变得困难[18](https://arxiv.org/html/2607.15525#bib.bib18), [19](https://arxiv.org/html/2607.15525#bib.bib19)。替代方法将 FFN 层分解为可解释的基方向或稀疏特征字典[20](https://arxiv.org/html/2607.15525#bib.bib20), [21](https://arxiv.org/html/2607.15525#bib.bib21)。KAN 提供了不同的分解:不是隐藏单元的多语义性,而是暴露了可直接可视化和曲线拟合的显式标量边函数。关于加法模型的可解释性工作表明,当范围和假设明确时,学习到的标量函数可能是有用的[22](https://arxiv.org/html/2607.15525#bib.bib22)。KAN 提供了比标准神经加法模型更丰富的边级分解,但高保真度的曲线拟合不应被误认为符号定律。因此,我们将闭式拟合描述为在观察到的激活域上的可近似性,而非完整的符号回归;更强的声明需要像 PySR 这样的语法搜索和留出域测试[23](https://arxiv.org/html/2607.15525#bib.bib23)。
## 3 方法
### 3.1 研究设计与模型系列
我们在四个阶段评估了 KAN 式前馈层:(i) 在 GuppyLM 规模上进行受控局部比较和可解释性来源分析,(ii) 在 BabyLM Strict-Small 上进行标准化替换基准测试,(iii) 对 GuppyLM B 样条 KAN 进行穷举边函数重建,以及 (iv) 更大规模的应力测试。
第一阶段使用 GuppyLM,这是一个基于 arman-bd/guppylm-60k-generic[34](https://arxiv.org/html/2607.15525#bib.bib34)(一个包含 60,000 条鱼个性描述语料的)小规模指令-响应语言模型测试平台。分词器是一个项目 BPE 分词器,词汇量 2,393,最大序列长度 128。模型有六层 Transformer,隐藏维度 384,六个注意力头。训练使用仅助手 token 损失:提示目标设为 −100 并被交叉熵忽略,这对于避免角色标记泄漏至关重要,并且解释了为什么验证交叉熵相对于普通的全 token 语言建模数值较低。所有主要 GuppyLM 行使用 8,000 优化步、批大小 32、AdamW、余弦学习率衰减、200 预热步、梯度裁剪以及种子 {42,43,44}。训练划分包含 57,000 个示例,测试划分包含 3,000 个示例。经过截断和移位后,训练划分包含 1,506,006 个非填充输入位置和 860,389 个助手目标 token;测试划分包含 79,231 个输入位置和 45,193 个助手目标 token。模拟实际的 8,000 步数据加载器,每次运行采样 255,904 个示例,种子 42–44 跨约 3.862–3.864M 个助手目标 token。这些计数清楚地表明 GuppyLM 是一个小规模的可解释性测试平台,而非广泛的开放网页预训练基准。
GuppyLM 模型系列被选择用于分离拓扑结构与基函数选择。MLP 基线使用标准的四倍扩展 GELU 前馈块。B 样条 KAN 行使用网格大小为 2 的显式学习样条边函数。KAT 式行将 B 样条前馈层与基于 KAN 的注意力投影相结合,因此并非仅 FFN 隔离。MLPEdge 保留了加性边函数拓扑,但将每个样条替换为一个小型标量 MLP。修正... (译文继续)相似文章
统计优势是否值得付出成本?KAN与MLP在结构化数据分类上的实证比较
本研究对Kolmogorov-Arnold网络(KANs)和多层感知器(MLPs)在结构化表格分类任务上进行了实证比较,发现KANs在统计上优于MLPs,但计算成本更高。
几何科爾莫戈羅夫-阿諾德網絡 (GeoKAN)
本文介紹了幾何科爾莫戈羅夫-阿諾德網絡 (GeoKAN),這是一個幾何感知模型家族,通過學習黎曼度量來適應坐標,從而實現更優函數近似和物理感知學習。
通过Kolmogorov-Arnold网络在FPGA上实现超快机器学习
本文介绍了作者的硕士论文,该论文利用Kolmogorov-Arnold网络(KAN)在FPGA上实现超快机器学习,通过自定义硬件架构实现亚微秒级推理和在线学习。文章引用了两篇已接收的论文:基于LUT评估的KANELÉ(FPGA 2026最佳论文奖)以及一种在FPGA上进行在线学习的方法(ICML 2026)。
KAN-MLP-Mixer: 关于使用 Kolmogorov-Arnold Networks (KANs) 改进基于 IMU 的人类活动识别的全面研究
本文系统地探索了混合 KAN 和 MLP 架构用于基于 IMU 的人类活动识别,相比纯 MLP 基线实现了 5.33% 的平均宏 F1 改进。
STKAN:用于时空预测的Kolmogorov-Arnold Networks
本文介绍了STKAN,一种集成泰勒多项式Kolmogorov-Arnold网络模块以实现空间和时间令牌混合的时空预测架构。在五个交通基准上的实验显示出竞争性表现,表明非线性函数逼近器可以补充架构设计。