Spectral Neuron - 一种用于可扩展且可解释模型的机器学习原语 [R]

Reddit r/MachineLearning 论文

摘要

本文提出了一种新的机器学习原语,称为 Spectral Neuron,提供了一个简单、可扩展且可解释的模型,并具有训练和初始化的数学基础。

之前曾在 Yahoo 的一个广告团队工作,这源于我一直反复思考的一个问题:是否存在既简单、可扩展、可解释,又可控的“简单”模型?决定探索这个问题,首先在博客中(从这里开始),然后在新的预印本《The Spectral Neuron》中,通过将最新的博客文章提炼成手稿来构建。我研究形式为:𝑓(𝒙) = 𝛌ₖ(𝐀₀ + 𝚺ᵢ 𝑥ᵢ𝐀ᵢ) 的模型。手稿:https://arxiv.org/abs/2608.08003 代码:https://github.com/alexshtf/spectral_neuron_paper 看起来像是一个简单的一行代码,但其中隐藏着许多有趣的方面。随着矩阵的增长,模型变得有多强大?我们能从学习到的矩阵中直接读出什么?通过构造可以保证哪些形状?我发展了数学理论,提供了实用的初始化和训练方案,并在合成数据和真实数据上进行了扩展实验测试模型。AI 免责声明:手稿由本人撰写,AI 协助查找规范引用和相关工作以进行文献综述。相比之下,代码大量由 AI 编写,并由本人审阅。
查看原文

相似文章

Muon优化器的谱缩放定律

arXiv cs.LG

本文首次系统研究了大语言模型训练过程中Muon优化器动量矩阵奇异值谱的行为规律,发现了在不同模型规模(77M至2.8B参数)下清晰的幂律缩放关系。研究结果为从业者提供了有理论依据、感知层级的Newton–Schulz迭代配置指南,在前沿规模下无需额外计算即可保持正交归一化质量。

神经网络可证明地学习群组合的谱表示

Hugging Face Daily Papers

本文提供了神经网络在群组合任务中学习结构化表示的理论分析,证明了训练动态驱动神经元以指数收敛速度收敛到不可约群表示。该工作建立了特征学习的表示理论解释,并刻画了矩阵值群表示的低秩压缩现象。

通过稀疏电路理解神经网络

OpenAI Blog

OpenAI 研究人员提出了一种训练稀疏神经网络的方法,通过强制大部分权重为零使其更易于解释,从而发现能够解释模型行为的小型解耦电路,同时保持性能。这项工作旨在推进机制可解释性,作为对稠密网络事后分析的补充,并支持 AI 安全目标。