你只需要SAMPAT
摘要
SAMPAT是一种三层神经架构,能够通过闭式代数表达式学习平滑、可解释的函数,在保持完全可解释性的同时提供有竞争力的性能。
arXiv:2607.09235v1 公告类型:新
摘要:当前AI/ML领域的最先进技术基于深度神经架构,但这些架构普遍缺乏可解释性。可解释性对于从实验数据中提取洞见至关重要,因为量化预测可能不足以满足科学家的需求。我们提出了一种三层神经架构SAMPAT(通过多元多项式和解析变换的平滑逼近),它能够可证明地学习一个连续、处处可微的函数,并可任意逼近任何光滑函数。SAMPAT的逼近函数可以表示为封闭且紧凑的代数、解析表达式,从而提供完全的可解释性。在合成数据集和基准数据集上的实验表明,SAMPAT以更简洁的表示取得了有竞争力的性能。对于许多任务,两层SAMPAT就足够了。通过对神经元之间的连接施加限制,SAMPAT可以用于提供一系列逼近函数,包括常规多项式和三角多项式、有理表达式、高斯函数、高斯混合以及这些函数的任意组合;在没有限制的情况下,它会学习合适的结构。SAMPAT还可用于因式分解多项式和对非线性系统建模。通过添加跳跃连接,4到6层SAMPAT足以表示AI/ML中广泛使用的大量方法,从而允许在学习过程中优化模型族的选择,而不仅仅是其参数。
查看缓存全文
缓存时间: 2026/07/13 07:59
# 你所需要的一切就是SAMPAT
来源:https://arxiv.org/html/2607.09235
Jayadeva 和 Madhur Aswani 电气工程系,印度理工学院德里分校
###### 摘要
当前人工智能/机器学习的最新技术依赖于深度神经网络架构,这些架构通常缺乏可解释性。在分析实验数据时,可解释性对于提取洞见至关重要,因为定量预测可能不足以满足科学家的需求。我们提出了一种三层神经网络架构——SAMPAT(通过多元多项式与解析变换的平滑逼近),它能够可证明地学习一个连续、处处可微的函数,并且可以任意接近任何光滑函数。SAMPAT的逼近器可以表示为一个封闭且紧凑的代数、解析表达式,从而提供完全的可解释性。在合成数据集和基准数据集上的实验表明,SAMPAT能以更简洁的表示取得有竞争力的性能。对于许多任务,两层SAMPAT就足够了。通过对神经元之间连接施加限制,SAMPAT可用于提供一系列逼近器,包括正则多项式与三角多项式、有理表达式、高斯函数、高斯混合模型,以及上述函数的任意组合;在不加限制时,它能够学习出合适的结构。SAMPAT可用于多项式分解和对非线性系统建模。通过添加跳跃连接,一个4到6层的SAMPAT足以表示AI/ML中广泛使用的相当一部分方法,从而允许在学习过程中不仅优化模型的参数,还能优化模型族的选择。
††publicationid:pubid: 0000–0000/00\$00.00 © 2021 IEEE
## I 引言
众所周知,三层神经网络可以学习任何平滑的输入-输出映射。关于存在性证明已有大量工作[4 (https://arxiv.org/html/2607.09235#bib.bib16)]。其中大部分涉及单位nn维立方体上的函数。然而,为给定任务构建三层网络一直难以实现,大多数训练好的网络都是准确的黑箱预测器。我们提出了SAMPAT(利用多元多项式与解析变换的平滑逼近),一种三层神经网络架构,有助于构建可解释模型及其分析。图1 (https://arxiv.org/html/2607.09235#S1.F1) 描述了基本的SAMPAT架构。
参照图注
图 1:基本SAMPAT架构
第1层神经元的输入记为x1x\_\{1\},x2x\_\{2\},... xnx\_\{n\}或xix\_\{i\},i=1,i=1,2, ..., nn。连接输入xjx\_\{j\}到第ii个第一层神经元的权值为uiju\_\{ij\};这种记法约定目标ii是下标的首字母,jj是来源。第ii个第一层神经元的净输入neti1net^\{1\}\_\{i\}由下式给出
neti1=∑j=1nuijxj\+bi\\displaystyle net^\{1\}\_\{i\}=\\sum\_\{j=1\}^\{n\}~u\_\{ij\}x\_\{j\}\+b\_\{i\}\(1\)
其中bib\_\{i\}是加到加权和上的偏置项。不失一般性,我们假设输入中包含一个取值为1的常数输入;与此输入相关联的权值为bib\_\{i\},作用相同。因此,除非必要,我们将省略偏置项以使记法和描述更简便。第一层神经元采用对数激活函数。第ii个第一层神经元的输出记为yiy\_\{i\},由下式给出
yi=log\(neti1\)=log\(∑j=1nuijxj\)\\displaystyle y\_\{i\}=log\(net^\{1\}\_\{i\}\)=log\(\\sum\_\{j=1\}^\{n\}~u\_\{ij\}x\_\{j\}\)\(2\)对数的底通常为e≈2.71828e\\approx 2.71828,但在数字电路实现中,底为2更为理想。注意log2\(neti1\)=loge\(neti1\)loge\(2\)log\_\{2\}\(net^\{1\}\_\{i\}\)=\\frac\{log\_\{e\}\(net^\{1\}\_\{i\}\)\}\{log\_\{e\}\(2\)\},而loge\(neti1\)=log2\(neti1\)log2\(e\)log\_\{e\}\(net^\{1\}\_\{i\}\)=\\frac\{log\_\{2\}\(net^\{1\}\_\{i\}\)\}\{log\_\{2\}\(e\)\},这意味着改变底等价于一个增益项。第2层神经元接收第1层输出的加权和。从第1层第ii个神经元到第2层第kk个神经元的连接权值记为vkiv\_\{ki\}。第2层第kk个神经元的净输入记为netk2net^\{2\}\_\{k\},由下式给出
netk2=∑i=1Avkiyi=∑i=1Avkilog\(∑j=1nuijxj\)=∑i=1Alog\(∑j=1nuijxj\)vki=log\(∏i=1A\(∑j=1nuijxj\)vki\)\\displaystyle net^\{2\}\_\{k\}=\\sum\_\{i=1\}^\{A\}~v\_\{ki\}y\_\{i\}=\\sum\_\{i=1\}^\{A\}~v\_\{ki\}~log\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\\right\)=\\sum\_\{i=1\}^\{A\}~log\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\\right\)^\{v\_\{ki\}\}=log\\left\(\\prod\_\{i=1\}^\{A\}~\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\\right\)^\{v\_\{ki\}\}\\right\)\(3\)其中偏置项已被隐含包含。第二层神经元采用指数激活函数。第kk个第2层神经元的输出记为zkz\_\{k\},由basenetk2base^\{net^\{2\}\_\{k\}\}给出,其中“base”与第1层对数所用的底相同。该底同样通常为ee。因此,
zk=exp\(netk2\)=exp\(log\(∏i=1A\(∑j=1nuijxj\)vki\)\)=∏i=1A\(∑j=1nuijxj\)vki\\displaystyle z\_\{k\}~=~exp\(net^\{2\}\_\{k\}\)=exp\\left\(log\\left\(\\prod\_\{i=1\}^\{A\}~\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\\right\)^\{v\_\{ki\}\}\\right\)\\right\)=\\prod\_\{i=1\}^\{A\}~\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\\right\)^\{v\_\{ki\}\}\(4\)
第kk个第二层神经元的输出是一个可约多项式,由第一层输入的多项式乘积构成。单变量的可约多项式构成所有多项式集合的一个稠密子集,也构成所有光滑函数集合的一个稠密子集。因此,两层SAMPAT网络能够对任何单变量连续函数进行通用逼近,因为总可以找到一个多项式以任意所需的精度逼近该光滑函数。然而,多元可约多项式的集合是多元多项式族的一个稀疏子集,而多元不可约多项式的集合则是多项式集合及多元连续函数集合的一个稠密子集。由于任何不可约多项式都可以表示为可约多项式的线性组合,因此任何不可约多项式都可以通过使用第三层来计算,该层对第二层计算出的可约多项式进行线性组合。第ll个第三层神经元的输入是第二层神经元输出的加权和,由下式给出
netl3=∑k=1Bwlkzk=∑k=1Bwlk∏i=1A\(∑j=1nuijxj\)vki,l=1,2,...,C.\\displaystyle net^\{3\}\_\{l\}=\\sum\_\{k=1\}^\{B\}~w\_\{lk\}z\_\{k\}=\\sum\_\{k=1\}^\{B\}~w\_\{lk\}\\prod\_\{i=1\}^\{A\}~\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\\right\)^\{v\_\{ki\}\},\\;l=1,2,\.\.\.,C.\(5\)其中我们再次假设任何偏置项由一个恒为常数的第三层输入表示,其关联的权值等于偏置项。第ll个第三层神经元的输出由下式给出
tl=act\(netl3\)=act\(∑k=1Bwlkzk\)=act\(∑k=1Bwlk∏i=1A\(∑j=1nuijxj\)vki\),l=1,2,...,C.\\displaystyle t\_\{l\}=act\(net^\{3\}\_\{l\}\)=act\\left\(\\sum\_\{k=1\}^\{B\}~w\_\{lk\}z\_\{k\}\\right\)=act\\left\(\\sum\_\{k=1\}^\{B\}~w\_\{lk\}\\prod\_\{i=1\}^\{A\}~\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\\right\)^\{v\_\{ki\}\}\\right\),\\;l=1,2,\.\.\.,C.\(6\)其中act\(\)act\(\)是第三层神经元的激活函数。在回归任务中,act\(\)act\(\)通常为恒等函数或线性函数,即act\(input\)=inputact\(input\)=input,或act\(input\)=gain⋅inputact\(input\)=gain\\cdot input。
因此,每个第三层SAMPAT神经元可以表示任何多元多项式,无论可约还是不可约。扩展的Stone-Weierstrass定理指出,任何连续多元函数都可以通过一个足够高次的多元多项式任意逼近。因此,通过为三层选择适当的权值,一个三层SAMPAT网络可以以任意所需的精度逼近任何函数。由于多项式是解析函数,可以微分任意多次,这意味着SAMPAT表示能够提供所有导数及偏导数。所有SAMPAT表示都可以用代数形式表达。简而言之,三层SAMPAT具有通用逼近能力,能够提供所有导数及偏导数,并且网络中任何神经元都完全可解释。log\(\)log\(\)函数不接受零参数,而负参数如果表示为涉及复变量的极形式则不会构成障碍,即log\(‖r‖eiθ\)=log\(‖r‖\)\+c.p.v.\(iθ\)log\(\\\|r\\\|e^\{i\\theta\}\)=log\(\\\|r\\\|\)\+c.p.v.\(i\\theta\),其中c.p.v.c.p.v.表示柯西主值。在方法部分,我们将更详细地讨论这些方面,包括如何在不使用复数运算的情况下计算实值逼近器。
(a)sin\(x\)sin\(x\)
≈1.8⋅\(1.35x\+0.29\)0.31−1.28\\approx 1.8\\cdot\(1.35x\+0.29\)^\{0.31\}\-1.28
≈0.67\+1.56\(1.77x\)0.39−1.69\(1.77x\)0.13\\approx\{0.67\+1.56\\left\(1.77x\\right\)^\{0.39\}\-1.69\\left\(1.77x\\right\)^\{0.13\}\}参照图注(b)\(x1−2x2\+3x3\)0.5\(4x4\+5x5−6x6\)3\\frac\{\(x\_\{1\}\-2x\_\{2\}\+3x\_\{3\}\)^\{0.5\}\}\{\(4x\_\{4\}\+5x\_\{5\}\-6x\_\{6\}\)^\{3\}\}
参照图注(c)2\(x1−2x2\+3x3\)\(4x4\+5x5−6x6\)\+3\(3x1\+4x2−5x3\)\(x4\+3x5\+5x6\)22\\frac\{\(x\_\{1\}\-2x\_\{2\}\+3x\_\{3\}\)\}\{\(4x\_\{4\}\+5x\_\{5\}\-6x\_\{6\}\)\}\+3\\frac\{\(3x\_\{1\}\+4x\_\{2\}\-5x\_\{3\}\)\}\{\(x\_\{4\}\+3x\_\{5\}\+5x\_\{6\}\)^\{2\}\}
图 2:(a) sin\(x\)sin\(x\)的1项和2项SAMPAT逼近;(b)、(c) 某些函数的2层和3层SAMPAT网络。图2(b) (https://arxiv.org/html/2607.09235#S1.F2.sf2) 和图2(c) (https://arxiv.org/html/2607.09235#S1.F2.sf3) 展示了一些示例的SAMPAT实现。通常存在其他实现方式。这些示例中神经元之间的连接被受限以作示意,但在数据上训练的SAMPAT网络会学习出合适的结构,其中许多必要的权值变为零或接近零,从而发现近似最优的逼近器形式。如果能够导致较小的查找表,简约的逼近对于硬件实现是有价值的。考虑sin\(x\)sin\(x\)在0到π/2\\pi/2范围内。一项泰勒级数逼近为sin\(x\)≈xsin\(x\)\\approx x,其测试R2得分为0.76。图2(a) (https://arxiv.org/html/2607.09235#S1.F2.sf1) 展示了使用一项和两项的SAMPAT逼近;两者的R2得分均高于0.99。
通过引入跳跃连接,可以进一步扩展3层SAMPAT的表示能力。跳跃连接将输入、神经元的净输入或神经元输出连接到非相邻层中的神经元。当存在跳跃连接时,第kk个第二层神经元的输出可表示为zk=exp\(αk\(x\)\)∏i=1A\(∑j=1nuijxj\)vkiz\_\{k\}=exp\(\\alpha\_\{k\}\(x\)\)\\prod\_\{i=1\}^\{A\}~\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\\right\)^\{v\_\{ki\}\},其中αk\(x\)\\alpha\_\{k\}\(x\)是一个依赖于权值和输入的函数。跳跃连接的使用增加了网络可以表示或学习的可能函数的数量。
如果3层SAMPAT的输出被提供给一个具有指数激活函数的神经元,则该神经元的输出可以表示输入变量多项式的指数函数——其中包括其参数为输入变量多项式的高斯函数。一个带有跳跃连接的6层SAMPAT可以表示多项式、多项式乘积的加权和、上述多项式的多项式,以及指数为多项式乘积加权和的高斯混合模型。
在SAMPAT中使用复数权值显著扩展了可以学习或表示的函数族。训练期间的收敛性更好,并且在许多情况下所需数据更少。由于实数是复数集合的一个子集,所有可以使用实值权值计算的函数都是复数SAMPAT网络可表示函数集合的子集。
当使用复数权值时,会出现其他表示形式。考虑图3(a) (https://arxiv.org/html/2607.09235#S1.F3.sf1) 中的SAMPAT网络。图中指示的权值被固定,而其他权值是可变的。注意,在这个SAMPAT网络中,除了跳跃连接外,第1层权值不存在(固定为0)。后者包括u1,12,1u^\{2,1\}\_\{1,1\},这是一个从第1层输入1到第2层神经元1的跳跃连接;以及u2,12,1u^\{2,1\}\_\{2,1\},这是从第1层输入1到第2层神经元2的权值。唯一可学习的其他权值是w1,1w\_\{1,1\}和w1,2w\_\{1,2\},它们是从第2层神经元输出到单个第3层神经元的权值。该网络使用sin\(x\)sin\(x\)函数在0≤x≤2π0\\leq x\\leq 2\\pi范围内的样本进行训练。
参照图注(a)
参照图注(b)
参照图注(c)
参照图注(d)
图 3:(a)、(b):sin\(x\)sin\(x\)的SAMPAT网络和逼近器;(c)、(d):Relu\(x\)Relu\(x\)的逼近器和绘图图3(c) (https://arxiv.org/html/2607.09235#S1.F3.sf3) 和图3(d) (https://arxiv.org/html/2607.09235#S1.F3.sf4) 展示了Relu\(x\)=max\(x,0\)Relu\(x\)=max\(x,0\)的绘图和逼近器,该逼近器由一个2层SAMPAT网络学习得到,该网络两层分别有1个和6个神经元,使用5000个训练样本进行训练。这可以与文献[10 (https://arxiv.org/html/2607.09235#bib.bib15)]中使用5、9和13次纽曼多项式的逼近器进行比较。
考虑图4(a) (https://arxiv.org/html/2607.09235#S1.F4.sf1) 所示的两层SAMPAT,其中所有第二层权值都等于1,并且只存在一个第二层神经元。第2层神经元的输出记为z1z\_\{1\},由下式给出
z1=∏i=1A\(∑j=1nuijxj\+bi\)\\displaystyle z\_\{1\}=\\prod\_\{i=1\}^\{A\}~\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\+b\_\{i\}\\right\)\(7\)这里我们重新引入了偏置项bib\_\{i\}以便于描述。为了清晰起见,偏置项仅显示在第一个和第ii个第一层处理单元上。
参照图注(a)
参照图注(b)
参照图注(c)
参照图注(d)
图 4:(a) 用于多项式因式分解的SAMPAT;(b) 一个示例;(c) 运算放大器频率响应;(d) SAMPAT模型假设权值uiju\_\{ij\}和偏置项bib\_\{i\}是复数,但所有第2层权值v1iv\_\{1i\}都等于1。在这种情况下,\(∑j=1nuijxj\+bi\)\\left\(\\sum\_\{j=1\}^\{n\}u\_\{ij\}x\_\{j\}\+b\_\{i\}\\right\)是z1z\_\{1\}的复根。图4(b) (https://arxiv.org/html/2607.09235#S1.F4.sf2)展示了一个用于分解f\(x\)=x4−19x3\+121x2−309x\+270f\(x\)=x^\{4\}\-19x^\{3\}\+121x^\{2\}\-309x\+270的SAMPAT网络,以及在1000个样本训练后的权值。输出
z1=1.0\(3.16096−1.57218x\)1.0\(4.54415−0.912706x\)1.0\(0.507008x−4.52967\)1.0\(1.37445x−4.22934\)1.0\\displaystyle z\_\{1\}=1\.0\\left\(3\.16096\-1\.57218x\\right\)^\{1\.0\}\\left\(4\.54415\-0\.912706x\\right\)^\{1\.0\}\\left\(0\.507008x\-4\.52967\\right\)^\{1\.0\}\\left\(1\.37445x\-4\.22934\\right\)^\{1\.0\}\(8\)从中可以读出根为x=8.934,3.077,4.978,2.01x=8.934,3.077,4.978,2.01,这些根接近精确根,即x=9,3,5,2x=9,3,5,2。考虑f\(x\)=x3−1f\(x\)=x^\{3\}\-1,其因式为单位立方根。我们使用一个2层SAMPAT,具有复数权值,第1层和第2层分别有1个和3个神经元,第2层神经元的所有输入权值固定为1。所学到的逼近器为相似文章
作为物理世界模型的可分离神经网络架构:从数学理论到应用
本文介绍了一种可分离神经网络架构(SNA),这是一种结合神经逼近与张量分解的函数类,用于高效求解参数化偏微分方程。该方法在工程应用中(如激光粉末床熔融和材料性能预测)相比传统基于网格的方法实现了显著加速(高达150,000倍)。
SAEs 能否捕捉神经几何?(6分钟阅读)
本文探讨了稀疏自动编码器(SAEs)如何捕捉弯曲的神经几何,揭示了SAE特征表示流形的三种不同方式,并提出了一个无监督流程来揭示神经表征中的几何结构。
@MaximeRivest: 乍一看:> 结构方程模型 (SEM/路径分析) > 神经常微分方程 (Neural OD…
作者将结构方程模型、神经常微分方程和类似DSPy的AI程序进行比较,认为它们都是用于定义和优化计算图的声明性框架,并论证了结构化流程对于可信AI代理至关重要。
@harshbhatt7585: https://x.com/harshbhatt7585/status/2063593933314113587
作者分享了从头训练一个160M参数大语言模型的经验,尝试了多种架构,如多Token预测和分层推理模型。他强调快速迭代、简化思路以及理解架构有效原因的重要性。
SNLP: 基于结构化牛顿校正的层并行推理
本文介绍了SNLP,这是一个通过用结构化近似替代精确牛顿校正来实现Transformer层并行推理的框架,在0.5B模型上实现了高达2.3倍的加速,同时降低了困惑度。