SILVA Networks:基于动态交互场的结构化隐式层和向量吸引子

arXiv cs.LG 论文

摘要

介绍了SILVA Networks,一种隐式神经架构,在不动点公式中显式分离了刺激、局部/全局交互、阻尼和读出,并在图像、分子、引文网络和长程图基准上进行了测试。

arXiv:2607.28989v1 公告类型:新 摘要:许多学习问题需要能够协调直接输入、邻近结构和更广泛背景的表示。在隐式神经层中,这些影响通常被吸收到单一的不动点更新中,使得难以区分哪些来自刺激、哪些在局部传播、哪些来自全局上下文、哪些由求解器动态产生。在此,我们介绍了SILVA Networks——通过动态交互场实现的结构化隐式层和向量吸引子。SILVA在单一不动点架构内分离了刺激、局部交互、全局交互、阻尼和读出。通过节点、邻域和全局汇总的领域特定定义,同一模板被实例化用于图像、分子、引文网络和长程图基准。实验和消融研究显示了这些项的依赖于任务的角色:在图任务中局部交互承担主要负载,MNIST在测试容量下从递归中获得很少收益,而最明显的全局收益出现在长程节点分类基准中。因此,SILVA提供了一种隐式表示,其内部交互动态可以被训练、消融、可视化和诊断。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:35

# SILVA 网络:基于动态交互场的结构化隐层与向量吸引子

来源:https://arxiv.org/html/2607.28989

Jose Luis Lima de Jesus Silva\*1,2

1 巴伊亚联邦大学,地球物理系,萨尔瓦多,BA 40170-115,巴西
2 巴伊亚联邦大学地球物理人工智能研究与应用小组(GAIA),萨尔瓦多,BA 40170-115,巴西

\* 通讯作者:[email protected] (https://arxiv.org/html/2607.28989v1/mailto:[email protected])

###### 摘要

许多学习问题需要能同时协调直接输入、邻近结构和更广泛上下文的表示。在隐式神经层中,这些影响通常被吸收到单一的定点更新中,从而难以分辨哪些来自刺激、哪些在局部传播、哪些来自全局上下文、哪些由求解器动态产生。本文引入 SILVA 网络,即基于动态交互场的结构化隐层与向量吸引子(Structured Implicit Layers and Vector Attractors via Dynamic Interaction Fields)。SILVA 在单一定点架构内分离了刺激、局部交互、全局交互、阻尼和读出。同一模板通过节点、邻域和全局摘要的领域特定定义,被实例化用于图像、分子、引文网络和长程图基准。实验和消融研究表明这些项的作用随任务而变化:局部交互在图任务中承担主要作用,MNIST 在测试容量下从循环中获得很少收益,而最明显的全局收益出现在长程节点分类基准中。因此,SILVA 提供了一种隐式表示,其内部交互动态可以被训练、消融、可视化和诊断。

## 1 引言

潜在表示通常需要协调多个同时存在的影响来源。一个像素区域、图节点或分子原子由其自身的观测特征、邻近结构以及其所处系统的更广泛背景共同驱动[11 (https://arxiv.org/html/2607.28989#bib.bib30),23 (https://arxiv.org/html/2607.28989#bib.bib34)]。现代架构通过深度、消息传递、注意力或循环来组合这些效应[23 (https://arxiv.org/html/2607.28989#bib.bib34),52 (https://arxiv.org/html/2607.28989#bib.bib11)]。在隐式架构中,同样的要素可以视为一个受驱动的动力系统:输入刺激进入状态空间,局部和全局交互修改该状态,数值求解器返回收敛时达到的状态[6 (https://arxiv.org/html/2607.28989#bib.bib5),24 (https://arxiv.org/html/2607.28989#bib.bib8)]。所提出的基于动态交互场的结构化隐层与向量吸引子(SILVA 网络)架构通过分离刺激、交互算子、求解器更新和读出状态,使这种分解变得明确。这一观点延续了从单次变换走向潜在状态迭代构建的长期发展脉络。反向传播使显式分层网络可训练[46 (https://arxiv.org/html/2607.28989#bib.bib1)]。Hopfield 网络和基于能量的模型表明,表示也可以是动力系统达到的状态[27 (https://arxiv.org/html/2607.28989#bib.bib23),38 (https://arxiv.org/html/2607.28989#bib.bib42)]。残差网络通过围绕恒等映射学习增量,使深度迭代精化可训练[26 (https://arxiv.org/html/2607.28989#bib.bib3)];而神经常微分方程将深度重新解释为通过数值求解的连续时间动力学[16 (https://arxiv.org/html/2607.28989#bib.bib4)]。图神经网络(GNN)通过在边上递归更新节点状态,将迭代状态更新扩展到关系型数据[48 (https://arxiv.org/html/2607.28989#bib.bib2)]。深度均衡模型(DEQ)[6 (https://arxiv.org/html/2607.28989#bib.bib5)]使定点观点变得明确。它们不是指定有限堆叠的不同层,而是定义一个变换并求解z∗=fθ(z∗,x)z^{\ast}=f_{\theta}(z^{\ast},x)。在最初的 DEQ 公式中,隐式微分将训练内存与求解器迭代次数解耦[6 (https://arxiv.org/html/2607.28989#bib.bib5)]。图特定的隐式神经网络将此思想扩展到节点状态矩阵和长程图依赖[24 (https://arxiv.org/html/2607.28989#bib.bib8)],后来的算子理论公式则强调适定性、稳定性和加速定点求解器[9 (https://arxiv.org/html/2607.28989#bib.bib9)]。Jacobian 正则化的 DEQ 进一步将均衡 Jacobian 的条件数与前向和反向稳定性联系起来[8 (https://arxiv.org/html/2607.28989#bib.bib7)]。多尺度 DEQ(MDEQ)进一步表明,均衡可以耦合多个特征分辨率于一个联合定点中[7 (https://arxiv.org/html/2607.28989#bib.bib6)]。定点抽象建立了一个强大的表示原理。SILVA 关注该定点更新的内部组成,明确指定直接输入驱动、局部交互和系统范围上下文如何进入同一均衡计算。

已有若干神经架构实现了交互机制。几何深度学习通过将卷积推广到欧几里得数组之外,把网格、图和流形视为一个家族[15 (https://arxiv.org/html/2607.28989#bib.bib35)]。图卷积、消息传递和交互网络提供了在边或对象上的高效局部聚合[11 (https://arxiv.org/html/2607.28989#bib.bib30),34 (https://arxiv.org/html/2607.28989#bib.bib18),23 (https://arxiv.org/html/2607.28989#bib.bib34)]。图注意力网络(GAT)和 transformer 注意力学习数据相关的交互权重[53 (https://arxiv.org/html/2607.28989#bib.bib10),52 (https://arxiv.org/html/2607.28989#bib.bib11)]。然而,纯局部传播可能将远距离信号压缩到固定大小的节点状态中[1 (https://arxiv.org/html/2607.28989#bib.bib45)]。稠密全局注意力和潜在瓶颈架构也可能将局部计算、全局上下文和重复求解器应用纠缠在单个学习变换中[30 (https://arxiv.org/html/2607.28989#bib.bib38),5 (https://arxiv.org/html/2607.28989#bib.bib39)]。SILVA 在一个定点层内分离了四个计算对象:外部刺激、局部交互算子、全局交互算子和有阻尼的求解器,后者负责累积它们的作用。

刺激、交互、稳定性和吸引子的术语在物理启发模型和神经动力学模型中有着悠久的历史。Hopfield 网络将计算表述为相互作用单元组成的物理系统中的集体收敛[27 (https://arxiv.org/html/2607.28989#bib.bib23)]。Wilson-Cowan 群体动力学和 Amari 神经场将神经活动建模为随时间变化的受驱动交互群体[56 (https://arxiv.org/html/2607.28989#bib.bib24),2 (https://arxiv.org/html/2607.28989#bib.bib25)]。现代神经科学使用吸引子网络来解释神经群体中的持续活动、线索整合和误差修正[32 (https://arxiv.org/html/2607.28989#bib.bib26)]。视觉皮层模型进一步表明,调谐和感知可能依赖循环、侧向、预测和自上而下的交互,而非仅仅前馈驱动[12 (https://arxiv.org/html/2607.28989#bib.bib27),44 (https://arxiv.org/html/2607.28989#bib.bib28),22 (https://arxiv.org/html/2607.28989#bib.bib29)]。这些工作为本文使用的动力学词汇提供了动机,而 SILVA 仍然是一种机器学习架构,而非生物回路模型。

局部-全局权衡在不同基准中表现不同。ZINC 分子性质基准通常奖励化学局部的键结构[29 (https://arxiv.org/html/2607.28989#bib.bib21)]。来自 Benchmarking GNNs 套件的 CLUSTER 是一个归纳式节点分类基准,基于合成图实例,其中长程聚合是核心[20 (https://arxiv.org/html/2607.28989#bib.bib17)]。Cora、Citeseer 和 Pubmed 引文网络节点分类处于另一个边界[49 (https://arxiv.org/html/2607.28989#bib.bib41),58 (https://arxiv.org/html/2607.28989#bib.bib13)]。它们的标注预算很小,强大的局部基线通常就足够了,这使得这些数据集成为直接检验全局项在局部结构已经解释大部分任务时是否仍贡献可测量信号的测试。

SILVA 网络命名了该机制的三个组成部分。*结构化隐层*是其更新被拆分为明确计算角色的定点层。*向量吸引子*是求解器达到的收敛向量值状态z∗z^{\ast}。*动态交互场*是学习得到的场fθ(z,x)−zf_{\theta}(z,x)-z,它结合了刺激、局部交互和全局交互。在层级别,SILVA 使用阻尼更新zk+1=(1−α)zk+αfθ(zk,x)z_{k+1}=(1-\alpha)z_{k}+\alpha f_{\theta}(z_{k},x),其中fθf_{\theta}被组织为刺激加上局部和全局项,领域特定适配器定义状态空间和算子。

该公式在特定意义上推广了传统神经层。标准前馈变换一次性计算表示。SILVA 则注入刺激并让其通过交互状态传播,直到达到近似向量吸引子。在下面发展的局部线性化分析中,路径是携带刺激到状态坐标的自、局部和全局算子的有序乘积。这些刺激到状态的路径精确说明了直接输入、局部邻域、全局上下文、阻尼和有限求解器深度如何组合。相同的外层定点求解器跨领域使用,而每个领域定义何为节点、何为局部邻域、何为全局摘要。共享对象是可检查的交互模板,通过领域特定的状态空间和算子实例化。

术语“均衡”(equilibrium)在两种精确意义下使用。在架构上,所有模型都运行阻尼定点求解器,并将终端状态zKz_{K}读出为近似定点。在严格的 DEQ 训练意义上,adjoint 训练的 MNIST 诊断使用 GMRES adjoint 求解[47 (https://arxiv.org/html/2607.28989#bib.bib37)],而其余实验使用截断反向传播通过展开的定点求解器。实证结果之所以有信息量,是因为全局项并非一律有益。在 MNIST[37 (https://arxiv.org/html/2607.28989#bib.bib52)]和引文网络节点分类中,全局项并不比局部或无交互变体自动提高准确率,因此所添加的算子被直接检验,而非假定其有用。在预期更广泛聚合重要的长程 CLUSTER 基准上,完整的局部+全局 SILVA 模型在五个种子上达到73.04±0.60%73.04\pm 0.60\%验证准确率。这超过最佳匹配的局部图基线14.2914.29个百分点,并超过无全局 SILVA 消融5.495.49个百分点。同样的实验还揭示了求解器残差、谱半径行为、学习到的交互结构和均衡状态几何,从而提供对动力学的测量以及任务得分。

贡献。
1.  1. SILVA 网络定义了结构化隐层,其中刺激项、局部交互项、全局交互项和阻尼求解器作为同一动态交互场的独立部分出现(第2节 (https://arxiv.org/html/2607.28989#S2))。
2.  2. 通过指定每个领域中使用的状态节点、局部图、全局摘要、求解器和反向模式,同一模板被实例化用于视觉、分子回归、引文网络节点分类和长程图基准。
3.  3. 堆叠的 SILVA 模型组合分别求解的近似向量吸引子状态,这些状态具有不同的参数和时间尺度,而不是增加单个均衡求解的迭代次数。
4.  4. 局部线性化求解器的有限路径和解释通过同一 Jacobian 级算子,将求解器深度、阻尼、谱半径和有效刺激到状态影响联系起来(第2.10节 (https://arxiv.org/html/2607.28989#S2.SS10)和2.11节 (https://arxiv.org/html/2607.28989#S2.SS11))。
5.  5. 该架构在视觉、化学、引文网络和长程图设置中进行了评估,包括局部/全局消融,以识别全局交互何时贡献可测量信号,以及局部结构何时已占主导。
6.  6. 实证表征包括种子敏感性、有限求解器预算、截断反向传播、稳定性诊断以及与通用多领域架构的直接基准重叠。

## 2 方法

### 2.1 均衡层

设z∈RN×dz\in\mathbb{R}^{N\times d}为层在NN个实体(视觉中的像素/单元,化学中的原子,引文图中的节点)上的状态,隐藏宽度为dd,xx为层的输入嵌入。所有实验共享一个外层模板。每领域更新映射fθ(z,x)f_{\theta}(z,x)通过阻尼定点(Picard)迭代[10 (https://arxiv.org/html/2607.28989#bib.bib22)]达到定点z∗=fθ(z∗,x)z^{\ast}=f_{\theta}(z^{\ast},x),对于k=0,...,K−1k=0,\dots,K-1,

zk+1=(1−α)zk+α⋅fθ(zk,x),z_{k+1}=(1-\alpha)z_{k}+\alpha\cdot f_{\theta}(z_{k},x), (1)

其中zkz_{k}是kk次更新后的求解器迭代值,KK是总迭代预算,α∈(0,1]\alpha\in(0,1]是阻尼系数,θ\theta表示更新映射中的所有学习参数,zKz_{K}是下游读出使用的近似定点。输入xx已由下面定义的领域特定输入编码器编码。

更新映射总是组合刺激、局部和全局项。其精确组成因领域而异,因此下面的公式分别陈述了被评估的组成。局部和全局映射作用于循环信号z~=χD(z)\tilde{z}=\chi_{\mathcal{D}}(z),而不一定是原始求解器状态,其中D\mathcal{D}索引领域或模型族。对于 ZINC,χD\chi_{\mathcal{D}}是恒等映射。对于 Cora、Citeseer 和 Pubmed 引文网络[49 (https://arxiv.org/html/2607.28989#bib.bib41),58 (https://arxiv.org/html/2607.28989#bib.bib13)]、CLUSTER[20 (https://arxiv.org/html/2607.28989#bib.bib17)]、MNIST[37 (https://arxiv.org/html/2607.28989#bib.bib52)]和 CIFAR-10[36 (https://arxiv.org/html/2607.28989#bib.bib57)],χD(z)=tanh(z)\chi_{\mathcal{D}}(z)=\tanh(z),与所评估模型一致。

化学实验使用 ZINC 分子性质基准[29 (https://arxiv.org/html/2607.28989#bib.bib21)]。节点分类实验使用 Cora、Citeseer 和 Pubmed 引文图[49 (https://arxiv.org/html/2607.28989#bib.bib41),58 (https://arxiv.org/html/2607.28989#bib.bib13)]。长程节点分类实验使用 CLUSTER 基准[20 (https://arxiv.org/html/2607.28989#bib.bib17)]。

这些非视觉实验使用

z~\displaystyle\tilde{z}=χD(z),\displaystyle=\chi_{\mathcal{D}}(z), (2)

fθ(z,x)\displaystyle f_{\theta}(z,x)=LayerNorm(ReLU(Wstimx+L(z~)+G(z~))).\displaystyle=\mathrm{LayerNorm}\Big(\mathrm{ReLU}\big(W_{\mathrm{stim}}x+L(\tilde{z})+G(\tilde{z})\big)\Big). (3)

这里WstimxW_{\mathrm{stim}}x、L(z~)L(\tilde{z})和G(z~)G(\tilde{z})都具有相同的

相似文章

隐式机器学习力场加速分子动力学模拟

arXiv cs.LG

介绍了隐式机器学习力场(I-MLFFs),该力场用不动点方程替代深层神经网络堆叠,支持热启动,并在用于分子动力学模拟的图神经网络架构上实现最高5倍的计算/内存节省。

人工神经网络的涌现符号结构

Hacker News Top

本研究提出,神经网络隐式地实现了符号结构,通过使用符号方程近似向量表示来证明,这些方程在算术、逻辑、代码和语言等多个领域中保持行为一致。

通过稀疏电路理解神经网络

OpenAI Blog

OpenAI 研究人员提出了一种训练稀疏神经网络的方法,通过强制大部分权重为零使其更易于解释,从而发现能够解释模型行为的小型解耦电路,同时保持性能。这项工作旨在推进机制可解释性,作为对稠密网络事后分析的补充,并支持 AI 安全目标。