通过隐藏神经元的联想记忆类别中的相

arXiv cs.LG 论文

摘要

本文分析了一类具有隐藏神经元的联想记忆,使用复制方法推导了相图和存储容量,并将其与transformers中的softmax注意力联系起来。

arXiv:2609.10976v1 Announce Type: new 摘要:Hopfield网络中的联想记忆是无序多体系统中的吸引子动力学,高阶和指数扩展将其检索更新转化为softmax注意力。多项式和指数区域已通过不同方法分析,没有通用架构来询问什么固定了存储尺度。在本文中,我们研究了Krotov和Hopfield的二部架构,我们称之为类$H$,其模型由每层的拉格朗日量固定,将隐藏神经元视为检索的序参量。在多项式负载下,复制方法得到复制对称相图和解析容量,串扰矩在Ising和球形可见神经元中是共同的,因此它们的差异来自可见熵。使用softmax隐藏层时负载是指数级的,副本表示将热力学映射到随机能量模型计数,具有顺磁、凝聚和冻结相。升温通过注意力的量化重新分配使检索不稳定,典型高斯模式在每个负载下保持亚稳态。区域在串扰统计上不同,多项式负载下为中心极限,指数负载下为大偏差,类$H$将检索分为两个角色,可见拉格朗日量固定稳定性,隐藏拉格朗日量固定存储尺度,这两个轴也可能指导新拉格朗日量的设计。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:24

# 通过隐藏神经元研究联想记忆的相变
来源:https://arxiv.org/html/2609.10976
太田稔弘Email:[[email protected]](mailto:[email protected])
隶属机构:CyberAgent AI Lab,东京涩谷150-0002,日本
隶属机构:RIKEN iTHEMS,埼玉和光351-0198,日本
滝真人Email:[[email protected]](mailto:[email protected])
隶属机构:立教大学人工智能与研究生院,东京丰岛171-8501,日本
隶属机构:RIKEN iTHEMS,埼玉和光351-0198,日本

###### 摘要
Hopfield网络中的联想记忆是无序多体系统中的吸引子动力学,高阶和指数级扩展将其检索更新转化为softmax注意力。多项式机制和指数机制已通过不同方法进行分析,但尚未有统一架构可以探讨是什么决定了存储规模。本文研究了Krotov和Hopfield提出的二部架构,我们称之为H类($\mathcal{H}$),其模型由每层的拉格朗日量决定,将隐藏神经元视为检索的序参量。在多项式负载下,副本法得出副本对称相图和闭合形式容量,且串扰矩在伊辛和球面可见神经元中是通用的,因此它们的差异源于可见熵。若隐藏层采用softmax,负载变为指数级,复制表示将热力学映射到随机能量模型计数上,产生顺磁、凝聚和冻结相。加热通过注意力的量子化重新分配使检索不稳定,典型的高斯模式在每种负载下都保持亚稳态。两种机制的区别在于串扰统计特征:多项式负载下为中心极限定理行为,指数负载下为大偏差行为,而H类将检索分为两种角色:可见拉格朗日量固定稳定性,隐藏拉格朗日量决定存储规模,这两个维度也可能指导新拉格朗日量的设计。

## I 引言
联想记忆是一种内容可寻址机制,能从部分线索中检索完整记忆。Hopfield网络将这种检索形式化为众多相互作用神经元的集体动力学,存储的模式作为能量景观的吸引子实现[1 (https://arxiv.org/html/2609.10976#bib.bib1)]。因此,该网络是一个无序多体系统,自旋玻璃统计力学的副本法量化了检索相与自旋玻璃相之间的竞争以及模型的存储容量[2 (https://arxiv.org/html/2609.10976#bib.bib2), 3 (https://arxiv.org/html/2609.10976#bib.bib3), 4 (https://arxiv.org/html/2609.10976#bib.bib4)]。此后该框架已得到显著扩展[5 (https://arxiv.org/html/2609.10976#bib.bib5), 6 (https://arxiv.org/html/2609.10976#bib.bib6)]。用高阶相互作用替代两两相互作用,将可检索模式的数量从神经元数量的线性级提升至多项式级(其阶数随相互作用阶数增长)[7 (https://arxiv.org/html/2609.10976#bib.bib7), 8 (https://arxiv.org/html/2609.10976#bib.bib8), 9 (https://arxiv.org/html/2609.10976#bib.bib9), 10 (https://arxiv.org/html/2609.10976#bib.bib10)],而指数级相互作用使其在神经元数量上达到指数级规模[11 (https://arxiv.org/html/2609.10976#bib.bib11)]。采用对数-求和-指数能量时,检索更新呈现softmax注意力形式,使联想记忆与Transformer的注意力机制直接对应[12 (https://arxiv.org/html/2609.10976#bib.bib12), 13 (https://arxiv.org/html/2609.10976#bib.bib13), 14 (https://arxiv.org/html/2609.10976#bib.bib14)]。这两种机制通过不同工具进行分析:多项式负载下使用副本法,指数负载下使用大偏差和极值统计学,后者控制检索阈值[15 (https://arxiv.org/html/2609.10976#bib.bib15)]和有限温度相变[16 (https://arxiv.org/html/2609.10976#bib.bib16), 17 (https://arxiv.org/html/2609.10976#bib.bib17), 18 (https://arxiv.org/html/2609.10976#bib.bib18)]。缺失的是一个统一架构,使我们能在此框架内探讨是什么决定了存储规模,以及串扰统计如何随其变化。

Krotov和Hopfield的二部架构提供了这种可能性[19 (https://arxiv.org/html/2609.10976#bib.bib19)]:一个可见层和一个隐藏层仅通过两两相互作用耦合,每层拉格朗日量的选择即可决定模型。我们将这个两层族称为 *H类*($\mathcal{H}$),它是k层耦合层层次结构$\mathcal{H}_k$的$k=2$成员,并在第二节(https://arxiv.org/html/2609.10976#S2)中描述。文献[19 (https://arxiv.org/html/2609.10976#bib.bib19)]中确定的三个代表性模型——迄今作为具有不同有效能量的独立模型进行研究:模型A(伊辛可见神经元)、模型B(隐藏层为softmax)和模型C(球面可见神经元)。我们进一步将隐藏神经元本身视为记忆检索的序参量,用统一语言描述不同的可见几何和隐藏非线性。第III节(https://arxiv.org/html/2609.10976#S3)处理模型A和C在多项式负载下的统计力学,其中副本法得出副本对称相图,零温度容量以闭合形式给出。衡量非检索模式串扰的矩对两个模型是通用的,而它们的检索相差异显著:二次球面模型是边际的且不存储任何东西[20 (https://arxiv.org/html/2609.10976#bib.bib20)],而高阶相互作用恢复了检索相。第IV节(https://arxiv.org/html/2609.10976#S4)研究模型B,其隐藏部分简化为分配给存储模式的注意力权重,因此检索即注意力的集中。其自然负载是指数级的,将热力学表示为与温度相关的复制数(每个复制选择一个存储模式),利用随机能量模型[21 (https://arxiv.org/html/2609.10976#bib.bib21), 22 (https://arxiv.org/html/2609.10976#bib.bib22)]的结构将问题转化为计数问题。这产生了顺磁、凝聚和冻结相,并表明加热不是通过重叠的平滑侵蚀,而是通过注意力的量子化重新分配来破坏检索稳定性,典型高斯模式在每种负载下仍保持亚稳态。

区分两种机制的是串扰统计的性质:多项式负载下为中心极限定理行为且对模式集成不敏感,指数负载下为大偏差行为且依赖于集成。一个结果是,在指数负载下,范数异常大的稀有高斯模式在自由能下低于典型检索,因此典型记忆从不是平衡相,网络作为亚稳态设备运行。这两种陈述背后是H类提供的图景,其中检索问题分离为由两个拉格朗日量承担的两种角色。可见拉格朗日量通过可见熵固定给定串扰下检索的稳定性,这区分了模型A和C。隐藏拉格朗日量固定存储规模和无序统计的性质:多项式非线性产生多项式负载和中心极限串扰,而对数-求和-指数产生指数负载和大偏差。用这些术语说,从经典Hopfield网络到密集联想记忆再到注意力的演进,并非一系列独立理论的延续,而是这两个维度上的一组位置,通过隐藏神经元提供的统一序参量语言进行比较。111我们数值实验的代码可在https://github.com/Toshihiro-Ota/classh获取。

## II 预备知识
为固定符号,本节概述H类($\mathcal{H}$),该结构最初在[19 (https://arxiv.org/html/2609.10976#bib.bib19)]中提出,并为后续章节的主要讨论提供统计力学设置。H类及更一般$ \mathcal{H}_k $联想记忆的详细信息见附录A(https://arxiv.org/html/2609.10976#A1)。

### II.1 H类概述
该系统的动力学变量包括$ N_v $个可见神经元$ v(t) \in \mathbb{R}^{N_v} $和$ N_h $个隐藏神经元$ h(t) \in \mathbb{R}^{N_h} $,它们的相互作用由$ \xi^{(h,v)} \in \mathbb{R}^{N_h \times N_v} $和$ \xi^{(v,h)} \in \mathbb{R}^{N_v \times N_h} $表示,约束条件为$ \xi^{(v,h)} = (\xi^{(h,v)})^\top $(见图1 https://arxiv.org/html/2609.10976#S2.F1)。系统动力学由“拉格朗日量”$ L_v: \mathbb{R}^{N_v} \to \mathbb{R} $和$ L_h: \mathbb{R}^{N_h} \to \mathbb{R} $决定,它们作为神经元激活函数的梯度:$ f = \nabla L_h $,$ g = \nabla L_v $。

系统的动力学方程和能量函数为:

$ \tau_v \frac{dv(t)}{dt} = \frac{\lambda}{\tau_h} \xi^{(v,h)} f(h(t)) - v(t) $

$ \tau_h \frac{dh(t)}{dt} = \frac{\lambda}{\tau_v} \xi^{(h,v)} g(v(t)) - h(t) $

以及

$ E_\xi(v,h) = \frac{1}{\tau_v} \left( v^\top g(v) - L_v(v) \right) + \frac{1}{\tau_h} \left( h^\top f(h) - L_h(h) \right) - \frac{\lambda}{\tau_h \tau_v} f(h)^\top \xi^{(h,v)} g(v) \eqcolon \frac{1}{\tau_v} E_v(v) + \frac{1}{\tau_h} E_h(h) + \frac{\lambda}{\tau_h \tau_v} E_{\mathrm{int}}(v,h) $

其中$ \tau_v $和$ \tau_h $分别是可见神经元和隐藏神经元的弛豫时间常数,$ \lambda $是耦合常数。组合$ v^\top g(v) - L_v(v) $和$ h^\top f(h) - L_h(h) $是拉格朗日量在激活值$ g(v) $和$ f(h) $处的勒让德变换。从这个意义上说,$ E_\xi $是与这对拉格朗日量相关的“哈密顿量”。事实上,上述动力学方程可视为限制在勒让德约束面上的哈密顿正则方程的一半,这使得动力学具有耗散性(见附录A https://arxiv.org/html/2609.10976#A1)。

参考说明 图1:H类联想记忆。$ N_v $个可见神经元和$ N_h $个隐藏神经元形成一个无层内连接的二部网络。

只要拉格朗日量的海森矩阵是半正定的,该能量函数就沿动力学方程的解轨迹单调递减:$ \frac{dE_\xi(v(t), h(t))}{dt} \leq 0 $。

此外,如果整体能量函数有下界,则轨迹保证收敛到不动点吸引子状态,对应于能量函数的某个局部极小值。这些不动点可被识别为存储的记忆,收敛过程即记忆检索。在绝热极限$ \tau_v \gg \tau_h $下,隐藏神经元比可见神经元弛豫快得多,可被绝热消除:在动力学方程中取$ \tau_h \to 0 $,得到$ h(t) = \frac{\lambda}{\tau_v} \xi^{(h,v)} g(v(t)) $,因此隐藏神经元瞬时跟随可见配置,其状态$ h_\mu(t) $衡量可见神经元激活与模式$ \xi_\mu^{(h,v)} $的重叠。从这个意义上说,每个隐藏神经元充当相应模式的特征检测器,隐藏神经元作为系统记忆检索的序参量[19 (https://arxiv.org/html/2609.10976#bib.bib19)]。

### II.2 配分函数
为考虑具有式(4) (https://arxiv.org/html/2609.10976#S2.E4) 能量函数的H类统计力学,我们在一般设置中引入形式配分函数:

$ Z_\xi(\beta) = \int dv dh \exp\left( -\beta E_\xi(v,h) \right) $

其中$ \beta $是逆温度。此表达式是形式的:对于某些拉格朗日量的选择,能量函数存在平坦方向,沿该方向积分发散(例如,当$ L_v $是1次齐次时,$ E_v $恒为零,能量与$ v $的整体尺度无关),因此精确的配分函数(包括积分域和测度)将在各节对应模型中定义。我们可以将此配分函数写为:

$ Z_\xi(\beta) = \int dv \, e^{-\frac{\beta}{\tau_v} E_v(v)} \times \int dh \exp\left\{ -\frac{\beta}{\tau_h} \left( E_h(h) + \frac{\lambda}{\tau_v} E_{\mathrm{int}}(v,h) \right) \right\} $

在此形式中,绝热极限重新表述为$ \beta/\tau_h \to \infty $,此时隐藏神经元的热涨落被抑制。通过鞍点近似,$ h $积分定位于被积函数的驻点$ h_* = \frac{\lambda}{\tau_v} \xi^{(h,v)} g(v) $。因此在绝热极限下,配分函数变为:

$ Z_\xi(\beta) \approx \int dv \exp\left\{ -\beta \left( \frac{1}{\tau_v} E_v(v) - \frac{1}{\tau_h} L_h(h_*) \right) \right\} \left( \frac{2\pi}{\beta/\tau_h} \right)^{N_h/2} = \left( \frac{2\pi}{\beta/\tau_h} \right)^{N_h/2} \int dv \exp\left( -\beta E_\xi(v, h_*) \right) $

严格来说,高斯预因子还带有因子$ (\det \operatorname{Hess} L_h(h_*))^{-1/2} $,我们在此领先阶忽略。其作用在附录C.2 (https://arxiv.org/html/2609.10976#A3.SS2) 中对模型B进行考察。

如本节所述,隐藏神经元在系统中扮演记忆检索序参量的角色。在以下章节中,我们从隐藏神经元角色的角度研究模型A、B和C的性质。

## III 模型A和C
模型A和C是H类内的一个模型家族成员。让我们考虑一系列拉格朗日量,222这些模型可进一步推广,见附录A。

相似文章

变分线性注意力:用于长上下文 Transformer 的稳定联想记忆

arXiv cs.LG

本文介绍了变分线性注意力(VLA),这是一种用于稳定长上下文 Transformer 中线性注意力机制记忆状态的方法。VLA 将记忆更新重构为在线正则化最小二乘问题,证明了状态范数的有界性,并展示了相较于标准线性注意力和 DeltaNet 显著的速度提升以及更高的检索准确性。

Transformer 记忆的吸引子几何:从冲突仲裁到自信幻觉

arXiv cs.AI

本文提出了一个统一的几何框架,用于理解 Transformer 的内存故障,通过隐藏状态吸引子盆地(attractor basins)区分冲突仲裁与幻觉。研究表明,随着模型规模的扩大,几何边际(geometric margin)在检测这些故障方面优于输出熵。