p-自旋玻璃网络的高效单批次持续学习
摘要
介绍p-Spin Glass Network——一种全新的序列模型架构,它实现了内存高效、样本高效以及单批次稳定性,从而支持持续学习与边缘AI应用。
arXiv:2608.14774v1 文献类型:新成果
摘要:现代序列模型严重依赖海量内存占用和大批量随机优化,这些瓶颈限制了样本效率与持续学习能力。我们提出**p-自旋玻璃网络**,一种通过结构化设计克服上述限制、管理优化方差并展现四大优势的新型架构:1. **内存效率优势**:原生三值量化将内部参数压缩8倍,精确隐式梯度将激活内存严格约束在 𝒪(B·T·D) 范围内。2. **样本效率优势**:在训练序列减少8倍的情况下,达到与Transformer基线模型相当的渐进性能。3. **单批次稳定性**:在随机微批次大小为1时,仍能实现平滑单调收敛。4. **模态无关性**:该稳定性跨越离散子词与长时域未压缩原始字节流,维持稳健的时序信用分配。本研究通过消除稳定深度学习对大批量的依赖,为持续学习与边缘人工智能奠定了基础。
查看缓存全文
缓存时间: 2026/08/18 10:28
# p自旋玻璃网络高效单批次持续学习
来源:https://arxiv.org/html/2608.14774
###### 摘要
现代序列模型严重依赖于巨大的内存占用和大批量随机优化,这些障碍限制了样本效率和持续学习能力。我们引入了p自旋玻璃网络,这是一种新颖的架构,它克服了这些限制,从结构上管理优化方差,并展现出四项显著能力:1. 它确保内存效率:原生三元量化将内部参数压缩了8倍,而精确的隐式梯度将激活内存严格限制在$\mathcal{O}(B\cdot T\cdot D)$。2. 它展现了样本效率,在使用少8倍的训练序列的情况下,匹配了Transformer基线的渐近性能。3. 该方法在随机微批次大小为1时实现了单批次稳定性和平滑、单调的收敛。4. 最后,这种稳定性被证明与模态无关,在离散子词和长期未压缩原始字节流中都保持了稳健的时间信用分配。最终,这项工作消除了稳定深度学习对大批量的要求,为持续学习和边缘AI奠定了基础。代码:https://github.com/VladimerKhasia/sgn
###### 关键词:
机器学习,序列模型,自旋玻璃
††附属说明:预印本。参考图1:p自旋玻璃网络的架构示意图。左列展示了与模态无关的输入编码。中间列详述了硬件融合的连续状态空间路由和高阶p自旋吸引子搜索。右列描绘了最终的词表投影和交叉熵评估。
## 1 引言
现代深度学习从根本上依赖于Transformer架构(18 (https://arxiv.org/html/2608.14774#bib.bib5); 16 (https://arxiv.org/html/2608.14774#bib.bib6)),其对巨大内存占用和大批量梯度累积的依赖严重阻碍了低资源和持续学习(14 (https://arxiv.org/html/2608.14774#bib.bib7))。尽管线性时间状态空间模型(SSMs)的最新进展(8 (https://arxiv.org/html/2608.14774#bib.bib8); 4 (https://arxiv.org/html/2608.14774#bib.bib9); 7 (https://arxiv.org/html/2608.14774#bib.bib10))缓解了序列长度的内存瓶颈,而极端网络量化(19 (https://arxiv.org/html/2608.14774#bib.bib11); 12 (https://arxiv.org/html/2608.14774#bib.bib12))压缩了参数占用,但这些技术共同未能解决在最小批次大小下训练所固有的严重梯度方差和优化不稳定性。
为了克服这一随机优化障碍,我们通过隐式深度学习(1 (https://arxiv.org/html/2608.14774#bib.bib13); 5 (https://arxiv.org/html/2608.14774#bib.bib14))和受物理学启发的 thermodynamic 吸引子(9 (https://arxiv.org/html/2608.14774#bib.bib15); 2 (https://arxiv.org/html/2608.14774#bib.bib16); 17 (https://arxiv.org/html/2608.14774#bib.bib17))的理论视角重新构建了序列表示。与通过显式展开的前馈图来映射输入的标准架构不同,隐式模型将隐藏状态定义为迭代定点求解器的收敛根。通过隐函数定理(IFT)在平衡流形处提取精确的解析梯度,激活内存在数学上与积分深度解耦。
基于这些原理,并受到自旋玻璃物理(13 (https://arxiv.org/html/2608.14774#bib.bib1); 15 (https://arxiv.org/html/2608.14774#bib.bib2); 3 (https://arxiv.org/html/2608.14774#bib.bib3); 6 (https://arxiv.org/html/2608.14774#bib.bib4))的启发,我们引入了p自旋玻璃网络。我们将三元量化专门应用于内部热力学投影矩阵。这种有针对性的压缩明确地约束了平衡层的Lipschitz常数,提供了一种结构性热力学正则化,从而抑制了梯度方差。作为一个通用框架,该架构在标准子词标记空间和长期未压缩原始字节流(20 (https://arxiv.org/html/2608.14774#bib.bib18); 21 (https://arxiv.org/html/2608.14774#bib.bib19); 10 (https://arxiv.org/html/2608.14774#bib.bib20))中都维持了稳健的时间信用分配。
总之,核心贡献如下:
- • 架构内存效率:我们将隐式p自旋吸引子($W_{\text{ext}},W_{\text{int}}$)的投影矩阵量化为三元值,在平衡层中实现了8倍的参数压缩。此外,通过将SRAM融合的状态空间分块与通过隐函数定理进行的梯度推导相结合,我们将HBM激活内存严格限制在$\mathcal{O}(B\cdot T\cdot D)$,无条件地不随定点迭代次数$K$变化。
- • 高效样本优化:我们证明该方法在仅消耗标准Transformer所需训练序列的12.5%时,达到了渐近性能均衡。
- • 持续学习的单批次稳定性:我们证实有界的定点求解器从结构上抑制了梯度方差。这种数学正则化保证了即使在纯随机微批次大小$B=1$时也能实现平滑、单调的收敛,消除了对大批量累积的标准要求。
- • 与模态无关的处理:我们通过实证验证了该架构是一个通用的序列建模框架。它成功地在根本不同的表示尺度上维持了时间信用分配,从离散子词标记空间($\|V\|=49152$)到极端范围的连续原始字节流($\|V\|=256$)。
## 2 方法论
### 2.1 数学公式与推导
本节提供了p自旋玻璃网络的公式。该架构作为一个通用序列建模框架,在此针对离散语言模态进行评估。其前向和反向传播动力学严格地将连续时间状态空间积分与p自旋玻璃平衡吸引子耦合在一起。
术语表:
- • $B, T, D$: 批次大小,序列长度,隐藏特征维度。
- • $H, d_h$: 注意力头数和头维度($D=H\cdot d_h$)。
- • $C, N$: 分块大小和序列分块数($T=N\cdot C$)。
- • $X \in \mathbb{R}^{B\times T\times D}$: 输入序列表示。
- • $W_q, W_k, W_v, W_g, W_o \in \mathbb{R}^{D\times D}$: 状态空间线性投影权重。
- • $W_{\text{ext}} \in \mathbb{R}^{2D_{\text{int}}\times D}, W_{\text{int}} \in \mathbb{R}^{2D_{\text{int}}\times D_{\text{int}}}$: 外部驱动和内部平衡三元矩阵。
- • $\gamma_{\text{param}} \in \mathbb{R}^{D_{\text{int}}}$: 可学习的自旋阻挫(弛豫率)参数。
- • $K \in \mathbb{Z}_{+}$: 平衡微步数(定点迭代次数)。
#### 2.1.1 通过门控状态空间进行连续ODE积分
对于给定层$l$,输入张量$X^{(l-1)}$通过均方根归一化($\epsilon=10^{-6}$)进行归一化:
$$\tilde{X}_{b,t,d}=\frac{X_{b,t,d}^{(l-1)}}{\sqrt{\frac{1}{D}\sum_{j=1}^{D}(X_{b,t,j}^{(l-1)})^2+\epsilon}}\odot W_{\text{norm},d}\tag{1}$$
状态空间投影$Q,K,V\in\mathbb{R}^{B\times T\times H\times d_h}$计算为$\tilde{X}W_q^{\top},\tilde{X}W_k^{\top},\tilde{X}W_v^{\top}$,其中$Q\leftarrow Q\cdot d_h^{-0.5}$。数据相关的ODE衰减门$G\in\mathbb{R}^{B\times T\times H}$通过softplus算子将连续时间时间增长严格限制为负区域:
$$G_{b,t,h}=\frac{1}{d_h}\sum_{j=1}^{d_h}-\log\left(1+\exp\left((\tilde{X}W_g^{\top})_{b,t,h,j}\right)\right)\tag{2}$$
为避免$\mathcal{O}(T^2)$的内存物化,序列被划分为$N$个长度为$C$的块。块内累积和$G_{cs}$控制精确的因果衰减掩码$\mathcal{M}^{(i)}\in\mathbb{R}^{C\times C}$,直接在SRAM中物化:
$$\mathcal{M}^{(i)}_{c,j}=\begin{cases}\exp\left(G_{cs}^{(i,c)}-G_{cs}^{(i,j)}\right)&\text{如果 }c\geq j\\0&\text{否则}\end{cases}\tag{3}$$
块$i$的上下文化输出结合了块内因果注意力和跨块全局记忆$h^{(i-1)}$:
$$\begin{aligned} O_{\text{intra}}^{(i)}&=\left(Q^{(i)}(K^{(i)})^{\top}\odot\mathcal{M}^{(i)}\right)V^{(i)}\tag{4}\\ O_{\text{cross}}^{(i)}&=\left(Q^{(i)}h^{(i-1)}\right)\odot\exp\left(G_{cs}^{(i)}\right)\tag{5}\\ h^{(i)}&=h^{(i-1)}\odot\exp\left(G_{cs}^{(i,C)}\right)\\ &\quad+\left(K^{(i)}\odot\exp\left(G_{cs}^{(i,C)}-G_{cs}^{(i)}\right)\right)^{\top}V^{(i)}\tag{6}\end{aligned}$$
连接后的序列通过$W_o^{\top}$,产生$X_{\text{ssm}}$。残差更新为$X_{\text{mid}}=X^{(l-1)}+X_{\text{ssm}}$。
#### 2.1.2 高阶相互作用(p自旋玻璃门控吸引子)
残差张量$X_{\text{mid}}$归一化为$\bar{X}$。p自旋玻璃MLP评估一个隐式平衡定点。为确保参数效率,稠密投影矩阵使用绝对均值缩放$s$和直通估计器(STE)量化为$\{-1,0,1\}$。对于$W\in\{W_{\text{ext}},W_{\text{int}}\}$:
$$\begin{aligned} s&=\max\left(\frac{1}{\|W\|}\sum_{w\in W}\|w\|,10^{-5}\right)\tag{7}\\ W^{Q}&=\text{STE}\left(\text{clamp}\left(\text{round}\left(\frac{W}{s}\right),-1,1\right)\cdot s\right)\tag{8}\end{aligned}$$
外部热力学驱动将表示投影到$2D_{\text{int}}$空间:$Z=\bar{X}(W_{\text{ext}}^{Q})^{\top}$。分裂$Z$分离出值界限$U_0$和自旋门$G_0$。阻挫率受$\gamma=0.5\tanh(\gamma_{\text{param}})$约束。对于$k\in\{1,\dots,K\}$个微步,网络寻找能量最小值$Y^{*}=Y_K$:
$$\begin{aligned} Y_{k-1}&=\tanh(U_{k-1})\odot\sigma(G_{k-1})\tag{9}\\ H_k&=Z+(\gamma\odot Y_{k-1})(W_{\text{int}}^{Q})^{\top}\tag{10}\\ U_k, G_k&=H_{k,[:,:,:D_{\text{int}}]}, H_{k,:,:,D_{\text{int}}:]}\tag{11}\end{aligned}$$
平衡状态$Y^{*}$通过$W_{\text{down}}$向下投影,产生层的最终输出:$X^{(l)}=X_{\text{mid}}+Y^{*}W_{\text{down}}^{\top}$。
#### 2.1.3 精确隐式梯度
通过迭代吸引子的反向传播依赖于通过诺伊曼级数近似的隐函数定理,确保在不进行$\mathcal{O}(K)$图展开的情况下进行精确梯度重构。定义平衡导数$\phi_u=(1-\tanh^{2}(U_{K}))\odot\sigma(G_{K})$和$\phi_g=\tanh(U_{K})\odot\sigma(G_{K})\odot(1-\sigma(G_{K}))$,给定传入$\nabla_{Y^{*}}\mathcal{L}$的迭代梯度$V_k$为:
$$V_k=\nabla_{Y^{*}}\mathcal{L}+\gamma\odot\left(\left[V_{k-1}\odot\phi_u\parallel V_{k-1}\odot\phi_g\right]W_{\text{int}}^{Q}\right)\tag{12}$$
得到精确梯度$\nabla_{H}=\left[\left(V_{K}\odot\phi_u\right)\parallel\left(V_{K}\odot\phi_g\right)\right]$,严格在定点流形处评估。
### 2.2 算法规范
我们提供p自旋玻璃网络的完整算法规范。为证明其作为通用序列建模框架与模态无关的适用性,方法以两种不同的公式提供,直接对应提供的代码实现。
算法1(https://arxiv.org/html/2608.14774#alg1)描绘了使用统一词表大小$\|V\|=49152$的标准子词分词架构。相反,算法2(https://arxiv.org/html/2608.14774#alg2)形式化了字符级(连续原始字节)公式,在未压缩词表$\|V\|=256$上运行。两个算法执行完全相同的内部p自旋吸引子和硬件融合的状态空间动力学,仅在它们的输入编码空间、嵌入矩阵和最终评估指标(困惑度与每字节比特数)上有所不同。
算法 1 p自旋玻璃网络(子词级)
0: 原始文本 $S$,子词分词器 $\tau_{\text{sub}}(\|V\|=49152)$,目标 $Y_{\text{targ}}$,层数 $L$。
0: 损失 $\mathcal{L}$,困惑度指标。
1: $I\leftarrow\tau_{\text{sub}}(S)\in\mathbb{Z}^{B\times T}$
2: $X^{(0)}\leftarrow\text{Embedding}(I,W_{\text{emb}})$
3: for $l=1$ to $L$ do
4: // 1. 门控状态空间连续积分
5: $\tilde{X}\leftarrow\text{RMSNorm}(X^{(l-1)})$
6: $Q,K,V\leftarrow\tilde{X}W_q^{\top},\tilde{X}W_k^{\top},\tilde{X}W_v^{\top}$
7: $G\leftarrow\frac{1}{d_h}\sum-\log(1+\exp(\tilde{X}W_g^{\top}))$
8: 分割成大小为$C$的块;$h\leftarrow\mathbf{0}$
9: foreach chunk $i\in\{1\dots N\}$ do
10: $\mathcal{M}^{(i)}\leftarrow\exp(G_{cs}^{(i)}-(G_{cs}^{(i)})^{\top})$ (带掩码的下三角)
11: $O_{\text{intra}}\leftarrow((Q_iK_i^{\top})\odot\mathcal{M}^{(i)})V_i$
12: $O_{\text{cross}}\leftarrow(Q_ih)\odot\exp(G_{cs}^{(i)})$
13: $O_i\leftarrow O_{\text{intra}}+O_{\text{cross}}$
14: 使用$K_i, V_i, G_{cs}$更新连续状态$h$
15: end for
16: $X_{\text{mid}}\leftarrow X^{(l-1)}+\text{Concat}(O_1\dots O_N)W_o^{\top}$
17: // 2. 高阶相互作用(p自旋平衡)
18: $\bar{X}\leftarrow\text{RMSNorm}(X_{\text{mid}})$
19: $W_{\text{ext}}^{Q}, W_{\text{int}}^{Q}\leftarrow\text{Quantize}_{1.58b}(W_{\text{ext}}), \text{Quantize}_{1.58b}(W_{\text{int}})$相似文章
元可塑性作为增量学习中的自适应梯度预处理
SynGAP 是一个无任务持续学习框架,通过自适应梯度预处理模拟生物元可塑性,以缓解灾难性遗忘,在基准测试中显示出相对于现有方法的显著准确性提升。
面向大规模动态图的可扩展高效联合脉冲嵌入预测架构
提出 SG-JEPA,一种面向大规模动态图的联合脉冲嵌入预测架构,该架构沿时间维度将节点划分为上下文集和目标集,以学习预测性嵌入,在节点分类上取得有竞争力的性能,同时可扩展到拥有1300万条边的图,并避免了复杂的自监督机制。
SinkRec:使用内存条件门控Delta网络缓解长序列推荐中的语义状态沉没
SinkRec引入了一种混合内存-转换架构,通过内存条件门控Delta网络将模式存储与动态建模解耦,以线性时间效率缓解长序列推荐中的语义状态沉没。
@DSPyOSS: 一种更清晰的持续学习操作化方案,适用于那些被错误地归类为“RAG”或“RL”的问题…
提出了一种名为“Machine Studying”的新型持续学习框架,其中AI系统能够自主从语料库中发展专业知识,并引入了StudyBench用于评估。
我的玩具脉冲网络在NARMA-10测试中完全失败,但一个简单的神经科学技巧带来了15倍的计算性价比。 [D]
作者描述了一个自建的脉冲神经网络引擎,最初未能通过NARMA-10基准测试,但通过应用神经科学中的异构导线延迟,它获得了可用的记忆深度,并在一个识别任务上相比连续网络实现了15倍的计算效率优势。