学习动态统计力学的函数空间方法
摘要
本文通过从参数空间转向函数空间,开发了一个统计力学框架来分析深度神经网络中的学习动态,推导了精确的误差动态和涨落效应。
arXiv:2609.09589v1 公告类型:新
摘要: 深度神经网络尽管在巨大的参数空间中表现出高度非线性动力学,但仍展现出规则的宏观行为。我们直接在函数空间中开发学习的统计力学描述,将参数配置视为微观实现,将函数及其动力学算子视为宏观变量。对于均方损失,精确的误差动态由学习算子 \(M=JJ^*\) 控制。将条件随机动力学的动力学玻尔兹曼权重与参数空间的状态密度结合,其局部曲率定义了一个统计算子 \(B\),并对局部涨落进行积分,得到
$$ \Phi_{\mathrm{fluc}}(M;B)=\frac{\sigma_\xi^2}{2}\log\det(M^{-1}+B)+\mathrm{const}. $$
在固定谱下,当 \([M,B]=0\) 时,该项在旋转下是静止的,通过将 \(M\) 的大特征值与 \(B\) 的小特征值配对来最小化,并产生对抗旋转失配的局部恢复贡献。对于在温和稳定统计条件下的ReLU型函数空间,\(B=\sigma_\xi^2L^*\mathcal K L\),其中 \(L\) 测量粗粒化的二阶结构。因此,低 \(B\) 部分对应于低结构曲率,直到 \(\mathcal K\) 的有界各向异性,这意味着偏好沿平滑、数据自适应方向更快弛豫。这些结果将函数空间确定为研究学习中稳定集体组织的自然宏观层面。
查看缓存全文
缓存时间: 2026/09/11 08:38
# 学习动力学统计力学的函数空间方法
来源:https://arxiv.org/html/2609.09589
###### 摘要
深度神经网络尽管在庞大的参数空间中展现出高度非线性的动力学,其宏观行为却出人意料地具有规律性。我们发展了一种直接在函数空间中对学习过程进行统计力学描述的理论,将参数构型视为微观实现,而将函数及其动力学算子视为宏观变量。对于均方损失,精确的误差动力学由学习算子 \(M = JJ^{\ast}\) 控制。裸条件随机动力学提供了一个动力学玻尔兹曼权重,而参数空间的多重性则贡献了一个函数空间态密度,其局部曲率定义了统计算子 \(B\)。在给定当前误差宏观态并对其产生的局部涨落系综进行积分后,我们得到了对主动子空间的条件自由能贡献 \(\Phi_{\mathrm{fluc}}(M;B) = \frac{\sigma_{\xi}^{2}}{2} \log \det(M^{-1} + B) + \mathrm{const}\)。在固定谱的情况下,当 \([M,B] = 0\) 时该贡献是旋转不变的;通过将 \(M\) 的大本征值与 \(B\) 的小本征值配对来最小化;并提供了一个局部恢复力贡献以对抗旋转失配。在温和的稳定统计条件下,ReLU 类型函数空间中的 \(B\) 呈现形式 \(B = \sigma_{\xi}^{2} L^{\ast} \mathcal{K} L\),其中 \(L\) 度量了粗粒化的二阶结构。因此,其低 \(B\) 子空间(在 \(\mathcal{K}\) 有界各向异性范围内)对应于低结构曲率的方向。在这种 ReLU 特化中,涨落诱导的贡献因此倾向于将更快的松弛与这个低曲率、数据自适应的子空间配对。这些结果表明,函数空间为研究学习中稳定的集体组织提供了一个自然的宏观层面,而具体的神经网络模型作为该宏观统计理论的实现进入,而非从一开始就定义其形式。
## 1 引言
深度神经网络给理论提出了一个不寻常的问题。它们的训练动态源于海量参数之间的强非线性相互作用,但其宏观行为常常表现出显著的规律性。在多个学习领域,性能在模型规模、数据和计算量的巨大变化上遵循平滑的缩放关系,而适当的参数化可以使优化超参数在宽度数量级上保持可迁移性 [Hestness et al. (2017) (https://arxiv.org/html/2609.09589#bib.bib16); Kaplan et al. (2020) (https://arxiv.org/html/2609.09589#bib.bib17); Yang et al. (2021) (https://arxiv.org/html/2609.09589#bib.bib18)]。规律性的组织也出现在学习动态和表示本身内部:神经网络训练反复发展出特征性的谱结构 [Cohen et al. (2021) (https://arxiv.org/html/2609.09589#bib.bib19)],而学习到的函数表现出对平滑、数据依赖方向的系统性偏好 [Rahaman et al. (2019) (https://arxiv.org/html/2609.09589#bib.bib13); Kadkhodaie et al. (2024) (https://arxiv.org/html/2609.09589#bib.bib20)]。这些观察之所以引人注目,正是因为这种规律性从训练的微观方程中并不明显。它们提出了一个基本的机制性问题:高度非线性的学习动态如何能够产生稳定且可扩展的宏观组织?
\boxed{\textit{高度非线性的学习动态如何能够产生稳定且可扩展的宏观组织?}}
\quad (1)
这个问题意味着,一个有用的深度学习理论不应仅仅跟踪单个参数的轨迹。它应该找到一个描述层次,在该层次上,稳健的集体结构变得可见。在这方面,一个特别成功的步骤是从参数空间转向函数空间。在神经切线核(NTK)机制下,一个高度非线性的参数化模型可以简化为一个近似封闭的线性动态,该动态由一个在整个训练过程中几乎保持固定的核控制 [Jacot et al. (2018) (https://arxiv.org/html/2609.09589#bib.bib8); Chizat et al. (2019) (https://arxiv.org/html/2609.09589#bib.bib9)]。这表明,一个复杂的微观系统可以接受一个简单得多的宏观描述。然而,这种封闭的代价是,控制学习的几何结构被有效地冻结了。特征学习理论放松了这一限制,并允许表示、核及其谱演化 [Woodworth et al. (2020) (https://arxiv.org/html/2609.09589#bib.bib10); Lauditi et al. (2025) (https://arxiv.org/html/2609.09589#bib.bib11); Lauditi et al. (2026) (https://arxiv.org/html/2609.09589#bib.bib12)]。因此,这两种机制揭示了一种有益的张力:固定动力学几何结构可得到一个简单的封闭描述,而允许几何结构本身适应则恢复了学习的一个本质部分,但也重新引入了非线性的、自洽的且常常依赖于模型的动态。这促使人们思考:是否可以在不解析其完整微观轨迹的情况下,表征学习的演化宏观组织。
巨大的微观维度、强非线性和可复现的宏观结构的结合,使统计力学成为解决这个问题的自然框架。统计力学思想长期以来一直通过吉布斯系综、高维景观、随机梯度扩散、平均场描述和集体序参量被用于研究神经网络 [Bahri et al. (2020) (https://arxiv.org/html/2609.09589#bib.bib7); Mandt et al. (2016) (https://arxiv.org/html/2609.09589#bib.bib4); Mandt et al. (2017) (https://arxiv.org/html/2609.09589#bib.bib5); Chaudhari and Soatto (2018) (https://arxiv.org/html/2609.09589#bib.bib6)]。这些方法已经确立,在对微观自由度进行粗粒化之后,可以出现有用的宏观规律。然而,在许多现有表述中,统计描述要么直接在参数空间中构建,要么通过一组为特定模型或极限选择的宏观变量来构建。一个相对未被探索的可能性是,在学习对象本身演化的层面——即函数空间——直接表述学习的统计力学。这就是本工作所发展的视角。
一个核心的方法论区别是,神经网络模型被视为统计理论的微观实现,而不是其起点。我们首先在函数空间中表述宏观变量和条件统计定律;然后一个具体的架构决定了哪些动力学算子和微观态几何是可实现的,从而决定了宏观定律如何被实例化。这并非让架构变得无关紧要:瞬时学习算子和微观实现的多重性仍然依赖于模型。相反,它将组织原则的形式与其模型特定的实现分离开来。这种区分对于跨架构持续存在的宏观规律性尤为自然:它们的具体实现可能不同,但其组织机制的形式不必源自任何一个微观模型。
参数构型被视为微观实现,而函数及其控制其演化的算子则提供了宏观变量。诸如损失之类的标量量仍然是重要的可观测量,但它们只保留了预测误差的幅度,而丢弃了其方向和谱结构的大部分。函数空间位于这两个极端之间:它对冗余的参数化进行粗粒化,同时保留学习的几何结构。
对于均方损失,精确的函数空间梯度动态具有简单形式:
\[
\dot{e} = -Me, \qquad M = JJ^{\ast}, \tag{2}
\]
因此,\(M\) 的谱和本征方向直接决定了误差的松弛几何。参数化通过给定函数空间状态的微观实现多重性进入该描述。将相应的态密度记为 \(\Omega(e)\),其局部曲率定义为:
\[
\boxed{B(r) = -\sigma_{\xi}^{2} \nabla_{e}^{2} \log \Omega(e) \big|_{e=r}.} \tag{3}
\]
因此,\(M\) 描述了学习的动力学几何,而 \(B\) 描述了由底层参数微观态诱导的统计几何。只有 \(B\) 到 \(M\) 的有限维主动子空间的压缩进入了下面的行列式和对易子中。
给定当前误差宏观态,并对其产生的局部函数空间涨落系综进行积分,得到一个依赖于动力学算子的条件自由能贡献:
\[
\boxed{\Phi_{\mathrm{fluc}}(M;B) = \frac{\sigma_{\xi}^{2}}{2} \log \det(M^{-1} + B) + \mathrm{const}.} \tag{4}
\]
其旋转结构产生了一个强烈的条件偏好。在固定谱的情况下:
\[
\boxed{\delta_{\mathrm{rot}} \Phi_{\mathrm{fluc}} = 0 \quad \Longleftrightarrow \quad [M,B] = 0,} \tag{5}
\]
而自由能最小值将谱配对为 \(m_{\mathrm{large}} \longleftrightarrow b_{\mathrm{small}}\)。
\[
\boxed{m_{\mathrm{large}} \longleftrightarrow b_{\mathrm{small}}.} \tag{6}
\]
配对状态进一步在每一对非退化的方向上具有正的旋转曲率。因此,这个条件自由能贡献提供了一个对抗算子失配的局部恢复热力学力。
我们并不假设这一项穷尽了 \(M\) 的全部慢动态;而是确定了局部涨落部分贡献的一个明确的热力学偏好。完整的局域自由能还包含一个不同的宏观态项 \(\frac{1}{2} \langle r_a, M^{-1} r_a \rangle_p\),它提供了一个误差导向的取向偏好;第4.1节 (https://arxiv.org/html/2609.09589#S4.SS1) 明确分离了这两个贡献。
接下来,我们在一类具体的函数空间中审视这种抽象统计几何的物理意义。ReLU 网络表示连续分段仿射函数,其二阶结构集中在激活单元边界上。经过粗粒化,这种结构可以由一个线性算子 \(L \simeq \mathcal{C} D^{2}\) 表示。在局部微观态系综的温和统计边界条件下,曲率算子变为:
\[
\boxed{B = \sigma_{\xi}^{2} L^{\ast} \mathcal{K} L,} \tag{7}
\]
其中 \(\mathcal{K}\) 是一个正结构熵度量。因此,对于本征模 \(B \phi_i = b_i \phi_i\),有 \(b_i \asymp \| L \phi_i \|^2\),
\[
b_i \asymp \| L \phi_i \|^2, \tag{8}
\]
而低 \(B\) 子空间(在 \(\mathcal{K}\) 的有界各向异性范围内)对应于小的粗粒化结构曲率方向。
将这一识别与热力学配对条件相结合,得到:
\[
\boxed{m_{\mathrm{large}} \longleftrightarrow \text{低结构曲率数据自适应子空间}.} \tag{9}
\]
在这一类函数空间中,条件热力学贡献因此倾向于将更快的松弛与数据加权函数几何的低曲率子空间配对。
总之,这些结果表明,函数空间为学习的统计力学提供了一个自然的宏观层面。在这个层面,学习动态可以从底层参数化提供的统计约束中分离出来:前者决定函数空间状态如何演化,而后者决定哪些此类状态允许多个微观实现,以及这些实现如何组织。在本工作中,这种分离揭示了特征演化方向上的热力学偏好。更广泛地说,相同的视角可能为研究学习的其他稳定集体结构(包括表示几何、谱组织和稳定性)提供一条途径,而无需完全描述微观参数轨迹。
#### 贡献。我们的主要贡献是:
- • 我们发展了一种直接在函数空间中对神经网络训练进行条件统计力学表述的方法。宏观统计定律在选择特定架构之前就已表述,具体的神经网络作为该定律的微观实现进入。
- • 我们展示了参数空间微观态多重性如何诱导函数空间态密度和局部统计曲率算子 \(B\),从而将动力学几何 \(M\) 与参数化提供的统计几何分离开来。
- • 我们推导了算子自由能的条件涨落贡献,并证明其旋转平稳点满足 \([M,B] = 0\)。在固定谱轨道上,该贡献通过反向谱配对(即 \(M\) 的较大本征值与 \(B\) 的较小本征值匹配)全局最小化,其梯度在匹配状态周围提供了一个局部恢复力贡献。
- • 对于在温和稳定统计边界条件下的 ReLU 类型函数空间,我们证明了 \(B = \sigma_{\xi}^{2} L^{\ast} \mathcal{K} L\),并且其谱度量了粗粒化的结构曲率(在结构熵度量的有界各向异性范围内)。将这一结果与条件算子偏好相结合,产生了将更快的松弛与低曲率数据自适应子空间配对的热力学偏好。
论文的剩余部分分三步阐述这些结果。第3节 (https://arxiv.org/html/2609.09589#S3) 构建了误差涨落的条件统计力学。第4节 (https://arxiv.org/html/2609.09589#S4) 分析了条件算子自由能贡献及其配对几何。第5节 (https://arxiv.org/html/2609.09589#S5) 将由此产生的微观态曲率与 ReLU 函数空间的结构光滑性联系起来。
## 2 相关工作
#### 核极限与特征学习。大量工作通过函数空间核来表征神经网络训练。在无限宽神经切线核(NTK)极限下,梯度下降由一个近似固定的核控制,不同的函数空间模式以相应核本征值设定的速率学习 [Jacot et al. (2018) (https://arxiv.org/html/2609.09589#bib.bib8)]。这种固定核的描述与惰性训练机制密切相关,在该机制中,网络保持在其初始线性化附近 [Chizat et al. (2019) (https://arxiv.org/html/2609.09589#bib.bib9)]。后续工作强调了这类核机制与更丰富的训练机制(其中表示本身演化)之间的区别 [Woodworth et al. (2020) (https://arxiv.org/html/2609.09589#bib.bib10)]。最近的分析明确推导了特征学习极限中的自适应核和演化谱结构 [Lauditi et al. (2025) (https://arxiv.org/html/2609.09589#bib.bib11); Lauditi et al. (2026) (https://arxiv.org/html/2609.09589#bib.bib12)]。
我们的工作涉及后一种机制,但颠倒了通常的构建顺序。我们不是从指定的神经网络模型开始并推导模型特定的宏观变量,而是在函数空间层面表述条件统计力学,然后探讨具体模型如何实现它。相似文章
基于贝叶斯滤波的噪声测量下拉格朗日动力学学习方法
本文提出了一种基于贝叶斯滤波的方法,通过使用神经网络参数化动能和势能,并通过最大似然估计联合估计状态和参数,从部分且含噪声的测量中学习拉格朗日动力学。
循环神经网络中学习诱导的动力学转变
本文提出了一种用于循环神经网络中学习诱导转变的动力学平均场理论,展示了反馈驱动的学习如何将网络动力学从混沌转变为稳定。
面向切换动态序列的时变深度状态空间模型
本文提出了一类时变深度状态空间模型,其动态特性通过基函数展开进行学习,从而能够自适应建模切换系统。该方法在合成切换数据和语音去噪任务上均优于时不变模型。
随机动力系统中嵌入潜在转移算子的深度谱学习
提出了一种利用深度特征空间和基于算子的潜在状态空间模型的随机非线性动力系统的谱学习方法,在预测和滤波任务中表现出稳定的性能。
以人为中心的学习机制:熵正则化表示学习的动态框架
本文提出了以人为中心的学习机制(HCLM),这是一个用于研究开放和受控学习系统的动态信息理论框架。它通过有效信息力形式化了熵正则化,推导了收敛性和泛化结果,并提供了对尺度律行为的条件性解释。