在失忆与混沌之间:可训练耗散振荡器网络的记忆稳定性表现力三难困境
摘要
本文提出了可训练耗散振荡器网络的记忆-稳定性-表现力三难困境,表明阻尼同时控制这三者并限制了可训练性,通过在20振荡器网络上的实验验证确认了理论界限。
arXiv:2606.09929v1 公告类型:新提交
摘要:物理储层计算利用非线性机械动力学,但通常固定基底,仅训练线性读出层,假定基底不具备实用的可训练性。我们重新审视了这一前提,针对非线性振荡器网络,其质量、阻尼和刚度通过辛积分器进行端到端学习。我们的核心结果是一个三难困境:记忆视野、梯度稳定性和动态表现力无法同时最大化,因为三者均由阻尼控制。反向梯度以阻尼设定的速率衰减,限制了信用反向传播的距离,而前向敏感性则以最大李亚普诺夫指数呈指数增长,因此可用梯度要求阻尼高于稳定性下限。由于李亚普诺夫指数随阻尼增加而下降,而记忆上限随视野增长而下降,稳定训练被限制在一个随视野收缩并在临界点闭合的带状区域内。我们在二十个振荡器网络上逐步验证了所有步骤。阻尼扫描发现最大李亚普诺夫指数单调变化,并在明确的稳定性下限处穿过零点,证实了定理的关键假设。通过计算匹配的对比,比较了学习基底与固定基底在九个视野上的延迟召回性能,结果显示学习基底在短视野上占优,但在接近十一步视野时优势消失并反转,这是带状闭合的预测特征;训练后的模型自然收敛到稳定性下限附近,自动寻求混沌边缘。分析上限高估了经验交叉点约五倍,这是可检测梯度与可学习梯度之间的差距,我们如实报告而非调优消除。本文的贡献在于对物理基底何时优于固定基底提供了确证的说明。
查看缓存全文
缓存时间: 2026/06/10 06:18
# 可训练耗散振荡器网络的记忆-稳定性-表达性三元矛盾
来源: https://arxiv.org/html/2606.09929
###### 摘要
物理储备池计算利用非线性机械动力学,但按惯例,它冻结基底并且只训练线性读出层,假设基底并非有用的可训练对象。我们重新审视了非线性振荡器网络的这一前提,其质量、阻尼和刚度通过辛积分器进行端到端学习。我们的核心结果是一个*三元矛盾*:记忆时域、梯度稳定性和动态表达能力不能同时最大化,因为三者都受阻尼控制。反向梯度以速率γ/2衰减,将记忆上限限制为 H ≤ 2/γ_min log(1/ε),而前向敏感性以 e^(λ_max T) 增长,因此可用的梯度要求阻尼高于一个稳定性下限。由于李雅普诺夫指数随阻尼下降,记忆上限随记忆时域下降,稳定训练被限制在一个随 H 收缩并在临界时域 H_c 处闭合的带内。我们在一个 20 振荡器网络上测试了每个步骤。阻尼扫描发现最大李雅普诺夫指数单调变化,并在 γ⋆ = 0.121 处穿过零,证实了定理的关键假设。在九个记忆时域上,对学习型基底与冻结型基底进行延迟召回任务的算力匹配比较表明,学习型基底在短时域上占优(H=1 时为 1.00 对比 0.88),优势在 H ≈ 11 附近缩小并反转,这是带闭合的预期特征;训练后的模型自发地稳定在 γ⋆ 附近,寻找混沌边缘。分析上限对经验交叉点的估计大约高出五倍,这是我们报告而非调优的可检测梯度与可学习梯度之间的差距。贡献在于提供了一个经过验证的几何解释,说明何时训练物理基底优于冻结它。
关键词: 物理储备池计算, 神经常微分方程, 动力系统, 李雅普诺夫指数, 辛积分, 序列建模, 混沌边缘。
## 1 引言
当实践者将物理系统用作计算基底时,其吸引力通常在于可解释性:质量弹簧网络遵循牛顿定律,其状态具有命名的物理意义,其行为由可写下的方程支配。希望基于“纯物理”构建的模型会比由不可理解的权重组成的神经网络更易理解。这一希望是大量物理储备池计算文献的起点,在这些文献中,振荡器晶格、忆阻薄膜、软体或光学腔的丰富非线性动力学被用于计算[8 (https://arxiv.org/html/2606.09929#bib.bib8),7 (https://arxiv.org/html/2606.09929#bib.bib7)]。
这些文献在一个近乎普遍的惯例下运作:物理基底被*冻结*,只有其瞬时状态上的线性读出层被训练。这种冻结并非偶然。它基于一个隐含前提:介质要么无法进行基于梯度的调优,要么调优成本不划算。两个进展使得直接质疑这一前提成为可能。神经常微分方程的伴随灵敏度方法[1 (https://arxiv.org/html/2606.09929#bib.bib1)]允许我们通过连续动力系统的解进行微分,而保结构积分器[3 (https://arxiv.org/html/2606.09929#bib.bib3),2 (https://arxiv.org/html/2606.09929#bib.bib2),6 (https://arxiv.org/html/2606.09929#bib.bib6)]使得这些梯度在长时间范围内保持准确。我们现在可以构建一个非线性弹簧网络,求解其运动方程,并端到端地学习弹簧和阻尼参数。
本文提出的问题不是*是否*可以进行此类训练(答案是肯定的),而是*何时*值得这样做,以及什么基本障碍支配着答案。我们发现这个障碍是尖锐的,并且具有简洁的几何形式。控制耗散系统记忆其输入时间长短的阻尼系数,与控制其前向敏感性(以及用于训练它的梯度)是否保持有界的阻尼系数是同一个量。强阻尼提供稳定的梯度但短记忆;弱阻尼提供长记忆,但在耦合非线性系统中会导致混沌和梯度爆炸。这两个需求相互冲突,满足两者的阻尼区域是一个随着所需记忆时域增长而收缩的带。
本文不同于立场文章之处在于,我们构建了系统并测量了每一个主张。我们实现了一个带有辛积分器的可微振荡器网络,使用 Benettin 算法估计李雅普诺夫指数,并运行了一个受控的学习型与冻结型比较实验。这些测量证实了定理的定性结构,并且同样有用的是,揭示了临界时域的最简单解析估计在何处过于宽松。
我们做出三个相互关联的贡献。首先,一个*三元矛盾*:一个定理表明记忆时域、梯度稳定性和表达能力受阻尼共同约束,可行训练带随时域收缩,并在临界 H_c 处闭合。其次,一个*方法*:混沌边缘训练,使用能量有界参数化和辛积分使梯度可信。第三,一个*实证测试*:一个算力匹配比较,其输出根据设计要么证实要么反驳核心预测,并且我们将其运行至完成。
我们有意不声称:通用逼近结果(继承自神经常微分方程文献,非我们所有);因“是物理”而具有的可解释性(我们在第7节 (https://arxiv.org/html/2606.09929#S7) 中反对此观点);以及与大型语言模型的竞争力(评估机械基底时错误的轴)。
本文结构如下。第2节 (https://arxiv.org/html/2606.09929#S2) 综述相关工作。第3节 (https://arxiv.org/html/2606.09929#S3) 陈述模型并证明能量有界性。第4节 (https://arxiv.org/html/2606.09929#S4) 预注册主张。第5节 (https://arxiv.org/html/2606.09929#S5) 证明三元矛盾。第6节 (https://arxiv.org/html/2606.09929#S6) 介绍训练方法。第7节 (https://arxiv.org/html/2606.09929#S7) 界定可解释性主张。第8节 (https://arxiv.org/html/2606.09929#S8) 介绍实验设置。第9节 (https://arxiv.org/html/2606.09929#S9) 和 第10节 (https://arxiv.org/html/2606.09929#S10) 报告测量的李雅普诺夫扫描以及学习型与冻结型比较。第11节 (https://arxiv.org/html/2606.09929#S11) 讨论结果,包括解析与经验 H_c 的差距。
## 2 相关工作
### 2.1 神经常微分方程
Chen 等人 [1 (https://arxiv.org/html/2606.09929#bib.bib1)] 引入了将深度网络的前向传播视为常微分方程解,并通过伴随灵敏度方法进行训练的处理方式。我们的模型是一种向量场被约束为机械形式的神经常微分方程,我们分析的梯度衰减和梯度爆炸现象是递归网络中长期研究的现象的连续时间模拟。
### 2.2 保结构与物理信息网络
哈密顿神经网络[3 (https://arxiv.org/html/2606.09929#bib.bib3)]和拉格朗日神经网络[2 (https://arxiv.org/html/2606.09929#bib.bib2)]将守恒定律融入学习到的动力学中。辛积分器[6 (https://arxiv.org/html/2606.09929#bib.bib6)]保存一个影子哈密顿量,对于长期保真度至关重要。我们的设置不同之处在于它是*耗散和受迫的*而非保守的,并且我们的焦点是训练可行性的几何,而非拟合已知物理系统。我们借用辛机制来保持梯度在低阻尼边缘附近的准确性。
### 2.3 物理储备池计算
物理储备池计算[8 (https://arxiv.org/html/2606.09929#bib.bib8),7 (https://arxiv.org/html/2606.09929#bib.bib7)]用输入信号驱动一个固定的非线性介质,并仅训练其产生的瞬态状态上的线性读出层。介质有意不被训练,该领域的实际结果依赖于手动将介质调优至混沌边缘。这是我们的三元矛盾所质疑的传统:我们提供了一个关于*何时*冻结基底是唯一稳定选择的原理性解释,并直接运行受控的学习型与冻结型比较实验。
### 2.4 状态空间模型与非线性的放置
现代长序列架构[4 (https://arxiv.org/html/2606.09929#bib.bib4),5 (https://arxiv.org/html/2606.09929#bib.bib5)]保持时间递归为线性,并将非线性推入逐点门控,实现了长记忆而无非线性递归的不稳定性。我们的三元矛盾为此选择是有效被迫的提供了一种解释:在耗散非线性递归中,长记忆所需的阻尼与超过临界时域时稳定梯度所需的阻尼不兼容。
### 2.5 本文填补的空白
上述每个传统单独来看都已成熟。尚未被清晰阐述的是*训练过的*机械基底的三种失效模式之间的耦合,以及由此产生的决定何时训练基底优于冻结它的几何结构。本文以一个定理、一个赋能方法以及一个实测比较提供了这一阐述。
## 3 模型与能量有界性
### 3.1 运动方程
考虑 N 个耦合振荡器,位置 x ∈ ℝ^N,速度 v ∈ ℝ^N,对角质量矩阵 M = diag(m_1, ..., m_N) ≻ 0,对角阻尼 Γ = diag(γ_1, ..., γ_N) ⪰ 0,以及一个学习到的势能 Φ。令可学习参数 θ 包含质量、阻尼、刚度和输入映射 B,输入 u(t),动力学方程为
M ẍ = −∇_x Φ(x; θ) − Γ ẋ + B u(t).
提升为一阶,令 z = (x, v) ∈ ℝ^{2N},得到一个向量场受机械约束的神经常微分方程,以及一个线性读出层 ŷ = W z(T) + b。我们使用*饱和弹簧*:固定图上的每个耦合 (i, j) 贡献力 k_{ij} tanh(r / a_{ij}),其中 r = x_i − x_j,势能为 Φ_{ij}(r) = k_{ij} a_{ij}^2 log cosh(r / a_{ij})。有界力是挤压激活函数的机械模拟,势能本身具有约束性。
### 3.2 通过构造确保稳定性
我们通过无约束潜在变量的 softplus 函数参数化质量、阻尼、刚度和尺度,因此所有物理量为正,且势能径向无界且下有界。
#### 命题 1 (能量有界的前向传播)。
令 E(z) = ½ v^T M v + Φ(x; θ)。沿动力学方程有
Ė = −v^T Γ v + v^T B u(t) ≤ −γ_min ‖v‖^2 + ‖B‖ ‖v‖ ‖u(t)‖,
因此对于有界输入 ‖u(t)‖ ≤ U,次水平集 {E ≤ E⋆} 是前向不变的,其中 E⋆ = Φ_min + ‖B‖^2 U^2 / (2 m_min γ_min^2);轨迹不会逃逸至无穷。保守力贡献 ẋ^T ∇_x Φ,在 Ė 中抵消;Young 不等式和径向无界性给出了不变集。我们在数值上确认了这一点:在短暂输入冲击后,对无阻尼网络进行辛滚动,总能量在一个有界的 14% 振荡内守恒,且在 400 步内无长期漂移,这正是保守系统上辛积分器的预期特征。
## 4 预注册主张
#### H1 (记忆上限)。
耗散系统的反向梯度幅值以速率 γ_min / 2 衰减,因此可用记忆时域满足 H ≤ (2 / γ_min) log(1 / ε)。
#### H2 (稳定性下限)。
前向敏感性以及反向计算的梯度以 e^{λ_max T} 增长。由于 λ_max 在阻尼向哈密顿极限下降时增加,数值可用的梯度施加了下界 γ ≥ γ⋆(T)。最大李雅普诺夫指数在阻尼中单调递减,并在 γ⋆ 处穿过零。
#### H3 (三元矛盾与带闭合)。
可行训练带 γ⋆ ≤ γ ≤ γ̄(H) 的宽度随 H 减小,并在临界时域 H_c 处闭合。
#### H4 (仅在带内学习型优于冻结型)。
在匹配算力下,训练基底在小 H 时优于冻结基底,随着 H 增长优势缩小,并在 H_c 附近两者交叉。自由训练的学习模型会将其阻尼稳定在稳定性下限附近(混沌边缘)。
#### H5 (可解释性是动态的,而非静态的)。
训练后的非线性振荡器网络保留相空间可解释性,但失去静态权重可解释性;输入-输出映射无法从方程中直接解读。
## 5 记忆–稳定性–表达性三元矛盾
通过 ODE 进行梯度下降训练会反向传播一个协状态:ȧ = −(∂f / ∂z)^T a [1 (https://arxiv.org/html/2606.09929#bib.bib1)]。在有效刚度 K = ∇_x^2 Φ 的操作点附近线性化,雅可比矩阵具有块形式 [[0, I], [−M^{−1}K, −M^{−1}Γ]],对于模态频率 ω 和模态阻尼 γ,其特征值为 s_± = −γ/2 ± √(γ^2/4 − ω^2),在欠阻尼区域实部为 −γ/2。
### 5.1 反向衰减设定记忆上限
线性化耗散系统的梯度幅值满足 ‖a(t)‖ ∼ e^{−(γ_min / 2)(T − t)}。将记忆时域 H 定义为梯度幅值降至其最终值的分数 ε 以下的滞后,得到上限 H ≤ (2 / γ_min) log(1 / ε)。图1 (https://arxiv.org/html/2606.09929#S5.F1) 显示了实验中出现的三个阻尼的衰减包络。更强的阻尼限制了信用可以反向传播的距离,因此长记忆需要小的 γ。
参见图注
图 1: 反向梯度幅值与滞后关系,绘制于冻结基底阻尼 (γ=0.077)、测量的稳定性下限 (γ⋆=0.121) 以及过阻尼值 (γ=0.40)。相似文章
基于数据驱动的离散时间深度循环神经网络的耗散系统建模
本文提出DissipNet,一种深度离散时间耗散循环神经网络,通过结构约束显式地强制执行耗散性,以确保耗散系统的稳定建模,优于传统的循环神经网络和物理信息神经网络。
Transformer 记忆的吸引子几何:从冲突仲裁到自信幻觉
本文提出了一个统一的几何框架,用于理解 Transformer 的内存故障,通过隐藏状态吸引子盆地(attractor basins)区分冲突仲裁与幻觉。研究表明,随着模型规模的扩大,几何边际(geometric margin)在检测这些故障方面优于输出熵。
固有噪声巩固:一种Doob势垒条件化扩散将模拟器件噪声转化为持续学习资源
本文提出将模拟神经形态硬件上的固有器件噪声作为持续学习的资源,通过条件化每个权重的随机动力学以避免跨越记忆关键势垒,展示了非单调的保持性能提升,并在BrainScaleS-2硅基芯片上进行了验证。
循环神经网络中学习诱导的动力学转变
本文提出了一种用于循环神经网络中学习诱导转变的动力学平均场理论,展示了反馈驱动的学习如何将网络动力学从混沌转变为稳定。
在顺序训练的早退出神经网络中平衡稳定性与可塑性
本文针对顺序训练的早退出神经网络中的灾难性遗忘问题,提出了两种分别基于弹性权重巩固(Elastic Weight Consolidation)和无遗忘学习(Learning without Forgetting)的方法,旨在在添加新退出点的同时保留早期退出点的性能。