超越小初始化的正交多指标模型学习:增量学习、竞争动态与对称性

arXiv cs.LG 论文

摘要

本文研究了在标准初始化下,双层神经网络学习正交多指标模型的训练动态,揭示了增量学习和竞争性参数重分配现象,并引入了一种基于对称性的有限宽度近似方法用于分析。

arXiv:2609.10879v1 Announce Type: new 摘要:近期工作已识别出在浅层网络训练单指标和多指标模型时的增量学习现象。然而,现有分析通常依赖于简化设置,如小初始化、相关性损失或逐层训练。这些选择减少了神经元相互作用,使得标准初始化下的一些特征学习动态未被探索。我们研究了在标准初始化下使用多项式数量样本,多项式宽度双层网络学习正交多指标目标的训练动态。我们首先证明了增量学习仍然发生:损失根据目标的Hermite展开顺序下降,低阶分量先于高阶分量恢复个体目标方向被学习。在这一标准初始化状态下,训练还显示出竞争性参数质量重分配:在总质量拟合目标均值并稳定后,质量转移到目标子空间,然后集中到对齐的神经元上。我们的理论分析使用了轻微修改的梯度流,而原始梯度下降在经验上表现出相同的定性动态。技术上,我们通过对称网络引入了基于对称性的有限宽度近似,而不是直接与无限宽度极限比较。这提供了更好的近似误差控制,可能具有独立意义。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:21

# 超越小规模初始化的正交多指标模型学习:增量学习、竞争动态与对称性  
来源:https://arxiv.org/html/2609.10879  
作者:Weihang Xu(华盛顿大学)、Simon S. Du(华盛顿大学)、Maryam Fazel(华盛顿大学;亚马逊公司)  
联系邮箱:{mozhou17,xuwh,ssdu}@cs.washington.edu, [email protected]  

###### 摘要  
近期研究揭示了在单指标模型和多指标模型上训练的浅层网络中的增量学习现象。然而,现有分析通常依赖于简化设定,如小规模初始化、相关损失或逐层训练。这些选择减少了神经元间的相互作用,未能充分探索标准初始化下的特征学习动态。本文研究了在标准初始化下,多项式宽度的两层网络通过多项式数量样本学习正交多指标目标时的训练动态。我们首先证明增量学习仍然存在:损失按照目标函数的Hermite展开逐阶递减,低阶分量先被学习,高阶分量随后恢复各个目标方向。在标准初始化设定下,训练还表现出参数质量的竞争性重分配现象:当总参数质量拟合目标均值并稳定后,质量向目标子空间转移,最终集中到与目标方向对齐的神经元上。我们的理论分析采用了略微修改的梯度流,而标准梯度下降在经验上表现出相同的定性动态。技术上,通过对称化网络引入基于对称性的有限宽度近似方法,而非直接与无限宽度极限进行比较。这提高了对近似误差的控制能力,并可能具有独立的研究价值。  

## 1 引言  
理解神经网络如何学习结构化目标函数是特征学习理论的核心问题。一个经典设定是浅层网络学习低维目标函数,如单指标模型和多指标模型(Arous et al., 2021;Damian et al., 2022;Ba et al., 2022;Bietti et al., 2022;Mousavi-Hosseini et al., 2022;Glasgow, 2023;Lee et al., 2024;Troiani et al., 2024;Collins-Woodfin et al., 2024;Zhou and Ge, 2024;Montanari and Wang, 2026;另见近期综述Bruna and Hsu, 2025)。在这些模型中,目标函数仅依赖于输入的几个相关方向,因此特征学习等价于通过梯度训练发现这些隐藏方向。  

此场景中一个特别有趣的现象是**增量学习**:网络并非一次性学习目标的所有部分,而是以结构化顺序逐步学习(Abbe et al., 2022;Abbe et al., 2023;Dandi et al., 2024;Bietti et al., 2023)。在高斯输入下,这一顺序自然由目标函数的Hermite展开描述:低阶分量先被学习,高阶分量在后续阶段对于识别相关方向变得重要。  

对于多指标模型,近期一系列工作(Li et al., 2020;Ge et al., 2021;Oko et al., 2024;Ren and Lee, 2024;Şimşek et al., 2024;Ren et al., 2025)研究了如下形式的目标函数:  
\[
f_{*}(\{\\bm{x}\})=\sum_{i=1}^{r}a_{i}^{*}\sigma(\{\\bm{w}\}_{i}^{*\top}\{\\bm{x}\}),\qquad\{\\bm{x}\}\sim N(\{\\bm{0}\},\{\\bm{I}\}_{d}),
\]  
其中目标方向 \(\{\{\\bm{w}\}_{i}^{*}\}\_{i=1}^{r}\) 是标准正交的。现有分析通常依赖简化修改,如小规模初始化、相关损失或逐层训练(Damian et al., 2022;Damian et al., 2023;Şimşek et al., 2024;Zhang et al., 2025;Ren and Lee, 2024)。这些选择通过降低当前网络输出在梯度信号中的作用使动态更易处理,使得每个神经元近似放大其与目标的弱初始相关性。因此,尽管这些工作确立了增量学习的多种形式,但它们留下了更具挑战性的标准初始化设定——其中网络输出不可忽略,神经元通过其集体预测相互作用。这种交互显著改变了学习机制,需要新的分析技术。  

本文表明,在标准初始化下增量学习仍然持续,但机制不同。群体损失按Hermite阶数递减:网络先拟合均值,然后通过二阶分量恢复目标子空间,最后利用高阶分量识别各个目标方向。该过程并非简单的弱对齐神经元的独立放大。均值被拟合后,总参数质量受到有效约束,后续阶段通过**竞争性**重分配该质量进行学习:首先从无关方向转移到目标子空间,然后从分散的目标子空间神经元集中到与各个目标方向对齐的神经元上。  

###### 定理 1.1(定理3.1的非正式版本)  
在标准随机初始化下,对多项式宽度两层网络使用(修改的)梯度流,通过多项式数量的样本可将正交多指标目标训练至小群体损失。此外,损失按目标函数的Hermite展开递减,参数质量经历如图1所述的竞争动态。这揭示了标准初始化下特征学习的竞争性质量重分配机制。  

![图1](https://arxiv.org/html/2609.10879/S1.F1)  
*图1:学习正交多指标目标(1)的训练动态。左图:损失递减,低阶Hermite分量先于高阶分量被拟合。中图:总质量快速稳定后,质量从无关方向转移至目标子空间。右图:质量从密集、未对齐的神经元集中到目标对齐的神经元。“质量”定义为指定子空间或神经元组上的平均参数范数平方。训练使用标准梯度下降,参数设置为 \(d=100, r=20, m=250, n=50000\)。此处展示的标准梯度下降轨迹表现出与定理3.1在(3)下刻画的动态相同的定性分阶段行为。*  

### 1.1 相关工作、关键挑战与我们的贡献  

##### 超越小规模初始化的增量学习  
越来越多的研究表明,浅层网络可以增量式地学习低维目标。在稀疏和单指标设定中,这表现为鞍点到鞍点的动态(Saxe et al., 2013;Jacot et al., 2021;Pesme and Flammarion, 2023),其中高阶相关性在训练过程中逐渐出现(Damian et al., 2023;Bietti et al., 2022;Lee et al., 2024;Berthier et al., 2025)。对于多指标模型,相关工作研究了阶梯动态(Abbe et al., 2022;Abbe et al., 2023)并确立子空间或方向恢复,通常通过轻微修改(如小规模初始化、相关损失或逐层训练)以获得强理论保证(Damian et al., 2022;Dandi et al., 2024;Şimşek et al., 2024;Ren and Lee, 2024;Oko et al., 2024;Zhang et al., 2025;Ren et al., 2025)。这些结果共同表明,基于梯度的方法可以利用目标的Hermite结构来恢复隐藏的低维特征。  

这些分析可处理的一个共同原因是动态近似由目标驱动。在小规模初始化(尺度 \(\alpha \ll 1\))下,两层学习器在早期特征学习阶段保持 \(f_t \ll f_*\)。因此每个神经元主要受其与目标的相关性驱动,多神经元动态近似解耦。然而,在标准初始化下,网络输出从一开始即不可忽略,神经元通过共享预测相互作用,因此这种解耦图像不再适用。  

我们的第一个贡献是证明在此交互机制下增量学习仍然持续。在标准随机初始化以及多项式数量神经元和样本的条件下,所分析动态的群体损失按Hermite阶数递减。这扩展了增量学习分析超越先前工作研究的小规模初始化设定。相关结果已存在,但通常依赖于无限宽度极限或非参数动态(Berthier et al., 2025;Bietti et al., 2023)。  

##### 特征学习中的竞争动态  
许多在小规模初始化下特征学习动态的现有分析大体上归结为一种放大机制:\(\dot{x}=ax^P\),其中 \(P \geq 1, a>0\)(例如Allen-Zhu and Li, 2020;Cao et al., 2022;Ge et al., 2021;Şimşek et al., 2024;Ren et al., 2025)。这描述了有用特征如何从其与目标的弱初始相关性增长。然而在标准初始化下,特征学习也可能具有竞争性:参数种群的不同部分相互作用,一个分量的增长可能以另一个分量的损失为代价。  

我们明确识别了这种竞争效应。在零阶分量被拟合后,总参数质量受到有效约束。在二阶学习期间,质量从无关方向转移至目标子空间。在高阶学习期间,质量从未对齐的神经元转移至与各个目标方向对齐的神经元。因此机制不仅是初始对齐较好的神经元的放大,还包括跨方向和神经元的竞争性质量重分配。由此产生的有效动态具有Lotka-Volterra型结构(Hofbauer and Sigmund, 1998;见第5节)。竞争效应也出现在其他现象中,如grokking(Varma et al., 2023;Lyu et al., 2023)和大型语言模型机制研究中的电路竞争(Ortu et al., 2024;Lindsey et al., 2025)。我们在一个解析可处理的设定中精确刻画了其中一种竞争机制。  

##### 基于对称性的有限宽度近似  
主要技术挑战在于控制标准初始化下的神经元交互。平均场分析通过无限宽度极限捕获此类交互(Chizat and Bach, 2018;Mei et al., 2018;Chizat et al., 2019),但将这些极限转化为定量有限宽度保证可能需要非常大的宽度、大量样本或限制于短时间范围(Mousavi-Hosseini et al., 2024;Wang et al., 2024;Takakura and Suzuki, 2024;Berthier et al., 2025;Montanari and Urbani, 2025)。近期工作开发了受混沌传播启发(Sznitman, 2006;Chaintron and Diez, 2022)的有限宽度耦合技术,通过比较有限网络与其无限宽度极限获得多项式运行时间和样本复杂度(Li et al., 2020;Mahankali et al., 2023;Glasgow et al., 2025)。然而,这种耦合在高精度设定中仍然微妙,因为所需宽度可能超多项式依赖于目标精度 \(1/\varepsilon\)。一个关键困难是目标方向附近的逐粒子耦合:在有限宽度网络中,最终与目标对齐的神经元来自有限样本中最有利初始化的粒子;但在无限宽度极限下,存在任意更好初始对齐的粒子,它们可能移动得比任何固定有限对应粒子更快,导致大耦合误差。  

我们转而利用目标和群体动态的对称性构建一个有限**对称化网络**。该网络保留了使群体动态可处理的不变性,同时与实际网络保持直接的有限粒子对应关系。随后我们证明实际的有限宽度经验动态保持接近该对称化对应网络;见第6节。这避免了将神经元投影到球面上,并给出了多项式宽度耦合界,使我们能控制标准初始化下分析的有限宽度训练轨迹。  

##### 与正交多指标模型相关工作的比较

相似文章

矩阵正交化提升循环模型的记忆能力

Hacker News Top

这项工作提出对mLSTM循环模型的记忆矩阵进行正交化,以提高其在噪声关联回忆任务上的性能。实验表明,与基线mLSTM相比,使用牛顿-舒尔茨迭代进行只读正交化可提升验证准确率。