人工神经网络中纤维化、压缩和对称性破缺的涌现
摘要
本文提出一个理论框架,表明神经网络中的学习会产生图对称性(纤维化和覆盖),从而能够显著压缩模型并提升持续学习性能。
arXiv:2609.01768v1 公告类型:新
摘要:人工神经网络通常被视为强大但不透明的黑箱。本文中,我们证明深度神经网络中的学习会产生局部对称性,这些对称性在图论中称为纤维化和覆盖。我们证明覆盖对称性是随机梯度下降的稳定吸引子。与这一理论一致,我们报告了覆盖对称性在主要网络架构中的涌现,包括多层、卷积、循环和Transformer网络。利用这些对称性可以实现显著的模型压缩——将网络大小减少到原始大小的17%,而不牺牲性能。此外,通过控制覆盖对称性的破缺可以克服可塑性损失,在持续学习中达到最先进的性能。理论结果为基于对称性的AI系统提供了新的基础,该系统将黑箱转换为可解释的有色图,并实现更高效的推理和终身学习。
查看缓存全文
缓存时间: 2026/09/03 06:10
# 人工神经网络中纤维化、压缩与对称性破缺的涌现 来源:https://arxiv.org/html/2609.01768 Osvaldo M\. Velarde 邮箱:[ovelarde@ccny\.cuny\.edu](mailto:[email protected]) 所属机构:纽约城市学院Levich研究所与物理系,美国纽约州纽约市康弗特大道160号,邮编10031 Lucas C\. Parra 邮箱:[parra@ccny\.cuny\.edu](mailto:[email protected]) 所属机构:纽约城市学院生物医学工程系,美国纽约州纽约市康弗特大道160号,邮编10031 Alireza Hashemi 邮箱:[ahashemi@ccny\.cuny\.edu](mailto:[email protected]) 所属机构:纽约城市学院Levich研究所与物理系,美国纽约州纽约市康弗特大道160号,邮编10031 Hernán A\. Makse 邮箱:[hmakse@ccny\.cuny\.edu](mailto:[email protected]) 所属机构:纽约城市学院Levich研究所与物理系,美国纽约州纽约市康弗特大道160号,邮编10031 ###### 摘要 人工神经网络通常被视为强大却不透明的“黑箱”。本研究证明,深度神经网络中的学习过程会生成图论中称为纤维化(fibrations)和覆叠(coverings)的局部对称性。我们从数学上证明,覆叠对称性是随机梯度下降的稳定吸引子。与此理论一致,我们报告了在主要网络架构(包括多层网络、卷积网络、循环网络和Transformer网络)中覆叠对称性的涌现。利用这些对称性可实现显著的模型压缩——在不牺牲性能的情况下将网络压缩至原始大小的17%。此外,通过精心打破覆叠对称性,可以克服塑性丧失问题,在持续学习中达到最先进的性能水平。这些理论结果为基于对称性的AI系统提供了新基础,能将“黑箱”转化为可解释的“着色图”,并实现更高效的推理和终身学习。 ###### 关键词 图纤维化,网络压缩,持续学习,对称性破缺 ## 1 引言 尽管神经网络架构日益强大,我们对其内部结构的理解仍然有限。它们常被视为黑箱,无法解释其网络连接如何捕捉训练数据的规律性。在缺乏理论支撑的学习理解下,人工智能的近期发展主要由经验性缩放定律驱动[1 (https://arxiv.org/html/2609.01768#bib.bib1), 2 (https://arxiv.org/html/2609.01768#bib.bib2)],导致模型规模不断增大。将缩放作为理解替代品的依赖带来了重大挑战。单次大规模训练运行成本高昂且能耗巨大,若顺序训练,网络可能随时间推移出现塑性丧失问题[3 (https://arxiv.org/html/2609.01768#bib.bib3), 4 (https://arxiv.org/html/2609.01768#bib.bib4), 5 (https://arxiv.org/html/2609.01768#bib.bib5)]。此外,从头训练大模型数据效率低下,需要极其庞大的数据集。在缺乏原则性指导的情况下,架构设计成为耗时的试错过程。最后,当模型过度参数化时,悖论的是它们在实践中仍然表现良好[6 (https://arxiv.org/html/2609.01768#bib.bib6)],这仍是理论争论的焦点[7 (https://arxiv.org/html/2609.01768#bib.bib7), 8 (https://arxiv.org/html/2609.01768#bib.bib8)]。 为应对这些挑战,我们提出新的理论框架,通过图对称性的视角分析深度神经网络的内部结构。虽然全局对称群是几何深度学习(GDL)[9 (https://arxiv.org/html/2609.01768#bib.bib9)]和我们对理论物理理解[9 (https://arxiv.org/html/2609.01768#bib.bib9), 10 (https://arxiv.org/html/2609.01768#bib.bib10), 11 (https://arxiv.org/html/2609.01768#bib.bib11)]的基础,但它们过于刚性,无法捕捉人工和生物神经系统中观察到的多样性[12 (https://arxiv.org/html/2609.01768#bib.bib12), 13 (https://arxiv.org/html/2609.01768#bib.bib13), 14 (https://arxiv.org/html/2609.01768#bib.bib14), 15 (https://arxiv.org/html/2609.01768#bib.bib15)]。例如,现有的机器学习应用严重依赖严格的全局对称性,如卷积神经网络中的平移等变性[16 (https://arxiv.org/html/2609.01768#bib.bib16), 17 (https://arxiv.org/html/2609.01768#bib.bib17)]或图神经网络中的置换等变性[18 (https://arxiv.org/html/2609.01768#bib.bib18), 19 (https://arxiv.org/html/2609.01768#bib.bib19), 20 (https://arxiv.org/html/2609.01768#bib.bib20), 9 (https://arxiv.org/html/2609.01768#bib.bib9)]。 相反,我们识别出在计算图的输入和输出树中自然涌现的限制较少的局部对称性。这些局部对称性在图论中称为纤维化、余纤维化和覆叠[21 (https://arxiv.org/html/2609.01768#bib.bib21), 12 (https://arxiv.org/html/2609.01768#bib.bib12)]。它们最初由格罗滕迪克作为范畴论中的映射引入[22 (https://arxiv.org/html/2609.01768#bib.bib22)],后被改造用于图[21 (https://arxiv.org/html/2609.01768#bib.bib21), 23 (https://arxiv.org/html/2609.01768#bib.bib23)]。 本文提供了一个统一的数学框架,证明随机梯度下降是局部对称性形成的机制。我们从数学上证明,由于权重更新的“同步学习”,覆叠对称性在随机梯度下降中涌现。这种同步学习诱导了纤维化对称性,为深度网络中常报道的神经活动同步现象提供了形式化解释[15 (https://arxiv.org/html/2609.01768#bib.bib15), 24 (https://arxiv.org/html/2609.01768#bib.bib24), 25 (https://arxiv.org/html/2609.01768#bib.bib25)]。 此外,我们开发了“平衡着色”算法[26 (https://arxiv.org/html/2609.01768#bib.bib26)]以在深度网络权重中识别这些结构,并利用所得纤维化对已训练模型进行大幅压缩,同时对性能影响最小。我们在多种架构中验证了这些局部对称性的涌现,包括多层感知机、卷积网络、循环网络(如长短期记忆网络)以及监督学习和强化学习环境下的Transformer网络。最后,通过精心打破这些涌现的对称性,我们扩展了网络容量以克服塑性丧失[4 (https://arxiv.org/html/2609.01768#bib.bib4), 5 (https://arxiv.org/html/2609.01768#bib.bib5)],在持续学习中展示了最先进的性能[3 (https://arxiv.org/html/2609.01768#bib.bib3)]。 ### 计算图中的对称性层次 我们将讨论的对称性构成一个层次结构,并在多种网络结构中涌现。为便于可视化,考虑一个具有二元权重(连接为1或0)的分层前馈网络,如图1 (https://arxiv.org/html/2609.01768#S1.F1)所示。图中节点按不同对称性着色以表示其类别。我们将在下一节将这些概念推广到连续值权重。 参见图注 图1:前馈网络中的对称性层次 为简化起见,权重为二元值,权重为零的连接未绘制。面板(d)中的图展示了传统的自同构置换示例。它通过置换π\\pi识别出三对对称节点。提出的框架基于对局部对称性的推广,如(余)纤维化和覆叠(a-c);详见正文。这些对称性的条件不太严格,可由更多节点满足,导致更少的对称类别(颜色)(空白节点应视为不同颜色)。自由度的减少增加了归纳偏置。 (e)用于持续学习的对称性破缺包括两个步骤:压缩至覆叠基(中间)以保留已学习的任务;随机化或置零冗余权重(右)以提供新的自由度继续学习。 **纤维化对称性**:节点具有纤维化对称性,若它们拥有同构的输入树[12 (https://arxiv.org/html/2609.01768#bib.bib12), 21 (https://arxiv.org/html/2609.01768#bib.bib21), 23 (https://arxiv.org/html/2609.01768#bib.bib23)],则称它们属于同一纤维。这意味着从图的输入到节点的整个连接结构是同构的(见方法4.1 (https://arxiv.org/html/2609.01768#S4.SS1))。尽管输入树贯穿整个网络,但它表示节点在其根处的局部“视图”[21 (https://arxiv.org/html/2609.01768#bib.bib21)]。实践中,纤维通过图论的平衡着色算法识别[12 (https://arxiv.org/html/2609.01768#bib.bib12), 26 (https://arxiv.org/html/2609.01768#bib.bib26)]。该算法通过迭代地将相同颜色分配给接收相同输入颜色集合的节点,将网络划分为平衡着色类别的节点(纤维划分)[27 (https://arxiv.org/html/2609.01768#bib.bib27)],因此称为“平衡着色”。例如图1 (https://arxiv.org/html/2609.01768#S1.F1)a所示,同一纤维中的节点着色相同。红色节点的输入树在左侧显示。 纤维化对称性允许将图G压缩为较小的基图Bfib。这种压缩通过合并所有共享相同颜色(即属于同一纤维)的节点同时保留输入树来实现(图1 (https://arxiv.org/html/2609.01768#S1.F1)a,方法4.2 (https://arxiv.org/html/2609.01768#S4.SS2))。我们将证明,所得基图执行与原始图完全相同的前向计算。在深度神经网络中,这意味着我们可以在不损失性能的情况下压缩网络。 **余纤维化对称性**:类似原理适用于网络参数的学习过程。在误差反向传播(现代AI的标准学习算法)期间,输出误差通过输出树向后传播。当节点共享同构的输出树(即从它们到输出层的连接结构)时,就会发生余纤维化对称性(图1 (https://arxiv.org/html/2609.01768#S1.F1)b)。 **覆叠对称性**:当多个节点同时具有同构的输入树和输出树时,它们形成覆叠对称性并属于一个覆叠(图1 (https://arxiv.org/html/2609.01768#S1.F1)c)。相应的着色是纤维化和余纤维化着色划分的交集,即图的更精细划分。显然,覆叠是比纤维化或余纤维化更严格的对称性。 最严格的对称性是**自同构**。这是网络节点的全局置换,使整个图的连接性保持不变。具有自同构对称性(即在同一轨道中)的节点示例如图1 (https://arxiv.org/html/2609.01768#S1.F1)d所示,以及节点标签的置换。尽管自同构是GDL[9 (https://arxiv.org/html/2609.01768#bib.bib9)]和理论物理[10 (https://arxiv.org/html/2609.01768#bib.bib10), 11 (https://arxiv.org/html/2609.01768#bib.bib11), 28 (https://arxiv.org/html/2609.01768#bib.bib28)]的基石,但这种对称性如此严格,以至于我们在训练后的网络中从未观察到。 总之,这些对称性构成了一个严格性递增的层次:从纤维化和余纤维化,到覆叠,最后到自同构。随着条件变得更严格,不同的颜色类别更多,每个类别中的节点更少(意味着对称性更少)。限制较少的局部对称性(如纤维化)更常见,并允许压缩成更紧凑的基图。这种压缩导致模型具有更少的有效自由度,对应更强的归纳偏置。关于图的对称性的更正式讨论,见方法4.1 (https://arxiv.org/html/2609.01768#S4.SS1)。 ## 2 结果 ### 2.1 理论结果:涌现对称性的数学基础 本文确立深度学习不仅仅是参数调整过程,也是对称性形成的过程。学习将网络组织成局部对称性,包括纤维化、余纤维化,共同形成覆叠。下文将此层次推广到加权计算图。 #### 计算图与同步 上述层次局部对称性在标准架构(如MLP、CNN、RNN和Transformer)中涌现(见方法4.12 (https://arxiv.org/html/2609.01768#S4.SS12)),但在标准MLP中最易理解。这里,权重Wik连接层ℓ-1中的节点k到层ℓ中的节点i,创建有向加权无环计算图。活动hi从输入x=h(0)通过加权和后接非线性激活函数σ前向传播到输出y: hi(ℓ) = σ(∑k Wik(ℓ) hk(ℓ-1))。(1) 网络生成关于期望目标 ŷ 的误差L=L(ŷ,y)。该误差从输出开始向后传播[29 (https://arxiv.org/html/2609.01768#bib.bib29)],起始于δi(N)=∂L/∂hi(N),通过激活函数的导数σ'将误差与前向活动耦合: δi(ℓ) = σi'(ℓ) ∑k Wki(ℓ+1) δk(ℓ+1)。(2) #### 纤维化同步活动,余纤维化同步误差 在加权图中,层ℓ中的两个节点i和j处于纤维化对称性,当它们拥有同构的输入树时,这意味着它们从前一层的纤维化颜色接收相同的求和输入。换句话说,它们满足入射权重的等和条件(见公式14 (https://arxiv.org/html/2609.01768#S4.E14))。因为现实网络使用连续权重,此等式约束在阈值εfib下验证: ‖∑k∈c (Wik(ℓ) − Wjk(ℓ))‖ ≤ εfib,(3) 其中求和遍历前一层所有纤维颜色c。当εfib=0时,我们获得精确的纤维化对称性。对于非零εfib,我们遵循[30 (https://arxiv.org/html/2609.01768#bib.bib30)]称之为“准纤维”。 我们的第一个理论观察是,同一纤维中的两个节点对于网络的任何输入x同步其活动(hi=hj)(图2 (https://arxiv.org/html/2609.01768#S2.F2)a)。该定理形式
相似文章
人工神经网络中符号模式涌现的数学原理与实验发现
本文证明,在广泛的人工神经网络类别中,推理逻辑可以被重新表述为稀疏符号交互,并得到数学判据和大量实验的支持,为可解释性和泛化性提供了新颖的见解。
神经网络可证明地学习群组合的谱表示
本文提供了神经网络在群组合任务中学习结构化表示的理论分析,证明了训练动态驱动神经元以指数收敛速度收敛到不可约群表示。该工作建立了特征学习的表示理论解释,并刻画了矩阵值群表示的低秩压缩现象。
人工神经网络的涌现符号结构
本研究提出,神经网络隐式地实现了符号结构,通过使用符号方程近似向量表示来证明,这些方程在算术、逻辑、代码和语言等多个领域中保持行为一致。
冲击波理论与人工神经网络对称约化随机梯度下降之间的联系
本文在冲击波理论与随机梯度下降的对称商学习动力学之间建立了数学上严谨的联系,表明在对称约化和粗粒化后,动力学满足粘性Hamilton-Jacobi方程和Burgers型方程,激波形成时间由损失曲率控制。
论结构可塑性中增长的稳定性
本文研究神经网络结构可塑性中剪枝与增长之间的不对称性,表明新生单元比现有单元受到更弱的梯度信号,并提出改进整合的干预措施。