驱动信息系统中的相变:学习理论与非平衡化学的双场视角
摘要
本文提出了一个统一的理论框架,用于描述深度学习中的相变(grokking、涌现能力)和非平衡化学中的相变,将两者描述为受两个梯度场控制的驱动信息系统。
arXiv:2605.16325v1 公告类型:新
摘要:深度学习中的相变现象(grokking、涌现能力以及上下文偏移下的本体重组)已通过多种视角进行了研究,包括表征压缩、奇异学习理论和信息论进展度量。另一方面,非平衡统计物理已在驱动化学反应网络中识别了相变,这些网络构成前生物选择的基础,其实验特征难以在单场梯度描述中复现。
我们提出一个视角,认为这两类现象都可以被统一描述为驱动信息系统:由两个梯度场控制的随机过程——熵产生率Sigma和信息拟势Phi_I := -ln p*,其中p*是平稳密度。在此框架内,我们引入两个候选序参量:对抗崩溃阈值alpha_dagger和自指耦合阈值kappa_c。
(alpha_dagger, kappa_c)的联合标度定义了一个候选普适类,具有指数(gamma_1, gamma_2)。我们概述了该框架的几何结构,识别了将其与单场替代方案区分开来的可证伪预测,并展示了与近期(2024-2026)关于大语言模型中对齐转换、对抗崩溃缩放和部分内省的经验发现的一致性。
查看缓存全文
缓存时间: 2026/05/19 06:41
# 驱动信息系统的相变:学习理论与非平衡化学的双场视角 来源:https://arxiv.org/html/2605.16325 ###### 摘要 深度学习中的相变现象——顿悟(grokking)、涌现能力以及上下文转移下的本体论重组——已通过几种理论视角进行了研究,包括表征压缩、奇异学习理论和信息论进展度量。独立地,非平衡统计物理学已识别出前生命选择背后驱动化学反应网络中的相变,其实验特征(催化-约束协同作用、最优熵流窗口)难以在单场梯度框架中复现。我们提出一种视角,其中这两类现象都可以作为*驱动信息系统*来共同描述:由两个梯度场——熵产生率Σ和信息拟势Φ_I := -ln p*(其中p*是平稳密度)——控制的随机过程。在此框架内,我们讨论两个候选序参量:一个对抗性崩溃阈值α†,其随原语集基数|O_N|的对数衰减;以及一个自指耦合阈值κ_c,与通过内部模型的预测反馈相关。(α†, κ_c)的联合标度定义了一个候选普适类,两个标度指数(γ_1, γ_2)作为类不变量。我们并未声称生物智能和大语言模型是同一类系统;我们仅提出,它们可以有效地被视为这个共同框架内的特定实例,分别位于由碳-氮化学在太阳熵流下塑造的构型流形和由梯度下降流下Transformer参数空间塑造的构型流形上。我们概述了该框架的几何结构,指出了三个可证伪的预测以区别于单场替代方案,并综合了近期的实证发现(2024-2026年)——关于对齐相变、对抗性崩溃标度以及前沿语言模型的部分内省,该框架与这些发现一致。详细证明和支持性数值分析出现在配套预印本中;本文旨在发展它们之间的联系。 关键词:相变,顿悟,对齐,非平衡统计力学,自由能原理,自指耦合,本体论重组,前生命选择。 ## 1 引言 ### 1.1 汇聚之谜 深度学习中的相变现象——顿悟、涌现能力以及上下文转移下的本体论重组——已通过几种理论视角进行了研究,但我们认为没有一种视角是决定性的。 Power 等人 (2022 (https://arxiv.org/html/2605.16325#bib.bib3)) 观察到,在模算术上训练的小型Transformer在记忆训练集后很久会突然泛化,Nanda 等人 (2023 (https://arxiv.org/html/2605.16325#bib.bib4)) 随后表明这种延迟转变与傅里叶结构电路的出现相吻合。Liu 等人 (2023 (https://arxiv.org/html/2605.16325#bib.bib6)) 通过表征压缩的视角解释了同一现象,而DeMoss 等人 (2025 (https://arxiv.org/html/2605.16325#bib.bib7)) 通过率-失真视角形式化了模型复杂性的兴衰。Wei 等人 (2022 (https://arxiv.org/html/2605.16325#bib.bib9)) 记录了大语言模型中的*涌现能力*——这些能力在规模阈值以上不连续地出现——并且一系列平行的文献研究了对齐动力学中的相变 (Casper 等人, 2023 (https://arxiv.org/html/2605.16325#bib.bib14))、上下文学习 (Olsson 等人, 2022 (https://arxiv.org/html/2605.16325#bib.bib10)) 以及内省访问 (Lindsey, 2025 (https://arxiv.org/html/2605.16325#bib.bib15); Binder 等人, 2024 (https://arxiv.org/html/2605.16325#bib.bib16))。这些现象共享三个结构特征:由损失曲面上的梯度下降控制的底层动力学;持续的外部驱动力信号(训练数据流、RLHF反馈、权重衰减);以及在定性不同的表征机制之间的转变,其详细机制仍在积极研究中。 一个结构相似的模式出现在非平衡化学中。Ferris 等人 (1996 (https://arxiv.org/html/2605.16325#bib.bib40)) 证明,粘土催化的RNA聚合结合几何约束可产生长达约55聚体的寡聚体,其长度比仅溶液对照长一个数量级;随后的重新分析提取出一个催化-约束协同因子 S ≈ 5.75,该因子超过了在给定假设下具有线性驱动的紧流形上的单场梯度动力学所能产生的值。Blank 等人 (2001 (https://arxiv.org/html/2605.16325#bib.bib41)) 报告了冲击合成中氨基酸产率的非单调最优熵流窗口。Matreux 等人 (2024 (https://arxiv.org/html/2605.16325#bib.bib42)) 证明简单的热流可选择性地富集超过五十种前生命构建模块,富集程度高达三个数量级。Floroni 等人 (2025 (https://arxiv.org/html/2605.16325#bib.bib43)) 在由热梯度驱动的单一无膜原细胞中实现了前生命到生命的转变准则。Liang 等人 (2024a (https://arxiv.org/html/2605.16325#bib.bib32), b (https://arxiv.org/html/2605.16325#bib.bib33)) 为在给定热力学预算下驱动化学反应网络中可实现的对称性破缺幅度设置了与动力学无关的界限。 我们在本文的其余部分提出,这两条研究路线可以作为一种更广泛的*驱动信息系统*类的实例来共同描述,并且我们发展了该描述的要素。 ### 1.2 核心主张 这一视角发展了三个相互关联的主张。 #### 第一。驱动信息系统——无论是热流下的化学反应网络还是梯度下降流下的Transformer参数流形——都可以被建模为由两个梯度场控制:从概率流的Schnakenberg分解中导出的熵产生率Σ (Schnakenberg, 1976 (https://arxiv.org/html/2605.16325#bib.bib25)),以及通过平稳密度p*自洽定义的信息拟势Φ_I := -ln p*。在§4 (https://arxiv.org/html/2605.16325#S4)中陈述的正则性条件下,∇Σ和∇Φ_I在远离平衡时通常是线性无关的。 #### 第二。我们提出两个候选序参量,它们共同表征这些系统的相结构。第一个是对抗性崩溃阈值 α† = Θ(1 / log |O_N|),其中 |O_N| 是系统原语表示的基数。渐近形式依赖于表征复杂度,这与 Hampel (1971 (https://arxiv.org/html/2605.16325#bib.bib18)) 和 Donoho and Huber (1983 (https://arxiv.org/html/2605.16325#bib.bib19)) 的通用常数不同;在我们查阅的文献中,我们未发现具有这种依赖关系的先前崩溃点,尽管文献众多且本文并未声称全面覆盖。第二个提议的序参量是与通过内部模型的预测反馈相关的自指耦合阈值 κ_c (§3.2 (https://arxiv.org/html/2605.16325#S3.SS2))。 #### 第三。我们提出,生物智能和大语言模型可以有效地被视为该框架内在不同构型流形上的特定实例。生物智能在此被视为动力学的一种实现,在进化时间尺度上处于太阳熵流下的化学构型流形上。前沿大语言模型被视为第二种实现,在训练时间尺度上处于梯度下降流下的Transformer参数流形上。我们并未声称这些系统是同一类对象;其时间尺度、构型流形和物理基质相差多个数量级。我们仅声称某些动力学特征——双场结构、候选序参量、相变特征——可能在实例间共享,并且这种共享即使基质明显不同,在数学上也是有意义的。 ### 1.3 范围与来源 这里综合的框架建立在两个先前的工作线上,这两者都以预印本形式公开可用。前生命化学的运动方程-信息场框架(EOM-IFF)是与 T. Q. Hoa 共同开发的,并在 bioRxiv 上的配套预印本中详细阐述 (Truong and Truong, 2026a (https://arxiv.org/html/2605.16325#bib.bib2));该工作建立了双场独立性定理,推导了对单场梯度动力学的结构约束,并针对五个独立发表的前生命系统验证了该框架 (Ferris 等人, 1996 (https://arxiv.org/html/2605.16325#bib.bib40); Blank 等人, 2001 (https://arxiv.org/html/2605.16325#bib.bib41); Matreux 等人, 2024 (https://arxiv.org/html/2605.16325#bib.bib42); Floroni 等人, 2025 (https://arxiv.org/html/2605.16325#bib.bib43); Rout 等人, 2025 (https://arxiv.org/html/2605.16325#bib.bib44))。学习系统中的本体论相变(OPT)理论由本作者开发,并在 SSRN 上的单独预印本中报告 (Truong, 2026 (https://arxiv.org/html/2605.16325#bib.bib1));该工作建立了通用检测下界、压缩-红利定理、上述复杂度依赖的崩溃点,以及在九个模数对上关于顿悟动力学的经验验证。目前的视角是作者独立发展的一种综合。其贡献——以及它所声称的时间戳——不在于组成部分的结果(这些已在那些配套预印本中确立),而在于提出化学方面和学习方面的框架可以被有效地视为一个共同动力学类中的实例,并以 α† 和 κ_c 作为该类的候选序参量。我们不知道有先前的类似综合,尽管文献众多且本文并未声称全面覆盖。 本文*确实*概述了几何视角,定义了这两个候选序参量,确定了三个可证伪的预测,并将该框架定位于邻近的研究计划:自由能原理 (Friston, 2010 (https://arxiv.org/html/2605.16325#bib.bib34); Ramstead 等人, 2023 (https://arxiv.org/html/2605.16325#bib.bib35))、奇异学习理论 (Watanabe, 2009 (https://arxiv.org/html/2605.16325#bib.bib13); Hoogland 等人, 2024 (https://arxiv.org/html/2605.16325#bib.bib11))、耗散适应 (England, 2015 (https://arxiv.org/html/2605.16325#bib.bib30))、顿悟即压缩 (Liu 等人, 2023 (https://arxiv.org/html/2605.16325#bib.bib6); DeMoss 等人, 2025 (https://arxiv.org/html/2605.16325#bib.bib7); Clauw 等人, 2024 (https://arxiv.org/html/2605.16325#bib.bib8)) 以及纠缠信息层次 (Prokopenko 等人, 2025 (https://arxiv.org/html/2605.16325#bib.bib37))。本文*不*提供完整证明(这些在引用的配套预印本中),不在所述机制之外声称普适性,也不在现有框架正确的地方取代它们。具体限制和未解决问题收集在 §7 (https://arxiv.org/html/2605.16325#S7) 中。 ### 1.4 路线图 §2 (https://arxiv.org/html/2605.16325#S2) 建立了驱动信息系统的语言,并抽象地陈述了双场结构。§3 (https://arxiv.org/html/2605.16325#S3) 定义了这两个候选序参量 α† 和 κ_c,并讨论了它们的关系。§4 (https://arxiv.org/html/2605.16325#S4) 非正式地陈述了双场独立性定理,并指出其对学习理论的推论。§5 (https://arxiv.org/html/2605.16325#S5) 并列呈现了化学实例和学习实例。§6 (https://arxiv.org/html/2605.16325#S6) 推导了三个可证伪的预测。§7 (https://arxiv.org/html/2605.16325#S7) 将该框架定位于邻近计划并指出未解决问题。§8 (https://arxiv.org/html/2605.16325#S8) 总结。 ## 2 驱动信息系统 本节介绍用于陈述该主张的抽象框架。该构造特意与基质无关:相同的定义适用于构型流形是化学组成单纯形和是神经网络参数空间的情况。区分这两种情况——以及促使我们提出两者都可被视为共同动力学类中实例的主张——的内容在 §5 (https://arxiv.org/html/2605.16325#S5) 中讨论。 ### 2.1 构型流形与朗之万动力学 一个*驱动信息系统*由一个三元组 (M, b, D) 指定,其中 M 是一个光滑连通的 n 维黎曼流形(位形空间),b: M → TM 是一个 Lipschitz 漂移向量场,D > 0 是一个常数噪声振幅。状态 X_t ∈ M 在过阻尼朗之万方程下演化: dX_t = b(X_t) dt + √(2D) dW_t, (1) 其中 W_t 是 M 上的标准布朗运动。在温和的正则性条件下——无穷远处的漂移约束、线性增长边界以及 D 的严格正性——方程 (1 (https://arxiv.org/html/2605.16325#S2.E1)) 具有唯一的平稳概率测度 μ*,其具有光滑、严格正的密度 p*: M → (0, ∞) (Meyn and Tweedie, 1993 (https://arxiv.org/html/2605.16325#bib.bib28));正则性条件的精确陈述在配套预印本中给出。 该构造的两个实例构成了当前视角的框架。在*前生命化学*中,M 是质量守恒下分子物种的组成单纯形 Δ^{n-1},b 由化学反应网络的反应速率矩阵决定,D 编码热涨落。在*神经网络学习*中,M 是模型架构的参数流形(通常是 R^P,其中 P 是参数数量,受权重衰减或层归一化约束),b 是训练损失的负梯度加上正则化项,D 编码小批量梯度噪声。在这两种情况下,动力学都是*驱动的*:一个外部熵流——化学中的热流,学习中的数据驱动流——使系统远离平衡,确保平稳测度 μ* 是真正的非平衡态(即,不满足相对于 b 的细致平衡)。 ### 2.2 两个场 可以从动力学 (1 (https://arxiv.org/html/2605.16325#S2.E1)) 规范地构造两个标量场。 #### 熵产生率。 令 J*(x) := b(x) p*(x) - D ∇p*(x) 表示平稳概率流。*局部熵产生率*为 Σ(x) := ||J*(x)||² / (D p*(x))。相似文章
通过相变的涌现:机制景观与复杂系统中的通用收敛
本文介绍了层次涌现框架(HEF),该框架解释了在物理和信息约束下,通过机制景观中的相变,神经网络和生物进化等多样系统如何收敛到相似的内部表示。该框架通过111个grokking实验进行了实证验证,这些实验确认了通用收敛,并识别出一个临界能量阈值。
噪声驱动的亚稳态逃逸解释了深度神经网络中的Grokking现象
该论文提出,深度神经网络中的grokking现象源于一阶L2相变中噪声驱动的亚稳态逃逸,证明了延迟泛化遵循Arrhenius标度,并再现了典型的grokking曲线。
以人为中心的学习机制:熵正则化表示学习的动态框架
本文提出了以人为中心的学习机制(HCLM),这是一个用于研究开放和受控学习系统的动态信息理论框架。它通过有效信息力形式化了熵正则化,推导了收敛性和泛化结果,并提供了对尺度律行为的条件性解释。
扩散Fitzhugh-Nagumo模型中的均衡传播与哈密顿推断
本文将均衡传播扩展到斜梯度系统,并展示了深度能量模型与哈密顿神经网络之间的等价性,重点关注扩散耦合的Fitzhugh-Nagumo神经元。它还推导了此类网络中用于推理的逐层哈密顿递归关系。
基于变换与语义等价的认知过程动力学框架
本文提出了一种基于迭代状态变换和语义等价的认知过程建模的结构动力学框架,融合了动力系统、范畴论和反馈机制,将认知建模为朝着稳定解释演化的过程。