训练的动力学:语言模型中涌现、可塑性丧失与电路控制的驱动成核速率定律

arXiv cs.LG 论文

摘要

这篇理论论文提出了一种驱动成核速率定律,用于解释语言模型中的能力涌现、可塑性丧失和电路控制,并通过在Pythia和一个受控的门控注意力模型上的实验加以支持。

arXiv:2607.27281v1 公告类型:新 摘要:当语言模型中电路的最后几个部分在一次随机尝试中对齐时,能力就会出现,而只差一个部分正确也毫无价值。我们证明这种无部分得分的联合对齐是能力形成的限速步骤。有两个指纹:在无捷径的装置中,一个五部分电路缺失三部分与一个三部分电路缺失三部分的等待时间相同(1.19-1.37),因此等待时间取决于缺失部分的数量,而非电路大小;在Pythia上跨越七种能力和三种规模,消融一个部分在32/32个判别单元中留下能力的中位数17%,而部分得分预测为50-83%(p = 2e-10),随机非部分头则留下100%。 一个势垒随缺失部分数量增长的稀有事件产生了一个速率方程——位点 × 尝试 × 驱动 × exp(-β*K),减去破坏——可从三个方向解读,每个方向都预先注册了冻结常数。前向:一个在基线处平坦的能力在我们选择的步骤点燃,一旦混合物超过浓度下限(10/10高于,0/12低于),并且在其仍平坦时,其到达时间可由其前体以六个保留模型上的5%中位数误差预测。后向:学习被扣留能力的延迟随着等待而增长,直到超过临界步骤后,它永远无法点燃——然而验证损失在整个过程中平滑下降,因此标准监控对其视而不见。我们定位了损伤(注意力头固着于基础数据)并分离出治疗方法:仅重新初始化查询-键切片即可恢复可学习性(6/6),而值切片则无效(0/6)。我们在受控的门控注意力模型中证明了该机制:占据强制了一个截止时间,其后果不需要混合假设。完成:SGD的噪声未能通过涨落-耗散检验,因此我们安装了一个这样的噪声,并按计划对电路进行退火、熔化和固定。范围:高达1.4B的Transformer模型中的合取电路。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:01

# 语言模型中涌现、可塑性损失与电路控制的受驱动成核速率定律

来源:https://arxiv.org/html/2607.27281(2026年7月)

###### 摘要

当语言模型中某个电路的最后几个部分在同一次随机尝试中对齐时,该能力便会出现,而“只差一个”则毫无价值。我们证明,这种“无部分学分”的联合对齐正是能力形成的**限速步骤**。两个指纹特征:在一个无捷径的装置中,一个五部分电路缺失三部分的等待时间与一个三部分电路缺失三部分的等待时间相同(1.19–1.37),因此等待时间取决于**缺失**部分的数量,而非电路规模;在 Pythia 上跨七种能力和三种规模,消融一个部分在 32 个判别性单元中的 32 个中仅留下中位数 17% 的能力,而部分学分模型预测为 50–83%(p=2×10⁻¹⁰),随机非部分头则留下 100%。一个罕见事件,其势垒随缺失部分增加而增大,导出唯一一个速率方程——位点×尝试次数×驱动力×e^(−βK),再减去破坏项——可沿三种方向解读,每种解读均以冻结常数预先注册。*正向*:一种能力在基线上保持平坦,一旦混合浓度超过某一阈值(上方10/10,下方0/12),便在我们选定的步骤被点燃;而在其仍平坦时,其到来时间可由前兆以 5% 的中位数误差在六个保留模型上测出。*反向*:学习被扣留能力的延迟随等待时间增长,直到越过某个临界步骤后完全无法点燃——然而验证损失全程平滑下降,因此标准监控对其视而不见。我们定位了损伤(头节点承诺于基础数据)并分离出治疗方案:仅重新初始化查询–键切片即可恢复可学习性(6/6),而值切片毫无作用(0/6)。我们在一个受控的门控注意力模型中证明了该机制,其中占据约束强加了一个有限期限,其后果**无需混合假设**。*完成态*:SGD 的噪声未通过涨落–耗散检验,因此我们安装了正确的噪声并按时退火、熔化和钉扎电路。冻结因子预测未运行组合的误差为 1–8%。适用范围:至 1.4B 规模的转换器中的合取电路,两个模型家族。

## 1 引言:训练有静力学;它缺少动力学

大量理论现已以*平衡*术语描述学习。奇异学习理论将训练阶段刻画为贝叶斯自由能的相变[1](https://arxiv.org/html/2607.27281#bib.bib1),2(https://arxiv.org/html/2607.27281#bib.bib2),3(https://arxiv.org/html/2607.27281#bib.bib3);数据混合阈值已被推导为容量分配最优值[4](https://arxiv.org/html/2607.27281#bib.bib4);顿悟现象被建模为一阶相变[5](https://arxiv.org/html/2607.27281#bib.bib5)以及从亚稳态的热逃逸[6](https://arxiv.org/html/2607.27281#bib.bib6)。用材料科学的语言来说,这就是训练的*平衡相图*:哪些相存在,哪个相更受偏好。然而,相图无法回答实践者提出的任何问题。*何时*出现这一能力?*多快*增长,能否加速?*直到何时*仍可被学习——为什么一个在错误数据上训练过久的网络会完全丧失学习它的能力[7](https://arxiv.org/html/2607.27281#bib.bib7)?*哪个*电路会被给定扰动最先摧毁?这些问题关乎*速率*,而自由能不是速率。冶金学需要第二张图——时间–温度–转变(TTT)图——之后相知识才变成过程控制。训练目前还没有这样一张图。本文构建了所缺失的动力学。其唯一研究对象是计算电路的*成核速率*,

J = N⏟位点 × ν⏟尝试频率 × σ(c)⏟过饱和度 × e^(−βK)⏟势垒 − D⏟破坏项,  (1)

该式由 SGD 的随机动力学推导一次(§2–§4),然后以三种方式解读。*正向*解读——将驱动力 σ 推过阈值——即能力*涌现*,附带一个导数时钟,能在能力可测之前标定其到来时间(§6)。*反向*解读——当位点项 N 被训练本身消耗时——即*可塑性丧失*,并提供了可塑性文献所指出缺失的定量定律、时间范围、机制和修复方法(§7)。*完成态*——注入 SGD 已被证明缺乏的温度——则成为*过程控制*:退火、选择性溶解、以及针对单个电路的淬火–释放调度(§8)。式 (1) 中的每个因子均被独立测量、冻结,并在未运行组合上进行测试(§9);本文每一节要么测量一个因子,要么沿一个方向解读该方程。这样一种构造只有当它能在该领域已关注的问题上、以该领域自身的语言给出回报时,才算物有所值。它在三个问题上给出了回报。

*可塑性丧失*是一个公认的开放问题:这一现象已在*《自然》*上确立[7](https://arxiv.org/html/2607.27281#bib.bib7),热启动之谜[8](https://arxiv.org/html/2607.27281#bib.bib8)仍然存在,而原因文献明确是不完备的——干预任何单一提议机制都不足够[9](https://arxiv.org/html/2607.27281#bib.bib9)。现有的是没有定律、时间表或已定位机制的治疗方法;§7 定量地提供了以上每一项。

*能力级数据调度*:数据混合方法[10](https://arxiv.org/html/2607.27281#bib.bib10),11(https://arxiv.org/html/2607.27281#bib.bib11),12(https://arxiv.org/html/2607.27281#bib.bib12)优化的是损失,而非哪些能力形成;阈值、时钟和保质期回答了“对于这种混合和这种规模,能力 X 会否涌现、何时涌现、获得它的截止期限是什么”。

*涌现早期预警*:前沿安全框架轮询评估并作出反应[13](https://arxiv.org/html/2607.27281#bib.bib13);前兆读数在能力本身仍处于基线平坦期时标定其到来时间。

适用范围,预先声明。两个模型家族(Pythia[14](https://arxiv.org/html/2607.27281#bib.bib14)、OLMo[15](https://arxiv.org/html/2607.27281#bib.bib15)——具有密集早期检查点的公开套件),规模至 1.4B,机制级能力外加一个任务级演示,因果常数来自一个受控的持续训练机制,其*结构*(而非常数)才是主张所在——核心因果结果另从随机初始化复现;以及一个明确未证明的数学前提(假设1),凡使用之处均予标示。

## 2 速率方程,逐步强制导出

我们自始至终区分*引用*(既有结果,我们不重新证明)、*在这里证明*(在所述假设下)和*测量*。推导链很短,每一步都强制下一步。

#### 第 1 步(引用):小批量 SGD 在扩散区是 SDE。

对于小批量,更新等于全梯度加零均值噪声;在扩散近似区(小步长、局部高斯批量噪声)中,SGD 近似为

dθ = −∇L(θ) dt + √(2ε Σ(θ)) dW

且有显式弱误差界[16](https://arxiv.org/html/2607.27281#bib.bib16),17(https://arxiv.org/html/2607.27281#bib.bib17)。生产环境优化器(Adam、梯度裁剪、调度)会变形该 SDE,但不会移除它的两个承重特征——漂移加状态依赖噪声——但我们不作更强断言:区条件是理论适用范围的一部分(§12),所有因果常数均在普通 SGD/AdamW 下测量,此时近似是受控的。

#### 第 2 步:为什么势垒在 K 上是指数的——两个独立基础。

*(A)计算基础——针对所测任务类的已证明复杂性理论。*对于我们的前提所实例化的任务族——K 元合取,且其任何严格子集都不携带信号,这一性质对我们的装置在引理1中*精确证明*——K 上的指数代价是学习理论的定理,而非假设。任何求解 (n,k) 稀疏奇偶问题的统计查询(SQ)算法,若允许 T 次容差 τ 的查询,必须有 T/τ² ≥ Ω(nᵏ)[18](https://arxiv.org/html/2607.27281#bib.bib18),19(https://arxiv.org/html/2607.27281#bib.bib19);具有有界梯度精度的梯度方法属于 SQ 框架(参见20](https://arxiv.org/html/2607.27281#bib.bib20)中讨论的归约,附录 A.1及其参考文献),而 SGD 可证明地在该极限附近运行,在保证成立的架构中以 n^{O(k)} 步学习 k 奇偶[20](https://arxiv.org/html/2607.27281#bib.bib20)。在代价界之外,阶梯定理和跳跃定理[21](https://arxiv.org/html/2607.27281#bib.bib21),22(https://arxiv.org/html/2607.27281#bib.bib22)证明了一个二分法,我们的速率决定步骤分析正依赖于它:单项式每个最多增加一个新坐标的目标(每一阶段都有子集信号)可在 O(d) 样本内被 SGD 学习——在平均场区是一个精确的 iff 刻画——而大小为 ℓ 的跳跃在已证明处花费 Θ̃(d^{max(ℓ−1,1)}) 步在线 SGD(高斯嵌套单项式目标、逐层训练;一般情况 CSQ 下界;对于普通小批量 SGD 的跳跃-2 情形由23](https://arxiv.org/html/2607.27281#bib.bib23)确立)。这些定理管辖大环境维数和指定训练区中的任务类;我们的装置是该类中小维成员,其定义性的无子集信号性质精确成立(引理1),且训练全程是单遍的(批量重用可绕过跳跃势垒[24](https://arxiv.org/html/2607.27281#bib.bib24))。

*定理固定了什么,以及未固定什么。*它们固定了*形式*——代价随联合所需部分数量呈指数——而非*常数*。在 nᵏ 标度中,n 计数的是必须在其上找到相关支撑的候选坐标;它不是词汇表大小,且对界的任何解读都不会给 β 赋予一个普适值。因此,写成每部分 e^β 时,β 是一个*有效*候选池的对数,须像化学动力学中活化能那样对每个系统测量而非推导。实测值恰恰在这方面富有信息:在玩具模型中每部分代价为 β̂=1.75(求和族)和 ≥2.40(奇偶族),即有效池约 6 和 ≥11——这是设计所使之相关的局部窗口的规模,远低于完整上下文,表明搜索是有结构的而非盲目的。在真实模型上,时钟的 β≈0.23 对应于接近 1 的有效池:真实电路形成根本不是盲目组合搜索,这正是 §10 的分级图景所预测的——先以廉价的携带子集信号的阶段逐步推进,留下一个很小且被强引导的残余联合步骤。与此一致,其他协议在真实模型上测得的每部分代价也处于同样的适度量级,并随电路和区制变化(时钟得到的 ≈0.23;再生的 0.47–0.62;先前工作中直接 K 控制的 ≈1.0[25](https://arxiv.org/html/2607.27281#bib.bib25))——这是一个家族和电路索引的材料常数,正如理论所要求,而非定理所能提供的普适数字。

*(B)物理基础——依赖混合的成核解读。*对于第 1 步形式的扩散,逃出亚稳态盆地的罕见跃迁速率,至指数前导阶为 J ≍ exp(−ΔS/ε),其中 ΔS 是最小不可几逃逸路径的拟势作用——Friedlin–Wentzell[26](https://arxiv.org/html/2607.27281#bib.bib26),27(https://arxiv.org/html/2607.27281#bib.bib27);可逆情形为 Kramers[28](https://arxiv.org/html/2607.27281#bib.bib28)。给定形成时间尺度上的混合(假设1),大偏差理论在前导阶形式上别无选择。*只有这一支*需要该假设,也只有这一支提供热力学词汇——温度、过饱和、熔化——进而提供 §8 的控制操作。在线 SGD 的严格逃逸时间和阈值分析存在于相邻情景中,其标度与此图景的预期完全一致:信息指数为 k 时样本复杂度为 N^{max(1,k−1)},阈值以下出现拉伸指数陷阱[29](https://arxiv.org/html/2607.27281#bib.bib29)。经典定理与生产训练之间的三个差距被明言而非掩盖:批量噪声并非渐近小(小噪声极限是一个区制条件,其诊断——无记忆性——本身可被测量);自适应优化器携带超出 θ 扩散的动量状态(我们的受控测量在 AdamW 下运行,因此所测签名已包含该变形);以及训练过程中景观不断演化(假设1的拟平稳性条款)。

#### 第 3 步(在此证明):对于 K 部分电路,ΔS=βK。

这是本文的数学核心——通用指数在此获得其*内容*——占据 §4。

#### 第 4 步(测量):什么乘以指数。

前因子在条件独立下分解为位点×尝试频率×过饱和度(一种平均场近似,其有效区及在边界处测得的失效均已在 §9 量化)。过饱和度具有实测形式 σ(c) ∝ (c−c₀)^γ,高于阈值浓度 c₀ 时成立,低于其则为零(§6)。破坏项 D 有两个分量,作用范围不同:一个作用于亚临界胚芽的*回复漂移*(始终存在——驱动力须克服它,它设定了阈值),以及一个作用于已形成结构的*击倒*分量,该分量对于*注入*温度呈 Arrhenius 形式,在原生设置和实际学习率下处于休眠(§8)。

#### 非平衡分支(诊断引用;测试和处方归我们)。

SGD 处于非平衡——详细平衡破缺、各向异性状态依赖噪声——已是既定结论[30](https://arxiv.org/html/2607.27281#bib.bib30),31(https://arxiv.org/html/2607.27281#bib.bib31),我们不主张这一诊断。我们增加的是*操作*步骤:一个涨落–耗散*资格检验*,任何候选“温度旋钮”都必须通过它;而测量结果是,六个原生 SGD 旋钮全部(

相似文章

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。

LM预训练的泛化动态(阅读时间17分钟)

TLDR AI

本文揭示,在预训练过程中,语言模型会频繁且突然地在模式匹配与泛化行为之间切换,这种现象被称为“模式跳跃”(mode-hopping),并提出了一个用于研究该现象的小型评估套件。

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。