为二次模型辩护
摘要
本文通过实证验证了优化二次模型能够预测多达1.5亿参数的大型语言模型的预训练动态,分析了Hessian谱和局部稳定性。
arXiv:2607.21716v1 Announce Type: new
Abstract: 由于神经网络损失景观的复杂性,优化理论被迫依赖于理想化模型,并且通常在模型的理论可处理性与它对真实优化动态描述的准确性之间存在权衡。在这项工作中,我们对最简单的优化模型——二次模型——进行了压力测试,并展示了它在具有1.5亿参数和30亿训练令牌的大型语言模型设置中具有惊人的预测能力。具体来说,我们展示了在训练过程中对中间检查点进行泰勒展开模型和损失函数,可以准确预测持续长达训练过程10\%的时间窗口内的优化动态。在确立这种一致性后,我们转而通过两个视角分析这些局部二次优化问题的结构:Hessian谱和局部稳定性。使用具有极深探测的Lanczos求积法,我们能够估计尾部深处的Hessian谱,并在特征值和特征向量中发现了令人惊讶的丰富结构,这些结构取决于批次大小、预条件和训练时间。我们还实证检验了中间检查点的局部线性稳定性,并将其与理论预测进行比较,以证明大型语言模型中的优化通常发生在随机稳定边缘,其性质也由批次大小决定。我们的结果表明,二次模型可能是预训练优化动态的一个理论上可处理的代理模型。
查看缓存全文
缓存时间: 2026/07/27 07:41
# 为二次模型辩护 **来源:** https://arxiv.org/html/2607.21716 Pranav Ajit Nair Kempner Institute at Harvard University Depen Morwani Kempner Institute at Harvard University Cengiz Pehlevan Kempner Institute at Harvard University Sham Kakade Kempner Institute at Harvard University Alex Damian Kempner Institute at Harvard University MIT ###### 摘要 由于神经网络损失景观的复杂性,优化理论不得不依赖理想化模型,而模型在理论上的易处理程度与其描述真实优化动态的准确度之间通常存在权衡。在本工作中,我们对最简单的优化模型——二次模型——进行了压力测试,并展示了它在具有1.5亿参数和30亿训练tokens的LLM设置中具有惊人的预测能力。具体来说,我们展示了在训练过程中对中间检查点处的模型和损失函数进行泰勒展开,能够准确预测长达训练总量10%的时间窗口内的优化动态。在确认了这一一致性之后,我们转而从两个角度分析这些局部二次优化问题的结构:Hessian谱和局部稳定性。通过使用极深探针的Lanczos求积,我们能够估计Hessian谱深入到尾部,并在特征值和特征向量中都发现了令人惊讶的结构,这些结构取决于批次大小、预处理器和训练时间。我们还对中间检查点处的局部线性稳定性进行了实证测试,并将其与理论预测进行比较,以证明LLM优化通常发生在随机稳定性边缘,其性质也由批次大小决定。我们的结果表明,二次模型可能是预训练优化动态的一个理论易处理的代理。 ## 1 引言 大型语言模型(LLM)的优化通过快速实验与理论直觉之间的反馈循环取得了迅速进展。在预训练中,许多设计选择,如学习率调度、批次大小缩放和优化器,至少是非正式地受到传统优化理论的启发(Polyak, 1964 (https://arxiv.org/html/2607.21716#bib.bib6); Zhang et al., 2024b (https://arxiv.org/html/2607.21716#bib.bib7); Polyak and Juditsky, 1992 (https://arxiv.org/html/2607.21716#bib.bib8); Meterez et al., 2025 (https://arxiv.org/html/2607.21716#bib.bib9); Kidambi et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib10))。这类模型通常作为以可处理的方式推理训练动态和规模化的有用指南。然而,尚不清楚这些模型中哪些真正描述了大规模预训练的动态。有几个失败模式导致了理论代理与实证之间的差距。一方面,模型可能过于理想化:它们能够捕捉数学现象,但在难以对现代神经网络证明的假设下。然而,如果模型没有纳入足够关于具体优化问题的结构(例如,所有光滑凸问题集合上的最坏情况界),它可能导致过于悲观的预测,并且无法产生可操作的见解。最后,如果模型并非过于理想化并且融入了问题特定的结构,它通常在理论上难以处理。 可以说,优化理论能够给出尖锐的具体问题预测的最简单设置是二次模型。该设置的优势在于,训练动态可以跨Hessian谱逐模态理解,从而能够进行针对特定实例的分析,这些分析对给定的Hessian谱是紧的。这使得它成为研究稳定性、学习率调度、批次大小缩放、加速和预处理以及开发可迁移到神经网络优化的有原则算法的有用沙盒(Meterez et al., 2025 (https://arxiv.org/html/2607.21716#bib.bib9), 2026 (https://arxiv.org/html/2607.21716#bib.bib12); Zou et al., 2021 (https://arxiv.org/html/2607.21716#bib.bib16); Wu et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib50); Kidambi et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib10); Jain et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib47); Morwani et al., 2026 (https://arxiv.org/html/2607.21716#bib.bib13); Zhang et al., 2024b (https://arxiv.org/html/2607.21716#bib.bib7), 2019 (https://arxiv.org/html/2607.21716#bib.bib75); Paquette and Paquette, 2021 (https://arxiv.org/html/2607.21716#bib.bib76); Zhang et al., 2024a (https://arxiv.org/html/2607.21716#bib.bib77); Wu et al., 2025 (https://arxiv.org/html/2607.21716#bib.bib78); Ferbach et al., 2026 (https://arxiv.org/html/2607.21716#bib.bib79); Zhang et al., 2026b (https://arxiv.org/html/2607.21716#bib.bib80); Varre et al., 2021 (https://arxiv.org/html/2607.21716#bib.bib81); Varre and Flammarion, 2022 (https://arxiv.org/html/2607.21716#bib.bib82); Bordelon and Pehlevan, 2021 (https://arxiv.org/html/2607.21716#bib.bib83))。这些工作主要将二次模型用作一个有用的理论易处理沙盒来测试算法和想法,并在应用于神经网络时采取信仰飞跃。在本工作中,我们旨在加强这种联系并对二次模型进行压力测试,提出以下问题:*二次模型在多大程度上实际捕捉了LLM的训练动态?* 在章节3 (https://arxiv.org/html/2607.21716#S3)中,我们通过在FineWeb上使用30亿tokens训练一个1.5亿参数的transformer,并每10%的训练保存中间检查点来测试这一点。然后我们在每个检查点附近对模型和损失进行泰勒展开,并在该代理损失上训练总token量的10%,然后与原始优化轨迹进行比较。我们对两个代理进行了此操作。第一个代理prox将模型线性化但保留交叉熵目标,这等价于NTK下的多类逻辑回归(Jacot et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib60); Lee et al., 2019 (https://arxiv.org/html/2607.21716#bib.bib61); Chizat et al., 2019 (https://arxiv.org/html/2607.21716#bib.bib62))。第二个代理quad将该目标泰勒展开到二阶,使得损失函数为凸二次函数。我们的结果表明,这些近似最多可保持训练总量的10%,并且近似质量在训练后期显著优于训练初期。受这些泰勒展开准确性的启发,我们转而描述这些局部二次问题的结构。 在章节4 (https://arxiv.org/html/2607.21716#S4)中,我们估计了沿训练轨迹的Hessian矩阵和高斯-牛顿矩阵的谱,包括有无Adam预处理器的两种情况。为此,我们使用了具有严格误差带的极深Lanczos求积探针,并能够解析跨越六个数量级的谱。我们发现谱通常分为一个头部,其大小由词汇量决定并且主要由解嵌入层主导,以及一个**普适的**幂律尾部:在不同批次大小下相同,且不受Adam预处理器影响。基于这些曲线,我们估计了源指数和容量指数,在可解析的尾部发现容量指数约为α≈1,源指数为β<1,这与文献中常用的可和性假设相矛盾。最后,在章节5 (https://arxiv.org/html/2607.21716#S5)中,我们通过估计每个保存的检查点接近**稳定性边缘**的程度(Défossez and Bach, 2015 (https://arxiv.org/html/2607.21716#bib.bib46); Jain et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib47); Ma et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib48); Wu et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib50); Ma and Ying, 2021 (https://arxiv.org/html/2607.21716#bib.bib51); Wu et al., 2022 (https://arxiv.org/html/2607.21716#bib.bib53); Velikanov et al., 2022 (https://arxiv.org/html/2607.21716#bib.bib52); Mulayoff and Michaeli, 2024 (https://arxiv.org/html/2607.21716#bib.bib49); Cohen et al., 2021 (https://arxiv.org/html/2607.21716#bib.bib4); Jastrzębski et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib54); Jastrzebski et al., 2020 (https://arxiv.org/html/2607.21716#bib.bib55); Cohen et al., 2022 (https://arxiv.org/html/2607.21716#bib.bib5); Lewkowycz et al., 2020 (https://arxiv.org/html/2607.21716#bib.bib57); Ahn et al., 2022 (https://arxiv.org/html/2607.21716#bib.bib58); Arora et al., 2022 (https://arxiv.org/html/2607.21716#bib.bib56); Damian et al., 2022 (https://arxiv.org/html/2607.21716#bib.bib59); Cohen et al., 2024 (https://arxiv.org/html/2607.21716#bib.bib11))来分析训练稳定性。这是一个线性化动态(预处理SGD)对学习率和批次大小极其敏感的区域,任何学习率的增加或批次大小的减少都可能导致线性化模型的训练发散。我们通过从各个检查点运行预处理SGD并使用学习率和批次大小乘子的网格来测试哪些超参数会导致SGD发散,从而对此进行实证测试,并将这些结果与线性稳定性分析所做的理论预测进行比较。我们观察到,在小到中等批次大小下,训练发生在噪声主导的随机稳定性边缘状态,而在大批次大小下,训练运行在确定性稳定性边缘,如Cohen等人(2021 (https://arxiv.org/html/2607.21716#bib.bib4))所述。因此我们得出结论,无论批次大小如何,大多数LLM训练都发生在稳定性边缘。 参见图注 **图1:** 使用余弦退火在1× Chinchilla tokens上训练的150M模型(黑色)的验证损失曲线,不同批次大小,在最优学习率下。(上)我们展示了LLM损失曲线与在每10%训练记录的检查点附近训练线性化模型(蓝色)所得曲线之间的一致性。(下)我们进一步对损失进行二次泰勒展开并训练二次模型(橙色)。在训练后期,损失仍然一致,但在早期发生偏离,这与仅线性化模型的情况相反。注意,橙色和蓝色曲线是在展开上训练的,但我们在真实模型损失上评估它们。我们从每个检查点测量近似保持的时间长度,见表格1(https://arxiv.org/html/2607.21716#S3.T1)。我们在第3节(https://arxiv.org/html/2607.21716#S3)中提供进一步细节,并且我们还在图12(https://arxiv.org/html/2607.21716#A2.F12)(附录B(https://arxiv.org/html/2607.21716#A2))中展示了具有EMA的恒定学习率的类似图。 ## 2 相关工作 ##### 线性化动态。 神经切线核(NTK)(Jacot et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib60); Lee et al., 2019 (https://arxiv.org/html/2607.21716#bib.bib61))通过在参数空间中进行一阶泰勒展开来近似网络,这种近似在参数位移相对较小时是准确的。这一状态也称为“懒惰”训练(Chizat et al., 2019 (https://arxiv.org/html/2607.21716#bib.bib62))。然而,在实践中,参数和NTK随着特征形成而快速演化(Fort et al., 2020 (https://arxiv.org/html/2607.21716#bib.bib63); Atanasov et al., 2021 (https://arxiv.org/html/2607.21716#bib.bib64); Long, 2021 (https://arxiv.org/html/2607.21716#bib.bib65); Vyas et al., 2022 (https://arxiv.org/html/2607.21716#bib.bib66); Ortiz-Jiménez et al., 2021 (https://arxiv.org/html/2607.21716#bib.bib67)),使得NTK动态在实际学习率和宽度下不准确。其他一些工作表明,使用“后核”(即训练结束时的线性化模型)对于可解释性和微调是更忠实的近似(Park et al., 2023 (https://arxiv.org/html/2607.21716#bib.bib68); Long, 2021 (https://arxiv.org/html/2607.21716#bib.bib65); Malladi et al., 2023 (https://arxiv.org/html/2607.21716#bib.bib69))。一条互补的研究线研究了高阶泰勒展开(Bai and Lee, 2019 (https://arxiv.org/html/2607.21716#bib.bib71); Bai et al., 2020 (https://arxiv.org/html/2607.21716#bib.bib70))作为真实动态的更好近似。相对于这些文献,我们在整个轨迹中局部线性化,而不是在初始化时,并且我们以占总训练预算的比例衡量一致窗口。 ##### Hessian谱。 神经网络Hessian谱先前已被研究以理解优化损失景观。对于小模型,可以精确计算Hessian特征值(Sagun et al., 2016 (https://arxiv.org/html/2607.21716#bib.bib27), 2017 (https://arxiv.org/html/2607.21716#bib.bib28)),要么通过封闭形式计算Hessian,要么通过相对较少的幂迭代,但当参数数量达到百万级时,这种方法很快失效。一个更精细的算法,也是第4.2节(https://arxiv.org/html/2607.21716#S4.SS2)的基础,是随机Lanczos求积(SLQ)算法(Lanczos, 1950 (https://arxiv.org/html/2607.21716#bib.bib17); Golub and Meurant, 2009 (https://arxiv.org/html/2607.21716#bib.bib22))。自引入以来,许多工作研究了该算法,提供了由求积算法给出的谱估计的精度界(Ubaru et al., 2017 (https://arxiv.org/html/2607.21716#bib.bib24); Adams et al., 2018 (https://arxiv.org/html/2607.21716#bib.bib25); Chen et al., 2021 (https://arxiv.org/html/2607.21716#bib.bib21), 2022 (https://arxiv.org/html/2607.21716#bib.bib26); Lin et al., 2016 (https://arxiv.org/html/2607.21716#bib.bib23))。在神经网络中,SLQ的首次应用是在视觉模型中,一些论文报告了训练后的分类Hessian倾向于分离为体部和离群特征值,其数量大致等于类别数(Papyan, 2018 (https://arxiv.org/html/2607.21716#bib.bib29), 2019 (https://arxiv.org/html/2607.21716#bib.bib30), 2020 (https://arxiv.org/html/2607.21716#bib.bib31); Ghorbani et al., 2019 (https://arxiv.org/html/2607.21716#bib.bib33)),这一效应与“神经坍缩”有关(Papyan et al., 2020 (https://arxiv.org/html/2607.21716#bib.bib32))。几个开源工具包实现了用于神经网络谱的SLQ,包括Ghorbani等人(2019 (https://arxiv.org/html/2607.21716#bib.bib33))附带的Tensorflow/JAX代码、PyHessian(Yao et al., 2020 (https://arxiv.org/html/2607.21716#bib.bib34))、GradVis(Chatzimichailidis et al., 2019 (https://arxiv.org/html/2607.21716#bib.bib35))和Deep Curvature套件(Granziol et al., 2019 (https://arxiv.org/html/2607.21716#bib.bib36))。 最近,经验谱测量已被用于推导神经网络训练中的优化处方。Granziol等人(2022 (https://arxiv.org/html/2607.21716#bib.bib37))使用SLQ从训练期间的Hessian谱推导出在线超参数学习器。在transformer中,Zhang等人(2024c (https://arxiv.org/html/2607.21716#bib.bib38))发现Hessian谱在不同参数块之间非常不均匀,并进一步利用这些发现设计了Adam-mini,一种内存效率更高的Adam版本(Zhang et al., 2025 (https://arxiv.org/html/2607.21716#bib.bib39))。据我们所知,SLQ在高达100亿参数规模的LLM中的首次应用是Granziol(2025 (https://arxiv.org/html/2607.21716#bib.bib40))和Granziol与Juarev(2026 (https://arxiv.org/html/2607.21716#bib.bib41)),他们在大约10-20个探针深度上运行SLQ,这在谱尾部给出了较差的分辨率。
相似文章
训练利润最优LLM的理论
本文提出了一种经济模型,结合缩放定律与微观经济学理论,分析大语言模型在利润最优情况下的训练策略,权衡模型质量、训练成本与硬件效率等因素。
仅靠拟合是不够的:极低量化大语言模型中的平滑性
本文探讨了极低量化大语言模型中的平滑性退化问题,认为除了数值精度外,保持平滑性对于维持模型性能至关重要。
基于不同微调策略和模型规模的LLM归因分析在自动代码合规性检查中的应用
本文使用基于扰动的归因分析方法,分析了不同微调策略(全量微调、LoRA、量化LoRA)和模型规模对LLM在自动代码合规性任务中解释行为的影响。研究发现全量微调产生的归因模式比参数高效方法更集中,而较大的模型会形成特定的解释策略,但性能收益在超过7B参数后出现递减。
LLM持续预训练中最佳超参数的可预测缩放规律
本文发现了LLM持续预训练中最佳超参数(学习率、批量大小)的可预测缩放规律,提出了一个两阶段框架,可将超参数搜索开销降低高达90%,同时保持性能。
评估大语言模型作为动力系统的可解释控制器
本文评估了大语言模型是否可以作为动力系统的可解释控制器,特别是针对热环境。研究发现,高复杂度模型如Qwen-3 14B和GPT-4o能够实现精确的控制和连贯的推理,而较小模型则表现不佳,凸显了混合基于模型和语言驱动的控制策略的潜力。