训练前预测:粒子物理基础模型的缩放定律

arXiv cs.AI 论文

摘要

本文证明,在小规模Transformer模型上拟合的缩放定律能够准确预测在粒子物理喷注数据上训练的更大模型的损失,从而在大规模训练之前将计算预算转化为预期的物理性能。他们发布了五个预训练模型以及完整的训练方案。

arXiv:2607.23377v1 公告类型:交叉 摘要:粒子物理学中最大的机器学习模型也是训练成本最高的,但在计算投入之前,无法估计给定架构的扩展回报。缩放定律已被拟合用于喷注,但尚未有研究表明能预测未用于拟合的模型的性能。我们证明,对于在对撞机喷注上预训练的通用Transformer,其性能是可以预测的。仅在小模型上拟合联合模型和数据缩放定律,涵盖三个数量级的训练计算量,我们预测了之后训练的、计算量超过其一百多倍的模型的损失,误差在百分之一以内。然后我们将预测与下游物理性能联系起来:在两个标准标记基准上,较低的预训练损失系统地带来较低的微调损失和更高的微调后背景抑制。因此,在该模型系列和这些任务中,计算预算可以在训练任何大模型之前转化为预期的物理性能。最终的前沿模型与已发表的、在同一语料库上训练的当前最先进的物理感知基础模型的数值一致,包括准确率、AUC和夸克/胶子抑制,只是在顶夸克标记的高纯度尾部,物理感知模型仍有一定优势。我们发布了五个跨越多种规模的预训练模型,以及完整的训练方案和代码。
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:01

# 训练前预测:粒子物理基础模型的缩放定律

来源:https://arxiv.org/html/2607.23377

Benjamin Nachman  
Fundamental Physics Directorate, SLAC National Accelerator Laboratory, Menlo Park, CA 94025, USA  
Department of Physics, Stanford University, Stanford, CA 94305, USA

Christopher Ré  
Department of Computer Science, Stanford University, Stanford, CA 94305, USA

###### 摘要

粒子物理学中最大的机器学习模型也是训练成本最高的模型,但在投入这些计算之前,无法估计某种架构扩展所能带来的回报。缩放定律(scaling laws)已被用于拟合喷注(jets),但迄今尚无研究证明它能预测未经拟合的模型性能。我们证明,对于在碰撞喷注上预训练的通用Transformer,这可以被预测。仅使用小模型拟合联合模型与数据的缩放定律(覆盖三个数量级的训练计算量),我们预测随后训练的、计算量高出百倍以上的模型损失,误差在百分之一以内。然后我们将预测与下游物理性能联系起来:在两个标准标记基准上,较低的预训练损失系统地带来较低的微调损失和微调后更高的背景抑制率。因此,在这一模型族和这些任务中,在训练任何大型模型之前,计算预算就可以转化为预期的物理性能。最终的前沿模型与已发表的、在同一语料库上训练的当前最优物理感知基础模型的数值在准确率、AUC和夸克/胶子抑制率上一致,仅在顶夸克标记的高纯度尾部,物理感知模型仍保有一定优势。我们发布了五个覆盖多个规模的预训练模型,以及完整的训练方案和代码。

## I 引言

过去十年机器学习反复出现的经验是:简单架构配合大数据集和更多计算量,往往优于精心设计的替代方案[30 (https://arxiv.org/html/2607.23377#bib.bib10)]。这些收益被发现是可以预测的:神经网络的损失随模型规模、数据集规模和计算量呈幂律下降,并且拟合得到的关系在启动训练之前足以可靠地规划训练过程[17 (https://arxiv.org/html/2607.23377#bib.bib7),15 (https://arxiv.org/html/2607.23377#bib.bib9)]。Hoffmann等人(通称Chinchilla研究)展示了如何通过拟合联合模型与数据的缩放定律,在模型规模和训练数据之间分配固定的计算预算[16 (https://arxiv.org/html/2607.23377#bib.bib8)]。这类定律被用于设计和预算大型训练。

粒子物理学是这一计划的特别有利场景。对撞机实验及其模拟能够产生几乎无限的有标注和无标注数据,且其生成过程已知;越来越多的研究正在为机器学习准备模拟数据和存档实验数据[8 (https://arxiv.org/html/2607.23377#bib.bib22)]。该领域已开始构建从模拟碰撞中学习可迁移表示的基础模型[3 (https://arxiv.org/html/2607.23377#bib.bib12),26 (https://arxiv.org/html/2607.23377#bib.bib3),4 (https://arxiv.org/html/2607.23377#bib.bib13),12 (https://arxiv.org/html/2607.23377#bib.bib14)]。缩放定律也已被拟合用于喷注[2 (https://arxiv.org/html/2607.23377#bib.bib15),33 (https://arxiv.org/html/2607.23377#bib.bib17),1 (https://arxiv.org/html/2607.23377#bib.bib18)],但始终是回顾性的:定律被拟合到全部可用运行上,然后报告其指数。缩放定律在其他领域中具有实用价值的两个性质,尚未在喷注上得到证明。没有研究在小模型上拟合定律、预先承诺预测、再训练大模型来检验预测;也没有研究将预训练损失定律与证明计算投入合理性的下游物理指标联系起来。缺少这两者,就无法事先估计某种架构扩展的回报,而这在一个最大模型也恰恰是训练成本最高的模型的领域里至关重要。

我们在这里同时建立这两点。我们研究ParticleViT,一个对喷注组成粒子应用通用Transformer、几乎没有物理特定结构的模型,在约十亿喷注的OmniLearned语料库[3 (https://arxiv.org/html/2607.23377#bib.bib12)]上预训练。我们的贡献如下。

- **可外推的缩放定律。** 仅在低于101910^{19}FLOPs训练的模型上拟合Chinchilla研究引入的联合模型与数据定律,我们预测随后以百倍以上计算量训练的模型损失,实测损失落在预测的约百分之一以内(第III.4 (https://arxiv.org/html/2607.23377#S3.SS4)节)。据我们所知,这是粒子物理学中第一个经过验证的预测性(而非回顾性拟合的)缩放定律。
- **作为规划工具的损失。** 在两个标准标记任务上,较低的预训练损失系统地带来较低的下游微调损失和微调后更高的背景抑制率(第IV (https://arxiv.org/html/2607.23377#S4)节)。结合第一项贡献,这就在训练任何大型模型之前,闭合了从计算预算到预测损失再到这些任务上预期性能的链条。
- **开放模型。** 我们发布五个覆盖规模阶梯的预训练ParticleViT模型(ParticleViT-S至ParticleViT-XL;表5 (https://arxiv.org/html/2607.23377#S7.T5)),以及完整的训练方案、代码和微调协议,使定律和模型可以直接使用(第VII.5 (https://arxiv.org/html/2607.23377#S7.SS5)节)。

沿着定律走向其前沿,我们进一步将规划模型与在同一语料库上训练的当前最优物理感知基础模型OmniLearned进行基准比较(第V (https://arxiv.org/html/2607.23377#S5)节)。与已发表的OmniLearned数值相比,两者在准确率、AUC和夸克/胶子抑制率上一致,仅在高纯度顶夸克标记尾部,物理感知模型仍有微弱优势。缩放拟合的一个副产品是十亿喷注语料库的计算最优模型规模,远小于从语言模型继承的经验法则(第III.3 (https://arxiv.org/html/2607.23377#S3.SS3)节)。我们在第VI (https://arxiv.org/html/2607.23377#S6)节论证,这反映了粒子词元的信息含量较低,这也使我们的结果与先前喷注缩放研究报道的饱和现象[33 (https://arxiv.org/html/2607.23377#bib.bib17),1 (https://arxiv.org/html/2607.23377#bib.bib18)]相调和。

为对撞机物理之外的读者说明:顶夸克标记是判断一个喷注起源于增强的顶夸克还是轻夸克和胶子的QCD辐射;夸克/胶子标记是判断一个喷注由夸克还是胶子产生。我们报告在信号效率εS=0.5\varepsilon_{S}=0.5下的背景抑制率R50=1/εBR_{50}=1/\varepsilon_{B},以及在εS=0.3\varepsilon_{S}=0.3下的R30R_{30},这些是这些基准上的标准性能指标[18 (https://arxiv.org/html/2607.23377#bib.bib1),19 (https://arxiv.org/html/2607.23377#bib.bib2)]。

## II 实验设置

### II.1 模型:低归纳偏置的Transformer

ParticleViT将喷注中的每个粒子视作一个词元,并对所得无序集合应用标准Transformer。主干网络遵循近期通用语言模型推广的设计选择[31 (https://arxiv.org/html/2607.23377#bib.bib27)]:重排序归一化保留在残差流之外,用RMSNorm替代LayerNorm[35 (https://arxiv.org/html/2607.23377#bib.bib24)],采用查询-键归一化以保证注意力稳定性(如[10 (https://arxiv.org/html/2607.23377#bib.bib25)]中大规模使用的方式),以及采用8/38/3宽度约定的门控线性单元前馈层[27 (https://arxiv.org/html/2607.23377#bib.bib23)]。我们将宽深纵横比随扩展大致保持在接近一百,这是Kaplan等人发现的Transformer最优值[17 (https://arxiv.org/html/2607.23377#bib.bib7)],从而使模型规模沿单一明确定义的族变化。读出使用单个前置类别词元,且没有位置编码,这反映了喷注的组成粒子构成集合而非序列。架构在第VII.2 (https://arxiv.org/html/2607.23377#S7.SS2)节有完整描述;对后续内容而言,关键是它刻意省略了物理感知网络所内置的归纳偏置(洛伦兹等变性、成对相互作用特征、红外与共线安全)[13 (https://arxiv.org/html/2607.23377#bib.bib4),6 (https://arxiv.org/html/2607.23377#bib.bib5),29 (https://arxiv.org/html/2607.23377#bib.bib6)]。

### II.2 预训练数据与目标

我们在OmniLearned数据集[3 (https://arxiv.org/html/2607.23377#bib.bib12)]上预训练,该数据集由七个喷注数据集组成,总计约1.06×1091.06\times 10^{9}个训练喷注;逐喷注特征和完整布局见第VII.4 (https://arxiv.org/html/2607.23377#S7.SS4)节。预训练目标是对语料库定义的扁平标签空间进行分类:200个喷注过程和味类标签,加上十个数据集级别标签。这些是喷注级别的类别,而非组成粒子的词表。我们报告高斯平滑的训练损失作为缩放量;扫描运行对语料库的遍历不足一遍,因此该损失是在模型从未见过的样本上评估的。精确定义见第VII.1 (https://arxiv.org/html/2607.23377#S7.SS1)节。

### II.3 下游任务与基线

对于下游评估,我们使用两个与预训练混合数据不相交的广泛使用的社区基准:顶夸克标记参考数据集[18 (https://arxiv.org/html/2607.23377#bib.bib1)]和Pythia8夸克/胶子数据集[19 (https://arxiv.org/html/2607.23377#bib.bib2)]。我们用新的二分类头对预训练主干进行微调,并报告准确率、AUC以及在εS=0.5\varepsilon_{S}=0.5和0.30.3下的背景抑制率。

作为物理感知基线模型,我们使用OmniLearned[3 (https://arxiv.org/html/2607.23377#bib.bib12)],一个融合了物理归纳偏置的成熟基础模型,并在这些基准上报告了当前最优性能。它在同一语料库上预训练,因此比较保持了预训练数据不变。我们全程与OmniLearned研究报告中公布的指标进行比较。为将两个模型置于更广阔领域的背景中,我们还复现了OmniLearned研究中汇总的已发表标记器结果[3 (https://arxiv.org/html/2607.23377#bib.bib12)]。

## III 可预测的缩放定律

### III.1 损失定义与计算量核算

我们在一个几何阶梯的ParticleViT模型上拟合缩放定律,这些模型在IsoFLOP网格上训练,即在固定计算量下同时变化可训练参数数量NN和训练喷注数量DD。这里NN是总可训练参数数量(第VII.1 (https://arxiv.org/html/2607.23377#S7.SS1)节)。训练计算量由模型规模和实测的喷注平均词元占用率核算;精确的FLOP约定和逐喷动词元数量见第VII.1 (https://arxiv.org/html/2607.23377#S7.SS1)节。

### III.2 函数形式与拟合

我们用Chinchilla参数形式对预训练损失建模

L(N,D)=ANα\+BDβ\+L∞,L(N,D)\;=\;\frac{A}{N^{\alpha}}\;+\;\frac{B}{D^{\beta}}\;+\;L_{\infty},(1)

其中L∞L_{\infty}是不可约损失,我们从阶梯上估计{A,B,α,β,L∞}\{A,B,\alpha,\beta,L_{\infty}\}。图1 (https://arxiv.org/html/2607.23377#S3.F1)以(模型规模,训练FLOPs)平面中的IsoLoss等值线以及损失随模型规模的IsoFLOP切片形式可视化了结果。我们按照Hoffmann等人[16 (https://arxiv.org/html/2607.23377#bib.bib8)]的方法估计参数,最小化阶梯上预测值与实测log⁡L\log L之间残差的Huber损失(δ=10−3\delta=10^{-3}),从初始化网格出发使用L-BFGS-B并保留最佳最优点;拟合给出α≈0.23\alpha\approx 0.23,β≈0.06\beta\approx 0.06,而L∞L_{\infty}未被分辨(表1 (https://arxiv.org/html/2607.23377#S3.T1))。振幅AA和指数α\alpha高度简并,因此我们只报告α\alpha。该拟合使用与Chinchilla研究相同的函数形式,后者的语言模型拟合给出α=0.34\alpha=0.34和β=0.28\beta=0.28[16 (https://arxiv.org/html/2607.23377#bib.bib8)]。因此最显著的区别是我们的拟合中数据指数小得多。这种比较是定性的,因为目标、词元定义和数据模态不同。拟合倾向于可忽略的不可约损失,L∞L_{\infty}紧贴搜索下界(10−1210^{-12}),但我们的数据实际上并不能约束它:L∞L_{\infty}与数据指数β\beta相互权衡,在最小二乘和稳健(soft-L1L_{1})目标下,或在80%80\%子样本上重新拟合,L∞L_{\infty}可以落在0到≈0.2\approx 0.2之间的任何位置,而拟合质量变化可忽略。因此我们将其报告为上界L∞≲0.2L_{\infty}\lesssim 0.2(与零一致),而非实测值。210210类目标具有严格为正的贝叶斯下界,但我们的数据无法分辨它,因此我们将拟合的近零L∞L_{\infty}带入外推,并将所探测区域视为幂律区域,而不将该下界解读为真正的不可约损失。数据指数β\beta很小,且在L∞L_{\infty}被固定在其下界时受到紧密约束(第10至第90百分位宽度低于±0.003\pm 0.003);允许非零L∞L_{\infty}沿上述简并方向只会将其放宽至β≲0.09\beta\lesssim 0.09。约束最弱的方向是振幅AA及其简并伙伴α\alpha,其区间大致覆盖0.140.14至0.290.29。因此下文讨论的计算最优分配的不确定性继承自α\alpha而非β\beta。

表 1:Chinchilla式缩放定律(式 [1 (https://arxiv.org/html/2607.23377#S3.E1))]的拟合参数,在136136个拟合点上估计,每个(计算预算,模型规模)单元一个点,覆盖十个均低于101910^{19}FLOPs的计算预算。中心值是名义拟合(对数残差的Huber损失,L-BFGS-B);α\alpha和β\beta的括号内区间是对拟合点进行100次随机80%子样本重拟合得到的第10和第90百分位数,即Hoffmann等人[16 (https://arxiv.org/html/2607.23377#bib.bib8)]的程序。振幅AA和指数α\alpha高度简并,因此AA约束较弱,两者以点估计形式给出;约束良好的组合是在枢轴点N0=6.6×106N_{0}=6.6\times 10^{6}和D0=6.0×107D_{0}=6.0\times 10^{7}处的归一化振幅A/N0α=0.057A/N_{0}^{\alpha}=0.057和B/D0β=0.93B/D_{0}^{\beta}=0.93。不可约损失L∞L_{\infty}未被分辨:拟合将其紧贴搜索下界(10−1210^{-12}),但它与β\beta简并,且在最小二乘和稳健目标下可与从0到≈0.2\approx 0.2的任何值一致,因此我们报告为上界(L∞≲0.2L_{\infty}\lesssim 0.2),并将拟合的近零值带入外推。参见图注

图 1:可预测的缩放定律。(模型规模,训练FLOPs)平面中的IsoLoss等值线(左)和损失随模型规模的IsoFLOP切片(右),针对OmniLearned语料库上的ParticleViT。圆圈是拟合中使用的运行;方块是五个留出

相似文章

fMRI基础模型的扩展性研究

arXiv cs.LG

本文对fMRI基础模型进行了一项扩展性研究,揭示了模型性能取决于预训练数据规模、模型规模和训练时长的组合,而不仅仅是计算资源。

TESSERA v2:扩展像素级地球基础模型

Hugging Face Daily Papers

该论文介绍了迄今为止最大的地球观测基础模型可控扩展研究,展示了预训练损失对下游性能的预测能力较差,并提供了最优计算资源分配规则。它训练了扩展的像素级模型(0.5B和1B参数),并将其蒸馏为紧凑的学生模型,这些模型优于更大的开源和专有模型。