用于对撞机物理的多域自适应轻量级基础模型

arXiv cs.LG 论文

摘要

介绍了NEXUS,一个约300万参数的轻量级基础模型,在LHC对撞数据上进行预训练,展示了在引力波、洪水预测和神经活动等任务上的改进下游性能及跨域迁移能力。

arXiv:2607.27501v1 公告类型:新 摘要:我们提出了一种轻量级基础建模方法(\textbf{NEXUS}),利用对撞机物理数据的预训练学习,将其应用于其他科学数据集的域外任务,采用约300万个参数的全连接自编码器模型。该模型在大型强子对撞机的大规模对撞数据集上以无监督方式进行预训练,该数据集由带电粒子径迹特征建模。针对对撞机分析的下游任务,如运动学回归和事件分类,基于预训练模型权重进行开发,与从头训练的等效架构相比,仅使用少量标记数据集即可实现更高的精度。此外,通过潜在空间解释以及在其他领域(包括引力波、洪水预测和神经活动)的应用,进一步研究了预训练的优势。此外,与相同规模的Transformer方法相比,NEXUS的相对计算简单性得到了验证,为基础模型在科学实验中的高能效推理以及实时或边缘应用打开了大门。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:02

# 面向对撞机物理的多域自适应轻量级基础模型
来源:https://arxiv.org/html/2607.27501

\[1\]\\fnmLiangyu\\surWu

\[2\]\\fnmQibin\\surLiu

1\]\\orgdiv物理系,\\orgname斯坦福大学,\\orgaddress\\street450 Jane Stanford Way,\\city斯坦福,\\postcode94305,\\stateCA,\\country美国

2\]\\orgnameSLAC国家加速器实验室,\\orgaddress\\street2575 Sand Hill Road,\\city门洛帕克,\\postcode94025,\\stateCA,\\country美国

###### 摘要

我们提出了一种轻量级的基础建模方法(NEXUS),利用从对撞机物理数据中进行的预训练学习,将其迁移到其他科学数据集的域外任务中。该方法采用一个全连接自编码器模型,参数约为300万。模型以完全无监督的方式,在大型强子对撞机的大型碰撞数据集上使用带电粒子径迹特征进行预训练。针对对撞机分析的下游任务(如运动学回归和事件分类)基于预训练权重开发,与从零开始训练的等价架构相比,仅需少量带标签数据集即可获得更高的精度。我们还通过潜在空间解释以及在其他领域的应用(包括引力波、洪水预报和神经活动)进一步研究了预训练的好处。此外,与同等规模的Transformer方法相比,NEXUS在计算上的简单性也得到了验证,为科学实验中基础模型的高能效推理以及实时或边缘应用打开了大门。

###### 关键词:

基础模型,迁移学习,跨域泛化

## 1 引言

高能对撞机为了解基础物理提供了独特的窗口,通过高度通用的探测器探索可及能量尺度的极限。然而,这些探测器的高复杂性和巨大数据率给数据采集、过滤、重建和分析带来了挑战。人工智能和机器学习(AI/ML)已被证明是利用这些实验发挥科学潜力的独特有效工具[albertsson2019machinelearninghighenergy,duarte2025machinelearning,Karagiorgi2022,Radovic2018]。

随着AI/ML能力的进步以及可用计算能力的提升,对撞机数据集的全部统计效能可以通过大规模训练基础模型来利用[bommasani2022opportunitiesrisksfoundationmodels,zhou2023comprehensivesurveypretrainedfoundation]。一个大规模预训练(即使用高比例的可用训练实例和计算资源)的骨干模型可以生成数据集的表示,并针对一系列规模较小的下游任务进行迁移和微调[KUCHERA2019156,Chappell\_2022,Dreyer2022],从而使得不同目标能够受益于共享的学习表示。这减少了从头训练多个特定任务模型所需的密集训练,允许在固定的计算预算内,在更广泛的任务上实现更高性能。基础模型还有助于缓解可用训练实例有限的挑战,这在科学背景下尤其重要,因为感兴趣的过程是罕见的,实验数据收集是有限的。

基础模型正在高能物理(HEP)领域得到积极研究,其应用包括喷注物理[golling2024maskedparticlemodelingsets,PhysRevD.111.054015,Bhimji\_2026,Birk\_2024]、新现象搜寻[hsu2026evenetfoundationmodelparticle]等[Mikuni\_2025]。此外,已在HEP数据上预训练的基础模型已被证明能够实现向其他科学领域的有效迁移学习[mikuni2025omnicosmostransferringparticlephysics]。然而,这种迁移通常依赖于一定程度的训练监督,以及依赖于资源密集型的架构(如Transformer)[vaswani2023attentionneed],这些架构在训练和部署上计算开销很大,通常涉及O\(10\)百万参数和包含O\(100\)百万训练实例的数据集。无注意力架构,例如依赖多层感知机的架构,可以在没有自注意力开销的情况下在特定任务上取得有竞争力的性能[tolstikhin2021mlpmixerallmlparchitecturevision,touvron2021resmlpfeedforwardnetworksimage,liu2021payattentionmlps],尽管这种潜力在预训练和迁移学习的背景下仍未得到充分探索,尤其是在对撞机物理领域。

本研究提出了一种方法,在保留大规模预训练性能优势的同时,避免基于Transformer架构的计算复杂性,从而降低模型开发和部署的计算成本。我们引入了一种基于全连接层自编码器架构的神经网络编码器×解码器,用于通用灵敏度(NEXUS)。它以完全无监督的方式,在由低层特征(具体为带电粒子径迹观测量)建模的对撞机事件上进行预训练。凭借300万参数和2000万训练实例,NEXUS展示了在一系列对撞机物理任务上的迁移学习能力,并将其扩展到其他科学领域。这些结果表明,对于某些模态,使用相对简单的深度神经网络(DNN)架构进行大规模预训练仍然可以在下游迁移任务上产生显著的改进。这对基础模型必须需要诸如注意力机制等计算密集型组件的普遍观点提出了挑战,并为科学应用(包括实时和其他资源受限环境中的部署)指明了通往低功耗、低成本基础模型的道路。

## 2 结果

基础模型的特征在于一个预训练模型,它学习可广泛迁移的表示,并且只需最少的额外训练即可适应广泛的下游任务。图1 (https://arxiv.org/html/2607.27501#S2.F1)提供了NEXUS基础模型及其后续下游应用的可视化表示。骨干模型包括编码器及其嵌入空间,下游模型由骨干模型加上一个调整输出维度以匹配每个下游任务的线性探测头组成。为了充分探索模型的迁移学习空间,预训练的骨干被迁移到四个对撞机物理任务和三个域外任务。

参见说明图1:NEXUS基础模型及其向域内和域外下游任务迁移的概述。\(a\) 在ATLAS碰撞事件上的无监督预训练,事件表示为内探测器径迹的30×6张量(最多30条领先pT径迹,每条径迹由六个特征描述:η、pT、φ、d0、z0和χ2)。\(b\) NEXUS骨干在四种下游研究训练方案中的使用示意图,即固定骨干、微调、从头训练和随机初始化。青色表示预训练权重,阴影表示随机权重,挂锁表示冻结权重,蓝色方块表示可训练的任务头。\(c\) 下游迁移。预训练的潜在表示馈送到轻量级任务头,用于域内ATLAS(蓝色)和域外(橙色)任务。

预训练的好处是通过衡量预训练模型在少量训练实例下相对于从头训练的模型在给定下游任务上的表现提升程度来量化。检验这一假设需要考察三种不同的模型训练方案:固定骨干,其中预训练权重固定,仅在线性探测头权重在训练期间调整;微调,其中整个下游模型在训练期间可以从预训练权重值开始更新;以及从头训练,其中下游模型给定一个任务从随机权重开始训练。

### 2.1 对撞机物理

带电粒子径迹提供了ATLAS实验[TheATLASCollaboration\_2008]在大型强子对撞机(LHC)上质子-质子碰撞的有用描述,以优异的空间分辨率捕获带电粒子的动量和轨迹。尽管径迹并不能完全描述碰撞的最终状态,但这里将其作为单一模态,用于测试基于集合输入的DNN基础模型。NEXUS的应用聚焦于对撞机物理实验研究中的关键任务,即从原始探测器信号重建粒子,以及基于粒子内容选择有趣的事件。

#### 2.1.1 异常检测

异常检测,即在没有信号特定先验的情况下识别数据集中的异常元素,是对撞机搜索计划的重要组成部分,因为超越标准模型(BSM)物理的本质是未知的[BELIS2024100091]。自编码器通常用于此任务,因为它们的无监督训练创建了一个潜在空间,其中类似数据的事件被聚类,而异常元素将偏离分布。作为理解NEXUS迁移学习能力的第一个机会,我们使用异常检测指标研究了其在骨干潜在空间中对ATLAS事件的学习聚类。

使用二维均匀流形近似与投影(UMAP)[Healy2024]投影来可视化ATLAS碰撞数据和来自蒙特卡罗(MC)模拟的八个BSM信号的潜在空间结构(图2 (https://arxiv.org/html/2607.27501#S2.F2))。在这个无标签的投影中出现了三个广阔的区域:标准模型(SM)本底(由数据表示)、两个轻子衰变共振(Z′→e+e−和Z′→τ+τ−),以及拓扑相似的富含喷注的信号(轻子夸克、W′→qq̄、W′→tb(包含强子和轻子顶夸克衰变)、Z′→bb̄和Z′→tt̄)。这种组织揭示了NEXUS学习到的基本拓扑特征:本底和轻子信号很容易被区分,而残余的混淆集中在具有相似径迹特征的拓扑相似的强子最终态中。对拟合到二维UMAP投影的核密度估计(KDE)取负对数密度,其中低密度、本底稀疏区域的事件获得更高的异常分数,在所有信号上提供了大于0.95的曲线下面积(AUC),表明NEXUS潜在空间具有有用的异常分类能力。

参见说明图2:九类事件的编码器潜在空间。冻结的NEXUS骨干潜在表示的三维UMAP投影:标准模型本底(蓝色)是孤立的,轻子Z′→ee/ττ信号形成一个不同的区域,而富含喷注的强子信号在左下角重叠。阴影区域显示了每类的密度。等高线包围了每个类最密集的68%。

#### 2.1.2 事件分类

为NEXUS考虑了两个监督分类任务:一个从本底中分类BSM信号的九路监督分类,以及一个对所有主要LHC本底[Section4 (https://arxiv.org/html/2607.27501#S4)]中的20个SM过程进行分类的分布内任务。基础模型的性能通过训练数据集扫描图来总结,其中训练实例数量从可用训练集的100%变化到0.1%,并在三种训练配置下评估性能。图3\(a\) (https://arxiv.org/html/2607.27501#S2.F3.sf1)和3\(b\) (https://arxiv.org/html/2607.27501#S2.F3.sf2)分别显示了BSM和SM分类任务的结果。对于每个任务,从预训练权重初始化的两种方案,即固定骨干和微调模型,在低训练实例数量下都优于从头训练的基线,揭示了预训练的好处。在极端低数据情况下,固定骨干通常最强,因为它较少的可训练参数能够抵抗过拟合[kumar2022finetuningdistortpretrainedfeatures]。当使用完整训练数据集时,从头训练的模型通常接近或超过微调性能,表明在数据充足的情况下,无论初始化如何,架构都会收敛到其最优性能。

#### 2.1.3 喷注重建

喷注是初始夸克或胶子在探测器中强子化产生的粒子喷射,留下带电粒子径迹以及量热器中的能量沉积。NEXUS喷注任务与重建相关,即同时回归喷注横动量pT和不变质量m,以及识别b夸克的存在(“b标记”)。由于喷注pT主要是量热器导出的量(如在当前ATLAS实验中重建的[TheATLASCollaboration\_2008]),而NEXUS仅使用径迹的输入无法获得该量,因此报告了从ATLAS开放数据获得的标准基于量热器的喷注重建分辨率作为非ML参考。图3\(c\) (https://arxiv.org/html/2607.27501#S2.F3.sf3)、3\(d\) (https://arxiv.org/html/2607.27501#S2.F3.sf4)和3\(e\) (https://arxiv.org/html/2607.27501#S2.F3.sf5)分别显示了喷注b标记、质量和pT回归的基础模型图。关于迁移学习的相同广泛结论也适用于喷注重建任务;在所有训练数据集大小下,预训练初始化优于从头训练(尤其是在标签较少时),其中微调总体最佳,而固定骨干在低统计情况下仍具有竞争力。

参见说明\(a\)BSM分类。

参见说明\(b\)SM分类。

参见说明\(c\)喷注b标记准确率。

参见说明\(d\)喷注重量回归。

参见说明\(e\)喷注pT回归。

图 3:下游对撞机任务上的基础模型扩展。对于每个任务,在相同的训练/验证/测试划分上比较三种训练方案(固定骨干、微调和从头训练),作为标记训练事件数量的函数,扫描范围从可用训练集的100%降至0.1%。性能是在保留的测试集上评估的适用于任务的测试指标。对于量热器导出的喷注pT,标准基于量热器的重建(“Calo reco”)的分辨率作为非ML参考叠加。点和带表示十个随机种子的平均值和标准差。

### 2.2 域外

NEXUS预训练骨干进一步在三个不同的非对撞机科学数据集上进行了测试,这些数据集来自专注于科学异常检测[nsfhdr\_ad]和分布外建模[nsfhdr\_mood]的社区挑战。所有域外数据集都由一维时间序列值组成,需要将对撞机径迹输入特征映射到描述一维波形的特征。表1 (https://arxiv.org/html/2607.27501#S2.T1)提供了本研究中使用的映射,这些映射旨在捕获相同的底层探测器响应,同时尊重不同坐标系中类似的对称性和信息内容。对撞机变量en

相似文章

训练前预测:粒子物理基础模型的缩放定律

arXiv cs.AI

本文证明,在小规模Transformer模型上拟合的缩放定律能够准确预测在粒子物理喷注数据上训练的更大模型的损失,从而在大规模训练之前将计算预算转化为预期的物理性能。他们发布了五个预训练模型以及完整的训练方案。

通用多模态基础模型

arXiv cs.LG

本文介绍了一种通用多模态基础模型,能够处理任意模态组合与预测任务,通过在具有多样化因果结构的大规模合成数据集上训练,实现了具有竞争力的性能。

Nvidia Cosmos 3

Hacker News Top

NVIDIA 开源了 Cosmos 3,这是一个物理AI的前沿基础模型,将推理、世界生成和动作生成统一在单一的 Mixture-of-Transformers 架构中,并发布了用于机器人、自动驾驶和仓库监控的模型检查点、数据集和训练脚本。