用于对撞机实验可解释异常检测的对比学习

arXiv cs.LG 论文

摘要

ORCA是一个使用对比学习和自编码器的两阶段框架,用于对撞机实验中的可解释异常检测,以提高新物理搜索的灵敏度和可解释性。

arXiv:2608.13652v1 Announce Type: new 摘要:对撞机物理的通用事件级异常检测存在两个常见问题:异常分数难以解释,并且与能量尺度和对象多重性强烈相关。我们提出通过对比学习进行异常检测的有组织表示(ORCA),这是一个两阶段框架,首先通过监督对比学习在多样化的物理过程中学习一个嵌入空间,然后在该空间中运行标准自编码器以生成事件级异常分数。在与高亮度大型强子对撞机条件一致的模拟数据集上,ORCA在灵敏度的广度和深度上对新物理信号带来了显著的提升,相对于基线自编码器架构。除了提高灵敏度外,对比嵌入使得异常样本可解释:因为已知过程占据空间的不同区域,对嵌入分布的最大似然模板拟合可以将异常样本中的事件归因于模板物理过程,并给出量化的不确定性。我们证明该拟合准确恢复了注入的信号产额,包括那些被排除在嵌入训练之外的信号,并通过它们最相似的已知过程来表征模板库中缺失的信号。这些结果确立了ORCA作为在对撞机上进行可解释异常检测搜索的一种途径,其中嵌入几何携带的高维物理信息优于标准的一维输出拟合,从而增强下游统计分析。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:10

# 对比学习在对撞机实验中用于可解释异常检测的实现
来源:https://arxiv.org/html/2608.13652  
贾浩毅 邮箱:[hjia@slac\.stanford\.edu](mailto:[email protected]) 所属机构:斯坦福大学物理系,450 Jane Stanford Way,斯坦福,CA 94305 所属机构:SLAC国家加速器实验室,2575 Sand Hill Rd,门洛帕克,CA 94025  
萨加尔·阿德帕利  
朱莉娅·贡斯基 所属机构:SLAC国家加速器实验室,2575 Sand Hill Rd,门洛帕克,CA 94025

2026年8月13日

###### 摘要

对撞机物理中的通用事件级异常检测存在两个反复出现的问题:异常分数难以解释,并且与能量尺度和物体多重性强相关。我们提出了一种用于异常检测的对比学习有序表示框架(Organized Representation via Contrastive learning for Anomaly detection,简称ORCA),这是一个两阶段框架:首先通过跨多样物理过程的监督对比学习来学习一个嵌入空间,然后在该空间中运行一个标准的自编码器以生成事件级异常分数。在一个与高亮度大型强子对撞机条件一致的模拟数据集上,ORCA相对于基线自编码器架构,在探测新物理信号的广度和深度上都取得了显著提升。除了提高灵敏度外,对比嵌入还使得异常样本具有可解释性:由于已知过程占据空间中不同的区域,对嵌入分布进行最大似然模板拟合,可以将异常样本中的事件归因于模板物理过程,并量化不确定性。我们证明,该拟合能够准确恢复注入的信号产额(包括嵌入训练中排除的信号),并通过它们最相似的已知过程来表征模板库中不存在的信号。这些结果确立了ORCA作为对撞机上基于可解释异常检测搜索的一条途径,其中嵌入几何结构比标准的一维输出拟合包含更高维度的物理信息,从而增强了下游统计分析。

## I 引言

异常检测(AD)已成为在大型强子对撞机(LHC)上搜索超出标准模型(BSM)物理迹象的关键机器学习(ML)技术10 (https://arxiv.org/html/2608.13652#bib.bib5);26 (https://arxiv.org/html/2608.13652#bib.bib22);1 (https://arxiv.org/html/2608.13652#bib.bib23)。AD方法与传统分析技术的不同之处在于,它们能够在保持高本底抑制能力的同时,做到与信号模型无关,从而能够覆盖可能进入测量相空间的广泛BSM现象。ATLAS4 (https://arxiv.org/html/2608.13652#bib.bib30);5 (https://arxiv.org/html/2608.13652#bib.bib31);6 (https://arxiv.org/html/2608.13652#bib.bib32);7 (https://arxiv.org/html/2608.13652#bib.bib33)和CMS17 (https://arxiv.org/html/2608.13652#bib.bib29)实验已经采用有前景的基于深度学习的AD技术,针对多种末态搜索奇异现象。

AD涵盖了大量ML技术和模型,每种都有其优势和局限性3 (https://arxiv.org/html/2608.13652#bib.bib20)。虽然所有目标都是获得传统监督ML方法所不具备的一定程度的模型无关性,但异常检测工具在使用信号模型方面各不相同。无监督技术仅使用无标签数据进行训练,并且不对接信号的性质做任何假设24 (https://arxiv.org/html/2608.13652#bib.bib17);16 (https://arxiv.org/html/2608.13652#bib.bib18);25 (https://arxiv.org/html/2608.13652#bib.bib16);21 (https://arxiv.org/html/2608.13652#bib.bib19)。自监督技术也主要使用无标签数据进行训练19 (https://arxiv.org/html/2608.13652#bib.bib21);22 (https://arxiv.org/html/2608.13652#bib.bib25),但从数据本身构建伪标签来塑造中间表示。第三类部分监督技术则使用带标签的数据来辅助此学习29 (https://arxiv.org/html/2608.13652#bib.bib6);32 (https://arxiv.org/html/2608.13652#bib.bib8),采用一个监督表示学习阶段,其后接一个不提供标签的无监督AD阶段。

虽然AD方法已被证明在隔离富信号相空间方面很强大,且不明确依赖于信号建模本身,但它们的传统实现存在局限性。第一种局限性是学习能力。基于压缩的技术,如裸自编码器35 (https://arxiv.org/html/2608.13652#bib.bib34),当直接在低级输入上训练时,对训练群体特性很敏感。基于重建的训练目标激励模型记住重复出现的条目,这比学习高阶相关性更快地降低了净损失。原始输入值、数据集拓扑结构和神经网络插值偏差都可能导致正常事件重建效果差,而稀有的真实异常却能重建良好9 (https://arxiv.org/html/2608.13652#bib.bib24)。此类局限性还增加了对探测器条件(如堆积)的依赖。

当前AD方法的第二个局限性涉及解释性。理解异常分数的行为通常仅限于检查相对于原始运动学输入的聚类和相关性。更复杂的解释可能使用蒙特卡洛(MC)模拟来做出,但存在这样的风险:这些解释源于MC建模误差,而非真实的偏差。参考文献4 (https://arxiv.org/html/2608.13652#bib.bib30);5 (https://arxiv.org/html/2608.13652#bib.bib31);6 (https://arxiv.org/html/2608.13652#bib.bib32);7 (https://arxiv.org/html/2608.13652#bib.bib33);17 (https://arxiv.org/html/2608.13652#bib.bib29)中的信号提取,要么在异常相空间进行(其中拟合实验测量的量,如不变质量分布),要么在运动学受限的相空间进行(其中拟合异常分数分布)。这两种方法都需要指定相对狭窄的测量相空间,从而降低了AD潜在的通用性。此外,这种缺乏可解释性显著降低了AD结果对于模型测试和开发的价值;仅凭一个异常分数,许多不同的模型(每个都跨越广泛的自由参数范围)可能表现为无法区分的分数分布。

对比学习(CL)13 (https://arxiv.org/html/2608.13652#bib.bib1);14 (https://arxiv.org/html/2608.13652#bib.bib37);15 (https://arxiv.org/html/2608.13652#bib.bib2)可以解决传统AD方法的这两个局限性。CL指的是一类表示学习技术,其中编码器被训练将指定为相似的事件对(正对)在固定维度的向量空间中映射到彼此接近的位置,同时将指定为不相似的对推开。生成的表示被训练以鼓励两个特性:对齐性和均匀性38 (https://arxiv.org/html/2608.13652#bib.bib36),其中正对映射得接近,而表示则分散在可用空间中。两者结合,施加了一种超越原始特征提供的特定于上下文的结构。正对可以通过带标签数据(文献中称为监督CL27 (https://arxiv.org/html/2608.13652#bib.bib28))构建,也可以通过对单个事件进行人工增强(增强方式保持底层物理不变)来构建14 (https://arxiv.org/html/2608.13652#bib.bib37),后者称为自监督CL。

在对撞机物理的AD应用中,这已被扩展到选择故意使物理不保持不变的增强方式,这些增强方式被用作排斥对,以使表示对通用的异常特征敏感19 (https://arxiv.org/html/2608.13652#bib.bib21);22 (https://arxiv.org/html/2608.13652#bib.bib25)。CL假设,使用这个向量空间可以为下游AD提供比原始输入特征更丰富的替代方案。具体来说,创建一个约束良好且受控的中间表示,使得密度估计或重建任务变得简单得多。模型中人为放大异常分数的统计伪影在此表示中被分散,从而能够更好地学习那些细微的高维相关性,这些相关性是基于AD搜索的主要目标。此外,一个精心构建的中间向量空间可以作为底层物理的表示,为嵌入(因此也用于提取)物理模型或过程信息提供连续的操作手段。

本工作提出了用于异常检测的对比学习有序表示(Organized Representation via Contrastive learning for Anomaly detection,简称ORCA)方法。第一阶段使用CL创建一个基于物理过程的潜在嵌入,通过监督信号和背景过程,以物体级运动学特征作为输入进行训练。然后将此嵌入用作第二阶段的输入,即一个仅在无监督的背景事件上训练的自编码器。这两个阶段仅通过学习到的嵌入耦合,因此每个阶段都可以独立替换。本文采用的架构代表了该框架的一种用例。因此,我们展示,通过使用物理信息嵌入,与直接在物体级特征上训练的基线自编码器相比,我们提高了AD模型的判别力。此外,我们构建了一个使用每个事件的嵌入向量值进行信号提取的框架,从而证明CL可以被用于强大的物理解释,而不失去相空间的通用性。该框架在结构上等同于BSM搜索中常用的分箱拟合技术。因此,解释结果无需额外的工具或对底层ML方法的熟悉,降低了使用已发表的真实数据AD结果进行重新解读的门槛。

先前关于高能物理(HEP)中AD物理信息嵌入的工作沿着两个广泛方向展开。第一种是在模型架构中直接施加物理对称性23 (https://arxiv.org/html/2608.13652#bib.bib27);33 (https://arxiv.org/html/2608.13652#bib.bib26)。第二种是从数据中学习嵌入,如自监督CL通过增强喷注或事件成分来强制近似不变性20 (https://arxiv.org/html/2608.13652#bib.bib35),这种方法通过异常驱动的增强适用于AD19 (https://arxiv.org/html/2608.13652#bib.bib21);22 (https://arxiv.org/html/2608.13652#bib.bib25)。参考文献32 (https://arxiv.org/html/2608.13652#bib.bib8);29 (https://arxiv.org/html/2608.13652#bib.bib6)从带标签的物理过程构建对比嵌入,并展示了检测灵敏度的显著提升。然而,两者都没有将嵌入发展成用于信号提取或物理解释的框架。自编码器特征嵌入两阶段结构的另一个先例可在参考文献31 (https://arxiv.org/html/2608.13652#bib.bib7)中找到,尽管其嵌入目标使用分类而不是CL。本工作首次将对比潜在表示应用于异常的物理解释,且无需局限于特定的测量相空间。

## II 方法学

### II.1 样本

ORCA在模拟的LHC碰撞数据集COLLIDE-2V34 (https://arxiv.org/html/2608.13652#bib.bib10)上进行训练和评估,该数据集包含约7.5亿次质子-质子碰撞,质心能量√s=13.6 TeV。数据集包含50多种不同的标准模型过程,使用MadGraph2 (https://arxiv.org/html/2608.13652#bib.bib11)和Pythia11 (https://arxiv.org/html/2608.13652#bib.bib12)在高亮度LHC条件下生成,对应的平均同时相互作用数μ等于200。简化探测器响应使用Delphes18 (https://arxiv.org/html/2608.13652#bib.bib13)进行模拟,配置卡为CMS Phase II配置,包含两个事件视图:假设高性能径迹的完全重建物体,以及性能降低以匹配L1触发器约束的自定义触发级物体。本工作仅考虑完全重建的物体。

事件由一个110维向量建模,该向量由10个主导喷注、4个主导电子、4个主导μ子、4个主导光子以及缺失横向能量(MET)构成。每种类型的物体按横向动量p_T排序,并截断为这些固定多重数;物体较少的事件用零填充,任何超出保留数量的额外物体被丢弃。喷注使用anti-k_t算法12 (https://arxiv.org/html/2608.13652#bib.bib14)重建,半径R=0.4。它们由六个特征描述:横向动量p_T、赝快度η、方位角φ、b标记判别式、电荷和质量。电子特征包括p_T、η、φ、强子与电磁量能器能量之比(E_had/E_em)以及ρ修正的隔离变量;光子仅使用p_T、η、φ。μ子特征包括p_T、η、φ以及ρ修正的隔离变量。缺失横向能量通过其大小和方位角进行编码。

### II.2 机器学习模型

ORCA方法采用两阶段过程进行训练,如图1 (https://arxiv.org/html/2608.13652#S2.F1)所示。首先,训练一个嵌入器模型,通过对多种不同信号使用对比损失项,来创建输入事件的表示。然后,一个无监督异常检测模型在基于第一阶段定义的表示嵌入的数据上进行训练。开发并训练第三个模型以提供ORCA结果的背景,具体来说,是一个直接在ORCA嵌入器模型的物理输入上训练的自编码器。每个模型的结构和训练细节如下所述。

图1:两阶段ORCA框架概述。在第一阶段,一个由编码器和投影头组成的嵌入器使用监督对比损失进行训练,以产生一个标准模型过程组彼此分离的表示空间。在第二阶段,一个异常检测模型(此处为自编码器)在嵌入到该表示空间的背景数据上进行无监督训练,其重建误差作为异常分数。投影头仅在第一阶段训练中使用。

#### ORCA 阶段1:嵌入器

嵌入器由编码器网络和投影网络组成,灵感来源于参考文献28 (https://arxiv.org/html/2608.13652#bib.bib9)。编码器网络将每个事件x映射到一个D_E维表示向量r → ∈ R^{D_E}。具体来说,每个物体首先通过一个专用的逐物体网络(每种物体类型一个)映射到一个共同的D_O维嵌入空间,该网络由堆叠的全连接层、批归一化和GELU激活组成,权重在所有该类型物体间共享。生成的物体标记被添加一个可学习的位置嵌入,并由一个Transformer编码器块堆栈处理,每个块包含多头自注意力和一个位置前馈网络(带GELU激活)、残差连接和层归一化。一个可学习的多

相似文章

CLOE:Christoffel损失自编码器用于异常检测

arXiv cs.LG

CLOE是一种新的半监督异常检测方法,结合了自编码器与基于Christoffel函数的检测器,通过一种新颖的损失函数来改进表示学习。该方法在高维表格数据上取得了最先进的结果,同时保持了简单性。

当规则违反罕见时:逻辑异常检测的奇美拉训练

arXiv cs.LG

本文介绍了奇美拉训练(Chimera Training),这是一种用于逻辑异常检测的方法,通过在特征层面进行反事实构建来训练神经规则评估器,无需真实的异常图像,从而在CLEVRER、OpenImages和VidOR等基准测试上提升了规则级异常检测性能。