物理学中的安全领域适应:克服干扰、标签偏移和模拟先验

arXiv cs.LG 论文

摘要

本文探讨了物理学中领域适应的挑战,其中模拟与实验数据在干扰项和标签偏移上存在差异。它提出了自适应领域适应方法,以专注于真实的物理不匹配,并提供了一个模型选择规则。

arXiv:2608.18190v1 Announce Type: new 摘要:领域适应被广泛用于使基于模拟训练的神经网络适用于实验数据。其前提是两个域仅在干扰项上有所不同,并且目标量在两个域中的分布相同。在物理学中,这两个假设都不成立:模拟可能在物理上出错,而目标量的分布——例如能量谱或红移分布——往往本身就是测量内容。我们在一个玩具空气簇射基准上研究了这种不匹配的后果,在该基准中,可以单独或同时启用探测器响应干扰、物理模拟偏移和能量谱偏移。标准的对抗性适应能处理条件偏移,但一旦两个谱不同,它就会对齐它们,将一个不可控的偏差替换为一个基于模拟先验的偏差。我们提出了自适应领域适应,它对模拟事件进行重新加权,以便将领域适应仅专注于真实的物理不匹配。由于预测的谱取决于模型训练配置,我们提供了一个无标签的模型选择规则来选择接近最佳的操作点。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:22

# 应对干扰因素、标签偏移与模拟先验  
来源:https://arxiv.org/html/2608.18190  

## 物理学的安全域适应:应对干扰因素、标签偏移与模拟先验  

###### 摘要  
域适应被广泛应用于使在模拟数据上训练的神经网络适用于实验数据。其前提是两个域仅在干扰因素上存在差异,而目标物理量在两个域中具有相同的分布。然而在物理学中,这两个前提通常不成立:模拟数据可能在物理建模上存在错误,而目标量(如能量谱、红移分布)的分布往往正是测量的对象本身。我们研究了这种不匹配带来的影响,使用一个模拟空气簇射的实验基准,其中探测器响应干扰、物理模拟偏移和能量谱偏移可以单独或同时开启。标准的对抗性域适应可以处理条件分布偏移,但一旦两个谱分布不同,它会强行对齐它们,从而用一个依赖于模拟先验的偏差替代了原有的不可控偏差。我们提出了一种自适应域适应方法,通过对模拟事件进行重新加权,使域适应仅聚焦于真实的物理差异。由于预测的谱分布依赖于模型训练配置,我们提供了一种无需标签的模型选择规则,用于选取接近最优的工作点。  

## 1 引言  
机器学习(ML)方法,特别是神经网络,已成为物理数据分析的有力工具。其优势在于能够识别数据中复杂的模式,这些模式可能被传统基于规则的算法框架所忽视或难以实现。神经网络不依赖于少数手工设计的变量,而是直接从数据中学习从原始探测器输出到目标物理量的映射,同时利用许多低层观测量之间的关联。因此,机器学习显著提高了数据分析的准确性,并被广泛应用于各种场景。然而,正是这种对数据细微特征的敏感性,驱动了成功的同时也构成了神经网络的主要局限。即模型可能捕捉到特定于训练数据集的模式,而非具有物理意义的结构[33, 43]。实际上,网络学习在其训练数据所定义的特征相空间内进行插值。将其应用于超出该区域的数据则构成外推,而这种外推是众所周知的不可靠。这种过度专化引入了可能很大且本质上不可控的偏差:网络的输出无法表明输入是否超出了模型训练的区域。此外,使网络精确的敏感性也使其对训练与应用数据之间的微小差异产生响应,因此模型越强大,其预测在不匹配情况下越脆弱。  
此问题在物理学中尤为重要,因为模型通常在蒙特卡洛(MC)模拟上训练,随后应用于实验数据[14, 26, 41, 10, 29, 27, 40]。MC模拟不可避免地与真实数据不同,因为它们无法完美复制每一个物理过程、探测器响应和噪声源。这些差异由于模拟本身的系统不确定性而进一步加剧,这种不确定性源于对底层物理的不完全了解。例如,在天体物理学中,μ子难题——模拟与观测空气簇射中μ子含量的长期不一致——至今仍未解决[7, 3, 1, 2, 4]。这种不匹配导致训练域(MC模拟)与目标域(实验数据)之间产生系统性偏移,可能损害结果的物理诠释。  
域适应(DA)是一大类技术,旨在使机器学习模型对域间的系统性偏移具有鲁棒性[14, 26, 30, 18, 15, 6]。在其标准形式中,给定来自*源*域的标记数据,其分布为\( p_{\text{src}}(x,y) \),以及来自*目标*域的未标记数据,其分布为\( p_{\text{tgt}}(x,y) \),目标是学习一个在目标域上准确的预测器。最广泛使用的方法族是对抗性的:训练一个辅助分类器(*对抗器*),使其能够从网络学习到的内部表示\( z \)中区分两个域,同时训练网络使这种区分变得不可能[15]。在收敛时,该表示预期保留任务所需的信息,同时丢弃识别域的信息。这类方法已成功应用于高能物理[16, 36, 13, 11](包括在大型强子对撞机LHC[9, 20, 31])以及宇宙学[32, 37]中。  
域适应基于两个假设。第一个是域之间仅因干扰因素而不同:从数据到目标物理量的映射是共享的,即\( p_{\text{src}}(y|x) = p_{\text{tgt}}(y|x) \),而差异仅限于不携带关于\( y \)的信息的特征。经典的例子是MNIST-M基准[15],其中标签是数字,域偏移是彩色背景。由于背景与数字无关,一个背景不变的表示可以跨域迁移而不会损失精度。第二个假设涉及对齐机制。对抗器仅看到表示的*边缘*分布,该分布也编码了标签的分布。因此,强制\( p_{\text{src}}(z) = p_{\text{tgt}}(z) \)仅在目标物理量在两个域中分布相同时,即\( p_{\text{src}}(y) = p_{\text{tgt}}(y) \)时,才是保持标签的[38]。否则,对齐只能通过扭曲预测本身来实现。  
在物理学中,这两个假设通常都不成立。首先,模拟可能在物理本身上出错,因此差异不是干扰因素,而是数据与目标物理量之间关系的真实差异。其次,在许多物理应用中,目标量的分布在域间并不共享,实际上它正是被测量的东西。例如,在宇宙线能量重建中,它是实验能量谱;在宇宙学中,它是红移分布。由于对抗器无法区分干扰差异与标签分布差异,在这种情况下简单应用DA可能会错误地将实验谱与模拟谱对齐,从而扭曲了DA旨在保护的测量。  
在本文中,我们在一个模拟空气簇射探测器阵列的玩具实验上,系统地研究了域适应的影响。该基准揭示了三种不同类型的不匹配:模拟物理的错误指定(横向分布函数LDF)、模拟探测器响应的伪影(波形形状)以及谱(标签)偏移。我们发现,只要两个域共享相同的能量谱,DA就能表现良好。然而,一旦谱不同(标签偏移),标准的域对抗神经网络(DANN)[15]会将重建的谱拉向模拟先验。这在分析旨在测量的量中引入了偏差。  
为了解决这个问题,我们引入了*自适应域适应*(ADA),它直接针对标签偏移。ADA动态地为进入对抗损失的模拟事件分配权重,使得源域(MC)和目标域(实验数据)的谱(由网络本身估计)重合。因此,谱被从域判别特征集合中移除,对抗器仅作用于域之间的真实物理差异。类似的重要性加权对抗对齐之前已被应用于分类任务,以处理类别不平衡[38, 42]。我们的ADA将这种方法扩展到回归情况,在这种情况下,权重必须在未知目标标签的情况下动态推断。  
模拟与实验数据之间的不匹配经常在信号处理管道的不同阶段显现。我们证明,当域偏移是局部的时,采用局部域分类器的域适应可以有效地剥离探测器级别的干扰。然而,当差异是非局部的或影响全局事件属性时,这种方法无法解决域偏移,应使用标准的、全局的域适应。为了在真实目标谱未知时最大化性能,我们还提出了*迭代域适应*。通过将一轮训练中预测的目标谱作为改进的先验反馈到下一轮,该框架迭代地更新其谱假设。这种自洽的细化减轻了对设定不良的初始先验的依赖,并导致更好的能量谱重建。  
我们的第二个结果涉及当没有目标标签时如何选择模型的问题。对抗训练有一个自由参数——适应强度,结果的质量可能对其很敏感。然而,在训练时没有任何可用的数量能够表明适应是成功了,还是太弱或太强。我们提出了一种基于网络预测的跨种子分散性的无标签选择规则:那些独立种子运行彼此一致的模型配置,就是对抗训练正确收敛的配置。在我们的玩具实验中,该规则在每种研究情况下返回的配置都在标签选择最优值的25%以内。这使得域适应在没有可靠目标标签的最具挑战性的情况下也能实际使用。  
论文的其余部分结构如下。第2节介绍了玩具模拟实验、网络架构以及贯穿全文使用的诊断量。第3节分别考虑每一种域不匹配,以理解每种偏移的孤立作用。第4节将它们同时开启,并识别标准DA的故障模式。自适应域适应(ADA)在第4.2节以联合LDF和谱偏移为例引入。第4.3节考虑波形加谱偏移,第4.4节涵盖所有三种偏移同时存在的现实情况。我们在第5节中制定并验证了通用的无标签模型选择规则。最后,第6节总结全文。  

## 2 数据与神经网络  
### 2.1 模拟实验与数据集  
我们的空气簇射探测器是一个3×3的探测站网格,网格间距\( D = 1500 \)米。每个*事件*是一次单独的簇射观测,其核心位置在距中心随机均匀分布的偏移\( r_{\text{core}} \in [200, D/3] \)米处。空气簇射的方位角和天顶角分别在\( [0, 2\pi) \)和\( \cos\theta \in [\cos\pi/4, 1] \)内均匀分布。天顶角是事件的物理参数:它固定了各探测站到簇射轴的垂直距离,从而决定了每个探测站记录的信号。每个事件由其无量纲能量\( E = \log_{10}(E_{\text{ph}}/1\,\text{EeV}) \in [0, 1] \)标记,我们从Beta分布中采样能量谱。  
每个探测站记录一个*波形*——记录信号的时间序列,在64个箱中均匀采样,覆盖时间区间\( [-5, 5] \)(任意时间单位a.u.)。所有九个探测站在每个事件中都记录了信号,没有应用触发条件或阈值。我们假设波形具有以其中心为中心的高斯形状,记录的积分信号\( S(r, E) \)遵循幂律横向分布函数(LDF):  
\[
S(r,E) = S_0(E) \left( \frac{r}{r_0} \right)^{-\beta_{\text{LDF}}}, \quad S_0(E) = 100 \cdot 10^{E}, \quad r_0 = 800\,\text{m}, \quad \beta_{\text{LDF}} = 3.0,
\]  
其中\( r \)是探测站到簇射轴的垂直距离,\( \beta_{\text{LDF}} \)是LDF斜率参数。波形宽度通过\( \sigma(S) = 0.8 + 0.4 \log_{10}(1 + S) \)(a.u.)依赖于信号幅度,每个箱还添加了标准差为0.02的独立高斯噪声。因此,关于能量的物理信息通过波形的积分传递到网络,而其形状和宽度由探测器响应的模拟设定。一个事件示例如图1所示。  
(a) (b)  
**图1:** 事件示例。(a):探测站位置和记录的信号,(b):两个探测站记录的波形示例,时间轴为任意单位(a.u.)。  
除了波形样本外,每个探测站还由四个标量描述:到簇射轴的垂直距离\( r/r_0 \),相对于簇射核心的地面坐标\( (x, y)/r_0 \),以及归一化的平面波前到达时间\( t \)。在没有波形不匹配的实验中,我们提供另一个特征,即记录波形的积分——*积分旁路*。所有波形箱和积分电荷都经过\( \log_{10}(1 + S) \)变换,因为它们在原始值上跨越了几个数量级。  
为了量化域适应的成功与否,在目标域上

相似文章

时态分布偏移下的域自适应气候降尺度

arXiv cs.LG

本文研究了基于深度学习的气候降尺度中的时态分布外偏移问题,并提出了一种域自适应框架,该框架结合了监督重建与域对齐,以在非平稳条件下改进高分辨率气候预测。

半监督噪声自适应:从噪声域迁移知识

Hugging Face Daily Papers

本文介绍了半监督噪声自适应(SSNA),一种新颖的框架,它利用合成噪声域(例如高斯分布)作为替代源域,以提高半监督学习设置中的泛化能力。所提出的噪声自适应框架(NAF)建立了一个泛化边界,并展示了改进的目标域性能。