Synthics: 用于机器学习的类物理合成数据集

arXiv cs.LG 论文

摘要

一种利用贝叶斯概率上下文无关文法生成结构上类似物理方程的合成回归数据集的方法,该方法已在费曼语料库上得到验证,并证明对超参数调优有效。

arXiv:2606.06724v1 公告类型:新 摘要:代表性数据是机器学习的基础,因为数据有限会阻碍泛化。收集足够的真实世界样本通常不可行。合成数据生成提供了一种实用的解决方案,但前提是生成的数据能够忠实地反映真实观测的结构。本文提出了一种方法,用于从给定的方程语料库中生成结构上类似物理方程的合成回归数据集。该方法使用贝叶斯概率上下文无关文法来捕捉语料库的底层代数结构,并从中采样新的方程。为确保生成的输入位于物理有意义的域内,通过非侵入式探测对每个方程的应用域进行表征,同时恢复变量间约束。输入采样进一步通过从有效域的随机子范围中采样,结合混合均匀分布和截断正态分布,模拟真实实验条件。生成的数据使用Kolmogorov-Smirnov检验在费曼方程语料库上进行统计验证。生成的方程在所有八个研究的结构特征上与语料库匹配,而未平滑的纯概率文法仅匹配两个,这表明在给定语料库大小的情况下,贝叶斯先验对于结构保真度至关重要。在一个下游超参数调优任务中,基于合成数据调优的梯度提升回归器在真实数据上平均从20个配置中选出第6优的配置,与直接在真实数据上调优的结果相当,并显著优于随机表达式树(第10位)和噪声(第19位)。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:18

# Synthics:用于机器学习的物理类合成数据集  
来源:https://arxiv.org/html/2606.06724  
Jari Vepsäläinen  
机电工程系  
能源与机械工程学院  
阿尔托大学,芬兰  
jari\.vepsalainen@aalto\.fi  

###### 摘要  
在机器学习中,代表性数据是基础,因为数据有限会阻碍泛化能力。收集足够的真实样本通常是不可行的。合成数据生成提供了一种实用的解决方案,但前提是生成的数据能忠实反映真实观测的结构。本文提出一种方法,用于生成在结构上类似于给定方程语料库中物理方程的合成回归数据集。该方法使用贝叶斯概率上下文无关文法来捕捉语料库的底层代数结构,并从中采样新方程。为确保生成的输入位于物理有意义的域内,通过非侵入式探测为每个方程刻画适用性域,同时恢复变量间的约束。输入采样通过从有效域的随机子范围(结合均匀分布和截断正态分布)中抽取,进一步模拟真实的实验条件。生成的数据通过科尔莫戈罗夫–斯米尔诺夫检验与费曼方程语料库进行统计验证。生成的方程在所有八个研究结构特征上与语料库匹配,而未经平滑的纯概率文法仅匹配两个特征,这表明在语料库规模下,贝叶斯先验对于结构保真度至关重要。在下游超参数调优任务中,基于合成数据调优的梯度提升回归器在真实数据上平均从20个配置中选出第6优的配置,与在真实数据上调优的结果相当,并显著优于随机表达式树(第10优)和噪声(第19优)。  

*关键词*:合成数据·机器学习·数据集·超参数调优·概率上下文无关文法·适用性域  

## 1 引言  

机器学习模型的好坏取决于训练数据,然而许多工程应用面临数据稀缺问题。与大语言模型不同,后者依赖互联网上大量可用的文本数据,而物理系统的大规模数据集很少可用,获取代表性数据通常成本高昂且耗时。每个新样本通常需要运行实验,而实验往往缓慢、昂贵,并且由于安全或法规限制,通常局限于狭窄的运行范围。合成数据生成提供了一种克服数据稀缺的可能性,但其有用性取决于生成的数据能否忠实反映真实观测的结构。与数据增强(对现有样本进行扰动以增加多样性)不同,合成数据生成产生全新的样本,模拟目标域,并允许更广泛地探索特征空间。挑战不在于合成数据的数量,而在于其质量。有了足够逼真的合成数据,模型可以在从未接触真实数据的情况下学会泛化到现实任务。例如,TabPFN 是一个在数百万个合成数据集上元学习的表格基础模型,其性能优于调优后的梯度提升树 [13 (https://arxiv.org/html/2606.06724#bib.bib1)]。  

本文介绍了一种生成合成数据集的方法,这些数据集保留了给定物理方程的结构和数学性质。该方法从物理方程语料库中学习一个贝叶斯概率上下文无关文法,并从学习到的分布中采样新方程。这些方程通过受约束的输入采样和适用性域估计转化为数据集,使得生成的点尊重每个方程的数学约束,例如,在出现 \(\sqrt{x_1 - x_2}\) 的地方要求 \(x_1 - x_2 \geq 0\)。然后,通过科尔莫戈罗夫–斯米尔诺夫检验将生成的方程与语料库进行验证。生成的合成数据集的实际效用在一个超参数调优任务中得到证明,结果表明,在合成数据上调优比在随机表达式树或噪声上调优更能指导机器学习任务的超参数选择。  

本文的贡献如下:  

1. **物理方程的受约束输入采样框架**。所提出的方法结合了均匀采样和截断正态采样,同时执行表达式特定的域估计,以避免平方根和对数等操作符导致的无效评估。  

2. **基于文法的物理方程合成回归数据集生成框架**。所提出的 Synthics 框架并非从均匀随机的表达式树中采样方程,而是从物理方程语料库中学习一个贝叶斯概率上下文无关文法,并从学习到的分布中生成新表达式。这保留了操作符频率、表达式深度和变量交互模式等结构特征,同时保持了句法新颖性。  

3. **方法的统计和实际验证**。使用基于科尔莫戈罗夫–斯米尔诺夫的分析评估生成方程与参考方程分布之间的相似性。同时还证明了在合成数据上训练的模型可以指导机器学习任务中的超参数选择。  

## 2 文献综述  

### 2.1 机器学习的合成数据  

在丰富数据集上训练的机器学习模型通常优于在小数据集上训练的模型,然而在许多工程领域,数据是稀缺的。Alzubaidi 等人 [2 (https://arxiv.org/html/2606.06724#bib.bib32)] 综述了为应对数据稀缺情况而开发的深度学习技术,如迁移学习、自监督学习、生成模型和物理信息网络。他们强调了这些技术在从结构健康监测到流体力学等领域的作用,这些领域的数据获取成本高昂或有限。合成数据生成是一种实用的应对方法。合成数据的实用性不仅取决于其数量,更取决于生成分布能否忠实反映真实结构。Goyal 和 Mahmoud [12 (https://arxiv.org/html/2606.06724#bib.bib17)] 综述了用于生成合成数据的生成式 AI 技术,包括生成对抗网络、变分自编码器和大语言模型,并列举了常见的局限性,如计算量大、训练不稳定以及隐私保障弱。即使存在这些局限性,合成数据已显示出在多个应用中提升性能的能力,例如医疗保健 [4 (https://arxiv.org/html/2606.06724#bib.bib34)]、自动驾驶 [27 (https://arxiv.org/html/2606.06724#bib.bib18)] 和机器人操作 [26 (https://arxiv.org/html/2606.06724#bib.bib16)]。Tobin 等人 [26 (https://arxiv.org/html/2606.06724#bib.bib16)] 完全在具有随机纹理和光照的模拟图像上训练目标检测器,并将其迁移到真实场景,精度达到厘米级,他们发现足够的模拟器变异性使得真实世界在模型看来只是另一种变体。Tremblay 等人 [27 (https://arxiv.org/html/2606.06724#bib.bib18)] 将这一思想扩展到车辆检测,并表明仅使用非真实感合成数据进行训练即可获得具有竞争力的检测器。对于数值预测,Hollmann 等人 [13 (https://arxiv.org/html/2606.06724#bib.bib1)] 引入了 TabPFN,这是一个在数百万个合成数据集上元学习的表格基础模型,在小型任务上数秒内即可超越调优后的梯度提升树。Zhang 等人 [32 (https://arxiv.org/html/2606.06724#bib.bib30)] 表明,通过精心策划的合成先验混合可以改善表格基础模型,而无需改变底层架构。具体到工程领域,正确的结构由底层物理决定。Karniadakis 等人 [15 (https://arxiv.org/html/2606.06724#bib.bib33)] 综述了物理信息机器学习领域,并认为当仅靠数据不足时,将物理定律嵌入学习过程至关重要。因此,将基于物理的模型与数据驱动方法相结合,以及生成物理信息合成数据,应被视为解决工程应用中数据稀缺问题的互补策略。  

### 2.2 元学习与模型选择  

合成数据的一个特别有影响力的应用是元学习和模型选择,其任务是为给定任务选择最合适的算法或超参数配置。Rice [21 (https://arxiv.org/html/2606.06724#bib.bib8)] 最初将算法选择形式化为一个学习问题,即根据问题特征预测给定数据集的最佳算法。Smith-Miles [24 (https://arxiv.org/html/2606.06724#bib.bib9)] 调查了 Rice 提出的原理在实际中的应用方式,Vanschoren [31 (https://arxiv.org/html/2606.06724#bib.bib10)] 综述了更广泛的元学习领域,该领域不仅包括算法选择,还扩展到少样本学习、迁移学习和其他范式。Vanschoren 等人 [30 (https://arxiv.org/html/2606.06724#bib.bib11)] 的 OpenML 平台为此类研究提供了基础设施,而 auto-sklearn [10 (https://arxiv.org/html/2606.06724#bib.bib12)] 等系统通过集成建模方法应用元学习来自动化大规模模型选择。然而,大多数方法由于需要拟合多个候选元模型而依赖大数据集和大量计算。更有利的做法是在合成数据上训练通用分类器,这些分类器能够预测新任务的最佳模型和配置,而无需在其上拟合多个模型。Basri 和 Chen [4 (https://arxiv.org/html/2606.06724#bib.bib34)] 评估了用于超参数调优的合成数据,发现合成数据和真实数据上预测精度之间存在强相关性。因此,有证据表明合成数据在元学习和模型选择任务中的实用性,这激励了研究能够为这类任务生成具有正确结构的合成数据生成器。  

### 2.3 基于文法的方程结构生成  

基于文法的方程生成是一种常见方法,用于产生句法有效且结构可解释的表达式。Kusner 等人 [16 (https://arxiv.org/html/2606.06724#bib.bib7)] 引入了文法变分自编码器,通过上下文无关文法的解析树对表达式进行编码和解码,使得每个生成的表达式在句法上有效,提高了有效输出的比例,并为下游优化产生了更连贯的潜在空间,尽管其文法是预先固定的,且规则概率未拟合到目标语料库。概率上下文无关文法则为产生式规则附加概率,Brence 等人 [7 (https://arxiv.org/html/2606.06724#bib.bib23)] 将其用作方程空间的先验,以指导方程发现,通过规则权重表达简约原则,为贝叶斯处理奠定了基础。本文在这些基础之上,将其扩展到合成数据生成而非方程发现,同时保留了一个可解释的概率文法,并通过狄利克雷先验对其产生概率进行正则化,使得即使在小语料库上也能产生多样化的结构分布,而不是坍缩到最频繁的规则上。Mežnar 等人 [20 (https://arxiv.org/html/2606.06724#bib.bib25)] 表明,学习到的层次生成器可以优于这种手工制作的文法,证明从数据估计的规则统计量携带了真正的结构信息,尽管其神经潜在空间牺牲了显式文法的透明性。方程发现也称为符号回归 [3 (https://arxiv.org/html/2606.06724#bib.bib19),18 (https://arxiv.org/html/2606.06724#bib.bib20)]。Udrescu 和 Tegmark [28 (https://arxiv.org/html/2606.06724#bib.bib3)] 引入了 AI Feynman,它结合了神经网络拟合和受物理启发的简化,以恢复 Feynman 基准中的所有 100 个方程。最近的符号回归方法基于深度学习 [6 (https://arxiv.org/html/2606.06724#bib.bib5),14 (https://arxiv.org/html/2606.06724#bib.bib6),23 (https://arxiv.org/html/2606.06724#bib.bib21)],但正如 Sato 和 Sato [22 (https://arxiv.org/html/2606.06724#bib.bib22)] 所表明的,它们利用的有效搜索空间因复制偏差而变窄,大多数生成的表达式是从训练分布中复制而来,而非新合成的。因此,文献中对方程结构和发现进行了深入研究,但这只是合成数据生成的一半故事。另一半是确保生成的方程在采样输入时能产生有效的输出。  

### 2.4 适用性域与物理有意义的采样  

确保有效输入是一个独立的问题,因为在标称范围内均匀采样可能会产生奇异、未定义或物理上不可能的输出。设计优化文献中将此作为可行域或适用性域识别来研究。Chen 和 Fuge [8 (https://arxiv.org/html/2606.06724#bib.bib26)] 提出了主动扩展采样来学习无界输入空间上的可行域,并证明了在探索区域内误分类损失具有恒定的概率界,与迭代次数无关。Metta 等人 [19 (https://arxiv.org/html/2606.06724#bib.bib27)] 使用带有杰克刀方差估计的神经网络代理,在可行域边界附近自适应采样。Straus 等人 [25 (https://arxiv.org/html/2606.06724#bib.bib28)] 表明,添加捕获变量间相互依赖性的不等式约束可以大幅缩小采样域并提高代理精度。Liang 等人 [17 (https://arxiv.org/html/2606.06724#bib.bib29)] 指出,标准生成模型经常违反硬物理约束,并提出了机会约束流匹配,它将随机优化集成到采样过程中,以保证可行性同时保持高保真生成。这些工作各自单独处理有效输入问题,而没有将其与采样方程的结构生成相结合。本文生成的方程是封闭形式的且评估成本低,其许多可行性条件直接源于表达式,例如平方根下的非负性。因此,一个更简单、非侵入式的采样过程就足够了,而文献中提出的更复杂的方法针对的是在昂贵黑盒模型下未知可行域的更困难情况。  

### 2.5 研究空白  

上述综述的文献在很大程度上是独立发展的。合成数据和元学习研究侧重于数量和分布保真度,但很少涉及可解释的结构。符号回归从数据走向方程,与本文的任务方向相反。基于文法的方法功能强大,但尚未与语料库学习的先验和适用性域探测相结合,以生成可供机器学习使用的数据集。适用性域估计与采样方程的结构生成处于分离状态。目前没有现有方法从真实的物理方程[原文可能不完整,根据上下文推测]。

相似文章

制作用于微调的合成数据集

Reddit r/LocalLLaMA

作者提出了一种使用形式求解器为LLM生成多样化合成推理训练数据的流程,并询问现有工作以及关于避免重复模板的建议。

@neural_avb: https://x.com/neural_avb/status/2072294078805684613

X AI KOLs Timeline

本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。

物理信息机器学习泛化性的PAC-Bayesian视角

arXiv cs.LG

本文为物理信息机器学习开发了一种PAC-Bayesian框架,为无界损失提供了高概率泛化保证。它提出了一种多任务视角,联合处理数据保真度、偏微分方程残差和边界条件,并引入了一种自界限学习算法。

凭借对物理的感知,AI模型能模拟更广泛的现实世界场景

MIT News — Artificial Intelligence

MIT CSAIL和清华大学的研究人员提出了GeoPT,这是一种预训练方法,利用合成动力学帮助AI模型更高效地学习物理,以模拟车辆安全和机器人测试等现实世界场景。其达到峰值性能的速度提升两倍,训练所需数据最多减少60%。