最小作用量引导的物理外推扩散
摘要
提出LAPG,一种由最小作用量原理引导的扩散框架,旨在提高物理外推任务推理过程中的物理一致性。
arXiv:2606.11277v1 Announce Type: new
摘要:可靠的外推仍然是计算物理学中生成模型的核心挑战,因为模型在有限的时间、参数或几何范围内训练,可能在训练分布之外产生物理不一致的预测。我们提出了一种最小作用量原理引导的扩散方法LAPG,该框架在推理过程中促进物理一致性,而非仅依赖训练过程中施加的约束。该方法将基于条件分数的扩散模型与基于作用量的物理引导分数相结合。在第一阶段,学习到的分数模型生成一个分布内的提议;在第二阶段,基于作用量的变分先验将该提议优化至目标分布外条件。这一公式将最小作用量原理转化为推理时可微的修正机制,并提供了点式残差惩罚的替代方案,后者通常需要经验性的损失平衡。我们在代表性的常微分和偏微分方程系统上评估了LAPG,包括自由落体、保守和耗散弹簧-质量动力学、相互作用点涡以及参数化翼型上的势流。在时间、参数和几何外推测试中,与训练时物理信息基线相比,LAPG减少了相位漂移,保持了耗散衰减,捕捉了涡旋运动,并改善了翼型流的升力响应。
查看缓存全文
缓存时间: 2026/06/11 13:46
# 最小作用量引导的扩散模型用于物理外推 来源:https://arxiv.org/html/2606.11277 [![[未标注图片]](https://arxiv.org/html/2606.11277v1/x1.png)杨仲新](https://orcid.org/0009-0003-7898-7511)¹ ¹北京大学工学院,北京 100871,中国 &[![[未标注图片]](https://arxiv.org/html/2606.11277v1/x2.png)宾远为](https://orcid.org/0000-0001-7722-7885)²,³,⁵ ²东方理工数字孪生研究院,宁波 315200,浙江,中国 ³东方理工高等研究院,宁波 315200,浙江,中国 ⁵深圳腾方科技有限公司,深圳 518000,广东,中国 [email protected] &[![[未标注图片]](https://arxiv.org/html/2606.11277v1/x3.png)项 I. A. 杨](https://orcid.org/0000-0003-4940-5976)⁴ ⁴机械工程系,宾夕法尼亚州立大学,大学城,PA 16802,美国 &[![[未标注图片]](https://arxiv.org/html/2606.11277v1/x4.png)陈十一](https://orcid.org/0000-0002-2913-4497)²,³ ²东方理工数字孪生研究院,宁波 315200,浙江,中国 ³东方理工高等研究院,宁波 315200,浙江,中国 ###### 摘要 可靠的外推仍然是计算物理中生成模型面临的核心挑战,因为在有限时间、参数或几何范围内训练的模型可能在训练分布之外产生物理上不一致的预测。我们提出了一种最小作用量原理引导的扩散方法 LAPG,该框架在推理过程中促进物理一致性,而非仅依赖训练过程中施加的约束。该方法将基于条件分数的扩散模型与作用量导出的物理引导分数相结合。在第一阶段,学习到的分数模型生成一个分布内的提议;在第二阶段,基于作用量的变分先验将该提议细化为面向目标分布外条件的结果。这一公式将最小作用量原理转化为可微的推理时修正机制,并提供了一种替代点态残差惩罚(通常需要经验性的损失平衡)的方法。 我们在多个代表性常微分方程和偏微分方程系统上评估了 LAPG,包括自由落体、保守和耗散弹簧-质量系统、相互作用点涡,以及参数化机翼上的势流。在时间、参数和几何外推测试中,与训练时物理信息基线相比,LAPG 减少了相位漂移,保持了耗散衰减,捕捉了涡旋运动,并改进了机翼流动的升力响应。 ## 1 引言 机器学习正日益成为物理科学中建模、预测和设计的计算工具 (Carleo 等,2019; Brunton 等,2020; Wang 等,2023)。在计算物理学中,机器学习模型通常被期望不仅作为现有模拟数据的插值器,而且作为能够探索新参数范围、将轨迹扩展到观察时间窗口之外以及支持在不同物理条件下进行设计的高效替代模型。这一期望提出了严格的泛化要求:有用的模型必须在训练分布之外保持物理可靠性。然而,这种物理外推仍然是数据驱动方法面临的核心困难,尤其是当目标区域涉及长时间演化、未见系统参数或训练集中不存在的几何形状时。 在近期的生成方法中,扩散模型已成为学习高维概率分布的强大工具 (Sohl-Dickstein 等,2015; Ho 等,2020; Song 和 Ermon,2019; Song 等,2020)。通过学习逐渐添加噪声的数据分布的分数,这些模型定义了采样器,在图像合成中取得了强劲性能,并正被应用于科学和工程问题。在物理系统中,扩散模型已被用于生成复杂场和轨迹,包括湍流、拉格朗日粒子统计和时空间神经场 (Li 等,2024; Du 等,2024; Gao 等,2024)。这些应用表明,当重复高保真采样成本高昂时,扩散模型可以作为复杂物理系统的数据驱动生成器。 尽管有这些优势,扩散模型继承了数据驱动学习的一个基本局限:学习到的分数主要受限于训练分布。当目标条件位于训练分布之外时,反向时间采样器遵循的是学习分数的神经网络外推,而非物理定律。这一困难与更广泛的观察一致:神经网络可能在训练分布之外不可靠地外推,数据驱动的神经算子当部署在训练集支持范围之外时可能遭受大的误差 (Xu 等,2021; Zhu 等,2023)。对于物理系统,这类误差尤其严重:生成的样本可能看起来统计上合理,但在长时间轨迹中会出现相位漂移 (Linot 等,2023),在参数偏移下出现错误的振幅 (Zhu 等,2023),违反不变量或边界条件 (Greydanus 等,2019; Krishnapriyan 等,2021; Bastek 等,2025),或对于未见几何形状产生扭曲的流场模式 (Bhatnagar 等,2019)。因此,物理生成中的分布外 (OOD) 失败不仅是预测准确性的损失,也是推理过程中物理一致性的损失。 一条主要的研究方向通过将物理结构融入学习来解决这一问题。物理信息神经网络 (PINNs) 通过在训练中惩罚微分方程残差、初始条件和边界条件来强制执行控制方程 (Raissi 等,2019)。相关方法更直接地将物理归纳偏置嵌入模型架构,例如用于动力系统的哈密顿或拉格朗日神经网络 (Greydanus 等,2019; Cranmer 等,2020),对称性或等变性保持网络 (Satorras 等,2021; Otto 等,2023),以及用物理残差正则化扩散训练的物理信息生成模型 (Bastek 等,2025)。这些方法显著提高了数据效率和分布内物理保真度,表明物理知识可以成为学习模型的强大约束。 尽管如此,大多数现有的物理信息策略在模型构建或训练期间施加物理知识,通常通过软惩罚项或架构约束 (Raissi 等,2019; Karniadakis 等,2021; Wang 等,2021; Bastek 等,2025; Cao 等,2024, 2025)。训练之后,模型参数固定,外推预测仍然取决于学习到的映射或分数在训练域之外的行为。这激发了一种互补策略:不是仅在模型学习时执行物理约束,而是可以在生成过程中直接使用物理原理,将每个推理样本引导向物理一致的状态。 在这项工作中,我们提出了一种最小作用量原理引导的 (LAPG) 扩散框架,该框架在推理时强制执行物理一致性。该方法将生成过程分为两个阶段。首先,使用基于条件分数的扩散模型在分布内条件下生成一个物理上合理的样本。其次,通过物理引导分数将样本细化为期望的目标条件。这样,学习到的分数模型提供了数据驱动的提议,而作用量导出的分数提供了不受训练分布限制的推理时修正。生成的采样器在生成过程中主动将每个生成的轨迹或场引导向物理一致性,而非仅仅依赖训练期间施加的物理正则化。 尽管最小作用量原理在保守哈密顿力学中最为常见,但本方法并不要求系统在此狭义上是保守的。LAPG 仅需要一个标量变分泛函,其驻点或极小点表征物理上允许的轨迹或场。对于耗散动力学,可以通过将耗散势函数与保守作用量结合来获得这样的泛函,如 Rayleigh 或 Lagrange–d’Alembert 公式 (Goldstein 等,1980)。对于流体系统,从涡动力学的变分公式以及不可压缩流的高斯最小约束原理中也发展了类似作用量的最小化原理 (Khalifa 和 Taha,2024; Taha 等,2023)。这些例子允许将相同的推理时引导策略应用于保守、耗散和 PDE 控制的系统,在一个统一的变分框架内。 本工作的贡献有三方面。第一,我们定义了一个作用量残差分数,可以在学习到的反向过程之后细化扩散样本。第二,我们将该想法应用于相空间轨迹和机翼流场。第三,我们在时间、参数和几何偏移下评估该方法,并与 PINN 型基线进行比较。 本文的其余部分组织如下。第 2 节介绍了 LAPG 公式,包括基于分数的扩散和作用量导出的物理先验。第 3 节描述了基准系统、扩散模型架构和基线模型。第 4 节呈现了外推结果。第 5 节总结发现并讨论局限性和未来扩展。 ## 2 方法论 我们考虑一族由条件向量 \(\mathbf{c}\) 指定的物理系统,该向量可能包含物理参数、初始或边界条件、几何表示或网格信息。对于每个条件,目标是生成一个物理上允许的状态 \(\mathbf{X}\)。对于下面考虑的动力系统,\(\mathbf{X}\) 表示离散化的相空间轨迹;对于机翼流动问题,它代表离散化的流场。训练数据来自条件 \(\mathbf{c} \in \mathcal{C}_{\mathrm{train}}\),而目标条件可能位于此训练分布之外。 我们基于分数扩散模型 (Song 等,2020),其中正向随机过程通过一个伪时间变量 \(\tau\) 逐步将数据 \(\mathbf{X}_0\) 扰动为噪声。给定干净数据 \(\mathbf{X}_0 \sim p_0(\mathbf{X}|\mathbf{c})\),正向过程定义了一族由噪声水平 \(\sigma_\tau \doteq \sigma(\tau)\) 索引的扰动条件分布 \(p_{\sigma_\tau}(\mathbf{X}_\tau|\mathbf{c})\)。该正向过程由随机微分方程 (SDE) 描述: \[ d\mathbf{X}_\tau = \mathbf{f} d\tau + g(\tau) d\mathbf{w}_\tau, \qquad \tau \in [0, T], \] (1) 其中 \(\mathbf{f}\) 是漂移系数,\(g\) 是扩散系数,\(\mathbf{w}_\tau\) 是标准维纳过程。在本工作中,我们使用方差爆炸 SDE (VESDE),其中 \(\mathbf{f}=0\) 且 \[ g(\tau) = \sqrt{\frac{d\sigma^2(\tau)}{d\tau}}, \qquad \sigma(\tau) = \sigma_{\min} \left( \frac{\sigma_{\max}}{\sigma_{\min}} \right)^{\tau/T}. \] (2) 这里 \(T\) 是终端扩散时间,\(\sigma_{\min}\) 和 \(\sigma_{\max}\) 是正向加噪过程中使用的最小和最大噪声水平。在所有基准测试中,状态变量在分数模型训练前被归一化。因此,我们对所有系统使用固定的 VESDE 噪声范围,\(\sigma_{\min}=0.01\) 和 \(\sigma_{\max}=50.0\),遵循标准的分数扩散设置 (Song 等,2020)。这些值未在 OOD 验证案例上单独调整。选择使得最小扰动远小于归一化数据尺度,而最大扰动足够大,使得终端分布实际上是高斯噪声。对于此 VESDE,对应的扰动核是高斯分布, \[ p(\mathbf{X}_\tau | \mathbf{X}_0) = \mathcal{N}\left( \mathbf{X}_\tau; \mathbf{X}_0, \sigma^2(\tau) \mathbf{I} \right), \] (3) 因此一个噪声样本可以写成 \(\mathbf{X}_\tau = \mathbf{X}_0 + \sigma(\tau) \mathbf{z}\),其中 \(\mathbf{z} \sim \mathcal{N}(\mathbf{0}, \mathbf{I})\)。 反向过程由对应的分数控制 \[ s(\mathbf{X}_\tau, \sigma_\tau; \mathbf{c}) \equiv \nabla_{\mathbf{X}_\tau} \log p_{\sigma_\tau}(\mathbf{X}_\tau | \mathbf{c}). \] (4) 该分数是扰动条件分布的对数密度梯度。已知时,分数提供了扰动数据分布的去噪方向。由于对于此处考虑的物理数据集,该分数无法解析得到,我们通过神经网络 \(S_\theta(\mathbf{X}_\tau, \sigma_\tau; \mathbf{c})\) 来近似它,其中 \(\theta\) 表示可训练网络参数,并通过去噪分数匹配训练该网络: \[ \mathcal{L}(\theta) = \mathbb{E}_{\tau, \mathbf{X}_0, \mathbf{z}} \left[ \lambda(\tau) \left\| S_\theta(\mathbf{X}_0 + \sigma(\tau) \mathbf{z}, \sigma(\tau); \mathbf{c}) + \frac{\mathbf{z}}{\sigma(\tau)} \right\|_2^2 \right]. \] (5) 对于 VESDE,我们使用标准权重 \(\lambda(\tau) = \sigma^2(\tau)\)。在式 (5)
相似文章
物理信息生成的自增强扩散指导
本文提出一种自增强扩散指导方法,将物理定律融入扩散模型,减少与真实动态的偏差,并实现更快的生成。
Lagrangian Flow Matching: 基于最小作用原理的规范路径设计框架
提出了Lagrangian流动匹配,一种基于物理的框架,利用最小作用原理设计生成建模中的概率路径和速度场,推广了现有最优输运和扩散路径。
ResilPhase:即插即用的相位映射与抗噪宏轨迹外推,用于扩散加速
ResilPhase是一个免训练的扩散模型加速框架,将加速推理重述为ODE空间中的稳定宏轨迹外推,通过无导数重心拉格朗日外推和有界相位映射,在高加速比下实现最先进的保真度。
基于梯度外推的策略优化
本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。
学习离散化:基于扩散的自适应网格与谱引导
本文提出了一种基于扩散的框架,用于学习条件于观测到的偏微分方程动力学的自适应网格离散化,利用谱引导和物理约束在需要的地方分配分辨率。该方法在五种偏微分方程场景中取得了具有竞争力或更优的性能。