大语言模型应该看到什么?物理不变量作为偏微分方程发现的数据表示

arXiv cs.LG 论文

摘要

本文引入数据解释,将时空场测量为物理不变量,供大语言模型恢复偏微分方程,在基准测试中无需训练即可将准确性提高两倍。

arXiv:2608.25189v1 公告类型:新 摘要:理解分子相互作用如何支配宏观行为是分子科学中的一个核心挑战。然而,传统的理论构建无法跟上现代实验常规产生的大量数据集。大语言模型为自动化理论构建提供了有希望的途径,但时空场无法直接放入提示中。现有模型通常仅通过一个分数来衡量每个提案与数据的拟合程度来学习数据。在这里,我们引入数据解释,一个将场测量为理论家会参考的量,并将其作为直接输入提供给模型的阶段。在模拟场的基准测试中,与显示原始数据相比,解释几乎将恢复方程的准确性提高两倍,计算成本可忽略不计,且无需任何训练。通过允许语言模型像理论家一样阅读场数据,数据解释提供了一种实用的自动化场理论构建途径,可以与实验共同演进。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:35

# 大语言模型应该“看”到什么?物理不变量作为PDE发现的数据表示
来源:https://arxiv.org/html/2608.25189
Matt Thomson所属机构:生物与生物学工程部所属机构:加州理工学院所属机构:帕萨迪纳,加利福尼亚州 91125

###### 摘要

理解分子相互作用如何支配宏观行为是分子科学中的一个核心挑战。然而,传统的理论构建无法跟上现代实验常规产生的海量数据。大语言模型为自动化理论构建提供了一条有前景的路径,但时空场无法直接放入提示词中。现有的模型通常只通过一个衡量每个建议与数据拟合程度的分数来了解数据。在此,我们引入“数据解释”阶段,该阶段将场数据测量成理论家会查阅的量,并将其作为直接输入提供给模型。在模拟场的基准测试中,与直接展示原始数据相比,数据解释使恢复方程的准确率几乎提高了两倍,且计算成本可忽略不计,也无需任何训练。通过让语言模型像理论家一样读取场数据,数据解释为能与实验共同演化的自动化场理论构建提供了一条实用路径。

## 1 引言

今天,为一个复杂化学系统推导理论模型通常需要数月到数年的专业专长,而实验人员则可以通过改变和重组分子组分常规地生成数千种不同的系统。这种差距源于人类带宽的瓶颈。传统的建模方法分为两类:自下而上的方法通过动力学理论将微观相互作用粗粒化为连续场方程;自上而下的方法则列举所有对称性允许的项而不涉及分子细节。这两种方法都很慢,依赖专业知识,并且无法匹配现代实验现在常规产生的数据量和复杂性。AI凭借其在科学领域内模式识别、特征提取和学习复杂映射的能力,为自动化这一理论构建过程提供了一条引人注目的路径——以分子科学现在至关重要的规模和速度。

本文中,我们专注于自动化自上而下的方法:从数据中恢复基于偏微分方程(PDE)的场理论。这是科学机器学习中的一个重要任务,其主导形式是稀疏回归。SINDy(Brunton等,2016)(https://arxiv.org/html/2608.25189#bib.bib9) 和 PDE-FIND(Rudy等,2017)(https://arxiv.org/html/2608.25189#bib.bib8) 将一个候选项库组装成设计矩阵,应用数值回归来寻找最佳拟合项,并使用稀疏惩罚来限制PDE的长度。然而,这种方法受限于导数候选项库,因为PDE的项必须包含在预先写好的库中。

符号回归以组合搜索为代价消除了库的约束。最近的进展表明,预训练的大语言模型(LLM)具备强大的科学推理能力,在作为符号回归的提议机制方面具有巨大潜力。FunSearch(Romera-Paredes等,2024)(https://arxiv.org/html/2608.25189#bib.bib7) 确立了LLM提出候选方案、数值评估器对其进行评分、以及进化算法驱动迭代优化的方案。LLM-SR(Shojaee等,2025)(https://arxiv.org/html/2608.25189#bib.bib6) 将这种LLM引导的进化方法应用于科学方程发现。此后,提出了许多方法来改进搜索或反馈信号:除了进化方程外,LASR(Grayeli等,2024)(https://arxiv.org/html/2608.25189#bib.bib5) 还进化了一个可以指导方程发现的假设库;DrSR(Wang等,2025)(https://arxiv.org/html/2608.25189#bib.bib4) 增加了一个数据分析LLM来学习数据洞察,并利用反思性反馈存储可重用的策略;IGSR(Saveliev等,2026)(https://arxiv.org/html/2608.25189#bib.bib3) 通过在树搜索中对每项的影响力进行评分,扩展了评估指标;LLM-ACES(Abhyankar等)(https://arxiv.org/html/2608.25189#bib.bib2) 整合了主动数据获取以更好地评估和进化候选假设;MARICL(Rezaei和Krishnan,2026)(https://arxiv.org/html/2608.25189#bib.bib1) 应用智能体从基础模型中读取高错误示例并提出改进建议。这些方法共享一个核心架构,如图1((https://arxiv.org/html/2608.25189#S1.F1))中黑色部分所示。一个预训练的LLM提出一个方程,一个数值评估器对其进行评估,所得分数返回给LLM以在循环中生成新的候选方案。在此架构中,LLM提出符号方程结构,而数值回归仅拟合所提议PDE结构的系数。这种分工消除了对PDE项候选预定义库的需求。该领域的工作主要集中在评估器和搜索上,通过改进微分方案、残差表述、信用分配和探索策略。

我们关注一个较少受到注意的不同方面:如何将数据表示给LLM。我们受到人类理论家如何从场数据构建理论的启发——通过识别数据中的显著结构。例如,经验丰富的理论家知道激波表示强对流效应,而图灵斑图表示扩散-反应系统。这两个推断都不需要场的数值数据,只需要对其模式的解释。因此,我们提议将这样一个解释阶段作为输入本身提供给模型,而不仅仅是依赖评估器。

参见说明图 1:从数据中发现基于PDE的场理论的符号回归架构。成熟的方法将LLM与评估器配对:LLM提出一个候选方程,评估器拟合其系数并返回一个分数。由于场数据通常无法放入提示中,因此该分数是LLM获取数据信息的唯一途径。我们贡献了两个解释阶段,如图中绿色部分所示。数据解释将观测场测量为理论家会计算的物理量。在我们正在进行的工作中,我们应用残差解释来分析提议未能解释的内容。该流程无需训练。我们引入了一个称为数据解释的阶段,其输出直接提供给LLM,如图1((https://arxiv.org/html/2608.25189#S1.F1))中绿色部分所示。将原始场数据输入LLM的成本高得令人望而却步,因此大多数现有研究仅在评估器内部使用它。数据解释则让LLM像理论家一样读取数据。我们计算一组测量值并将其作为证据提供,选择这些测量值的依据是理论家在遇到不熟悉的场时会查阅的量。这些诊断既廉价又紧凑:它们占用的时间只是单次模型调用时间的一小部分,并且占用的词元比它们替换的原始数据更少。它们也是可解释的,因此LLM被告知的内容可以由人类和AI共同审查。本工作特意实现了一小组诊断,足以测试该提议的有效性,而非穷尽所有可能。在未来的工作中,我们将用更全面的诊断来扩展解释模块。

## 2 方法论

PDE发现的流水线包含四个循环阶段:“数据解释 → LLM提出方程 → 解析与规范化 → 评估”,如图1((https://arxiv.org/html/2608.25189#S1.F1))所示。本文所有实验均使用QwQ-32B模型。整个过程中模型参数保持不变。

### 2.1 数据解释

我们将频谱分析作为数据解释的主要组成部分。我们考虑一个在周期性域上的标量场u⁡\(x,t\)u(\\bm\{x\},t),由一个时间一阶或二阶的常系数PDE控制。傅里叶变换
u^k\(t\)=∫u\(x,t\)e−ik⋅xdx\\hat\{u\}\_\{\\bm\{k\}\}\(t\)=\\int u\(\\bm\{x\},t\)e^\{\-i\\bm\{k\}\\cdot\\bm\{x\}\}\\mathrm\{d\}\\bm\{x\}\(1\) 可以将场数据u⁡\(x,t\)u(\\bm\{x\},t)分解为在波矢k\\bm\{k\}处的空间模式序列u^k\(t\)\hat\{u\}\_\{\\bm\{k\}\}\(t\)。对于线性PDE,每个模式u^k\(t\)\hat\{u\}\_\{\\bm\{k\}\}\(t\)独立演化,遵循一个常微分方程,其参数就是我们要找的系数。因此,LLM可以直接从每个模式的增长、衰减或振荡方式推断出系数。相反,如果模式之间发生能量传递,解耦将失效,这表明存在非线性PDE。

该解释解决了以下四个问题,每个问题都有相应的测量值,如下所列。

**Q1:时间上是一阶还是二阶?** 对于时间一阶的PDE,例如∂u∂t=ν∇2u\+σu\\frac\{\\partial u\}\{\\partial t\}=\\nu\\nabla^\{2\}u\+\\sigma u,其中ν\\nu和σ\\sigma为系数,每个傅里叶模式满足

du^kdt=\(σ−ν\|k\|2\)u^k,sou^k\(t\)=u^k\(0\)e\(σ−ν\|k\|2\)t,\\frac\{\\mathrm\{d\}\\hat\{u\}\_\{\\bm\{k\}\}\}\{\\mathrm\{d\}t\}=\(\\sigma\-\\nu\|\\bm\{k\}\|^\{2\}\)\\hat\{u\}\_\{\\bm\{k\}\},\\qquad\\mbox\{so\}\\quad\\hat\{u\}\_\{\\bm\{k\}\}\(t\)=\\hat\{u\}\_\{\\bm\{k\}\}\(0\)e^\{\(\\sigma\-\\nu\|\\bm\{k\}\|^\{2\}\)t\},\(2\) 因此,振幅\|u^k\(t\)\|\\|\\hat\{u\}\_\{\\bm\{k\}\}\(t\)\|随时间单调变化。

对于时间二阶的PDE,例如∂2u∂t2=c2∇2u\+σu\+γ∂u∂t\\frac\{\\partial^\{2\}u\}\{\\partial t^\{2\}\}=c^\{2\}\\nabla^\{2\}u\+\\sigma u\+\\gamma\\frac\{\\partial u\}\{\\partial t\},每个模式反而是一个阻尼振荡器

d2u^kdt2−γdu^kdt\+\(c2\|k\|2−σ\)u^k=0,\\frac\{\\mathrm\{d\}^\{2\}\\hat\{u\}\_\{\\bm\{k\}\}\}\{\\mathrm\{d\}t^\{2\}\}\-\\gamma\\frac\{\\mathrm\{d\}\\hat\{u\}\_\{\\bm\{k\}\}\}\{\\mathrm\{d\}t\}\+\\left\(c^\{2\}\|\\bm\{k\}\|^\{2\}\-\\sigma\\right\)\\hat\{u\}\_\{\\bm\{k\}\}=0,\(3\) 而振幅\|u^k\(t\)\|\\|\\hat\{u\}\_\{\\bm\{k\}\}\(t\)\|随时间振荡。

我们测量\|u^k\(t\)\|\\|\\hat\{u\}\_\{\\bm\{k\}\}\(t\)\|的时间演化以推断PDE的时间阶数。然而,此测试并非详尽无遗。例如,一个过阻尼的二阶方程,当γ2≥4\(c2\|k\|2−σ\)\\gamma^\{2\}\\geq 4\(c^\{2\}\|\\bm\{k\}\|^\{2\}\-\\sigma\)时,会单调衰减,与一阶方程无法区分。这表明数据解释约束的是可能结构的空间,而不是确定一个唯一结构。

**Q2:线性系数是什么?** 我们测量衰减率r⁡\(k\)=−dln⁡\|u^k\|dtr\(\\bm\{k\}\)=\-\\frac\{\\mathrm\{d\}\\ln\|\\hat\{u\}\_\{\\bm\{k\}\}\|\}\{\\mathrm\{d\}t\} 来探测PDE系数。对于公式(2)(https://arxiv.org/html/2608.25189#S2.E2),r⁡\(k\)=ν\|k\|2−σr\(\\bm\{k\}\)=\\nu\|\\bm\{k\}\|^\{2\}\-\\sigma。因此,跨模式k\\bm\{k\}的一次回归就能同时返回两个线性系数ν\\nu和σ\\sigma。对于振荡模式,我们还从u^k\(t\)\\hat\{u\}\_\{\\bm\{k\}\}\(t\) 中连续极小值之间的间隔估计频率ω⁡\(k\)\\omega\(\\bm\{k\}\)。对于公式(3)(https://arxiv.org/html/2608.25189#S2.E3),ω2\(k\)≈c2\|k\|2−σ\\omega^\{2\}\(\\bm\{k\}\)\\approx c^\{2\}\|\\bm\{k\}\|^\{2\}\-\\sigma,回归可以恢复系数c2c^\{2\}。由于ω⁡\(k\)\\omega\(\\bm\{k\}\) 只是一个估计值,我们不使用截距来确定σ\\sigma。

**Q3:PDE是线性的还是非线性的?** 我们测量两个量。第一个是在一个时间窗口开始和结束时,超过特定波数阈值的频谱能量比例。第二个是Q2中速率回归的判定系数R2R^\{2\}。这两个量都可以探测PDE的非线性。

非线性项通常会耦合不同的模式。例如,一个平流项u∂u∂xu\\frac\{\\partial u\}\{\\partial x\}的傅里叶变换是

F\[u∂u∂x\]k=∑k1\+k2=kik2,xu^k1u^k2,\\mathcal\{F\\}\\left\[u\\frac\{\\partial u\}\{\\partial x\}\\right\]\_\{\\bm\{k\}\}=\\sum\_\{\\bm\{k\}\_\{1\}\+\\bm\{k\}\_\{2\}=\\bm\{k\}\}i\\bm\{k\}\_\{2,x\}\\hat\{u\}\_\{\\bm\{k\}\_\{1\}\}\\hat\{u\}\_\{\\bm\{k\}\_\{2\}\},\(4\) 其中k2,x\\bm\{k\}\_\{2,x\} 是k2\\bm\{k\}\_\{2\} 的x分量。因此,模式k\\bm\{k\}由其他模式的乘积驱动。能量因此向高波数迁移,这可以被第一个测量值检测到。而且由于Q2中的回归假设每个模式独立衰减,非线性会降低其拟合度,这可以被判定系数R2R^\{2\}检测到。较低的R2R^\{2\}因此表明PDE很可能是非线性的。

**Q4:是否存在平流?** 我们测量在平移下的空间相关性增益。对于两个时间帧t0<t1t\_\{0\}<t\_\{1\},我们计算

g=maxs⁡\[corr\(u⁡\(x,t0\),u⁡\(x\+s,t1\)\)−corr\(u⁡\(x,t0\),u⁡\(x,t1\)\)\]g=\\max\_\{\\bm\{s\}\}\\left\[\\text\{corr\}\\left\(u\(\\bm\{x\},t\_\{0\}\),u\(\\bm\{x\}\+\\bm\{s\},t\_\{1\}\)\\right\)\\-\\text\{corr\}\\left\(u\(\\bm\{x\},t\_\{0\}\),u\(\\bm\{x\},t\_\{1\}\)\\right\)\\right\]\(5\) 以及使g最大的平移量s∗\\bm\{s\}^\{\*\}。平流在不改变结构的情况下对其进行平移,因此一个经历传输的场在零平移时与其自身的相关性较差,但一旦平移了位移量,则相关性很强,从而得到较大的g和非零的s∗\\bm\{s\}^\{\*\}。扩散和生长作用没有优先方向,使得最大值在s∗=0\\bm\{s\}^\{\*\}=\\bm\{0\}处,且g接近零。因此,该测量值将有向传输与各向同性演化区分开来,并且s∗\\bm\{s\}^\{\*\} 在已知时间间隔t1−t0t\_\{1\}\-t\_\{0\}的情况下也估计了平流速度。

### 2.2 LLM提出方程

§2.1 (https://arxiv.org/html/2608.25189#S2.SS1) 的诊断结果被渲染为文本(约300个词元),并附加到一个包含两个进一步说明的提示中。首先,方程可以由哪些符号构成:场u,以及它的时间和空间导数。任何代数组合都是允许的。我们特意不包括候选项库。其次,输出格式:LLM以散文形式推理,然后在一个分隔块中明确陈述其PDE提案及其数值系数。这使得答案与通常包含数千词元的推理线程分离开来。

### 2.3 解析与规范化

将提议的PDE提取并重写为单一规范形式,使得仅在表示法上不同的表达式得到相同的评分。语言模型并不遵循一种惯例:同一个拉普拉斯算子可能表示为d2u/dx2\+d2u/dy2d2u/dx2\+d2u/dy2、∇2u\\nabla^\{2\}u 或 Δu\\Delta u。因此,规范化确保了一个正确的提议因其内容而非其表示法得到评分。

### 2.4 评估

给定一个提议的PDE结构,通过正则化最小二乘法拟合系数,并通过弱形式残差和稀疏惩罚对方程进行评分。此回归仅拟合所提议PDE结构的系数,从不选择结构本身。我们注意到,仅靠残差是不够的,因为最小二乘法可能会给一个冗余项分配接近零的系数。当两个结构都能同样好地解释数据时,稀疏惩罚可以选择更短的PDE,就像理论家会做的那样。

## 3 实验

### 3.1 数据与基准

场是通过数值求解由八项库组成的PDE生成的。对于周期性域上的标量场u⁡\(x,t\)u(\\bm\{x\},t),一个一阶样本的形式为∂u∂t=ν∇2u\+a⋅∇u\+σu\+βu∂u∂x\+r⁡\(u−u2\)\\f

相似文章