InsightSR:通过并行语义和结构LLM指导优化符号回归搜索空间

arXiv cs.LG 论文

摘要

InsightSR是一个利用大语言模型来优化符号回归搜索空间的框架,通过迭代的语义和结构指导提高准确性和物理一致性。

arXiv:2608.25291v1 Announce Type: new 摘要:符号回归 (SR) 旨在从观测数据中发现简洁的数学定律,但传统方法常因物理意义表达式的庞大组合搜索空间而面临挑战。我们提出 InsightSR,这是一个将大语言模型 (LLM) 作为指导层嵌入 PySR 遗传编程引擎的框架。InsightSR 不依赖 LLM 直接生成表达式,而是通过两条互补路径逐步优化搜索空间本身:语义种子路径提出维度一致的函数骨架,结构特征路径推荐非线性特征变换。这些变换在迭代中累积,扩展输入空间,将符号搜索从基于原始变量构建深层表达树转向基于丰富语义特征集组装浅层树。生成后的反馈循环评估候选方案,根据经验效用对特征分类,并优化下一次迭代的指导,将发现过程从开放式生成转变为迭代式自我修正优化。在三个基准测试中,InsightSR 在 Feynman 基准上达到 95% 的精确恢复率,在 LLM-SRBench LSR-Transform 任务上达到 80.18% 的准确率,显著优于最先进的遗传编程和神经符号方法,同时在现实世界数据集上保持强大的分布外泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:38

# InsightSR:通过并行语义与结构化大语言模型引导精炼符号回归搜索空间
来源:https://arxiv.org/html/2608.25291
###### 摘要

> 符号回归(SR)旨在从观测数据中发现简洁的数学规律,然而传统方法在面对具有物理意义的表达式所构成的庞大组合搜索空间时常常力不从心。我们提出 InsightSR,这是一个将大语言模型(LLM)作为指导层嵌入到 PySR 遗传编程引擎周围的框架。InsightSR 并非依赖 LLM 直接生成表达式,而是通过两条互补的路径利用 LLM 渐进式地变换搜索空间本身:一条语义种子路径提出量纲一致的功能骨架,另一条结构特征路径则推荐非线性特征变换。这些变换在迭代过程中累积,扩展输入空间,并将符号搜索从基于原始变量构建深层表达式树,转变为在丰富、语义化的特征集上组装浅层表达式树。一个生成后反馈循环评估候选表达式,根据其经验效用对特征进行分类,并为下一次迭代优化指导,将发现过程从开放式生成转变为迭代式、自我修正的精炼过程。在三个基准测试中,InsightSR 在费曼基准测试上实现了 95% 的精确恢复率,在 LLM‑SRBench LSR‑Transform 任务上达到了 80.18% 的准确率,显著优于最先进的遗传编程和神经‑符号方法,同时在真实数据集上保持了强大的分布外泛化能力。

## 引言

符号回归(SR)旨在从观测数据中直接提炼潜在的数学规律,是自动化科学发现的基石\[schmidt2009distilling,brunton2016discovering\]。尽管 SR 能产生可解释的闭式表达式,但其优化本质上是 NP 难问题\[virgolin2022symbolic\],且候选表达式的组合搜索空间随表达式复杂度呈指数增长。另一个挑战在于,如何将物理约束(如量纲一致性和已知的守恒定律)融入搜索过程。因此,纯数据驱动的 SR 方法常常产生虽然数值精度高但违反基本物理原理的表达式。

现有方法主要依赖于对数学表达式离散空间的随机搜索。最广泛使用的是遗传编程(GP)变体\[koza1994genetic,cranmer2023pysr,virgolin2021improving\],它们通过变异和交叉操作进化表达式树种群;以及更近期的基于蒙特卡洛树搜索(MCTS)的方法\[sun2022symbolic,shojaee2023transformer\],它们将发现过程视为序列决策任务。虽然这些方法可以恢复近似的符号形式,但它们采样效率低下,并且在观测噪声下容易过拟合。更关键的是,由于缺乏强制执行物理约束的机制,它们常常生成数学上灵活但物理上无意义的表达式,缺乏科学解释所需的简洁性和领域一致性。

神经网络的集成进一步扩展了 SR 工具集。深度强化学习方法如 DSR\[petersen2021deep\]和 uDSR\[landajuela2022unified\]将方程发现视为策略优化问题,使用学习到的梯度引导在表达式空间中搜索。基于 Transformer 的模型如 NeSymReS\[biggio2021neural\]和 E2E\[kamienny2022end\]利用大规模预训练将数据模式直接映射到数学表达式。其他专门方法,如 PhySO\[landajuela2021discovering\],在搜索中纳入量纲约束以强制物理一致性。尽管这些神经方法加速了发现过程,但它们本质上是数据驱动的:其性能严重依赖于训练分布,并且通常无法泛化到分布外的情形。此外,它们执行的物理约束通常是在训练期间硬编码的,而不是动态推理的,限制了其适应新物理情境的能力。

近期工作探索将大语言模型(LLM)集成到 SR 中,以利用其编码的科学先验知识。LLM‑SR\[shojaee2025llmsr\]通过 LLM 生成方程骨架,并通过 BFGS 优化其参数,将成功模式存储在经验缓冲区中以指导未来迭代。SR‑LLM\[guo2025srllm\]将 SR 视为一个强化学习问题,使用基于 LLM 的策略网络,并结合检索增强生成进行增量知识积累。LaSR\[li2024lasr\]专注于 LLM 引导的特征工程,推荐变换以扩展输入空间。PiSR via LLM\[taskin2026pisr\]将 LLM 生成的评估作为物理信息正则化项纳入损失函数。虽然这些方法前景广阔,但常常受限于两个问题。首先,它们产生显著的推理开销,因为在搜索过程中需要频繁查询 LLM。其次,更重要的是,每种方法仅沿单一维度使用 LLM 指导——要么是结构假设生成,要么是输入空间变换——未能利用整合两者的潜在协同效应。这种分离忽略了一个关键机会:结构先验可以指导特征工程,而工程化的特征可以简化拟合数据所需的结构形式。

为了解决这些限制,我们提出 InsightSR,一个将 LLM 作为指导层嵌入到 PySR 遗传编程引擎\[cranmer2023pysr\]周围的框架。InsightSR 并非依赖 LLM 直接生成候选表达式,而是利用 LLM 通过两条互补路径渐进式地变换搜索空间。语义种子路径提出量纲一致的功能骨架,提供物理信息的热启动;结构特征路径则推荐非线性特征变换,这些变换在代际间累积,逐步扩展输入空间。这将搜索负担从基于原始变量构建深层表达式树,转变为在语义丰富的特征集上组装浅层组合。一个从结果中学习的反馈循环在每次迭代结束时闭合:LLM 评估 Pareto 最优候选表达式,根据其经验效用对特征进行分类,并更新知识库,为后续迭代中的两条路径提供信息,将符号发现从开放式生成转变为迭代式、自我修正的精炼。

我们的工作做出了三个关键贡献:

1. **语义种子路径**:我们引入了一种机制,利用领域感知的 LLM 提出量纲一致的功能骨架,作为进化搜索的物理信息种子。通过审查和重新配置候选拓扑以符合目标物理单位,该路径在数值拟合开始之前就从搜索空间中剪枝掉物理不一致的表达式。LLM 还提供每个算子的复杂度偏好,引导遗传编程引擎选择物理上合理的算子组合。

2. **结构特征路径**:我们设计了一条互补路径,其中 LLM 根据问题上下文和先前代次的性能历史推荐非线性特征变换。这些变换在代际间累积,逐步扩展输入空间。这将进化搜索从基于原始变量构建深层表达式树以发现复杂的非线性关系,转变为在丰富的特征基上组装浅层组合,显著降低了符号引擎需要解析的结构复杂度。

3. **闭环迭代精炼**:我们实现了一种从结果中学习的机制,闭合发现循环。每次迭代后,LLM 沿多个维度评估候选表达式,包括数值精度、物理可解释性和特征效用。这些评估累积在一个动态知识库中,为后续迭代中的语义和结构路径提供信息,使搜索能够自我修正并逐步收敛到最优符号形式。

## 方法

参见图例:图 1:InsightSR 系统架构。该框架每一代遵循四阶段迭代循环:(1)上下文初始化,LLM 执行自动单位合成和领域分析;(2)并行引导策略,同时生成种子表达式(策略 A)并推荐特征增强(策略 B);(3)使用 PySR 搜索,集成的启发式方法引导 PySR 引擎;以及(4)策略分析,LLM 评估前 K 个候选表达式并制定下一次迭代的计划。SR 的目标是发现一个分析表达式 \(f:\mathbb{R}^{d}\to\mathbb{R}\),准确描述数据集 \(\mathcal{D}=\{(\mathbf{x}_{i},y_{i})\}_{i=1}^{N}\) 中的关系。遵循标准的 GP 公式,我们将其视为平衡数值精度与结构简洁性的多目标优化:

\[
\min_{f\in\mathcal{F}}\mathcal{L}(f,\mathcal{D})=\text{MSE}(y,f(\mathbf{X}))+\lambda\cdot\mathcal{C}(f),
\tag{1}
\]

其中 \(\mathcal{C}(f)\) 表示 \(f\) 的结构复杂度(以其表达式树中的节点数衡量),\(\lambda\) 控制简洁性惩罚。

InsightSR 将发现过程组织为一个四阶段迭代循环,总结于图 1 (https://arxiv.org/html/2608.25291#Sx2.F1) 并在算法 1 (https://arxiv.org/html/2608.25291#alg1) 中形式化。每一代在三个干预点嵌入 LLM 推导的领域知识——进化搜索之前、期间和之后——将 PySR 从无向随机探索转向有目的的引导优化。我们下面详细描述每个阶段。

算法 1 InsightSR 搜索过程
0:数据集 \(\mathbf{X},y\),问题上下文 \(\mathcal{C}\),单位 \(\mathcal{U}\)
0:最优符号表达式 \(f^{*}\)
初始化知识库 \(\mathcal{K} \leftarrow \emptyset\)
for \(g=1\) to \(G\) do
    \(\mathcal{F}_{seed} \leftarrow \text{LLM.SemanticSeeds}(\mathcal{C},\mathcal{U},\mathcal{K})\)  ▷ 种子路径
    \(\mathbf{X}_{aug} \leftarrow \text{LLM.StructuralFeatures}(\mathcal{C},\mathcal{K})\)  ▷ 特征路径
    \(\mathcal{G} \leftarrow \text{MergeGuidance}(\mathcal{F}_{seed},\mathbf{X}_{aug})\)
    \(\text{candidates} \leftarrow \text{PySR.GuidedSearch}(\mathbf{X}_{aug},y,\mathcal{G})\)
    \(\text{eval, insights} \leftarrow \text{LLM.StrategicAnalysis}(\text{candidates})\)
    \(\mathcal{K} \leftarrow \text{KB.Accumulate}(\text{insights},\text{eval})\)
    if \(\text{Loss}(f^{*}) < 10^{-10}\) then
        break
    end if
end for
return 候选中的最佳表达式 \(f^{*}\)

### 上下文初始化与单位合成

框架首先解析每个变量的物理量纲。它从数据集元数据和问题描述中提取可用的量纲信息。对于单位仍然模糊或未指定的变量,LLM 基于问题的语义上下文和目标变量的物理作用推断可能的量纲。由此产生的单位分配在整个发现循环中作为量纲约束存在。通过强制执行量纲齐次性,框架从搜索空间中剪枝物理不一致的候选表达式,确保符号搜索扎根于潜在的物理学。

### 并行引导策略

InsightSR 的核心是一个并行引导策略,其中 LLM 同时沿两个互补维度贡献:自上而下的语义种子生成和自下而上的特征工程。

**语义种子路径**:该路径利用领域感知的 LLM 提出量纲一致的功能骨架,作为进化搜索的物理信息种子。给定问题元数据和第 3.1 节中解析的单位约束,LLM 生成候选表达式拓扑,其量纲一致性在进入种群之前会经过审查。每个骨架包含符号常量,随后会进行数值优化。通过用物理上合理的结构为种群播种,该路径在进化优化开始之前,就从搜索空间中剪枝掉大量量纲不一致的表达式。

**结构特征路径**:与此同时,该路径通过 LLM 引导的特征工程丰富输入空间。在每一代,LLM 分析性能历史,并根据幸存候选表达式中观察到的模式识别高实用性的非线性变换 \(\phi(\mathbf{x})\)。这些变换被附加到输入矩阵:

\[
\mathbf{X}_{aug}=[\mathbf{x}_{1},\dots,\mathbf{x}_{d},\phi_{1}(\mathbf{x}),\dots,\phi_{k}(\mathbf{x})],
\tag{2}
\]

其中 \(\phi_{j}(\mathbf{x})\) 包括幂律项 \(x_i^n\) 和超越映射 \(\sin(x_i)\) 等操作。关键是,这些特征在代际间累积,逐步扩展输入空间。这将搜索从构建深层表达式树以发现复杂的非线性关系,转变为在已丰富的特征集上组装浅层组合,显著降低了进化引擎需要解析的结构深度。

两条路径在 PySR 引擎内部汇合。优化器不再在原始输入 \(\mathbf{x}\) 上的无约束空间 \(\mathcal{F}\) 中搜索,而是在一个信息丰富的流形上操作:

\[
f^{*}=\arg\min_{f\in\mathcal{F}_{seed}}\mathcal{L}(f(\mathbf{X}_{aug}),\mathcal{D}).
\tag{3}
\]

语义种子提供扎根于物理的宏观结构约束,而工程化的特征提供源自经验模式的微观构建块。它们共同将搜索限制在表达式空间的物理合理区域内,同时不牺牲高精度拟合所需的数值灵活性。

### 使用 PySR 搜索

合成的引导由三部分组成:符号种子、算子偏好和增强特征矩阵 \(\mathbf{X}_{aug}\)。这些被传递给修改后的 PySR 引擎进行进化搜索。为了将搜索引导向 LLM 推导的功能结构,我们引入了一种复杂度偏置机制,调整每个表达式树的结构惩罚。调整后的复杂度 \(\mathcal{C}'(f)\) 计算为基础算子成本 \(c_o\) 加上 LLM 提供的偏置 \(\omega_o\) 的总和:

\[
\mathcal{C}'(f)=\sum_{o\in f}(c_o+\omega_o).
\tag{4}
\]

LLM 推荐的算子获得负偏置 \(\omega_o\),从而赋予其复杂度优势。

相似文章

语言模型通过控制搜索引导符号方程发现

arXiv cs.AI

本文介绍了LLM-PySR,一种通过控制搜索参数让语言模型引导符号方程发现的方法,同时使用数值符号回归进行拟合。该方法在基准任务上实现了准确性与复杂性的良好平衡。

EditSR:通过基于编辑的修正增强神经符号回归

arXiv cs.AI

EditSR 提出了一种双层框架,将神经符号回归模型与基于编辑的修正器(Rectifier)相结合,以高效修正生成表达式中的结构错误,减少错误累积,并以有限的额外成本提高复杂符号结构的恢复能力。

基于语义级奖励的LLM校准

arXiv cs.CL

提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。