语言模型通过控制搜索引导符号方程发现

arXiv cs.AI 论文

摘要

本文介绍了LLM-PySR,一种通过控制搜索参数让语言模型引导符号方程发现的方法,同时使用数值符号回归进行拟合。该方法在基准任务上实现了准确性与复杂性的良好平衡。

arXiv:2607.04156v1 Announce Type: new 摘要:科学方程发现必须结合广泛的领域先验知识和严格的数值测试。符号回归提供了数值基础,但面临组合搜索空间,而许多语言模型系统直接要求模型提出或选择公式。我们测试了一种不同的分工方式。我们比较了角色规范,其中语言模型充当方程作者、候选决策者或搜索控制器,同时与端到端语言模型和纯数值基线进行对比。在我们提出的控制器设置中,实现为LLM-PySR,语言模型指定变量、算子、变换和搜索深度;符号回归枚举并拟合表达式;确定性指标控制保留。在74个AI-Feynman方程和七个复杂公式恢复任务中,搜索控制实现了准确性、复杂性、稳定性和成本的最佳平衡。在一个独立的电池数据集上,LLM-PySR识别出了早期电压曲线位移与循环寿命之间的紧凑分段线性关系。结果表明,语言模型应该塑造假设探索,而不是决定哪些方程存活。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:36

# 语言模型通过搜索控制引导符号方程发现
来源:https://arxiv.org/abs/2607.04156
查看PDF (https://arxiv.org/pdf/2607.04156)

> **摘要:** 科学方程发现必须将广泛的领域先验与严格的数值测试相结合。符号回归提供了数值基础,但面临组合搜索空间的问题;而许多语言模型系统则直接要求模型提出或选择公式。我们测试了一种不同的任务分工。我们比较了角色设定——语言模型分别作为方程作者、候选决策者或搜索控制器,同时与端到端语言模型和纯数值基线进行对比。在我们提出的控制器设置(以 LLM-PySR 实现)中,语言模型指定变量、算子、变换和搜索深度;符号回归枚举并拟合表达式;确定性指标控制保留结果。在 74 个 AI-费曼方程和七个复杂公式恢复任务上,搜索控制在准确率、复杂度、稳定性和成本之间实现了最强的观察平衡。在一个独立的电池数据集上,LLM-PySR 识别出早期电压曲线位移与循环寿命之间的紧凑分段线性关系。结果表明,语言模型应塑造假设探索方向,而非直接决定哪些方程得以保留。

## 提交历史

来自:Zikai Xie \[查看邮箱 (https://arxiv.org/show-email/7b9d36f5/2607.04156)\] **\[v1\]** 2026年7月5日星期日 07:50:08 UTC(2,196 KB)

相似文章