语言模型通过控制搜索引导符号方程发现
摘要
本文介绍了LLM-PySR,一种通过控制搜索参数让语言模型引导符号方程发现的方法,同时使用数值符号回归进行拟合。该方法在基准任务上实现了准确性与复杂性的良好平衡。
arXiv:2607.04156v1 Announce Type: new
摘要:科学方程发现必须结合广泛的领域先验知识和严格的数值测试。符号回归提供了数值基础,但面临组合搜索空间,而许多语言模型系统直接要求模型提出或选择公式。我们测试了一种不同的分工方式。我们比较了角色规范,其中语言模型充当方程作者、候选决策者或搜索控制器,同时与端到端语言模型和纯数值基线进行对比。在我们提出的控制器设置中,实现为LLM-PySR,语言模型指定变量、算子、变换和搜索深度;符号回归枚举并拟合表达式;确定性指标控制保留。在74个AI-Feynman方程和七个复杂公式恢复任务中,搜索控制实现了准确性、复杂性、稳定性和成本的最佳平衡。在一个独立的电池数据集上,LLM-PySR识别出了早期电压曲线位移与循环寿命之间的紧凑分段线性关系。结果表明,语言模型应该塑造假设探索,而不是决定哪些方程存活。
查看缓存全文
缓存时间: 2026/07/07 04:36
# 语言模型通过搜索控制引导符号方程发现 来源:https://arxiv.org/abs/2607.04156 查看PDF (https://arxiv.org/pdf/2607.04156) > **摘要:** 科学方程发现必须将广泛的领域先验与严格的数值测试相结合。符号回归提供了数值基础,但面临组合搜索空间的问题;而许多语言模型系统则直接要求模型提出或选择公式。我们测试了一种不同的任务分工。我们比较了角色设定——语言模型分别作为方程作者、候选决策者或搜索控制器,同时与端到端语言模型和纯数值基线进行对比。在我们提出的控制器设置(以 LLM-PySR 实现)中,语言模型指定变量、算子、变换和搜索深度;符号回归枚举并拟合表达式;确定性指标控制保留结果。在 74 个 AI-费曼方程和七个复杂公式恢复任务上,搜索控制在准确率、复杂度、稳定性和成本之间实现了最强的观察平衡。在一个独立的电池数据集上,LLM-PySR 识别出早期电压曲线位移与循环寿命之间的紧凑分段线性关系。结果表明,语言模型应塑造假设探索方向,而非直接决定哪些方程得以保留。 ## 提交历史 来自:Zikai Xie \[查看邮箱 (https://arxiv.org/show-email/7b9d36f5/2607.04156)\] **\[v1\]** 2026年7月5日星期日 07:50:08 UTC(2,196 KB)
相似文章
InsightSR:通过并行语义和结构LLM指导优化符号回归搜索空间
InsightSR是一个利用大语言模型来优化符号回归搜索空间的框架,通过迭代的语义和结构指导提高准确性和物理一致性。
当大型语言模型发展语言:用于高效多智能体推理的符号通信
本文提出通信语言符号路由(CLSR),多个LLM智能体自主发明并演化紧凑的符号语言进行推理,相比思维链(CoT)实现3-6倍的令牌减少,同时保持准确性。
迈向可靠且鲁棒的LLM规划:符号反馈驱动的迭代自我改进框架
本文提出了一种符号反馈驱动的迭代自我改进框架,以提高大语言模型在长周期规划任务中的鲁棒性和可靠性。该方法利用自然语言提示、符号验证器和计划识别器来增强可行性与正确性。
语言模型虽努力仍出错:自纠正科学生成的共形预测
介绍了科学可行性控制(SFC),一种共形预测框架,为大型语言模型中的科学推理有效性提供统计保证,在PhyX物理推理上达到50.1%的准确率,优于DeepSeek-R1和GPT-4,同时将科学违规减少73%。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。