符号回归中的深度分解与归约
摘要
本文介绍了DDRSR,一种在符号回归中拓宽表达式分解与归约的方法,避免暴力子结构搜索并提供理论正确性,在经验上优于先前方法。
arXiv:2608.02628v1 公告类型:新
摘要:符号回归(SR)是从数据中发现潜在模式并用数学表达式表示它们的任务。当前机器学习方法在符号回归中往往缺乏对控制这些表达式的内在数学和物理原理的深刻理解。虽然开创性的AI Feynman方法利用了数据背后的数学性质,但其表达式简化机制适用范围狭窄,且在处理复杂方程时容易失败。此外,其底层机制严重依赖对子表达式的暴力搜索,极大限制了其实用性。通过严格的数学推导和证明,我们提出了我们的方法:Deep Divide and Reduce in Symbolic Regression(DDRSR)。DDRSR从根本上拓宽了表达式分解与归约的适用范围,避免了对子结构进行暴力搜索的需求,并确保了更广泛的通用性和严格的理论正确性。经验评估表明,这些理论原理在表达式分解和数值回归任务中均具有显著优势。最后,我们讨论了该范式的适用场景和固有局限性,以及未来研究的有前景方向。
查看缓存全文
缓存时间: 2026/08/05 07:40
# 符号回归中的深度分治与归约(Deep Divide-and-Reduce in Symbolic Regression) 来源:https://arxiv.org/html/2608.02628 Yusong Deng, Yanjie Li, Weijun Li\* 中国科学院大学 跨学科高等研究院 北京,101408 dengyusong22@mails\.ucas\.ac\.cn ###### 摘要 符号回归(\(SR\))是从数据中发现潜在模式并用数学表达式表示这些模式的任务。当前的机器学习方法往往缺乏对控制这些表达式的内在数学与物理原理的深刻理解。虽然开创性的 AI Feynman 方法利用了数据背后的数学性质,但其表达式简化机制适用范围狭窄,且在面对复杂方程时容易失效。此外,其底层机制严重依赖对子表达式的暴力搜索,极大限制了其实用性。通过严格的数学推导与证明,我们提出了符号回归中的深度分治与归约方法(Deep Divide and Reduce in Symbolic Regression, \(DDRSR\))。\(DDRSR\) 从根本上拓宽了表达式分解与归约的适用性,避免了对子结构进行暴力搜索的需求,并兼顾了更广泛的通用性与严格的理论正确性。实证评估表明,这些理论原理在表达式分解和数值回归任务中均带来了显著优势。最后,我们讨论了该范式的适用场景、固有局限性以及未来研究的有前景方向。 ## 1 引言 符号回归(\(SR\))是机器学习与自然科学交叉领域的一项基础性挑战,旨在从观测数据中自动发现可解释的数学表达式,以精确刻画系统的内在动态。与传统深度学习回归方法不同,\(SR\) 在追求高预测精度的同时强调模型可解释性。由于其能够揭示物理定律的精确解析形式,\(SR\) 在“AI for Science”范式中获得了前所未有的关注,尤其是在涉及底层数学与物理原理的情境中。当代符号回归方法论大致分为两大主流范式:基于搜索的方法与基于预训练的方法。搜索型方法——从经典遗传编程(\(GP\))到最近的强化学习框架如 Deep Symbolic Regression [Petersen et al. (2019)](https://arxiv.org/html/2608.02628#bib.bib2),以及众多后续变体 [Sun et al. (2022)](https://arxiv.org/html/2608.02628#bib.bib1)、[Mundhenk et al. (2021)](https://arxiv.org/html/2608.02628#bib.bib3)、[Li et al. (2024)](https://arxiv.org/html/2608.02628#bib.bib4)、[Liu et al. (2025)](https://arxiv.org/html/2608.02628#bib.bib33)、[
相似文章
EditSR:通过基于编辑的修正增强神经符号回归
EditSR 提出了一种双层框架,将神经符号回归模型与基于编辑的修正器(Rectifier)相结合,以高效修正生成表达式中的结构错误,减少错误累积,并以有限的额外成本提高复杂符号结构的恢复能力。
InsightSR:通过并行语义和结构LLM指导优化符号回归搜索空间
InsightSR是一个利用大语言模型来优化符号回归搜索空间的框架,通过迭代的语义和结构指导提高准确性和物理一致性。
使用固定深度符号回归搜索前馈神经网络权重更新规则空间
本文研究使用符号回归发现显式神经网络权重更新规则,这些规则在小型符号回归基准上优于标准手工设计的优化器,在30个基准/网络组合中的25个上实现了44.47%的聚合MSE降低。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
@gklambauer: G-RRM:用递归推理模型引导符号求解器 符号求解器需要分支来检查不同的选择…
本文介绍了一种神经符号方法G-RRM,它使用递归推理模型来引导符号求解器解决约束满足问题,在特定条件下显示出显著的加速效果。