代理式发现交换相关密度泛函

arXiv cs.AI 论文

摘要

本文提出了一种基于大语言模型的代理系统,用于自动化发现密度泛函理论中的交换相关泛函。该系统在性能上超越了人工设计的基线,同时也凸显了基准过拟合带来的挑战。

arXiv:2605.05460v1 公告类型:new 摘要:开发高精度的交换相关(XC)泛函一直是密度泛函理论(DFT)中一个长期存在的难题。绝大多数 XC 泛函均由研究人员手工设计,结合了物理洞察、精确约束和经验拟合。大语言模型的最近进展为这种由人类驱动的设计流程提供了一种系统化的自动化替代方案。本报告介绍了一种代理搜索系统,其中大语言模型根据进化历史提出结构化的泛函形式变更。该系统通过迭代的“计划-执行-总结”循环尝试提升泛函性能,其改进程度可通过针对标准热化学数据集优化泛函参数,随后在预留子集上评估性能来衡量。发现的最佳泛函 SAFS26-a(2026 种子代理泛函搜索)相比黄金标准 {\omega}B97M-V 基线提升了约 9%。这些结果也揭示了 AI 辅助科学中的一个警示性教训:足以发现真正改进的模型同样有能力利用非物理捷径来操纵基准测试;将领域专业知识转化为明确强制执行的约束,对于确保结果在科学上切实可靠仍然至关重要。
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:18

# 交换-关联密度泛函的智能体发现
来源: https://arxiv.org/html/2605.05460
1\]字节跳动 Seed 2\]普林斯顿大学\\贡献\[\*\]工作在字节跳动 Seed 期间完成\\贡献\[†\]通讯作者

###### 摘要

开发高精度的交换-关联(XC)泛函一直是密度泛函理论(DFT)中长期存在的挑战。绝大多数 XC 泛函均由研究人员人工设计,结合了物理直觉、精确约束和经验拟合。大型语言模型(LLM)的最新进展为这种由人类驱动的设计流程提供了一种系统化、自动化的替代方案。本报告提出了一种智能体搜索系统,其中 LLM 根据进化历史提出结构化的泛函形式变更。该系统通过迭代式的“计划-执行-总结”循环尝试提升泛函性能,其改进可通过针对标准热化学数据集优化泛函参数,并在留出子集上评估性能来量化。最强发现的泛函 SAFS26-a(Seed Agentic Functional Search 2026)相比金标准 ωB97M-V 基线提升了约 9%。这些结果也揭示了一个关于 AI 辅助科学的警示性教训:足够强大以发现真正改进的模型,同样具备利用非物理捷径来“刷”基准测试的能力;将领域专业知识转化为明确执行的约束,对于保持结果的科学根基仍然至关重要。

\correspondence

Yang Sun at , Yixiao Chen at

## 1 引言

Kohn-Sham DFT 的准确性主要取决于交换-关联泛函 $E_{\mathrm{xc}}[\rho]$ 的质量。随着时间的推移,这一挑战催生了密集的近似层级,从局部密度近似(LDA)、广义梯度近似(GGA)和元 GGA(meta-GGA),到杂化泛函和双杂化泛函,每一种都在准确性、计算成本和普适性之间进行权衡。迄今为止已提出超过 200 种 XC 泛函,但至今尚无系统性的方法来生成在多样化的化学系统中可靠准确的泛函 [mardirossian2017thirty]。

缺乏建设性的设计程序使得 XC 泛函的开发成为自动化搜索的自然目标。最近由 LLM 驱动的进化系统在算法和工程任务上最为成功,因为进步易于衡量,且连续迭代可以实现具体的改进 [romeraparedes2024funsearch, novikov2025alphaevolve, yang2023opro, wan2025loongflowdirectedevolutionarysearch]。然而,DFT 泛函的发现提出了根本不同的挑战。在算法领域,初始解通常远非最优,每次进化迭代都能识别出目标明确的改进(更好的启发式方法、更紧的界限、更高效的子程序),因此以利用为主的父代选择能可靠地推动进步。相比之下,在泛函发现中,许多看似改进的地方与科学家们经过几十年精心确定的注意事项纠缠在一起,包括守恒定律、数值稳定性、可解释性和可迁移性 [kaplan2023predictive]。此外,XC 泛函基线已经是高度优化的人工设计,很少有局部参数修改不会违反物理约束或导致整体性能下降。因此,以利用为主的采样会停滞不前,对单一精英个体的重复微小扰动往往会导致对基准测试的过拟合,而非真正泛化能力的提升。因此,对接近最优形式的增量式细化不仅无效,反而有害(见附录 G (https://arxiv.org/html/2605.05460#A7))。真正的进步首先要求探索泛函形式空间中结构新颖的区域(新的描述符组合、理性的增强因子拓扑结构和自旋依赖架构),然后才在新发现的有希望区域内进行细化。这种“先探索后细化”的动态过程解释了我们在搜索中观察到的大部分显著分数提升(见附录 D (https://arxiv.org/html/2605.05460#A4) 和 E (https://arxiv.org/html/2605.05460#A5))。

先前对符号泛函形式的搜索可以产生具有竞争力的泛函 [ma2022evolving],但半随机突变将搜索限制在一组预定的修改中,并且仅微弱地利用了关于成功或失败的知识积累。相反,是否可以使用完全基于 LLM 的智能体循环进行符号搜索,该循环可以检查进化历史、诊断停滞期并提出定性不同的形式?更重要的是,这些智能体能否实际上改进最准确的人工设计泛函?本报告聚焦于这一科学问题。我们的目标是设计一种能够改进 SOTA 交换-关联泛函形式的智能体搜索,分析表现最佳的发现泛函,并从搜索轨迹中提取设计原则和局限性。

### 1.1 智能体发现框架

参见图 1 标题:智能体搜索框架示意图:基于多岛进化种群的结构化记忆管理的计划-执行-总结循环。

**计划-执行-总结循环**。智能体搜索建立在 LoongFlow [wan2025loongflowdirectedevolutionarysearch] 之上,这是一个用结构化认知循环替代随机突变的进化框架。每次进化迭代都经过三个 LLM 阶段:一个**规划器(Planner)**,为下一个泛函形式修改生成自然语言蓝图;一个**执行器(Executor)**,将此蓝图转换为可执行的 JAX 代码;以及一个**总结器(Summarizer)**,比较意图与结果,并将结构化诊断写入进化记忆中。确切的任务定义和完整组件描述见附录 C (https://arxiv.org/html/2605.05460#A3) 和 B (https://arxiv.org/html/2605.05460#A2)。

**种群结构**。搜索维护一个跨 $n$ 个独立进化岛屿的候选泛函种群,每个岛屿都有一个封顶的顶级解档案,以保留结构多样化的“垫脚石” [mouret2015mapelites]。父代选择使用以探索为主的 80/20 分裂(80% 均匀随机,20% 来自精英档案),定期迁移在岛屿之间传输顶级解,实现独立成熟思想的跨谱系融合。这种以探索为主的制度优先考虑结构多样性而非对当前最佳结果的利用,这是一个明确的选择,以匹配问题的性质(第 2.3 节 (https://arxiv.org/html/2605.05460#S2.SS3))。完整细节见附录 B.4 (https://arxiv.org/html/2605.05460#A2.SS4)。

**进化记忆**。经过 400 多次迭代,累积的搜索记录远远超出了任何单个 LLM 上下文窗口的容量。框架通过进化记忆 $\mathcal{M}_t$ 解决了这一问题。除了完整的父代状态外,搜索上下文通过两个通道传递给规划器:检索祖先计划、解决方案和总结器诊断的每谱系检索工具,以及跨所有岛屿编译的已耗尽的死胡同策略的全局合成摘要。这确保了智能体在不需要将完整历史记录放入单个提示中时,避免重蹈覆辙。完整细节见附录 B.5 (https://arxiv.org/html/2605.05460#A2.SS5)。

### 1.2 泛函搜索空间与评估

**泛函形式与搜索目标**。进化的对象是范围分离杂化元 GGA 密度泛函的半局部部分 [ma2022evolving, mardirossian2017thirty]。在范围分离杂化元 GGA 中,交换-关联由局部自旋密度 $\rho_\sigma$、其梯度 $\|\nabla\rho_\sigma\|$ 和动能密度 $\tau_\sigma$ 构建。总交换能量结合了短程半局部交换,其中包含短程精确(Hartree-Fock)交换的分数 $c_x$ 以及全范围精确交换。关联同样分解为同自旋和异自旋半局部通道加上 VV10 非局部色散项 [vydrov2010vv10]:

$$
\begin{aligned}
E_x &= E_{x,\mathrm{sr}}^{\mathrm{mGGA}} + c_x \, E_{x,\mathrm{sr}}^{\mathrm{exact}} + E_{x,\mathrm{lr}}^{\mathrm{exact}}, \tag{1} \\
E_c &= E_{c,\mathrm{ss}}^{\mathrm{mGGA}} + E_{c,\mathrm{os}}^{\mathrm{mGGA}} + E_{c,\mathrm{nl}}^{\mathrm{VV10}}. \tag{2}
\end{aligned}
$$

每个半局部通道定义为将适当的局部密度近似(LDA)参考能量密度乘以一个无量纲增强因子 $g(w,u)$;这些增强因子的形式是进化搜索的对象。范围分离参数 $\omega=0.3$,短程精确交换分数 $c_x=0.15$,以及 VV10 参数继承自 ωB97M-V 并保持固定;只有三个增强因子 $g_x$, $g_{c,\mathrm{ss}}$ 和 $g_{c,\mathrm{os}}$ 发生进化。

原始密度 $\rho_\sigma$ 通过增强因子所乘的 LDA 参考能量密度进入。由于 $\|\nabla\rho\|$ 和 $\tau$ 是无界的且非无量纲,梯度和动能密度以无量纲描述符的形式进入增强因子:

$$
s = \|\nabla\rho\| / \rho^{4/3}, \quad t = \tau / \rho^{5/3}, \tag{3}
$$

其中 $\tau = \tfrac{1}{2} \sum_i \|\nabla \varphi_i\|^2$ 是正定动能密度。有界变量为:

$$
w = \frac{k_\sigma - t}{k_\sigma + t}, \quad u = \frac{\gamma s^2}{1 + \gamma s^2}, \tag{4}
$$

其中 $w \in [-1, 1]$ 且 $u \in [0, 1]$,这里 $k_\sigma = \tfrac{3}{10}(6\pi^2)^{2/3}$ 是均匀电子气(UEG)动能前置因子,$\gamma$ 是从 ωB97M-V 继承的固定梯度参数。

**基线与评估器**。初始基线是 ωB97M-V,即金标准范围分离杂化元 GGA 密度泛函 [mardirossian2016wB97MV, mardirossian2017thirty]。在基线形式中,交换由 $w$ 和 $u$ 的紧凑多项式表示,关联由自旋解析或平均描述符的低阶多项式表示。候选后代在基于 JAX 的代码库中实现,该代码库在固定在 ωB97M-V 自洽值上的电子密度上评估泛函形式,遵循非自洽评估协议 [ma2022evolving]。每个候选者的经验参数通过准牛顿优化算法(L-BFGS)最小化训练误差来拟合,梯度通过 JAX 自动微分计算。损失通过 MGCDB84 数据集上的加权均方根偏差(WRMSD)进行测量。为了避免在进化中泄露最终测试集,评估使用验证子集 WRMSD 来计算分数。遵循为 ωB97M-V 建立的程序,最终性能通过结合 MGCDB84 的验证和测试子集计算的 WRMSD 来测量,排除 RG10 数据集。RG10 被排除是因为它不属于其余 82 个数据集分类的八种热化学数据类型中的任何一种;总共 3547 个点构成了这个最终集合 [mardirossian2016wB97MV]。MGCDB84 训练集仅有微小变化,即将两个分子从测试集转移到验证集(C20-C24 子集)。这样做是因为已知该子集显著偏离分布;因此,其包含增加了关键的进化信号。

由于每个候选者都是在对其不自洽的密度上进行评估,一旦允许密度弛豫,报告的 WRMSD 值可能会发生偏移。Ma 等人 [ma2022evolving] 发现自洽 GAS22 误差接近其非自洽对应物,但类似的 SCF 验证仍然是必要的后续步骤。

**评分**。设 $s$ 表示候选泛函形式及其优化后的经验参数 $\Theta$。参数在 MGCDB84 训练分割上拟合,每个候选者由验证加权均方根偏差评分:

$$
J[s(\Theta)] = \mathrm{WRMSD}_{\mathrm{val}}[s(\Theta)], \quad R[s(\Theta)] = \frac{J_{\mathrm{target}}}{J[s(\Theta)]}. \tag{5}
$$

这里 $J_{\mathrm{target}} = 3.45$ kcal 是一个任意选择的、低于 ωB97M-V 验证 WRMSD(4.02 kcal)约 15% 的目标。为了 discouraging 非物理解决方案,原始分数会对违反强制物理约束(第 1.3 节 (https://arxiv.org/html/2605.05460#S1.SS3))的情况进行惩罚:

$$
R_{\mathrm{evlv}}[s(\Theta)] = R[s(\Theta)] \times 0.9^{\,n}, \tag{6}
$$

其中 $n$ 是候选者违反的约束数量。因此,搜索倾向于那些参数可以成功优化、泛化到留出的验证子集并满足强制物理约束的泛函形式。测试分割仅保留用于最终报告。

### 1.3 验证与鲁棒性

除了数值鲁棒性外,发现的泛函还针对三个物理约束 + 一个技术约束进行筛选,任何表现良好的元 GGA 交换-关联泛函都应满足这些约束 [kaplan2023predictive]。在不惩罚违反这些约束的情况下收集的结果表明,强制执行不仅仅是预防性的,而是形成了必不可少的护栏(见附录 F (https://arxiv.org/html/2605.05460#A6))。

1. **自旋对称性**。XC 能量密度必须在交换自旋通道下保持不变:$\varepsilon_{\mathrm{xc}}(\mathbf{r}; \rho_\alpha, \rho_\beta) = \varepsilon_{\mathrm{xc}}(\mathbf{r}; \rho_\beta, \rho_\alpha)$ 在空间每一点。这在 O2 三重态分子网格上进行了测试(其中 $\rho_\alpha \neq \rho_\beta$),通过交换自旋通道并逐点比较产生的能量密度。最大逐点偏差 $\max_{\mathbf{r}} \|\varepsilon_{\mathrm{xc}}^{\alpha\beta} - \varepsilon_{\mathrm{xc}}^{\beta\alpha}\|$ 必须低于 $10^{-5}$ Ha。

2. **均匀电子气(UEG)交换极限**。在均匀电子气极限下($\nabla\rho=0, \tau=\tau_{\mathrm{UEG}}$),短程 DFT 交换增强因子(通过除以 LDA 交换和 RSH 衰减因子 $f_{\mathrm{SR}}(\rho, \omega)$ 提取)必须满足 $g_x(s=0, t=k_c) = c_{x,0}$,其中 $a_{\mathrm{HF}}=0.15$ 是 ωB97M-V 的短程 Hartree-Fock 交换混合分数,给出 $c_{x,0} = 1 - a_{\mathrm{HF}} = 0.85$,且 $k_c = \tfrac{3}{10}(6\pi^2)^{2/3}$ 是动能描述符 $t$ 的 UEG 值。这在四个代表性密度的合成非极化 UEG 网格上进行了测试,涵盖了典型的价电子区域。最大偏差 $\|g_x - c_{x,0}\|$ 必须保持在真实 UEG 交换的 0.5% 以下。

3. **交换的均匀坐标缩放**。在均匀坐标缩放 $\mathbf{r} \to \mathbf{r}/\lambda$ 下...

相似文章

使用大型语言模型驱动的代理系统自动发现生物系统的常微分方程

arXiv cs.AI

本文介绍了MEDA,一个由LLM和符号回归驱动的代理框架,用于自动发现生物动态系统的常微分方程(ODE)模型。它检索背景知识,提出候选ODE,并在典型模型检索、外推和开放式发现任务中评估这些模型,展示了强大的结构恢复能力和生物学上合理的模型。

基于深度学习的精确可扩展交换关联泛函

Hugging Face Daily Papers

微软研究院发布 Skala——一种用于 DFT 的深度学习交换关联泛函,在 GMTKN55 主流化学基准上达到 2.8 kcal/mol 精度,成本仅为半局域泛函水平,全面超越传统泛函。