探索物理问题中的结构:AI智能体能发现统计力学映射吗?

arXiv cs.AI 论文

摘要

本文介绍了StatMechBench-v0,一个用于评估基于LLM的AI智能体能否从原始配分函数中发现统计力学映射到可处理表示的基准。结果表明,智能体常常能通过数值检查,但会错误识别底层结构,这凸显了当前LLM推理的局限性以及对更丰富验证方式的需求。

arXiv:2607.26367v1 公告类型:新 摘要:理论物理学的一项重要技能是识别新问题何时可以转化为已知模型。我们将这项技能作为一项AI智能体任务来研究:基于LLM的智能体能否从原始配分函数中发现统计力学映射,从而得到可处理的表示?为了探究这个问题,我们引入了StatMechBench-v0,这是一个包含六个伊辛(Ising)型问题的基准,涵盖转移矩阵方法、规范可消除无序以及平面/Pfaffian结构。我们评估了一个简单的“提出-验证-修订”智能体在多种LLM和问题表述下的表现。结果表明,数值反馈通常能帮助智能体修复代码并恢复正确的配分函数。然而,智能体也可能在通过数值检查的同时,错误识别底层可处理类别或低估计算复杂度。这既揭示了当前LLM推理的局限性,也呼吁建立超越数值一致性的验证栈,例如引入符号检查和结构不变量。我们的研究为面向理论物理结构发现的AI智能体提供了早期评估和设计方向。
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:00

# 探索物理问题中的结构:AI智能体能否发现统计力学映射?

来源:https://arxiv.org/html/2607.26367

王雨舟  
Siebel计算与数据科学学院  
伊利诺伊大学厄巴纳-香槟分校  
[email protected]

& 王冰舟¹  
物理与天文系  
莱斯大学  
[email protected]

## 摘要

理论物理学中的一项重要技能是识别新问题何时可以转化为已知模型。我们将这项技能作为一项AI智能体任务来研究:基于LLM的智能体能否从原始配分函数发现统计力学映射,并将其转化为可处理的形式?为了探究这个问题,我们引入了**StatMechBench-v0**,这是一个包含六个伊辛型问题的基准测试,涵盖转移矩阵方法、规范可消除无序以及平面/Pfaffian结构。我们在多种LLM和问题表述上评估了一个简单的“提出-验证-修正”智能体。结果表明,数值反馈通常能帮助智能体修复代码并恢复正确的配分函数。然而,智能体也可能在通过数值检查的同时,错误识别潜在的可用结构类别或低估计算复杂度。这既揭示了当前LLM推理的局限性,也呼吁建立一个超越数值一致性、纳入符号检查和结构不变量等验证手段的验证栈。我们的研究为旨在发现理论物理结构的AI智能体提供了早期评估和设计方向。

## 1 引言

理论物理学中一种常见的思维方式是将新问题与现有理论联系起来,例如将新建立的模型映射到已被充分研究的模型上。统计力学作为物理学的一个重要分支,发展出了一系列典范模型,用以理解微观自由度如何产生宏观相和临界现象(Baxter, 1982)。例如伊辛模型(Lenz, 1920;Ising, 1925)、Potts模型(Potts, 1952),以及许多其他精确可解的晶格模型(Baxter, 1982)。这些模型经过过去一个世纪几代物理学家的发展和求解,蕴含了宝贵的专家知识,物理学家们寻求将新的统计力学问题与现有模型相联系的变换,从而能够复用已知的结果、直觉和工具。

虽然成功地将一个统计力学模型与另一个模型联系起来本身可能就是一项深刻的物理结果,例如Kramers–Wannier对偶性(Kramers and Wannier, 1941a),但它也是在更广泛研究流程中的一步。例如,物理学家识别出从新问题到现有模型的映射,并利用它来计算感兴趣的物理量、简化分析,并获得对原始问题的定性理解。然而,识别或构建这样的映射并非易事:它通常需要对现有模型的熟悉、关于原始问题结构的数学或物理直觉,以及应用适当变换的能力。历史上,许多重要的映射都耗费了大量专家精力,而这一困难可能成为研究中的关键瓶颈,尤其是对于那些不在相关子领域内的研究者而言。

在这项工作中,我们提出一个问题:**我们能否构建一个基于LLM的AI智能体来发现统计力学映射?** 形式上,我们将映射视为从原始问题表示到已知解结构的参考模型的变换(第2节)。我们的关键洞见是,LLM可能已经从教科书、论文和讲义中学习到了所有现有的物理模型,既有数学描述也有自然语言描述,因此基于LLM的智能体或许能够通过结合模型描述、符号模式和高层物理类比,凭借其推理和自我反思能力提出合理的映射假设。

我们首先通过系统评估来建立我们对当前LLM在该领域能力的洞见和理解(第3节)。具体来说,我们收集了一组具有代表性的统计力学映射问题,并按难度分为三个层级(第3.1节)。我们对一部分问题的初步评估表明,在规范描述和改写描述下,LLM都能在反馈循环中找到映射并正确构造可处理的配分函数表示(第3.2节、第3.3节)。我们还识别了几种失败模式。这些观察既揭示了当前AI的能力,也为我们下一步构建发现智能体指明了方向。基于我们的问题分类和评估结果,我们提出了未来统计力学发现智能体的设计和挑战(第4节)。

我们的最终目标是支持前沿研究,例如量子码的容错阈值(Dennis et al., 2002;Chubb and Flammia, 2021)以及监控量子动力学中的相变问题(Skinner et al., 2019;Bao et al., 2020)。更广泛地说,作为将AI智能体具体应用于开放性理论物理问题的早期尝试,我们希望这项工作能鼓励物理学家进一步探索LLM在研究中的作用。通过突出当前智能体AI系统在协助科学发现方面的优势与局限,这项工作旨在为加速科学进步做出贡献。

## 2 背景与问题形式化

统计力学的目标是从系统的微观自由度和相互作用出发,解释并预测其宏观行为。在本节中,我们首先提供统计力学的必要背景,主要参考文献(Baxter, 1982),然后形式化“发现统计力学映射”这一问题。最后,我们回顾启发本工作的AI智能体在科学发现方面的最新进展。

### 2.1 配分函数与精确可解模型

我们从配分函数 \(Z\) 开始,它使得宏观热力学可观测量能够从微观构型中获得,并且将作为我们构建统计力学映射的起点。经典平衡态统计力学以配分函数¹ 的形式表述:

\[
Z=\sum_{s}e^{-\beta H(s)},
\tag{1}
\]

其中 \(s\) 表示系统的微观状态或构型,例如对于一个具有 \(n\) 个二元自由度的系统,\(s=(s_1,\dots,s_n)\),其中 \(s_i\in\{-1,+1\}\),\(i\in\{1,\dots,n\}\);\(H(s)\) 表示构型 \(s\) 的能量;\(\beta\) 是逆温度。\(Z\) 依赖于进入 \(H(s)\) 的物理模型参数以及温度;这里隐式地不写出这种依赖关系。对于离散系统,求和变为积分;对于连续系统和量子系统,则分别变为积分和迹。

配分函数在统计力学中处于核心地位,因为用 \(Z\) 归一化 \(e^{-\beta H(s)}\) 可以得到微观构型 \(s\) 上的概率分布(即 \(p(s)=\frac{e^{-\beta H(s)}}{Z}\));然后,宏观可观测量可以通过对微观状态取加权平均来获得。

尽管 \(Z\) 将微观状态与宏观可观测量联系起来,但如式(1)那样直接求值对于宏观尺寸的真实相互作用² 系统是不可行的,因为这样的系统包含极其大量的自由度,通常约为阿伏伽德罗常数(\(10^{23}\))的量级。例如,考虑一个具有 \(n\) 个二元自由度的系统,即 \(s=(s_1,\ldots,s_n)\),其中 \(s_i\in\{0,1\}\),直接计算式(1)需要对 \(2^n\)(\(n\sim 10^{23}\))个构型求和。因此,通常采用以下一种或两种策略:(i)用简化的理想化模型替代真实系统,该模型由状态 \(s\) 和能量函数 \(H(s)\) 定义,并选择这些来捕捉相关物理,同时使配分函数具有可处理的结构。(ii)引入近似来计算求和。

在特殊情况下,模型的结构允许精确计算配分函数;这样的模型通常被称为*精确可解模型*。迄今为止,精确可解模型的目录仍然有限,但它为物理学家提供了宝贵的理论库,标志着当前解析控制的边界。表1总结了四组已被精确求解的模型。

**表1:** 从文献(Baxter, 1982)改编的几类经典精确可解模型。

模型 → I. 变换 → II. 可解结构 → III. 计算 \(Z\)

物理学家推理

**图1:** 精确计算配分函数 \(Z\) 的一般逻辑。

### 2.2 统计力学映射

我们从图1中提取出物理学家计算配分函数 \(Z\) 的一般逻辑:将模型映射到一个等价表述,使可解结构变得明显,从而能够显式地计算配分函数。类似地,这一逻辑也指导着对新模型的研究:当一个模型首次被引入以解释新现象时,分析该模型的一个自然的第一步是寻找变换,以揭示其是否具有可解结构或能否与已知模型联系起来。

为了扩大可能开辟可行求解路径的变换搜索规模,我们提出一个问题:*基于LLM的AI智能体能否通过将问题映射到已知的统计力学模型来揭示问题的可解结构?* 我们将此类任务称为*统计力学映射*。作为初步探索,本工作关注的核心对象是以原始配分函数或式(1)形式的原始配分函数型求和(即来自问题的指数多构型求和)呈现的情况;相应地,“映射”指的是将原始配分函数带入已知模型配分函数的数学变换,例如变量变换、规范变换和对偶变换。

一般而言,成功的配分函数映射既有物理价值也有方法论价值。从物理角度看,它可以将一个新问题置于现有的普适类³ 中。从方法论角度看,对被映射模型的解析控制可以转移回原始问题。即使被映射的配分函数不是精确可解的,映射仍然提供物理洞见,并允许应用特定模型的数值方法,如蒙特卡洛或张量网络方法。

据我们所知,此前尚无工作研究使用基于LLM的智能体来识别统计力学映射。最接近的工作(Gupta et al., 2025)使用机器学习算法来学习由对偶性(一种特定变换)映射得到的函数,而本工作则询问LLM智能体能否自行发现映射本身。

### 2.3 用于科学发现的AI智能体

已有若干基于LLM的智能体被提出,用于通过程序搜索进行科学和数学发现。FunSearch(Romera-Paredes et al., 2024)引入了一个LLM引导的进化搜索框架,将预训练LLM与自动评估器配对,以发现数学和算法问题的程序。AlphaEvolve(Novikov and others, 2025)将这一研究方向扩展到更通用的进化编码智能体,能够修改更大的代码库并优化科学、数学和工程任务中的算法。

在理论物理方面,Brenner和Colwell(2026)将Gemini Deep Think、树搜索和自动数值反馈相结合,通过评估一个核心积分来推导宇宙弦辐射问题的解析解。它建立在ERA(Aygün et al., 2025)这一更广泛的LLM-树搜索科学软件生成系统之上,该系统将科学软件开发形式化为一个可评分的搜索问题,并在多个科学领域展示了结果。

已有若干基准测试评估了AI智能体在物理问题上的表现。Song等人(2025)评估了LLM在生物学、化学、材料科学和物理学(包括求解伊辛模型)中的场景化科学发现任务。PRL-Bench(Miao et al., 2026)提供了一个基准测试,用于评估源自近期《物理评论快报》论文的理论和计算物理研究任务,涵盖现代物理的主要子领域,包括统计物理。

本工作针对统计力学映射这一更细粒度的问题,其成功要求识别潜在的可用结构,从而能够更精确地诊断AI智能体是否能发现具有物理意义的约简,而不仅仅是将最终答案制作得看似合理,或自动化一个宽泛的研究流程。

## 3 探测用于统计力学映射的LLM智能体

由于统计力学映射(第2.2节)涵盖广泛的问题领域,涉及多样的精确可解模型和数学变换,并且可以服务于不同目的(例如计算感兴趣的物理量 vs. 分析物理),同时当今基于LLM的智能体设计空间巨大(从提示设计到工具使用),而LLM能力仍然不透明(例如记忆 vs. 推理),因此直接构建一个完整的端到端智能体来实现我们的任务是不切实际且具有挑战性的。因此,我们进行了一项探测性评估,以首先建立对LLM能力的理解并指导智能体设计。

我们首先将统计力学映射问题按难度分为三个层级,然后在一个包含最简单层级问题(重新发现已知问题)的小型基准测试上评估一个朴素的“提出-验证-修正”智能体。我们的评估显示出使用反馈的有希望的结果——

相似文章

模拟、推理、决策:基于LLM的科学推理驱动仿真决策

arXiv cs.AI

密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。

科学机器学习中的物理审计代理发现

arXiv cs.AI

介绍了物理审计代理科学机器学习(PA-SciML),这是一种以验证为先的工作流程,其中LLM代理发现替代模型,并针对边界条件和因果性等物理要求而非仅误差指标进行验证。数值示例表明,与仅基于误差的基线相比,可信度有所提高。