PhysMent:一种用于LLM物理问题推理的交互式方法
摘要
PhysMent引入了一个交互式基准测试,通过与MuJoCo物理模拟器的迭代工具介导实验来评估LLM的物理推理能力,揭示了模型在多步骤程序任务中的弱点。
arXiv:2609.13152v1 Announce Type: new
摘要:大型语言模型(LLMs)在静态科学基准测试中表现出色,但它们通过主动实验推理物理世界的能力仍鲜为人知。我们引入PhysMent,一个基准测试,通过与MuJoCo物理模拟器的迭代工具介导交互来评估LLM的物理推理。与静态基准测试预先提供所有量不同,PhysMent要求模型通过施加力、查询对象状态、推进时间并修改场景几何来发现信息,然后回答问题。该基准测试包含105个经典力学场景,分为四个难度级别(简单/困难和单步/多步)、三种场景模式(标准、对象创建、隐藏对象)和一个场景操作类别,使用六维评分框架进行评估。结果显示,当前模型在定性单概念任务上表现合理(准确率高达80%),但在需要精确多步骤实验程序的定量任务上显著退化:大多数模型在最难的单概念类别上准确率低于30%,瓶颈在于程序(自适应多步骤工具使用)而非概念负担。在七种模型中,准确率从25%到67%不等,失败原因包括过早提交答案、低效探索以及在模拟器反馈中接地不一致,而非概念差距。
查看缓存全文
缓存时间: 2026/09/15 08:30
# PhysMent:一种用于物理问题中大语言模型推理的交互式方法 来源:https://arxiv.org/html/2609.13152 Utkarsh Jha Xiyin Yang Abhinav Jarajapu Anik Sahai Eddie Hu Robin Jeshua Deepak Stefano Saravalle Aditya Shah ###### 摘要 大型语言模型(LLMs)在静态科学基准测试中表现强劲,然而它们通过*主动实验*来推理物理世界的能力仍然知之甚少。我们推出了PhysMent,这是一个通过迭代的、工具介导的与MuJoCo物理模拟器的交互来评估LLM物理推理能力的基准。与预先提供所有数据的静态基准不同,PhysMent要求模型通过施加力、查询物体状态、推进时间以及修改场景几何形状来*发现*信息,然后才能回答问题。该基准包含105个经典力学场景,组织在四个难度类别(简单/复杂 × 单一/多重)、三种场景模态(标准、物体创建、隐藏物体)以及一个场景操作类别中,并采用六维评分框架进行评估。结果表明,当前模型在定性单一概念任务上表现尚可(准确率高达80%),但在需要精确、多步实验程序的定量任务上表现显著下降:在最难的单一概念类别中,大多数模型准确率低于30%,其瓶颈在于程序性(自适应多步工具使用)而非概念负载。在七款模型中,准确率在25%到67%之间,失败原因主要是过早提交答案、探索效率低下以及未能根据模拟器反馈进行一致的验证,而非概念性差距。我们的代码可在[此处](https://github.com/DRJCompSciWiz/PhysMent---An-Interactive-Approach-For-LLM-Reasoning-In-Physics-Problems)获取。 物理推理、大型语言模型、基准、MuJoCo、智能体AI ## 1 引言 大型语言模型在阅读理解(Hendrycks et al., 2021a ([https://arxiv.org/html/2609.13152#bib.bib1](https://arxiv.org/html/2609.13152#bib.bib1)))、研究生水平的科学(Rein et al., 2024 ([https://arxiv.org/html/2609.13152#bib.bib2](https://arxiv.org/html/2609.13152#bib.bib2)))和数学问题求解(Hendrycks et al., 2021b ([https://arxiv.org/html/2609.13152#bib.bib3](https://arxiv.org/html/2609.13152#bib.bib3)))方面达到了很高的性能。然而,这些能力本质上是陈述性的:模型阅读一个完全指定的问题并产生文本答案。现实世界中的物理推理则不同。面对一个未知系统的科学家必须设计实验、施加干预、观察结果、修正假设并进行迭代。现有的基准测试缺失的正是这种区别。PIQA(Bisk et al., 2020 ([https://arxiv.org/html/2609.13152#bib.bib4](https://arxiv.org/html/2609.13152#bib.bib4)))、ScienceQA(Lu et al., 2022 ([https://arxiv.org/html/2609.13152#bib.bib5](https://arxiv.org/html/2609.13152#bib.bib5)))、GPQA(Rein et al., 2024 ([https://arxiv.org/html/2609.13152#bib.bib2](https://arxiv.org/html/2609.13152#bib.bib2)))和ARC(Clark et al., 2018 ([https://arxiv.org/html/2609.13152#bib.bib6](https://arxiv.org/html/2609.13152#bib.bib6)))都测试了用自然语言表达的物理原理的静态记忆。PHYRE(Bakhtin et al., 2019 ([https://arxiv.org/html/2609.13152#bib.bib7](https://arxiv.org/html/2609.13152#bib.bib7)))和IntPhys(Riochet et al., 2020 ([https://arxiv.org/html/2609.13152#bib.bib8](https://arxiv.org/html/2609.13152#bib.bib8)))涉及物理环境,但评估的是学习到的视觉或强化学习策略,而非语言介导的实验推理。最接近的先前工作是Mind’s Eye(Liu et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib9](https://arxiv.org/html/2609.13152#bib.bib9))),它通过MuJoCo模拟后端增强了LLM,但将其用作*一次性神谕*:模型调用模拟器一次来检索事实,而不是设计多步实验方案。PhysMent直接解决了这一差距:它需要一个*持续的、多轮的实验对话*,模型根据先前的观察自适应地选择干预措施,这与Mind’s Eye的单次调用有着根本的不同。我们认为,一个针对此能力、使用LLM作为实验物理探究智能体的基准需要具备三个特性:(1)信息不完整性:模型必须选择要测量的量,而不是从提示中读取;(2)因果干预性:模型必须施加力、修改场景或推进时间以观察随之而来的状态变化;(3)基于环境的评估:答案由物理引擎验证,而非人工编写的答案。我们强调,这些是针对*此*评估目标的功能性要求,而非静态基准的缺陷,静态基准在其衡量陈述性物理知识的目标上仍然是合适的。我们提出了PhysMent,一个基于这三个原则构建的基准。模型被置于MuJoCo环境(Todorov et al., 2012 ([https://arxiv.org/html/2609.13152#bib.bib10](https://arxiv.org/html/2609.13152#bib.bib10)))中,并给予一个包含26个仿真工具的结构化API。每个场景(共105个)呈现一个任务,例如从滚动行为中识别空心球体,或计算动摩擦系数——两者都无法仅通过应用公式来解决。 #### 贡献。 - • 据我们所知,PhysMent是第一个通过与3D刚体模拟器的持续多轮实验对话来评估LLM的基准,这与单次神谕调用(Mind’s Eye)或非LLM的拼图解决智能体(PHYRE)形成对比。 - • 我们设计了105个场景,涵盖13个难度-模态类别,覆盖本科经典力学的核心主题。 - • 我们定义了一个六维评分框架,超越了二元准确性,以诊断实验策略的质量。 - • 我们在前沿模型和多种提示策略上建立了基准结果,揭示了定量和多步物理推理中的系统性失败模式。 ## 2 相关工作 我们将PhysMent置于四条研究脉络中,每条都与我们贡献的一个方面相关:物理/科学推理基准(衡量什么)、智能体工具使用(模型如何行动)、LLM模拟器耦合(物理如何被具体化)以及具身AI(先前的交互式评估存在于何处)。PhysMent的独特之处在于将所有四个评估方向组合到一个单一的基准套件中。PhysMent与代表性基准的完整比较可在附录A ([https://arxiv.org/html/2609.13152#A1](https://arxiv.org/html/2609.13152#A1))的表4 ([https://arxiv.org/html/2609.13152#A1.T4](https://arxiv.org/html/2609.13152#A1.T4))中找到。 ### 2.1 物理与科学推理基准 #### 静态文本基准。 PIQA(Bisk et al., 2020 ([https://arxiv.org/html/2609.13152#bib.bib4](https://arxiv.org/html/2609.13152#bib.bib4)))使用约2万个二选一问题测试物理常识;每个问题都是自包含的,不需要交互。ScienceQA(Lu et al., 2022 ([https://arxiv.org/html/2609.13152#bib.bib5](https://arxiv.org/html/2609.13152#bib.bib5)))和ARC(Clark et al., 2018 ([https://arxiv.org/html/2609.13152#bib.bib6](https://arxiv.org/html/2609.13152#bib.bib6)))涵盖从小学到高中的科学,采用多项选择题形式。GPQA(Rein et al., 2024 ([https://arxiv.org/html/2609.13152#bib.bib2](https://arxiv.org/html/2609.13152#bib.bib2)))将难度提升至由专家编写的、研究生水平的物理、生物和化学问题,这些问题难以通过查阅资料作弊,但仍然呈现需要无需实验干预的完全指定问题。MATH(Hendrycks et al., 2021b ([https://arxiv.org/html/2609.13152#bib.bib3](https://arxiv.org/html/2609.13152#bib.bib3)))和MMLU(Hendrycks et al., 2021a ([https://arxiv.org/html/2609.13152#bib.bib1](https://arxiv.org/html/2609.13152#bib.bib1)))分别评估竞赛数学和广泛的多任务科学知识。最近一波特定于物理的基准测试正在使该范式更加精细化。PhysReason(Zhang et al., 2025a ([https://arxiv.org/html/2609.13152#bib.bib44](https://arxiv.org/html/2609.13152#bib.bib44)))在物理定理应用、过程理解、计算和条件分析方面引入了步骤级评估;PHYBench(Qiu et al., 2025 ([https://arxiv.org/html/2609.13152#bib.bib45](https://arxiv.org/html/2609.13152#bib.bib45)))整理了500个问题,并提出了分级表达式编辑距离分数来代替二元正确性;而UGPhysics(Xu et al., 2025 ([https://arxiv.org/html/2609.13152#bib.bib46](https://arxiv.org/html/2609.13152#bib.bib46)))和ABench-Physics(Zhang et al., 2025b ([https://arxiv.org/html/2609.13152#bib.bib47](https://arxiv.org/html/2609.13152#bib.bib47)))则针对抗污染的本科物理学。所有这些都是静态的:呈现一个完全指定的问题,模型必须推导出答案。这些基准测试没有一个测试*设计*测量或从*观察到的*实验结果进行推理的能力。 #### 基于视觉的物理理解。 PhysBench(Chow et al., 2025 ([https://arxiv.org/html/2609.13152#bib.bib11](https://arxiv.org/html/2609.13152#bib.bib11)))使用超过1万个基于视频和图像的条目评估视觉语言模型在物理世界理解方面的能力,发现在75个VLM中存在显著差距。它评估对预先录制事件的*感知*,而非与实时模拟器的主动交互。IntPhys(Riochet et al., 2020 ([https://arxiv.org/html/2609.13152#bib.bib8](https://arxiv.org/html/2609.13152#bib.bib8)))使用发展心理学中的预期违反范式来测试从渲染视频中获得的直觉物理;CoPhy(Baradel et al., 2020 ([https://arxiv.org/html/2609.13152#bib.bib12](https://arxiv.org/html/2609.13152#bib.bib12)))针对从视觉输入进行物理动力学的反事实预测。两者都评估对预先录制物理的被动预测——它们不允许智能体干预、修改或查询实时模拟。 #### 交互式物理环境。 PHYRE(Bakhtin et al., 2019 ([https://arxiv.org/html/2609.13152#bib.bib7](https://arxiv.org/html/2609.13152#bib.bib7)))是一个二维经典力学拼图基准,其中一个学习到的智能体放置物体以满足目标。虽然具有交互性,但它使用了简化的二维物理,不评估LLM,也不需要关于物理量的语言介导推理。ScienceWorld(Wang et al., 2022 ([https://arxiv.org/html/2609.13152#bib.bib13](https://arxiv.org/html/2609.13152#bib.bib13)))在基于文本的交互环境中测试智能体在小学科学任务上的表现,但使用基于规则的文本模拟器而非物理引擎。 #### Mind’s Eye 和 UTOPIA。 Mind’s Eye(Liu et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib9](https://arxiv.org/html/2609.13152#bib.bib9)))是最相关的先前工作。它通过从文本生成仿真代码、在MuJoCo中执行并将输出作为额外上下文反馈回来,将LLM推理建立在物理基础上。它引入了UTOPIA,一个跨6个物理场景(运动、摩擦、自由落体、水平抛体、弹性碰撞和斜面)的39个子任务基准,其中每个子任务是一个固定的观察/查询概念对。如第1节([https://arxiv.org/html/2609.13152#S1](https://arxiv.org/html/2609.13152#S1))所确立的,PhysMent在根本方面与Mind’s Eye不同:Mind’s Eye将模拟器*一次性*作为神谕来检索事实,而PhysMent需要一个持续的多轮协议,其中干预措施是自适应选择的。一次性神谕没有迭代预算、探索效率或跨轮次验证的概念。在PhysMent中,我们涵盖了UTOPIA的物理范围,同时增加了2.7倍的场景数量,UTOPIA中没有的物体创建和隐藏物体模态,以及更广泛的26工具交互API(与代码生成相对)。 ### 2.2 智能体LLM与工具增强推理 PhysMent将工具增强推理置于物理仿真循环中,其中工具具有物理基础的语义,答案根据MuJoCo模拟器的内部状态进行验证。先前关于工具增强语言模型的研究表明,将推理、规划和外部工具使用交织可以显著提高交互式问题解决能力。ReAct(Yao et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib14](https://arxiv.org/html/2609.13152#bib.bib14)))将语言推理跟踪与具体的工具操作交织,在ALFWorld(Shridhar et al., 2021 ([https://arxiv.org/html/2609.13152#bib.bib15](https://arxiv.org/html/2609.13152#bib.bib15)))等交互式基准测试上大幅优于思维链和模仿基线。Toolformer(Schick et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib16](https://arxiv.org/html/2609.13152#bib.bib16)))教会语言模型自我监督API调用生成,实现了对计算器、搜索引擎和日历的零样本使用。HuggingGPT(Shen et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib17](https://arxiv.org/html/2609.13152#bib.bib17)))证明了一个大型LLM可以通过规划-选择-执行流水线来编排专家模型。DEPS(Wang et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib18](https://arxiv.org/html/2609.13152#bib.bib18)))使用结构化描述和自我解释在Minecraft中进行零样本多任务规划;Voyager(Wang et al., 2024 ([https://arxiv.org/html/2609.13152#bib.bib19](https://arxiv.org/html/2609.13152#bib.bib19)))将其扩展到终身技能获取。PAL(Gao et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib20](https://arxiv.org/html/2609.13152#bib.bib20)))通过程序辅助推理链将计算卸载到Python解释器。Chameleon(Lu et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib21](https://arxiv.org/html/2609.13152#bib.bib21)))在LLM编排下组合异构工具。思维链提示(Wei et al., 2022 ([https://arxiv.org/html/2609.13152#bib.bib22](https://arxiv.org/html/2609.13152#bib.bib22)))提供了通过示例演示引出多步推理的基础技术。PhysMent继承了这些方法的交替推理-行动循环,但将工具空间限制为物理基础操作,其输出由模拟器而非检索到的文本决定。因此,PhysMent中的工具反馈具有可验证的物理语义。 ### 2.3 LLM与物理模拟器耦合 Code as Policies(Liang et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib23](https://arxiv.org/html/2609.13152#bib.bib23)))和ProgPrompt(Singh et al., 2022 ([https://arxiv.org/html/2609.13152#bib.bib24](https://arxiv.org/html/2609.13152#bib.bib24)))表明LLM可以生成可执行的机器人任务计划,与物理API接口。Inner Monologue(Huang et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib25](https://arxiv.org/html/2609.13152#bib.bib25)))通过用自然语言环境反馈闭合推理循环,提高了长期机器人任务完成率。Language to Rewards(Yu et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib26](https://arxiv.org/html/2609.13152#bib.bib26)))将GPT-4与MuJoCo MPC耦合以合成机器人技能;Eureka(Ma et al., 2024 ([https://arxiv.org/html/2609.13152#bib.bib27](https://arxiv.org/html/2609.13152#bib.bib27)))使用进化奖励代码优化与Isaac Gym,在83%的任务上超越了专家设计的奖励。RT-2(Zitkovich et al., 2023 ([https://arxiv.org/html/2609.13152#bib.bib28](https://arxiv.org/html/2609.13152#bib.bib28)))在机器人轨迹数据上共同微调视觉语言模型以实现涌现的物理控制。SayCan(Brian Ichtler et al., 2022 ([https://arxiv.org/html/2609.13152#bib.bib29](https://arxiv.org/html/2609.13152#bib.bib29)))将LLM输出与机器人可供性函数结合,用于长期任务执行。这些系统将LLM与物理引擎集成以实现*机器人控制*。PhysMent通过将模拟器视为测量工具、将其用作可靠的真实来源来重新利用LLM。重点不在于控制任何东西,而在于观察LLM在与26工具API交互时多步骤的行为。 ### 2.4 具身AI基准 EmbodiedQA(Das et al., 2018 ([https://arxiv.org/html/2609.13152#bib.bib30](https://arxiv.org/html/2609.13152#bib.bib30)))要求在3D环境中导航和回答问题。ALFRED(Shridhar et al., 2020 ([https://arxiv.org/html/2609.13152#bib.bib31](https://arxiv.org/html/2609.13152#bib.bib31)))评估在家庭任务执行中的语言基础。ALFWorld(Shridhar et al., 2021 ([https://arxiv.org/html/2609.13152#bib.bib15](https://arxiv.org/html/2609.13152#bib.bib15)))对齐基于文本和视觉具身环境以研究策略迁移。Habitat(Savva et al., 2019 ([https://arxiv.org/html/2609.13152#bib.bib32](https://arxiv.org/html/2609.13152#bib.bib32)))和AI2-THOR(Kolve et al., 2022 ([https://arxiv.org/html/2609.13152#bib.bib33](https://arxiv.org/html/2609.13152#bib.bib33)))提供高保真3D平台,用于视觉导航和操作。BEHAVIOR(Srivastava et al., 2021 ([https://arxiv.org/html/2609.13152#bib.bib34](https://arxiv.org/html/2609.13152#bib.bib34)))涵盖100项具有丰富物理状态变化的家庭活动;MineDojo(Fan et al., 2022 ([https://arxiv.org/html/2609.13152#bib.bib35](https://arxiv.org/html/2609.13152#bib.bib35)))基于互联网规模的Minecraft知识构建了一个开放式的智能体框架。这些基准针对通用具身行动,不提供对PhysMent核心的力、动量、力矩、能量等底层物理量的访问。 ## 3 方法 ### 3.1 动机 评估LLM中物理推理的现有基准主要依赖于基于文本的问题回答,所有相关信息都在提示中提供。虽然此类评估衡量了模型回忆和应用物理
相似文章
面向LLM推理的科学逻辑性增强方法:以物理学为例
本文介绍了一种增强LLM推理中科学逻辑性的方法论,包括评估标准与数据采样方法,并通过多款基座LLM在物理问题上的实验验证了其有效性。
BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动态基准测试
BilliardPhys-Bench 是一个新的基准测试,通过合成台球场景来评估多模态大语言模型的物理推理能力,要求预测碰撞和最终球的位置。论文发现,当前模型在较长的模拟中表现不佳,并表现出一种“静态偏差”——在不确定时预测无交互。
测试前沿大语言模型在平行物理世界中的物理素养
本文介绍了一种四阶段诊断法,用于测试大语言模型能否在不熟悉的物理框架中进行推理。研究发现,前沿模型的通过率较低,并表现出定性分析与定量分析之间的不对称性。
模拟、推理、决策:基于LLM的科学推理驱动仿真决策
密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。
PRL-Bench:评估大语言模型在尖端物理研究中能力的全面基准
PRL-Bench是一个全面基准,用于评估大语言模型在尖端物理研究中的能力,基于从五个物理子领域精选的100篇《物理评论快报》论文构建。该基准揭示了当前大语言模型性能的重大差距(最佳得分低于50%),旨在测试端到端研究流程、复杂推理和自主探索。