BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动态基准测试
摘要
BilliardPhys-Bench 是一个新的基准测试,通过合成台球场景来评估多模态大语言模型的物理推理能力,要求预测碰撞和最终球的位置。论文发现,当前模型在较长的模拟中表现不佳,并表现出一种“静态偏差”——在不确定时预测无交互。
arXiv:2605.30900v1 公告类型: 新
摘要:当前的多模态模型在静态图像识别方面表现良好,但直觉物理推理仍然是一个弱点。从单张图像预测物体的运动和相互作用对这些系统来说仍然困难。我们提出了 BilliardPhys-Bench,这是一个用于合成台球环境中的物理推理的基准测试。其程序化引擎生成带有摩擦和弹性碰撞的随机场景。该基准测试评估三种能力:(1) 预测球与球之间的碰撞,(2) 推理墙壁反弹,(3) 估计运动停止后球的最终位置。我们评估了来自 GPT、Claude、Gemini 和 Qwen 系列的最新多模态大语言模型(MLLMs)。随着模拟时间的增加和场景几何变得更加复杂,性能会下降。我们还观察到一个一致的失败模式,我们称之为“静态偏差”:当正确的物理结果更难推断时,模型倾向于预测无交互。这些发现揭示了当前多模态大语言模型在视觉动力学方面的不足,并指出了在多模态架构中引入更好的物理归纳偏置的必要性。
查看缓存全文
缓存时间: 2026/06/01 09:25
# BilliardPhys-Bench:多模态大语言模型物理推理与视觉动态基准测试
来源:https://arxiv.org/html/2605.30900
Ben Wang\*
阿里巴巴集团
北京,中国
yuanjian\.wb@alibaba\-inc\.com
&Xiaogang Li\*
阿里巴巴集团
北京,中国
lixiaogang\.lxg@alibaba\-inc\.com
&Ruochen Gao
阿里巴巴集团
北京,中国
gaoruochen\.grc@alibaba\-inc\.com
Peiyao Xiao
阿里巴巴集团
北京,中国
xiaopeiyao\.xpy@alibaba\-inc\.com
&Chengliang Xu
阿里巴巴集团
北京,中国
xiaodu\.xcl@alibaba\-inc\.com
&Zeyu Wang
阿里巴巴集团
北京,中国
chenfan\.wzy@alibaba\-inc\.com
Zichao Chen
阿里巴巴集团
北京,中国
chenzichao\.czc@alibaba\-inc\.com
&Bing Zhao†
阿里巴巴集团
北京,中国
xiongdao@alibaba\-inc\.com
&Hu Wei†
阿里巴巴集团
北京,中国
kongwang@alibaba\-inc\.com
###### 摘要
当前多模态模型在静态图像识别方面表现出色,但在直观的物理推理上仍然存在弱点。从单张图像预测物体如何移动和交互,对这些系统而言依然困难。我们提出了 BilliardPhys-Bench,一个基于合成台球环境的物理推理基准测试。其过程生成引擎可生成包含摩擦和弹性碰撞的随机场景。该基准测试评估三种能力:(1) 预测球与球之间的碰撞,(2) 推理关于墙壁反弹,(3) 估计运动停止后球的最终位置。我们评估了来自 GPT、Claude、Gemini 和 Qwen 系列的最新多模态大语言模型。随着模拟时间增加和场景几何复杂度提升,模型性能下降。我们还观察到一个一致的失败模式,我们称之为“静止偏差”:当正确的物理结果较难推断时,模型倾向于预测没有交互。这些发现揭示了当前多模态大语言模型在视觉动态推理上的短板,并指明了在多模态架构中加入更强物理归纳偏置的必要性。
BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs
Ben Wang\*
Alibaba Group
Beijing, China
yuanjian\.wb@alibaba\-inc\.com
Xiaogang Li\*
Alibaba Group
Beijing, China
lixiaogang\.lxg@alibaba\-inc\.com
Ruochen Gao
Alibaba Group
Beijing, China
gaoruochen\.grc@alibaba\-inc\.com
Peiyao Xiao
Alibaba Group
Beijing, China
xiaopeiyao\.xpy@alibaba\-inc\.com
Chengliang Xu
Alibaba Group
Beijing, China
xiaodu\.xcl@alibaba\-inc\.com
Zeyu Wang
Alibaba Group
Beijing, China
chenfan\.wzy@alibaba\-inc\.com
Zichao Chen
Alibaba Group
Beijing, China
chenzichao\.czc@alibaba\-inc\.com
Bing Zhao†
Alibaba Group
Beijing, China
xiongdao@alibaba\-inc\.com
Hu Wei†
Alibaba Group
Beijing, China
kongwang@alibaba\-inc\.com
## 1 引言
对物理世界进行推理是通用人工智能的前提条件(NVIDIA et al. (2025);Wu et al. (2024);Upadhyay et al. (2026);Zhao et al. (2026);Zhou et al. (2026))。人类能轻松做到这一点:从一张台球桌的单张图像,大多数人都能预期可能的轨迹、碰撞和结果。然而,当前的多模态大语言模型仍然难以从二维图像中准确推断物理演化(Yao et al. (2024);Ye et al. (2024);Zhang et al. (2026a, b))。台球非常适合作为评估任务,因为它需要对碰撞角度进行几何估计、多物体跟踪以及基于动力学的因果推理(Zhao et al. (2015);Kiefl (2024);Alberico et al. (2025))。与主要测试语义识别能力的标准视觉问答不同,台球预测对初始条件敏感:感知到的位置或速度的微小误差会被放大,导致截然不同的结果(Wang et al. (2025);Xu et al. (2025b, a);Yu et al. (2026);Mak et al. (2026))。这种敏感性使得台球成为测试预测性物理推理(而非描述性场景理解)的试金石(Yuan et al. (2025);Jiang et al. (2025);Liu et al. (2025))。
现有的物理推理基准测试分为三类。静态问答基准测试通过文本或图像查询测试物理定律的知识(Wang et al. (2025);Shen et al. (2025);Xiang et al. (2025);Chung et al. (2025);Zhu et al. (2025);Ye et al. (2025);LSST Dark Energy Science Collaboration et al. (2026))——这些测试测量的是陈述性知识,但不需要对演化环境进行推理。符号或基于代码的基准测试通过抽象接口呈现物理现象,减少了对感知基础的需求(Bakhtin et al. (2019);Matthews et al. (2025);Cherian et al. (2024);Li et al. (2025);Zhang et al. (2025))。视觉交互基准测试将 VLM 作为智能体进行评估,通过试错进行规划与适应(Li et al. (2025);Zhang et al. (2025))。而单帧前向模拟——从静态初始状态预测未来状态,无需迭代交互——则研究较少。这一差距反映了感知与推理之间的分离。模型可能正确描述场景或陈述物理规则,却无法产生准确的预测(Xu et al. (2025c);Lee et al. (2025);Puyin et al. (2025);Lin et al. (2025))。在台球领域,这表现为静止偏差以及在连续碰撞上的失败。此前关于球轨迹预测的工作主要使用视频中的逐帧跟踪(Yu (2025);Kienzle et al. (2025);Gomez-Gonzalez et al. (2020);Chiang et al. (2024)),而非基于静态状态的预测。
我们提出的 BilliardPhys-Bench 有三方面贡献:(1) 一个程序化生成的多层次基准测试。我们的引擎创建随机台球场景,每个场景提供高分辨率初始状态图像以及物理引擎的计算真值。基准测试将问题分解为三个层次:(a) 离散碰撞预测(母球是否会碰撞,以及和哪个物体碰撞?),(b) 连续最终状态估计(能量耗散后所有球的精确坐标),(c) 复杂交互链(对二次和三次碰撞进行推理)。(2) 一个用于分析物理推理失败的诊断框架。我们评估了领先的专有和开源多模态大语言模型,并分析了失败模式——静止偏差、对动量传递的误解、对视觉细节的敏感性——从而深入理解为什么当前架构在视觉动态推理上失败。(3) 为更强物理归纳偏置指出的方向。我们的结果展示了下一词预测在物理模拟上的局限性,并概述了通过混合神经物理方法(Achterhold et al. (2023))、因子图或可微分物理引擎等途径的发展方向。通过将评估从交互式行动转向一次性预测,我们的基准测试检验了多模态大语言模型是否能够维持一个内在的物理模型。
## 2 数据生成
参照图注
图 1:BilliardPhys-Bench 数据生成流水线。该流水线包含三个阶段:(1) 初始条件采样,随机确定球的位置和母球速度;(2) 物理模拟,用高保真引擎计算弹性碰撞和基于摩擦的减速,同时导出结构化标注;(3) 可视化与统计,生成渲染图像和数据集分布报告。
### 2.1 恒定摩擦的物理建模
为了描述台球在恒定摩擦力下的运动,我们考虑一个质量为 \(m\) 的球在水平表面上运动,摩擦系数为 \(\mu\)。与运动方向相反作用的动摩擦力 \(f\) 为:
\[
f = \mu N = \mu mg \tag{1}
\]
其中 \(N\) 是法向力,\(g\) 是重力加速度。根据牛顿第二定律 (\(F=ma\)),恒定减速度 \(a\) 为:
\[
a = \frac{-f}{m} = \frac{-\mu mg}{m} = -\mu g \tag{2}
\]
对于匀减速直线运动,最终速度 \(v\)、初始速度 \(v_0\)、加速度 \(a\) 和位移 \(s\) 之间的关系为:
\[
v^2 - v_0^2 = 2as \tag{3}
\]
将 \(a = -\mu g\) 代入,得到速度关于位移的函数:
\[
v^2 = v_0^2 - 2\mu gs, \qquad v(s) = \sqrt{v_0^2 - 2\mu gs} \tag{4}
\]
在此恒定摩擦模型下,球的速度随移动距离非线性减小(公式 (4))。
### 2.2 数据集生成
数据集采用自定义生成器合成。每个示例通过三个阶段创建:初始条件采样、物理模拟与标注导出、可视化(见图 1)。
首先,对初始场景进行采样并保存为 `init.json`:母球(ID=0)的速度(方向和大小)以及所有其他球的位置根据配置的范围和随机种子随机采样。摩擦建模为速度随路径长度成比例减小(公式 (4)),因此球在移动以下距离后停止:
\[
s_{\text{stop}} = \frac{v_0^2}{2\mu g}. \tag{5}
\]
这里 \(g = 9.8 \, \mathrm{m/s^2}\),\(\mu = 0.002\)。我们选择这个摩擦系数,使得在我们给定的初始速度区间内,大约 50% 的生成场景中会发生碰撞。所有碰撞(球-球和球-墙)都是完全弹性的。如果球在模拟过程中落袋,其最终位置记录为 `null`。
参照图注
参照图注
图 2:所生成基准测试样本的分布。上方的直方图显示了从 1 秒到 5 秒模拟窗口下母球初始速度的采样情况。下方的柱状图展示了每个时间窗口下 200 个采样场景中碰撞和无碰撞案例的数量。
其次,模拟器推进到目标时间 \(t \in \{1,2,3,4,5\}\,\text{s}\),并写入 `_final.json`,包含:
- **任务 1(Q1)**:每个球的碰撞标签保存为一个对象列表,格式为 `{"id": i, "answer": "T" | "F"}`,每个非母球对应一个条目。
- **任务 2(Q2)**:每个墙壁的碰撞答案存储为一个答案列表(例如 `{"wall": "TOP", "answer": "T" | "F"}`),表示是否发生碰撞。
- **任务 3(预测)**:最终位置保存在 `predictions` 键下,格式为 `{"id": , "pos": [x, y]}` 的列表;落袋球的 `pos = null`。数值坐标最多保留四位小数。
参照图注
图 3:提示工程与任务定义的说明。评估流水线向模型提供一个“通用提示”,描述物理常数(摩擦、弹性)和输入图像。三个诊断任务——碰撞检测(任务 1)、墙壁交互(任务 2)和坐标预测(任务 3)——要求模型返回结构化的 JSON 输出以供自动评分。此示例为 3s 场景。
第三,生成器产生可视化输出:初始和最终场景图像、与帧渲染器使用相同画布尺寸和球半径绘制的轨迹叠加图,以及采样的母球初始速度直方图(图 2)。场景的所有文件按照场景索引命名约定存储,便于自动评估和可重复性。
### 2.3 模型输入输出与评估流水线
流水线(图 3)构建一个结构化提示(可选包含场景图像),提交给聊天式 LLM API,提取 JSON,并根据真值判断正确性。
#### 发送给模型的输入
- **图像**:场景图像,显示球的位置、ID 和母球速度箭头(图 4),坐标轴 \(x \in [0,2], y \in [0,1]\)。
- **提示**:说明摩擦(\(v(s) = \sqrt{v_0^2 - 2\mu gs}\),\(\mu = 0.002\),\(g = 9.8\)),停止距离(\(s_{\text{stop}} = v_0^2 / (2\mu g)\)),三个任务的定义以及 JSON 输出格式。三个任务为:
1. 任务 1(Q1):对每个非母球,预测母球是否会与其碰撞。
2. 任务 2(Q2):对每面墙,预测母球是否会与其碰撞。
3. 任务 3(Q3):预测每个球在目标时刻的二维位置,格式为 `{"id": , "pos": [x, y]}`;落袋球的 `pos = null`。
参照图注
参照图注
参照图注
图 4:来自台球推理基准测试的示例。(上)输入图像,显示初始球位置和母球速度向量。(中)真值轨迹叠加,显示墙壁反射和球-球碰撞。(下)目标预测时刻的棋盘状态。
#### API 调用策略
实现中对任务 1、任务 2 和任务 3 分别调用模型,以减少输出格式的不确定性,并允许为每个任务定制验证规则。所有调用均使用配置好的聊天完成端点,消息格式为 JSON。对于 Q1/Q2 启用思维链,对于 Q3 禁用思维链,因为自由形式的推理会干扰所需的 JSON 输出。运行时参数包括 `--max-tokens`、`--timeout` 和 `--enable-cot`。
#### 验证与重试
每次回复后,客户端通过定位第一个平衡的 `{...}` 子字符串来提取 JSON。失败或截断的响应会触发重试,并采用升级策略(新会话或增加超时时间)。
- **任务 1/2**:对照预期模式解析;如果格式错误或不完整则重复。
- **任务 3**:必须包含 `predictions` 列表,覆盖 ID 0–6,至少有一个非空的数值坐标,并进行范围检查。当启用 `force_numeric` 时,提示要求数值估计而非 `null`。成功的输出保存为三个 JSON 文件,每个任务一个。
#### 正确性判断
一个独立的评估工具根据真值判断预测:
- **Q1(碰撞)**:针对每个球比较 T/F 与真值标签。
- **Q2(墙壁)**:仅当预测的墙壁集合与真值完全匹配时才算正确。
- **Q3(位置)**:如果欧几里得距离 ≤ 球半径,则认为正确;两者均为 `null` 也算正确。
#### 实践说明
提示要求仅输出 JSON,不带其他文本。我们观察到,某些模型(如 Qwen-VL-相似文章
PhysMent:一种用于LLM物理问题推理的交互式方法
PhysMent引入了一个交互式基准测试,通过与MuJoCo物理模拟器的迭代工具介导实验来评估LLM的物理推理能力,揭示了模型在多步骤程序任务中的弱点。
ChaosBench-Logic v2:大规模评估LLM在动态系统上的逻辑推理能力
ChaosBench-Logic v2是一个包含165个动态系统共40,886个问题的大规模基准测试,用于评估LLM的逻辑推理能力,结果显示即使在最前沿的模型中,在状态转变推理上也接近随机表现,并存在系统性失败模式。
通过宽基线匹配激发MLLMs中的复杂空间推理
本文介绍了ReasonMatch-Bench,一个用于多模态大语言模型中宽基线匹配的基准,并提出了动态对应强化学习(DCRL)以提升空间推理能力。实验表明,该方法在基准测试上取得了显著提升,同时保持了通用性能。
P3D-Bench:参数化3D生成与结构推理的多模态大语言模型基准测试
本文提出P3D-Bench,一个用于评估多模态大语言模型在参数化3D生成任务上的基准测试,涵盖文本到3D、图像到3D和组装到3D,并采用几何精度、语义对齐和部件级结构等指标。
对概率算子进行逻辑推理的LLM能力基准测试
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。