Apple-π:基于视频的思维基准测试,迈向遵循物理法则的物理智能
摘要
Apple-π是一个基准测试,通过三阶段流程(感知、公式化、推导)评估视频生成模型推理物理定律的能力。它包含400个视频,涵盖经典力学任务,并揭示当前模型在可靠的基于物理法则的世界模拟方面存在不足。
查看缓存全文
缓存时间: 2026/07/21 10:36
论文页面 - Apple-π:基于视频的思考基准测试,迈向符合物理规律的世界智能
来源:https://huggingface.co/papers/2607.16401 发表于 7月17日
·
由 leoli (https://huggingface.co/lifuguan) 于 7月21日提交
论文作者:
、
、
、
、
、
、
、
、
、
、
、
、
摘要
现代视频生成模型日益被视为具备内在物理规律把握能力的新兴世界模型。然而,现有基准测试大多仅在输出层面评估物理合理性,并未验证模型是否通过忠实且符合物理规律的推理过程得出结果。我们提出 Apple-PI,这是首个明确将视频模型评估锚定于物理规律的基准测试。Apple-PI 包含三个部分:1) Orchard:包含 400 个视频的数据集,覆盖经典力学中的十项经典任务。它将单定律任务(用于无混杂因素的诊断)与多定律任务(用于探究泛化能力)分开。2) Benchmark Protocol:基于科学推理的三阶段协议,包括感知、公式化和演绎。它利用附有信息图解的首帧进行链式帧提示,将生成的视频视为模型的可视化推理轨迹。3) Evaluation Suite:一套混合评估套件,结合基于多模态大语言模型的主观评分与基于物理规律的客观度量。这能够实现分阶段诊断——不仅判断模型是否失败,还能定位其失败环节。对 11 个模型的基准测试表明,当前视频模型远未成为可靠的符合物理规律的世界模拟器,最佳视频模型的得分仅为 0.473。我们进一步进行的阶段、支柱和来源分解分析揭示了从感知到公式化再到演绎的瓶颈、多定律状态转移的薄弱以及持续存在的模拟-现实差距。这些发现使 Apple-PI 成为引导未来视频模型迈向具备符合物理规律世界智能的世界模型的诊断基础。
查看 arXiv 页面 (https://arxiv.org/abs/2607.16401)查看 PDF (https://arxiv.org/pdf/2607.16401)项目页面 (https://21yrm.github.io/Apple-PI-homepage)GitHub10 (https://github.com/21yrm/Apple-PI)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16401)
在你的智能体中获取此论文:
hf papers read 2607.16401
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2607.16401 即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.16401 即可从此页面链接。
引用此论文的 Spaces1
包含此论文的收藏集0
没有包含此论文的收藏集
添加此论文到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
Physics-IQ Verified
本文对Physics-IQ基准进行了系统性审计,该基准用于评估视频生成模型对物理世界的理解,并提出了改进提示和评分的方法以增强可靠性。
PhysBrain 1.0 技术报告
PhysBrain 1.0 是一份技术报告,提出了一种利用人类自我中心视频为视觉-语言-动作模型生成物理常识监督的方法,在ERQA、PhysBench、SimplerEnv-WidowX、LIBERO和RoboCasa等具身控制基准上取得了最先进的结果。
Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准
提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。
从被动视频到可编辑体验:面向具身智能的物理接地体验合成
介绍Pegasus,一种低资源框架,利用基于图的任务表示、分层可供性潜在空间和闭环物理验证,将人类示范视频转换为机器人可执行数据,旨在将硬件数据收集转变为可规模化的知识迁移。
@rohanpaul_ai: 大多数视频模型看起来比它们理解得更好,而视频质量只是最容易注意到的方面。LongCat 刚刚……
LongCat 发布了 WBench,这是一个用于视频世界模型的基准测试,通过 289 个案例和 20 个模型,测试了控制、记忆、指令遵循和物理合理性,发现没有模型在所有维度上都表现出色,凸显了视频质量与真实世界模拟之间的差距。