Apple-π:基于视频的思维基准测试,迈向遵循物理法则的物理智能

Hugging Face Daily Papers 论文

摘要

Apple-π是一个基准测试,通过三阶段流程(感知、公式化、推导)评估视频生成模型推理物理定律的能力。它包含400个视频,涵盖经典力学任务,并揭示当前模型在可靠的基于物理法则的世界模拟方面存在不足。

现代视频生成模型越来越被视为具有内在物理定律理解能力的新兴世界模型。然而,现有基准测试主要仅在输出层面评估物理合理性,并未验证模型是否通过忠实且遵循物理法则的推理过程得出结果。我们提出了Apple-π,这是首个明确基于物理定律评估视频模型的基准测试。Apple-π包含三个组成部分:1) Orchard:一个包含400个视频的数据集,涵盖经典力学中的十个典型任务。它将单定律任务(用于无混杂因素诊断)与多定律任务(用于测试泛化能力)分开。2) 基准测试流程:基于科学推理的三阶段流程,包括感知(Perception)、公式化(Formulation)和推导(Deduction)。该流程在信息图标注的首帧上使用帧链提示,将生成的视频视为模型的可视化推理轨迹。3) 评估套件:一种混合评估套件,结合了基于多模态大语言模型的主观评分和基于物理定律的客观度量。这使得可以对模型是否失败以及失败环节进行分阶段诊断。对11个模型的基准测试表明,当前视频模型远非可靠的基于物理法则的世界模拟器,最佳视频模型得分仅为0.473。我们基于阶段、支柱和来源的分解分析进一步揭示了从感知到公式化再到推导的瓶颈、弱的多定律状态转移以及持续的模拟到现实差距。这些发现将Apple-π定位为引导未来视频模型向具有基于物理法则的物理智能的世界模型发展的诊断基础。
查看原文
查看缓存全文

缓存时间: 2026/07/21 10:36

论文页面 - Apple-π:基于视频的思考基准测试,迈向符合物理规律的世界智能

来源:https://huggingface.co/papers/2607.16401 发表于 7月17日

·

由 leoli (https://huggingface.co/lifuguan) 于 7月21日提交

论文作者:

摘要

现代视频生成模型日益被视为具备内在物理规律把握能力的新兴世界模型。然而,现有基准测试大多仅在输出层面评估物理合理性,并未验证模型是否通过忠实且符合物理规律的推理过程得出结果。我们提出 Apple-PI,这是首个明确将视频模型评估锚定于物理规律的基准测试。Apple-PI 包含三个部分:1) Orchard:包含 400 个视频的数据集,覆盖经典力学中的十项经典任务。它将单定律任务(用于无混杂因素的诊断)与多定律任务(用于探究泛化能力)分开。2) Benchmark Protocol:基于科学推理的三阶段协议,包括感知、公式化和演绎。它利用附有信息图解的首帧进行链式帧提示,将生成的视频视为模型的可视化推理轨迹。3) Evaluation Suite:一套混合评估套件,结合基于多模态大语言模型的主观评分与基于物理规律的客观度量。这能够实现分阶段诊断——不仅判断模型是否失败,还能定位其失败环节。对 11 个模型的基准测试表明,当前视频模型远未成为可靠的符合物理规律的世界模拟器,最佳视频模型的得分仅为 0.473。我们进一步进行的阶段、支柱和来源分解分析揭示了从感知到公式化再到演绎的瓶颈、多定律状态转移的薄弱以及持续存在的模拟-现实差距。这些发现使 Apple-PI 成为引导未来视频模型迈向具备符合物理规律世界智能的世界模型的诊断基础。

查看 arXiv 页面 (https://arxiv.org/abs/2607.16401)查看 PDF (https://arxiv.org/pdf/2607.16401)项目页面 (https://21yrm.github.io/Apple-PI-homepage)GitHub10 (https://github.com/21yrm/Apple-PI)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16401)

在你的智能体中获取此论文:

hf papers read 2607.16401

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2607.16401 即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2607.16401 即可从此页面链接。

引用此论文的 Spaces1

包含此论文的收藏集0

没有包含此论文的收藏集

添加此论文到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Physics-IQ Verified

Hugging Face Daily Papers

本文对Physics-IQ基准进行了系统性审计,该基准用于评估视频生成模型对物理世界的理解,并提出了改进提示和评分的方法以增强可靠性。

PhysBrain 1.0 技术报告

Hugging Face Daily Papers

PhysBrain 1.0 是一份技术报告,提出了一种利用人类自我中心视频为视觉-语言-动作模型生成物理常识监督的方法,在ERQA、PhysBench、SimplerEnv-WidowX、LIBERO和RoboCasa等具身控制基准上取得了最先进的结果。