PhiZero:一个围绕物理语言构建的世界模型

Hugging Face Daily Papers 论文

摘要

PhiZero是一个物理世界模型,它从视频中学习一种称为“物理语言”的紧凑离散表示,并在渲染未来视频之前用它来推理世界状态的转换,从而在生成和理解任务中提高物理一致性。

我们介绍了PhiZero,一个围绕物理语言构建的物理世界模型,物理语言是世界状态转换的一种紧凑离散表示。现有的物理世界模型通常直接在像素空间中预测未来视频,将潜在的世界动态隐含在高维视觉预测器中。受人类从视觉经验中抽象出预测结构并以自然语言组织进行显式推理的能力的启发,我们通过自监督从野外视频中学习物理语言,并使用它来显式推理物理世界如何演化。因此,PhiZero采用了“先推理后渲染”的范式:它首先将未来的世界演化推断为物理语言序列,然后将推断出的转换渲染成视频。在生成和理解基准上的大量实验验证了PhiZero建模物理一致的世界演化的能力。我们进一步展示了其在逼真交互式世界建模、细粒度动作条件模拟和零样本运动迁移方面的潜力。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - PhiZero:围绕物理语言构建的世界模型

来源:https://huggingface.co/papers/2607.28624

摘要

我们提出了 PhiZero,这是一个围绕物理语言构建的物理世界模型,物理语言是世界状态转换的紧凑离散表示。现有的物理世界模型通常直接在像素空间中预测未来视频,将底层世界动态隐含在高维视觉预测器中。受人类从视觉经验中抽象预测结构并以自然语言组织进行显式推理的能力的启发,我们通过自监督从野外视频中学习物理语言,并用它显式推理物理世界如何演化。因此,PhiZero 采用先推理后渲染的范式:首先将未来世界演化推断为物理语言序列,然后将推断出的转换渲染为视频。在生成和理解基准上的广泛实验验证了 PhiZero 建模物理一致世界演化的能力。我们进一步展示了其在真实交互式世界建模、细粒度动作条件模拟和零样本运动迁移方面的潜力。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28624)
查看 PDF (https://arxiv.org/pdf/2607.28624)
项目页面 (https://phi-zero.github.io/)
GitHub2 (https://github.com/yaoyao-jpg/PhiZero)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28624)

在您的 agent 中获取此论文:

hf papers read 2607\.28624

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28624 即可从此页面链接到该模型。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28624 即可从此页面链接到该数据集。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.28624 即可从此页面链接到该 Space。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接它。

相似文章

EgoPhys:从第一人称视频学习可变形物体的通用物理模型

Hugging Face Daily Papers

EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。

PhysiFormer: 在世界空间中学习模拟力学

Hugging Face Daily Papers

PhysiFormer 使用坐标空间扩散生成物理上合理的3D物体运动,无需显式归纳偏置,实现了高效的多物体推理以及对复杂材料和几何形状的泛化。

世界模型与物理AI教程

arXiv cs.AI

本教程提供了一个统一的框架,将多种世界建模方法整合在一起,用于物理AI,涵盖了显式世界模型和隐式世界模型及其在预测、推理和规划中的作用。

Qwen的具身世界建模 (28分钟阅读)

TLDR AI

Qwen-RobotWorld技术报告提出了一种统一的、语言条件化的视频世界模型,用于具身智能,能够从当前观测中预测未来视频,涵盖机器人、自动驾驶、导航等多个领域,并应用于合成数据生成、策略评估和规划。