PhysiFormer: 在世界空间中学习模拟力学
摘要
PhysiFormer 使用坐标空间扩散生成物理上合理的3D物体运动,无需显式归纳偏置,实现了高效的多物体推理以及对复杂材料和几何形状的泛化。
查看缓存全文
缓存时间: 2026/06/26 02:04
论文页面 - PhysiFormer:在世界空间中学习模拟力学
来源:https://huggingface.co/papers/2606.27364
摘要
PhysiFormer 使用坐标空间扩散生成物理上合理的 3D 物体运动,无需显式的归纳偏置,能够高效地进行多物体推理并泛化到复杂材料和几何形状。
我们提出 PhysiFormer,一种用于物理上合理的 3D 物体运动的扩散 Transformer。与在依赖视角的像素空间中运行的视频世界模型不同,PhysiFormer 将物体表示为在世界坐标中表达的 3D 网格。给定初始顶点位置和速度,以及物体材料类型(刚性或弹性),模型采样未来的顶点轨迹。虽然相关的神经物理学方法建立在特设的潜在空间上,或显式地强制刚性和因果性,但 PhysiFormer 表明,通过将顶点轨迹预测视为直接在世界坐标中的单一去噪扩散过程,可以在没有任何此类归纳偏置的情况下获得优异的结果。概率公式捕捉了所学动力学中的不确定性,从而能够从初始条件生成多样化的合理未来,这使得该框架可能对存在未观测不确定性的应用有用。该模型的特征在于注意力在时间、空间和物体上进行因子分解以提高效率,从而无需显式物体编码即可实现置换不变的多物体推理。PhysiFormer 在超过 10 万条模拟轨迹上进行训练,能够生成刚性和弹性力学,并泛化到混合材料设置、未见过的真实世界几何形状以及更多数量的物体。它在轨迹精度、刚性保持和基于动量的物理一致性方面显著优于自回归基线。我们的结果将坐标空间扩散定位为机器人、图形学和物理设计中视角不变、几何感知世界建模的一个有前景的步骤。可视化、代码和模型可在 https://yimingc9.github.io/physiformer 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2606.27364)查看 PDF (https://arxiv.org/pdf/2606.27364)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.27364)
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.27364 以从本页链接它。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.27364 以从本页链接它。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.27364 以从本页链接它。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
PhysisForcing:面向机器人操作的物理增强世界模拟器
PhysisForcing 是一种训练框架,通过基于 DiT 架构的像素级轨迹对齐和语义级关系对齐损失来强制物理一致性,从而增强机器人操作的具身视频生成,在基准测试上取得了显著改进。
PhyGenHOI: 物理感知的动态人-物交互4D生成
PhyGenHOI是一个新颖框架,通过将运动扩散模型与物质点方法模拟相结合,利用3D高斯表示生成物理精确的4D人-物交互。
PhysForge:为交互式虚拟世界生成具备物理基础的 3D 资产
PhysForge 是一个两阶段框架,能够生成具备物理基础和运动学参数的交互式 3D 资产,解决了虚拟世界中静态几何模型带来的瓶颈问题。
物理信息生成的自增强扩散指导
本文提出一种自增强扩散指导方法,将物理定律融入扩散模型,减少与真实动态的偏差,并实现更快的生成。
PAIWorld: 面向机器人操作的三维一致世界基础模型
PAIWorld 通过几何感知和跨视图注意力机制增强扩散变换器世界模型,提升机器人操作任务中的多视图三维一致性,在基准测试上达到最优结果。