PhysiFormer: 在世界空间中学习模拟力学

Hugging Face Daily Papers 论文

摘要

PhysiFormer 使用坐标空间扩散生成物理上合理的3D物体运动,无需显式归纳偏置,实现了高效的多物体推理以及对复杂材料和几何形状的泛化。

我们提出PhysiFormer,一个用于物理上合理的3D物体运动的扩散Transformer。与在视角相关的像素空间中操作的视频世界模型不同,PhysiFormer将物体表示为在世界坐标中表达的3D网格。给定初始顶点位置和速度以及物体材料类型(刚性或弹性),该模型采样未来的顶点轨迹。虽然相关的神经物理方法建立在特设的潜在空间上或明确强制刚性和因果性,但PhysiFormer表明,通过将顶点轨迹预测直接视为在世界坐标中的单一去噪扩散过程,无需任何此类归纳偏置即可获得优异的结果。概率公式捕捉了学习动力学中的不确定性,从而能够从初始条件生成多样化的合理未来,使得该框架可能适用于具有未观测不确定性的应用。该模型具有分解为时间、空间和物体的注意力机制,以提高效率,从而实现排列不变的多物体推理,无需显式物体编码。在超过10万条模拟轨迹上训练后,PhysiFormer生成刚性和弹性力学,并泛化到混合材料设置、未见过的真实世界几何形状以及更大的物体数量。它在轨迹精度、刚性保持和基于动量的物理一致性方面显著优于自回归基线。我们的结果表明,坐标空间扩散是朝着机器人、图形和物理设计的视角不变、几何感知的世界建模迈出的有希望的一步。可视化、代码和模型可在 https://yimingc9.github.io/physiformer 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/26 02:04

论文页面 - PhysiFormer:在世界空间中学习模拟力学

来源:https://huggingface.co/papers/2606.27364

摘要

PhysiFormer 使用坐标空间扩散生成物理上合理的 3D 物体运动,无需显式的归纳偏置,能够高效地进行多物体推理并泛化到复杂材料和几何形状。

我们提出 PhysiFormer,一种用于物理上合理的 3D 物体运动的扩散 Transformer。与在依赖视角的像素空间中运行的视频世界模型不同,PhysiFormer 将物体表示为在世界坐标中表达的 3D 网格。给定初始顶点位置和速度,以及物体材料类型(刚性或弹性),模型采样未来的顶点轨迹。虽然相关的神经物理学方法建立在特设的潜在空间上,或显式地强制刚性和因果性,但 PhysiFormer 表明,通过将顶点轨迹预测视为直接在世界坐标中的单一去噪扩散过程,可以在没有任何此类归纳偏置的情况下获得优异的结果。概率公式捕捉了所学动力学中的不确定性,从而能够从初始条件生成多样化的合理未来,这使得该框架可能对存在未观测不确定性的应用有用。该模型的特征在于注意力在时间、空间和物体上进行因子分解以提高效率,从而无需显式物体编码即可实现置换不变的多物体推理。PhysiFormer 在超过 10 万条模拟轨迹上进行训练,能够生成刚性和弹性力学,并泛化到混合材料设置、未见过的真实世界几何形状以及更多数量的物体。它在轨迹精度、刚性保持和基于动量的物理一致性方面显著优于自回归基线。我们的结果将坐标空间扩散定位为机器人、图形学和物理设计中视角不变、几何感知世界建模的一个有前景的步骤。可视化、代码和模型可在 https://yimingc9.github.io/physiformer 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2606.27364)查看 PDF (https://arxiv.org/pdf/2606.27364)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.27364)

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.27364 以从本页链接它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.27364 以从本页链接它。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2606.27364 以从本页链接它。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章