RigidFormer:利用 Transformer 学习刚体动力学

Hugging Face Daily Papers 论文

摘要

RigidFormer 是一种新型的无网格、以对象为中心的 Transformer 模型,能够从点云中学习刚体动力学。在多对象接触动力学方面,其在速度和可扩展性上优于基于网格的基线模型。

基于学习的多对象刚体动力学模拟仍然具有挑战性,因为接触过程是不连续的,且误差会在长时间范围内累积。现有的大多数方法仍然依赖于网格连通性和顶点级消息传递,这限制了它们在点云等无网格输入上的适用性,并导致高昂的计算成本。因此,高效地从无网格表示中对高保真刚体动力学进行建模仍然是一项挑战。我们提出了 RigidFormer,这是一种以对象为中心的基于 Transformer 的模型,能够学习具有可控积分步长的无网格刚体动力学。RigidFormer 在对象级别进行推理,并通过紧凑的锚点推进每个对象;锚点-顶点池化(Anchor-Vertex Pooling)利用局部顶点特征丰富这些锚点,在保留与接触相关的几何信息的同时,避免了密集的顶点级交互。我们提出了基于锚点的旋转位置编码(Anchor-based RoPE),在注意力的计算中注入锚点几何信息,同时尊重对象和锚点的无序特性:对象令牌的处理是置换等变的,而平均池化的锚点描述符在保持形状范围的同时对锚点重新索引具有不变性。此外,RigidFormer 通过可微 Kabsch 对齐将更新投影到刚体流形上,从而强制执行刚体约束。在标准基准测试中,RigidFormer 在使用点输入时优于或持平于基于网格的基线模型,运行速度更快,能够泛化到未见过的点云分辨率和不同数据集,并可扩展至 200 多个对象;我们还展示了将其初步扩展至命令条件化铰链刚体,通过将身体部位视为相互作用的对象级组件来实现。
查看原文
查看缓存全文

缓存时间: 2026/05/12 02:49

论文页面 - RigidFormer:使用 Transformer 学习刚体动力学

来源:https://huggingface.co/papers/2605.09196 RigidFormer:使用 Transformer 学习刚体动力学 - 我们尝试利用 Transformer 来扩展基于学习的物理动力学模拟。

RigidFormer 使用 Transformer 学习刚体动力学。它是一种无网格、以物体为中心的 Transformer,能够从点云中模拟多物体刚体接触动力学。

完全依靠神经模拟器而非传统物理引擎来学习物理规律,是一个重要且被广泛研究的问题。之前的最先进(SOTA)方法通常使用图神经网络来提升准确性和泛化能力,但在大规模高效、高保真模拟方面仍面临挑战。

RigidFormer 仅使用点云作为输入,在标准基准测试中表现媲美甚至超越基于网格的基线方法,运行速度更快,能够跨不同点云分辨率和数据集泛化,并且可扩展至 200 多个物体。我们还展示了一个初步扩展,通过将身体部位视为相互作用的物体级组件,实现对受指令控制的人体/关节体的模拟。

RigidFormer 是无网格的:它不需要网格连接性、符号距离场(SDFs)或顶点级别的消息传递,因此非常适合点云观测和可扩展模拟。

该架构还可以通过替换刚体模块(可微 Kabsch 对齐)来调整,以学习软体动力学。

相似文章

PhysiFormer: 在世界空间中学习模拟力学

Hugging Face Daily Papers

PhysiFormer 使用坐标空间扩散生成物理上合理的3D物体运动,无需显式归纳偏置,实现了高效的多物体推理以及对复杂材料和几何形状的泛化。

TrackCraft3R: 改造视频扩散变换器用于密集3D追踪

Hugging Face Daily Papers

TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。

Lite3R:一种高效的模型无关前馈3D重建框架

Hugging Face Daily Papers

Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。

NeuROK: 生成式4D神经物体运动学

Hugging Face Daily Papers

本文介绍了NeuROK,一种数据驱动的生成式4D神经物体运动学方法,该方法学习潜在空间和基于变换器的编码器-解码器,以模拟静态物体在各种物理条件下的真实时间变形,克服了预定义物理模型的局限性。