基于静止状态观察的铰接物体重建
摘要
本文介绍了一种静止状态框架,该框架从单个闭合配置中重建铰接物体,利用显式网格、视觉-语言输出和视频扩散模型来生成并验证关节假设,而无需观测运动。
查看缓存全文
缓存时间: 2026/08/12 08:19
论文页面 - 从静止状态观测重建铰接物体
来源:https://huggingface.co/papers/2607.27749
摘要
一种静止状态框架通过将视觉-语言输出融合为一致的部分网格,并通过几何一致性验证合成的运动假设,从而从单一闭合构型重建铰接物体。
构建交互式数字孪生需要同时恢复物体的3D几何以及控制其铰接方式的运动学结构。然而,现有的铰接物体重建方法要求从多个铰接状态中明确观测到运动。我们引入一种静止状态公式,从单一闭合构型重建铰接物体,这是一个本质上不适定的设置,其中几何、语义和运动先验补偿了运动线索的缺失。我们的框架采用显式网格作为跨模型验证与融合的中间表示,将视觉-语言模型和分割模型的噪声输出调和为空间一致的部分结构。为了在没有观测运动的情况下估计关节参数,我们使用视频扩散模型合成铰接假设,并通过几何一致性对其进行验证。我们的方法实现了准确的部分分解和物理上合理的铰接,性能可与基于运动观测的重建方法、生成方法以及模块化预训练模型基线相媲美。
查看 arXiv 页面 (https://arxiv.org/abs/2607.27749) 查看 PDF (https://arxiv.org/pdf/2607.27749) 项目页面 (https://da-eun07.github.io/rest2art/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27749)
引用该论文的模型 0
暂无模型关联该论文
在模型 README.md 中引用 arxiv.org/abs/2607.27749,即可在此页面关联该模型。
引用该论文的数据集 0
暂无数据集关联该论文
在数据集 README.md 中引用 arxiv.org/abs/2607.27749,即可在此页面关联该数据集。
引用该论文的 Space 0
暂无 Space 关联该论文
在 Space README.md 中引用 arxiv.org/abs/2607.27749,即可在此页面关联该 Space。
包含该论文的收藏集 0
暂无收藏集包含该论文
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可在此页面关联该收藏集。
相似文章
重新审视机器人操作中的关节部件感知
本文提出了几何基本结构(GPS),这是一种用于机器人操作中关节部件感知的新表示方法,支持高效的VR标注,无需微调即可达到73%的成功率。
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
@artemZholus:谢谢!在第二篇论文(https://arxiv.org/abs/2605.06388)中,我们采用了您(和RAE)的方案,效果不错。
本文系统地比较了基于重建和基于语义的潜在空间在机器人行动条件潜在扩散世界模型中的应用。研究发现,像V-JEPA 2.1这样的语义编码器在策略相关指标上通常优于重建编码器,从而主张将语义潜在空间作为机器人世界模型的更强基础。
视频扩散模型在手部运动重建中的惊人有效性
ViDiHand 利用预训练的视频扩散模型表示,直接从自我中心视频帧中重建4D手部运动,无需检测器或优化,在ARCTIC、HOT3D和HOI4D上优于现有方法。
场景即对象,而非基元:来自无位姿视图的实例结构化3D令牌化
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。