Deform360:面向可变形世界模型的大规模多视角视触觉数据集

Hugging Face Daily Papers 论文

摘要

Deform360是一个大规模视触觉数据集,包含198个物体、超过215小时的观测数据,用于研究可变形物体动力学,支持在机器人操作中比较2D视频与3D粒子世界模型。

预测物体动力学(即世界建模)是机器人操作中的一项基本挑战,而可变形物体的建模因其高维状态空间和复杂材料特性尤为困难。当前世界模型主要通过两种范式进行研究:在2D像素空间上学习动力学,或在更显式的3D几何空间上学习。然而,由于缺乏多样化的大规模真实世界数据,人们对其相对优势与局限性的系统性理解仍不明确。为此,我们提出Deform360——一个大规模视触觉数据集,涵盖198个日常物体、1980组交互序列、超过215小时的观测数据,通过41台环绕摄像机及双臂触觉夹爪捕捉全局运动与接触引起的局部变形。借助新颖的无标记视触觉3D追踪流水线,提取稠密几何与运动信息,我们系统评估了当前最先进的世界模型,比较了2D视频模型与3D粒子模型。最后,我们通过执行可变形物体的机器人规划任务,初步展示了该数据集在真实世界中的适用性。分析揭示了结构先验与可扩展性之间的权衡,为未来面向可变形物体的可泛化世界建模研究提供了坚实基准。项目网站:https://deform360.lhy.xyz
查看原文
查看缓存全文

缓存时间: 2026/07/07 06:42

论文页面 - Deform360: 一个大规模多视角视触觉数据集用于可变形世界模型

来源: https://huggingface.co/papers/2607.05390 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

介绍了一个名为Deform360的大规模视触觉数据集,用于研究可变形物体动力学,使得在机器人操作任务中能够比较2D视频和3D粒子世界模型。

预测物体动力学(即世界建模 (https://huggingface.co/papers?q=world%20modeling))是机器人操作中的一项基本挑战,而对可变形物体 (https://huggingface.co/papers?q=deformable%20objects) 的建模因其高维状态空间和复杂的材料特性而尤为困难。当前的世界模型通过两种不同的范式来应对这一挑战:在2D像素空间 (https://huggingface.co/papers?q=2D%20pixel%20space) 上学习动力学,或在更显式的3D几何空间 (https://huggingface.co/papers?q=3D%20geometric%20space) 上学习。由于缺乏多样化、大规模的真实世界数据,对它们相对优势和局限性的系统性理解仍然难以获得。为解决这一问题,我们提出了Deform360,这是一个大规模视触觉数据集 (https://huggingface.co/papers?q=visuotactile%20dataset),包含198个日常物体、1,980个交互序列以及超过215小时来自41个环绕视图摄像头和双手触觉夹爪的观测数据,以捕捉全局运动及接触引起的局部变形。利用一种新颖的无标记视触觉3D跟踪流水线提取密集几何和运动,我们系统地评估了当前最先进的世界模型,比较了2D视频模型与3D粒子模型 (https://huggingface.co/papers?q=3D%20particle%20models)。最后,我们通过执行可变形物体 (https://huggingface.co/papers?q=deformable%20objects) 上的机器人规划 (https://huggingface.co/papers?q=robot%20planning) 任务,初步证明了我们数据集的真实世界适用性。我们的分析揭示了结构先验与可扩展性之间权衡的关键见解,为未来在通用可变形物体中心的世界建模 (https://huggingface.co/papers?q=world%20modeling) 研究提供了一个坚实的基准。项目网站: https://deform360.lhy.xyz

查看 arXiv 页面 (https://arxiv.org/abs/2607.05390)查看 PDF (https://arxiv.org/pdf/2607.05390)项目页面 (https://deform360.lhy.xyz/)GitHub1 (https://github.com/lhy0807/deform360)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05390)

在您的智能体中获取此论文:

hf papers read 2607\.05390

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有与本文关联的模型

在模型的 README.md 中引用 arxiv.org/abs/2607.05390 以从此页面链接。

引用此论文的数据集0

没有与本文关联的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2607.05390 以从此页面链接。

引用此论文的 Spaces0

没有与本文关联的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2607.05390 以从此页面链接。

包含此论文的收藏0

没有包含此论文的收藏

将此论文添加到一个收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

EgoPhys:从第一人称视频学习可变形物体的通用物理模型

Hugging Face Daily Papers

EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。