Deform360:面向可变形世界模型的大规模多视角视触觉数据集
摘要
Deform360是一个大规模视触觉数据集,包含198个物体、超过215小时的观测数据,用于研究可变形物体动力学,支持在机器人操作中比较2D视频与3D粒子世界模型。
查看缓存全文
缓存时间: 2026/07/07 06:42
论文页面 - Deform360: 一个大规模多视角视触觉数据集用于可变形世界模型
来源: https://huggingface.co/papers/2607.05390 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
介绍了一个名为Deform360的大规模视触觉数据集,用于研究可变形物体动力学,使得在机器人操作任务中能够比较2D视频和3D粒子世界模型。
预测物体动力学(即世界建模 (https://huggingface.co/papers?q=world%20modeling))是机器人操作中的一项基本挑战,而对可变形物体 (https://huggingface.co/papers?q=deformable%20objects) 的建模因其高维状态空间和复杂的材料特性而尤为困难。当前的世界模型通过两种不同的范式来应对这一挑战:在2D像素空间 (https://huggingface.co/papers?q=2D%20pixel%20space) 上学习动力学,或在更显式的3D几何空间 (https://huggingface.co/papers?q=3D%20geometric%20space) 上学习。由于缺乏多样化、大规模的真实世界数据,对它们相对优势和局限性的系统性理解仍然难以获得。为解决这一问题,我们提出了Deform360,这是一个大规模视触觉数据集 (https://huggingface.co/papers?q=visuotactile%20dataset),包含198个日常物体、1,980个交互序列以及超过215小时来自41个环绕视图摄像头和双手触觉夹爪的观测数据,以捕捉全局运动及接触引起的局部变形。利用一种新颖的无标记视触觉3D跟踪流水线提取密集几何和运动,我们系统地评估了当前最先进的世界模型,比较了2D视频模型与3D粒子模型 (https://huggingface.co/papers?q=3D%20particle%20models)。最后,我们通过执行可变形物体 (https://huggingface.co/papers?q=deformable%20objects) 上的机器人规划 (https://huggingface.co/papers?q=robot%20planning) 任务,初步证明了我们数据集的真实世界适用性。我们的分析揭示了结构先验与可扩展性之间权衡的关键见解,为未来在通用可变形物体中心的世界建模 (https://huggingface.co/papers?q=world%20modeling) 研究提供了一个坚实的基准。项目网站: https://deform360.lhy.xyz
查看 arXiv 页面 (https://arxiv.org/abs/2607.05390)查看 PDF (https://arxiv.org/pdf/2607.05390)项目页面 (https://deform360.lhy.xyz/)GitHub1 (https://github.com/lhy0807/deform360)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05390)
在您的智能体中获取此论文:
hf papers read 2607\.05390
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有与本文关联的模型
在模型的 README.md 中引用 arxiv.org/abs/2607.05390 以从此页面链接。
引用此论文的数据集0
没有与本文关联的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2607.05390 以从此页面链接。
引用此论文的 Spaces0
没有与本文关联的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2607.05390 以从此页面链接。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
SoftVTBench: 一个面向可变形物体操作的变形感知视觉触觉数据集与基准测试
SoftVTBench 呈现了一个同步的视觉触觉数据集和变形感知基准测试,用于评估可变形物体操作中的物理交互质量,包含4,000个演示和一个新的成功指标。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
TableVerse:一个具有真实世界基础布局的大规模桌面数据集,用于可泛化操作
TableVerse 引入了一个完全自动化的 Real2Sim 流水线,将非结构化、野外图像转换为高保真、可模拟的桌面环境,具有精确的度量标准和物理稳定性,同时提供了一个大规模数据集(TableVerse-100K),用于可泛化的机器人操作。
DeformSmith:物理引导分层生成用于机器人操作的可变形资产
DeformSmith是一个框架,用于从文本或图像生成交互式、物理可信的可变形资产,通过物理引导的分层生成来提高质量和可信度。