TableVerse:一个具有真实世界基础布局的大规模桌面数据集,用于可泛化操作

Hugging Face Daily Papers 论文

摘要

TableVerse 引入了一个完全自动化的 Real2Sim 流水线,将非结构化、野外图像转换为高保真、可模拟的桌面环境,具有精确的度量标准和物理稳定性,同时提供了一个大规模数据集(TableVerse-100K),用于可泛化的机器人操作。

可泛化机器人操作策略的开发本质上受到大规模、高保真场景数据可用性的限制。尽管最近的自动合成方法试图通过文本到布局的幻觉生成或简化的程序化生成来弥合这一差距,但它们经常存在物理上不可信的问题,并且无法捕捉真实人类环境中复杂、密集的杂乱布局。在本文中,我们介绍了 TableVerse,一个完全自动化的 Real2Sim 流水线,它将范式从想象性布局生成转变为从非结构化、野外图像数据中进行确定性重建。我们的框架能够无缝地将非脚本化的互联网媒体处理成高保真、可模拟的桌面环境,具备精确的度量尺度、真实的拓扑结构以及经过验证的机械稳定性。此外,我们还集成了一个自动化的任务条件轨迹生成框架,用于合成高质量、无碰撞的抓取和放置演示。利用这一完整的流水线,我们构建了 TableVerse-100K 数据集,这是一个包含 100,000 个独特、物理上一致的环境以及交互式操作轨迹的大规模语料库。通过捕获多样化的资产组成、真实的空间分布和高质量的演示,TableVerse-100K 建立了一个高度可扩展且高保真的数据基础,为促进未来在可泛化机器人操作任务方面的研究提供了重要价值。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - TableVerse:基于真实世界布局的大规模桌面数据集,用于通用操控

来源:https://huggingface.co/papers/2607.21017

摘要

通用机器人操控策略的发展从根本上受限于大规模、高保真场景数据的可用性。尽管近期的自动化合成方法试图通过文本到布局的想象生成或简化程序化生成来弥补这一差距,但这些方法常常因物理上不可行,且无法捕捉真实人类环境中复杂、密集的杂乱场景而表现不佳。在本文中,我们提出TableVerse,一个全自动化的Real2Sim流水线,它将范式从想象性布局生成转向对非结构化、真实世界图像数据的确定性重建。我们的框架能够无缝地将未经脚本编排的互联网媒体处理为高保真、可直接用于仿真的桌面环境,并具备精确的度量尺度、真实的拓扑结构和经过验证的力学稳定性。此外,我们还集成了一套自动化的任务条件轨迹生成框架,用于合成高质量、无碰撞的抓取与放置演示。基于这一完整流水线,我们构建了TableVerse-100K数据集——一个包含10万个独特且物理一致的场景,并搭配交互式操控轨迹的大规模语料库。通过捕捉多样化的物品种类、真实的物体空间分布以及高质量的演示动作,TableVerse-100K建立了一个高度可扩展且高保真的数据基础,为未来通用机器人操控任务的研究提供了重要价值。

查看arXiv页面 (https://arxiv.org/abs/2607.21017)
查看PDF (https://arxiv.org/pdf/2607.21017)
项目页面 (https://bytedance.github.io/TableVerse/)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21017)

在你的agent中获取这篇论文:

hf papers read 2607.21017

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

0

没有模型链接此论文

请在一个模型的README.md中引用arxiv.org/abs/2607.21017以在此页面上链接它。

引用此论文的数据集

0

没有数据集链接此论文

请在一个数据集的README.md中引用arxiv.org/abs/2607.21017以在此页面上链接它。

引用此论文的Space

0

没有Space链接此论文

请在一个Space的README.md中引用arxiv.org/abs/2607.21017以在此页面上链接它。

包含此论文的收藏集

0

没有收藏集包含此论文

请将这篇论文添加到一个收藏集中 (https://huggingface.co/new-collection) 以在此页面上链接它。

相似文章

TT4D:一种基于单目视频进行乒乓球4D重建的Pipeline与数据集

Hugging Face Daily Papers

本文介绍了TT4D,这是一种新颖的Pipeline和大规模数据集,旨在从单目视频中重建乒乓球比赛的4D场景。该方案采用独特的“先升维”策略,在进行时间分割之前,先估计乒乓球的3D轨迹和旋转,从而即使在存在遮挡的情况下也能实现稳健的重建。

Image2Sim: 通过生成式神经模拟器实现具身导航规模化

Hugging Face Daily Papers

Image2Sim是一个神经模拟框架,它能从RGB-D图像创建高保真交互环境,为具身导航智能体提供可扩展的训练。该框架生成了近20K场景和超过1000万训练样本,在基准测试上展现了显著改进,并实现了有效的真实世界零样本迁移。

VCG-Bench:面向统一视觉中心的生成与编辑结构化基准

arXiv cs.CL

VCG-Bench 是一个统一基准,用于评估视觉-语言模型在结构化图表生成与编辑任务上的表现,引入了一种基于符号 mxGraph XML 的“以图表为代码”范式,以及一个包含 6 个领域共 1,449 张图表的分类数据集。