WorldRover:一个用于丰富标注世界探索的可扩展合成视频数据引擎
摘要
WorldRover是一个可扩展的合成数据引擎,它生成长距离、丰富标注的视频序列,包含深度和相机运动,以支持训练模型进行连贯的世界探索。
查看缓存全文
缓存时间: 2026/08/18 07:50
论文页面 - WorldRover:一个可扩展的合成视频数据引擎,用于带有丰富标注的世界探索
来源:https://huggingface.co/papers/2608.15659
摘要
WorldRover 是一个合成数据引擎,用于生成具有深度、相机运动和跟踪信号的长程、标注丰富的视频序列,以支持训练模型实现连贯的世界探索。
学习生成或重建可探索世界所需的视频,除了 RGB 信息外,还需要更多:相机运动、场景几何、时间对应关系,以及针对交互式模型的控制信号。真实采集可以提供其中部分信号,但稠密几何和长程对应关系通常依赖于估计或专用仪器。渲染可以直接提供这些信息,然而现有的合成资源很少在相同的帧上同时结合它们,还同时支持对视角和外观的可控变化。我们推出了 WorldRover,一个用于在艺术家构建的环境中生成标注丰富、长程探索数据的数据引擎。其核心 WorldRover-Engine 是一个 Unreal Engine 管道,能够执行并离线渲染分钟级的路线,同时保留其完整的轨迹和场景几何。相同的探索过程可以从第一人称、第三人称和 360 全景摄像机(https://huggingface.co/papers?q=panoramic%20cameras)在不同的环境状态下进行重放。使用 WorldRover-Engine,我们构建了 WorldRover-10M,其序列将 RGB 与度量深度(https://huggingface.co/papers?q=metric%20depth)、相机轨迹(https://huggingface.co/papers?q=camera%20trajectories)以及贯穿每次探索的轨迹派生动作信号(https://huggingface.co/papers?q=action%20signals)配对。第三人称子集还额外提供了稠密光流(https://huggingface.co/papers?q=optical%20flow)、带有可见性(https://huggingface.co/papers?q=visibility)的长程 2D/3D 点轨迹(https://huggingface.co/papers?q=2D%2F3D%20point%20tracks),以及不同于相机轨迹的角色轨迹。该引擎可以从第一人称、第三人称和 360 全景视角渲染遍历过程,支持不同的环境状态或使用中性白色材质,同时保留路线和场景几何。因此,WorldRover 将长程世界探索转化为一个可扩展的数据生成问题,为必须构建、维护和重复访问可探索世界连贯表示的模型提供监督。
查看 arXiv 页面 (https://arxiv.org/abs/2608.15659) 查看 PDF (https://arxiv.org/pdf/2608.15659) 项目页面 (https://alayalab.github.io/WorldRover/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15659)
在您的代理中获取此论文:
hf papers read 2608\.15659
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.15659 以从本页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.15659 以从本页面链接它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.15659 以从本页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模
Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。
CityRAG:基于空间锚定的视频生成,步入真实城市
CityRAG 提出一种视频生成模型,利用地理注册数据生成长时、物理一致、3D 连贯的真实城市视频,为机器人与自动驾驶提供可导航、可仿真的逼真环境。
UniWorld-View:基于视频扩散模型的大基线视图合成
提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。
NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型
NVIDIA推出OmniDreams,这是一个基于Cosmos扩散模型构建的生成式世界模型,用于实时动作条件视频生成,能够在复杂的未见场景中实现自动驾驶策略评估的闭环仿真。