WorldRover:一个用于丰富标注世界探索的可扩展合成视频数据引擎

Hugging Face Daily Papers 论文

摘要

WorldRover是一个可扩展的合成数据引擎,它生成长距离、丰富标注的视频序列,包含深度和相机运动,以支持训练模型进行连贯的世界探索。

学习生成或重建可探索世界需要视频配对更多内容:相机运动、场景几何、时间对应,以及对于交互模型,控制信号。真实捕获可以提供这些信号的一部分,但稠密几何和长距离对应通常依赖于估计或专用设备。渲染可以直接提供这些量,但现有的合成资源很少在相同帧上结合它们,同时支持视角和外观的受控变化。我们引入WorldRover,一个用于生成艺术家构建环境的丰富标注、长距离探索的数据引擎。其核心是WorldRover-Engine,一个Unreal Engine管道,执行和离线渲染分钟级路线,同时保留完整轨迹和场景几何。相同的探索可以从第一人称、第三人称和360全景相机在不同环境状态下重放。使用WorldRover-Engine,我们构建WorldRover-10M,其序列在每个探索中配对RGB与度量深度、相机轨迹和轨迹衍生的动作信号。第三人称子集还提供稠密光流、长距离2D/3D点轨迹(带可见性)以及与相机轨迹不同的角色轨迹。该引擎可以从第一人称、第三人称和360全景视角渲染遍历,在不同环境状态下或使用中性白色材质,同时保留路线和场景几何。因此,WorldRover将长视野世界探索转化为一个可扩展的数据生成问题,为必须构建、维护和重访可探索世界连贯表示的模型提供监督。
查看原文
查看缓存全文

缓存时间: 2026/08/18 07:50

论文页面 - WorldRover:一个可扩展的合成视频数据引擎,用于带有丰富标注的世界探索

来源:https://huggingface.co/papers/2608.15659

摘要

WorldRover 是一个合成数据引擎,用于生成具有深度、相机运动和跟踪信号的长程、标注丰富的视频序列,以支持训练模型实现连贯的世界探索。

学习生成或重建可探索世界所需的视频,除了 RGB 信息外,还需要更多:相机运动、场景几何、时间对应关系,以及针对交互式模型的控制信号。真实采集可以提供其中部分信号,但稠密几何和长程对应关系通常依赖于估计或专用仪器。渲染可以直接提供这些信息,然而现有的合成资源很少在相同的帧上同时结合它们,还同时支持对视角和外观的可控变化。我们推出了 WorldRover,一个用于在艺术家构建的环境中生成标注丰富、长程探索数据的数据引擎。其核心 WorldRover-Engine 是一个 Unreal Engine 管道,能够执行并离线渲染分钟级的路线,同时保留其完整的轨迹和场景几何。相同的探索过程可以从第一人称、第三人称和 360 全景摄像机(https://huggingface.co/papers?q=panoramic%20cameras)在不同的环境状态下进行重放。使用 WorldRover-Engine,我们构建了 WorldRover-10M,其序列将 RGB 与度量深度(https://huggingface.co/papers?q=metric%20depth)、相机轨迹(https://huggingface.co/papers?q=camera%20trajectories)以及贯穿每次探索的轨迹派生动作信号(https://huggingface.co/papers?q=action%20signals)配对。第三人称子集还额外提供了稠密光流(https://huggingface.co/papers?q=optical%20flow)、带有可见性(https://huggingface.co/papers?q=visibility)的长程 2D/3D 点轨迹(https://huggingface.co/papers?q=2D%2F3D%20point%20tracks),以及不同于相机轨迹的角色轨迹。该引擎可以从第一人称、第三人称和 360 全景视角渲染遍历过程,支持不同的环境状态或使用中性白色材质,同时保留路线和场景几何。因此,WorldRover 将长程世界探索转化为一个可扩展的数据生成问题,为必须构建、维护和重复访问可探索世界连贯表示的模型提供监督。

查看 arXiv 页面 (https://arxiv.org/abs/2608.15659) 查看 PDF (https://arxiv.org/pdf/2608.15659) 项目页面 (https://alayalab.github.io/WorldRover/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15659)

在您的代理中获取此论文:

hf papers read 2608\.15659

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.15659 以从本页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.15659 以从本页面链接它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.15659 以从本页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

Wonder:更优的视频世界模型

Hugging Face Daily Papers

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模

Hugging Face Daily Papers

Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。