CG-World:面向世界模型的大规模世界状态数据集与协议
摘要
CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。
arXiv:2607.26452v1 公告类型:新
摘要:世界模型必须学习状态、动作、事件和观测的联合动态,然而现有的视频、机器人和仿真数据集通常只捕获了这种结构的一部分。我们引入了 CG-World,一个从工业计算机图形学制作流水线中衍生的大规模世界状态数据集与协议。CG-World 明确记录了中间状态,包括多模态语义、空间结构、骨骼和控制器状态、运动曲线、相机和光照参数、物理缓存、接触事件以及多通道渲染。CG-World v1 包含约 85 万个 1-5 秒的时间对齐片段。它将潜在状态、观测、关系、事件和分支元数据分离,并将它们组织成统一的时空样本。为了支持干预学习和反事实推理,CG-World 定义了一个分支谱系,涵盖事实轨迹、观测干预、动作干预、机制干预和严格反事实分支,并明确记录干预目标、不变项和替代结果。我们在几何条件视频生成、动作预测和闭环视觉-语言-动作策略迁移上评估了该数据集。结果表明,CG-World 为受控生成、动作建模和具身策略迁移提供了可复用的结构化监督。我们计划通过持续的数据收集和社区协作来扩展 CG-World,以构建面向世界模型、物理 AI 和具身智能的共享数据基础设施。
查看缓存全文
缓存时间: 2026/07/31 04:00
# CG-World:面向世界模型研究的大规模世界状态数据集 来源:https://arxiv.org/html/2607.26452 ###### 摘要 世界模型需要学习状态、动作、事件与观测的联合分布,而现有的公开视频数据集、机器人轨迹和仿真数据通常只覆盖这些要素中的一部分。为了解决这一局限,我们提出 CG-World(图1)——一种源自工业计算机图形生产流程的世界状态数据协议,并配套发布相应的大规模数据集。该数据集显式记录中间世界状态,包括多模态语义信息、空间表示、骨骼与控制器状态、运动曲线、相机与光照参数、物理缓存、接触事件以及多通道渲染输出。CG-World v1 包含约 85 万个世界状态片段,每个片段时长 1 至 5 秒。它将底层状态、观测、事件、关系和分支元数据相分离,并将这些异构记录组织为时间对齐的数据单元,从而提供显式且全面的世界状态信息表示。为进一步支持基于干预的学习和反事实推理,CG-World 引入统一的分支谱系,将世界状态轨迹分为事实轨迹、观测干预、动作干预、机制干预和严格反事实分支。对于每个分支,干预目标、不变变量和替代结果均被显式记录。我们在世界模型研究相关的三个受控任务上评估了 CG-World:几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移。实验结果表明,CG-World 为受控生成、动作建模和具身策略迁移提供了可复用的结构化监督,持续带来模型性能提升。未来工作中,我们计划通过持续数据收集和社区协作进一步扩展数据集,目标是使 CG-World 成为通用世界模型、物理 AI 和具身智能研究的共享数据基础设施。 关键词:世界模型;世界状态数据;具身智能;物理 AI;工业数据;反事实数据;合成数据 ## 1 引言 世界模型研究正从视频生成转向世界理解与预测。该领域已从将观测历史压缩为潜在表示,发展到在潜在空间中维护可条件化、可干预且可交互的表示,更广泛的目标是联合建模状态、动力学、控制与物理规律([Ding et al. 2025](https://arxiv.org/html/2607.26452#bib.bib1))。Kinetics-700、Ego4D 与 Panda-70M 为视频学习提供了支持([Carreira et al. 2019](https://arxiv.org/html/2607.26452#bib.bib2);[Grauman et al. 2022](https://arxiv.org/html/2607.26452#bib.bib3);[Chen et al. 2024](https://arxiv.org/html/2607.26452#bib.bib4)),但仅靠规模并不足以保证物理理解([Motamed et al. 2026](https://arxiv.org/html/2607.26452#bib.bib5))。公开观测数据以视频数据集为主,很少提供与视频对齐的动作、接触及相关信号,这限制了它们向具身智能与自动驾驶决策模型的迁移。Open X-Embodiment、BridgeData V2 和 DROID 等机器人数据集([Open X-Embodiment Collaboration 2024](https://arxiv.org/html/2607.26452#bib.bib6);[Walke et al. 2023](https://arxiv.org/html/2607.26452#bib.bib7);[Khazatsky et al. 2024](https://arxiv.org/html/2607.26452#bib.bib8))组织了特定领域的观测、动作和演示,但通常不暴露求解器状态、接触图、材质参数或类似的中间变量。仿真数据提供可读状态、可控参数和可重复过程,但仍是特定引擎与配置的输出,因此受制于现实差距、求解器偏差和有限的跨域泛化能力([Hafner et al. 2025](https://arxiv.org/html/2607.26452#bib.bib9);[Li et al. 2020](https://arxiv.org/html/2607.26452#bib.bib10))。 比世界模型架构之争更具决定性的是,缺少支撑这些多元研究方向的数据基础。语言与多模态学习受益于丰富的高质量语料库([Raffel et al. 2020](https://arxiv.org/html/2607.26452#bib.bib11))。相比之下,面向世界模型的公开数据集,包括那些面向视频生成的模型,通常只覆盖视觉序列、相机位姿、深度、全景观测和 3D 信息中的一部分。目前仍缺乏一个高质量公开数据集,能在同一时空样本中对齐 3D 场景状态、全景或多视角观测、深度与几何真值、相机轨迹以及最终视频;而额外对齐动作和物理信息的多条件数据集则更为稀缺。 工业计算机图形生产不仅产生最终视频,还会在 CG 引擎中显式记录物理、时间与空间的中间数据,从而提供世界状态的详细描述。虽然这些记录并不等同于真实世界的物理真值,但它们以数值方式描述了观测输出背后的运动、交互和生成过程,并在实体与时间层面与最终视频保持对齐。因此,它们非常适合作为世界模型的多模态过程监督,却尚未被系统整理为世界模型训练数据。 为填补这一空白,我们借鉴 ImageNet([Deng et al. 2009](https://arxiv.org/html/2607.26452#bib.bib12))将图像组织为分层语义数据库的先例,以时空对齐为核心,建立了一套描述世界状态的分层数据治理协议,并构建了大规模数据集和反事实分支子集,用于跨任务的世界模型训练与评估。 ## 2 相关工作 真实世界观测数据。ScanNet([Dai et al. 2017](https://arxiv.org/html/2607.26452#bib.bib13))和 Matterport3D([Chang et al. 2017](https://arxiv.org/html/2607.26452#bib.bib14))通过真实 RGB-D 和 3D 扫描提供几何与相机位姿,为可控视频生成提供了重要支持。然而,这些数据仍以终端观测为中心,通常缺乏与时间观测严格对齐的中间物理状态。Genie、GAIA-1/2 与 Cosmos 展示了视频世界模型的基础能力([Bruce et al. 2024](https://arxiv.org/html/2607.26452#bib.bib15);[Hu et al. 2023](https://arxiv.org/html/2607.26452#bib.bib16);[Russel et al. 2025](https://arxiv.org/html/2607.26452#bib.bib17);[NVIDIA et al. 2025](https://arxiv.org/html/2607.26452#bib.bib18))。后续的 PhyWorld 等工作通过持续后训练和物理偏好优化提升了视频延续的物理合理性,进一步说明仅凭终端视频观测无法提供可直接学习的机制监督([Zhao et al. 2026](https://arxiv.org/html/2607.26452#bib.bib19))。 传感器采集数据集与具身智能。Open X-Embodiment 以标准化格式聚合了超过 100 万条真实机器人轨迹。RT-2([Zitkovich et al. 2023](https://arxiv.org/html/2607.26452#bib.bib20))和 OpenVLA([Kim et al. 2025b](https://arxiv.org/html/2607.26452#bib.bib21))等模型表明,在互联网规模的视觉-语言知识和机器人行为数据上联合训练能够提升语义泛化能力和跨任务控制能力。尽管这些数据集捕获了真实传感器、具身形态和操作噪声,但通常无法记录世界的完整潜在状态。CG-World 与之互补:它提供了真实世界数据收集中难以获得的密集中间状态监督。 合成世界与仿真平台。Kubric、iGibson 与 ThreeDWorld([Greff et al. 2022](https://arxiv.org/html/2607.26452#bib.bib22);[Li et al. 2022](https://arxiv.org/html/2607.26452#bib.bib23);[Gan et al. 2021](https://arxiv.org/html/2607.26452#bib.bib24))等合成数据生成器和仿真器提供了可控环境、丰富标注和物理模拟,某些还具备干预变量。然而,不同仿真器之间的状态协议和物理等价标准并不一致,不同引擎或参数设置可能以不同动力学近似同一物理过程。CG-World 则源自交付的生产记录,并包含大量无法仅靠引擎计算获得的专家创作数据,例如使用 3D 粒子系统制作的流体运动。 物理与因果。IntPhys 和 PHYRE 用于评估直觉物理和交互推理([Riochet et al. 2022](https://arxiv.org/html/2607.26452#bib.bib25);[Bakhtin et al. 2019](https://arxiv.org/html/2607.26452#bib.bib26));CLEVRER([Yi et al. 2020](https://arxiv.org/html/2607.26452#bib.bib27))在视频框架中统一了描述、解释、预测和反事实推理;CausalWorld([Ahmed et al. 2021](https://arxiv.org/html/2607.26452#bib.bib28))允许对操作环境中与物体和机器人关联的因果变量进行显式干预。然而,大多数视觉推理基准仍局限于判别式问答、合理性判断或简化物理系统,因此所覆盖的应用领域较为有限。 总之,世界模型训练仍缺少一个标准化的数据系统,来系统地对齐语义、动作、物理、观测和反事实。CG-World 通过将工业生产中的显式中间物理状态、多通道视觉观测和同根分支谱系纳入共享的时空数据系统,填补了这一空白。 ## 3 世界状态数据
相似文章
GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
多智能体世界模型(3分钟阅读)
γ-World 是一个生成式多智能体世界模型,支持独立可控、排列对称的智能体,采用 Simplex Rotary Agent Encoding 和 Sparse Hub Attention 技术,实现了实时 24 FPS 的推演,并具有从两个玩家到四个玩家的零样本泛化能力。
galilai-group/stable-worldmodel
stable-worldmodel 是一个用于可重复世界模型研究的统一平台,提供标准化的环境、数据收集、训练和评估接口。
MultiWorld:可扩展的多智能体多视角视频世界模型
MultiWorld 是一个统一的多智能体多视角视频世界建模框架,通过多智能体条件模块与全局状态编码器,在精准控制多智能体行为的同时保持多视角一致性。
HY-World 2.0:用于重建、生成和模拟三维世界的多模态世界模型
HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。