MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers 论文

摘要

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。

视频世界模型根据历史观测和控制信号预测未来观测,通过自回归状态转换实现长视野生成。与主要捕捉视觉外观和运动的传统视频生成模型不同,视频世界模型学习在智能体动作下环境演化的底层动力学,为具身智能和交互式仿真提供基础。最近的进展很大程度上依赖于通过后训练或蒸馏来适配预训练的视频生成模型。虽然有效,但这些方法通常需要复杂的训练流程、大量的计算资源,并且存在双向预训练与因果流式推理之间的不匹配问题。近期研究表明,从零训练自回归视频世界模型是可行且可扩展的。然而,社区仍然缺乏一个轻量级、透明且完全可复现的基线,能够以适度的计算资源进行端到端训练。我们提出了 MiniWorld,一个从零训练流式视频世界模型的可复现框架。MiniWorld 采用块因果视频扩散变换器(Video Diffusion Transformer),在预训练 Video VAE 的潜空间中使用流匹配进行训练。基于 Diffusion Forcing,它采用分块非递减噪声调度和两阶段持续训练,以改善时间建模和稳定性。在推理时,MiniWorld 结合滚动 KV 缓存与流水线异步去噪,在受限计算下实现高效的流式生成。整个模型可在单台 8-GPU 服务器上数天内完成训练。通过发布训练和推理代码库以及预训练检查点,我们希望 MiniWorld 能够促进视频世界建模的未来研究。
查看原文
查看缓存全文

缓存时间: 2026/08/05 09:44

论文页面 - MiniWorld:普及从零开始的视频世界模型训练

来源:https://huggingface.co/papers/2608.01127

摘要

视频世界模型根据历史观测和控制信号预测未来的观测,通过自回归的状态转移实现长时程生成。与主要捕捉视觉外观和运动的传统视频生成模型不同,视频世界模型学习在智能体动作下支配环境演化的底层动力学,为具身 AI 和交互式仿真提供基础。最近的进展很大程度上依赖于通过后训练或蒸馏来适配预训练的视频生成模型。虽然有效,但这些方法通常需要复杂的训练流程、大量的计算资源,并且存在双向预训练与因果流式推理之间的不匹配问题。近期研究表明,从零开始训练自回归视频世界模型是可行且可扩展的。然而,社区仍然缺乏一个轻量级、透明、完全可复现的基线,能够在适度的计算资源下进行端到端训练。我们提出了 MiniWorld,一个用于从零开始训练流式视频世界模型的可复现框架。MiniWorld 采用块因果视频扩散 Transformer(block-causal Video Diffusion Transformer),在预训练 VideoVAE 的潜空间中使用 Flow Matching 进行训练。基于 DiffusionForcing,它采用分块非递减噪声调度和两阶段持续训练来改善时间建模和稳定性。在推理时,MiniWorld 结合滚动 KV 缓存与流水线异步去噪,在有界计算下实现高效的流式生成。整个模型可以在单个 8-GPU 服务器上几天内完成训练。通过发布训练和推理代码库以及预训练检查点,我们希望 MiniWorld 能够促进未来视频世界建模的研究。

查看 arXiv 页面 查看 PDF 项目页面 GitHub21 添加到合集

在您的代理中获取此论文:

hf papers read 2608\.01127

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

zhaoyian01/MiniWorld 机器人 • 1 天前更新 • 2 (https://huggingface.co/zhaoyian01/MiniWorld)

引用此论文的数据集0

没有数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.01127 即可在此页面链接到该论文。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.01127 即可在此页面链接到该论文。

包含此论文的合集0

没有合集包含此论文

将此论文添加到合集(https://huggingface.co/new-collection)以在此页面链接到它。

相似文章

Wonder:更优的视频世界模型

Hugging Face Daily Papers

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。