MiniWorld:从零训练视频世界模型的民主化
摘要
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
查看缓存全文
缓存时间: 2026/08/05 09:44
论文页面 - MiniWorld:普及从零开始的视频世界模型训练
来源:https://huggingface.co/papers/2608.01127
摘要
视频世界模型根据历史观测和控制信号预测未来的观测,通过自回归的状态转移实现长时程生成。与主要捕捉视觉外观和运动的传统视频生成模型不同,视频世界模型学习在智能体动作下支配环境演化的底层动力学,为具身 AI 和交互式仿真提供基础。最近的进展很大程度上依赖于通过后训练或蒸馏来适配预训练的视频生成模型。虽然有效,但这些方法通常需要复杂的训练流程、大量的计算资源,并且存在双向预训练与因果流式推理之间的不匹配问题。近期研究表明,从零开始训练自回归视频世界模型是可行且可扩展的。然而,社区仍然缺乏一个轻量级、透明、完全可复现的基线,能够在适度的计算资源下进行端到端训练。我们提出了 MiniWorld,一个用于从零开始训练流式视频世界模型的可复现框架。MiniWorld 采用块因果视频扩散 Transformer(block-causal Video Diffusion Transformer),在预训练 VideoVAE 的潜空间中使用 Flow Matching 进行训练。基于 DiffusionForcing,它采用分块非递减噪声调度和两阶段持续训练来改善时间建模和稳定性。在推理时,MiniWorld 结合滚动 KV 缓存与流水线异步去噪,在有界计算下实现高效的流式生成。整个模型可以在单个 8-GPU 服务器上几天内完成训练。通过发布训练和推理代码库以及预训练检查点,我们希望 MiniWorld 能够促进未来视频世界建模的研究。
查看 arXiv 页面 查看 PDF 项目页面 GitHub21 添加到合集
在您的代理中获取此论文:
hf papers read 2608\.01127
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
zhaoyian01/MiniWorld 机器人 • 1 天前更新 • 2 (https://huggingface.co/zhaoyian01/MiniWorld)
引用此论文的数据集0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.01127 即可在此页面链接到该论文。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.01127 即可在此页面链接到该论文。
包含此论文的合集0
没有合集包含此论文
将此论文添加到合集(https://huggingface.co/new-collection)以在此页面链接到它。
相似文章
世界模型自蒸馏:训练世界模型解决通用任务
一个可扩展的框架结合了自蒸馏和强化学习,将任务解决能力从视觉语言模型迁移到视频扩散模型,无需标注的任务-视频数据。
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。
minWM:用于实时交互式视频世界模型的全栈开源框架
minWM 是一个全栈开源框架,可将双向视频扩散模型转换为实时交互式视频世界模型,支持可控相机、低延迟推演和模块化架构。
SANA-WM: 高效分钟级世界建模与混合线性扩散Transformer
SANA-WM是一个拥有26亿参数的开源世界模型,能生成高保真720p分钟级视频,支持精确相机控制,在达到工业级质量的同时显著降低计算需求。
MultiWorld:可扩展的多智能体多视角视频世界模型
MultiWorld 是一个统一的多智能体多视角视频世界建模框架,通过多智能体条件模块与全局状态编码器,在精准控制多智能体行为的同时保持多视角一致性。