SolarWM:面向长时程视频世界模型的开放数据与可扩展训练

Hugging Face Daily Papers 论文

摘要

SolarWM引入了一个开放框架和统一训练配方,用于通过跨多样数据源的可扩展训练构建交互式视频世界模型,从而实现长时程实时运行。

我们介绍SolarWM,这是一个完全开放的基础框架,用于从数据准备到长时程推理构建交互式视频世界模型。跨异构数据源和视频骨干进行训练具有挑战性:数据集在时间尺度、相机几何、视觉质量、运动和字幕风格上存在差异,而视频生成器使用不同的表示和架构。因此,简单数据混合和特定于模型的实现会产生不一致的监督,并使结果难以重现和比较。SolarWM通过可重构的多源数据引擎和骨干原生适配框架解决了这种耦合。该引擎将来自10个数据集的143万个标准片段转换为统一的、帧对齐的合约,涵盖视觉观察、度量相机几何、字幕、质量元数据、选择决策和来源,同时将源处理与混合构建解耦。在共享的相机条件、训练和推理接口下,我们基于Wan2.2、LTX-2.5和MiniMax-H3实例化了四个5B到33B的模型,同时保留它们的原生表示和目标。一个统一的三阶段配方结合了双向适配、教师强制自回归初始化和分布匹配蒸馏。由此产生的因果模型在仅使用5秒序列训练后,就能在从几分钟到几小时的运行中实现实时交互。通过发布由此产生的数据、流程、配方、权重和框架,SolarWM为交互式世界模型研究提供了可重现和可扩展的基础。
查看原文
查看缓存全文

缓存时间: 2026/09/03 03:52

论文页面 - SolarWM:面向长时序视频世界模型的开放数据与可扩展训练方案

来源:https://huggingface.co/papers/2609.02886 发布于9月2日

#2 当日精选论文(https://huggingface.co/papers/date/2026-09-03) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

SolarWM提供了一个开放框架与统一训练方案,用于在多样化数据源和生成器骨干网络上构建交互式视频世界模型,从而实现长时序实时推演。

我们推出SolarWM,这是一个完全开放的基础框架,用于从数据准备到长时序推理的全流程交互式视频世界模型(https://huggingface.co/papers?q=video%20world%20models)构建。跨异构数据源和视频骨干网络的训练极具挑战:数据集在时间尺度、相机几何、视觉质量、运动模式和标注风格上存在差异,而视频生成器采用不同的表示形式和架构。简单的数据混合和特定模型的实现方案会导致监督信号不一致,使得结果难以复现和比较。SolarWM通过可重构多源数据引擎(https://huggingface.co/papers?q=multi-source%20data%20engine)和骨干网络原生适配(https://huggingface.co/papers?q=backbone-native%20adaptation)框架解决了这种耦合问题。该引擎将来自10个数据集的143万个标准片段转换为统一的、帧对齐的协议,涵盖视觉观测、度量相机几何、标注、质量元数据、选择决策和溯源信息,同时将源处理与混合构建解耦。在共享的相机条件控制(https://huggingface.co/papers?q=camera-conditioning)、训练和推理接口下,我们基于Wan2.2、LTX-2.5和MiniMax-H3实例化了四个5B至33B参数的模型,同时保留其原生表示和目标。统一的三阶段方案结合了双向适配、教师强制自回归初始化(https://huggingface.co/papers?q=autoregressive%20initialization)和分布匹配蒸馏(https://huggingface.co/papers?q=distribution%20matching%20distillation)。生成的因果模型(https://huggingface.co/papers?q=causal%20models)仅通过5秒序列的训练,即可在分钟到小时的推演范围内实现实时交互。通过发布生成的数据、处理流程、训练方案、权重和框架,SolarWM为交互式世界模型研究提供了可复现且可扩展的基础。

查看arXiv页面(https://arxiv.org/abs/2609.02886)查看PDF文档(https://arxiv.org/pdf/2609.02886)项目主页(https://junchao-cs.github.io/SolarWM-Web/)GitHub仓库(https://github.com/Junchao-cs/SolarWM)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.02886)

通过智能体获取本文:

hf papers read 2609\.02886

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型1

junchaoh-cs/SolarWM 约1小时前更新(https://huggingface.co/junchaoh-cs/SolarWM)

引用本文的数据集1

junchaoh-cs/SolarWM-Data 约1小时前更新 • 69 • 5(https://huggingface.co/datasets/junchaoh-cs/SolarWM-Data)

引用本文的应用空间0

暂无关联本文的应用空间

在应用空间的README.md中引用 arxiv.org/abs/2609.02886 即可从本页面链接。

包含本文的收藏集0

暂无包含本文的收藏集

将本文添加到收藏集(https://huggingface.co/new-collection)即可从本页面链接。

相似文章

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。

Efficient-Large-Model/SANA-WM_bidirectional

Hugging Face Models Trending

SANA-WM 是一个高效的 2.6B 参数开源世界模型,用于分钟级视频生成并具备精确的相机控制。它采用混合线性扩散变换器和两阶段流水线,从图像和文本提示生成 720p 视频。