SolarWM:面向长时程视频世界模型的开放数据与可扩展训练
摘要
SolarWM引入了一个开放框架和统一训练配方,用于通过跨多样数据源的可扩展训练构建交互式视频世界模型,从而实现长时程实时运行。
查看缓存全文
缓存时间: 2026/09/03 03:52
论文页面 - SolarWM:面向长时序视频世界模型的开放数据与可扩展训练方案
来源:https://huggingface.co/papers/2609.02886 发布于9月2日
#2 当日精选论文(https://huggingface.co/papers/date/2026-09-03) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
SolarWM提供了一个开放框架与统一训练方案,用于在多样化数据源和生成器骨干网络上构建交互式视频世界模型,从而实现长时序实时推演。
我们推出SolarWM,这是一个完全开放的基础框架,用于从数据准备到长时序推理的全流程交互式视频世界模型(https://huggingface.co/papers?q=video%20world%20models)构建。跨异构数据源和视频骨干网络的训练极具挑战:数据集在时间尺度、相机几何、视觉质量、运动模式和标注风格上存在差异,而视频生成器采用不同的表示形式和架构。简单的数据混合和特定模型的实现方案会导致监督信号不一致,使得结果难以复现和比较。SolarWM通过可重构多源数据引擎(https://huggingface.co/papers?q=multi-source%20data%20engine)和骨干网络原生适配(https://huggingface.co/papers?q=backbone-native%20adaptation)框架解决了这种耦合问题。该引擎将来自10个数据集的143万个标准片段转换为统一的、帧对齐的协议,涵盖视觉观测、度量相机几何、标注、质量元数据、选择决策和溯源信息,同时将源处理与混合构建解耦。在共享的相机条件控制(https://huggingface.co/papers?q=camera-conditioning)、训练和推理接口下,我们基于Wan2.2、LTX-2.5和MiniMax-H3实例化了四个5B至33B参数的模型,同时保留其原生表示和目标。统一的三阶段方案结合了双向适配、教师强制自回归初始化(https://huggingface.co/papers?q=autoregressive%20initialization)和分布匹配蒸馏(https://huggingface.co/papers?q=distribution%20matching%20distillation)。生成的因果模型(https://huggingface.co/papers?q=causal%20models)仅通过5秒序列的训练,即可在分钟到小时的推演范围内实现实时交互。通过发布生成的数据、处理流程、训练方案、权重和框架,SolarWM为交互式世界模型研究提供了可复现且可扩展的基础。
查看arXiv页面(https://arxiv.org/abs/2609.02886)查看PDF文档(https://arxiv.org/pdf/2609.02886)项目主页(https://junchao-cs.github.io/SolarWM-Web/)GitHub仓库(https://github.com/Junchao-cs/SolarWM)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.02886)
通过智能体获取本文:
hf papers read 2609\.02886
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
junchaoh-cs/SolarWM 约1小时前更新(https://huggingface.co/junchaoh-cs/SolarWM)
引用本文的数据集1
junchaoh-cs/SolarWM-Data 约1小时前更新 • 69 • 5(https://huggingface.co/datasets/junchaoh-cs/SolarWM-Data)
引用本文的应用空间0
暂无关联本文的应用空间
在应用空间的README.md中引用 arxiv.org/abs/2609.02886 即可从本页面链接。
包含本文的收藏集0
暂无包含本文的收藏集
将本文添加到收藏集(https://huggingface.co/new-collection)即可从本页面链接。
相似文章
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
minWM:用于实时交互式视频世界模型的全栈开源框架
minWM 是一个全栈开源框架,可将双向视频扩散模型转换为实时交互式视频世界模型,支持可控相机、低延迟推演和模块化架构。
Efficient-Large-Model/SANA-WM_bidirectional
SANA-WM 是一个高效的 2.6B 参数开源世界模型,用于分钟级视频生成并具备精确的相机控制。它采用混合线性扩散变换器和两阶段流水线,从图像和文本提示生成 720p 视频。
SANA-WM: 高效分钟级世界建模与混合线性扩散Transformer
SANA-WM是一个拥有26亿参数的开源世界模型,能生成高保真720p分钟级视频,支持精确相机控制,在达到工业级质量的同时显著降低计算需求。
ZimaBlue: 通过可扩展的视频预训练进化可泛化的世界行动模型
ZimaBlue 引入了一个可扩展框架,从大规模自我中心视频中学习可泛化的世界行动模型,通过三阶段课程和慢-快架构,显著提升了零样本机器人操作能力。