Open-Sora 2.0:以20万美元成本训练商业级视频生成模型

Papers with Code Trending 论文

摘要

Open-Sora 2.0是一个开源视频生成模型,仅花费20万美元训练,达到了商业级性能,可与领先的模型如HunyuanVideo和Runway Gen-3 Alpha媲美,旨在实现先进视频创作的民主化。

视频生成模型在过去一年取得了显著进展。AI视频的质量不断提高,但代价是模型规模更大、数据量增加以及对训练计算资源的需求更大。在本报告中,我们介绍了Open-Sora 2.0,一个仅花费20万美元训练的商业级视频生成模型。通过这个模型,我们证明了训练顶级性能视频生成模型的成本是高度可控的。我们详细介绍了所有促成这一效率突破的技术,包括数据整理、模型架构、训练策略和系统优化。根据人类评估结果和VBench分数,Open-Sora 2.0与全球领先的视频生成模型相当,包括开源的HunyuanVideo和闭源的Runway Gen-3 Alpha。通过完全开源Open-Sora 2.0,我们旨在实现先进视频生成技术的民主化,促进内容创作中更广泛的创新和创造力。所有资源公开可用: https://github.com/hpcaitech/Open-Sora。
查看原文
查看缓存全文

缓存时间: 2026/09/07 18:06

论文页面 - Open-Sora 2.0:以20万美元训练商业级视频生成模型

来源:https://huggingface.co/papers/2503.09642 发布日期:2025年3月12日

·

提交者:https://huggingface.co/akhaliq

AK (https://huggingface.co/akhaliq) 于2025年3月14日

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Open-Sora 2.0 是一款高效且可商用的视频生成模型,以显著更低的训练成本达到了与领先模型相当的性能,并已开源以促进创新。

视频生成模型 (https://huggingface.co/papers?q=Video%20generation%20models) 在过去一年中取得了显著进展。AI视频的质量持续提升,但代价是更大的模型规模、更多的数据量以及更高的训练算力需求。在本报告中,我们推出了仅以20万美元训练而成的商业级视频生成模型——Open-Sora 2.0。通过该模型,我们证明了训练顶级视频生成模型的成本是高度可控的。我们详细介绍了所有促成这一效率突破的技术,包括数据整理 (https://huggingface.co/papers?q=data%20curation)、模型架构 (https://huggingface.co/papers?q=model%20architecture)、训练策略 (https://huggingface.co/papers?q=training%20strategy) 和系统优化。根据人工评估 (https://huggingface.co/papers?q=human%20evaluation) 结果和VBench评分 (https://huggingface.co/papers?q=VBench%20scores),Open-Sora 2.0 的性能与全球领先的视频生成模型 (https://huggingface.co/papers?q=video%20generation%20models) 相当,包括开源的 HunyuanVideo (https://huggingface.co/papers?q=HunyuanVideo) 和闭源的 Runway Gen-3 Alpha (https://huggingface.co/papers?q=Runway%20Gen-3%20Alpha)。通过将 Open-Sora 2.0 完全开源,我们旨在实现先进技术的普及,推动内容创作领域更广泛的创新与创造力。所有资源公开可在以下地址获取:https://github.com/hpcaitech/Open-Sora\。

查看arXiv页面 (https://arxiv.org/abs/2503.09642) 查看PDF (https://arxiv.org/pdf/2503.09642) GitHub29.5k星标 (https://github.com/hpcaitech/open-sora) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2503.09642)

通过你的代理获取此论文:

hf papers read 2503\.09642

还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型8个

hpcai-tech/Open-Sora-v2 文本转视频• 更新于2025年3月15日 • 429 • 183 (https://huggingface.co/hpcai-tech/Open-Sora-v2)

Compumacy/OPensora 文本转视频• 更新于2025年3月29日 • 11 (https://huggingface.co/Compumacy/OPensora)

xFusha/Open-Sora-v2 文本转视频• 更新于2月25日 • 19 (https://huggingface.co/xFusha/Open-Sora-v2)

hlaaa/Open-Sora-v2 文本转视频• 更新于3月29日 • 15 (https://huggingface.co/hlaaa/Open-Sora-v2)

浏览引用本文的8个模型 (https://huggingface.co/models?other=arxiv:2503.09642)## 引用本文的数据集0个

没有数据集链接到本文

在数据集的 README.md 中引用 arxiv.org/abs/2503.09642 即可从本页面链接。

引用本文的Spaces5个

包含本文的收藏集7个

浏览包含本文的7个收藏集 (https://huggingface.co/collections?paper=2503.09642)

相似文章

视频生成模型作为世界模拟器

OpenAI Blog

OpenAI的技术报告介绍了Sora视频生成模型,该模型通过视觉补丁统一多样化的视觉数据,支持大规模训练生成模型,能够生成长达一分钟的高清视频,支持可变的时长、宽高比和分辨率。

Sora 2 正式发布

OpenAI Blog

OpenAI 发布了 Sora 2,这是一个先进的视频生成模型,代表了人工智能内容创作能力的重大进步。

Sora 已推出

OpenAI Blog

OpenAI 已向公众推出其视频生成技术 Sora,并采取了包括 C2PA 元数据、水印和滥用防护在内的安全措施。该系统在物理学和复杂动作方面存在已知限制,但代表了人工智能驱动视频创作能力的重大进步。

Vallée Duhamel & Sora

OpenAI Blog

# Vallée Duhamel & Sora 来源:[https://openai.com/index/sora-vallee-duhamel/](https://openai.com/index/sora-vallee-duhamel/) [(在新窗口打开)](https://x.com/OpenAI)[(在新窗口打开)](https://www.youtube.com/OpenAI)[(在新窗口打开)](https://www.linkedin.com/company/openai)[(在新窗口打开)](https://github.com/openai)[(在新窗口打开)](https://www.instagram.com/openai/)[(在新窗口打开)](https://www.tiktok.com/@openai)[(在新窗口打开)