SANA-Video:基于块线性扩散变压器的高效视频生成
摘要
SANA-Video是一个小型扩散模型,利用线性注意力和恒定内存KV缓存,高效生成高分辨率、长时长的视频,以显著更低的成本和更快的速度实现与现有模型相媲美的性能。
查看缓存全文
缓存时间: 2026/05/16 00:22
论文页面 - SANA-Video: 基于块线性扩散 Transformer 的高效视频生成
来源:https://huggingface.co/papers/2509.24695
发布于 2025年9月29日
·
由 https://huggingface.co/Yuyang-z 提交
Yuyang (https://huggingface.co/Yuyang-z) 于 2025年9月30日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
SANA-Video 是一个小型扩散模型,利用线性注意力和恒定内存 KV 缓存,高效生成高分辨率、高质量的视频,并具备强大的文本-视频对齐能力,在更低的成本和更快的速度下实现具有竞争力的性能。
我们推出了 SANA-Video,一个能够高效生成分辨率高达 720x1280、时长可达分钟级视频的小型扩散模型 (https://huggingface.co/papers?q=diffusion%20model)。SANA-Video 以极快的速度合成高分辨率、高质量的长视频,并具备强大的文本-视频对齐 (https://huggingface.co/papers?q=text-video%20alignment) 能力,可在 RTX 5090 GPU 上部署。我们的高效、有效且长视频生成依赖于两个核心设计:(1) 线性 DiT (https://huggingface.co/papers?q=Linear%20DiT):我们利用线性注意力 (https://huggingface.co/papers?q=linear%20attention) 作为核心运算,相较于处理视频生成中大量 token 的传统注意力机制,效率更高。(2) 用于块线性注意力的恒定内存 KV 缓存 (https://huggingface.co/papers?q=Constant-Memory%20KV%20cache):我们设计了一种基于块的自动回归 (https://huggingface.co/papers?q=block-wise%20autoregressive) 方法,通过利用线性注意力 (https://huggingface.co/papers?q=linear%20attention) 的累积特性,采用恒定内存状态来实现长视频生成。这种 KV 缓存为线性 DiT (https://huggingface.co/papers?q=Linear%20DiT) 提供固定内存成本的全局上下文,消除了传统 KV 缓存的需求,从而实现高效、分钟级视频生成。此外,我们探索了有效的数据过滤和模型训练策略,将训练成本缩减至在 64 块 H100 GPU 上仅需 12 天,仅为 MovieGen (https://huggingface.co/papers?q=MovieGen) 成本的 1%。凭借低成本优势,SANA-Video 在与现代最先进的小型扩散模型 (https://huggingface.co/papers?q=diffusion%20model)s(例如 Wan 2.1-1.3B 和 SkyReel-V2-1.3B)相比时,实现了具有竞争力的性能,同时实测延迟快 16 倍。此外,SANA-Video 可在 RTX 5090 GPU 上以 NVFP4 精度 (https://huggingface.co/papers?q=NVFP4%20precision) 进行部署,将生成 5 秒 720p 视频的推理速度从 71 秒加速到 29 秒(2.4 倍加速)。总之,SANA-Video 实现了低成本、高质量的视频生成。
查看 arXiv 页面 (https://arxiv.org/abs/2509.24695)
查看 PDF (https://arxiv.org/pdf/2509.24695)
项目页面 (https://nvlabs.github.io/Sana/Video)
GitHub 5.25k (https://github.com/NVlabs/Sana)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2509.24695)
在您的 agent 中获取此论文:
hf papers read 2509.24695
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 5
Efficient-Large-Model/SANA-Video_2B_720p 文本转视频 • 更新于 Mar 16 • 20 • 15 (https://huggingface.co/Efficient-Large-Model/SANA-Video_2B_720p)
Efficient-Large-Model/SANA-Video_2B_480p 文本转视频 • 更新于 Oct 28, 2025 • 88 • 14 (https://huggingface.co/Efficient-Large-Model/SANA-Video_2B_480p)
Efficient-Large-Model/SANA-Video_2B_480p_diffusers 文本转视频 • 更新于 Nov 4, 2025 • 5 (https://huggingface.co/Efficient-Large-Model/SANA-Video_2B_480p_diffusers)
Efficient-Large-Model/SANA-Video_2B_480p_LongLive_diffusers 文本转视频 • 更新于 Dec 9, 2025 • 2 (https://huggingface.co/Efficient-Large-Model/SANA-Video_2B_480p_LongLive_diffusers)
浏览引用此论文的 5 个模型 (https://huggingface.co/models?other=arxiv:2509.24695)
引用此论文的数据集 0
没有数据集链接此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2509.24695 以便在此页面链接。
引用此论文的 Space 1
包含此论文的收藏集 5
浏览包含此论文的 5 个收藏集 (https://huggingface.co/collections?paper=2509.24695)
相似文章
SANA-Video 2.0:基于混合线性注意力和注意力残差的高效视频生成
SANA-Video 2.0 为视频扩散Transformer引入了混合线性-softmax注意力机制,可在单个GPU上生成高达720p的高质量视频,与全softmax模型相比显著降低延迟,同时保持具有竞争力的VBench分数。
Nvidia 的新型长视频生成技术(12分钟阅读)
NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。
Efficient-Large-Model/SANA-WM_bidirectional
SANA-WM 是一个高效的 2.6B 参数开源世界模型,用于分钟级视频生成并具备精确的相机控制。它采用混合线性扩散变换器和两阶段流水线,从图像和文本提示生成 720p 视频。
SANA-WM: 高效分钟级世界建模与混合线性扩散Transformer
SANA-WM是一个拥有26亿参数的开源世界模型,能生成高保真720p分钟级视频,支持精确相机控制,在达到工业级质量的同时显著降低计算需求。
LVSA: 用于长视频扩散的无训练稀疏注意力
LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。