Nvidia 的新型长视频生成技术(12分钟阅读)

TLDR AI 模型

摘要

NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。

SANA-Video 2.0 将线性注意力与周期性 softmax 层相结合,可在单个 GPU 上生成最高 720p 的视频。其 5B 和 14B 模型在保持有竞争力质量的同时,显著降低了长视频和高分辨率生成的延迟。
查看原文
查看缓存全文

缓存时间: 2026/07/27 13:39

# SANA-Video 2.0 来源: https://nvlabs.github.io/Sana/Video2/ NVIDIA Research · 高效AI团队与新加坡实验室 混合线性注意力与注意力残差:高效视频生成 Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin, Yuyang Zhao, Tian Ye, Zhangjie Wu, Zian Wang, Daquan Zhou, Ping Luo, Song Han, Enze Xie NVIDIA **84.30** VBench 总分 **13.06s** 720p/5s · 单张 H100 **3.2×** 比softmax快(60秒时)**120×** 比 Wan 2.2 14B 快 ## 单H100延迟 720p / 5s · 单张 H100 · 40步 **120×** Wan 2.2 14B **1556** Hunyuan **788** LTX-2.3 **130** Ours 14B **69.3** Ours 5B + Sol **13.06** 对数刻度 秒 ↓ 论文概述 ## 摘要 混合线性注意力与注意力残差:高效视频生成 我们推出了 **SANA-Video 2.0**,这是一个混合视频扩散Transformer,在统一架构下实例化为5B和14B两种尺度。它专为在单块GPU上生成最高720p的高质量视频而设计,在质量上与全softmax视频DiT相当,同时保留了线性注意力在长序列上的良好扩展性。为了避免全局使用二次注意力,**混合线性-softmax注意力**将门控线性注意力(用于O(N)主导的混合)与周期性门控softmax锚点以3:1的比例结合,恢复了纯线性注意力所缺乏的全秩Token交互。为了在深度方向传播这些刷新后的表示,**块注意力残差(AttnRes)**将已完成块的摘要路由到后续线性层,实现了锚点特征复用,并将深层有效秩提升约12%。通过从头训练,SANA-Video 2.0直接学习完整的混合架构,而非对预训练模型进行线性化,并通过降低分辨率的代理研究确定25% softmax为最佳质量-效率权衡。在40步采样下,SANA-Video 2.0在单张H100上以480p和13.2秒的耗时取得VBench分数84.30,与规模大得多的softmax视频DiT相比,延迟仅为后者的一小部分。其编译后的DiT前向传播在720p/60秒下比匹配的全softmax基线 **快3.2倍**,且该差距随视频时长扩大而进一步增大。此外,全栈Sol-Engine优化(内核融合、缓存和稀疏注意力)将此硬件友好型骨干网络再加速 **3.58倍**,使5B管道在720p/5秒下达到 **13.06秒**,在单张H100上比Wan 2.2-A14B **快120倍**。总体而言,我们的混合设计以显著降低的成本恢复了softmax级别的表达能力,为可扩展的长视频和高分辨率视频生成铺平了道路。 论文 ## SANA-Video 2.0 混合线性注意力与注意力残差:高效视频生成 BibTeX `` @misc{chen2026sanavideo20hybridlinear, title = {SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation}, author = {Junsong Chen and Jincheng Yu and Yitong Li and Shuchen Xue and Haozhe Liu and Jingyu Xin and Yuyang Zhao and Tian Ye and Zhangjie Wu and Zian Wang and Daquan Zhou and Ping Luo and Song Han and Enze Xie}, year = {2026}, eprint = {2607.21553}, archivePrefix = {arXiv}, primaryClass = {cs.CV}, doi = {10.48550/arXiv.2607.21553}, url = {https://arxiv.org/abs/2607.21553} } ``

相似文章

视频生成的并行解码(10分钟阅读)

TLDR AI

NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。

实时长视频生成(GitHub仓库)

TLDR AI

NVlabs 发布了 LongLive 2.0,这是一个采用 NVFP4 量化的实时长视频生成并行基础设施,同时支持训练和推理。它达到了 45.7 FPS,并被 ICLR 2026 接收。