SANA-Video 2.0:基于混合线性注意力和注意力残差的高效视频生成

Hugging Face Daily Papers 论文

摘要

SANA-Video 2.0 为视频扩散Transformer引入了混合线性-softmax注意力机制,可在单个GPU上生成高达720p的高质量视频,与全softmax模型相比显著降低延迟,同时保持具有竞争力的VBench分数。

我们推出了SANA-Video 2.0,一种在统一架构下实例化为5B和14B规模的混合视频扩散Transformer。该模型旨在单个GPU上生成高达720p的高质量视频,在保持线性注意力有利的长序列扩展能力的同时,其质量与全softmax视频DiT相当。为避免全程使用二次注意力,混合线性-Softmax注意力以3:1的比例将用于O(N)主导混合的门控线性注意力与周期性门控softmax锚点相结合,恢复了纯线性注意力所缺乏的全秩令牌交互。为在深度方向上传播这些更新后的表征,块注意力残差(AttnRes)将已完成的块摘要路由到后续线性层,实现了锚点特征复用,并将深层有效秩提升约12%。通过从头训练,SANA-Video 2.0 直接学习完整的混合机制,而非对预训练模型进行线性化处理,降低分辨率代理研究确定25% softmax为最佳的效率-质量平衡点。采用40步采样时,SANA-Video 2.0 在单个H100上以480p分辨率、13.2秒内实现了84.30的VBench分数,与规模大得多的softmax视频DiT竞争,且延迟仅为后者的极小部分。其编译后的DiT前向传播在720p/60秒下比匹配的全softmax基线快3.2倍,且该差距随视频时长增加而扩大。此外,全栈Sol-Engine优化(内核融合、缓存和稀疏注意力)进一步加速了这一硬件友好型骨干网络,提速达3.58倍,使得5B管道在720p/5秒下仅需13.06秒,并在单个H100上比Wan 2.2-A14B快120倍。总体而言,我们的混合设计以大幅降低的成本恢复了softmax级别的表达能力,实现了可扩展的长时长、高分辨率视频生成。
查看原文
查看缓存全文

缓存时间: 2026/07/24 13:01

论文页面 - SANA-Video 2.0:面向高效视频生成的混合线性注意力与注意力残差

来源:https://huggingface.co/papers/2607.21553
发布于 7 月 23 日

·
由 https://huggingface.co/Lawrence-cj 提交

Chen (https://huggingface.co/Lawrence-cj) 于 7 月 24 日

作者:

摘要

我们提出了 SANA-Video 2.0,这是一种在统一架构下以 5B 和 14B 规模实例化的混合视频扩散 Transformer。该模型旨在单块 GPU 上生成高达 720p 的高质量视频,在保留线性注意力对长序列的良好扩展性的同时,在质量上与全 softmax 视频 DiT 相当。为避免全程使用二次注意力,Hybrid Linear-Softmax Attention 以 3:1 的比例将门控线性注意力(O(N) 主导的混合)与周期性门控 softmax 锚点相结合,恢复了纯线性注意力所缺失的全秩 token 交互。为跨深度传播这些刷新后的表示,Block Attention Residuals(AttnRes)将完整的块摘要路由到后续线性层,从而实现锚点特征复用,并将深层有效秩提升约 12%。通过从头训练,SANA-Video 2.0 直接学习完整的混合架构,而非线性化预训练模型,并通过降低分辨率的代理研究确定了 25% softmax 为最优质量-效率权衡。使用 40 步采样,SANA-Video 2.0 在单块 H100 上以 480p 分辨率、13.2 秒内达到 VBench 得分 84.30,在远小于大型 softmax 视频 DiT 的延迟下仍保持竞争力。其编译后的 DiT 前向传播在 720p/60s 下比匹配的全 softmax 基线快 3.2 倍,且该差距随视频时长增加而扩大。此外,全栈 Sol-Engine 优化(内核融合、缓存和稀疏注意力)将这一硬件友好型骨干进一步加速 3.58 倍,使 5B 流水线在 720p/5s 下达到 13.06 秒,比非 H100 上的 Wan2.2-A14B 快 120 倍。总体而言,我们的混合设计以显著降低的成本恢复了 softmax 级别的表达能力,解锁了可扩展的长时、高分辨率视频生成。

查看 arXiv 页面 (https://arxiv.org/abs/2607.21553)
查看 PDF (https://arxiv.org/pdf/2607.21553)
项目页面 (https://nvlabs.github.io/Sana/Video2)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21553)

在你的 agent 中获取这篇论文:

hf papers read 2607.21553

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

没有模型链接到这篇论文

在模型 README.md 中引用 arxiv.org/abs/2607.21553 即可从本页链接。

引用该论文的数据集 0

没有数据集链接到这篇论文

在数据集 README.md 中引用 arxiv.org/abs/2607.21553 即可从本页链接。

引用该论文的 Spaces 0

没有 Space 链接到这篇论文

在 Space README.md 中引用 arxiv.org/abs/2607.21553 即可从本页链接。

包含该论文的收藏集 0

没有包含该论文的收藏集

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

Nvidia 的新型长视频生成技术(12分钟阅读)

TLDR AI

NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。

Efficient-Large-Model/SANA-WM_bidirectional

Hugging Face Models Trending

SANA-WM 是一个高效的 2.6B 参数开源世界模型,用于分钟级视频生成并具备精确的相机控制。它采用混合线性扩散变换器和两阶段流水线,从图像和文本提示生成 720p 视频。

FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡

Hugging Face Daily Papers

FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。