SANA-Video 2.0:基于混合线性注意力和注意力残差的高效视频生成
摘要
SANA-Video 2.0 为视频扩散Transformer引入了混合线性-softmax注意力机制,可在单个GPU上生成高达720p的高质量视频,与全softmax模型相比显著降低延迟,同时保持具有竞争力的VBench分数。
查看缓存全文
缓存时间: 2026/07/24 13:01
论文页面 - SANA-Video 2.0:面向高效视频生成的混合线性注意力与注意力残差
来源:https://huggingface.co/papers/2607.21553
发布于 7 月 23 日
·
由 https://huggingface.co/Lawrence-cj 提交
Chen (https://huggingface.co/Lawrence-cj) 于 7 月 24 日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们提出了 SANA-Video 2.0,这是一种在统一架构下以 5B 和 14B 规模实例化的混合视频扩散 Transformer。该模型旨在单块 GPU 上生成高达 720p 的高质量视频,在保留线性注意力对长序列的良好扩展性的同时,在质量上与全 softmax 视频 DiT 相当。为避免全程使用二次注意力,Hybrid Linear-Softmax Attention 以 3:1 的比例将门控线性注意力(O(N) 主导的混合)与周期性门控 softmax 锚点相结合,恢复了纯线性注意力所缺失的全秩 token 交互。为跨深度传播这些刷新后的表示,Block Attention Residuals(AttnRes)将完整的块摘要路由到后续线性层,从而实现锚点特征复用,并将深层有效秩提升约 12%。通过从头训练,SANA-Video 2.0 直接学习完整的混合架构,而非线性化预训练模型,并通过降低分辨率的代理研究确定了 25% softmax 为最优质量-效率权衡。使用 40 步采样,SANA-Video 2.0 在单块 H100 上以 480p 分辨率、13.2 秒内达到 VBench 得分 84.30,在远小于大型 softmax 视频 DiT 的延迟下仍保持竞争力。其编译后的 DiT 前向传播在 720p/60s 下比匹配的全 softmax 基线快 3.2 倍,且该差距随视频时长增加而扩大。此外,全栈 Sol-Engine 优化(内核融合、缓存和稀疏注意力)将这一硬件友好型骨干进一步加速 3.58 倍,使 5B 流水线在 720p/5s 下达到 13.06 秒,比非 H100 上的 Wan2.2-A14B 快 120 倍。总体而言,我们的混合设计以显著降低的成本恢复了 softmax 级别的表达能力,解锁了可扩展的长时、高分辨率视频生成。
查看 arXiv 页面 (https://arxiv.org/abs/2607.21553)
查看 PDF (https://arxiv.org/pdf/2607.21553)
项目页面 (https://nvlabs.github.io/Sana/Video2)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21553)
在你的 agent 中获取这篇论文:
hf papers read 2607.21553
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
没有模型链接到这篇论文
在模型 README.md 中引用 arxiv.org/abs/2607.21553 即可从本页链接。
引用该论文的数据集 0
没有数据集链接到这篇论文
在数据集 README.md 中引用 arxiv.org/abs/2607.21553 即可从本页链接。
引用该论文的 Spaces 0
没有 Space 链接到这篇论文
在 Space README.md 中引用 arxiv.org/abs/2607.21553 即可从本页链接。
包含该论文的收藏集 0
没有包含该论文的收藏集
将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
SANA-Video:基于块线性扩散变压器的高效视频生成
SANA-Video是一个小型扩散模型,利用线性注意力和恒定内存KV缓存,高效生成高分辨率、长时长的视频,以显著更低的成本和更快的速度实现与现有模型相媲美的性能。
Nvidia 的新型长视频生成技术(12分钟阅读)
NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。
Efficient-Large-Model/SANA-WM_bidirectional
SANA-WM 是一个高效的 2.6B 参数开源世界模型,用于分钟级视频生成并具备精确的相机控制。它采用混合线性扩散变换器和两阶段流水线,从图像和文本提示生成 720p 视频。
FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡
FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。
@songhan_mit: 探索SANA World Model,采用混合线性注意力,高效且快速!
SANA World Model是一个新的人工智能模型,采用混合线性注意力,以实现高效和快速。