使用可训练稀疏注意力实现更快的视频扩散

Papers with Code Trending 论文

摘要

本文介绍了可训练稀疏注意力(VSA),一种硬件高效的稀疏注意力机制,它降低了视频扩散变换器的计算成本,而不影响性能,从而实现更高效的扩展和更快的生成。

扩展视频扩散变换器(DiTs)受限于其二次3D注意力,即使大部分注意力质量集中在少数位置上。我们将这一观察转化为VSA,一种可训练的、硬件高效的稀疏注意力,它在训练和推理中替代了全注意力。在VSA中,一个轻量级的粗阶段将令牌池化到瓦片中,并识别高权重关键令牌;一个细阶段仅在那些瓦片内计算令牌级注意力,遵循块计算布局以确保硬件效率。这导致了一个可微分的内核,它可以端到端训练,不需要事后分析,并保持FlashAttention3 MFU的85%。我们通过预训练从60M到1.4B参数的DiT进行了大量的消融研究和缩放定律实验。VSA达到一个帕累托点,将训练FLOPS减少了2.53倍而没有扩散损失下降。改造开源的Wan-2.1模型将注意力时间加速6倍,将端到端生成时间从31秒降低到18秒,且质量相当。这些结果确立了可训练稀疏注意力作为全注意力的实用替代方案,并作为进一步扩展视频扩散模型的关键推动因素。
查看原文
查看缓存全文

缓存时间: 2026/08/30 09:26

论文页 - 通过可训练稀疏注意力实现更快的视频扩散

来源:https://huggingface.co/papers/2505.13389
发布于 2025年5月19日

摘要

可训练稀疏注意力(VSA)以最小性能影响降低了视频扩散 Transformer 的计算成本,从而实现模型的高效扩展。

视频扩散 Transformer(https://huggingface.co/papers?q=video%20diffusion%20transformers)与 DiT(https://huggingface.co/papers?q=DiTs)的扩展受限于其二次型 3D 注意力机制,尽管大部分注意力权重实际集中在少数关键位置上。我们将此发现转化为 VSA(https://huggingface.co/papers?q=VSA)——一种可训练且硬件高效的稀疏注意力机制,在训练和推理阶段替代全注意力。在 VSA 中,轻量级粗粒度阶段将 token 聚合为分块,并识别高权重关键 token;细粒度阶段仅在这些分块内计算 token 级注意力(https://huggingface.co/papers?q=token-level%20attention),并采用分块计算(https://huggingface.co/papers?q=block%20computing)布局以确保硬件效率。这形成了一个可端到端训练的可微分内核,无需事后分析,并能保持 FlashAttention3(https://huggingface.co/papers?q=FlashAttention3)85% 的 MFU(https://huggingface.co/papers?q=MFU)。我们通过从 60M 到 1.4B 参数的 DiT(https://huggingface.co/papers?q=DiTs)预训练进行了大规模消融实验和扩展规律研究。VSA(https://huggingface.co/papers?q=VSA)达到了帕累托最优点,在无扩散损失(https://huggingface.co/papers?q=diffusion%20loss)下降的前提下,将训练 FLOPS(https://huggingface.co/papers?q=FLOPS)降低了 2.53 倍。对开源的 Wan-2.1 模型(https://huggingface.co/papers?q=Wan-2.1%20model)进行改造后,注意力计算时间加速 6 倍,端到端生成时间从 31 秒缩短至 18 秒,且质量相当。这些结果证实可训练稀疏注意力是全注意力的实用替代方案,也是进一步扩展视频扩散模型的关键技术。

查看 arXiv 页面(https://arxiv.org/abs/2505.13389)查看 PDF(https://arxiv.org/pdf/2505.13389)GitHub 4.16k auto(https://github.com/hao-ai-lab/FastVideo)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2505.13389)

在您的代理中获取此论文:
hf papers read 2505.13389

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型5

FastVideo/FastWan2.2-TI2V-5B-FullAttn-Diffusers 文本转视频• 5B• 更新于2025年11月25日 • 92.7k • 68(https://huggingface.co/FastVideo/FastWan2.2-TI2V-5B-FullAttn-Diffusers)

FastVideo/FastWan2.1-T2V-1.3B-Diffusers 文本转视频• 1B• 更新于1月5日 • 547 • 22(https://huggingface.co/FastVideo/FastWan2.1-T2V-1.3B-Diffusers)

FastVideo/FastWan2.1-T2V-14B-Diffusers 更新于2025年8月4日 • 409 • 18(https://huggingface.co/FastVideo/FastWan2.1-T2V-14B-Diffusers)

FastVideo/Wan2.1-VSA-T2V-14B-720P-Diffusers 更新于2025年8月4日 • 16 • 9(https://huggingface.co/FastVideo/Wan2.1-VSA-T2V-14B-720P-Diffusers)

浏览引用本文的 5 个模型(https://huggingface.co/models?other=arxiv:2505.13389)## 引用本文的数据集3

FastVideo/Wan2.2-Syn-121x704x1280_32k 查看器• 更新于2025年10月29日 • 33.3k • 12k • 7(https://huggingface.co/datasets/FastVideo/Wan2.2-Syn-121x704x1280_32k)

Hahshshsshbs/Wan2.2-Syn-121x704x1280_32k 查看器• 更新于7月7日 • 33.3k • 8.62k • 1(https://huggingface.co/datasets/Hahshshsshbs/Wan2.2-Syn-121x704x1280_32k)

johnnyeric/Wan-Syn_77x448x832_600k 查看器• 更新于2025年11月27日 • 4.26k • 1.06k(https://huggingface.co/datasets/johnnyeric/Wan-Syn_77x448x832_600k)

引用本文的空间26

浏览引用本文的 26 个空间(https://huggingface.co/spaces?arxivIds=2505.13389)## 包含本文的收藏夹2

相似文章

FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡

Hugging Face Daily Papers

FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。