LVSA: 用于长视频扩散的无训练稀疏注意力

Hugging Face Daily Papers 论文

摘要

LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。

密集自注意力是长视频扩散推理中计算和质量的瓶颈:计算成本随序列长度呈二次方增长,且超出训练时长后,模型会收敛到近乎静态的输出,即“冻结”的重复视频。现有最先进的方法要么成本过高(例如需要重新训练),要么无法以可扩展的方式同时满足性能和质量的目 标。为此,我们提出了长视频稀疏注意力(LVSA),这是一种无训练、模型无关的块稀疏注意力机制,适用于视频扩散变换器。它结合了结构化窗口模式与旋转全局锚点,从而消除了导致长时域伪影的固定网格偏差。LVSA 与 FlashInfer 内核相结合,在 6 倍时长下,可将 Wan 2.1 1.3B 的计算量减少高达 3.17 倍,在 6 倍时长下将 Wan 2.1 14B 的计算量减少 2.98 倍,在 1.5 倍时长下将 HunyuanVideo 1.5 的计算量减少 3.33 倍(与密集注意力相比)。除了减少计算量之外,LVSA 还能够以 2 倍时长生成 HunyuanVideo 1.5,而这在单 GPU 上原本会内存溢出。此外,在 Wan 2.1 1.3B 上,与 RIFLEx 相比,LVSA 实现了最高 2.41 倍的加速,与 UltraViCo 相比实现了最高 3.27 倍的加速。为了展示在不同平台上的适用性,我们将 LVSA 应用于 NPU,与密集注意力相比,在 Wan 2.2 A14B 上实现了最高 2.71 倍的加速,在 Wan 2.1 1.3B 上实现了最高 3.24 倍的加速。为了公平地评估质量,我们引入了 VQeval,这是一个能够正确评分循环视频失败的工具,而此类失败在 VBench-Long 等最先进评估器中反而会受到奖励。LVSA 在训练时长长度下生成时质量中性,在扩展长度下质量积极。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:36

论文页面 - LVSA:长视频扩散中的无训练稀疏注意力

来源: https://huggingface.co/papers/2605.31057

摘要

长视频稀疏注意力(LVSA)通过引入一种稀疏注意力机制,解决了视频扩散模型中的计算瓶颈问题,在保持视频质量的同时降低了计算成本,即使超出训练时间范围也能维持效果。

密集自注意力(https://huggingface.co/papers?q=Dense%20self-attention)是长视频扩散推理的计算和质量瓶颈:其计算成本随序列长度呈二次方增长,且超出训练时间范围后,模型会收敛到近乎静态的输出,即“冻结“的重复视频。当前最先进的方法要么成本过高(例如需要重新训练),要么无法以可扩展的方式同时满足性能和质量目标。为此,我们提出了长视频稀疏注意力(LVSA),这是一种无需训练、与模型无关的块稀疏注意力(https://huggingface.co/papers?q=block-sparse%20attention)机制,专门用于视频扩散变换器(https://huggingface.co/papers?q=video%20diffusion%20transformers)。该方法结合了结构化窗口模式(https://huggingface.co/papers?q=structured%20window%20pattern)与旋转全局锚点(https://huggingface.co/papers?q=rotating%20global%20anchors),从而消除了导致长时域伪影的固定网格偏差。与FlashInfer内核(https://huggingface.co/papers?q=FlashInfer%20kernel)结合后,LVSA在Wan 2.1 1.3B模型上(6倍时间范围)相比密集注意力将计算量减少高达3.17倍,在Wan 2.1 14B模型上(6倍时间范围)减少2.98倍,在HunyuanVideo 1.5模型上(1.5倍时间范围)减少3.33倍。除了降低计算成本,LVSA还能在2倍时间范围内生成HunyuanVideo 1.5,这在单GPU上原本会内存不足。此外,在Wan 2.1 1.3B模型上,LVSA相比RIFLEx(https://huggingface.co/papers?q=RIFLEx)实现高达2.41倍的加速,相比UltraViCo(https://huggingface.co/papers?q=UltraViCo)实现高达3.27倍的加速。为了展示其跨平台的适用性,我们将LVSA应用于NPU,在Wan 2.2 A14B和Wan 2.1 1.3B模型上相比密集注意力分别实现了高达2.71倍和3.24倍的加速。为了公平评估质量,我们引入了VQeval(https://huggingface.co/papers?q=VQeval)工具,它能正确评估循环视频失败的情况,而这类失败在当前最先进的评估工具(如VBench-Long)(https://huggingface.co/papers?q=VBench-Long)中反而会被奖励。LVSA在训练时间范围内的生成中保持质量中性,在扩展时间范围内则能提升质量。

查看arXiv页面(https://arxiv.org/abs/2605.31057)查看PDF(https://arxiv.org/pdf/2605.31057)GitHub13(https://github.com/JiusiServe/LongVideoSparseAttention)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.31057)

在你的智能体中获取这篇论文:

hf papers read 2605\.31057

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

没有模型关联本论文

请在模型README.md中引用arxiv.org/abs/2605.31057,以便从此页面链接。

引用本论文的数据集0

没有数据集关联本论文

请在数据集README.md中引用arxiv.org/abs/2605.31057,以便从此页面链接。

引用本论文的太空0

没有太空关联本论文

请在太空README.md中引用arxiv.org/abs/2605.31057,以便从此页面链接。

包含本论文的收藏0

没有收藏包含本论文

请将本论文添加到收藏(https://huggingface.co/new-collection),以便从此页面链接。

相似文章

使用可训练稀疏注意力实现更快的视频扩散

Papers with Code Trending

本文介绍了可训练稀疏注意力(VSA),一种硬件高效的稀疏注意力机制,它降低了视频扩散变换器的计算成本,而不影响性能,从而实现更高效的扩展和更快的生成。

FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡

Hugging Face Daily Papers

FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。