LVSA: 用于长视频扩散的无训练稀疏注意力
摘要
LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。
查看缓存全文
缓存时间: 2026/06/02 15:36
论文页面 - LVSA:长视频扩散中的无训练稀疏注意力
来源: https://huggingface.co/papers/2605.31057
摘要
长视频稀疏注意力(LVSA)通过引入一种稀疏注意力机制,解决了视频扩散模型中的计算瓶颈问题,在保持视频质量的同时降低了计算成本,即使超出训练时间范围也能维持效果。
密集自注意力(https://huggingface.co/papers?q=Dense%20self-attention)是长视频扩散推理的计算和质量瓶颈:其计算成本随序列长度呈二次方增长,且超出训练时间范围后,模型会收敛到近乎静态的输出,即“冻结“的重复视频。当前最先进的方法要么成本过高(例如需要重新训练),要么无法以可扩展的方式同时满足性能和质量目标。为此,我们提出了长视频稀疏注意力(LVSA),这是一种无需训练、与模型无关的块稀疏注意力(https://huggingface.co/papers?q=block-sparse%20attention)机制,专门用于视频扩散变换器(https://huggingface.co/papers?q=video%20diffusion%20transformers)。该方法结合了结构化窗口模式(https://huggingface.co/papers?q=structured%20window%20pattern)与旋转全局锚点(https://huggingface.co/papers?q=rotating%20global%20anchors),从而消除了导致长时域伪影的固定网格偏差。与FlashInfer内核(https://huggingface.co/papers?q=FlashInfer%20kernel)结合后,LVSA在Wan 2.1 1.3B模型上(6倍时间范围)相比密集注意力将计算量减少高达3.17倍,在Wan 2.1 14B模型上(6倍时间范围)减少2.98倍,在HunyuanVideo 1.5模型上(1.5倍时间范围)减少3.33倍。除了降低计算成本,LVSA还能在2倍时间范围内生成HunyuanVideo 1.5,这在单GPU上原本会内存不足。此外,在Wan 2.1 1.3B模型上,LVSA相比RIFLEx(https://huggingface.co/papers?q=RIFLEx)实现高达2.41倍的加速,相比UltraViCo(https://huggingface.co/papers?q=UltraViCo)实现高达3.27倍的加速。为了展示其跨平台的适用性,我们将LVSA应用于NPU,在Wan 2.2 A14B和Wan 2.1 1.3B模型上相比密集注意力分别实现了高达2.71倍和3.24倍的加速。为了公平评估质量,我们引入了VQeval(https://huggingface.co/papers?q=VQeval)工具,它能正确评估循环视频失败的情况,而这类失败在当前最先进的评估工具(如VBench-Long)(https://huggingface.co/papers?q=VBench-Long)中反而会被奖励。LVSA在训练时间范围内的生成中保持质量中性,在扩展时间范围内则能提升质量。
查看arXiv页面(https://arxiv.org/abs/2605.31057)查看PDF(https://arxiv.org/pdf/2605.31057)GitHub13(https://github.com/JiusiServe/LongVideoSparseAttention)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.31057)
在你的智能体中获取这篇论文:
hf papers read 2605\.31057
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
没有模型关联本论文
请在模型README.md中引用arxiv.org/abs/2605.31057,以便从此页面链接。
引用本论文的数据集0
没有数据集关联本论文
请在数据集README.md中引用arxiv.org/abs/2605.31057,以便从此页面链接。
引用本论文的太空0
没有太空关联本论文
请在太空README.md中引用arxiv.org/abs/2605.31057,以便从此页面链接。
包含本论文的收藏0
没有收藏包含本论文
请将本论文添加到收藏(https://huggingface.co/new-collection),以便从此页面链接。
相似文章
使用可训练稀疏注意力实现更快的视频扩散
本文介绍了可训练稀疏注意力(VSA),一种硬件高效的稀疏注意力机制,它降低了视频扩散变换器的计算成本,而不影响性能,从而实现更高效的扩展和更快的生成。
FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡
FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。
VideoMLA:用于分钟级自回归视频扩散的低秩潜变量KV缓存
VideoMLA 用共享的低秩潜变量和解耦的 3D-RoPE 位置键替换了视频扩散模型中每个头的 KV 缓存,在 B200 上将每个 token 的 KV 内存降低了 92.7%,吞吐量提升了 1.23 倍,同时在 VBench 基准测试中保持了质量。
SANA-Video:基于块线性扩散变压器的高效视频生成
SANA-Video是一个小型扩散模型,利用线性注意力和恒定内存KV缓存,高效生成高分辨率、长时长的视频,以显著更低的成本和更快的速度实现与现有模型相媲美的性能。
OPSD-V: 面向后训练少步自回归视频生成器的在线策略自蒸馏
OPSD-V 通过使用真实长视频数据作为训练时的时间上下文,提供密集的轨迹级监督,从而增强视觉质量和运动动态,同时不改变推理机制,改进了少步自回归视频扩散模型。