FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡
摘要
FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。
查看缓存全文
缓存时间: 2026/07/24 05:08
论文页面 - FVAttn:面向视频生成的运行时负载均衡自适应稀疏注意力
来源:https://huggingface.co/papers/2607.16190
摘要
视频扩散变换器处理长时空序列,使得自注意力成为高分辨率视频生成的主要瓶颈。无训练稀疏注意力降低了这一成本,但自适应Top-proving在多GPU序列并行下产生了不均匀的每头工作负载。由此产生的工作负载异构性将稀疏注意力转变为一个排名级别的掉队问题。我们提出了一种无训练稀疏注意力系统,它改善了自适应稀疏注意力在多GPU序列并行下的分布式执行效率。该系统使用Top-proving、Top-k安全底限和视频感知块组织作为稀疏路由前端,然后在运行时修复物化的掩码。运行时负载均衡通过点对点通信迁移少量重型头来缩短当前关键路径。松弛感知稀疏增强利用额外的有价值块填补剩余的非关键排名松弛,同时通过重叠隐藏调度和迁移开销。在step-distilled Wan2.2I2V上,平均负载不平衡从1.34降至1.08,并且相比FlashAttention实现了4.41倍的注意力加速,同时实现了2.02–2.11倍的DiT推理加速,视频质量具有竞争力。
查看arXiv页面 (https://arxiv.org/abs/2607.16190) 查看PDF (https://arxiv.org/pdf/2607.16190) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16190)
在你的agent中获取本论文:
hf papers read 2607.16190
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
没有模型链接本论文
在模型README.md中引用arxiv.org/abs/2607.16190以从此页面链接。
引用本论文的数据集0
没有数据集链接本论文
在数据集README.md中引用arxiv.org/abs/2607.16190以从此页面链接。
引用本论文的Spaces0
没有Space链接本论文
在Space README.md中引用arxiv.org/abs/2607.16190以从此页面链接。
包含本论文的收藏0
没有收藏包含本论文
将本论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
使用可训练稀疏注意力实现更快的视频扩散
本文介绍了可训练稀疏注意力(VSA),一种硬件高效的稀疏注意力机制,它降低了视频扩散变换器的计算成本,而不影响性能,从而实现更高效的扩展和更快的生成。
Sol-Attn: 通过即时注意力稀疏化加速视频生成推理
Sol-Attn 提出了一种无需训练的方法,用于视频生成推理的注意力稀疏化,通过在线softmax过程中动态选择键值块,实现了超过2倍的速度提升,且质量损失极小。
LVSA: 用于长视频扩散的无训练稀疏注意力
LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。
SANA-Video 2.0:基于混合线性注意力和注意力残差的高效视频生成
SANA-Video 2.0 为视频扩散Transformer引入了混合线性-softmax注意力机制,可在单个GPU上生成高达720p的高质量视频,与全softmax模型相比显著降低延迟,同时保持具有竞争力的VBench分数。
面向可扩展向量架构的FlashAttention
FlashAttention-V引入了针对可扩展向量架构的分块FlashAttention优化,在CPU上的小型语言模型transformer推理中实现了高达42倍的加速,并识别了量化瓶颈。