FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡

Hugging Face Daily Papers 论文

摘要

FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。

视频扩散Transformer处理长时空序列,使得自注意力成为高分辨率视频生成的主要瓶颈。无需训练的稀疏注意力能降低这一成本,但自适应Top-p路由在多GPU序列并行下会产生不均匀的每头负载。这种负载异构性导致稀疏注意力变成rank级别的拖尾问题。我们提出的方法是一种无需训练的稀疏注意力系统,旨在提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。该方法使用Top-p路由、Top-k安全底限和视频感知的块组织作为稀疏路由前端,然后在运行时修复具体的注意力掩码。运行时负载均衡通过P2P通信迁移少量重载头以缩短当前关键路径。松弛感知的稀疏增强将剩余非关键路径的松弛填充上额外的高价值块,同时重叠将调度和迁移开销隐藏在已有计算之后。在步骤蒸馏的Wan2.2 I2V上,该方法将平均负载不平衡从1.34降至1.08,注意力速度相比FlashAttention提升4.41倍,DiT推理速度提升2.02-2.11倍,并保持有竞争力的视频质量。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:08

论文页面 - FVAttn:面向视频生成的运行时负载均衡自适应稀疏注意力

来源:https://huggingface.co/papers/2607.16190

摘要

视频扩散变换器处理长时空序列,使得自注意力成为高分辨率视频生成的主要瓶颈。无训练稀疏注意力降低了这一成本,但自适应Top-proving在多GPU序列并行下产生了不均匀的每头工作负载。由此产生的工作负载异构性将稀疏注意力转变为一个排名级别的掉队问题。我们提出了一种无训练稀疏注意力系统,它改善了自适应稀疏注意力在多GPU序列并行下的分布式执行效率。该系统使用Top-proving、Top-k安全底限和视频感知块组织作为稀疏路由前端,然后在运行时修复物化的掩码。运行时负载均衡通过点对点通信迁移少量重型头来缩短当前关键路径。松弛感知稀疏增强利用额外的有价值块填补剩余的非关键排名松弛,同时通过重叠隐藏调度和迁移开销。在step-distilled Wan2.2I2V上,平均负载不平衡从1.34降至1.08,并且相比FlashAttention实现了4.41倍的注意力加速,同时实现了2.02–2.11倍的DiT推理加速,视频质量具有竞争力。

查看arXiv页面 (https://arxiv.org/abs/2607.16190) 查看PDF (https://arxiv.org/pdf/2607.16190) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16190)

在你的agent中获取本论文:

hf papers read 2607.16190

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

没有模型链接本论文

在模型README.md中引用arxiv.org/abs/2607.16190以从此页面链接。

引用本论文的数据集0

没有数据集链接本论文

在数据集README.md中引用arxiv.org/abs/2607.16190以从此页面链接。

引用本论文的Spaces0

没有Space链接本论文

在Space README.md中引用arxiv.org/abs/2607.16190以从此页面链接。

包含本论文的收藏0

没有收藏包含本论文

将本论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力

arXiv cs.CL

SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。