分区支持,重构残差:面向视频生成和世界模型的训练无关稀疏注意力
摘要
SparsePR 是一种训练无关的方法,通过使用响应耦合分区和探测拟合残差重构来减少注意力误差,同时保持生成质量,从而加速视频变换器。
查看缓存全文
缓存时间: 2026/08/24 16:29
论文页面 - 划分支持集,重构残差:免训练的视频生成与世界模型稀疏注意力机制
来源:https://huggingface.co/papers/2608.18484
发布于8月19日
·
由https://huggingface.co/PardisTaghavi提交
pardis (https://huggingface.co/PardisTaghavi)于8月24日发布
摘要
SparsePR通过响应耦合划分与探针拟合残差重构加速视频Transformer,在低执行对密度下降低注意力误差并实现显著加速。
免训练的块稀疏注意力 (https://huggingface.co/papers?q=block-sparse%20attention) 能够加速视频Transformer (https://huggingface.co/papers?q=video%20transformers),但仅按行划分注意力集中区域本身无法指定可执行的稀疏算子。共享划分路径的查询可能具有重叠度较低的支持集,而仅保留注意力质量并不能决定跳过交互导致的softmax后误差。我们发现划分几何结构既影响合并支持集,也影响从稀疏输出预测剩余残差的可行性。我们提出SparsePR (https://huggingface.co/papers?q=SparsePR),该方法结合了响应耦合划分 (https://huggingface.co/papers?q=Response-Coupled%20Partitioning) 与探针拟合残差重构 (https://huggingface.co/papers?q=Probe-Fitted%20Residual%20Reconstruction)。采样查询的键响应形成成对的K/V分组,其质心为共享路由生成查询响应坐标。随后利用少量精确查询行,在探针残差观测到的输出子空间内,从稀疏输出校准特定调用的仿射修正。在四种异构视频生成与世界模型中,SparsePR (https://huggingface.co/papers?q=SparsePR) 持续降低注意力重构误差 (https://huggingface.co/papers?q=attention-reconstruction%20error)。消融实验表明探针拟合贡献了大部分误差降低,而响应耦合划分 (https://huggingface.co/papers?q=response-coupled%20partitioning) 则降低了硬丢弃误差并在有限探针预算下改善重构效果。SparsePR (https://huggingface.co/papers?q=SparsePR) 在实现22.0-26.0%的执行对密度 (https://huggingface.co/papers?q=executed-pair%20density) 时保持了生成质量,并实现1.48x-2.61x的端到端加速。项目页面:https://pardistaghavi.github.io/SparsePR-website/
查看arXiv页面 (https://arxiv.org/abs/2608.18484) 查看PDF (https://arxiv.org/pdf/2608.18484) 项目页面 (https://pardistaghavi.github.io/SparsePR-website/) GitHub14 (https://github.com/PardisTaghavi/SparsePR) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18484)
在你的智能体中获取此论文:
hf papers read 2608.18484
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型:0
无模型关联此论文
在模型README.md中引用arxiv.org/abs/2608.18484以从此页面关联。
引用此论文的数据集:0
无数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2608.18484以从此页面关联。
引用此论文的Space:0
无Space关联此论文
在Space README.md中引用arxiv.org/abs/2608.18484以从此页面关联。
包含此论文的收藏:0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面关联。
相似文章
Sol-Attn: 通过即时注意力稀疏化加速视频生成推理
Sol-Attn 提出了一种无需训练的方法,用于视频生成推理的注意力稀疏化,通过在线softmax过程中动态选择键值块,实现了超过2倍的速度提升,且质量损失极小。
FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡
FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。
使用稀疏Transformer进行生成建模
OpenAI推出了稀疏Transformer,一种深度神经网络,将注意力机制的复杂度从O(N²)优化到O(N√N),使得能够对长度超过以前30倍的序列进行建模,适用于文本、图像和音频领域。该模型采用稀疏注意力模式和基于检查点的内存优化技术,可以训练深达128层的网络,在多个领域实现了最先进的性能。
使用可训练稀疏注意力实现更快的视频扩散
本文介绍了可训练稀疏注意力(VSA),一种硬件高效的稀疏注意力机制,它降低了视频扩散变换器的计算成本,而不影响性能,从而实现更高效的扩展和更快的生成。
LVSA: 用于长视频扩散的无训练稀疏注意力
LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。