分区支持,重构残差:面向视频生成和世界模型的训练无关稀疏注意力

Hugging Face Daily Papers 论文

摘要

SparsePR 是一种训练无关的方法,通过使用响应耦合分区和探测拟合残差重构来减少注意力误差,同时保持生成质量,从而加速视频变换器。

训练无关的块稀疏注意力可以加速视频变换器,但逐行注意力集中本身并不能指定可执行的稀疏操作符。共享块路由的查询可能具有较差重叠的支持,而仅保留的注意力质量并不能决定跳过交互后的softmax误差。我们表明,分区几何形状既影响池化支持,也影响从稀疏输出中预测剩余残差的能力。我们引入了SparsePR,它结合了响应耦合分区和探测拟合残差重构。采样查询键响应形成配对的K/V组,其质心诱导查询-响应坐标用于共享路由。然后,一小部分精确查询行在探测残差中观察到的输出子空间内,从稀疏输出校准特定调用的仿射校正。在四个异构视频生成和世界模型中,SparsePR 一致减少了注意力重构误差。消融研究表明,探测拟合贡献了大部分这种减少,而响应耦合分区降低了硬丢弃误差,并在有限探测预算下改善了重构。SparsePR 在22.0-26.0%的实现执行对密度下保持生成质量,同时实现1.48倍至2.61倍的端到端加速。项目页面:https://pardistaghavi.github.io/SparsePR-website/
查看原文
查看缓存全文

缓存时间: 2026/08/24 16:29

论文页面 - 划分支持集,重构残差:免训练的视频生成与世界模型稀疏注意力机制

来源:https://huggingface.co/papers/2608.18484
发布于8月19日

·

由https://huggingface.co/PardisTaghavi提交

pardis (https://huggingface.co/PardisTaghavi)于8月24日发布

摘要

SparsePR通过响应耦合划分与探针拟合残差重构加速视频Transformer,在低执行对密度下降低注意力误差并实现显著加速。

免训练的块稀疏注意力 (https://huggingface.co/papers?q=block-sparse%20attention) 能够加速视频Transformer (https://huggingface.co/papers?q=video%20transformers),但仅按行划分注意力集中区域本身无法指定可执行的稀疏算子。共享划分路径的查询可能具有重叠度较低的支持集,而仅保留注意力质量并不能决定跳过交互导致的softmax后误差。我们发现划分几何结构既影响合并支持集,也影响从稀疏输出预测剩余残差的可行性。我们提出SparsePR (https://huggingface.co/papers?q=SparsePR),该方法结合了响应耦合划分 (https://huggingface.co/papers?q=Response-Coupled%20Partitioning) 与探针拟合残差重构 (https://huggingface.co/papers?q=Probe-Fitted%20Residual%20Reconstruction)。采样查询的键响应形成成对的K/V分组,其质心为共享路由生成查询响应坐标。随后利用少量精确查询行,在探针残差观测到的输出子空间内,从稀疏输出校准特定调用的仿射修正。在四种异构视频生成与世界模型中,SparsePR (https://huggingface.co/papers?q=SparsePR) 持续降低注意力重构误差 (https://huggingface.co/papers?q=attention-reconstruction%20error)。消融实验表明探针拟合贡献了大部分误差降低,而响应耦合划分 (https://huggingface.co/papers?q=response-coupled%20partitioning) 则降低了硬丢弃误差并在有限探针预算下改善重构效果。SparsePR (https://huggingface.co/papers?q=SparsePR) 在实现22.0-26.0%的执行对密度 (https://huggingface.co/papers?q=executed-pair%20density) 时保持了生成质量,并实现1.48x-2.61x的端到端加速。项目页面:https://pardistaghavi.github.io/SparsePR-website/

查看arXiv页面 (https://arxiv.org/abs/2608.18484) 查看PDF (https://arxiv.org/pdf/2608.18484) 项目页面 (https://pardistaghavi.github.io/SparsePR-website/) GitHub14 (https://github.com/PardisTaghavi/SparsePR) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18484)

在你的智能体中获取此论文:

hf papers read 2608.18484

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型:0

无模型关联此论文

在模型README.md中引用arxiv.org/abs/2608.18484以从此页面关联。

引用此论文的数据集:0

无数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2608.18484以从此页面关联。

引用此论文的Space:0

无Space关联此论文

在Space README.md中引用arxiv.org/abs/2608.18484以从此页面关联。

包含此论文的收藏:0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面关联。

相似文章

FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡

Hugging Face Daily Papers

FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。

使用稀疏Transformer进行生成建模

OpenAI Blog

OpenAI推出了稀疏Transformer,一种深度神经网络,将注意力机制的复杂度从O(N²)优化到O(N√N),使得能够对长度超过以前30倍的序列进行建模,适用于文本、图像和音频领域。该模型采用稀疏注意力模式和基于检查点的内存优化技术,可以训练深达128层的网络,在多个领域实现了最先进的性能。

使用可训练稀疏注意力实现更快的视频扩散

Papers with Code Trending

本文介绍了可训练稀疏注意力(VSA),一种硬件高效的稀疏注意力机制,它降低了视频扩散变换器的计算成本,而不影响性能,从而实现更高效的扩展和更快的生成。