RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型

Hugging Face Daily Papers 论文

摘要

RT-Lynx提出利用激活稀疏性而非权重稀疏性来加速扩散模型,在线性层上实现了高达1.55倍的加速,同时保持生成质量,并被ICML 2026接收。

扩散Transformer(DiT)在图像生成中表现出色,但推理成本较高。虽然先前的工作通过量化和蒸馏降低了这一成本,但半结构化稀疏性(可将FLOPs减少近一半)仍未得到充分探索。一个关键原因是现有方法大多聚焦于权重稀疏化,而剪枝50%的权重会移除关键的模型容量并降低生成质量。然而,我们的研究表明,DiT的激活值本质上具有稀疏性,并且对N:M半结构化稀疏化的鲁棒性显著高于权重。基于这一观察,我们倡导从权重稀疏化向激活稀疏化的范式转变。我们提出了RT-Lynx,该方法对激活值应用N:M稀疏化,并引入误差补偿技术以减轻精度损失。我们进一步实现了针对此场景高度优化的CUDA内核,在线性层中平均实现了高达1.55倍的加速。在多种扩散模型上的大量实验表明,我们的方法在保持原始模型生成质量的同时,显著加速了推理过程。
查看原文
查看缓存全文

缓存时间: 2026/05/27 02:47

论文页面 - RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型

来源:https://huggingface.co/papers/2605.26632
👋 大家好!我们很高兴分享我们的ICML 2026工作RT-Lynx:将GEMM稀疏性放在扩散模型的正确位置

半结构化稀疏性有潜力将GEMM FLOPs减少近一半,但将其应用于扩散模型仍具挑战性:传统的权重稀疏化往往移除关键的生成能力,并导致可见的质量下降。

我们重新审视了这个问题,发现与权重不同,DiT激活值本质上是稀疏的,并且对2:4半结构化稀疏性具有显著更强的鲁棒性。这表明对于加速扩散Transformer而言,激活稀疏性比权重稀疏性更值得作为优化目标。基于这一观察,我们提出了RT-Lynx,将稀疏化目标从权重转向激活值。它结合了在线激活稀疏化、基于范数的补偿以及轻量级LoRA分支来恢复细粒度的视觉细节。为了使其在实际中高效运行,我们进一步设计了优化的CUDA内核,将稀疏化、压缩和稀疏Tensor Core计算融合为统一的推理管线。

在Qwen-Image、FLUX.1-dev和Z-Image上,RT-Lynx在保持生成质量的同时,实现了约1.2倍的端到端加速和最高1.55倍的平均线性层加速。

我们希望这项工作能突出激活稀疏性作为加速现代扩散Transformer的更合适且硬件友好的方向。欢迎反馈!

相似文章