RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型
摘要
RT-Lynx提出利用激活稀疏性而非权重稀疏性来加速扩散模型,在线性层上实现了高达1.55倍的加速,同时保持生成质量,并被ICML 2026接收。
查看缓存全文
缓存时间: 2026/05/27 02:47
论文页面 - RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型
来源:https://huggingface.co/papers/2605.26632
👋 大家好!我们很高兴分享我们的ICML 2026工作RT-Lynx:将GEMM稀疏性放在扩散模型的正确位置。
半结构化稀疏性有潜力将GEMM FLOPs减少近一半,但将其应用于扩散模型仍具挑战性:传统的权重稀疏化往往移除关键的生成能力,并导致可见的质量下降。
我们重新审视了这个问题,发现与权重不同,DiT激活值本质上是稀疏的,并且对2:4半结构化稀疏性具有显著更强的鲁棒性。这表明对于加速扩散Transformer而言,激活稀疏性比权重稀疏性更值得作为优化目标。基于这一观察,我们提出了RT-Lynx,将稀疏化目标从权重转向激活值。它结合了在线激活稀疏化、基于范数的补偿以及轻量级LoRA分支来恢复细粒度的视觉细节。为了使其在实际中高效运行,我们进一步设计了优化的CUDA内核,将稀疏化、压缩和稀疏Tensor Core计算融合为统一的推理管线。
在Qwen-Image、FLUX.1-dev和Z-Image上,RT-Lynx在保持生成质量的同时,实现了约1.2倍的端到端加速和最高1.55倍的平均线性层加速。
我们希望这项工作能突出激活稀疏性作为加速现代扩散Transformer的更合适且硬件友好的方向。欢迎反馈!
相似文章
@_yucheng_lu: MTP 使自回归 LLM 变快。同样的技巧能否用于扩散语言模型?与 @modal 进行了一次有趣的合作,探索……
介绍了多令牌残差预测(MRP)技术,该技术通过预测相邻去噪步骤之间的残差来加速扩散语言模型推理,在 SGLang 中实现了最高 1.56 倍的速度提升,并在激进解码设置中恢复了最高 +16 的准确率点数。
加速视觉生成式LLMs的解耦RL:基于扩散并行与训练器辅助生成
本文介绍了DigenRL,一个用于基于扩散的生成式LLMs的解耦RL框架,它利用生成轴流水线并行和训练器辅助生成,相比现有系统实现了1.56-2.10倍的吞吐量提升。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
LaCache: 扩散大语言模型的精确缓存与精度自适应推理
LaCache 提出了一种针对扩散式LLM的无训练加速框架,利用无损缓存和精度自适应推理消除去噪步骤中的冗余计算,在保持任务精度的同时实现了高达40.2倍的端到端加速。
神经形态扩散语言模型:通过稀疏性和块去噪解决计算与内存瓶颈
提出神经形态掩码扩散语言模型(N-MDLMs),该模型将块扩散与基于尖峰的神经形态计算相结合,通过利用稀疏性和每次参数访问生成多个token来提高吞吐量和能效,并通过类屋顶线模型进行分析。