$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
摘要
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
arXiv:2604.18995v1 公告类型: new
摘要:扩散大语言模型(dLLM)凭借并行 token 预测能力,成为自回归生成的有力替代方案。然而,实际 dLLM 解码仍受高推理延迟困扰,限制其落地。本研究发现,这一低效主要源于解码过程中的重复冗余:空间冗余来自置信度簇与位置歧义,时间冗余则因对已稳定 token 反复重掩码。基于此,我们提出 $R^2$-dLLM,一套从推理与训练双视角统一削减解码冗余的框架。推理阶段,无需额外训练即可聚合局部置信与 token 预测,并锁定时序稳定 token,跳过冗余步骤;训练阶段,我们设计冗余感知的监督微调流程,让模型对齐高效解码轨迹,减少对手动阈值的依赖。实验表明,$R^2$-dLLM 在各类模型与任务上持续将解码步数削减至多 75%,同时保持有竞争力的生成质量。结果证实,解码冗余是 dLLM 的核心瓶颈,显式削减可带来显著的实际效率提升。
查看缓存全文
缓存时间: 2026/04/22 08:29
# $R^2$-dLLM:通过时空冗余削减加速扩散大语言模型 来源:https://arxiv.org/abs/2604.18995 查看 PDF(https://arxiv.org/pdf/2604.18995) > 摘要:扩散大语言模型(dLLM)通过并行预测 token,已成为自回归生成的有力替代方案。然而,实际 dLLM 解码仍存在高推理延迟,限制了其落地。本文发现,这种低效主要源于解码过程中的重复冗余:空间冗余来自置信度聚集与位置歧义;时间冗余则因对已稳定 token 的反复重掩码造成。基于此,我们提出 $R^2$-dLLM,一套从推理与训练双视角统一削减解码冗余的框架。推理阶段,我们引入无需训练的解码规则,聚合局部置信与 token 预测,并固化时序稳定的 token,避免冗余解码步。训练阶段,我们设计冗余感知的监督微调流程,使模型对齐高效解码轨迹,降低对手动阈值的依赖。实验表明,$R^2$-dLLM 在不同模型与任务上,将解码步数最高减少 75%,同时保持生成质量。结果证实,解码冗余是 dLLM 的核心瓶颈,显式削减可带来显著的实际效率提升。 ## 提交历史 来自:杜振邦 [查看邮件](https://arxiv.org/show-email/5432f1fd/2604.18995) **\[v1\]** 2026 年 4 月 21 日 02:26:08 UTC(2,373 KB)
相似文章
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。
基于时空并行解码与置信度外推的高效扩散LLMs
本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。
Prefilling-dLLM:扩散语言模型中长上下文推理的预测性预填充
本文提出Prefilling-dLLM,一种无需训练的框架,它将前缀分割成块并缓存KV表示,在扩散语言模型的长上下文推理中实现了最先进的质量和高达28倍的加速。
@DailyDoseOfDS_: 将任意自回归LLM转换为扩散LM。dLLM是一个Python库,统一了扩散语言模型的训练与评估…
dLLM是一个开源Python库,能以极少的计算资源将任意自回归语言模型转换为扩散语言模型,统一训练和评估。
PSD: 通过并行推测解码推动扩散大语言模型的帕累托前沿
本文介绍了一种无需训练的框架——并行推测解码(PSD),它通过同时提升空间和时间效率来加速扩散大语言模型的推理,每次前向传递最多可处理5.5×的token数,且质量与贪婪解码相当。