$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型

arXiv cs.CL 论文

摘要

R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。

arXiv:2604.18995v1 公告类型: new 摘要:扩散大语言模型(dLLM)凭借并行 token 预测能力,成为自回归生成的有力替代方案。然而,实际 dLLM 解码仍受高推理延迟困扰,限制其落地。本研究发现,这一低效主要源于解码过程中的重复冗余:空间冗余来自置信度簇与位置歧义,时间冗余则因对已稳定 token 反复重掩码。基于此,我们提出 $R^2$-dLLM,一套从推理与训练双视角统一削减解码冗余的框架。推理阶段,无需额外训练即可聚合局部置信与 token 预测,并锁定时序稳定 token,跳过冗余步骤;训练阶段,我们设计冗余感知的监督微调流程,让模型对齐高效解码轨迹,减少对手动阈值的依赖。实验表明,$R^2$-dLLM 在各类模型与任务上持续将解码步数削减至多 75%,同时保持有竞争力的生成质量。结果证实,解码冗余是 dLLM 的核心瓶颈,显式削减可带来显著的实际效率提升。
查看原文
查看缓存全文

缓存时间: 2026/04/22 08:29

# $R^2$-dLLM:通过时空冗余削减加速扩散大语言模型  
来源:https://arxiv.org/abs/2604.18995  
查看 PDF(https://arxiv.org/pdf/2604.18995)

> 摘要:扩散大语言模型(dLLM)通过并行预测 token,已成为自回归生成的有力替代方案。然而,实际 dLLM 解码仍存在高推理延迟,限制了其落地。本文发现,这种低效主要源于解码过程中的重复冗余:空间冗余来自置信度聚集与位置歧义;时间冗余则因对已稳定 token 的反复重掩码造成。基于此,我们提出 $R^2$-dLLM,一套从推理与训练双视角统一削减解码冗余的框架。推理阶段,我们引入无需训练的解码规则,聚合局部置信与 token 预测,并固化时序稳定的 token,避免冗余解码步。训练阶段,我们设计冗余感知的监督微调流程,使模型对齐高效解码轨迹,降低对手动阈值的依赖。实验表明,$R^2$-dLLM 在不同模型与任务上,将解码步数最高减少 75%,同时保持生成质量。结果证实,解码冗余是 dLLM 的核心瓶颈,显式削减可带来显著的实际效率提升。

## 提交历史

来自:杜振邦 [查看邮件](https://arxiv.org/show-email/5432f1fd/2604.18995)  
**\[v1\]** 2026 年 4 月 21 日 02:26:08 UTC(2,373 KB)

相似文章

基于时空并行解码与置信度外推的高效扩散LLMs

arXiv cs.CL

本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。