多令牌残差预测
摘要
引入多令牌残差预测(MRP),这是一个用于扩散语言模型的轻量级模块,能够在单次主干前向传播中实现依赖感知的多令牌去噪,实现高达1.42倍的无损加速。
arXiv:2605.18817v1 公告类型:新
摘要:扩散语言模型(DLM)通过迭代去噪掩码令牌序列来生成文本,与自回归模型相比,在并行性和质量之间取得了权衡。在当前实践中,每步解码的令牌数量由置信阈值控制,且随着每步去噪的令牌增多,质量会单调下降。我们引入了多令牌残差预测(MRP),这是一个轻量级模块,能够在单次主干前向传播中实现依赖感知的多令牌去噪。MRP利用了去噪过程的一个关键特性:相邻去噪步的logit分布非常相似。MRP不是再次运行主干以获取下一步的logit,而是从主干的隐藏状态预测步之间的残差,从而以极低的成本在每次主干前向传播中去噪更多令牌。我们将MRP部署在两种推理模式中:直接解码,它使用校正后的logit无需验证,以获得可调的质量-速度权衡;以及推测解码,它针对主干验证MRP的提议以实现无损加速。在1.7B、4B和8B规模的SDAR模型上,跨推理和代码生成基准的实验表明,在SGLang中可实现高达$1.42\times$的无损加速。
相似文章
@_yucheng_lu: MTP 使自回归 LLM 变快。同样的技巧能否用于扩散语言模型?与 @modal 进行了一次有趣的合作,探索……
介绍了多令牌残差预测(MRP)技术,该技术通过预测相邻去噪步骤之间的残差来加速扩散语言模型推理,在 SGLang 中实现了最高 1.56 倍的速度提升,并在激进解码设置中恢复了最高 +16 的准确率点数。
残差上下文扩散语言模型(2分钟阅读)
本文介绍了残差上下文扩散(RCD)模块,该模块通过回收扩散语言模型中丢弃的令牌表示来提高效率和准确性,在具有挑战性的推理任务上实现了5–10%的准确性提升,并将去噪步骤减少了多达4–5倍。
多块扩散语言模型
本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。
# 支持性令牌揭示:用于快速扩散语言模型解码
本文提出了 AXON,一种无需训练的模块,通过智能选择"锚点"(anchor)token 优先揭示,并利用注意力、不确定性和置信度信号来辅助后续去噪步骤,从而改善离散扩散语言模型解码的质量-延迟权衡。在推理和代码生成基准测试上的实验表明,AXON 在保持或提升准确率的同时减少了函数评估次数。
Nemotron-TwoTower:基于预训练自回归上下文的扩散语言建模
本文提出了Nemotron-TwoTower,一种扩散语言模型,通过冻结的自回归塔和可训练的扩散去噪器解耦上下文表示与去噪过程,以2.42倍吞吐量达到了基线质量98.7%的水平。