展开与回滚:扩散大语言模型是自身的效率教师
摘要
本文介绍了 WINO 和 WINO+,这两种方法能够在扩散大语言模型中实现可撤销的并行解码,并提炼高效的降噪轨迹,显著改善质量-速度权衡。
arXiv:2605.16941v1 公告类型:新
摘要:扩散大语言模型(DLLMs)有望实现快速并行生成,但开源 DLLMs 仍面临严重的质量-速度权衡:通过一次性揭示多个 token 来加速解码通常会显著降低质量。我们将这一困境归因于训练与推理之间的不匹配,这种不匹配因不可逆解码而放大。虽然训练从随机损坏的状态重建 token,但高效推理需要自适应的降噪顺序,即较容易的 token 提前揭示,而依赖上下文的 token 则推迟处理。这一观点催生了两种互补的方法:一种推理时方法使并行解码可撤销,以及一种训练时扩展方法,用于提炼这一可撤销过程所暴露的可靠顺序。据此,我们首先提出了 Wide-In, Narrow-Out (WINO),一种无需训练的、支持可撤销并行生成的解码算法。WINO 主动草拟多个 token,利用丰富的全局上下文验证生成的 token,并对不可靠的 token 重新掩码以备后续细化。基于此发现的顺序,我们进一步引入了 WINO+,它将 WINO 产生的经过验证的降噪轨迹注入模型参数,使训练与高效推理对齐。在 LLaDA 和 MMaDA 上的实验表明,WINO 同时提升了质量和效率,而 WINO+ 进一步增强了这一进展。在 GSM8K 上,WINO 将准确率从 73.24% 提升至 75.82%,同时步骤数减少 6.10 倍;WINO+ 进一步实现了 76.58% 的准确率,步骤数减少 6.83 倍。在 Flickr30K 上,WINO+ 实现了 16.22 倍的步骤减少,并提升了 CIDEr 指标。这些结果表明,DLLMs 可以通过首先通过可撤销解码发现可靠的降噪顺序,然后学习遵循该顺序以实现更快的生成,从而充当自身的效率教师。代码可在 https://github.com/Feng-Hong/WINO-DLLM/tree/WINO-plus 获取。
查看缓存全文
缓存时间: 2026/05/19 06:36
# 滚入与滚出:扩散大语言模型是自身的效率导师 来源:https://arxiv.org/html/2605.16941 范钦曾∗,冯鸿∗,耿宇,黄杰正,肖峰曹,张雅,博涵,王彦峰,姚江潮† 范钦曾和冯鸿对本文贡献相等(以∗标记)。通讯作者为姚江潮(以†标记),通讯邮箱为[email protected]。 范钦曾、冯鸿、耿宇、张雅、王彦峰、姚江潮任职于上海交通大学,中国上海。黄杰正任职于Apple MLR,美国加利福尼亚州库比蒂诺。肖峰曹任职于同济大学,中国上海。博涵任职于香港浸会大学,中国香港,以及日本理化学研究所。 ###### 摘要 扩散大语言模型(DLLMs)承诺实现快速的并行生成,然而开源DLLMs仍然面临严重的质量-速度权衡:通过一次揭示多个令牌来加速解码往往导致质量大幅下降。我们将这一困境归因于由不可逆解码放大的训练-推理不匹配。虽然训练是从随机破坏的状态重建令牌,但高效推理需要一个自适应的去噪顺序,其中较容易的令牌先被揭示,而依赖上下文的令牌则被推迟。这一观点启发了两种互补方法:一种推理时的方法,使并行解码变得可撤销;以及一种训练时的扩展,从这种可撤销过程中提炼出可靠的顺序。因此,我们首先提出Wide-In, Narrow-Out(WINO),一种无需训练的解码算法,实现了可撤销的并行生成。WINO激进地草稿多个令牌,利用更丰富的全局上下文验证生成的令牌,并重新屏蔽不可靠的令牌供后续细化。在此基础上,我们进一步引入WINO+,它将WINO产生的验证去噪轨迹注入模型参数,使训练与高效推理对齐。在LLaDA和MMaDA上的实验表明,WINO同时提升了质量和效率,而WINO+进一步强化了这一进展。在GSM8K上,WINO将准确率从73.24%提升至75.82%,解码步数减少6.10倍;WINO+进一步达到76.58%,步数减少6.83倍。在Flickr30K上,WINO+在CIDEr得分提升的同时实现了16.22倍的步数减少。这些结果表明,DLLMs可以通过可撤销解码首先发现可靠的去噪顺序,然后学习遵循该顺序以实现更快的生成,从而充当自身的效率导师。代码可在https://github.com/Feng-Hong/WINO-DLLM/tree/WINO-plus获取。 ## I. 引言 自回归大语言模型[radford2018improving, radford2019language],例如GPT系列[openai2022chatgpt],在广泛的语言任务中表现出色。然而,它们逐令牌生成的基础机制带来了固有的局限性,包括严重的推理延迟、易受错误传播影响[DBLP:journals/corr/abs-2310-12397, DBLP:journals/corr/abs-2310-08118]以及保持全局一致性的挑战[mei2025surveycontextengineeringlarge]。为此,扩散大语言模型(DLLMs)作为一种有吸引力的非自回归替代方案出现,旨在克服这些瓶颈。通过同时生成令牌[DBLP:conf/nips/LiTGLH22],DLLMs理论上可以实现大规模推理加速,同时其原生双向注意力提供了更好的一致性。DLLMs的巨大潜力也已被专有闭源系统(例如,Mercury Coder[inceptionlabs2025mercury]和Gemini Diffusion[deepmind2025geminidiffusion])所展示,它们展现了超过每秒1000个令牌的惊人速度,作为强有力的概念验证。 尽管有这些前景,开源DLLMs的性能仍然令人失望。一个关键的瓶颈是它们陷入了严重的质量-速度权衡困境。具体来说,为了获得高质量输出,这些模型往往被迫缓慢解码,一次只生成一个令牌,这否定了它们的主要架构优势。如图1所示,试图通过并行生成多个令牌来加速推理必然导致输出质量显著下降[DBLP:journals/corr/abs-2502-09992, DBLP:journals/corr/abs-2506-00413]。这种鲜明的权衡在很大程度上阻止了开源DLLMs成为自回归模型可行的高性能替代方案。 我们将这种权衡归因于DLLMs中的训练-推理不匹配,这种不匹配因标准解码的不可逆性而进一步放大[DBLP:conf/nips/SahooASGMCRK24, DBLP:conf/iclr/OuNXZSLL25]。在训练期间,掩码扩散模型从随机破坏的状态重建令牌,其中恢复顺序是隐式随机的。然而,在推理期间,生成的顺序遵循渐进去噪轨迹,不同的令牌有不同的上下文需求,因此存在自然的顺序偏好。较容易的令牌应该更早被揭示,而更依赖上下文的令牌应该延迟,直到获得足够的上下文。标准解码无法纠正违反这种顺序偏好的行为。一旦一个令牌被解码,它就被固定且无法修订,即使后来出现更丰富的上下文。因此,在上下文不足的情况下过早揭示的令牌可能引入错误,这些错误会在剩余轨迹中保留并传播。因此,质量-速度权衡源于在不可逆解码过程中以次优顺序揭示令牌。 为了从推理侧解决这个问题,我们首先提出Wide-In, Narrow-Out(WINO),一种新颖的解码算法,为DLLMs实现可撤销解码。WINO采用并行工作的草稿-验证流程。在每个步骤中,草稿模块基于宽松的阈值激进地提出多个新令牌(“Wide-In”)。同时,验证模块利用新丰富起来的全局上下文重新评估所有先前生成的令牌。任何未通过更严格验证检查的令牌将被重新屏蔽,以供未来步骤细化(“Narrow-Out”)。这种机制带来两个优点:1)打破了传统解码的不可逆性,允许过早揭示的令牌在获得更丰富上下文时被修订;2)允许在每个扩散步骤中更激进地生成令牌,从而实现更快的推理而不牺牲质量。重要的是,WINO不需要额外训练,可以直接应用于现有的DLLMs。 (图1:WINO相对于标准解码和朴素并行采样的加速和性能提升演示,在GSM8K上使用LLaDA评估,在Flickr30K上使用MMaDA评估。标准解码每步揭示1个令牌,朴素并行采样每步揭示M(>1)个令牌。对于GSM8K我们设M=4,对于Flickr30K设M=8。) 虽然WINO在推理过程中缓解了顺序引起的错误,但其草稿-验证-回退过程也暴露了轨迹级信号,可以减少训练侧的不匹配。每次回退表明一个令牌可能被揭示得太早,而令牌的最终确定步骤则反映了揭示它的更合适阶段。基于这一信号,我们提出WINO+,一种轨迹注入框架,将WINO导出的顺序转移到模型参数中。WINO+离线运行WINO,提取令牌级最终确定步骤,并构建轨迹引导的训练样本。WINO+不是随机选择掩码令牌进行重建,而是训练模型再现验证后的顺序:较早最终确定的令牌较早受监督,而较晚最终确定的令牌保持掩蔽直到其对应的轨迹步骤。这用轨迹排序去噪替代了随机重建,使训练与高效推理更加对齐。 我们在语言和视觉-语言基准上使用代表性的开源DLLMs(包括LLaDA[DBLP:journals/corr/abs-2502-09992]和MMaDA[DBLP:journals/corr/abs-2505-15809])进行了广泛实验。结果显示了从WINO到WINO+的清晰进展。WINO在推理时通过使并行生成可撤销来加速解码。WINO+则从训练侧进一步改进效率,通过教导模型遵循WINO发现的验证生成顺序,减少推理时对在线回退的依赖。例如,在GSM8K上,WINO将准确率从73.24%提升至75.82%,解码步数减少6.10倍,而WINO+进一步将准确率提升至76.58%,步数减少6.83倍。在Flickr30K上,WINO实现了10.05倍的步数减少,而WINO+进一步将CIDEr提升至63.38,步数减少16.22倍。这些结果表明,DLLMs可以充当自身的效率导师:它们的可撤销解码过程首先直接改进推理,然后产生经过验证的轨迹,模型可以从中学习更好的去噪顺序。 我们的贡献总结如下: - • 我们识别了DLLMs质量-速度权衡背后的训练-推理不匹配:标准训练依赖于随机破坏的状态,而高效推理需要自适应的去噪顺序。在不可逆解码下,违反这种顺序偏好会导致累积错误。 - • 我们提出了WINO,一种无需训练、即插即用的解码算法。通过并行的草稿-验证-回退机制,WINO能够激进地生成令牌,同时修订过早揭示的令牌,从而同时提高解码速度和生成质量。 - • 我们进一步提出WINO+,一种轨迹注入框架,将WINO发现的验证生成顺序转移到模型参数中。WINO+从WINO轨迹中提取令牌级最终确定步骤,并用轨迹排序去噪而非随机重建来训练模型。 - • 在语言和视觉-语言基准上的广泛实验表明,WINO持续加速推理,同时保持或提高质量,而WINO+通过从WINO导出的轨迹中学习,进一步增强了效率和性能。 ## II. 相关工作 ### II-A 基于扩散的语言模型 扩散模型[DBLP:journals/corr/Sohl-DicksteinW15, DBLP:conf/nips/HoJA20, DBLP:conf/iclr/0011SKKEP21]最初流行于图像生成[DBLP:conf/cvpr/RombachBLEO22, DBLP:conf/icml/NicholDRSMMSC22, DBLP:conf/nips/SahariaCSLWDGLA22],最近作为自回归语言模型(ARLMs)在文本生成方面的替代方案引起了关注。早期的扩散工作[DBLP:journals/corr/Sohl-DicksteinW15]首先研究了从连续域到离散域的扩展。随后,D3PM[DBLP:conf/nips/AustinJHTB21]提供了一个通用框架,将扩散前向过程建模为离散状态马尔可夫链,该链由离散时间步上特定转移矩阵的乘法定义。后续基于CTMC的方法[DBLP:conf/nips/CampbellBBRDD22]后来将D3PM扩展到连续时间设置,利用连续时间马尔可夫链(CTMC)理论。最近,从D3PM中吸收态扩散推导出的掩码扩散模型(MDMs)[DBLP:conf/nips/ShiHWDT24]在小规模模型(例如,MDLM[DBLP:conf/nips/SahooASGMCRK24]和RADD[DBLP:conf/iclr/OuNXZSLL25])和大规模实现(例如,LLaDA[DBLP:journals/corr/abs-2502-09992]和Dream[dream2025])中都显示出有前景的结果。扩展这一工作线,MMaDA[DBLP:journals/corr/abs-2505-15809]引入了一类新型的多模态大扩散模型,具有共享的概率公式和模态无关的架构。 ### II-B DLLM加速技术 现有针对DLLMs的加速研究分为两个方向:KV缓存和采样压缩。前者目标是构建DLLMs的KV缓存,因为其双向全注意力机制与ARLMs的因果注意力不同。典型工作如Block Diffusion[DBLP:conf/iclr/ArriolaGCYQHSK25]、Fast-dLLM-cache[DBLP:journals/corr/abs-2505-22618]和dLLM-cache[DBLP:journals/corr/abs-2506-06295]分别探索了不同的缓存机制,在加速方面显示出有前景的性能。注意,这个方向不在我们当前工作的范围内。后一个方向专注于优化采样过程本身。针对经典的低置信度重掩码策略,一些工作引入了新颖的采样策略,动态调整并行预测的令牌数量,从而提高推理效率。Fast-dLLM-parallel[DBLP:journals/corr/abs-2505-22618]采用直接方法,选择置信度得分超过预定义阈值的令牌。同时,熵界(EB)采样器[DBLP:journals/corr/abs-2505-24857]作为传统采样器的即插即用替代,利用基于熵的去掩码过程,在每一步动态解码多个令牌,同时维持预定义的错误容差。尽管我们的WINO由于采样压缩带来了加速前景,但与这些工作不同,我们探索解决DLLMs中标准解码固有的局限性。 ## III. 预备知识:DLLMs的解码过程 给定提示XX,一个DLLM生成响应Y=[y1,y2,...,yL]Y=[y_1,y_2,\ldots,y_L],带有预定义的响应长度LL。响应序列初始化为全部特殊掩码令牌Y(0)=[[MASK],[MASK],...,[MASK]]Y^(0)=[[MASK],[MASK],...,[MASK]]。
相似文章
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
PSD: 通过并行推测解码推动扩散大语言模型的帕累托前沿
本文介绍了一种无需训练的框架——并行推测解码(PSD),它通过同时提升空间和时间效率来加速扩散大语言模型的推理,每次前向传递最多可处理5.5×的token数,且质量与贪婪解码相当。
基于时空并行解码与置信度外推的高效扩散LLMs
本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。
扩散以压缩:利用扩散语言模型实现无损压缩
本文介绍了扩散语言模型(DLMs)作为一种新的无损文本压缩推理范式,旨在克服基于自回归LLM的压缩器的吞吐量瓶颈,同时实现最先进的压缩率。