CForce:通过一致性强制提升dLLMs的并行解码
摘要
本文介绍了Consistency Forcing(CForce),一种针对扩散大语言模型的蒸馏技术,通过将早期阶段的预测与后期阶段对齐来提升并行解码,从而改善速度-质量权衡。
arXiv:2608.13925v1 公告类型:跨领域
摘要:扩散大语言模型(dLLMs)通过在单次前向传播中预测多个掩码来加速语言生成。然而,在激进的并行策略下,现有的dLLMs可能在早期去噪阶段出现不可靠的预测,导致错误传播到后续阶段。为解决此问题,我们提出了针对dLLMs的一致性强制(CForce),这是一种蒸馏方法,强制早期阶段的掩码预测与后期阶段对齐。CForce在预先收集的自展开轨迹上训练模型,从而改善训练-推理一致性。我们引入了置信度自适应KL散度作为蒸馏目标,以结合正向和反向KL的优点。我们进一步对一致性目标进行理论分析,解释为何CForce能近似最小化早期阶段的预测误差。关键的是,该公式同样适用于掩码到标记解码和可编辑解码;在可编辑情况下,后续的标记到标记细化为早期掩码状态预测提供额外监督。在非编辑和可编辑的LLaDA模型上的实验表明,速度-质量权衡得到改善,尤其是在高并行解码预算下。代码可在以下位置获取:https://github.com/inclusionAI/dFactory。
查看缓存全文
缓存时间: 2026/08/17 10:06
# CForce:通过一致性强制提升扩散大语言模型的并行解码能力
来源:https://arxiv.org/html/2608.13925
陈凯徐隶属机构:上海交通大学龚卓诚隶属机构:蚂蚁集团 \{renyj26, 132435xck, zhijied\}@sjtu\.edu\.cn, lijg\.zero@antgroup\.com 李建国邓志杰
###### 摘要
扩散大语言模型(dLLMs)通过在单次前向传播中预测多个掩码来加速语言生成。然而,现有的dLLMs在采用激进并行策略时,在早期去噪阶段可能出现不可靠的预测,导致错误传播到后续阶段。为解决此问题,我们提出了一种针对dLLMs的一致性强制(CForce)蒸馏方法,旨在强制早期阶段的掩码预测与后期阶段对齐。CForce在预先收集的自身展开轨迹上训练模型,从而改善训练-推理的一致性。我们引入了置信度自适应KL散度作为蒸馏目标,以融合前向和反向KL的优势。我们进一步提供了针对一致性目标的理论分析,以解释CForce为何能近似最小化早期阶段的预测误差。关键的是,该公式同样适用于掩码到令牌(M2T)解码和可编辑解码;在可编辑情况下,后期的令牌到令牌(T2T)精炼为早期掩码状态预测提供了额外的监督。在不可编辑和可编辑的LLaDA模型上的实验表明,该方法提升了速度-质量权衡,尤其是在高并行解码预算下。代码可在:https://github.com/inclusionAI/dFactory 获取。
11脚注文本:贡献相同。22脚注文本:通讯作者。## 1 引言
图1:速度-质量权衡:准确率与每次前向传播的令牌数(TPF)。右上方表示更优。一致性强制将两个模型推向更高并行度的权衡点。图2:并行度下的逐任务准确率(AUP)。AUP将分数-并行度曲线整合为一个指标。CForce在所有四个基准测试中均带来一致的提升。扩散大语言模型(dLLMs)(Austin et al\. 2021a (https://arxiv.org/html/2608.13925#bib.bib4);Zheng et al\. 2023 (https://arxiv.org/html/2608.13925#bib.bib46);Lou et al\. 2024 (https://arxiv.org/html/2608.13925#bib.bib27);Sahoo et al\. 2024 (https://arxiv.org/html/2608.13925#bib.bib34);Nie et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib32);Ye et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib43);Arriola et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib3);Gong et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib17)\)通过迭代去噪掩码序列来生成文本,通过在单次前向传播中承诺多个令牌以实现高并行性(Wu et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib40);Bie et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib7);Bie et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib6);Wang et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib39);Cheng et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib13)\)。然而,现有的dLLMs在采用激进的并行策略时,在早期去噪阶段可能出现不可靠的预测,并且由此产生的错误可以传播到后续阶段。因此,更快的dLLM解码不仅依赖于减少去噪步数,还依赖于提高在高并行解码下早期阶段预测的可靠性。
这一问题对于可编辑的dLLMs尤为重要。传统的掩码扩散解码主要是掩码到令牌(M2T),而像LLaDA2.1(Bie et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib6))这样的可编辑模型还执行令牌到令牌(T2T)的精炼,允许后续的去噪状态修改早期的草稿。这些后续状态包含更丰富的上下文和可能的T2T修正,可以在令牌承诺之前为早期M2T预测提供更强的监督。现有的加速和蒸馏方法并未沿着模型自身的阈值解码轨迹训练这种早期到晚期的一致性:一些方法修改了解码或缓存(Kim et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib21);Wu et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib40);Liu et al\. 2025b (https://arxiv.org/html/2608.13925#bib.bib26)\),而另一些方法使用构建的、教师生成的或特权轨迹(Zhang et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib44);Kim et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib20);Liang et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib23)\),其信息条件与学生的推理状态不同。
我们提出了针对dLLMs的一致性强制(CForce),这是一种受一致性模型(Salimans and Ho 2022 (https://arxiv.org/html/2608.13925#bib.bib36);Song et al\. 2023 (https://arxiv.org/html/2608.13925#bib.bib37))启发的蒸馏方法,旨在强制早期阶段的掩码预测与后期阶段对齐。具体来说,从一个预训练的dLLM开始,CForce在自身展开轨迹上训练模型,从而改善训练-推理的一致性。然后,CForce将每个预先收集的轨迹划分为多个阶段。每个阶段边界设置在新揭示掩码令牌的固定数量之后,而不是在每个原生步骤处,后者会带来大量的轨迹存储开销。对于每一对相邻阶段,早期阶段的预测被训练以匹配同一模型在后期阶段使用停止梯度(stop-gradient)的预测,而不依赖于冻结的教师模型。仍被掩码的位置使用置信度自适应KL散度(CAD)进行对齐,CAD根据后期阶段的预测置信度动态地在正向和反向KL之间插值。CForce还应用交叉熵(CE)锚来稳定令牌承诺。针对揭示难度的课程学习进一步稳定了这一相邻阶段目标(Xu et al\. 2025b (https://arxiv.org/html/2608.13925#bib.bib42);Liu et al\. 2025a (https://arxiv.org/html/2608.13925#bib.bib25))。
我们进一步提供了支持此设计的理论分析:早期阶段的预测误差上界由相邻阶段分布漂移加上揭示边界令牌误差(第4.4节 (https://arxiv.org/html/2608.13925#S4.SS4))限定,这两个项直接对应于我们目标中的CAD和CE组件。
经验上,最清晰的结果出现在可编辑的LLaDA2.1-mini(Bie et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib6))上:一致性强制将平均每次前向传播的令牌数(TPF)从6.94提高到9.08,同时将平均准确率从85.57提高到86.41。在不可编辑的LLaDA2.0-mini(Bie et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib7))上,该方法显示了明确的速度-质量权衡,在激进解码下,将平均TPF从3.60提高到6.42,并在固定TPF预算下提高了少步准确率。图1 (https://arxiv.org/html/2608.13925#S1.F1)和图2 (https://arxiv.org/html/2608.13925#S1.F2)可视化了这种效果。
我们的贡献有四点:(1)我们将dLLM加速的重点重新定义为激进阈值解码下的早期阶段可靠性,而不仅仅是关注更少的采样步骤;(2)我们引入了CForce,它利用CAD和CE锚在模型自身的解码轨迹上对齐相邻阶段;(3)我们将这一思想实例化到可编辑的dLLMs中,其中后续的T2T精炼阶段监督早期的M2T预测;(4)我们展示了相同的方案在不可编辑的dLLM上改进了少步和高TPF行为,具有明确的速度-质量权衡。
## 2 相关工作
#### 掩码扩散语言模型。
掩码扩散语言模型(MDLMs)将文本生成转化为离散去噪问题(Austin et al\. 2021a (https://arxiv.org/html/2608.13925#bib.bib4);Zheng et al\. 2023 (https://arxiv.org/html/2608.13925#bib.bib46);Lou et al\. 2024 (https://arxiv.org/html/2608.13925#bib.bib27))。基于早期的掩码生成方法(Ghazvininejad et al\. 2019 (https://arxiv.org/html/2608.13925#bib.bib16);Chang et al\. 2022 (https://arxiv.org/html/2608.13925#bib.bib8)),近期的dLLMs进一步扩展了这一范式,实现了更强大的文本和代码生成(Nie et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib32);Ye et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib43);Gong et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib17))。为提高生成速度,一些dLLMs引入了基于置信度的并行解码(Wu et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib40);Wang et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib39);Cheng et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib13);Bie et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib7);Chen et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib12)),而可编辑模型允许后续的去噪状态修改已承诺的令牌(Bie et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib6))。在激进并行解码下,这些后续修正尤为重要,因为早期的M2T预测是在有限上下文中进行的,可以从后续去噪状态引发的监督中受益。
#### dLLMs的加速方法。
现有的加速方法遵循几个互补的方向。推理时方法改进令牌选择或验证而不改变模型参数(Kim et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib21);Xu et al\. 2025a (https://arxiv.org/html/2608.13925#bib.bib41);Agrawal et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib1);Gao et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib15)),而系统级方法通过缓存来减少计算(Wu et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib40);Ma et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib30);Liu et al\. 2025b (https://arxiv.org/html/2608.13925#bib.bib26))。基于训练的方法则利用构建的、教师生成的或特权轨迹来改善少步生成(Chen et al\. 2025b (https://arxiv.org/html/2608.13925#bib.bib11);Zhang et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib44);Kim et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib20);Liang et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib23))。这些方法加速了解码,但并未直接在其自身阈值解码路径产生的低上下文状态上训练模型。
#### 扩散模型中的一致性蒸馏。
扩散蒸馏通过将缓慢的多步生成压缩为更快的采样器或模型来降低采样成本(Luhman and Luhman 2021 (https://arxiv.org/html/2608.13925#bib.bib28);Salimans and Ho 2022 (https://arxiv.org/html/2608.13925#bib.bib36);Meng et al\. 2023 (https://arxiv.org/html/2608.13925#bib.bib31))。一致性模型通过强制轨迹状态间的一致性来扩展这一思想,从而实现一步或少步生成(Song et al\. 2023 (https://arxiv.org/html/2608.13925#bib.bib37);Luo et al\. 2023 (https://arxiv.org/html/2608.13925#bib.bib29);Kou et al\. 2024 (https://arxiv.org/html/2608.13925#bib.bib22))。相关的目标也在离散生成模型(Hayakawa et al\. 2024 (https://arxiv.org/html/2608.13925#bib.bib18);Sahoo et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib35);Xu et al\. 2025b (https://arxiv.org/html/2608.13925#bib.bib42))以及最近的dLLMs(Zhang et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib44);Kim et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib20);Liang et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib23))中被研究。这些工作展示了跨状态监督的有效性。然而,它们通常依赖于单独的教师、固定的表示或教师生成的目标。相反,一致性强制从模型自身的阈值解码轨迹构建相邻阶段的约束,无需冻结教师模型,并将其适应于掩码令牌揭示和编辑转换。
## 3 基础知识
图3:可编辑dLLM解码示意图。在每个解码步骤,高置信度的掩码位置被去噪,同时已生成的令牌也可能被修正以纠正早期错误。#### 掩码扩散语言模型。
参见图注图4:一致性强制概览。左:自身展开的阈值解码轨迹在每次累计M2T揭示数达到阶段大小SS时被降采样为相邻阶段对;右:早期的低上下文状态被训练以匹配同一模型在后期、信息更丰富状态下的停止梯度预测。掩码扩散语言模型将文本生成公式化为在离散令牌空间中的去噪问题(Austin et al\. 2021a (https://arxiv.org/html/2608.13925#bib.bib4);Lou et al\. 2024 (https://arxiv.org/html/2608.13925#bib.bib27);Sahoo et al\. 2024 (https://arxiv.org/html/2608.13925#bib.bib34))。给定提示词x∈Xx\\in\\mathcal\{X\}和干净的目标序列y=\(y1,...,yL\)y=\(y^\{1\},\\ldots,y^\{L\}\)(词汇表为V\\mathcal\{V\}),前向过程通过独立地将令牌替换为\[MASK\]\[\\mathrm\{MASK\}\]来破坏y。令αt∈\[0,1\]\\alpha\_\{t\}\\in\[0,1\]表示在噪声时间t令牌保持未被掩码的概率,令sts\_\{t\}为被破坏的序列。在吸收掩码过程下:
q(stj∣yj)=\{αt,stj=yj,1−αt,stj=\[MASK\]\.q(s\_\{t\}^\{j\}\\mid y^\{j\})=\\begin\{cases\}\\alpha\_\{t\},&s\_\{t\}^\{j}=y^\{j\},\\\\ 1\-\\alpha\_\{t\},&s\_\{t\}^\{j}=\[\\mathrm\{MASK\}\].\\end\{cases\}
反向模型为每个掩码位置j预测一个分类分布qθ(⋅∣x,st,j)q\_\{\\theta\}(\\cdot\\mid x,s\_\{t\},j)。
令Mt=\{j:stj=\[MASK\]\}M\_\{t\}=\\\{j:s\_\{t\}^\{j\}=\[\\mathrm\{MASK\}\]\\\}表示掩码位置。训练可以写成掩码扩散的标准变分下界,简化为这些位置上的加权交叉熵:
LMDLM\\displaystyle\\mathcal\{L\}\_\{\\mathrm\{MDLM\}\}=E(x,y),t,st\[w(t)∑j∈MtCEθj\],\\displaystyle=\\mathbb\{E\}\_\{(x,y),t,s\_\{t\}\\}\\left\[w(t)\\sum\_\{j\\in M\_\{t\}\\}\\mathrm\{CE\}\_\{\\theta\}^\{j\\right\],(1)CEθj\\displaystyle\\mathrm\{CE\}\_\{\\theta\}^\{j\}=−logqθ(yj∣x,st,j)\.\\displaystyle=-\\log q\_\{\\theta\}(y^\{j\}\\mid x,s\_\{t\},j)\.这里w(t)=−αt′/(1−αt)w(t)=-\\alpha^\{\\prime\}\_\{t\}/(1\-\\alpha\_\{t\})是由吸收扩散过程诱导的正ELBO权重。该目标训练模型从部分观察的上下文中恢复干净令牌,从而在推理时能够并行去噪多个位置。
在当前的大型dLLMs中,这种掩码扩散目标通常与块扩散(Arriola et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib3);Bie et al\. 2025 (https://arxiv.org/html/2608.13925#bib.bib7))一起使用,块扩散将目标序列划分为块,并在顺序生成块的同时并行去噪每个块。近期的可编辑dLLMs进一步增强了此块扩散框架,增加了令牌到令牌的精炼,允许在后续去噪状态中修改已承诺的令牌(Bie et al\. 2026 (https://arxiv.org/html/2608.13925#bib.bib6))。此后,除非另有说明,我们遵循此块扩散设置,并在一个块内讨论解码和训练。
#### 基于置信度的并行解码。
在推理时,块扩散通过从一个全掩码块状态s0s\_\{0\}开始,迭代地将其去噪为全干净状态来生成一个块。此过程产生一个轨迹T=(s0,s1,...,sT)\\mathcal\{T\}=(s\_\{0\},s\_\{1\},\\ldots,s\_\{T\}),其中TT是为该块分配的解码步数。在步骤t,令Mt=\{j:stj=\[MASK\]\}M\_\{t\}=\\\{j:s\_\{t\}^\{j\}=\[\\mathrm\{MASK\}\]\\\}表示被掩码的位置。相似文章
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。
LEAP:通过前瞻早期收敛令牌检测释放 dLLM 并行潜力
本文介绍了 LEAP,这是一种无需训练的方法,旨在通过检测早期收敛令牌来加速扩散语言模型(dLLMs)的推理过程。该方法能在不损失准确性的前提下,将去噪步骤减少 30%。
基于时空并行解码与置信度外推的高效扩散LLMs
本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。
DC-Leap: 通过草稿引导的连续跳跃解码实现dLLMs的无训练加速
提出DC-Leap,一种无训练框架,通过引入动态连续验证和草稿引导解码来加速扩散大语言模型,在保持生成质量的同时实现高达105倍的加速。
Fast-dLLM++:用于更快扩散LLM推理的Fr\'{e}chet剖面解码
Fast-dLLM++ 引入了适用于扩散LLM的Fr\'{e}chet剖面解码,这是一种无需训练的方法,基于异构置信度剖面选择并行提交集。在LLaDA-8B模型的基准测试中,它实现了高达37%的吞吐量提升,同时保持可比的准确性。