OPTD:面向少步扩散语言模型的基于一致性引导自适应压缩的在策略转移蒸馏
摘要
本文介绍了OPTD,一种用于少步扩散语言模型的、具有一致性引导自适应压缩的在策略转移蒸馏方法,在四个推理和代码生成基准上改善了质量-效率权衡。
arXiv:2608.02942v1 公告类型:新
摘要:扩散语言模型(dLLMs)可以并行预测多个词元,但要实现准确生成,仍需要大量迭代去噪步骤。少步蒸馏通过将多个教师步骤压缩为单次学生转移来加速解码。然而,现有方法在离策略轨迹上构建监督。在推理时,学生模型的早期并行承诺会改变后续预测的上下文,因此其实际访问的状态会偏离受监督的状态——而这恰恰发生在步骤压缩最激进的时候。在策略蒸馏是解决这种不匹配的自然方法,但它仍未解决每次转移应推进多远的问题:仅匹配教师模型的下一个动作会限制压缩程度,而不加区分地合并未来动作又可能违反中间依赖关系。为了解决这一局限,我们提出了OPTD,即带有一致性引导自适应压缩的在策略转移蒸馏。它从少步学生模型自身的轨迹中采样部分状态,使用冻结的、仅基于问题的教师模型来识别与结果一致的未来候选,并按当前状态置信度对它们排序。该方法随后选择最长的前缀,其联合承诺能够保持教师模型rollout的结果。一个集合瓶颈目标将每个经过验证的未来候选提升到解码器的释放阈值,同时冻结教师KL锚点对所有其他活动位置进行正则化。目标构建和训练均不使用金标准响应。在四个数学推理和代码生成基准上,OPTD持续改善质量-效率权衡,并在评估的少步基线中取得了最强的总体质量约束AUP。
查看缓存全文
缓存时间: 2026/08/05 07:42
# OPTD:面向少步扩散语言模型的基于一致性指导自适应压缩的在策略迁移蒸馏
Source: https://arxiv.org/html/2608.02942
Xiaocheng Lu1,\*, Hualei Zhang1,\*, Shuhan Guo2,†\dagger, Jie Zhang1, Xiaoyi Pang1, Jian Liu1, Haoxi Li1, Bohai Gu1, Haoxuan Che1, Jingcai Guo3, Song Guo1
###### 摘要
扩散语言模型(dLLMs)可以并行预测多个词元,但精确生成仍需要大量迭代去噪步骤。少步蒸馏通过将多个教师步骤压缩为单个学生转换来加速解码。然而,现有方法在离策略轨迹上构建监督信号。在推理时,学生的早期并行提交会改变后续预测的上下文,因此它实际访问的状态会偏离监督所对应的状态——正是在步压缩最激进的时候。在策略蒸馏是应对这种不匹配的自然补救措施,但它仍留下一个问题:每次转换应该推进多远?仅匹配教师的下一步动作会限制压缩,而不加区分地合并未来动作则可能违反中间依赖。为了解决这一局限,我们提出OPTD,即带有一致性指导自适应压缩的在策略转换蒸馏。它从少步学生自身的轨迹中采样部分状态,使用冻结的、仅基于问题的教师来识别与结果一致的未来候选,并按当前状态置信度对其进行排序。该方法随后选择联合提交能保持教师展开结果的最长前缀。一个集合瓶颈目标促使每个经过验证的未来候选达到解码器的释放阈值,同时冻结教师KL锚点对所有其他活动位置进行正则化。目标构建和训练均不使用金标准答案。在四个数学推理和代码生成基准上,OPTD持续改善了质量–效率权衡,并在所评估的少步基线中取得了最强的整体质量约束AUP。
11footnotetext:同等贡献。22footnotetext:在香港科技大学实习期间完成的工作。## 引言
Refer to caption图1:质量–效率前沿。四个基准上的平均质量约束AUP。OPTD达到313.18 AUP:是原始LLaDA的6.69倍,比先前AUP最高的方法TAD-S高27.5%。其收益来自更高的并行性和适度的精度权衡。扩散语言模型(dLLMs)通过迭代地将掩码位置替换为预测词元来生成文本(Nie等,2025 (https://arxiv.org/html/2608.02942#bib.bib7);Sahoo等,2024 (https://arxiv.org/html/2608.02942#bib.bib5))。由于去噪器会为每个剩余掩码预测一个分布,解码器可以并行提交多个高置信度词元。然而,精确生成仍然需要多次神经函数评估(NFEs),因为后续预测通常依赖于先前去噪步骤所揭示的上下文。少步蒸馏通过训练一个学生转换来近似多个教师转换,从而降低这一成本。图1 (https://arxiv.org/html/2608.02942#Sx1.F1)预览了由此产生的四个基准上的质量–效率权衡。
大多数现有少步方法以离策略方式构建压缩目标,使用固定的教师轨迹或预设的破坏调度,而不是加速后学生自身的行为(Zhang等,2026 (https://arxiv.org/html/2608.02942#bib.bib18);Qian等,2026 (https://arxiv.org/html/2608.02942#bib.bib13);Kim等,2026 (https://arxiv.org/html/2608.02942#bib.bib14);Liang等,2026 (https://arxiv.org/html/2608.02942#bib.bib15);Shen等,2026 (https://arxiv.org/html/2608.02942#bib.bib16);Zhou等,2026 (https://arxiv.org/html/2608.02942#bib.bib17))。在推理时,学生决定要提交的词元和下一个部分状态。这种不匹配对dLLM尤其重要,因为一个并行动作会改变所有剩余掩码的上下文,并可能改变许多后续的释放决策。在我们的审计中,只有33.7%的学生访问状态出现在相应的教师轨迹上;覆盖率从前八个解码步骤中的55.0%下降到第40步之后的6.5%。此外,在进度匹配的教师状态上验证通过的合并中,只有50.3%在迁移到学生状态后仍然有效。
在策略蒸馏使监督信号与学生访问的状态对齐,但它不能决定一次转换应推进多远。仅匹配教师的即时动作无法提供额外压缩,而固定的合并视界则会在每个状态施加相同深度,并且在我们的视界诊断中无法将更深视界转化为额外并行性。逐词元验证也不够:一个未来词元在单独情况下可能与教师结果中的值一致,但当与其他未来词元联合提交时可能变得无效。事实上,我们后来发现,单独有效词元的并集也可能无法通过联合检查(在验证单元消融中为416个中的10个)。这两种失败模式促使我们设计一种直接在学生访问状态上评估的状态依赖压缩规则。
我们提出OPTD,即在策略转换蒸馏,采用一致性指导的自适应压缩。OPTD从不断发展的学生推理策略中采样部分状态,并查询一个冻结的、仅基于问题的教师(它只看到问题和当前部分状态)以获取与结果一致的未来候选。它按当前状态置信度对这些候选排序,并选择联合提交能保持教师展开结果的最长前缀。一个集合瓶颈确定性损失促使每个经过验证的未来词元达到解码器的释放阈值,而冻结教师KL锚点则对所有其他活动位置进行正则化。教师和验证器仅用于构建训练目标;推理时运行不变的学生和解码器。经验上,该过程提高了解码并行性,同时保持了有竞争力的精度。没有任何模型或目标构建组件会观察到金标准答案或参考答案。
总之,我们的主要贡献有三点:
- •我们识别并量化了离策略少步dLLM蒸馏中的状态–动作不匹配,展示了教师收集的监督信号如何偏离演化中学生所遇到的状态和释放决策。
- •我们引入了一致性指导的自适应压缩,它选择最长的保持结果候选前缀,并通过阈值对齐的验证集确定性强制和冻结教师锚点对其进行优化。
- •在数学推理和代码生成基准上,OPTD相比于少步基线改善了精度–并行性权衡;受控分析分离了在策略状态和联合一致性验证的各自效果。
## 相关工作
#### 扩散语言模型。
离散扩散将去噪扩展到类别状态空间(Austin等,2021a (https://arxiv.org/html/2608.02942#bib.bib3);Hoogeboom等,2021 (https://arxiv.org/html/2608.02942#bib.bib4)),最近的掩码dLLM将该公式扩展到语言建模(Sahoo等,2024 (https://arxiv.org/html/2608.02942#bib.bib5);Arriola等,2025 (https://arxiv.org/html/2608.02942#bib.bib6);Nie等,2025 (https://arxiv.org/html/2608.02942#bib.bib7);Ye等,2025 (https://arxiv.org/html/2608.02942#bib.bib8);Cheng等,2025 (https://arxiv.org/html/2608.02942#bib.bib9))。在部分状态xx下,去噪器为每个掩码位置预测一个分布。动态解码器释放置信度超过阈值的位点,并在没有位置就绪时进行回退释放。因此,模型质量和置信度校准共同决定每次前向释放的词元数量。Fast-dLLM、D2F和dParallel通过前缀缓存和并行释放机制加速这一解码过程(Wu等,2025 (https://arxiv.org/html/2608.02942#bib.bib10);Wang等,2026 (https://arxiv.org/html/2608.02942#bib.bib12);Chen等,2025 (https://arxiv.org/html/2608.02942#bib.bib11));这些系统级优化与学习到的转换策略互补。
#### 少步和轨迹蒸馏。
渐进蒸馏和一致性学习在连续域中压缩多步扩散采样器(Salimans and Ho2022 (https://arxiv.org/html/2608.02942#bib.bib25);Song等,2023 (https://arxiv.org/html/2608.02942#bib.bib26))。最近的dLLM方法使用伪轨迹、时间目标、锐化分布、学习释放顺序或一致性目标来减少去噪成本(Qian等,2026 (https://arxiv.org/html/2608.02942#bib.bib13);Kim等,2026 (https://arxiv.org/html/2608.02942#bib.bib14);Liang等,2026 (https://arxiv.org/html/2608.02942#bib.bib15);Shen等,2026 (https://arxiv.org/html/2608.02942#bib.bib16);Zhou等,2026 (https://arxiv.org/html/2608.02942#bib.bib17);Zhang等,2026 (https://arxiv.org/html/2608.02942#bib.bib18))。这些方法建立了强大的蒸馏检查点,但它们的监督通常是在学生推理轨迹之前或独立于该轨迹的情况下生成的。OPTD与这些初始化方法兼容,并贡献了推理对齐的状态收集和自适应转换压缩。我们的一致性概念也有所不同:它是联合提交的完成块在结果上的一致性,而不是沿采样器轨迹的自一致性。
Refer to caption图2:OPTD概览。当前学生提供在策略部分状态。冻结的、仅基于问题的教师从每个状态向前展开,并提出未来的释放。OPTD保留联合提交能保持教师展开结果的候选动作,并选择最长保持结果的动作。阈值对齐的集合瓶颈确定性强制提升其已验证的未来词元,冻结教师KL锚点正则化所有其他活动位置。
#### 在策略蒸馏。
教师与学生之间的状态分布不匹配是在策略蒸馏的核心动机:GKD让自回归学生生成自己的轨迹,并针对这些轨迹查询教师以获得密集的下一词元监督(Agarwal等,2023 (https://arxiv.org/html/2608.02942#bib.bib24))。dLLM存在同样的不匹配,这促使在该设置下产生了一系列在策略蒸馏工作:OPDLM执行从自回归教师到扩散学生的数据高效知识迁移,但仅监督最终序列,中间去噪状态不受约束(Su等,2026 (https://arxiv.org/html/2608.02942#bib.bib20));d-OPSD将策略自蒸馏细化到步骤级,通过监督任意顺序的释放转换,但依赖推理时不可用的特权自未来条件(Luo等,2026 (https://arxiv.org/html/2608.02942#bib.bib19));TOPD则沿学生自身的去噪轨迹进行基于轨迹的OPD(Ren等,2026 (https://arxiv.org/html/2608.02942#bib.bib33))。这三种方法都将教师监督与学生访问的状态对齐,但它们追求的是能力或对齐提升,而非少步加速。OPTD则直接在学生状态上学习加速合并。
## 在策略转换蒸馏
### 预备知识
掩码dLLM从完全掩码的响应开始。给定问题qq,在部分状态xx上的一次去噪器前向会在每个活动掩码i∈M(x)i\\in M\\(x\\)处预测pθ(⋅∣q,x,i)p\_\{\\theta\}\(\\cdot\\mid q,x,i\)。设G(x)G\\(x\\)为当前暴露的块组,MG(x)⊆M(x)M\_\{G\}\(x\)\\subseteq M\\(x\\)为其掩码位置。定义cθ(i∣q,x)=maxypθ(y∣q,x,i)c\_\{\\theta\}\(i\\mid q,x\)=\\max\_\{y\}p\_\{\\theta\}\(y\\mid q,x,i\)。阈值解码器选择
Aθτ(q,x)=\{i∈MG(x):cθ(i∣q,x)≥τ\}A\_\{\\theta\}^\{\\tau\}\(q,x\)=\\\{i\\in M\_\{G\}\\(x\\):c\_\{\\theta\}\(i\\mid q,x\)\\geq\\tau\\\}(1)并联合提交其argmax词元,为空集时选择最高置信度回退。我们将每次去噪器前向计为一次NFE。
少步蒸馏将多个教师转换替换为单个学生转换。现有方法在固定状态分布doffd\_\{\\mathrm\{off\}\}上训练,而推理遵循学生自身分布dθd\_\{\\theta\}:
Loff=Ex∼doffl(x;θ),Lon=Ex∼dθl(x;θ)。\\mathcal\{L\}\_\{\\mathrm\{off\}\}=\\mathbb\{E\}\_\{x\\sim d\_\{\\mathrm\{off\}\}\\}\\ell\\(x;\\theta\),\\qquad\\mathcal\{L\}\_\{\\mathrm\{on\}\}=\\mathbb\{E\}\_\{x\\sim d\_\{\\theta\}\}\\ell\\(x;\\theta\)。\(2\)由于联合释放会同时改变所有剩余掩码的上下文,因此在doffd\_\{\\mathrm\{off\}\}上构建的目标在dθd\_\{\\theta\}\下通常失效。为了解决这种分布不匹配,OPTD通过直接在x∼dθx\\sim d\_\{\\theta\}\下采样的部分状态上构建监督,在学生诱导的状态分布下进行优化。
### OPTD算法
尽管在策略训练解决了状态分布不匹配,但它并未确定适当的压缩程度:在给定状态下,可以将多少教师转换一致地合并为单个学生转换?OPTD通过自适应转换构建来解决这一状态依赖的压缩问题。如图2 (https://arxiv.org/html/2608.02942#Sx2.F2)所示,当前学生首先使用其推理解码器提供一个在策略状态。我们将这个采样到的学生访问状态称为*根状态*。随后,冻结的教师从该状态生成一个保守续接。从该续接中,OPTD选择一个按置信度排序的最长未来动作,其联合提交保持教师的展开结果。
#### 在策略状态收集。
给定训练问题qq,我们使用与推理时相同的仅基于问题动态解码器,从完全掩码响应运行当前学生到采样到的展开深度,保留结果部分状态xx及其下一次转换所暴露的块组。然后,用(q,x)(q,x)查询冻结的教师策略pTp\_\{T\},以获得其当前分布和保守的未来续接。
#### 一致性指导的自适应压缩。
为了确定每个状态下教师轨迹可以被安全压缩多远,我们执行一致性指导的自适应压缩:我们构建一个有序的、结果一致的未来候选族,并通过测试它们对冻结教师展开结果的影响来选择状态依赖的前缀长度。
具体而言,从学生访问的状态x0=xx^\{0\}=x开始,冻结教师使用置信度阈值τ\\tau保守地完成当前暴露的块组:
x0→A1x1→A2⋯→AJxJ=xT,x^\{0\}\\xrightarrow\{A\_\{1\}\}x^\{1\}\\xrightarrow\{A\_\{2\}\}\\cdots\\xrightarrow\{A\_\{J\}\}x^\{J\}=x^\{T\},\(3)其中AhA\_\{h\}是教师在波次hh的释放集,xTx^\{T\}是展开结果。第一波A1A\_\{1\}在xx处立即可用;后续波次通常依赖于中间释放。暴露的块组限制了目标构建的空间范围;在该块组内,该方法不施加固定的每状态压缩率。教师波次视界HH同时受暴露块组和实现上限H=16H\{=\}16波次的限制。
设y^i=argmaxypT(y∣q,x,i)\\hat\{y\}\_\{i\}=\\arg\\max\_\{y\}p\_\{T\}\(y\\mid q,x,i\)且ci=pT(y^i∣q,x,i)c\_\{i\}=p\_\{T\}\(\\hat\{y\}\_\{i\}\\mid q,x,i\)。一个未来位置只有在当前状态教师预测已与其在教师结果中的值一致时才有资格:
C(x)=\{i∈MG(x)∖A1:y^i=xiT\},\\mathcal\{C\}\(x\)=\\left\\\{i\\in M\_\{G\}\(x\)\\setminus A\_\{1\}:\\;\\hat\{y\}\_\{i\}=x^\{T\}\_\{i\}\\right\\\},相似文章
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。
通过在线策略蒸馏实现数据高效的自回归到扩散语言模型
本文介绍了OPDLM,一种通过在线策略蒸馏将自回归语言模型转换为扩散语言模型的方法,所需训练令牌数量减少15倍到7000倍,同时保留原始模型的知识。
DiffusionOPD:扩散模型中在线策略蒸馏的统一视角
DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。
Draft-OPD:面向推测式草稿模型的在线策略蒸馏
Draft-OPD 引入在线策略蒸馏,结合目标辅助展开和错误重放,克服了训练用于推测解码的草稿模型时存在的离线到推理不匹配问题,实现了超过5倍的无损加速,相较于EAGLE-3和DFlash分别提升了23%和13%。