Prefix-Denoising Consistency:扩散语言模型的测试时验证
摘要
本文介绍了Prefix-Denoising Consistency (PDC),一种用于扩散语言模型的测试时验证方法,通过使用前缀条件再生和多数投票来提高推理任务的性能。
arXiv:2608.25311v1 公告类型:新
摘要:扩散语言模型 (DLMs) 近年来在与自回归 (AR) 模型的竞争中日益具有竞争力,甚至在特定任务上超越了它们。与 AR 模型不同,DLMs 通过迭代去噪产生输出,而没有从左到右的顺序。为了进一步提高 DLMs 的性能,我们引入了 PDC (\emph{Prefix-Denoising Consistency}),一种用于 DLMs 的测试时自验证方法。PDC 利用了在前缀条件再生下 DLMs 中的一个独特测试时信号,正确轨迹比不正确的轨迹更稳定且可重现。具体而言,给定一个初始生成的样本,PDC 在句子中间位置分割,并基于固定前缀重新生成剩余的令牌。在数学推理和常识推理基准测试中,PDC 持续改进初始样本,在计算受限比较中优于独立生成,并且对不同的解掩策略和参数设置具有鲁棒性。这些结果突出了前缀条件再生作为 DLM 特有的有效测试时验证原语。
查看缓存全文
缓存时间: 2026/08/27 09:39
# 前缀去噪一致性:扩散语言模型的测试时验证方法
来源:https://arxiv.org/html/2608.25311
###### 摘要
扩散语言模型(DLMs)近年来在与自回归(AR)模型的竞争中日益展现竞争力,甚至在特定任务上超越了后者。与AR模型不同,DLMs通过迭代去噪生成输出,且不遵循从左到右的顺序。为进一步提升DLMs的性能,我们提出了PDC(*前缀去噪一致性*),这是一种针对DLMs的测试时自验证方法。PDC利用了在固定前缀条件下DLMs在测试时出现的一个独特现象:正确轨迹比错误轨迹更稳定且更具可复现性。具体而言,给定一个初始生成的样本,PDC在句子中间位置进行分割,并在固定前缀的条件下重新生成剩余的token。在数学推理和常识推理基准测试中,PDC持续提升了初始样本的性能,在计算约束对比中优于独立生成的结果,并且对不同的去掩码策略和参数设置具有鲁棒性。这些结果凸显了前缀条件下的再生作为一种有效的、DLM特有的测试时验证原语的价值。
前缀去噪一致性前缀条件输入再生输出投票ρ=0\.1\\rho=0\.1ρ=0\.5\\rho=0\.5ρ=0\.9\\rho=0\.9a\(0\.1\)a^\{\(0\.1\)\}a\(0\.5\)a^\{\(0\.5\)\}a\(0\.9\)a^\{\(0\.9\)\}DLM再生多数投票a\(0\.1\),a\(0\.5\),a\(0\.9\)\{\\scriptstyle a^\{\(0\.1\)\},\\,a^\{\(0\.5\)\},\\,a^\{\(0\.9\)\}\}未掩码位置已掩码位置
图1:前缀去噪一致性(PDC)概述。给定一个初始的扩散语言模型输出,PDC以保留率ρ∈\{0\.1,0\.5,0\.9\}\\rho\\in\\\{0\.1,0\.5,0\.9\\\}保留精确的前缀,将同一长度为L的输出窗口内的剩余位置重新掩码,并重新生成它们以获取候选答案。最终答案仅通过对再生答案的多数投票选出;初始答案仅记录用于分析,不参与投票。
## 1 引言
扩散语言模型(DLMs)(Nie et al\., 2025; Zhu et al\., 2025; Ye et al\., 2025)最近已成为自回归(AR)语言模型(OpenAI, 2025; Qwen Team, 2025; NVIDIA, 2025)的一个有吸引力的替代方案。与严格从左到右生成token的AR模型不同,DLMs通过迭代去噪来优化输出,从而能够进行更全局的修改,并可能实现更并行、更高效的推理。近期的DLMs在一系列语言和推理任务中展现出竞争力(Gong et al\., 2025; Fu et al\., 2026),表明基于扩散的生成可以为标准的AR范式之外提供一个有前景的新扩展方向。
与AR模型相比,最先进的DLMs在解码时采用低温以获得强大的pass@1准确率。然而,这也给测试时验证带来了挑战:由于温度较低,重复采样的多样性有限,因为DLMs可能遵循相似的去噪轨迹并返回相同的答案。这使得将自一致性从AR模型直接迁移过来变得不那么直接。在AR推理中,自一致性通过采样多条推理路径并选择最频繁的答案来提高准确率(Wang et al\., 2023)。然而,对于低温DLM解码,重复的完整生成可能导致近乎相同的去噪轨迹,因此样本之间的一致性可能夸大了可靠性,而非提供独立的验证。最近的工作(Wang et al\., 2026a)通过在去掩码过程中使用时间信息(TiF)来解决这个问题。TiF对从中间去噪步骤信息中提取的答案进行投票,表明去噪轨迹包含有用的推理信号,并且可以提高准确率。然而,TiF利用了单个去噪轨迹内的一致性:它重用一次运行的中间状态,而不是生成多条替代推理轨迹。因此,从设计上讲,它无法直接利用使多数投票在AR推理中有效的多轨迹自一致性机制。TiF可以利用该运行中的时间波动,但一旦运行被锁定在错误的推理路径上,它就无法分支到新的轨迹。
252550507575100100Dream\-7BGSM8KMATH\-500SVAMP252550507575100100LLaDA\-8B128256512252550507575100100LLaDA\-1\.5128256512128256512R0\.5\+R^\{\+\}\_\{0\.5\}:正确答案保留率R0\.5−R^\{\-\}\_\{0\.5\}:相同错误保持率
图2:在ρ=0\.5\\rho=0\.5再生下的复现率。绿色表示正确答案保留率R0\.5\+R^\{\+\}\_\{0\.5\},红色表示相同错误答案保留率R0\.5−R^\{\-\}\_\{0\.5\},在三个数学基准测试中,生成长度L=128,256,512L=128,256,512。差距R0\.5\+−R0\.5−\>0R^\{\+\}\_\{0\.5\}\-R^\{\-\}\_\{0\.5\}\>0表明正确答案比错误答案更具可复现性。包括CSQA和SQA在内的完整复现率结果报告在附录表4中。
为解决此问题,我们提出了PDC(*前缀去噪一致性*)。从已完成的输出开始,它保留一个精确的前缀,重新掩码剩余位置,并以相同的温度重新去噪这些位置。在几个保留率(即保留的前缀量)上重复此干预,会产生结构化的替代轨迹,其提取的答案通过多数投票进行聚合。这使得模型可以在保留初始解决方案中有用上下文的同时,修正原始生成中的错误。
我们的贡献如下:
- • **前缀条件下的再生**。PDC是一种测试时缩放方法,它在固定输出窗口内保持精确的前缀,重新掩码未保留的位置,并仅对再生的答案进行投票。初始答案被排除在外,以隔离前缀条件下去噪的效果。
- • **初始正确的答案更具可复现性**。图2显示,初始正确的答案比初始错误的答案更具可复现性。这一观察引出了我们的算法。
- • **性能优于初始样本**。在涵盖数学和常识推理基准的完整扩散设置中,PDC持续优于初始样本和TiF。
- • **计算效率与鲁棒性分析**。我们将PDC与标准自一致性(即多数投票)进行比较。我们表明,PDC在更小的总去噪步预算下优于多数投票。我们还对不同的去掩码方案和设置进行了验证,观察到了性能提升。
## 2 前缀去噪一致性
### 2\.1 标准DLM推理时间
DLMs通过迭代去噪一个以掩码token初始化的固定长度序列来生成输出。给定一个提示x、最大输出长度L和总去噪步数T,令V≤L\\mathcal\{V\}^\{\\leq L\}表示词汇表V\\mathcal\{V}上长度至多为L的token序列集合。
去噪过程从一个完全由掩码token组成的输出窗口开始:
z\(0\)\\displaystyle z^\{\(0\)\}=\[x,\[MASK\],...,\[MASK\]⏟L\],\\displaystyle=\\left\[x,\\;\\underbrace\{\\text\{\{\[MASK\]\}\},\\ldots,\\text\{\{\[MASK\]\}\}\}\_\{L}\\right\],\(1\)
在每个去噪步t=1,...,Tt=1,\\ldots,T,DLM并行预测当前所有掩码输出位置的token,条件是部分去噪的序列z\(t−1\)z^\{\(t\-1\)\}。然后,它根据去噪计划选择这些位置的一个子集进行解掩码。该计划通常基于模型的置信度。剩余的位置保持掩码状态,生成一个更新的序列z\(t\)z^\{\(t\)\},例如:
z\(t\)=\[x,\[MASK\],\[TOKEN\],...,\[TOKEN\],\[MASK\],...⏟L\].z^\{\(t\)\}=\\left\[x,\\;\\underbrace\{\\text\{\{\[MASK\]\}\},\\text\{\{\[TOKEN\]\}\},\\ldots,\\text\{\{\[TOKEN\]\}\},\\text\{\{\[MASK\]\}\},\\ldots\}\_\{L}\\right\].
因此,在中间去噪步,输出窗口既包含仍被掩码的位置,也包含在早期步骤中填入的token。这些位置不一定要按照从左到右的顺序解掩码;相反,它们可能以去噪计划决定的任意顺序被解析。经过T次去噪步后,DLM获得一个完全解掩码的输出窗口,输出序列y=z\(T\)y=z^\{\(T\)\},其长度不超过输出长度L。
算法1:前缀去噪一致性(PDC)
1:输入:提示x,生成预算L,去噪预算T,保留率集合R=\{0\.1,0\.5,0\.9\}\\mathcal\{R\}=\\\{0\.1,0\.5,0\.9\\\},答案提取器\\mathrm\{Extract\}
2:输出:再生投票答案\(\hat{a}\),或无投票
3:
y←DLM\(x,L,T\)y\\leftarrow\\mathrm\{DLM\}\(x;L,T\); // 初始生成
ly←\|y\|\\ell\_\{y\}\\leftarrow\|y\|
4:记录a\(0\)←Extract\(y\)a^\{\(0\)\}\\leftarrow\\mathrm\{Extract\}\(y\) // 仅用于诊断
5:对每个保留率ρ∈R\\rho\\in\\mathcal\{R\}执行
6:如果ly=0\\ell\_\{y\}=0则
7:
Lρprefix←0L\_\{\\rho\}^\{\\text\{prefix\}\}\\leftarrow 0
8:否则
9:
Lρprefix←max\(1,⌊ρly⌋\)L\_\{\\rho\}^\{\\text\{prefix\}\}\\leftarrow\\max\(1,\\lfloor\\rho\\ell\_\{y\}\\rfloor\)
10:结束如果
11:
Lρ←L−LρprefixL\_\{\\rho\}\\leftarrow L\-L\_\{\\rho\}^\{\\text\{prefix\}\}
12:
Tρ←LρT\_\{\\rho\}\\leftarrow L\_\{\\rho\}
13:运行受限DLM,输出位置1:Lρprefix1\{:\}L\_\{\\rho\}^\{\\text\{prefix\}\}固定,LρL\_\{\\rho\}后缀位置掩码:
14:
y\(ρ\)←DLM\(x,y1:Lρprefix;Lρ,Tρ\)y^\{\(\\rho\)\}\\leftarrow\\mathrm\{DLM\}\\left\(x,y\_\{1:L\_\{\\rho\}^\{\text\{prefix\}\}\};L\_\{\\rho\},T\_\{\\rho\}\\right\)
15:
a\(ρ\)←Extract\(y\(ρ\)\)a^\{\(\\rho\)\}\\leftarrow\\mathrm\{Extract\}\(y^\{\(\\rho\)\}\)
16:结束循环
17:
B←\{a\(ρ\):ρ∈R,a\(ρ\)≠∅\}\\mathcal\{B\}\\leftarrow\\\{a^\{\(\\rho\)\}:\\rho\\in\\mathcal\{R\},\\;a^\{\(\\rho\)\}\\neq\\varnothing\\\}
18:如果B=\{\}\\mathcal\{B\}=\\\{\\\}则
19:返回无投票
20:结束如果
21:返回Maj\(B\)\\operatorname\{Maj\}\(\\mathcal\{B\}\),平票时按固定顺序ρ=0\.1,0\.5,0\.9\\rho=0\.1,0\.5,0\.9裁决
22:*注意:*初始答案a\(0\)a^\{\(0\)\}不参与投票。
我们的方法不依赖于DLM更新规则的内部形式。因此,我们将DLM视为一个黑盒生成器,给定输入x、输出预算L和去噪步数T,返回序列y=DLM\(x,L,T\),y∈V≤L\.y=\\mathrm\{DLM\}\(x;L,T\),\\qquad y\\in\\mathcal\{V\}^\{\\leq L\}\.
输出长度和初始提取的答案为:
ly=\|y\|,a\(0\)=Extract\(y\),\\ell\_\{y\}=\|y\|,\\qquad a^\{\(0\)\}=\\mathrm\{Extract\}\(y\),
其中\\mathrm\{Extract\}是一个任务特定的规范答案提取器,\\mathrm\{Extract\}\(y\)=\\varnothing表示提取失败(答案解析失败)。
在典型的扩散解码中,模型并行预测当前掩码位置的token,每一步根据去噪计划(通常基于置信度)选择一部分位置进行解掩码(Nie et al\., 2025; Zhu et al\., 2025; Ye et al\., 2025)。
### 2\.2 前缀去噪一致性(PDC)
我们提出的方法PDC(图1和算法1)以保留率ρ∈R\\rho\\in\\mathcal\{R\}保留初始生成输出y的一个前缀,掩码剩余的输出位置,使用相同的DLM重新生成这些位置,然后通过多数投票聚合重新生成的答案。
在本文中,我们使用固定的三个保留率集合R=\{0\.1,0\.5,0\.9\}\\mathcal\{R\}=\\\{0\.1,0\.5,0\.9\\\},该集合覆盖了弱、中、强前缀条件,同时仅需三次再生。给定长度为ly\\ell\_\{y\}的初始输出y,保留率ρ\\rho下保留的token数为:
Lρprefix=⌊ρly⌋\.L\_\{\\rho\}^\{\\text\{prefix\}\}=\\lfloor\\rho\\ell\_\{y\}\\rfloor\.
剩余的再生长度和去噪步数为:
Lρ=L−Lρprefix,Tρ=Lρ\.L\_\{\\rho\}=L\-L\_\{\\rho\}^\{\\text\{prefix\}\},\\qquad T\_\{\\rho\}=L\_\{\\rho\}\.
与公式(1)不同,再生输入为以下等式:
zρ\(0\)=\[x,y1:Lρprefix,\[MASK\],...,\[MASK\]⏟Lρ\],z^\{\(0\)\}\_\{\\rho\}=\\left\[x,\\;y\_\{1:L\_\{\\rho\}^\{\text\{prefix\}\}\},\\;\\underbrace\{\\text\{\{\[MASK\]\}\},\\ldots,\\text\{\{\[MASK\]\}\}\}\_\{L\_\{\\rho\}\}\right\],
其中y1:Lρprefixy\_\{1:L\_\{\\rho\}^\{\text\{prefix\}\}\}是以速率ρ\\rho保留的输出token,LρL\_\{\\rho\}是要去噪的掩码后缀位置数量。仅对剩余的LρL\_\{\\rho\}个输出位置进行去噪:
y\(ρ\)=DLM\(x,y1:Lρprefix;Lρ,Tρ\),\|y\(ρ\)\|≤L\.y^\{\(\\rho\)\}=\\mathrm\{DLM\}\\left\(x,y\_\{1:L\_\{\\rho\}^\{\text\{prefix\}\}\};L\_\{\\rho\},T\_\{\\rho\}\\right\),\\qquad\|y^\{\(\\rho\)\}\|\\leq L\.
再生的答案为:
a\(ρ\)=Extract\(y\(ρ\)\)\.a^\{\(\\rho\)\}=\\mathrm\{Extract\}\(y^\{\(\\rho\)\}\).
因此,y\(ρ\)y^\{\(\\rho\)\}的最终长度可能与初始输出长度ly\\ell\_\{y\}不同。然而,再生并非从初始输出的末尾继续。相反,它只是在同一长度为L的输出窗口内重新填充被重新掩码的位置。
受到AR模型类似观察的启发(Iwase et al\., 2026),我们发现在DLMs中,正确的推理路径在再生下比错误的更具可复现性(图2)。标准答案用a⋆a^\{\\star\}表示。正确答案的复现率衡量的是再生是否保留了正确的初始答案,定义为:
Rρ\+=Pr\[a\(ρ\)=a⋆∣a\(0\)=a⋆\]\.R^\{\+\}\_\{\\rho\}=\\Pr\\left\[a^\{\(\\rho\)\}=a^\{\\star\}\\mid a^\{\(0\)\}=a^\{\\star\}\\right\].
相同错误保持率衡量的是当初始答案错误时,再生是否重复相同的错误答案,定义为:
Rρ−=Pr\[a\(ρ\)=a\(0\)∣a\(0\)≠∅,a\(0\)≠a⋆\]\.R^\{\-\}\_\{\\rho\}=\\Pr\\left\[a^\{\(\\rho\)\}=a^\{\(0\)\}\\mid a^\{\(0\)\}\\neq\\varnothing,\\;a^\{\(0\)\}\\not=a^\{\\star\}\\right\]\.
###### 观察 2\.1(复现率)。在不同的实验设置下,在DLMs中,初始正确的答案比初始错误的答案更有可能被保留:Rρ\+≥Rρ−\.R^\{\+\}\_\{\\rho\}\\geq R^\{\-\}\_\{\\rho\}\.
利用观察2\.1,PDC评估初始答案的可靠性。PDC仅对再生的答案进行投票,初始答案a\(0\)a^\{\(0\)\}被排除在最终投票之外。这隔离了前缀条件再生的效果:DLMs只有在再生的候选答案支持更好的答案时,才能改进初始答案。非空再生答案的多重集为:
B=\{a\(ρ\):ρ∈R,a\(ρ\)≠∅\}\\mathcal\{B\}=\\left\\\{a^\{\(\\rho\)\}:\\rho\\in\\mathcal\{R\},\\;a^\{\(\\rho\)\}\\neq\\varnothing\\right\\\}
如果B=\{\}\\mathcal\{B\}=\\\{\\\},则该示例被标记为无投票。否则,PDC返回出现频率最高的再生答案,记为Maj\(B\)\\operatorname\{Maj\}\(\\mathcal\{B\}\):
a^=Maj\(B\)\.\\hat\{a\}=\\operatorname\{Maj\}\(\\mathcal\{B\}\)\.
三个保留率探测了不同长度的依赖性。相似文章
OPTD:面向少步扩散语言模型的基于一致性引导自适应压缩的在策略转移蒸馏
本文介绍了OPTD,一种用于少步扩散语言模型的、具有一致性引导自适应压缩的在策略转移蒸馏方法,在四个推理和代码生成基准上改善了质量-效率权衡。
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。
超越Token位置:扩散语言模型中跨去噪步骤的安全对齐
本文提出了一种无需训练的解码方法,称为拒绝感知早期承诺(RAEC),通过利用早期去噪步骤中的拒绝信号来改进扩散语言模型的安全对齐。
残差上下文扩散语言模型(2分钟阅读)
本文介绍了残差上下文扩散(RCD)模块,该模块通过回收扩散语言模型中丢弃的令牌表示来提高效率和准确性,在具有挑战性的推理任务上实现了5–10%的准确性提升,并将去噪步骤减少了多达4–5倍。
GDSD:强化学习作为扩散语言模型的引导式降噪器自蒸馏
GDSD提出了一种强化学习方法,直接从优势引导的自教师中蒸馏扩散语言模型的降噪器,避免了基于ELBO的似然代理带来的偏差。在规划、数学和编码基准上,比先前最先进的方法准确率提升高达+19.6%。