DCGC: 基于草稿的复杂推理全局校正方法——掩码扩散模型
摘要
本文介绍了DCGC,一个掩码扩散模型框架,用于通过基于不完美草稿的条件,全局校正大语言模型(LLMs)中的缺陷推理轨迹。它无需真实故障标签即可提高推理基准测试的准确性。
arXiv:2608.25428v1 公告类型:新
摘要:修正有缺陷的推理轨迹仍然是大语言模型(LLMs)的一个重大挑战,其自回归生成可能将早期错误传播到后续推理中。我们引入了DCGC,一个掩码扩散模型(MDM)框架,用于全局校正,该框架使用上游求解器的不完美解决方案草稿作为辅助上下文。DCGC结合了任务特定的监督微调(SFT)和一种称为动态双CFG(Dynamic Dual-CFG)的新颖推理时机制。该机制分离问题专用和联合问题-草稿分支,并使用相对置信度差距缩放草稿条件化的残差。在数学、代码和知识推理基准测试中,DCGC优于标准采样和更简单的CFG变体,额外结果表明可转移到不同的扩散骨干网络。在测试时设置中,当真实故障标签不可用时,DCGC通过校正低共识的上游输出来提高完整测试集的准确性,突出了其作为无需验证器的全局校正模块在困难推理实例中的实用性。
查看缓存全文
缓存时间: 2026/08/27 09:20
# 基于掩码扩散模型的草稿条件全局校正用于复杂推理
来源:https://arxiv.org/html/2608.25428
Minhae Oh 隶属:首尔大学电气与计算机工程系 \*同等贡献\. Nakyung Lee 隶属:首尔大学电气与计算机工程系 \*同等贡献\. Jungwoo Lee 隶属:首尔大学电气与计算机工程系 \*同等贡献\. 隶属:通讯作者\.
###### 摘要
校正有缺陷的推理轨迹仍然是大语言模型(LLMs)面临的一个重大挑战,其自回归生成可能将早期错误传播到后续推理中。我们引入了**DCGC**,一个用于全局校正的**掩码扩散模型(MDM)**框架,它使用上游求解器生成的不完善解草稿作为辅助上下文。DCGC结合了针对特定任务的监督微调(SFT)与一种称为**动态双线性分类器引导(Dynamic Dual-CFG)**的新型推理时机制。该机制分离了仅问题分支和联合问题-草稿分支,并使用相对置信度差距缩放草稿条件残差。在数学、代码和知识推理基准测试中,DCGC优于标准采样和更简单的CFG变体,额外结果表明其可迁移至不同的扩散骨干网络。在测试时设置中,当真实失败标签不可用时,DCGC通过校正低共识的上游输出,提升了整个测试集的准确率,凸显了其作为无需验证器的全局校正模块在处理困难推理实例时的实用性。
## 1 引言
尽管大语言模型(LLMs)近期在复杂推理任务上展现了卓越性能,但它们仍然容易出现逻辑谬误和幻觉,尤其是在多步推理环境中。因此,众多研究探讨了自我精炼(self-refinement),即模型迭代地批评和修正自身生成内容以提高解的质量。诸如Self-Refine、Reflexion和LATS等突出方法通过引入反馈循环或搜索机制来缓解这些问题。然而,由于当代LLMs的主流架构是自回归的,大多数现有的自我精炼方法都建立在这种严格的、从左到右的序列范式之上。这使得校正变得困难,因为修订轨迹中的早期错误步骤会成为后续生成的前缀条件,从而可能继续沿着相同的错误路径前进。此外,近期研究表明,自回归模型(ARMs)通常校准不良,并对自己的预测表现出过度自信。这种过度自信可能使无工具的自我校正变得脆弱,因为即使推理轨迹包含错误,模型也可能过度信任自身推理过程。这促使我们考虑将**扩散语言模型(DLMs)**,特别是**MDMs**,作为结构上不同的基底,用于事后推理校正。与承诺单一从左到右前缀的ARMs不同,MDMs通过在掩码位置进行迭代去噪来生成文本,允许在推理过程中重新审视输出序列。这一特性使得MDMs非常适合用于*草稿条件全局校正*,即模型在强条件依赖原始问题的同时,使用不完善草稿作为全局去噪的辅助上下文。尽管有此潜力,先前的工作主要利用MDMs从头生成解,其用于校正长推理轨迹的全局校正用途尚未得到充分探索。
在这项工作中,我们引入了**DCGC(基于掩码扩散模型的草稿条件全局校正)**,一个将MDMs重新用作复杂推理中无工具校正模块的框架。给定一个问题和上游求解器生成的不完善草稿,DCGC在仅问题和联合问题-草稿上下文下执行迭代去噪。草稿通过联合上下文影响生成,而其额外的残差贡献则相对于仅问题分支进行控制。与依赖外部工具、记忆缓冲区或计算成本高昂的树搜索方法不同,DCGC在无工具设置中运行,仅使用内部模型信号。为实现这一点,DCGC结合了**双重能力SFT**与**动态双线性CFG**。SFT阶段在仅问题求解和草稿条件校正上训练MDM,赋予模型在推理时使用的两种条件模式。**动态双线性CFG**随后分离仅问题和联合问题-草稿分支,使用它们的相对置信度差距在去噪过程中调制草稿影响力。这种设计鼓励选择性地重用草稿,而不将内部置信度作为正确性的验证器。
我们的贡献总结如下:
- •我们提出了**DCGC**,一个将MDMs重新用作复杂推理中无工具校正模块的草稿条件全局校正框架。DCGC将不完善的解作为全局去噪和校正的辅助上下文。
- •我们引入了**动态双线性CFG**,一种推理时的引导机制,它分离仅问题和草稿条件分支。通过使用相对置信度差距缩放草稿引导,该方法控制联合上下文在仅问题分支之外的贡献强度。
- •我们在数学、代码和知识推理基准测试中提供了受控的经验证据。DCGC在求解器失败的难题集上改进了最初失败的解决方案,平均准确率比强大的自回归和基于扩散的基线高出24.8%。
## 2 相关工作
#### 非自回归生成与编辑。虽然标准ARMs试图通过提示或工具使用进行迭代推理精炼,但它们固有地遭受顺序错误传播并缺乏全局编辑灵活性。最近,DLMs作为并行、非自回归的替代方案出现,但它们主要被用于*从头*生成而非精炼。为弥合这一差距,我们的框架将DLMs重新用作专门的推理精炼器。受视觉编辑技术启发,我们利用CFG来引导全局去噪过程,实现非顺序、细粒度的校正,同时保留有效的逻辑。
#### CFG中的自适应缩放。为克服静态CFG的局限性,最近的方法动态地调制跨空间区域、时间去噪步骤或内部模型置信度的引导尺度。然而,这些方法是为单条件轨迹设计的,缺乏在多上下文场景中过滤误导性辅助信号的机制。相反,我们提出了一种差异置信度策略,基于来自次要上下文的相对确定性增益调制引导,允许精炼器仅在辅助信息能提高置信度时选择性地使用它。
参见图例 **图 1:DCGC 概览。** DCGC 作为一个迭代去噪过程(左)运行,每一步使用三个并行的条件流:无条件流、问题条件流(Q)和联合条件流(Q, W)。核心的动态双线性CFG机制(右)基于令牌级别的置信度动态调制引导。通过应用基于ReLU的缩放(S₂),DCGC调制影响力,仅在联合上下文提供置信度增益时(C_joint > C_prob)激活残差放大,确保了鲁棒的选择性重用。
## 3 预备知识
#### 掩码扩散模型。MDMs通过迭代去噪过程生成文本。令x₀ = (x₀¹, ..., x₀ᴸ)为干净令牌序列,x_t表示在时间步t的损坏序列。前向过程q(x_t | x₀)根据单调递减的噪声调度α_t ∈ [0, 1],独立地使用掩码令牌[M]损坏每个令牌:
q(x_t | x₀) = ∏_{i=1}^{L} (α_t δ(x_t^i, x₀^i) + (1 - α_t) δ(x_t^i, [M])) (1)
其中δ(·, ·)是克罗内克δ函数。反向过程使用神经去噪器x̂_θ(x_t, t)从损坏状态x_t重建x₀。对于任何0 ≤ s ≤ t ≤ T,联合训练目标为:
E_{q(x_t | x₀), t} [λ_t || x̂_θ(x_t, t) - x₀||²]. (2)
在实践中,MDMs使用**分类器引导(CFG)**来引导生成,其中来自无条件和条件分数的组合梯度推动去噪朝向更符合任务需求的输出。
## 4 方法:DCGC
给定一个问题P和上游求解器生成的不完善草稿W,**DCGC**框架旨在执行全局校正,生成精炼后的解X。该过程使用**动态双线性CFG**引导的MDM迭代进行。在每一步t,我们从损坏的序列x_t出发。我们定义三个并行的条件流:
1. **无条件流**:x̂_uncond = x̂_θ(x_t, t)
2. **仅问题流**:x̂_prob = x̂_θ(x_t, t; c=P)
3. **联合流**:x̂_joint = x̂_θ(x_t, t; c=(P, W))
DCGC的核心更新规则结合了这些信号:
x̂_final = x̂_prob + S₂ * (x̂_joint - x̂_prob) - S₁ * (x̂_uncond - x̂_prob) (3)
这里,S₁和S₂是动态尺度。标准CFG通常使用固定的S₁。关键创新是**动态缩放因子S₂**,它调制来自草稿条件的*残差*贡献。
**动态双线性CFG**机制通过以下方式计算S₂:
C_joint = max softmax(x̂_joint)
C_prob = max softmax(x̂_prob)
ΔC = C_joint - C_prob
S₂ = ReLU(β * ΔC) (4)
这里,β是一个超参数。该机制的核心是:**仅当联合上下文提供了比仅问题上下文更高的置信度(ΔC > 0)时,才放大草稿条件残差**。这鼓励模型在草稿有助于提高当前预测置信度时重用草稿信息,并在草稿可能产生误导时忽略它。ReLU确保当ΔC ≤ 0时,S₂ = 0,有效关闭草稿的影响。
**双重能力SFT**:为了使模型能够同时处理仅问题和草稿条件两种模式,我们在两个任务上进行微调:(1)仅问题求解,和(2)给定问题和草稿的校正。这确保了模型能有效利用两种条件信号。
## 5 实验
我们在三个推理领域评估DCGC:数学(MATH)、代码(MBPP)和知识推理(ARC-Challenge)。我们将其与强大的基线进行比较,包括标准采样、无草稿的标准CFG,以及更简单的CFG变体。
**主要结果**:表1总结了在"求解器失败"难题子集上的整体校正准确率。DCGC在所有基准测试中均显著优于自回归和基于扩散的基线,平均提升达24.8%。这证实了其作为通用校正模块的有效性。
**消融研究**:我们分析了动态双线性CFG中每个组件的作用。移除动态缩放(S₂)导致性能显著下降,表明选择性重用至关重要。移除联合流分支,仅使用问题流则等同于无草稿的校正,性能下降幅度更大。
## 6 分析
#### 令牌级分析。我们首先根据仅问题流和联合流是否预测相同的argmax令牌来划分令牌位置。当它们的argmax预测不同时,位置被标记为**分歧**,否则为**一致**。表10报告了这两组的平均置信度差距和草稿重用率。
**表 10:MATH数据集上分支分歧、置信度差距与草稿重用的令牌级关系。** 分歧表示仅问题流和联合流预测不同argmax令牌的位置。草稿重用通过门打开位置的8-gram重叠来衡量。
分歧位置的平均置信度差距大约是一致位置的八倍(0.214 vs. 0.026)。分歧位置的草稿重用率也显著更高(0.321 vs. 0.192)。此外,门缩放S₂随分支分歧概率单调增加,Spearman相关系数ρ=0.167,95%置信区间为[0.150, 0.182]。这些结果表明,相对差距将额外的残差放大集中在了两个条件分支提供竞争性预测的位置。在一致位置,差距和相应的放大效应要小得多,尽管不一定为零。
#### 示例级分析。我们接下来测试置信度引导的重用是否反映了草稿与当前问题的相关性,而非生成长度或草稿上下文存在等表面因素。对于每个示例,我们计算平均置信度差距及其草稿重用率。然后我们在两种条件下测量它们的Spearman相关性:原始草稿配对相应问题,以及一个洗牌控制组,其中问题配对来自无关MATH示例的草稿。我们还报告了控制生成长度后的偏相关性。
**表 11:MATH数据集上平均置信度差距与草稿重用的示例级相关性。** 洗牌条件将每个问题与来自无关示例的草稿配对。最后一列报告了控制生成长度后的偏Spearman相关性。
使用原始草稿时,置信度差距与草稿重用显著相关(ρ=0.195),并且在控制生成长度后相关性仍为正(ρ=0.247)。相比之下,在洗牌控制下相关性明显减弱,且其置信区间包含零。洗牌保留了草稿的存在,但移除了其与问题的语义对应关系。因此,由此产生的差异表明,置信度差距响应的是问题与草稿的对齐程度,而不仅仅是草稿的可用性或输出长度。
令牌级和示例级分析共同支持了相对置信度差距预期的机制作用:它控制草稿衍生信息在何处以及以多大强度被重用。这些结果并不意味着该差距验证了逻辑正确性,也不意味着更大的差距必然保证成功校正。相反,它们表明该差距作为一个选择性草稿重用信号,而非不加区分的置信度启发式方法发挥作用。
## 附录 H 提示
### H.1 Self-Refine 提示格式
我们提供**Self-Refine**流程中使用的四个提示模板,它们分别指导初始解生成、自我批评、精炼和最终响应选择。
**生成提示**:你是一名细致的数学辅导员。请一步步解决问题。严格遵循以下最终答案格式!保持每一步简短且基于事实。最后,精确输出一行:答案是:
问题:[此处填写问题]
解:
**反馈提示**:你是一名严格的评审者。根据数学问题和当前解,撰写具体、可操作的反馈,列出具体的修正。指出错误的算术、遗漏的约束或无效的推理。如果解已经完全正确且清晰,请说明。
问题:[此处填写问题]
当前解:[此处填写草稿解]
反馈(以项目符号列出修正和检查):
最后,输出一行 'Stop: yes' 如果不需要进一步精炼,否则 'Stop: no'。此行后不要输出任何内容。
Stop:
**精炼提示**:你是一名专业的数学编辑。根据反馈改进解。修正指出的每一个问题。保持推理简洁正确。最后,精确输出一行:答案是:
问题:[此处填写问题]
先前解:[此处填写草稿解]
反馈:[此处填写反馈]
改进后的解:
**系统提示/指令头(可选)**:你是一个有用的助手。精确遵循指令,仅输出请求的内容。
### H.2 DCGC 提示模板
**标准求解提示**用于问题上下文:数学相似文章
置信捷径:掩码扩散模型的一种推理失效模式
本文识别了掩码扩散语言模型中的一种失效模式:基于置信度的解码在复杂推理任务中导致高置信度错误,并表明置信对齐训练会加剧此问题,而随机掩码则能保持推理性能。
多轮反射掩码激发掩码扩散模型的推理能力
本文提出反射掩码(Reflective Masking),一种轻量级后训练方法,通过令牌级修订策略和历史引用机制,使掩码扩散模型能够进行多轮自我修正,提升在数独、数学、代码生成和图像编辑等推理任务上的性能。
基于轨迹的在策略蒸馏用于掩码扩散语言模型
一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。
承诺先于实现:掩码扩散语言模型中无分类器引导何时不再必要
本文研究了在掩码扩散语言模型中,无分类器引导(CFG)在何种情况下真正必要。研究表明,对引导的依赖因提示而异,且通常可以在不损失约束满足能力的前提下移除引导,并由此定义了“承诺视界”(commitment horizon)。
Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models
This paper proposes speculative correction, a training-free draft-then-refine decoding strategy for diffusion language models, showing quality-latency improvements using LLaDA2.1 models.