DACA-GRPO:扩散语言模型中强化学习的去噪感知信用分配
摘要
本文指出了现有扩散语言模型强化学习方法中的弱点——缺乏时间信用分配和偏差似然估计——并提出了DACA-GRPO,一种即插即用的增强方案,引入了去噪进度分数和分层掩码似然,在推理、代码生成和受约束生成等多个基准上取得了一致的改进。
arXiv:2605.16342v1 Announce Type: new
摘要:扩散大型语言模型是自回归模型的一种有吸引力的替代方案,然而现有应用于扩散模型的强化学习方法将所有去噪步骤视为同等重要,并依赖于有偏、高方差的似然估计。我们识别出两个根本弱点:去噪轨迹中缺乏时间信用分配,以及用于策略优化的平均场似然估计的系统性偏差。为了解决这些问题,我们提出了面向GRPO的去噪感知信用分配(DACA-GRPO),这是一种轻量级、即插即用的增强方案,适用于任何GRPO风格的训练器。DACA-GRPO引入了两种互补机制:去噪进度分数,它从中间预测中提取每个token的重要性权重,无需额外前向成本;以及分层掩码似然,它将token位置划分为多个层级,使得每个token在大部分序列作为上下文的情况下被预测,从而减少平均场偏差。在三类GRPO基方法上的应用表明,DACA-GRPO在涵盖数学推理、代码生成、约束满足和受约束生成的七个基准上均取得了一致的改进,在数学推理上最高提升5.6个百分点,代码生成上7.4个百分点,约束满足上36.3个百分点,JSON模式遵循上5.9个百分点。
查看缓存全文
缓存时间: 2026/05/19 06:41
# DACA-GRPO:扩散语言模型中强化学习的去噪感知信用分配 来源:https://arxiv.org/html/2605.16342 Dominic Culver¹,Nikhil Bhendawade²,Lokesh Boominathan²,Manuel R. Ciosici²,Yizhe Zhang²,Irina Belousova¹ ¹俄亥俄州立大学 ²苹果公司 (2026年5月8日) ###### 摘要 扩散大语言模型是自回归模型的一种有前途的替代方案,然而现有的针对扩散模型的强化学习(RL)方法将所有去噪步骤视为同等重要,并依赖于有偏、高方差的似然估计。我们指出了两个根本性弱点:去噪轨迹中缺少*时间信用分配*,以及策略优化中使用的平均场似然估计的系统性偏差。为了解决这些问题,我们提出了用于GRPO的去噪感知信用分配(DACA-GRPO),这是一种轻量级、即插即用的增强方案,适用于任何GRPO风格的训练器。DACA-GRPO引入了两种互补机制:*去噪进展分数*(从中间预测中提取每个token的重要性权重,无需额外前向计算成本)和*分层掩码似然*(将token位置划分为多个层,使得每个token在大部分序列作为上下文的情况下被预测,从而减少平均场偏差)。在三种GRPO基础方法之上应用后,DACA-GRPO在七个基准测试(涵盖数学推理、代码生成、约束满足和约束生成)上取得了一致的改进,数学推理提升高达5.6个百分点,代码生成提升7.4个百分点,约束满足提升36.3个百分点,JSON模式遵循提升5.9个百分点。 †††同等贡献。 ‡俄亥俄州立大学。工作是在苹果公司实习期间完成的。 ### 1 引言 扩散大语言模型(dLLM)是自回归模型的一种替代范式,支持高吞吐量、任意顺序的并行文本生成。它们通过迭代去噪被破坏的序列来运作,从一系列掩码或均匀token的序列开始(Sahoo et al., 2024 (https://arxiv.org/html/2605.16342#bib.bib20); Nie et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib17); Monsefi et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib15); Labs et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib10); Ye et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib27))。组相对策略优化(Guo et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib8); Yu et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib28); Liu et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib13))(GRPO),现在已是自回归LLM的标准后训练方法,最近已被适配到离散扩散模型(Zhao et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib29); Tang et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib23); Rojas et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib19); Gong et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib7))。与自回归LLM不同,dLLM无法直接计算完成序列的对数似然 log p_θ(o|q),因此必须通过证据下界(ELBO)来近似或替代。虽然这些方法取得了显著成功,但它们忽略了*去噪轨迹*本身。在生成过程中,dLLM在每一步都会计算每个被掩码位置上的分布,但只揭晓少数几个;其余预测——编码了模型不断演化的理解——被丢弃了。并非所有步骤贡献相同:有些涉及决定性的结构承诺,而另一些则是常规的填充。然而,当前方法对每个token赋予相同的信用,无论它是在何时以何种置信度生成的。此外,似然估计遭受平均场偏差——在零token间上下文中预测所有token——这破坏了策略梯度。我们做出以下贡献: 1. 我们指出了现有dLLM RL方法中的**两个根本性弱点**:跨过去噪步骤缺少时间信用分配,以及策略优化中使用的平均场似然估计的系统性偏差。 2. **去噪进展分数(DPS)**跟踪模型在去噪步骤间信念的演变,将这些信号转换为每个token的重要性权重,以调节RL损失。DPS**不需要额外的前向传播**——它重新利用了模型通常会丢弃的logits。 3. 为了缓解似然偏差,我们引入了**分层掩码似然(SML)**,一种位置分层的估计器,将输出token划分为K个层,并在(K-1)/K序列作为上下文的条件下评估每个token。直观上,这应该通过确保层间token依赖关系被捕获来减少使用平均场近似引入的噪声。 4. **DACA-GRPO**将DPS和SML结合成一个统一的、即插即用的框架,与底层的GRPO变体无关。我们在三种流行的RL方法——Diffu-GRPO (Zhao et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib29))、wd1 (Tang et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib23))和GDPO (Rojas et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib19))——之上评估DACA-GRPO,涵盖七个基准测试:数学推理(MATH-500, GSM8K)、代码生成(MBPP, HumanEval)、约束满足(Countdown, Sudoku)和约束生成(JSON)。DACA-GRPO在基准测试和基础方法上取得了一致的改进,数学推理提升高达5.6个百分点,代码生成提升7.4个百分点,约束满足提升36.3个百分点,JSON模式遵循提升5.9个百分点。这两个组件是互补的:DPS在结构化约束任务和短生成长度上影响最大,而SML在长文本数学和代码任务上提供了最大增益。 参见图注 图1:DPS在所有基准测试上提升了所有三种基础方法。展示了生成长度{128, 256, 512}中的最佳准确率(%)。浅色条:复现的基线。深色条:应用DPS后。绿色百分比显示相对于基线的相对提升。DPS在数学推理、代码生成、约束满足和约束生成任务上取得了一致的提升,其中数独任务相对提升最大——wd1提升高达+51%,GDPO提升高达+90%。 ### 2 相关工作 诸如MDLM (Sahoo et al., 2024 (https://arxiv.org/html/2605.16342#bib.bib20))和LLaDA (Nie et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib17))等扩散语言模型确立了掩码扩散作为一种可行的文本生成范式,后续工作将直接偏好优化应用于此场景(Black et al., 2024 (https://arxiv.org/html/2605.16342#bib.bib2); Xie et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib25); Lou et al., 2024 (https://arxiv.org/html/2605.16342#bib.bib14))。我们的工作与扩散架构正交;我们专注于RL训练信号。强化学习已通过基于人类反馈的强化学习(Ouyang et al. (2022 (https://arxiv.org/html/2605.16342#bib.bib18)))和GRPO (Shao et al., 2024 (https://arxiv.org/html/2605.16342#bib.bib21))等方法被广泛应用于自回归LLM。最近的工作将GRPO扩展到扩散模型:Diffu-GRPO (Zhao et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib29))适配了PPO-clip目标,wd1 (Tang et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib23))提出了一种无比率替代方案,GDPO (Rojas et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib19))制定了扩散特定的策略优化,DiffuCoder (Gong et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib7))引入了用于方差减少的耦合采样。这四个方法都将去噪轨迹视为一个黑箱,在步骤间分配均匀的信用。DACA-GRPO是第一个利用轨迹级信号进行信用分配的工作。时间信用分配是强化学习中的一个经典挑战(Sutton and Barto, 2018 (https://arxiv.org/html/2605.16342#bib.bib22))。在自回归设置中,逐token奖励模型(Lightman et al., 2024 (https://arxiv.org/html/2605.16342#bib.bib12); Zhu et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib30))和过程奖励模型(Uesato et al., 2022 (https://arxiv.org/html/2605.16342#bib.bib24))提供了步骤级监督,但需要训练额外的奖励模型或收集额外的标注。DPS通过利用扩散模型的一个结构特性来解决相同的挑战:中间预测在生成过程中已经计算出来,但通常被丢弃。与此同时,DyLLM (Lee et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib11))观察到并非所有token位置在去噪步骤中贡献相同,并通过注意力-上下文相似性识别*显著*位置以加速推理。两种方法都从去噪轨迹中挖掘信号,但目的不同:DyLLM使用基于注意力的显著性加速推理,而DPS使用token级预测置信度通过信用分配改进*训练*。SML将不同的原理应用于掩码token似然估计:不是分层掩码*比例*(如DiffuCoder中的对偶时间步(Gong et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib7)))或使用时间上的确定性求积(如GDPO中的SDMC (Rojas et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib19))),我们分层token*位置*——一次掩码一个层以提供部分上下文,目标是平均场估计误差而非采样*方差*。 ### 3 背景 掩码扩散语言模型(Sahoo et al., 2024 (https://arxiv.org/html/2605.16342#bib.bib20); Nie et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib17))定义了一个逐步掩码token的前向过程和一个去噪的反向过程。给定一个干净的序列 x_0 = (x_1, ..., x_L),前向过程在时间步 t ∈ [0,1] 通过独立地以概率 t 将每个token替换为 [MASK] 来产生噪声序列 x_t。反向(生成)过程从一个完全掩码的序列 x_1 开始,并迭代地预测和揭示token,直到达到 x_0。在每个去噪步骤 t,模型 p_θ 为每个被掩码的位置 i ∈ M_t(其中 M_t = {i: x_{t,i} = [MASK]})预测一个分布 p_θ(x_i | x_t),覆盖所有词汇token。然后,通过选择具有最高模型置信度的位置和token,揭晓固定数量 k 个被掩码位置。特别地,对*所有*被掩码位置进行预测,但大多数被丢弃。这些“浪费的”预测构成了我们DPS机制的基础。 用于扩散语言模型的GRPO (Shao et al., 2024 (https://arxiv.org/html/2605.16342#bib.bib21))为每个提示生成一组 G 个候选响应 {y^{(g)}}_{g=1}^G,计算奖励 {r^{(g)}},并使用组均值 μ_r 和标准差 σ_r 定义组相对优势: A^{(g)} = (r^{(g)} - μ_r) / σ_r. (3.1) Diffu-GRPO (Zhao et al., 2025 (https://arxiv.org/html/2605.16342#bib.bib29))使用逐token PPO-clip代理目标适配GRPO,其中逐token似然比 ρ_i(θ) = p_θ(x_i | m) / p_{θ_old}(x_i | m),在所有完成token被掩码(m)的情况下计算: L_d1 = -E[ min( ρ_i(θ)A, clip(ρ_i(θ), 1-ε, 1+ε)A ) ]. (3.2) wd1 (Tang et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib23))提出了一种无比率替代方案,包含显式的正负样本强化,使用归一化优势权重 Â_+^{(g)} = softmax(A^{(g)}) 和 Â_-^{(g)} = softmax(-A^{(g)}): L_wd1 = - ∑_{g:A^{(g)}>0} Â_+^{(g)} log p_θ(y^{(g)}) 正样本强化:放大正确 + ∑_{g:A^{(g)}<0} Â_-^{(g)} log p_θ(y^{(g)}) 负样本抑制:抑制错误. (3.3) GDPO (Rojas et al., 2026 (https://arxiv.org/html/2605.16342#bib.bib19))在*序列级别*操作,使用证据下界(ELBO)作为 log p_θ(y) 的替代: L_ELBO(y | q) = E_{t~U[0,1]} E_{y_t ~ π_t(·|y)} [ (1/t) ∑_{i=1}^L 1[y_{t,i}=M] log π_θ(y_i | y_t, q) ]. (3.4) 为减少方差,GDPO引入了半确定蒙特卡洛(SDMC):N个固定的求积点 t 和随机掩码采样。该损失使用序列级重要性比率 r_g = L_ELBO^θ(y_g|q) / L_ELBO^{θ_old}(y_g|q) 和未归一化的优势 A_g = r_g - mean(r_1, ..., r_G): L_GDPO(θ) = - (1/G) ∑_{g=1}^G (1/|y_g|) min( r_g·A_g, clip(r_g, 1-ε, 1+ε)·A_g ) + β KL(π_θ || π_ref). (3.5) ##### 掩码token对数似然。所有三种方法都需要估计每个完成的 log p_θ(y)。在dLLM中,这通常通过采样随机掩码率 t~U(0,1),构建掩码版本 x_t,并计算: log p_θ(y) ≈ (1/|M_t|) ∑_{i∈M_t} log p_θ(x_i | x_t). (3.6) 其中 p_θ(x_i | x_t) 通过softmax从模型在位置 i 的输出logits获得——每个逐token对数概率是精确的;近似源于将其分解为独立逐token项的平均场因子分解。d1和wd1直接使用这种单样本估计,导致高方差和平均场偏差(所有token被掩码,零token间上下文)。GDPO通过时间上的确定性求积减少方差,但每个点的估计仍然受到相同偏差的影响。SML通过在每个token被大部分序列((K-1)/K)作为上下文的情况下预测它来解决平均场偏差。 ### 4 当前方法的弱点 **弱点1:没有时间信用分配** 在自回归模型中,顺序生成过程自然引入了某种形式的信用分配:每个token的概率以所有先前token为条件,并且基于位置可以分配逐token奖励或优势。扩散模型缺乏这种结构。所有token被预测时上下文(几乎)完全相同,使得无法区分早期结构决策与后期填充。从RL的角度来看,这意味着在给定步骤生成的每个token(无论其在序列中的结构重要性如何)都获得与组优势成比例的相同更新幅度。考虑一个例子:dLLM生成一个数独解,在第5步为一个关键歧义格分配一个值,但在第15步填入一个仅由相邻单元格决定的值。当前的RL方法对这两个操作赋予相同的信用,而DPS通过测量每个token在生成过程中的信心演化来识别关键决策点。**弱点2:有偏的似然估计** 如 §3 所述,所有现有方法依赖于平均场近似来计算 log p_θ(y): log p_θ(y) ≈ (1/|M_t|) ∑_{i∈M_t} log p_θ(x_i | x_t). 这有两个问题:1) **零上下文偏差**:通过将所有其他token替换为 [MASK] 来构建 x_t,因此每个 x_i 在完全没有其他完成token作为上下文的情况下被评估。这与自回归似然形成对比,自回归似然中每个token以所有先前token为条件。2) **高方差**:随机掩码率 t 对 log p_θ(y) 的估计贡献了额外的方差。SML通过引入一种结构化估计器来解决这两个问题,该估计器将位置划分为层,并一次对一个层施加掩码,从而提供部分上下文。相似文章
GDSD:强化学习作为扩散语言模型的引导式降噪器自蒸馏
GDSD提出了一种强化学习方法,直接从优势引导的自教师中蒸馏扩散语言模型的降噪器,避免了基于ELBO的似然代理带来的偏差。在规划、数学和编码基准上,比先前最先进的方法准确率提升高达+19.6%。
@probablynotaz9: ICML 单作者论文警报:是否曾想用经典策略梯度对扩散 LLM 进行后训练,而无需……
这篇 ICML 单作者论文介绍了摊销式组相对策略优化(AGRPO),旨在为扩散语言模型实现高效的强化学习后训练。
读取轨迹,引导路径:面向扩散语言模型的轨迹感知强化学习
本文介绍了 CAPR(缓存摊销路径精化),一种用于扩散大语言模型的强化学习算法。该算法无需完整树展开的计算开销,即可从去噪轨迹中提取类树状监督信号。CAPR 在 GSM8K、Math500、数独和倒计时等推理基准测试上达到了最先进的性能,计算成本仅为平坦展开方式的约 0.75 倍。
先素描后绘制:面向扩散多模态大语言模型的层次化强化学习
本文提出HT-GRPO,一种面向扩散多模态大语言模型的层次化强化学习方法,它采用先素描后绘制的训练方案和层次化信用分配机制,以提升图像生成质量和奖励对齐效果。
Masked Diffusion Language Models 是强大且可操控的基于文本的世界模型,用于智能体强化学习 [R]
本文提出将 Masked Diffusion Language Models (MDLMs) 作为基于文本的世界模型用于智能体强化学习,表明其任意顺序去噪目标避免了前缀模式崩溃,并且相比自回归基线模型带来了更强的性能。