读取轨迹,引导路径:面向扩散语言模型的轨迹感知强化学习

arXiv cs.CL 论文

摘要

本文介绍了 CAPR(缓存摊销路径精化),一种用于扩散大语言模型的强化学习算法。该算法无需完整树展开的计算开销,即可从去噪轨迹中提取类树状监督信号。CAPR 在 GSM8K、Math500、数独和倒计时等推理基准测试上达到了最先进的性能,计算成本仅为平坦展开方式的约 0.75 倍。

arXiv:2606.04396v1 公告类型:新论文 **摘要:** 扩散大语言模型(dLLMs)通过并行地对多个位置进行迭代去掩码和修订来生成响应。这一过程留下了丰富的去噪轨迹,记录了哪些 token 趋于确定、哪些仍不稳定,以及何时完成了最终决策。现有的 dLLM 强化学习方法对这一信号的利用较为有限。平坦展开(flat rollout)计算成本低,但对整条轨迹仅分配一个结果奖励。树状展开(tree rollout)通过对部分轨迹进行分支并向上传播叶节点奖励,可提供更细粒度、可验证的训练信号,但计算开销较大。我们探索能否在不引入树级计算开销的前提下,仅凭去噪轨迹本身提供类树状监督。为此,我们提出了 CAPR(Cached-Amortized Path Refinement),这是一种 dLLM 强化学习算法,它将去噪轨迹压缩为紧凑的路径状态,利用缓存的轨迹状态生成低成本的兄弟续写,并训练块级价值头以实现局部块级监督。在块级去掩码调度下,CAPR 记录路径状态和块进度特征,然后根据每个块中所揭示的 token 将最终结果奖励重新分配到各个块。这使得价值头能够将单一稀疏奖励转化为块级 PPO 权重。因此,CAPR 在很大程度上恢复了树搜索的细粒度优势,同时避免了完整树展开,将展开生成成本降低至平坦展开的约 0.75 倍、树状展开的约 0.6 倍(在标准设置下)。在 4×4 数独、倒计时、GSM8K 和 Math500 四个任务上,基于稠密和混合专家架构的 LLaDA 主干模型,CAPR 在 256 和 512 token 预算下均为经强化学习微调的 dLLMs 树立了新的最优基准。在数独任务上,其性能与最强树结构基线相当,而每步计算量不足后者的三分之一。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:14

# 读懂轨迹,引导路径:面向扩散语言模型的轨迹感知强化学习

来源:https://arxiv.org/abs/2606.04396
查看 PDF (https://arxiv.org/pdf/2606.04396)

> **摘要:** 扩散大语言模型(dLLMs)通过迭代地对多个位置并行去掩码和修正来生成响应。这一过程留下了丰富的去噪轨迹,记录了哪些 token 变得确定、哪些仍不稳定,以及何时形成了最终决策。现有的 dLLM 强化学习方法对这一信号的利用十分有限。扁平展开(flat rollout)计算成本低,但对整条轨迹仅分配单一的结果奖励。树状展开(tree rollout)通过对部分轨迹进行分支并向上传播叶节点奖励,提供了更精细、可验证的训练信号,但计算开销较大。我们探讨去噪轨迹本身是否能够在不引入树级计算量的情况下提供类似树搜索的监督信号。为此,我们提出了 CAPR(缓存均摊路径精化,Cached-Amortized Path Refinement)——一种 dLLM-RL 算法,它将去噪轨迹压缩为紧凑的路径状态,利用缓存的轨迹状态生成低成本的兄弟续写,并训练一个块级价值头以提供局部块级监督。在块级去掩码调度下,CAPR 记录路径状态和块进度特征,再根据每个块中揭示的 token 将最终结果奖励重新分配到各块。这使价值头能够将一个稀疏奖励转化为块级 PPO 权重。因此,CAPR 在无需完整树展开的前提下,恢复了树搜索的大部分粒度优势,将展开生成成本降低至扁平展开的约 0.75 倍、树状展开的约 0.6 倍(在标准设置下)。在 4×4 数独、Countdown、GSM8K 和 Math500 等任务上,基于稠密和混合专家(MoE)LLaDA 主干网络,CAPR 在 256 和 512 token 预算下为经 RL 微调的 dLLMs 树立了新的最优水平。在数独任务上,CAPR 以不足最强树结构基线三分之一的单步计算量达到了相当的性能。

## 提交历史

提交者:Anant Khandelwal \[查看邮箱 (https://arxiv.org/show-email/a8eb6f80/2606.04396)\] **\[v1\]** 2026 年 6 月 3 日(周三)03:22:54 UTC(1,060 KB)

相似文章

基于轨迹的在策略蒸馏用于掩码扩散语言模型

arXiv cs.CL

一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。

GDSD:强化学习作为扩散语言模型的引导式降噪器自蒸馏

Hugging Face Daily Papers

GDSD提出了一种强化学习方法,直接从优势引导的自教师中蒸馏扩散语言模型的降噪器,避免了基于ELBO的似然代理带来的偏差。在规划、数学和编码基准上,比先前最先进的方法准确率提升高达+19.6%。

DACA-GRPO:扩散语言模型中强化学习的去噪感知信用分配

arXiv cs.LG

本文指出了现有扩散语言模型强化学习方法中的弱点——缺乏时间信用分配和偏差似然估计——并提出了DACA-GRPO,一种即插即用的增强方案,引入了去噪进度分数和分层掩码似然,在推理、代码生成和受约束生成等多个基准上取得了一致的改进。