多轮反射掩码激发掩码扩散模型的推理能力
摘要
本文提出反射掩码(Reflective Masking),一种轻量级后训练方法,通过令牌级修订策略和历史引用机制,使掩码扩散模型能够进行多轮自我修正,提升在数独、数学、代码生成和图像编辑等推理任务上的性能。
查看缓存全文
缓存时间: 2026/06/22 09:30
论文页面 - 多轮反思性掩码激发掩码扩散模型中的推理
来源:https://huggingface.co/papers/2606.16700 掩码扩散模型(LLaDa、DiffusionGemma 等)的原生推理形式是什么?
对于自回归语言模型,推理很大程度上被定义为延续:生成思维链,反思它,然后添加更多 token。
但掩码扩散模型并非从左到右生成。它们利用双向上下文生成并精炼整个画布。因此,它们自然的推理机制可能不是延续,而是修正。在我们近期的工作中,我们引入了反思性掩码,一种轻量级后训练方法,能够激发现有掩码扩散模型中的多轮自我修正。
核心思想很简单:模型不再承诺每个生成的 token,而是学习一个 token 级别的修正策略:✅ 保留可靠 token 🟨 重新掩码不确定或错误的 token ✨ 揭示更好的替代结果。这便将生成转变为稀疏、局部的自我纠正迭代过程。
这种设置下的一个关键挑战是修正可能陷入循环:模型可能重新掩码一个错误的 token,随后又生成同样的错误。为了解决这个问题,我们引入了历史参考,一种无需参数的记忆机制,向模型展示之前的去噪状态。这有助于模型记住已经尝试过的内容,避免重复错误。
我们认为这个方向令人兴奋,因为它为扩散语言模型提供了一种不同的推理视角:自回归反思通过延续来思考,而反思性掩码通过修正来思考。
最近像 DiffusionGemma 和 Gemini Diffusion 这样的系统凸显了基于扩散的文本生成的巨大前景,包括双向上下文和迭代精炼。我们的工作研究了一个互补的问题:如何对现有的 MDM 进行后训练,使其能够通过自我修正显式地执行稀疏的多轮推理?
我们在多个设置中评估了反思性掩码:🧩 数独修正 🧠 数学推理 💻 代码生成 🎨 图像编辑
在这些任务中,反思性掩码允许模型选择性地重新审视之前的输出,而不是从头重新生成或过早确定,从而提升了性能。更广泛的启示是,扩散语言模型可能不仅仅是更快的并行生成器;它们可能开启一种不同的推理范式:将推理视为迭代状态精炼。
相似文章
置信捷径:掩码扩散模型的一种推理失效模式
本文识别了掩码扩散语言模型中的一种失效模式:基于置信度的解码在复杂推理任务中导致高置信度错误,并表明置信对齐训练会加剧此问题,而随机掩码则能保持推理性能。
重掩码,而非替换:掩码扩散语言模型中的 Token-to-Mask 精修
提出 Token-to-Mask(T2M)重掩码,在掩码扩散 LM 中通过将可疑 token 重置为掩码状态而非直接覆盖来修正生成错误,在 CMATH 上最高提升 5.92 准确率,无需额外训练或参数。
DCGC: 基于草稿的复杂推理全局校正方法——掩码扩散模型
本文介绍了DCGC,一个掩码扩散模型框架,用于通过基于不完美草稿的条件,全局校正大语言模型(LLMs)中的缺陷推理轨迹。它无需真实故障标签即可提高推理基准测试的准确性。
基于轨迹的在策略蒸馏用于掩码扩散语言模型
一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。
掩码蒸馏:将思维链内化到语言模型中
掩码蒸馏是一种知识蒸馏框架,它训练学生大语言模型仅预测解决方案令牌,同时推理教师提供反馈,旨在将思维链计算内化到模型参数中。该方法显示任务相关的成功,在GSM8K上有效,但对于像Countdown这样更困难的任务需要小型脚手架。