揭示状态:状态适应在 Masked Diffusion Language Models 中何时重要

Hugging Face Daily Papers 论文

摘要

本文研究了在推理过程中状态适应(state adaptation)对于 masked diffusion language models(MDMs)何时真正重要,将推理过程组织为五个维度,并表明选择性适应(利用轻量级检测器识别高机会状态)能够捕获大部分 oracle 收益——例如,在 LLaDA-8B 的受限 JSON 填充任务上,仅适应 10% 的状态便捕获了 56.9% 的机会收益。

Masked diffusion language models(MDMs)允许灵活的生成顺序,使得去掩码(unmasking)策略成为一项推理决策。现有方法在位置优先级排序、并行度控制、选择区域限制、预测修正或未来去噪规划等方面各有不同,但这些选择是否应在生成过程中发生改变,至今仍不清楚。我们通过策略反转(strategy reversal)来研究这一问题,即某个替代动作比固定选择更优的情形。我们将 MDM 推理组织为五个维度——得分(score)、数量(cardinality)、区域(region)、承诺(commitment)和规划(planning),并定义适应机会(adaptation opportunity)为最佳候选动作相对验证集上选定的固定动作所具有的单步效用优势。这一视角表明,适应的价值取决于此类反转出现的频率和幅度。在三个 MDM 和十个任务上,适应机会高度不均匀,某些场景下呈现出集中且可预测的单步增益。这促使我们提出选择性适应:在校准验证提示上训练的轻量级检测器能够识别高机会状态,例如在 LLaDA-8B 的受限 JSON 填充任务上,仅适应 10% 的状态便捕获了候选集 oracle 机会的 56.9%。我们的层级转移结果表明,状态适应只有在选择性而非均匀地应用时才最有价值。
查看原文
查看缓存全文

缓存时间: 2026/10/01 08:23

论文页面 - 揭开状态的面纱:状态自适应何时对掩码扩散语言模型有影响

来源:https://huggingface.co/papers/2609.33355

摘要

掩码扩散语言模型(MDMs)允许灵活的生成顺序,因此去掩码策略成为一项推理时的决策。现有方法在如何对位置排序、控制并行度、限制选择区域、修正预测或规划未来去噪等方面各有不同,但这些选择在生成过程中何时应当改变,至今仍不清楚。我们通过“策略反转“(即某个替代动作开始优于固定选择)来研究这个问题。我们将 MDM 推理组织为五个维度——评分(score)、基数(cardinality)、区域(region)、承诺(commitment)和规划(planning)——并把“自适应机会“定义为:候选动作中最佳者相对于经验证选定的固定动作所具有的单步效用优势。这一视角表明,自适应的价值取决于这种反转发生的频率和幅度。在三个 MDM 和十项任务上,自适应机会表现出高度异质性,其中一些场景的单步增益集中且可预测。这促使我们采用选择性自适应:在验证提示上校准的轻量级检测器能够识别高机会状态,例如在 LLaDA-8B 的受限 JSON 填充任务上,仅对前 10% 的状态进行自适应,就捕获了候选集 oracle 机会的 56.9%。我们的转移层面的结果表明,状态自适应在选择性应用时最为有效,而非均匀应用。

查看 arXiv 页面 (https://arxiv.org/abs/2609.33355) 查看 PDF (https://arxiv.org/pdf/2609.33355) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.33355)

获取本文到你的 agent:

hf papers read 2609.33355

还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型与本文关联

在模型 README.md 中引用 arxiv.org/abs/2609.33355 即可将模型链接到此页面。

引用本文的数据集0

暂无数据集与本文关联

在数据集 README.md 中引用 arxiv.org/abs/2609.33355 即可将数据集链接到此页面。

引用本文的 Spaces0

暂无 Space 与本文关联

在 Space README.md 中引用 arxiv.org/abs/2609.33355 即可将 Space 链接到此页面。

包含本文的合集0

暂无合集包含本文

将本文加入合集 (https://huggingface.co/new-collection) 即可将合集链接到此页面。

相似文章

掩码扩散解码作为$x$-预测流

arXiv cs.CL

本文重新将掩码扩散语言模型解码解释为连续干净状态预测,引入了一个基于流的框架,其中令牌根据置信度连续异步更新,在仅使用25%的解码预算下,达到了LLaDA性能的97%。

面向扩散语言模型的自适应多步前瞻解码

arXiv cs.CL

提出 AdaLook,一种适用于掩码扩散语言模型的自适应多步前瞻解码框架,该框架根据候选分数方差动态确定展开深度和分支扩展,与现有的单步前瞻解码方法相比,实现了更好的准确率-解码步骤权衡。