CaRE:面向掩码扩散语言模型的计算感知重掩码评估协议
摘要
本文提出 CaRE,一种用于掩码扩散语言模型的计算感知评估协议,它标准化了步数、指标和随机性。该协议表明,先前的比较混淆了算法改进与评估伪影,并揭示温度解释了 MAUVE 的大部分方差,而计算匹配的比较则颠覆了已发表的排名。
arXiv:2607.24763v1 公告类型: 新
摘要:掩码扩散语言模型(MDLM)正在快速发展,但可靠解读其进展所需的评估标准并未跟上。尽管 MDLM 已能与自回归语言模型竞争,但最近七篇关于重掩码的论文在不相容的设置下进行评估,变化了名义步数、指标和采样温度,而未联合控制这些因素,这使得它们的策略排名几乎无法比较,并且无法确定报告的性能提升是源于算法改进还是评估伪影。我们提出 CaRE,一种计算感知的评估框架,它通过标准化实际的函数评估次数(NFE)、强制多指标报告并明确控制随机性来审计 MDLM 的重掩码策略。将 CaRE 应用于 LLaDA-8B-Base 和 Dream-7B-Base 上的 7 种重掩码策略,涵盖 4 个随机性水平和 3 个步数预算,并在 OpenWebText 和 LM1B 上进行评估,结果揭示:(i) 温度解释了 MAUVE 的大部分方差,(ii) 计算匹配的比较推翻了数种已发表的策略排名,(iii) 信息重掩码和随机解掩码之间存在矛盾,在 unmask_temp=0.25(p=0.020)下,高熵重掩码在 256 步时使 MAUVE 降低 0.296。一个覆盖 12 个开放权重 MDLM(参数量从 150M 到 8B)的 CaRE 排行榜表明,这种交互方向在不同架构和规模上均成立。这些发现表明,当前的 MDLM 评估可能系统性地将算法改进与计算和随机性的隐藏选择混为一谈。我们公开了评估协议、实现和排行榜,以确保未来的重掩码声明具有可复现性和可比性。
查看缓存全文
缓存时间: 2026/07/29 09:51
# 面向掩码扩散语言模型的计算感知重掩码评估协议
来源: https://arxiv.org/html/2607.24763
Yash Shah1 亚利桑那州立大学 yshah124@asu\.edu&Abhijit Chakraborty211footnotemark:1 MongoDB abhijit\.chakraborty@mongodb\.com&Vivek Gupta1 亚利桑那州立大学 vgupt140@asu\.edu
###### 摘要
掩码扩散语言模型正在超越用于可靠解释其进展的评估标准。MDLM 现已能与自回归 LM 匹敌,然而近期的七篇重掩码论文在不同的设置下进行评估,导致其策略排名基本无法比较。现有研究在名义步数、指标和采样温度上各有不同,但没有工作联合控制这些因素,因此无法判断报告的性能提升是来自算法本身还是评估伪影。我们提出 Care111https://anonymous\.4open\.science/w/CaRE\-846C/, 我们发布协议、实现和排行榜,以确保未来的重掩码声明是可复现且稳健的。,一个计算感知的评估框架,通过标准化实际 NFE、多指标报告和随机性来审计掩码离散 MDLM 的重掩码。我们发布协议、实现和排行榜,以确保未来的重掩码声明是可复现且稳健的。在 LLaDA\-8B\-Base 和 Dream\-7B\-Base 上应用了 7 种重掩码策略,4 个随机性水平,以及在 OpenWebText 和 LM1B 上的 3 个步数预算,Care 表明 (i) 温度解释了 MAUVE 方差的主要部分 (\(η^2=0.91\)),(ii) 计算匹配的比较推翻了多项已发表的策略排名,以及 (iii) 信息型重掩码和随机型去掩码之间存在矛盾,高熵重掩码在 256 步且 unmask\_temp=0.25 时将 MAUVE 降低 0.296 (\(p=0.020\))。一个 Care 排行榜覆盖了 12 个开放权重的 MDLM(1.5 亿到 80 亿参数),其交互方向在不同架构和规模下保持一致。这些结果表明,当前的 MDLM 评估可能系统性地将算法改进与隐藏的计算和随机性选择混为一谈,而 Care 发布了一个七点协议和实现,使未来的重掩码声明具有可复现性。
## 1 引言
十多年来,自回归语言模型将从左到右生成视为默认选择,而非设计决策。掩码扩散语言模型(MDLM)通过将生成重新表述为对整个序列的迭代并行去噪来挑战这一假设。大规模 MDLM 的出现,如 LLaDA\-8B\[18 (https://arxiv.org/html/2607.24763#bib.bib2)\] 和 Dream\-7B\[30 (https://arxiv.org/html/2607.24763#bib.bib3)\],表明这一范式已从理论好奇心转变为自回归 LM 的有力替代方案。在本文中,“重掩码”特指在*掩码离散标记*扩散语言模型的去噪过程中重新引入掩码;连续状态和基于流的 DLM 使用不同的推理范式,不在本文讨论范围内(§A (https://arxiv.org/html/2607.24763#A1))。
参照图说明
图 1:评估差距:七篇重掩码论文在不同条件下进行评估,得出矛盾的排名。三个混淆因素(计算量、指标、随机性)各自独立地推翻结论。联合控制所有三个因素揭示了它们的交互作用 (\(p=0.020\); none vs. high\_entropy, LLaDA\-8B\-Base, OWT, 256 步, \(t=0.25\), 3 个种子, 配对 t 检验)。#### 评估危机。
在过去六个月中,提出了七种重掩码策略\[28 (https://arxiv.org/html/2607.24763#bib.bib4),32 (https://arxiv.org/html/2607.24763#bib.bib5),13 (https://arxiv.org/html/2607.24763#bib.bib6),9 (https://arxiv.org/html/2607.24763#bib.bib7),11 (https://arxiv.org/html/2607.24763#bib.bib8),1 (https://arxiv.org/html/2607.24763#bib.bib9),12 (https://arxiv.org/html/2607.24763#bib.bib10)\] 以改进 MDLM 推理,通过选择性地在去噪过程中重新引入掩码。每种策略都在不同的步数预算、指标和采样温度下进行评估,产生了矛盾的排名,同一策略在一篇论文中被报告为最佳,在另一篇中则是最差(图 1 (https://arxiv.org/html/2607.24763#S1.F1))。图像生成社区在 Clean\-FID\[20 (https://arxiv.org/html/2607.24763#bib.bib45)\] 标准化评估之前面临类似情况,机器翻译在 SacreBLEU\[23 (https://arxiv.org/html/2607.24763#bib.bib25)\] 强制分词器一致性之前也是如此。在这两种情况下,部分表面上的进步后来被归因于评估不一致而非算法改进。MDLM 现在正处于类似的转折点。隐藏的交互作用。单个混淆因素在先前工作中已有记载:PPL–MAUVE 分歧\[22 (https://arxiv.org/html/2607.24763#bib.bib24)\]、温度敏感性\[3 (https://arxiv.org/html/2607.24763#bib.bib22),8 (https://arxiv.org/html/2607.24763#bib.bib23)\]、NFE 形式化\[19 (https://arxiv.org/html/2607.24763#bib.bib20)\] 以及解码超参数主导性\[10 (https://arxiv.org/html/2607.24763#bib.bib29)\]。社区已经指出该问题\[21 (https://arxiv.org/html/2607.24763#bib.bib15),34 (https://arxiv.org/html/2607.24763#bib.bib12),29 (https://arxiv.org/html/2607.24763#bib.bib13),24 (https://arxiv.org/html/2607.24763#bib.bib11)\] 但未进行联合控制。Care 将这些线索结合起来,揭示了*信息型重掩码和随机型去掩码之间存在持续矛盾*。随机型去掩码是主要的多样性杠杆,通过单次温度变化即可将 MAUVE 从 0.66 提升到 0.98,增益达 0.32,超过了同一温度下任意两种策略之间的最大差距。然而,在较高计算预算下,高熵重掩码通过持续的标记搅动(在保持表层多样性的同时缩小了分布覆盖范围)将这一优势降低了 0.296 个 MAUVE 点 (\(p=0.020\))。据我们所知,没有并行的 MDLM 评估揭示这种交互作用,因为检测它需要同时控制所有三个混淆因素。贡献。① 交互发现:信息型重掩码和随机型去掩码之间存在持续矛盾 (\(p=0.020\)); 三因素 ANOVA 显示温度占主导 (\(η^2=0.91\)),且策略 × 温度交互作用显著 (\(η^2=0.47\))。与最多控制两个混淆因素的先前框架(表 2 (https://arxiv.org/html/2607.24763#S3.T2))不同,检测这种交互需要计算量、指标和随机性被*联合*控制,这就是为什么它未出现在早期的 MDLM 评估工作中。② 计算匹配反转:当实际 NFE 相等时,策略排名在无条件生成和 HumanEval 上都发生反转。③ 七点协议和排行榜:一个在 OpenWebText 和 LM1B 上验证的可复现标准,以及一个覆盖十二个开放权重 MDLM 的公共排行榜。前沿叠加图(§4.5 (https://arxiv.org/html/2607.24763#S4.SS5))显示,该交互在 PPL-熵空间中不可见,将 Care 定位为对 Generative Frontiers\[24 (https://arxiv.org/html/2607.24763#bib.bib11)\] 的补充。
## 2 Care 框架与协议
Care 提供了一个统一的 `RemaskingSampler`,具有四个设计原则:① 自动跟踪每次生成的 NFE;② 四个默认指标(通过 Llama\-3\-8B 计算的 PPL、MAUVE、Self\-BLEU、Distinct\-3);③ 将 `unmask\_temp` 作为必需参数,并支持扫描;④ 字符级英文过滤器(ASCII ≥ 0.85, CJK ≤ 0.02)。添加一个模型需要约 50 行代码;添加一个策略需要约 20 行代码。附录 C.2 (https://arxiv.org/html/2607.24763#A3.SS2) 给出了已发布代码库中 `HighEntropy` 的完整实现,表明一个完整的重掩码策略适合大约 20 行代码。无条件生成、HumanEval 和 GSM8K 的提示格式遵循标准的 `lm-eval` 配置;代表模板见附录 C.1 (https://arxiv.org/html/2607.24763#A3.SS1)。完整的实验范围涵盖 12 个开放权重的 MDLM(1.5 亿到 80 亿参数)、5 个评估设置和 7 个重掩码策略;细节见第 4 节 (https://arxiv.org/html/2607.24763#S4)。
表 1:七点 Care 协议。每个遗漏点都会独立地推翻已发表的结论。
## 3 相关工作
#### 重掩码策略。
ReMDM\[28 (https://arxiv.org/html/2607.24763#bib.bib4)\] 识别了 PPL 作弊并倡导 MAUVE,但将核采样作为开/关切换,未隔离随机性。CoRe\[32 (https://arxiv.org/html/2607.24763#bib.bib5)\] 对单一策略使用了计算匹配的基线;Prism\[2 (https://arxiv.org/html/2607.24763#bib.bib19)\] 通过层次化 NFE 扩展测试时计算;UnMaskFork\[17 (https://arxiv.org/html/2607.24763#bib.bib46)\] 发现基于温度的比例缩放会降低 MDLM 性能。Care 将这些临时实践规范化,并揭示了它们无法检测到的交互。Care 相对于现有框架的增益。现有框架各自最多控制 Care 所识别的三个混淆因素中的两个。HELM\[15 (https://arxiv.org/html/2607.24763#bib.bib26)\] 是多指标的,但针对自回归 LLM,没有 NFE 或重掩码的概念。Generative Frontiers\[24 (https://arxiv.org/html/2607.24763#bib.bib11)\] 将温度视为曲线参数,并将生成分解到 PPL-熵空间,但不比较重掩码策略,且使 NFE 隐式化(第 4.5 节 (https://arxiv.org/html/2607.24763#S4.SS5))。dLLM\[34 (https://arxiv.org/html/2607.24763#bib.bib12)\] 指出了超参数敏感性,但未提供重掩码策略比较协议。ReMDM\[28 (https://arxiv.org/html/2607.24763#bib.bib4)\] 控制 NFE 并倡导 MAUVE,但将随机性与核采样的开/关混为一谈,使得排名与 Care 确定为主导因素 (\(η^2=0.91\)) 的变量纠缠在一起。据我们所知,Care 是第一个在单个可运行协议中联合控制计算量、指标和随机性(表 2 (https://arxiv.org/html/2607.24763#S3.T2)),并将其交互作为可测量对象暴露的框架;DARE\[29 (https://arxiv.org/html/2607.24763#bib.bib13)\] 和 d3LLM\[25 (https://arxiv.org/html/2607.24763#bib.bib14)\] 是互补的后训练和并行框架。
表 2:框架比较。Care 是唯一一个联合控制所有三个混淆因素并识别其交互的框架。评估方法论。Clean\-FID\[20 (https://arxiv.org/html/2607.24763#bib.bib45)\] 和 SacreBLEU\[23 (https://arxiv.org/html/2607.24763#bib.bib25)\] 是 Care 的直接类比。LM Eval Harness\[6 (https://arxiv.org/html/2607.24763#bib.bib27)\] 标准化了更广泛的 LLM 评估;Zheng 等人\[33 (https://arxiv.org/html/2607.24763#bib.bib31)\] 识别了 fp32 截断作为 MDM 中的隐式温度;Holtzman 等人\[10 (https://arxiv.org/html/2607.24763#bib.bib29)\] 显示了解码超参数主导 AR 生成。
## 4 验证实验
#### 评估范围。
实验涵盖 12 个开放权重的 MDLM(1.5 亿到 80 亿参数;密集、MoE 和 Soft\-Masked 变体)和 5 个评估设置:① 在 OpenWebText\[7 (https://arxiv.org/html/2607.24763#bib.bib32)\] 和 LM1B\[4 (https://arxiv.org/html/2607.24763#bib.bib33)\] 上的无条件生成(MAUVE、PPL、Self\-BLEU、Distinct\-3);② 在 HumanEval 上的代码生成(pass@1);③–⑤ 在 GSM8K\[5 (https://arxiv.org/html/2607.24763#bib.bib44)\]、HellaSwag\[31 (https://arxiv.org/html/2607.24763#bib.bib34)\] 和 BBH\[27 (https://arxiv.org/html/2607.24763#bib.bib49)\] 上的算术、常识和多步推理——通过对数似然评分进行评估,作为采样不变的合理性检查。更多实验和设置在附录 C (https://arxiv.org/html/2607.24763#A3) 中讨论。策略涵盖了 LLaDA 和 Dream 支持的所有重掩码方法(附录 B (https://arxiv.org/html/2607.24763#A2))。
### 4.1 混淆因素 1:名义步数 ≠ 实际计算量
如果在相同名义步数下比较策略而不控制实际 NFE,任何质量差异都可能反映计算优势而非算法优势。
在 256 名义步数下,实际 NFE 范围从 128(none)到 513(running\_conf.)——相差 4 倍(表 3 (https://arxiv.org/html/2607.24763#S4.T3))。对于 `none`(从不重新引入掩码),128 个输出位置中的每一个都被恰好去噪一次;因此,无论名义步数设置得有多高(只要大于 128),模型都只需要恰好 128 次前向传播,这解释了名义预算(256)和实际 NFE(128)之间的两倍差异。重新掩码已决定标记的策略会产生额外的前向传播,其数量与重掩码率成正比。
表 3:LLaDA\-8B\-Base 在 256 名义步数下的实际 NFE。计算匹配的质量。将实际 NFE 固定为 {128,256,512} 显示 `none` 在每个预算下均主导 MAUVE,且差距随着计算量增加而扩大(表 4 (https://arxiv.org/html/2607.24763#S4.T4))。
表 4:计算匹配的质量(LLaDA\-8B\-Base, OWT, prefix=64, gen=128, \(t=0.0\),英文过滤;通过 Llama\-3\-8B 计算 PPL)。`none` 行使用 3 种子均值(种子 1–3);`random` 和 `high\_entropy` 行是单种子(种子 1)。这些是与表 5 (https://arxiv.org/html/2607.24763#S4.T5) 分开的实验运行:策略在不同的名义步数下运行,以在各配置间平衡实际 NFE。
### 4.2 混淆因素 2:PPL 和 MAUVE 偏好不同策略
即使计算量匹配,单一指标也可能选出不同的胜者——这证实了指标选择是一个独立的混淆因素,而非同一潜在质量的代理。
在 128 确定性步骤下,`high\_entropy` 取得了最佳 MAUVE(0.612)但非最佳 PPL;`none` 取得了最佳 PPL 但非最佳 MAUVE(表 5 (https://arxiv.org/html/2607.24763#S4.T5))。排名随步数预算而翻转。GPT\-2\-XL AR 参考在 OWT 上达到 MAUVE=0.742,标定了绝对尺度。图 2 (https://arxiv.org/html/2607.24763#S4.F2) 显示随机配置主导了帕累托前沿。
表 5:LLaDA\-8B\-Base, OWT, prefix=64, gen=128, 单一种子, 确定性 (\(t=0.0\)),英文过滤。通过 Llama\-3\-8B 计算 PPL。蓝色 = 最佳 MAUVE,绿色 = 最佳 PPL。GPT\-2\-XL AR: MAUVE=0.742。参照图说明
图 2:LLaDA\-8B\-Base, OWT。各步数预算(64/128/256)和温度下的 MAUVE vs PPL。空心标记 = 随机 (\(t>0\)); 实心 = 确定性 (\(t=0.0\))。随机配置在每个 PPL 水平上都主导了帕累托前沿。
### 4.3 混淆因素 3:随机型去掩码主导策略选择
随机性是最容易被忽视的混淆因素:单次温度参数变化产生的质量偏移超过了整个策略差异范围,使得任何在未控温度下的策略比较都变得无意义。
在 LLaDA 上将 `unmask\_temp` 从 0.0 变化到 0.1,MAUVE 从 0.66 提升到 0.98,而 PPL 从 9.6 退化到 17.6(表 6 (https://arxiv.org/html/2607.24763#S4.T6))。在 128 和 256 步时,这 0.32 的增益超过了同一温度下任意两种策略之间的最大差距(表 5 (https://arxiv.org/html/2607.24763#S4.T5));在 64 步时,策略差距达到 0.347(none vs. high\_entropy),但温度效应在两种情况下都是主要的方差来源(\(η^2=0.91\),表 8 (https://arxiv.org/html/2607.24763#S4.T8))。在 \(t=0.25\) 下用 3 个种子确认:0.948 ± 0.021 vs. 0.652 ± 0.025 (\(p=0.020\))。
表 6:不同温度下的 MAUVE(LLaDA\-8B\-Base, OWT, prefix=64, gen=128,英文过滤;通过 GPT\-2 XL 骨干计算 MAUVE, \(K=500\))。± = 3 种子均值/标准误差相似文章
Representation-based Masked Diffusion Model
本文提出了基于表示的遮蔽扩散模型(RMDM),该模型利用文本表示来改进遮蔽扩散模型中的并行令牌更新,特别是在少步采样中提升生成质量。
DiffScore:超越自回归似然性的文本评估
本文介绍了 DiffScore,这是一个基于掩码大型扩散语言模型(Masked Large Diffusion Language Models)的文本评估框架,通过利用掩码重建来解决自回归评分中的位置偏差问题。
基于注意力折扣的自适应采样器用于掩码扩散语言模型
本文介绍了ADAS,一种无需训练的重排序规则,用于并行掩码扩散解码。它利用注意力对强烈关注不确定位置的token进行折扣,从而在低NFE设置下提升推理和代码任务的性能,且运行时开销极小。
PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。
Masked Diffusion Language Models 是强大且可操控的基于文本的世界模型,用于智能体强化学习 [R]
本文提出将 Masked Diffusion Language Models (MDLMs) 作为基于文本的世界模型用于智能体强化学习,表明其任意顺序去噪目标避免了前缀模式崩溃,并且相比自回归基线模型带来了更强的性能。