VoidPadding: 让[VOID]处理掩码扩散语言模型中的填充,使[EOS]专注于语义终止
摘要
VoidPadding引入了一个[VOID]标记来处理掩码扩散语言模型中的填充,使[EOS]能够仅专注于语义终止。该方法显著提升了推理和编码基准测试的性能,同时减少了解码步骤。
arXiv:2606.17999v1 公告类型:新\n摘要:MDLMs通过去噪预分配的掩码响应画布生成文本,使得响应长度建模成为指令微调的核心。现有的MDLMs通常继承了自回归惯例,在指令微调中使用重复的\\texttt{[EOS]}标记进行填充,使\\texttt{[EOS]}同时扮演语义终止符和填充标记的双重角色。我们表明,这种双重角色是在大块解码下\\texttt{[EOS]}溢出的根本原因。为了解耦这些角色,我们提出了VoidPadding,它引入\\texttt{[VOID]}用于填充,并保留\\texttt{[EOS]}用于终止。在推理过程中,学习到的\\texttt{[EOS]}信号能够实现早期停止,而学习到的\\texttt{[VOID]}信号则引导自适应的响应画布扩展。在Dream-7B-Instruct上,VoidPadding在数学推理和代码生成基准测试中,将块大小平均的四任务均值提升了\\(+17.84\\)分(相较于原始模型)和\\(+6.95\\)分(相较于RainbowPadding),同时平均减少了55.7%的解码NFE。代码可在 https://github.com/Haru-LCY/VoidPadding 获取。
查看缓存全文
缓存时间: 2026/06/17 05:42
# VoidPadding:让 [VOID] 处理掩码扩散语言模型中的填充,使 [EOS] 专注于语义终止
来源:https://arxiv.org/abs/2606.17999
查看 PDF (https://arxiv.org/pdf/2606.17999)
> 摘要:掩码扩散语言模型(MDLMs)通过对预分配的掩码响应画布进行去噪来生成文本,这使得响应长度建模成为指令微调的核心。现有的 MDLMs 通常沿用自回归模型的惯例,在指令微调期间使用重复的 \texttt{[EOS]} 标记进行填充,从而赋予 \texttt{[EOS]} 双重角色:既是语义终止符,又是填充标记。我们表明,这种双重角色是大块解码下 \texttt{[EOS]} 溢出的根本原因。为了解耦这些角色,我们提出了 VoidPadding,该方法引入 \texttt{[VOID]} 用于填充,并保留 \texttt{[EOS]} 用于终止。在推理过程中,学习到的 \texttt{[EOS]} 信号支持提前停止,而学习到的 \texttt{[VOID]} 信号则引导自适应响应画布扩展。在 Dream-7B-Instruct 上,VoidPadding 在数学推理和代码生成基准测试中,将块大小平均的四任务均值提升了 +17.84 分(相对于原始模型)和 +6.95 分(相对于 RainbowPadding),同时平均将解码 NFE 降低了 55.7%。代码可在以下网址获取:this https URL (https://github.com/Haru-LCY/VoidPadding)。
## 提交历史
来自:Chunyu Liu [查看邮件 (https://arxiv.org/show-email/63c8aad2/2606.17999)] **\[v1\]** 2026年6月16日 星期二 14:46:53 UTC (2,532 KB)相似文章
# 支持性令牌揭示:用于快速扩散语言模型解码
本文提出了 AXON,一种无需训练的模块,通过智能选择"锚点"(anchor)token 优先揭示,并利用注意力、不确定性和置信度信号来辅助后续去噪步骤,从而改善离散扩散语言模型解码的质量-延迟权衡。在推理和代码生成基准测试上的实验表明,AXON 在保持或提升准确率的同时减少了函数评估次数。
Scratchpad Patching:在字节级语言模型中解耦计算量与补丁大小
本文介绍了 Scratchpad Patching,这是一种针对无分词器(tokenizer-free)语言模型的技术,通过在补丁(patch)内动态刷新上下文来减少补丁滞后,从而将计算量与补丁大小解耦。
DLLM-JEPA:面向掩码扩散语言模型的联合嵌入预测架构
介绍了DLLM-JEPA,这是一种针对掩码扩散语言模型的JEPA公式,通过扩散噪声调度从单个输入构建两个视图,相比LLM-JEPA减少了33%的训练FLOPs,并在GSM8K等任务上提升了微调性能。
MaskAlign: Token子集表征对齐实现高效扩散训练
MaskAlign提出了一种Token子集表征对齐方法,通过减少对完整Token集的依赖,并在扰动下保持稳定对齐,从而改进扩散Transformer训练。
掩码扩散解码作为$x$-预测流
本文重新将掩码扩散语言模型解码解释为连续干净状态预测,引入了一个基于流的框架,其中令牌根据置信度连续异步更新,在仅使用25%的解码预算下,达到了LLaDA性能的97%。