离散扩散模型:从分词到生成的统一框架
摘要
本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。
arXiv:2607.13431v1 Announce Type: new
摘要:离散去噪扩散模型(DDMs)最近成为自回归(AR)建模的一种有吸引力的替代方案,用于离散数据,提供并行生成和迭代全局细化能力。与状态空间固定的连续扩散不同,DDMs的基本形态取决于离散状态空间的构建方式:分词方案、词汇表拓扑以及领域特定的结构字母表。本文引入了一个统一的概念框架,通过底层离散状态空间的构建来审视离散扩散模型。在此框架下,现有公式(包括转移矩阵、掩码/吸收状态以及基于分数/比率的方法)作为共同设计空间的不同实例出现。该框架进一步揭示了训练目标、推理算法、扩展行为、系统优化和评估协议中的常见设计权衡,为未来的研究指明了几个有希望的方向。
查看缓存全文
缓存时间: 2026/07/16 04:22
# 离散扩散模型:从分词到生成的统一框架
**来源:** https://arxiv.org/html/2607.13431
叶原¹,², 李维恩¹, 宋睿¹, 李泽宇¹, 刘浩辰³, 孔翔宇¹,², 董子轩⁴, 杜林峰¹,², 孙子鹏¹,², 张维旭¹,², 黄嘉欣⁵, 韩长江⁵, 杨永涵⁵, 赵子辰⁵, 胡秀媛⁶, 吴浩伦¹,², 陈彦凯⁵, 莫锋然⁷, 康继坤⁸, 何博玮⁵, Philip S. Yu⁹, 刘雪⁵,¹,²
¹麦吉尔大学, ²Mila - 魁北克人工智能研究所, ³剑桥大学, ⁴多伦多大学,
⁵MBZUAI - 穆罕默德·本·扎耶德人工智能大学, ⁶清华大学, ⁷罗切斯特理工学院, ⁸Salesforce, ⁹伊利诺伊大学芝加哥分校
###### 摘要
离散去噪扩散模型(DDMs)近期已成为自回归(AR)模型在离散数据处理方面的一个引人注目的替代方案,具备并行生成和迭代全局精化的能力。与状态空间固定的连续扩散不同,DDM 的基本形态取决于离散状态空间是如何构建的:包括分词方案、词汇拓扑以及领域特定的结构字母表。本文引入了一个统一的概念框架,通过底层离散状态空间的构建来审视离散扩散模型。在此框架下,现有的各种形式,包括转移矩阵法、掩码/吸收态法以及得分/比率法,都显现为同一设计空间的不同实例化。该框架还揭示了训练目标、推理算法、缩放行为、系统优化和评估协议方面的常见设计权衡,为未来研究指明了几个有前景的方向。
## 1 引言
自回归(AR)模型已成为生成离散序列的标准。通过将联合分布分解为从左到右的条件概率乘积,AR 模型拥有简洁的最大似然目标、稳定的训练以及成熟的解码基础设施(Ghazvininejad 等人,2019 (https://arxiv.org/html/2607.13431#bib.bib28)),这些特性推动了大型语言模型(LLMs)从早期数十亿参数的规模扩展到拥有数千亿参数的前沿模型。然而,随着模型大规模部署,AR 范式固有的局限性日益凸显。首先,生成本质上是**顺序的**:每个令牌必须在前一个令牌生成后才能开始,这导致了无论并行能力如何,都需要 O(L) 串行解码步骤,当序列长度增长到数万或数十万时,这一瓶颈变得成本高昂(Zhang 等人,2025c (https://arxiv.org/html/2607.13431#bib.bib480))。其次,AR 解码**本质上是单向且不可逆的**:一旦一个令牌被生成,除非应用明确的后期修正机制,否则它无法根据后续上下文进行修改。这种单次提交限制了模型进行全局规划、满足非局部约束或在观察到下游结构后修正前期决策的能力。而这些能力对于诸如文本填充、受限编辑、可控生成和长程推理等任务至关重要(Ye 等人,2025a (https://arxiv.org/html/2607.13431#bib.bib659); 2024a (https://arxiv.org/html/2607.13431#bib.bib658))。
扩散模型提供了一种截然不同的生成范式:它不是逐个令牌构建序列,而是从一个完全损坏的输入开始,通过多个去噪步骤**同时细化所有位置**,每一步都能访问整个当前状态,从而在生成的每个阶段都支持双向上下文和全局修正。这种迭代精化视角颇具吸引力,原因如下。首先,并行更新将墙钟时间延迟分摊到各个位置,在计算资源充足的情况下,使得生成时间在很大程度上独立于序列长度(Sahoo 等人,2024 (https://arxiv.org/html/2607.13431#bib.bib73); Nie 等人,2025a (https://arxiv.org/html/2607.13431#bib.bib74); b (https://arxiv.org/html/2607.13431#bib.bib62))。其次,每一步的全局上下文允许模型进行整体规划,纠正早期错误、协调长程依赖关系并满足跨越整个输出的约束(Ye 等人,2025a (https://arxiv.org/html/2607.13431#bib.bib659); 2024a (https://arxiv.org/html/2607.13431#bib.bib658); Liu 等人,2025e (https://arxiv.org/html/2607.13431#bib.bib25))。第三,损坏-去噪框架还为**编辑和填充**提供了自然接口:通过选择性地仅重新损坏一部分位置,模型可以在依赖周围上下文的同时修改或补全部分输出,而无需改变架构或进行特定任务的微调(Lee 等人,2025a (https://arxiv.org/html/2607.13431#bib.bib284); He 等人,2024 (https://arxiv.org/html/2607.13431#bib.bib59); Zhang 等人,2025a (https://arxiv.org/html/2607.13431#bib.bib311))。这些特性使得扩散在需要全局连贯性、并行解码或细粒度可控性时,成为 AR 生成的有力补充。
然而,将扩散应用于离散数据并非连续扩散的简单延伸。在图像和波形等连续空间中,前向过程添加高斯噪声,逆向过程在相同的 \(\mathbb{R}^d\) 空间中预测得分或去噪后的信号。而离散序列则存在于分类空间 \(\{1,\dots,K\}^L\) 中,其中欧几里得意义上的“小扰动”和基于梯度的得分函数并不直接适用。人们或许会考虑将离散令牌嵌入到连续空间,应用标准高斯扩散,再四舍五入回最近的令牌。然而,这种“嵌入-扩散”方法会在嵌入流形与离散词汇之间引入几何失配,常常导致舍入误差、表示坍缩和较差的样本质量(Li 等人,2022 (https://arxiv.org/html/2607.13431#bib.bib49); Gong 等人,2023b (https://arxiv.org/html/2607.13431#bib.bib29); He 等人,2023 (https://arxiv.org/html/2607.13431#bib.bib36))。另一种替代方案(也是本文的重点)是**在离散空间原生地定义扩散**,这需要设计一个**离散损坏过程**以及一个匹配的**逆向去噪器**,从损坏的分类输入中预测干净的令牌(Austin 等人,2021a (https://arxiv.org/html/2607.13431#bib.bib5); Hoogeboom 等人,2021 (https://arxiv.org/html/2607.13431#bib.bib37); Sahoo 等人,2024 (https://arxiv.org/html/2607.13431#bib.bib73); Lou 等人,2024 (https://arxiv.org/html/2607.13431#bib.bib52))。损坏过程的选择不仅仅是一个实现细节:它决定了令牌空间中扰动的拓扑结构、每个时间步去噪任务的难度以及最终的生成顺序。
离散设置还引入了独特的挑战,涉及精确似然计算、分类变量的噪声调度设计,以及词汇结构与前向过程语义之间的交互(Gulrajani 和 Hashimoto,2023 (https://arxiv.org/html/2607.13431#bib.bib76); Shi 等人,2024b (https://arxiv.org/html/2607.13431#bib.bib77); Gat 等人,2024 (https://arxiv.org/html/2607.13431#bib.bib8))。这些设计选择构成了一个丰富且迅速扩展的设计空间,使离散扩散区别于其连续对应物和标准 AR 建模。
本文的核心前提是,这个设计空间最好通过一个统一的组织视角来理解:**离散状态空间的构建**,我们将其广义地称为**分词(Tokenization)**。我们认为分词不是一个预处理细节,而是一个首要的设计轴线,它几乎塑造了后续的每一个建模决策。在文本中,子词词汇的选择决定了掩码的粒度、替换噪声的语义以及去噪器所见到的有效序列长度。在分词化的多模态生成中,VQ-VAE 或残差量化器的码本拓扑定义了一种令牌间的“距离”概念,损坏过程可以利用或忽略它。在科学领域,自然的字母表,如氨基酸、核苷酸、原子类型、键类型,本身就携带着丰富的结构和化学语义,这些语义与噪声调度和有效性约束之间存在着复杂的相互作用。通过将分词置于显要位置,我们在一个单一的视角下统一了这些看似迥异的领域:即**状态空间结构**与**损坏-去噪动力学**之间的相互作用。这种视角揭示了那些在分词被视为固定上游选择时几乎不可见的反复出现的设计模式和失败模式。
基于这一前提,本文开发了一个涵盖从分词到生成全流程的离散扩散统一框架,并将其实例化到三大应用类别。第一个领域是**通过扩散语言模型(dLLMs)进行文本和代码生成**:包括掩码、吸收态和流匹配等方法,这些方法最近已扩展到数十亿参数规模,用于开放式生成、指令遵循、推理和代码合成(Nie 等人,2025b (https://arxiv.org/html/2607.13431#bib.bib62); a (https://arxiv.org/html/2607.13431#bib.bib74); Gong 等人,2025a (https://arxiv.org/html/2607.13431#bib.bib660); Ye 等人,2025d (https://arxiv.org/html/2607.13431#bib.bib26); Gong 等人,2025b (https://arxiv.org/html/2607.13431#bib.bib30))。第二个是**分词化的多模态生成**,其中连续的信号(如图像、音频和视频)首先使用向量量化或编解码模型进行离散化,然后在得到的令牌空间中使用离散扩散进行建模,通常在统一架构中与文本令牌联合处理(Gu 等人,2022 (https://arxiv.org/html/2607.13431#bib.bib32); Chang 等人,2022 (https://arxiv.org/html/2607.13431#bib.bib17); Xie 等人,2025a (https://arxiv.org/html/2607.13431#bib.bib655); Yang 等人,2025d (https://arxiv.org/html/2607.13431#bib.bib48))。第三个涵盖了**科学与工程中领域固有的离散结构**:氨基酸字母表上的蛋白质序列、核苷酸词汇上的 DNA/RNA、具有分类节点和边属性的分子图,以及图布局和调度方案等组合对象(Gruver 等人,2023 (https://arxiv.org/html/2607.13431#bib.bib31); Avdeyev 等人,2023 (https://arxiv.org/html/2607.13431#bib.bib6); Vignac 等人,2023 (https://arxiv.org/html/2607.13431#bib.bib649); Sun 和 Yang,2023 (https://arxiv.org/html/2607.13431#bib.bib81))。我们还涵盖了一个新兴方向,即**智能体、规划与工具使用**,其中离散扩散作为决策流程的规划器或结构化输出生成器,包括视觉-语言-动作模型和组合优化(Ye 等人,2025a (https://arxiv.org/html/2607.13431#bib.bib659); Liu 等人,2025e (https://arxiv.org/html/2607.13431#bib.bib25); Ye 等人,2025c (https://arxiv.org/html/2607.13431#bib.bib45))。

图 1:论文概览。
我们的贡献如下:
1. **以分词为中心的视角。** 我们将离散状态空间的构建从一个外围的实现选择提升为主要组织原则,分析词汇设计、码本拓扑和自然字母表如何塑造损坏过程、去噪难度和下游可控性,同时引入面向扩散的分词质量诊断工具(第4节 (https://arxiv.org/html/2607.13431#S4))。
2. **统一的公式化与训练/推理框架。** 我们将每个离散扩散模型分解为四个组成部分——损坏算子、去噪器参数化、训练目标和采样器——并展示主要公式化族如何实例化这个共享结构(第5节 (https://arxiv.org/html/2607.13431#S5)),然后围绕相同的分解组织训练目标和参数化(第6节 (https://arxiv.org/html/2607.13431#S6))以及推理算法(第7节 (https://arxiv.org/html/2607.13431#S7))。
3. **跨领域实例化。** 我们将该框架映射到文本和代码、分词化多模态生成、蛋白质、基因组学、分子和图,以及规划和智能体,揭示共享的设计模式和领域特定的约束(第9节 (https://arxiv.org/html/2607.13431#S9))。
4. **缩放、系统与评估。** 我们将缩放行为、训练流程、推理加速和评估协议视为设计空间的组成部分,而非事后考虑(第8节 (https://arxiv.org/html/2607.13431#S8)和第10节 (https://arxiv.org/html/2607.13431#S10))。
5. **开放性问题。** 我们识别出具体的开放挑战:缩放行为、上下文学习差距、KV缓存类比、流式生成、统一令牌空间以及理论基础,并将这些挑战框定为可操作的研究问题(第12节 (https://arxiv.org/html/2607.13431#S12))。
本文其余部分组织如下。第2节 (https://arxiv.org/html/2607.13431#S2) 将我们的框架与先前关于扩散生成的综述联系起来。第3节 (https://arxiv.org/html/2607.13431#S3) 建立符号表示,并提供关于 AR 生成、连续扩散和离散马尔可夫链的简要背景。第4节 (https://arxiv.org/html/2607.13431#S4) 详细考察了文本、代码、量化媒体和科学领域的离散状态空间与分词。第5节 (https://arxiv.org/html/2607.13431#S5) 提出了核心公式化:转移矩阵模型、吸收态掩码、替换和混合损坏、连续时间过程、得分/比率方法以及一个统一视角。第6节 (https://arxiv.org/html/2607.13431#S6) 系统化了训练目标、逆向参数化、条件设置和引导,以及实际训练策略。第7节 (https://arxiv.org/html/2607.13431#S7) 涵盖推理算法:祖先采样、基于置信度的重新掩码、半自回归和块更新、引导和约束以及加速技术。第8节 (https://arxiv.org/html/2607.13431#S8) 讨论缩放和系统考虑。第9节 (https://arxiv.org/html/2607.13431#S9) 将框架实例化到各个应用领域。第10节 (https://arxiv.org/html/2607.13431#S10) 回顾评估和基准测试。第11节 (https://arxiv.org/html/2607.13431#S11) 讨论作为全局精化的离散扩散、与优化的联系、可信度以及何时更倾向于 AR 或混合方法。第12节 (https://arxiv.org/html/2607.13431#S12) 概述未来方向,第13节 (https://arxiv.org/html/2607.13431#S13) 总结。我们发布了一个配套资源库,包含分类法和精选资源,网址为 https://github.com/AAAAA-Academia-Attractions/Discrete-Diffusion。
## 2 相关工作
近年来的一些综述涉及了基于扩散的生成。在此,我们将我们的框架与之对比,并阐明以分词为中心、跨领域处理方法所带来的额外贡献。最近的综述文章显著改进了对基于扩散生成的覆盖,特别是在文本和多模态语言建模方面。以文本为中心的综述通常围绕非自回归生成、连续与离散公式化,或扩散语言模型和基于扩散的大型语言模型的出现来组织文献(Li 等人,2023a (https://arxiv.org/html/2607.13431#bib.bib93); Čeović 等人,2023 (相似文章
Set Diffusion:在自回归与扩散之间插值令牌顺序以实现快速灵活的解码
Set Diffusion 引入了一类新的语言模型,通过在灵活位置、灵活长度的令牌集合上分解令牌生成,在自回归模型和扩散模型之间进行插值。这使得解码速度更快,令牌排序更灵活,在推理、摘要和无条件生成任务上实现了更好的速度-质量权衡。
令牌时间连续扩散用于语言建模
本文介绍了令牌时间连续扩散(Token Time Continuous Diffusion,简称TTCD),这是一种新型扩散语言模型,它在连续空间中运行,采用每个令牌的时间步,在条件生成和数独求解方面以高加速比优于离散模型。
扩散模型的数学导论
本文对扩散模型进行了以证明为导向的介绍,涵盖了朗之万动力学、基于分数的模型、离散化、离散扩散以及推理时控制,面向研究生读者。
用于优化离散扩散语言模型的漂移目标
本文提出TokenDrift,一种漂移目标方法,通过将分类预测提升至连续语义空间进行反对称漂移,从而优化离散扩散语言模型。在固定去噪步数下,该方法显著提升了生成质量。
Discrete Stochastic Localization用于非自回归生成
提出离散随机定位(Discrete Stochastic Localization, DSL),一种用于非自回归文本生成的连续状态扩散框架,采用单位球面令牌嵌入和时步不变的降噪器,在OpenWebText上实现了比掩码离散扩散模型更好的分布忠实性。