离散扩散的单纯形松弛
摘要
本文介绍了 Simplax,一种用于离散扩散模型的精确狄利克雷-类别增强方法,它在保留原始类别损坏过程的同时丰富了训练目标和逆向转移,在 OpenWebText 上改善了困惑度-熵权衡,在 Sudoku 上提高了有效性。
arXiv:2608.10615v1 公告类型:新
摘要:用于类别生成的离散扩散模型由损坏核定义,该核决定了中间状态空间和相关的逆向预测问题。我们研究均匀离散扩散,并探讨是否可以在不改变底层类别损坏过程的前提下丰富其训练目标和逆向转移。我们引入了 Simplax,一种精确的狄利克雷--类别增强方法,它在保留原始均匀扩散过程作为其类别边际的同时,将每个损坏的类别状态与一个辅助的单纯形值变量耦合。这种增强产生了一个可处理的 Rao--Blackwellized 逆向桥目标和一个相应的随机逆向采样器,同时保留损坏的类别状态作为去噪器的输入。实验上,Simplax 改善了无条件 OpenWebText 生成的生成困惑度--熵权衡。在 Sudoku 上,一个仅使用 $30$-线索谜题训练的模型在所有评估的线索密度中达到了最高准确率,包括最小唯一可解 $17$-线索情形,并且在无条件生成中也实现了最高的有效性。
查看缓存全文
缓存时间: 2026/08/12 08:36
# 离散扩散的单纯形松弛
**Source:** https://arxiv.org/html/2608.10615
Jinya Sakurai¹²⁴, Patrick Pynadath³, Satoshi Hayakawa², Jaehong Yoon¹, Xulei Yang⁴, Nancy F. Chen⁴˒⁵, Xun Xu⁴˒⁵
¹新加坡南洋理工大学 ²东京大学 ³普渡大学 ⁴A\*STAR 先进智能与计算研究所(IAIC) ⁵A\*STAR 前沿人工智能研究中心(CFAR)
###### 摘要
用于类别生成的离散扩散模型由破坏核定义,破坏核决定了中间状态空间以及相关的反向预测问题。我们研究均匀离散扩散,并探讨能否在不改变底层类别破坏过程的前提下,丰富其训练目标与反向转移。我们引入 Simplax,一种精确的 Dirichlet–类别(Dirichlet–categorical)增广方法,它将每个被破坏的类别状态与一个辅助的单纯形取值变量耦合,同时保留原始均匀扩散过程作为其类别边际。这一增广产生了可处理的 Rao–Blackwell 化反向桥目标以及相应的随机反向采样器,同时仍保留被破坏的类别状态作为去噪器的输入。实验上,Simplax 改善了无条件 OpenWebText 生成的生成困惑度–熵权衡。在数独任务上,仅用 30 个提示数的谜题训练的模型,在所有评估的提示数密度下均取得了比较方法中最高的准确率,包括最小唯一可解的 17 个提示数情形,并在无条件生成中实现了最高有效性。
## 1 引言
参看图1
图1:反向桥匹配,示意 \(K=3\) 的情形:one-hot 状态是 \(\Delta^{K-1}\) 的顶点,\(\mathbf{w}_{t}\) 是内点。(a) 被破坏状态 \(\mathbf{z}_{t}\) 既是去噪器输入,也是唯一的桥锚点,因此每个样本只匹配一条桥。(b) Simplax 联合采样 \((\mathbf{w}_{t},\mathbf{z}_{t})\);\(\mathbf{z}_{t}\) 仍作为去噪器输入,而额外的采样 \(\widetilde{\mathbf{z}}_{t}\sim\operatorname{Cat}(\mathbf{w}_{t})\) 锚定所有 \(K\) 条桥,这些桥被同时匹配并通过精确边际化得到 (15) (https://arxiv.org/html/2608.10615#S3.E15)。
离散扩散模型已成为一种有前景的生成建模框架,适用于类别数据,包括文本、生物序列及其他符号领域 (Hoogeboomet al.,2021) (https://arxiv.org/html/2608.10615#bib.bib1); Austinet al.,2021 (https://arxiv.org/html/2608.10615#bib.bib2); Campbellet al.,2022 (https://arxiv.org/html/2608.10615#bib.bib3); Louet al.,2024 (https://arxiv.org/html/2608.10615#bib.bib4); Zhanget al.,2025 (https://arxiv.org/html/2608.10615#bib.bib11)。与自回归生成相比,它通过学习反转完整类别状态上的加噪过程,提供了一条概念上不同的并行预测路径。该框架中的一个核心设计选择是破坏核。这一选择决定了中间状态空间和反向更新的语义,并塑造了用于近似反向过程的训练目标形式 (Austinet al.,2021) (https://arxiv.org/html/2608.10615#bib.bib2); Campbellet al.,2022 (https://arxiv.org/html/2608.10615#bib.bib3); Louet al.,2024 (https://arxiv.org/html/2608.10615#bib.bib4))。
已有的离散扩散模型以不同方式实例化这一设计选择。遮蔽扩散将 token 向一个特殊的掩码状态破坏,产生的中间序列可被解释为部分观测数据 (Austinet al.,2021) (https://arxiv.org/html/2608.10615#bib.bib2); Sahooet al.,2024 (https://arxiv.org/html/2608.10615#bib.bib5); Shiet al.,2024 (https://arxiv.org/html/2608.10615#bib.bib6); Ouet al.,2025 (https://arxiv.org/html/2608.10615#bib.bib8); Zhenget al.,2025 (https://arxiv.org/html/2608.10615#bib.bib9))。均匀扩散则将 token 向原始类别字母表上的均匀分布替换,以对称方式对待所有类别,不引入特殊的吸收态 (Austinet al.,2021) (https://arxiv.org/html/2608.10615#bib.bib2); Schiffet al.,2025 (https://arxiv.org/html/2608.10615#bib.bib7); Sahooet al.,2025 (https://arxiv.org/html/2608.10615#bib.bib10); Deschenauxet al.,2026 (https://arxiv.org/html/2608.10615#bib.bib17))。近期工作已在引导、重复 token 修正、少步生成、自我纠正和扩展性等方面研究了均匀扩散 (Schiffet al.,2025) (https://arxiv.org/html/2608.10615#bib.bib7); Sahooet al.,2025 (https://arxiv.org/html/2608.10615#bib.bib10); von Rütteet al.,2025 (https://arxiv.org/html/2608.10615#bib.bib44),2026 (https://arxiv.org/html/2608.10615#bib.bib42); Sahooet al.,2026 (https://arxiv.org/html/2608.10615#bib.bib43))。
这些进展为均匀离散扩散留下了一个方法论问题:能否在保持类别破坏过程不变的前提下,丰富其训练目标和采样器?在标准均匀扩散中,两个噪声水平之间的反向更新直接通过采样的类别状态表达。这保持了离散生成过程,但也意味着训练和采样都通过类别中间状态来表述。我们思考是否可以在这些转移周围引入一种辅助概率结构,以便在不改变前向过程本身的前提下推导出可处理的目标和采样器。在这项工作中,我们考虑一种均匀离散扩散的概率增广,它保持类别破坏过程不变,同时引入一个辅助的单纯形取值状态。
我们引入 Simplax,一种精确的 Dirichlet–类别增广,其中每个被破坏的类别状态 \(\mathbf{z}_{t}\) 通过移位 Dirichlet 条件分布与辅助单纯形变量 \(\mathbf{w}_{t}\) 耦合。得到的增广层次结构保留原始均匀扩散过程作为其类别边际,并具有精确解码器 \(q(\mathbf{z}_{t}\mid\mathbf{w}_{t})=\operatorname{Cat}(\mathbf{z}_{t};\mathbf{w}_{t})\)。因此,单纯形变量并非作为类别状态的替代引入,而是作为与其概率耦合的辅助随机变量,可用于构造训练目标和反向转移。
在增广空间中直接构造反向目标存在困难,因为由此产生的单纯形反向桥是移位 Dirichlet 分量的混合,其 KL 散度通常不可处理。因此,我们通过对 \(\mathbf{w}_{t}\) 的辅助类别解码进行平均,推导出一个类别反向桥代理,其形式为标准离散反向 KL 散度的平均。该期望具有解析的 Rao–Blackwell 化形式。我们进一步从同一增广层次结构推导出一个随机祖先采样器,使用去噪器预测和辅助单纯形状态来参数化反向更新。
我们在 OpenWebText 上的无条件文本生成和数独上的约束类别生成上评估 Simplax。在 OpenWebText 上,Simplax 在广泛的推理预算范围内取得了有利的生成困惑度–熵权衡,在大多数报告的操作点上优于比较方法。在数独上,所有模型仅使用 30 个提示数的谜题训练,并在分布内、迁移到更简单和更困难的提示数密度以及无条件生成下进行评估。Simplax 在所有评估的数独设置中均取得了比较方法中的最高性能。
我们的主要贡献如下。首先,我们引入了均匀离散扩散的一种精确 Dirichlet–类别增广,保留原始类别过程作为边际。其次,我们推导出一个可处理的类别反向桥代理,其辅助类别期望具有 Rao–Blackwell 闭式形式,并从同一增广层次结构推导出一个随机祖先采样器。第三,我们实证表明,所提出的框架在开放式文本建模和约束类别生成中均改善了生成性能,包括广泛的推理预算区间和数独中的分布偏移。
## 2 预备知识
#### 记号。 设 \(\mathcal{V}=\{\mathbf{x}\in\{0,1\}^{K}\;:\;\sum_{i=1}^{K}x_{i}=1\}\) 表示 \(K\) 个类别上的 one-hot 向量集合,设 \(\Delta^{K-1}\) 表示 \(K\) 个类别上的概率单纯形。我们用 \(\mathcal{V}\) 中的 one-hot 列向量表示取 \(K\) 个值的标量离散随机变量。我们写 \(\operatorname{Cat}(\cdot;\bm{\pi})\) 表示类别概率为 \(\bm{\pi}\in\Delta^{K-1}\) 的类别分布。涉及 Dirichlet 密度的结果假设每个类别 \(k\) 都有 \(\pi_{k}>0\);我们实验中使用的均匀基分布满足此条件。我们写 \(\operatorname{Dir}(\cdot;\bm{\alpha})\) 表示浓度向量为 \(\bm{\alpha}\in\mathbb{R}_{>0}^{K}\) 的 Dirichlet 分布。我们用 \(\mathbf{1}\in\mathbb{R}^{K}\) 表示全一向量,\(\left\langle \mathbf{a},\,\mathbf{b}\right\rangle\) 表示内积,\(\mathbf{a}\odot\mathbf{b}\) 表示 Hadamard 积,\(\mathbf{a}\oslash\mathbf{b}\) 表示逐元素除法。对于长度为 \(L\) 的序列,我们写 \(\mathbf{x}^{1:L}\in\mathcal{V}^{L}\)。
### 2.1 Dirichlet 分布
Dirichlet 分布是概率单纯形上的分布。其均值由归一化浓度向量给出,而浓度参数之和控制分布围绕其均值的集中程度。特别地,对于 \(\mathbf{p}\in\Delta^{K-1}\) 和 \(\eta>0\),\(\operatorname{Dir}(\cdot;\eta\mathbf{p})\) 表示以 \(\mathbf{p}\) 为中心的 Dirichlet 分布,其中 \(\eta\) 控制其集中度。
### 2.2 离散扩散
我们考虑一个离散扩散过程,其先验为 \(\bm{\pi}\in\Delta^{K-1}\),噪声调度为 \(\alpha_{t}\in[0,1]\)。遵循标准参数化,时间 \(t\) 的加噪类别状态分布为
\[
q(\mathbf{z}_{t}\mid\mathbf{x})=\operatorname{Cat}\!\left(\mathbf{z}_{t};\mathbf{p}_{t}(\mathbf{x})\right),\quad\mathbf{p}_{t}(\mathbf{x})\coloneq\alpha_{t}\mathbf{x}+(1-\alpha_{t})\bm{\pi}.
\tag{1}
\]
我们使用满足 \(\alpha_{0}=1\)、\(\alpha_{1}=0\) 且对所有 \(t>0\) 都有 \(\alpha_{t}<1\) 的调度。因此,对于 \(t>0\),\(\mathbf{p}_{t}(\mathbf{x})\) 严格为正。对于两个时间 \(s<t\),前向转移为
\[
q(\mathbf{z}_{t}\mid\mathbf{z}_{s})=\operatorname{Cat}\!\left(\mathbf{z}_{t};\alpha_{t\mid s}\mathbf{z}_{s}+(1-\alpha_{t\mid s})\bm{\pi}\right),
\tag{2}
\]
其中 \(\alpha_{t\mid s}=\alpha_{t}/\alpha_{s}\)。均匀扰动后的类别边际为
\[
q(\mathbf{z}_{t})=\mathbb{E}_{q(\mathbf{x})}\left[\operatorname{Cat}(\mathbf{z}_{t};\alpha_{t}\mathbf{x}+(1-\alpha_{t})\bm{\pi})\right],
\tag{3}
\]
且解码器 \(q(\mathbf{x}\mid\mathbf{z}_{t})\) 通过贝叶斯规则给出。对于连续的噪声水平,离散状态扩散通常通过两个端点的条件转移表示 (Campbellet al.,2022) (https://arxiv.org/html/2608.10615#bib.bib3); Louet al.,2024 (https://arxiv.org/html/2608.10615#bib.bib4))。其关键成分是转移核 \(q(\mathbf{z}_{s}\mid\mathbf{z}_{t},\mathbf{x})\),其闭式形式为
\[
q(\mathbf{z}_{s}\mid\mathbf{z}_{t},\mathbf{x})=\operatorname{Cat}\!\left(\mathbf{z}_{s};\frac{\alpha_{s\mid t}\langle\mathbf{z}_{t},\mathbf{x}\rangle}{\alpha_{t}}\mathbf{x}+\left(1-\frac{\alpha_{s\mid t}\langle\mathbf{z}_{t},\mathbf{x}\rangle}{\alpha_{t}}\right)\bm{\pi}\right).
\tag{4}
\]
离散时间均匀扩散的训练目标是最小化近似反向核与 \(q(\mathbf{z}_{s}\mid\mathbf{z}_{t},\mathbf{x})\) 在 \(q(\mathbf{x}\mid\mathbf{z}_{t})\) 下的期望之间的 KL 散度 (Campbellet al.,2022) (https://arxiv.org/html/2608.10615#bib.bib3))。我们的方法通过保留相同的离散前向过程,同时引入一个可从中得出替代目标与反向采样的增广单纯形层次结构,来丰富该目标。
### 2.3 Dirichlet–类别层次结构
设 \(\eta_{t}>0\) 为时间相关的浓度参数,定义
\[
q(\mathbf{w}_{t}\mid\mathbf{z}_{t},\mathbf{x})=\operatorname{Dir}\!\left(\mathbf{w}_{t};\eta_{t}\mathbf{p}_{t}(\mathbf{x})+\mathbf{z}_{t}\right).
\tag{5}
\]
由于 \(\mathbf{z}_{t}\) 是 one-hot 向量,这也等价于
\[
q(\mathbf{w}_{t}\mid\mathbf{z}_{t},\mathbf{x})=\operatorname{Dir}\!\left(\mathbf{w}_{t};\eta_{t}\mathbf{p}_{t}(\mathbf{x})+1\right),
\tag{6}
\]
而条件分布 \(q(\mathbf{z}_{t}\mid\mathbf{w}_{t})=\operatorname{Cat}(\mathbf{z}_{t};\mathbf{w}_{t})\) 选择被编码为 one-hot 的类别。
联合层次结构为
\[
q(\mathbf{z}_{t},\mathbf{w}_{t}\mid\mathbf{x})=q(\mathbf{z}_{t}\mid\mathbf{x})\,q(\mathbf{w}_{t}\mid\mathbf{z}_{t},\mathbf{x}),
\tag{7}
\]
其中 \(\eta_{t}>0\) 是浓度参数。该 Dirichlet 分布的均值以扩散时间的类别边际为中心,而附加的 one-hot 计数 \(\mathbf{z}_{t}\) 将松弛状态锚定到采样的离散 token 上。这一构造给出了精确的 Dirichlet–类别层次结构。
###### 命题 1。 假设 \(t>0\)。Dirichlet–类别层次结构满足以下性质;涉及 \(\mathbf{w}_{s}\) 的陈述额外要求 \(s>0\)。
1. 松弛状态的边际分布为
\[
q(\mathbf{w}_{t}\mid\mathbf{x})=\operatorname{Dir}\!\left(\mathbf{w}_{t};\eta_{t}\mathbf{p}_{t}(\mathbf{x})\right).
\tag{8}
\]
2. 给定 \(\mathbf{w}_{t}\) 时,\(\mathbf{x}\) 与 \(\mathbf{z}_{t}\) 条件独立,且离散状态可通过下式从松弛状态恢复:
\[
q(\mathbf{z}_{t}\mid\mathbf{w}_{t},\mathbf{x})=q(\mathbf{z}_{t}\mid\mathbf{w}_{t})=\operatorname{Cat}\!\left(\mathbf{z}_{t};\mathbf{w}_{t}\right).
\tag{9}
\]
3. 对于 \(s<t\),给定 \(\mathbf{z}_{t}\) 和 \(\mathbf{x}\) 时,\(\mathbf{z}_{s}\) 与 \(\mathbf{w}_{t}\) 条件独立,且
\[
q(\mathbf{z}_{s},\mathbf{w}_{t}\mid\mathbf{x})=\int q(\mathbf{z}_{s}\mid\mathbf{z}_{t},\mathbf{x})\,q(\mathbf{w}_{t}\mid\mathbf{z}_{t},\mathbf{x})\,q(\mathbf{z}_{t}\mid\mathbf{x})\,\mathrm{d}\mathbf{z}_{t}.
\tag{10}
\]
### 2.4 精确的 Dirichlet 转移
我们写下给定 \(\mathbf{z}_{t}\) 和 \(\mathbf{x}\) 时 \(\mathbf{w}_{s}\) 的精确转移密度,它由两个移位 Dirichlet 分量的混合给出。
**命题 2。** 对于 \(t>0\)、\(s>0\),给定 \(\mathbf{z}_{t}\) 和 \(\mathbf{x}\) 时,\(\mathbf{w}_{s}\) 的条件分布为
\[
q(\mathbf{w}_{s}\mid\mathbf{z}_{t},\mathbf{x})=\sum_{\mathbf{z}_{s}\in\mathcal{V}}q(\mathbf{z}_{s}\mid\mathbf{z}_{t},\mathbf{x})\,\operatorname{Dir}\!\left(\mathbf{w}_{s};\eta_{s}\mathbf{p}_{s}(\mathbf{x})+\mathbf{z}_{s}\right).
\tag{11}
\]
因此,时间边际 \(q(\mathbf{w}_{s}\mid\mathbf{x})\) 等于
\[
q(\mathbf{w}_{s}\mid\mathbf{x})=\operatorname{Dir}(\mathbf{w}_{s};\eta_{s}\mathbf{p}_{s}(\mathbf{x})).
\tag{12}
\]
证明。对 (7) 关于 \(\mathbf{z}_{s}\) 求和,并使用精确解码器 \(q(\mathbf{z}_{s}\mid\mathbf{w}_{s})=\operatorname{Cat}(\mathbf{z}_{s};\mathbf{w}_{s})\) 以及 (2) 中的转移。对时间边际,直接应用 (1) 和 (7) 并对 \(\mathbf{z}_{s}\) 求和。∎
## 3 方法
我们的方法从以下观察出发:在增广空间 \((\mathbf{z}_{t},\mathbf{w}_{t})\) 中,反向过程存在一个自然的时间不对称性:\(\mathbf{w}_{t}\) 的密度由 \(\mathbf{z}_{t}\) 的时间条件分布控制,而 \(\mathbf{z}_{s}\) 由离散反向桥控制。直接最小化增广反向过程与真实过程之间的 KL 散度需要在包含移位 Dirichlet 混合的分布之间计算 KL,这通常不可处理。我们转而推导一个可处理的类别反向桥目标。
### 3.1 类别反向桥目标
在时间 \(t_{n-1}<t_{n}\),标准均匀扩散目标为
\[
\mathcal{L}_{n}=\mathbb{E}_{q(\mathbf{x},\mathbf{z}_{t_{n}})}\left[\mathrm{KL}\left(q(\mathbf{z}_{t_{n-1}}\mid\mathbf{z}_{t_{n}},\mathbf{x})\,\|\,p_{\theta}(\mathbf{z}_{t_{n-1}}\mid\mathbf{z}_{t_{n}})\right)\right].
\tag{13}
\]
在增广层次结构下,我们通过从解码器 \(q(\mathbf{z}_{t_{n}}\mid\mathbf{w}_{t_{n}})=\operatorname{Cat}(\mathbf{z}_{t_{n}};\mathbf{w}_{t_{n}})\) 采样辅助类别解码来平均该目标。得到的代理目标为
\[
\widetilde{\mathcal{L}}_{n}=\mathbb{E}_{q(\mathbf{x},\mathbf{z}_{t_{n}},\mathbf{w}_{t_{n}})}\left[\mathrm{KL}\left(q(\mathbf{z}_{t_{n-1}}\mid\mathbf{z}_{t_{n}},\mathbf{x})\,\|\,p_{\theta}(\mathbf{z}_{t_{n-1}}\mid\mathbf{w}_{t_{n}})\right)\right].
\tag{14}
\]
该期望允许进行 Rao–Blackwell 化:由于 \(\mathbf{w}_{t_{n}}\) 被积分掉,条件分布 \(p_{\theta}(\cdot\mid\mathbf{w}_{t_{n}})\) 的 KL 期望可以解析计算。特别地,定义 \(\bar{\mathbf{z}}_{t_{n}}=\mathbb{E}[\mathbf{z}_{t_{n}}\mid\mathbf{w}_{t_{n}}]=\mathbf{w}_{t_{n}}\),则辅助期望简化为
\[
\widetilde{\mathcal{L}}_{n}=\mathbb{E}_{q(\mathbf{x},\mathbf{z}_{t_{n}},\mathbf{w}_{t_{n}})}\left[\sum_{\mathbf{z}_{t_{n-1}}}q(\mathbf{z}_{t_{n-1}}\mid\mathbf{z}_{t_{n}},\mathbf{x})\log\frac{q(\mathbf{z}_{t_{n-1}}\mid\mathbf{z}_{t_{n}},\mathbf{x})}{p_{\theta}(\mathbf{z}_{t_{n-1}}\mid\mathbf{w}_{t_{n}})}\right].
\tag{15}
\]
在该目标中,被破坏的类别状态 \(\mathbf{z}_{t_{n}}\) 仍作为去噪器输入,而辅助单纯形状态 \(\mathbf{w}_{t_{n}}\) 仅用于参数化反向核。我们在附录 A 中表明,(15) 中的期望是解析可处理的,因为 Dirichlet 的矩与离散反向核的线性结构相互作用。
### 3.2 随机祖先采样器
在时间步 \(t_{n}\) 处,增广状态为 \((\mathbf{z}_{t_{n}},\mathbf{w}_{t_{n}})\)。给定去噪器预测 \(p_{\theta}(\mathbf{x}\mid\mathbf{z}_{t_{n}})\),我们构造反向更新如下。首先,我们使用预测来形成一个精心设计的类别边际 \(\mathbf{r}_{s}(\mathbf{w}_{t_{n}})\),定义如下:
\[
\mathbf{r}_{s}(\mathbf{w}_{t_{n}})=\alpha_{s\mid t_{n}}\mathbf{w}_{t_{n}}+(1-\alpha_{s\mid t_{n}})\bm{\pi}.
\tag{16}
\]
然后我们采样
\[
\mathbf{z}_{s}\sim\operatorname{Cat}\left(\mathbf{z}_{s};\mathbf{r}_{s}(\mathbf{w}_{t_{n}})\right).
\tag{17}
\]
接着从增广反向桥中采样辅助状态:
\[
\mathbf{w}_{s}\sim q(\mathbf{w}_{s}\mid\mathbf{z}_{s},\mathbf{x}_{\theta}),
\tag{18}
\]
其中 \(\mathbf{x}_{\theta}\) 是从去噪器预测中采样得到的,而 \(q(\mathbf{w}_{s}\mid\mathbf{z}_{s},\mathbf{x}_{\theta})\) 是(5)中给出的条件 Dirichlet。严格来说,对于 \(s=0\),该转移以 \(\mathbf{z}_{0}\sim q(\mathbf{z}_{0}\mid\mathbf{x}_{\theta})=\operatorname{Cat}(\mathbf{z}_{0};\mathbf{x}_{\theta})\) 结束。
设时间网格为 \(1=t_{N}>t_{N-1}>\cdots>t_{0}=0\)。对于以 \(\mathbf{z}_{t}\) 为条件的去噪器,Dirichlet–类别层次结构产生一个随机采样器,该采样器在正时间维持增广状态 \((\mathbf{z}_{t},\mathbf{w}_{t})\)。由于端点边际为 \(q(\mathbf{w}_{1})=\operatorname{Dir}(\mathbf{w}_{1};\eta_{1}\bm{\pi})\),精确解码器为 \(q(\mathbf{z}_{1}\mid\mathbf{w}_{1})=\operatorname{Cat}(\mathbf{z}_{1};\mathbf{w}_{1})\),生成从以下分布开始:
\[
\mathbf{w}_{t_{N}}\sim\operatorname{Dir}(\eta_{t_{N}}\bm{\pi}),\qquad\mathbf{z}_{t_{N}}\sim\operatorname{Cat}(\mathbf{w}_{t_{N}}).
\tag{19}
\]
给定相邻时间 \(s=t_{n-1}<t=t_{n}\),我们按 (17) 和 (18) 采样反向转移。我们强调去噪器输入始终是类别状态 \(\mathbf{z}_{t}\),而不是单纯形状态 \(\mathbf{w}_{t}\)。
## 4 实验
我们在两个任务上评估 Simplax:使用 OpenWebText 的无条件文本生成和使用数独的约束类别生成。所有模型均使用相同的均匀离散扩散前向过程训练,因此比较仅反映训练目标和采样器方面的差异。
### 4.1 无条件文本生成
我们按照先前工作 (Schiffet al.,2025) (https://arxiv.org/html/2608.10615#bib.bib7)) 的协议,在 OpenWebText 上训练小规模 GPT-2 规模的模型。我们使用 \(T=64\) 个扩散步、余弦噪声调度和 \(K=128\) 的 token 词汇量(基于 BPE)。我们报告生成困惑度(PPL)与自适应熵(entropy)的权衡,通过改变采样过程中的去噪步数来生成。
**结果。** 图 2 显示了在推理预算(去噪步数)从 \(8\) 到 \(256\) 的范围内,生成困惑度与熵的权衡。Simplax 在大多数操作点上优于标准的相似文章
用于优化离散扩散语言模型的漂移目标
本文提出TokenDrift,一种漂移目标方法,通过将分类预测提升至连续语义空间进行反对称漂移,从而优化离散扩散语言模型。在固定去噪步数下,该方法显著提升了生成质量。
离散扩散模型:从分词到生成的统一框架
本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。
Set Diffusion:在自回归与扩散之间插值令牌顺序以实现快速灵活的解码
Set Diffusion 引入了一类新的语言模型,通过在灵活位置、灵活长度的令牌集合上分解令牌生成,在自回归模型和扩散模型之间进行插值。这使得解码速度更快,令牌排序更灵活,在推理、摘要和无条件生成任务上实现了更好的速度-质量权衡。
基于离散扩散的约束代码生成
本文介绍了Constrained Diffusion for Code (CDC),这是一种无需训练的神经符号推理框架,它将约束满足直接集成到离散扩散模型的逆向去噪过程中,用于代码生成。CDC在功能正确性、安全性和语法方面持续提升约束满足率,在多个基准测试中优于现有的扩散模型和自回归基线。
Discrete Stochastic Localization用于非自回归生成
提出离散随机定位(Discrete Stochastic Localization, DSL),一种用于非自回归文本生成的连续状态扩散框架,采用单位球面令牌嵌入和时步不变的降噪器,在OpenWebText上实现了比掩码离散扩散模型更好的分布忠实性。