令牌时间连续扩散用于语言建模

Hugging Face Daily Papers 论文

摘要

本文介绍了令牌时间连续扩散(Token Time Continuous Diffusion,简称TTCD),这是一种新型扩散语言模型,它在连续空间中运行,采用每个令牌的时间步,在条件生成和数独求解方面以高加速比优于离散模型。

在本文中,我们提出了令牌时间连续扩散(TTCD),这是一种新型扩散语言模型,它(a)在连续空间中运行,将高斯噪声确定性地映射到最终的令牌画布上,无需进一步采样,并且关键的是(b)引入了每个令牌时间步的新概念,其中一些令牌从噪声到令牌的转化速度比其他令牌更快。连续空间建模帮助TTCD避免了多个令牌的并行采样,这是纯离散空间迭代模型在高加速比下不准确的一个关键来源。每个令牌时间步的概念帮助TTCD更好地建模条件生成,允许更确定的令牌以更快的速度前进,并在精炼过程中实现差异化的令牌间影响。TTCD在高加速比下优于离散模型。我们在OpenWebText上训练了一个1.6亿参数的TTCD模型,然后对其进行了自蒸馏;我们发现,在高加速比下,我们在无条件生成质量上与几个现有模型相当,这些模型大小相似,使用相同数据训练并进行了自蒸馏,而在条件生成上我们更优。我们在数独求解方面也取得了类似的提升。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:41

论文页面 - Token Time Continuous Diffusion 面向语言建模的词元时间连续扩散

来源:https://huggingface.co/papers/2607.14106

摘要

本文提出了一种新的扩散语言模型——词元时间连续扩散(TTCD),其特点在于:(a)在连续空间中运行,将高斯噪声确定性地映射到最终的词元画布上,无需进一步采样;且关键在于(b)引入了一种新的每词元时间概念,使得某些词元从噪声到词元的进展速度可快于其他词元。连续空间建模帮助TTCD避免了多词元的并行采样,而这正是纯离散空间迭代模型在高加速比下误差的主要来源。每词元时间的概念有助于TTCD更好地建模条件生成,允许更确定的词元以更快速度推进,并在精炼过程中实现词元间差异化的相互影响。TTCD在高加速比下优于离散模型。我们在OpenWebText上训练了一个1.6亿参数的TTCD模型,并对其进行自蒸馏;我们发现,在高加速比下,我们与若干类似规模、基于相同数据训练并进行自蒸馏的现有模型在无条件生成质量上相当,在条件生成上则表现更优。我们在数独求解任务中也取得了类似的提升。

查看arXiv页面 (https://arxiv.org/abs/2607.14106)
查看PDF (https://arxiv.org/pdf/2607.14106)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14106)

引用本文的模型 0

暂无模型关联本文

请在模型 README.md 中引用 arxiv.org/abs/2607.14106 以从本页面链接。

引用本文的数据集 0

暂无数据集关联本文

请在数据集 README.md 中引用 arxiv.org/abs/2607.14106 以从本页面链接。

引用本文的 Space 0

暂无 Space 关联本文

请在 Space README.md 中引用 arxiv.org/abs/2607.14106 以从本页面链接。

包含本文的收藏 1

相似文章

LangFlow:连续扩散在语言建模中可与离散扩散相媲美

Hugging Face Daily Papers

LangFlow提出了首个可与离散扩散方法相媲美的连续扩散语言模型,挑战了长期以来认为连续扩散在语言建模中劣于离散扩散的观点。该工作引入了基于最优Gumbel噪声调度等关键要素,并展示了与离散扩散基线相比具有竞争力的困惑度和迁移学习性能。

TextLDM:利用连续潜在扩散进行语言建模

Hugging Face Daily Papers

本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。