令牌时间连续扩散用于语言建模
摘要
本文介绍了令牌时间连续扩散(Token Time Continuous Diffusion,简称TTCD),这是一种新型扩散语言模型,它在连续空间中运行,采用每个令牌的时间步,在条件生成和数独求解方面以高加速比优于离散模型。
查看缓存全文
缓存时间: 2026/07/20 09:41
论文页面 - Token Time Continuous Diffusion 面向语言建模的词元时间连续扩散
来源:https://huggingface.co/papers/2607.14106
摘要
本文提出了一种新的扩散语言模型——词元时间连续扩散(TTCD),其特点在于:(a)在连续空间中运行,将高斯噪声确定性地映射到最终的词元画布上,无需进一步采样;且关键在于(b)引入了一种新的每词元时间概念,使得某些词元从噪声到词元的进展速度可快于其他词元。连续空间建模帮助TTCD避免了多词元的并行采样,而这正是纯离散空间迭代模型在高加速比下误差的主要来源。每词元时间的概念有助于TTCD更好地建模条件生成,允许更确定的词元以更快速度推进,并在精炼过程中实现词元间差异化的相互影响。TTCD在高加速比下优于离散模型。我们在OpenWebText上训练了一个1.6亿参数的TTCD模型,并对其进行自蒸馏;我们发现,在高加速比下,我们与若干类似规模、基于相同数据训练并进行自蒸馏的现有模型在无条件生成质量上相当,在条件生成上则表现更优。我们在数独求解任务中也取得了类似的提升。
查看arXiv页面 (https://arxiv.org/abs/2607.14106)
查看PDF (https://arxiv.org/pdf/2607.14106)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14106)
引用本文的模型 0
暂无模型关联本文
请在模型 README.md 中引用 arxiv.org/abs/2607.14106 以从本页面链接。
引用本文的数据集 0
暂无数据集关联本文
请在数据集 README.md 中引用 arxiv.org/abs/2607.14106 以从本页面链接。
引用本文的 Space 0
暂无 Space 关联本文
请在 Space README.md 中引用 arxiv.org/abs/2607.14106 以从本页面链接。
包含本文的收藏 1
相似文章
LangFlow:连续扩散在语言建模中可与离散扩散相媲美
LangFlow提出了首个可与离散扩散方法相媲美的连续扩散语言模型,挑战了长期以来认为连续扩散在语言建模中劣于离散扩散的观点。该工作引入了基于最优Gumbel噪声调度等关键要素,并展示了与离散扩散基线相比具有竞争力的困惑度和迁移学习性能。
Set Diffusion:在自回归与扩散之间插值令牌顺序以实现快速灵活的解码
Set Diffusion 引入了一类新的语言模型,通过在灵活位置、灵活长度的令牌集合上分解令牌生成,在自回归模型和扩散模型之间进行插值。这使得解码速度更快,令牌排序更灵活,在推理、摘要和无条件生成任务上实现了更好的速度-质量权衡。
TextLDM:利用连续潜在扩散进行语言建模
本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。
通过熵门控连续比特流扩散缩小语言建模中的自回归差距
本文介绍了一种扩散语言模型,将文本视为二进制比特流上的连续过程,利用熵门控随机采样来缩小与自回归模型的性能差距。该模型在 LM1B 和 OWT 基准测试中取得了最先进的结果,同时降低了内存占用。
BitLM:利用位级连续扩散解锁多 Token 语言生成
本文介绍了 BitLM,一种利用位级连续扩散并行生成多个 Token 的语言模型,旨在克服传统自回归生成的顺序瓶颈,同时保留因果结构。