连续潜在扩散语言模型

Hugging Face Daily Papers 论文

摘要

Cola DLM 是一种分层潜在扩散语言模型,它通过文本到潜空间的映射以及条件解码,实现高效且非自回归的文本生成。

大语言模型在自回归范式下取得了显著的成功,但高质量的文本生成并不必然依赖于固定的从左到右的顺序。现有的替代方案仍难以同时实现生成效率、可扩展的表示学习以及有效的全局语义建模。我们提出了 Cola DLM,这是一种分层潜在扩散语言模型,通过分层信息分解来构建文本生成过程。Cola DLM 首先利用文本变分自编码器(Text VAE)学习稳定的文本到潜空间映射,随后使用块因果 DiT 在连续潜空间中建模全局语义先验,最后通过条件解码生成文本。从统一的马尔可夫路径视角来看,其扩散过程执行的是潜先验传输,而非令牌级别(token-level)的观测恢复,从而将全局语义组织与局部文本实现分离开来。这种设计产生了更具灵活性的非自回归归纳偏置,支持在连续空间中进行语义压缩和先验拟合,并能自然地扩展到其他连续模态。通过对涵盖 4 个研究问题、8 个基准测试、严格匹配的约 2B 参数自回归及 LLaDA 基线模型,以及最高约 2000 EFLOPs 的扩展曲线的实验,我们确定了 Cola DLM 的有效整体配置,并验证了其在文本生成方面的强大扩展行为。综上所述,这些结果确立了分层连续潜在先验建模作为一种有别于严格令牌级语言建模的合理替代方案,在此方案中,生成质量和扩展行为可能比似然度更能反映模型能力,同时也为离散文本与连续模态之间的统一建模提供了一条具体路径。
查看原文
查看缓存全文

缓存时间: 2026/05/08 07:24

论文页面 - 连续潜在扩散语言模型

来源: https://huggingface.co/papers/2605.06548

摘要

Cola DLM 提出了一种分层潜在扩散语言模型,该模型利用文本到潜在空间的映射、全局语义先验建模以及条件解码,以灵活的自回归归纳偏置实现高效的文本生成。

大型语言模型在自回归范式 (https://huggingface.co/papers?q=autoregressive%20paradigm) 下取得了显著成功,然而高质量的文本生成 (https://huggingface.co/papers?q=text%20generation) 并不需要局限于固定的从左到右的顺序。现有的替代方案仍然难以同时实现生成效率、可扩展的表示学习以及有效的全局语义建模。我们提出了 Cola DLM,一种分层潜在扩散语言模型 (https://huggingface.co/papers?q=hierarchical%20latent%20diffusion%20language%20model),通过分层信息分解来构建文本生成 (https://huggingface.co/papers?q=text%20generation) 框架。Cola DLM 首先使用 Text VAE (https://huggingface.co/papers?q=Text%20VAE) 学习稳定的文本到潜在空间映射 (https://huggingface.co/papers?q=text-to-latent%20mapping),然后使用块因果 DiT (https://huggingface.co/papers?q=block-causal%20DiT) 在连续潜在空间 (https://huggingface.co/papers?q=continuous%20latent%20space) 中建模全局语义先验 (https://huggingface.co/papers?q=global%20semantic%20prior),最后通过条件解码 (https://huggingface.co/papers?q=conditional%20decoding) 生成文本。从统一的马尔可夫路径视角 (https://huggingface.co/papers?q=Markov-path%20perspective) 来看,其扩散过程执行的是潜在先验传输 (https://huggingface.co/papers?q=latent%20prior%20transport) 而非令牌级的观测恢复,从而将全局语义组织与局部文本实现分离开来。这种设计带来了更灵活的自回归归纳偏置 (https://huggingface.co/papers?q=non-autoregressive%20inductive%20bias),支持在连续空间中进行语义压缩和先验拟合,并自然地扩展到其他连续模态。通过在涵盖 4 个研究问题、8 个基准测试、严格匹配的约 2B 参数自回归和 LLaDA 基线,以及高达约 2000 EFLOPs 的扩展曲线的一系列实验中,我们确定了 Cola DLM 的有效整体配置,并验证了其在文本生成 (https://huggingface.co/papers?q=text%20generation) 方面的强大扩展行为 (https://huggingface.co/papers?q=scaling%20behavior)。综上所述,这些结果确立了分层连续潜在先验建模作为严格令牌级语言建模的一种合理替代方案,其中生成质量和扩展行为 (https://huggingface.co/papers?q=scaling%20behavior) 可能比似然 (https://huggingface.co/papers?q=likelihood) 更能反映模型能力,同时也为离散文本和连续模态之间的统一建模 (https://huggingface.co/papers?q=unified%20modeling) 指明了一条具体路径。

查看 arXiv 页面 (https://arxiv.org/abs/2605.06548) 查看 PDF (https://arxiv.org/pdf/2605.06548) 项目页面 (https://hongcanguo.github.io/Cola-DLM/) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.06548)

在您的智能体中获取此论文:

hf papers read 2605\.06548

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有链接到此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2605.06548 即可从此页面建立链接。

引用此论文的数据集0

没有链接到此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2605.06548 即可从此页面建立链接。

引用此论文的 Spaces0

没有链接到此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2605.06548 即可从此页面建立链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面建立链接。

相似文章

ByteDance-Seed/Cola-DLM · Hugging Face

Reddit r/LocalLLaMA

字节跳动发布Cola-DLM,一种层次化连续潜在空间扩散语言模型,结合了文本VAE和块因果扩散Transformer,在Hugging Face上提供模型权重、代码和论文。

TextLDM:利用连续潜在扩散进行语言建模

Hugging Face Daily Papers

本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。