连续潜在扩散语言模型
摘要
Cola DLM 是一种分层潜在扩散语言模型,它通过文本到潜空间的映射以及条件解码,实现高效且非自回归的文本生成。
查看缓存全文
缓存时间: 2026/05/08 07:24
论文页面 - 连续潜在扩散语言模型
来源: https://huggingface.co/papers/2605.06548
摘要
Cola DLM 提出了一种分层潜在扩散语言模型,该模型利用文本到潜在空间的映射、全局语义先验建模以及条件解码,以灵活的自回归归纳偏置实现高效的文本生成。
大型语言模型在自回归范式 (https://huggingface.co/papers?q=autoregressive%20paradigm) 下取得了显著成功,然而高质量的文本生成 (https://huggingface.co/papers?q=text%20generation) 并不需要局限于固定的从左到右的顺序。现有的替代方案仍然难以同时实现生成效率、可扩展的表示学习以及有效的全局语义建模。我们提出了 Cola DLM,一种分层潜在扩散语言模型 (https://huggingface.co/papers?q=hierarchical%20latent%20diffusion%20language%20model),通过分层信息分解来构建文本生成 (https://huggingface.co/papers?q=text%20generation) 框架。Cola DLM 首先使用 Text VAE (https://huggingface.co/papers?q=Text%20VAE) 学习稳定的文本到潜在空间映射 (https://huggingface.co/papers?q=text-to-latent%20mapping),然后使用块因果 DiT (https://huggingface.co/papers?q=block-causal%20DiT) 在连续潜在空间 (https://huggingface.co/papers?q=continuous%20latent%20space) 中建模全局语义先验 (https://huggingface.co/papers?q=global%20semantic%20prior),最后通过条件解码 (https://huggingface.co/papers?q=conditional%20decoding) 生成文本。从统一的马尔可夫路径视角 (https://huggingface.co/papers?q=Markov-path%20perspective) 来看,其扩散过程执行的是潜在先验传输 (https://huggingface.co/papers?q=latent%20prior%20transport) 而非令牌级的观测恢复,从而将全局语义组织与局部文本实现分离开来。这种设计带来了更灵活的自回归归纳偏置 (https://huggingface.co/papers?q=non-autoregressive%20inductive%20bias),支持在连续空间中进行语义压缩和先验拟合,并自然地扩展到其他连续模态。通过在涵盖 4 个研究问题、8 个基准测试、严格匹配的约 2B 参数自回归和 LLaDA 基线,以及高达约 2000 EFLOPs 的扩展曲线的一系列实验中,我们确定了 Cola DLM 的有效整体配置,并验证了其在文本生成 (https://huggingface.co/papers?q=text%20generation) 方面的强大扩展行为 (https://huggingface.co/papers?q=scaling%20behavior)。综上所述,这些结果确立了分层连续潜在先验建模作为严格令牌级语言建模的一种合理替代方案,其中生成质量和扩展行为 (https://huggingface.co/papers?q=scaling%20behavior) 可能比似然 (https://huggingface.co/papers?q=likelihood) 更能反映模型能力,同时也为离散文本和连续模态之间的统一建模 (https://huggingface.co/papers?q=unified%20modeling) 指明了一条具体路径。
查看 arXiv 页面 (https://arxiv.org/abs/2605.06548) 查看 PDF (https://arxiv.org/pdf/2605.06548) 项目页面 (https://hongcanguo.github.io/Cola-DLM/) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.06548)
在您的智能体中获取此论文:
hf papers read 2605\.06548
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接到此论文的模型
在模型的 README.md 中引用 arxiv.org/abs/2605.06548 即可从此页面建立链接。
引用此论文的数据集0
没有链接到此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2605.06548 即可从此页面建立链接。
引用此论文的 Spaces0
没有链接到此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.06548 即可从此页面建立链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面建立链接。
相似文章
ByteDance-Seed/Cola-DLM · Hugging Face
字节跳动发布Cola-DLM,一种层次化连续潜在空间扩散语言模型,结合了文本VAE和块因果扩散Transformer,在Hugging Face上提供模型权重、代码和论文。
TextLDM:利用连续潜在扩散进行语言建模
本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。
CRoCoDiL: 用于语言的连续且鲁棒的条件扩散
CRoCoDiL提出了一种用于语言的连续且鲁棒的条件扩散方法,将掩码扩散模型转移到连续语义空间中,相比LLaDA等离散方法,生成质量更优,采样速度快10倍。
扩散以压缩:利用扩散语言模型实现无损压缩
本文介绍了扩散语言模型(DLMs)作为一种新的无损文本压缩推理范式,旨在克服基于自回归LLM的压缩器的吞吐量瓶颈,同时实现最先进的压缩率。
TAG-DLM:面向文本属性图学习的扩散语言模型
TAG-DLM 在一个掩码扩散语言模型中统一了文本推理与图消息传递,使得能够在节点分类和链接预测任务中联合推理文本与图拓扑。