扩展与蒸馏文本嵌入以提升扩散性
摘要
该论文指出,扩展文本嵌入(例如将 T5-small 换成 T5Gemma-2-270M)能大幅改进连续扩散语言模型,而将扩展后的嵌入蒸馏到一个连通性更强的潜在空间,可使其更易生成——最终在 Gen. PPL 上达到 17.8,优于 GPT-2-M。
查看缓存全文
缓存时间: 2026/10/02 04:28
论文页面 - Scaling and Distilling Text Embeddings for Better Diffusibility
Source: https://huggingface.co/papers/2610.01016
很高兴与大家分享我们最近关于连续扩散语言模型(DLMs)潜在空间的论文!
在这篇论文中,我们发现**扩大(scaling)**文本嵌入的规模可以显著提升连续 DLM 的性能。例如,将近期 ELF 模型中所使用的 T5-small 嵌入替换为更先进的 T5Gemma-2-270M 后,我们能将 Gen. PPL 降低约 40%。
但仅有 scaling 还不够,因为扩大的嵌入往往难以生成。它们的区分度和信息量如此之高,以至于相似且可互换的词语的嵌入之间距离很远。因此,连续扩散模型很难生成这样分离且离散的目标。为缓解这一问题,我们对这些嵌入进行了蒸馏(distilling),将其压缩到一个更加连贯且鲁棒的潜在空间中,使其更易于扩散模型生成。
最终,我们中等规模的 DLM 在 OpenWebText 上以真实文本的熵水平达到了 Gen. PPL 17.8(真实文本的 PPL 为 15.4),在 Gen. PPL 指标上超越了 GPT-2-M。我们的研究结果为语言表示学习提供了新的见解,也为扩展 DLM 提供了一种可靠的途径。
相似文章
TextLDM:利用连续潜在扩散进行语言建模
本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。
视觉生成中文本条件化的缩放特性
本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。
Abra:扩散图像训练的缩放研究
本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。
高维潜变量的扩散性
本文表明,为重建而微调自编码器会降低有效维度,使得标准速度预测在扩散模型中效率低下,并提出使用x0预测来聚焦于信号流形,从而持续提升文本到图像生成性能。
像素空间文本到图像扩散模型的训练实证研究
本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。