扩展与蒸馏文本嵌入以提升扩散性

Hugging Face Daily Papers 论文

摘要

该论文指出,扩展文本嵌入(例如将 T5-small 换成 T5Gemma-2-270M)能大幅改进连续扩散语言模型,而将扩展后的嵌入蒸馏到一个连通性更强的潜在空间,可使其更易生成——最终在 Gen. PPL 上达到 17.8,优于 GPT-2-M。

扩散语言模型(DLMs)为自回归(AR)语言生成提供了一个极具前景的替代方案。近期在连续扩散语言模型上的进展,即对连续文本嵌入应用潜在扩散,提出了一个实际问题:哪种嵌入能构建出最好的潜在空间,即最具「可扩散性」?为回答这一问题,我们在不同嵌入之间进行搜索,发现将同一族系中的嵌入模型扩展到更强的版本(T5 到 T5Gemma-1 再到 T5Gemma-2),能大幅提升生成性能。然而,原始的 T5Gemma-2 嵌入仍非最优。它们的判别性过强,以至于即使是那些合理的备选词的嵌入也被彼此拉开,这使得生成过程在采样不完美时非常脆弱。因此,连续扩散往往无法命中其中任何一个嵌入,最终停留在一个无效的嵌入上。为解决这一问题,我们对 T5Gemma-2 进行蒸馏,训练一个学生编码器来学习教师模型的解码概率作为软标签。基于这种软标签的学习使学生编码器将备选词的嵌入拉得更近,同时保持编解码机制不变。蒸馏后的嵌入形成了一个连通性更强、更易扩散的潜在空间,优于原始的 T5Gemma-2 嵌入。最终,我们中等规模的 DLM 在 OpenWebText 上以真实文本的真实熵水平实现了 Gen. PPL 17.8(真实文本的 PPL 为 15.4),在 Gen. PPL 上超越了 GPT-2-M。
查看原文
查看缓存全文

缓存时间: 2026/10/02 04:28

论文页面 - Scaling and Distilling Text Embeddings for Better Diffusibility

Source: https://huggingface.co/papers/2610.01016

很高兴与大家分享我们最近关于连续扩散语言模型(DLMs)潜在空间的论文!

在这篇论文中,我们发现**扩大(scaling)**文本嵌入的规模可以显著提升连续 DLM 的性能。例如,将近期 ELF 模型中所使用的 T5-small 嵌入替换为更先进的 T5Gemma-2-270M 后,我们能将 Gen. PPL 降低约 40%。

但仅有 scaling 还不够,因为扩大的嵌入往往难以生成。它们的区分度和信息量如此之高,以至于相似且可互换的词语的嵌入之间距离很远。因此,连续扩散模型很难生成这样分离且离散的目标。为缓解这一问题,我们对这些嵌入进行了蒸馏(distilling),将其压缩到一个更加连贯且鲁棒的潜在空间中,使其更易于扩散模型生成。

最终,我们中等规模的 DLM 在 OpenWebText 上以真实文本的熵水平达到了 Gen. PPL 17.8(真实文本的 PPL 为 15.4),在 Gen. PPL 指标上超越了 GPT-2-M。我们的研究结果为语言表示学习提供了新的见解,也为扩展 DLM 提供了一种可靠的途径。

代码和项目页面也已发布:代码 | 项目页面。欢迎查看!

相似文章

TextLDM:利用连续潜在扩散进行语言建模

Hugging Face Daily Papers

本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。

视觉生成中文本条件化的缩放特性

Hugging Face Daily Papers

本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。

Abra:扩散图像训练的缩放研究

Hugging Face Daily Papers

本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。

高维潜变量的扩散性

Hugging Face Daily Papers

本文表明,为重建而微调自编码器会降低有效维度,使得标准速度预测在扩散模型中效率低下,并提出使用x0预测来聚焦于信号流形,从而持续提升文本到图像生成性能。