@mihirp98: 图像、视频、音频、动作——生成式建模已趋同于一个范式:压缩成连续潜变量,生成…

X AI KOLs Timeline 论文

摘要

研究人员提出Latent Thought Flows,将256个文本令牌压缩为8个连续潜变量,实现单步生成,在推理计算与生成质量的帕累托前沿上优于自回归基线。

图像、视频、音频、动作——生成式建模已趋同于一个范式:压缩成连续潜变量,在潜空间生成,再解码。 语言是唯一的例外:仍然逐个令牌生成,作为一个长的离散序列。 Latent Thought Flows:我们将256个文本令牌压缩为8个连续潜变量,使用单步流模型生成它们,并用自回归解码器将其读取为文本。 结果:在推理计算与生成质量的帕累托前沿上,比调优的自回归基线更好——这得益于压缩和单步生成。 联合领导:@ZhengyangGeng
查看原文
查看缓存全文

缓存时间: 2026/07/16 22:23

图像、视频、音频、动作——生成式建模已汇聚于一种方案:压缩为连续潜变量,在潜空间生成,再解码。

语言是唯一的例外:仍然以长离散流的形式逐词元生成。

潜在思维流:我们将256个文本词元压缩为8个连续潜变量,通过单步流模型生成它们,并使用自回归解码器将其读出为文本。

结果:相比于精心调优的自回归基线,实现了更优的推理计算量 vs. 生成质量的帕累托前沿——得益于压缩和单步生成。

与 @ZhengyangGeng 共同领导。

相似文章

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。

使用CLIP潜在表示的分层文本条件图像生成

OpenAI Blog

OpenAI提出了一个使用CLIP潜在表示进行文本条件图像生成的分层两阶段模型:一个先验模型从文本标题生成CLIP图像嵌入,以及一个基于扩散的解码器从嵌入生成图像。该方法提高了图像多样性,并实现了零样本语言引导图像操作。

TextLDM:利用连续潜在扩散进行语言建模

Hugging Face Daily Papers

本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。