@mihirp98: 图像、视频、音频、动作——生成式建模已趋同于一个范式:压缩成连续潜变量,生成…

X AI KOLs Timeline 论文

摘要

研究人员提出Latent Thought Flows,将256个文本令牌压缩为8个连续潜变量,实现单步生成,在推理计算与生成质量的帕累托前沿上优于自回归基线。

图像、视频、音频、动作——生成式建模已趋同于一个范式:压缩成连续潜变量,在潜空间生成,再解码。 语言是唯一的例外:仍然逐个令牌生成,作为一个长的离散序列。 Latent Thought Flows:我们将256个文本令牌压缩为8个连续潜变量,使用单步流模型生成它们,并用自回归解码器将其读取为文本。 结果:在推理计算与生成质量的帕累托前沿上,比调优的自回归基线更好——这得益于压缩和单步生成。 联合领导:@ZhengyangGeng
查看原文
查看缓存全文

缓存时间: 2026/07/16 22:23

图像、视频、音频、动作——生成式建模已汇聚于一种方案:压缩为连续潜变量,在潜空间生成,再解码。

语言是唯一的例外:仍然以长离散流的形式逐词元生成。

潜在思维流:我们将256个文本词元压缩为8个连续潜变量,通过单步流模型生成它们,并使用自回归解码器将其读出为文本。

结果:相比于精心调优的自回归基线,实现了更优的推理计算量 vs. 生成质量的帕累托前沿——得益于压缩和单步生成。

与 @ZhengyangGeng 共同领导。

相似文章

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。