@mihirp98: 图像、视频、音频、动作——生成式建模已趋同于一个范式:压缩成连续潜变量,生成…
摘要
研究人员提出Latent Thought Flows,将256个文本令牌压缩为8个连续潜变量,实现单步生成,在推理计算与生成质量的帕累托前沿上优于自回归基线。
查看缓存全文
缓存时间: 2026/07/16 22:23
图像、视频、音频、动作——生成式建模已汇聚于一种方案:压缩为连续潜变量,在潜空间生成,再解码。
语言是唯一的例外:仍然以长离散流的形式逐词元生成。
潜在思维流:我们将256个文本词元压缩为8个连续潜变量,通过单步流模型生成它们,并使用自回归解码器将其读出为文本。
结果:相比于精心调优的自回归基线,实现了更优的推理计算量 vs. 生成质量的帕累托前沿——得益于压缩和单步生成。
与 @ZhengyangGeng 共同领导。
相似文章
@alec_helbling: 越来越多的研究工作使用连续流模型来处理像语言生成这样的离散问题。一个简单的做法:表示…
这条推文讨论了越来越多地使用连续流模型来处理像语言生成这样的离散任务,提出了一种方法来将词汇表示为独热向量,并在连续空间中学习流。
通过判别式文本表征将一步图像生成从类别标签扩展到文本
研究者通过集成高判别力的大语言模型文本编码器,将 MeanFlow 一步图像生成从固定类别标签扩展到灵活文本输入,实现高效的文本条件合成并显著提升性能。
@jiqizhixin:如果只需要一步就能生成高质量图像,而不是数百步?斯坦福和字节跳动推出 W-Flow……
斯坦福和字节跳动推出 W-Flow,一种单步生成模型,利用 Wasserstein 梯度流实现了最先进的单步 ImageNet 256x256 生成(FID 1.29),采样速度比多步扩散模型快 100 倍。
Kathleen写作:无注意力机制的自回归生成与数据规模扩展
Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。
GenFirst:生成先于重建,实现稳定的端到端潜在生成建模
GenFirst 提出了一种生成先于重建的策略,以实现潜在生成模型的稳定端到端训练,避免潜在坍缩,并在图像合成和多模态生成中达到最先进水平。