GenFirst:生成先于重建,实现稳定的端到端潜在生成建模
摘要
GenFirst 提出了一种生成先于重建的策略,以实现潜在生成模型的稳定端到端训练,避免潜在坍缩,并在图像合成和多模态生成中达到最先进水平。
查看缓存全文
缓存时间: 2026/09/01 11:52
论文页面 - GenFirst:稳定端到端潜变量生成建模中的先生成再重建策略
来源:https://huggingface.co/papers/2608.29335
摘要
通过熵保持与非对称动态机制,采用先生成的策略实现端到端直接训练的潜变量生成模型,避免了模型坍缩,达到了最先进的图像合成效果与统一的多模态生成能力。
潜变量生成模型通常采用两阶段流程:先训练用于重建的变分自编码器(https://huggingface.co/papers?q=variational%20autoencoder),再在冻结的潜空间上训练生成模型。由于针对重建优化的潜变量未必对生成友好,联合训练两个模型成为一种有吸引力的替代方案。然而,直接进行端到端训练仍具挑战性,因其容易出现潜变量坍缩(https://huggingface.co/papers?q=latent%20collapse)并面临生成与重建的冲突。我们通过分析不同目标函数如何塑造潜空间,重新审视(https://huggingface.co/papers?q=sit)了这一问题,并得出两个关键见解。第一,Kullback-Leibler散度(https://huggingface.co/papers?q=Kullback-Leibler%20divergence)目标中的熵(https://huggingface.co/papers?q=entropy)项对于防止坍缩至关重要:重建和先验拟合倾向于收缩后验分布(https://huggingface.co/papers?q=posterior),而熵保持则能维护潜变量非退化的不确定性。第二,重建与生成表现出非对称的学习动态:重建快速且具有强监督性,而生成较慢且更难优化。基于这些见解,我们首次实现了无潜变量坍缩(https://huggingface.co/papers?q=latent%20collapse)的直接端到端训练,并提出了GenFirst——一种简单的先生成再重建策略。生成目标首先在较弱的重建压力下塑造潜空间,随后逐步增强重建以恢复视觉细节。我们使用具有精确似然的连续自回归先验(https://huggingface.co/papers?q=autoregressive%20priors)和具有隐式似然的SiT(https://huggingface.co/papers?q=SiT)先验验证了GenFirst。结合我们的端到端目标与GenFirst,SiT(https://huggingface.co/papers?q=SiT)在ImageNet-256(https://huggingface.co/papers?q=ImageNet-256)上,使用CFG(https://huggingface.co/papers?q=CFG)时达到0.97的gFID(https://huggingface.co/papers?q=gFID),不使用CFG时为1.45;而MMDiT(https://huggingface.co/papers?q=MMDiT)在文本到图像生成(https://huggingface.co/papers?q=text-to-image%20generation)任务中达到了0.90的GenEval(https://huggingface.co/papers?q=GenEval)分数。除了图像生成,我们将该框架扩展至用于生成与表示学习的共享视觉潜变量(https://huggingface.co/papers?q=shared%20visual%20latents),以及连续的统一文本图像生成。这些结果证明了稳定的端到端潜变量学习在不同生成先验与模态间的通用性。
查看arXiv页面 (https://arxiv.org/abs/2608.29335) 查看PDF (https://arxiv.org/pdf/2608.29335) 项目页面 (https://tom-zgt.github.io/GenFirst/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.29335)
引用本文的模型
0
无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2608.29335 以从本页链接。
引用本文的数据集
0
无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2608.29335 以从本页链接。
引用本文的Space
0
无Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2608.29335 以从本页链接。
收录本文的合集
1
相似文章
探索式建模:解锁第三个预训练轴与端到端生成
本文介绍了探索式建模(Explorative Modeling),这是一种新的生成建模范式,通过探索模型生成与数据之间的候选匹配来分解训练循环。它确立了除参数和数据之外的第三个预训练轴,提高了图像、视频和语言领域的扩展效率,并以更少的推理步骤实现端到端生成建模。
@mihirp98: 图像、视频、音频、动作——生成式建模已趋同于一个范式:压缩成连续潜变量,生成…
研究人员提出Latent Thought Flows,将256个文本令牌压缩为8个连续潜变量,实现单步生成,在推理计算与生成质量的帕累托前沿上优于自回归基线。
GenRecon:结合生成先验的多视图3D场景重建
GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。
生成作为辅助监督:通过解耦嵌入预测以零推理开销增强视觉理解
GAS 引入了一种生成引导的训练框架,通过解耦的混合Transformer架构,使用辅助生成任务来提高多模态模型中的视觉理解,且无推理开销。
GEAR:引导式端到端自回归图像合成
GEAR提出了一种通过表示对齐共同训练向量量化分词器和自回归生成器的方法,实现端到端训练,在ImageNet gFID上相比强基线实现高达10倍的收敛速度提升。