GenFirst:生成先于重建,实现稳定的端到端潜在生成建模

Hugging Face Daily Papers 论文

摘要

GenFirst 提出了一种生成先于重建的策略,以实现潜在生成模型的稳定端到端训练,避免潜在坍缩,并在图像合成和多模态生成中达到最先进水平。

潜在生成模型通常遵循两阶段流水线,首先训练变分自编码器进行重建,然后在冻结的潜在空间上训练生成模型。由于重建优化的潜在表示不一定适合生成,联合训练两种模型是一个有吸引力的替代方案。然而,直接端到端训练仍然具有挑战性,因为它容易发生潜在坍缩并面临生成-重建冲突。我们通过分析不同目标如何塑造潜在空间来重新审视这个问题,并确定了两个关键见解。首先,Kullback-Leibler 散度目标中的熵项对于防止坍缩至关重要:重建和先验拟合倾向于缩小后验分布,而熵保持非退化的潜在不确定性。其次,重建和生成表现出不对称的学习动态:重建快速且监督强烈,而生成较慢且更难优化。基于这些见解,我们实现了首次无潜在坍缩的直接端到端训练,并提出了 GenFirst,一种简单的生成先于重建策略。生成目标首先在弱重建压力下塑造潜在空间,之后逐步加强重建以恢复视觉细节。我们使用具有精确似然的连续自回归先验和具有隐式似然的 SiT 先验来验证 GenFirst。使用我们的端到端目标和 GenFirst,SiT 在 ImageNet-256 上实现了 gFID 为 0.97(使用 CFG)和 1.45(不使用 CFG),而 MMDiT 在文本到图像生成中达到了 GenEval 评分 0.90。除了图像生成,我们将框架扩展到用于生成和表示学习的共享视觉潜在空间,以及连续统一的文本-图像生成。这些结果表明了稳定的端到端潜在学习在生成先验和模态之间的通用性。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:52

论文页面 - GenFirst:稳定端到端潜变量生成建模中的先生成再重建策略

来源:https://huggingface.co/papers/2608.29335

摘要

通过熵保持与非对称动态机制,采用先生成的策略实现端到端直接训练的潜变量生成模型,避免了模型坍缩,达到了最先进的图像合成效果与统一的多模态生成能力。

潜变量生成模型通常采用两阶段流程:先训练用于重建的变分自编码器(https://huggingface.co/papers?q=variational%20autoencoder),再在冻结的潜空间上训练生成模型。由于针对重建优化的潜变量未必对生成友好,联合训练两个模型成为一种有吸引力的替代方案。然而,直接进行端到端训练仍具挑战性,因其容易出现潜变量坍缩(https://huggingface.co/papers?q=latent%20collapse)并面临生成与重建的冲突。我们通过分析不同目标函数如何塑造潜空间,重新审视(https://huggingface.co/papers?q=sit)了这一问题,并得出两个关键见解。第一,Kullback-Leibler散度(https://huggingface.co/papers?q=Kullback-Leibler%20divergence)目标中的熵(https://huggingface.co/papers?q=entropy)项对于防止坍缩至关重要:重建和先验拟合倾向于收缩后验分布(https://huggingface.co/papers?q=posterior),而熵保持则能维护潜变量非退化的不确定性。第二,重建与生成表现出非对称的学习动态:重建快速且具有强监督性,而生成较慢且更难优化。基于这些见解,我们首次实现了无潜变量坍缩(https://huggingface.co/papers?q=latent%20collapse)的直接端到端训练,并提出了GenFirst——一种简单的先生成再重建策略。生成目标首先在较弱的重建压力下塑造潜空间,随后逐步增强重建以恢复视觉细节。我们使用具有精确似然的连续自回归先验(https://huggingface.co/papers?q=autoregressive%20priors)和具有隐式似然的SiT(https://huggingface.co/papers?q=SiT)先验验证了GenFirst。结合我们的端到端目标与GenFirst,SiT(https://huggingface.co/papers?q=SiT)在ImageNet-256(https://huggingface.co/papers?q=ImageNet-256)上,使用CFG(https://huggingface.co/papers?q=CFG)时达到0.97的gFID(https://huggingface.co/papers?q=gFID),不使用CFG时为1.45;而MMDiT(https://huggingface.co/papers?q=MMDiT)在文本到图像生成(https://huggingface.co/papers?q=text-to-image%20generation)任务中达到了0.90的GenEval(https://huggingface.co/papers?q=GenEval)分数。除了图像生成,我们将该框架扩展至用于生成与表示学习的共享视觉潜变量(https://huggingface.co/papers?q=shared%20visual%20latents),以及连续的统一文本图像生成。这些结果证明了稳定的端到端潜变量学习在不同生成先验与模态间的通用性。

查看arXiv页面 (https://arxiv.org/abs/2608.29335) 查看PDF (https://arxiv.org/pdf/2608.29335) 项目页面 (https://tom-zgt.github.io/GenFirst/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.29335)

引用本文的模型

0

无模型链接此论文

在模型README.md中引用 arxiv.org/abs/2608.29335 以从本页链接。

引用本文的数据集

0

无数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2608.29335 以从本页链接。

引用本文的Space

0

无Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2608.29335 以从本页链接。

收录本文的合集

1

相似文章

探索式建模:解锁第三个预训练轴与端到端生成

Hugging Face Daily Papers

本文介绍了探索式建模(Explorative Modeling),这是一种新的生成建模范式,通过探索模型生成与数据之间的候选匹配来分解训练循环。它确立了除参数和数据之外的第三个预训练轴,提高了图像、视频和语言领域的扩展效率,并以更少的推理步骤实现端到端生成建模。

GenRecon:结合生成先验的多视图3D场景重建

Hugging Face Daily Papers

GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。

GEAR:引导式端到端自回归图像合成

Hugging Face Daily Papers

GEAR提出了一种通过表示对齐共同训练向量量化分词器和自回归生成器的方法,实现端到端训练,在ImageNet gFID上相比强基线实现高达10倍的收敛速度提升。