扩散友好型潜在流形的关键要素是什么?用于潜在扩散的先验对齐自编码器

Hugging Face Daily Papers 论文

摘要

本文介绍了先验对齐自编码器(PAE),这是一种用于构建扩散友好型潜在流形的新型方法,在实现最先进图像生成质量的同时,使训练收敛速度加快 13 倍。

分词器是潜在扩散模型的关键组件,因为它们定义了扩散模型运行的潜在空间。然而,现有的分词器主要旨在提高重建保真度或继承预训练表示,这导致真正有利于生成建模的潜在空间特性尚不明确。在本文中,我们从潜在流形组织的角度研究了这一问题。通过构建受控的分词器变体,我们确定了扩散友好型潜在流形的三个关键属性:相干的空间结构、局部流形连续性和全局流形语义。我们发现,这些属性与下游生成质量的一致性高于重建保真度。基于这一发现,我们提出了先验对齐自编码器(PAE),它明确地塑造潜在流形,而不是让扩散友好型流形间接地从重建或继承中产生。具体而言,PAE 利用从 VFM 推导出的精细化先验和基于扰动的正则化,将空间结构、局部连续性和全局语义转化为明确的训练目标。在 ImageNet 256x256 数据集上,PAE 在训练效率和生成质量方面均优于现有的分词器,在相同的训练设置下达到了与 RAE 相当的性能,且收敛速度最多快 13 倍,并取得了 1.03 的创纪录 gFID。这些结果强调了为潜在扩散模型组织潜在流形的重要性。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:20

论文页面 - 扩散友好的潜在流形:什么最重要?面向潜在扩散的先验对齐自编码器

来源: https://huggingface.co/papers/2605.07915 🚀 PAE:具有 13 倍更快训练速度的最先进潜在扩散模型!

pae_teaser (https://cdn-uploads.huggingface.co/production/uploads/66b1b8c6d3407c95f56b7ed2/QU_c1-QiDIjv48KO4DxfA.png)

我们很高兴地介绍 Prior-Aligned AutoEncoder (PAE),这是一种构建扩散友好型潜在流形的全新范式!通过显式塑造潜在空间的几何结构,PAE 打破了重建保真度与生成可学习性之间的权衡。

🔥 亮点:

最先进质量:在 ImageNet 256×256 上实现了 1.03 的新 SOTA gFID 得分,超越了 RAE 和 FAE 等强基线模型。

前所未有的效率:使下游 DiT 训练的收敛速度提高 13 倍。相比先前方法需要 800+ 个 epoch,PAE 仅需 80 个 epoch 即可达到竞争性性能。

扩散友好型流形:显式优化了三个关键几何属性:空间结构一致性、局部流形连续性和全局语义组织,确保潜在空间平滑且语义一致。

稳健的少步采样:得益于改进的局部连续性,仅需 45 步去噪即可保持高质量生成 (gFID 1.05)。

可用模型:基于 DINOv2、SigLIP2、DINOv3 和 MAE 骨干的预训练分词器!代码与模型已在 HuggingFace 和 ModelScope 上完全开源。

相似文章

L2P:释放像素生成的潜在潜力

Hugging Face Daily Papers

L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。

分子潜在扩散中的暗区平滑化

arXiv cs.LG

本文介绍了TopVAE,一种拓扑优化的变分自编码器,通过让解码器内化结构和化学约束来减少分子潜在扩散中的“暗区”,从而显著提高分子生成质量。

PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力

arXiv cs.AI

PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。