扩散友好型潜在流形的关键要素是什么?用于潜在扩散的先验对齐自编码器
摘要
本文介绍了先验对齐自编码器(PAE),这是一种用于构建扩散友好型潜在流形的新型方法,在实现最先进图像生成质量的同时,使训练收敛速度加快 13 倍。
查看缓存全文
缓存时间: 2026/05/11 07:20
论文页面 - 扩散友好的潜在流形:什么最重要?面向潜在扩散的先验对齐自编码器
来源: https://huggingface.co/papers/2605.07915 🚀 PAE:具有 13 倍更快训练速度的最先进潜在扩散模型!
pae_teaser (https://cdn-uploads.huggingface.co/production/uploads/66b1b8c6d3407c95f56b7ed2/QU_c1-QiDIjv48KO4DxfA.png)
我们很高兴地介绍 Prior-Aligned AutoEncoder (PAE),这是一种构建扩散友好型潜在流形的全新范式!通过显式塑造潜在空间的几何结构,PAE 打破了重建保真度与生成可学习性之间的权衡。
🔥 亮点:
最先进质量:在 ImageNet 256×256 上实现了 1.03 的新 SOTA gFID 得分,超越了 RAE 和 FAE 等强基线模型。
前所未有的效率:使下游 DiT 训练的收敛速度提高 13 倍。相比先前方法需要 800+ 个 epoch,PAE 仅需 80 个 epoch 即可达到竞争性性能。
扩散友好型流形:显式优化了三个关键几何属性:空间结构一致性、局部流形连续性和全局语义组织,确保潜在空间平滑且语义一致。
稳健的少步采样:得益于改进的局部连续性,仅需 45 步去噪即可保持高质量生成 (gFID 1.05)。
可用模型:基于 DINOv2、SigLIP2、DINOv3 和 MAE 骨干的预训练分词器!代码与模型已在 HuggingFace 和 ModelScope 上完全开源。
相似文章
@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...
NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。
L2P:释放像素生成的潜在潜力
L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。
分子潜在扩散中的暗区平滑化
本文介绍了TopVAE,一种拓扑优化的变分自编码器,通过让解码器内化结构和化学约束来减少分子潜在扩散中的“暗区”,从而显著提高分子生成质量。
不要重新训练,只需对齐:通过表征对齐将自回归语言模型适配为扩散语言模型
本文介绍了 Repr-Align,一种通过表征对齐将自回归语言模型适配为扩散语言模型的方法,无需从头重新训练表征即可实现高达 4 倍的训练加速。
PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。