使用球面潜编码器的高效图像合成
摘要
本文提出 Sphere Latent Encoder,一种高效的少步图像生成框架,该框架完全在球面潜空间中进行去噪,能够在 ImageNet-1K 上以显著降低的计算成本生成高质量 256×256 图像,并提升 FID 分数。
查看缓存全文
缓存时间: 2026/05/18 14:26
论文页面 — 高效图像合成:球面潜在编码器
来源:https://huggingface.co/papers/2605.15592 🚀球面潜在编码器:基于球面潜在去噪的高效图像合成
本文提出球面潜在编码器(Sphere Latent Encoder) ,一种高效的少步图像生成框架,该框架在球面潜在空间中完全执行去噪。与原始球面编码器中反复在像素空间和潜在空间之间切换不同,本方法使用固定的预训练表征自编码器,并单独训练一个潜在去噪模型。这样将重建与生成解耦,使采样效率大幅提升。
核心思路: 使用预训练的基于RAE/DINOv2的编码器作为强大的图像分词器,将含噪潜在向量投影到超球面上,并直接在那个潜在空间中训练一个 Transformer 去噪器。在推理时,模型仅需几步即可优化潜在向量,并在最后调用一次解码器。
为何重要: 该方法保留了球面编码器的简洁性,同时消除了其主要瓶颈:编码器-解码器之间的反复切换。这带来了大幅降低的计算成本,并在少步场景下取得更优的样本质量。
亮点:
- 仅需少量采样步骤即可生成高质量的256×256图像。
- 避免反复进行像素-潜在转换,降低了推理成本。
- 在Animal-Faces、Oxford-Flowers和ImageNet-1K上均优于球面编码器。
- 在ImageNet-1K上取得强结果:在相同的4步CFG设置下,FID从4.02提升至2.25;采用6步时可达2.11。
- 消融实验表明,球面投影、一致性损失、噪声分布以及表征自编码器的选择对性能均至关重要。
一个特别有趣的启示是:强语义潜在表征加上球面潜在建模,可以成为标准扩散/流采样的实用替代方案,尤其是在低NFE生成为首要任务时。
局限也很明确:当前实验聚焦于类别条件生成、依赖于强大的预训练表征自编码器,且高质量的一步生成仍然具有挑战性。总体而言,这是高效潜在空间生成建模的一个有前景的方向。
相似文章
面向图像生成的球形流匹配中的潜在几何对齐
本文提出对齐潜在几何以实现球形流匹配,将潜在变量投影到固定半径的球面上,并使用球形线性插值来提升图像生成质量,在类条件ImageNet上持续改进FID。
L2P:释放像素生成的潜在潜力
L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。
SP^3: 用于即插即用恢复的球面先验
本文介绍SP³,一种使用球面编码器先验的即插即用图像恢复方法,在各项任务中实现与零样本扩散先验相当的感知质量,同时速度快3-630倍。
扩散友好型潜在流形的关键要素是什么?用于潜在扩散的先验对齐自编码器
本文介绍了先验对齐自编码器(PAE),这是一种用于构建扩散友好型潜在流形的新型方法,在实现最先进图像生成质量的同时,使训练收敛速度加快 13 倍。
@FeitengLi: NVIDIA Spatial Intelligence Lab 提出 PiD,重新设计了 latent 扩散模型里的解码环节。 目前主流文生图都在 latent 空间生成,再用 VAE decoder 映射回像素。这个 decoder 的…
NVIDIA Spatial Intelligence Lab 提出 PiD,将 latent 扩散模型的解码环节重新设计为条件像素扩散过程,统一解码与上采样,实现低延迟高分辨率解码。