使用球面潜编码器的高效图像合成

Hugging Face Daily Papers 论文

摘要

本文提出 Sphere Latent Encoder,一种高效的少步图像生成框架,该框架完全在球面潜空间中进行去噪,能够在 ImageNet-1K 上以显著降低的计算成本生成高质量 256×256 图像,并提升 FID 分数。

少步图像生成已取得快速进展,一致性模型和基于平均流的方法显著减少了采样步数。尽管推理成本低,但这些方法常面临训练不稳定和可扩展性有限的问题。Sphere Encoder 是一种近期提出的替代方案,只需几步就能生成高质量图像;然而,它在推理过程中需要在像素空间和潜空间之间反复切换,同时在单一架构内联合优化重建与生成。这种设计导致计算效率低下,并引发重建与生成之间的目标冲突。为解决这些限制,我们将框架解耦为固定的预训练图像编码器和在球面潜空间中独立训练的潜空间去噪模型。我们的方法消除了训练和推理中重复的像素空间操作,提高了效率,并使重建与生成能够独立专精。在 Animal-Faces、Oxford-Flowers 和 ImageNet-1K 数据集上,我们的方法在生成质量和推理速度上均显著优于 Sphere Encoder,同时与强大的少步和多步基线取得了有竞争力的结果。
查看原文
查看缓存全文

缓存时间: 2026/05/18 14:26

论文页面 — 高效图像合成:球面潜在编码器

来源:https://huggingface.co/papers/2605.15592 🚀球面潜在编码器:基于球面潜在去噪的高效图像合成

本文提出球面潜在编码器(Sphere Latent Encoder) ,一种高效的少步图像生成框架,该框架在球面潜在空间中完全执行去噪。与原始球面编码器中反复在像素空间和潜在空间之间切换不同,本方法使用固定的预训练表征自编码器,并单独训练一个潜在去噪模型。这样将重建与生成解耦,使采样效率大幅提升。

核心思路: 使用预训练的基于RAE/DINOv2的编码器作为强大的图像分词器,将含噪潜在向量投影到超球面上,并直接在那个潜在空间中训练一个 Transformer 去噪器。在推理时,模型仅需几步即可优化潜在向量,并在最后调用一次解码器。

为何重要: 该方法保留了球面编码器的简洁性,同时消除了其主要瓶颈:编码器-解码器之间的反复切换。这带来了大幅降低的计算成本,并在少步场景下取得更优的样本质量。

亮点:

  • 仅需少量采样步骤即可生成高质量的256×256图像。
  • 避免反复进行像素-潜在转换,降低了推理成本。
  • 在Animal-Faces、Oxford-Flowers和ImageNet-1K上均优于球面编码器。
  • 在ImageNet-1K上取得强结果:在相同的4步CFG设置下,FID从4.02提升至2.25;采用6步时可达2.11
  • 消融实验表明,球面投影、一致性损失、噪声分布以及表征自编码器的选择对性能均至关重要。

一个特别有趣的启示是:强语义潜在表征加上球面潜在建模,可以成为标准扩散/流采样的实用替代方案,尤其是在低NFE生成为首要任务时。

局限也很明确:当前实验聚焦于类别条件生成、依赖于强大的预训练表征自编码器,且高质量的一步生成仍然具有挑战性。总体而言,这是高效潜在空间生成建模的一个有前景的方向。

相似文章

L2P:释放像素生成的潜在潜力

Hugging Face Daily Papers

L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。

SP^3: 用于即插即用恢复的球面先验

Hugging Face Daily Papers

本文介绍SP³,一种使用球面编码器先验的即插即用图像恢复方法,在各项任务中实现与零样本扩散先验相当的感知质量,同时速度快3-630倍。