PiD:基于像素扩散的快速高分辨率潜在解码

Hugging Face Daily Papers 论文

摘要

PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。

大多数实际的高分辨率文本到图像系统,包括潜在扩散和自回归模型,都在紧凑的潜在空间中进行生成,然后由一个解码器将生成的潜在表示映射回像素。然而,潜在到像素的解码器是面向重建的,其优化目标是逆转编码器而非合成更多细节,并且在百万像素尺度下成本越来越高。这一缺点呼唤一种更具表现力和更高效的解码范式。受近期可扩展像素空间扩散进展的启发,我们提出了 PiD,一种像素扩散解码器,它将潜在解码重新定义为条件像素扩散,将解码和上采样统一为一个生成模块。通过直接在高分辨率像素空间中进行去噪,PiD 能以低延迟合成 4 倍甚至 8 倍放大的图像。对于潜在条件化,一个轻量级的 sigma 感知适配器将噪声污染的潜在表示注入像素扩散主干,使 PiD 能够解码部分去噪的潜在表示并提前终止潜在扩散过程。为了进一步提高效率,我们使用 DMD2 对模型进行蒸馏,将推理步骤减少到仅 4 步。PiD 适用于传统的 VAE 潜在表示以及近期基于 RAE 的模型所使用的语义潜在表示(例如 SigLIP、DINOv2)。在消费级 RTX 5090 上,PiD 在不到 1 秒内将 512×512 图像的潜在表示解码为 2048×2048 像素,峰值内存为 13 GB,在 GB200 GPU 上则快至 210 毫秒,比级联扩散超分辨率流水线快约 6 倍,且视觉保真度更高。
查看原文
查看缓存全文

缓存时间: 2026/05/25 02:35

Paper page - PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion

来源:https://huggingface.co/papers/2605.23902

摘要

PiD 引入了一种像素扩散解码器,将潜在解码重新构建为条件像素扩散,从而能够在减少计算需求的情况下,以高分辨率实现快速且高质量的图像合成。

大多数实用的高分辨率文本到图像系统,包括潜在扩散(https://huggingface.co/papers?q=latent%20diffusion)和自回归模型,都在紧凑的潜在空间中生成,然后由解码器将生成的潜在映射回像素。然而,这种潜在到像素的解码器是面向重建的,优化目标是逆解码编码器而非合成更多细节,并且在百万像素尺度上成本越来越高。这一缺陷呼唤一种更具表现力且更高效的解码范式。受近期可扩展像素空间扩散进展的启发,我们引入了 PiD,一种像素扩散(https://huggingface.co/papers?q=Pixel%20diffusion)解码器,它将潜在解码(https://huggingface.co/papers?q=latent%20decoding)重新构建为条件像素扩散(https://huggingface.co/papers?q=conditional%20pixel%20diffusion),将解码和上采样统一为单个生成模块。通过直接在高质量像素空间(https://huggingface.co/papers?q=pixel%20space)中降噪,PiD 能够合成放大 4 倍甚至 8 倍的图像,且延迟较低。对于潜在条件化,一个轻量级的 sigma 感知适配器(https://huggingface.co/papers?q=sigma-aware%20adapter)将噪声干扰的潜在注入像素扩散(https://huggingface.co/papers?q=pixel%20diffusion)主干网络,使得 PiD 能够解码部分降噪后的潜在,并提前终止潜在扩散(https://huggingface.co/papers?q=latent%20diffusion)过程。为了进一步提高效率,我们使用 DMD2 对模型进行了蒸馏,将推理步骤减少到仅 4 步。PiD 适用于传统的 VAE 潜在(https://huggingface.co/papers?q=VAE%20latents)以及语义潜在(https://huggingface.co/papers?q=semantic%20latents)(例如 SigLIP、DINOv2),这些被用于近期基于 RAE 的模型中。PiD 将 512×512 图像的潜在解码为 2048×2048 像素,在消费级 RTX 5090 上耗时不到 1 秒且峰值内存为 13 GB,在 GB200 GPU 上最快可达 210 毫秒,比基于级联扩散的超分辨率(https://huggingface.co/papers?q=super-resolution)管线快约 6 倍,同时视觉保真度更优。

查看 arXiv 页面 (https://arxiv.org/abs/2605.23902) 查看 PDF (https://arxiv.org/pdf/2605.23902) 项目页面 (https://research.nvidia.com/labs/sil/projects/pid/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.23902)

引用该论文的模型1

nvidia/PiD Image-to-Image • 更新于 19 分钟前 • 3 (https://huggingface.co/nvidia/PiD)

引用该论文的数据集0

没有数据集引用该论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.23902 以在此页显示链接。

引用该论文的 Space 0

没有 Space 引用该论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.23902 以在此页显示链接。

包含该论文的收藏0

没有收藏包含该论文

将该论文添加到收藏 (https://huggingface.co/new-collection) 以在此页显示链接。

相似文章

nVIDIA/PiD

Hugging Face Models Trending

NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。

并行解码蒸馏加速图像与视频生成

Hugging Face Daily Papers

并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。

L2P:释放像素生成的潜在潜力

Hugging Face Daily Papers

L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。