PiD:基于像素扩散的快速高分辨率潜在解码
摘要
PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。
查看缓存全文
缓存时间: 2026/05/25 02:35
Paper page - PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
来源:https://huggingface.co/papers/2605.23902
摘要
PiD 引入了一种像素扩散解码器,将潜在解码重新构建为条件像素扩散,从而能够在减少计算需求的情况下,以高分辨率实现快速且高质量的图像合成。
大多数实用的高分辨率文本到图像系统,包括潜在扩散(https://huggingface.co/papers?q=latent%20diffusion)和自回归模型,都在紧凑的潜在空间中生成,然后由解码器将生成的潜在映射回像素。然而,这种潜在到像素的解码器是面向重建的,优化目标是逆解码编码器而非合成更多细节,并且在百万像素尺度上成本越来越高。这一缺陷呼唤一种更具表现力且更高效的解码范式。受近期可扩展像素空间扩散进展的启发,我们引入了 PiD,一种像素扩散(https://huggingface.co/papers?q=Pixel%20diffusion)解码器,它将潜在解码(https://huggingface.co/papers?q=latent%20decoding)重新构建为条件像素扩散(https://huggingface.co/papers?q=conditional%20pixel%20diffusion),将解码和上采样统一为单个生成模块。通过直接在高质量像素空间(https://huggingface.co/papers?q=pixel%20space)中降噪,PiD 能够合成放大 4 倍甚至 8 倍的图像,且延迟较低。对于潜在条件化,一个轻量级的 sigma 感知适配器(https://huggingface.co/papers?q=sigma-aware%20adapter)将噪声干扰的潜在注入像素扩散(https://huggingface.co/papers?q=pixel%20diffusion)主干网络,使得 PiD 能够解码部分降噪后的潜在,并提前终止潜在扩散(https://huggingface.co/papers?q=latent%20diffusion)过程。为了进一步提高效率,我们使用 DMD2 对模型进行了蒸馏,将推理步骤减少到仅 4 步。PiD 适用于传统的 VAE 潜在(https://huggingface.co/papers?q=VAE%20latents)以及语义潜在(https://huggingface.co/papers?q=semantic%20latents)(例如 SigLIP、DINOv2),这些被用于近期基于 RAE 的模型中。PiD 将 512×512 图像的潜在解码为 2048×2048 像素,在消费级 RTX 5090 上耗时不到 1 秒且峰值内存为 13 GB,在 GB200 GPU 上最快可达 210 毫秒,比基于级联扩散的超分辨率(https://huggingface.co/papers?q=super-resolution)管线快约 6 倍,同时视觉保真度更优。
查看 arXiv 页面 (https://arxiv.org/abs/2605.23902) 查看 PDF (https://arxiv.org/pdf/2605.23902) 项目页面 (https://research.nvidia.com/labs/sil/projects/pid/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.23902)
引用该论文的模型1
nvidia/PiD Image-to-Image • 更新于 19 分钟前 • 3 (https://huggingface.co/nvidia/PiD)
引用该论文的数据集0
没有数据集引用该论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.23902 以在此页显示链接。
引用该论文的 Space 0
没有 Space 引用该论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.23902 以在此页显示链接。
包含该论文的收藏0
没有收藏包含该论文
将该论文添加到收藏 (https://huggingface.co/new-collection) 以在此页显示链接。
相似文章
nVIDIA/PiD
NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。
@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...
NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。
@FeitengLi: NVIDIA Spatial Intelligence Lab 提出 PiD,重新设计了 latent 扩散模型里的解码环节。 目前主流文生图都在 latent 空间生成,再用 VAE decoder 映射回像素。这个 decoder 的…
NVIDIA Spatial Intelligence Lab 提出 PiD,将 latent 扩散模型的解码环节重新设计为条件像素扩散过程,统一解码与上采样,实现低延迟高分辨率解码。
并行解码蒸馏加速图像与视频生成
并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。
L2P:释放像素生成的潜在潜力
L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。