nVIDIA/PiD
摘要
NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。
查看缓存全文
缓存时间: 2026/05/26 07:58
nvidia/PiD · Hugging Face
来源:https://huggingface.co/nvidia/PiD
https://huggingface.co/nvidia/PiD#pid–pixel-diffusion-decoderPiD — 像素扩散解码器
PiD 预告图
论文 (https://arxiv.org/abs/2605.23902),项目页面 (https://research.nvidia.com/labs/sil/projects/pid/)
Yifan Lu (https://yifanlu0227.github.io/),Qi Wu (https://wilsoncernwq.github.io/),Jay Zhangjie Wu (https://zhangjiewu.github.io/),Zian Wang (https://www.cs.toronto.edu/~zianwang/),Huan Ling (https://www.cs.toronto.edu/~linghuan/),Sanja Fidler (https://www.cs.utoronto.ca/~fidler/),Xuanchi Ren (https://xuanchiren.com/)
PiD 将潜在到像素的解码器重新构建为条件像素空间扩散模型,将解码和上采样统一为一个生成模块。它直接在高分辨率像素空间中进行去噪,并一次性生成超分辨率图像。此仓库托管已发布的解码器检查点,以及它们所依赖的编码器/解码器(“VAE”)权重。
此仓库中的所有 PiD_* 检查点均为 4 步蒸馏。非 PiD_* 条目(ae.safetensors,flux2_ae.safetensors,sd3_vae/,rae/,scale_rae/)是 PiD 所插入的对应编码器/解码器 VAE 权重——它们本身并非 PiD 检查点。
https://huggingface.co/nvidia/PiD#licenseterms-of-use许可/使用条款
该模型根据 NSCLv1 (https://huggingface.co/nvidia/PixelDiT-1300M-1024px/blob/main/LICENSE) 许可证发布。作品及任何衍生作品仅可用于非商业(研究或评估)用途。
https://huggingface.co/nvidia/PiD#deployment-geography部署地区:
全球
https://huggingface.co/nvidia/PiD#pid-checkpointsPiD 检查点
针对每个 diffusers 风格的主干,发布了两种变体:
2k— 在 2048px 上训练,用作 4× 解码器(512 LDM → 2048 px),或者用于 Scale-RAE 主干时作为 8× 解码器(256 → 2048)。2kto4k— 使用多分辨率数据分桶 2048→3840 以及 SD3 风格的动态移位训练;设计用于 1024 LDM → 4K(4096 px)解码。
两种检查点变体均支持多种宽高比。
路径主干(编码器侧)SR 因子变体checkpoints/PiD_res2k_sr4x_official_flux_distill_4stepFlux1-dev(16 通道 VAE)4×2kcheckpoints/PiD_res2k_sr4x_official_flux2_distill_4stepFlux2-dev(128 通道 BN VAE)4×2kcheckpoints/PiD_res2k_sr4x_official_sd3_distill_4stepSD3 medium(16 通道 VAE)4×2kcheckpoints/PiD_res2k_sr4x_official_dinov2_distill_4stepDINOv2-B + RAE ViT-XL(768 通道)4×2kcheckpoints/PiD_res2k_sr8x_official_siglip_distill_4stepSigLIP-2 So400M + Scale-RAE ViT-XL(1152)8×2kcheckpoints/PiD_res2kto4k_sr4x_official_flux_distill_4stepFlux1-dev(16 通道 VAE)4×2kto4kcheckpoints/PiD_res2kto4k_sr4x_official_flux2_distill_4stepFlux2-dev(128 通道 BN VAE)4×2kto4kcheckpoints/PiD_res2kto4k_sr4x_official_sd3_distill_4stepSD3 medium(16 通道 VAE)4×2kto4k
Z-Image 共享 Flux1 的 VAE,因此其推理路径重用 flux 检查点(包括 2k 和 2kto4k)——无需单独提供 zimage 检查点。
每个目录包含单个文件 model_ema_bf16.pth,即转换为 bfloat16 的 EMA 权重——推理脚本默认加载的格式。
https://huggingface.co/nvidia/PiD#vae–encoder-weightsVAE / 编码器权重
这些是 PiD 配对的每个主干的编码器(以及适用时的原始解码器)权重。将它们托管在此处,以便一次下载即可获得端到端所需的一切。
路径描述checkpoints/ae.safetensorsFlux1-dev / Z-Image 16 通道 VAE(编码器 + 原始 Flux 解码器)。checkpoints/flux2_ae.safetensorsFlux2-dev 128 通道 BN VAE。checkpoints/sd3_vae/SD3 medium 16 通道 VAE(diffusers 格式)。checkpoints/rae/DINOv2-B 图像编码器 + RAE ViT-XL 解码器 + ImageNet-512 归一化统计信息。checkpoints/scale_rae/SigLIP-2 So400M 编码器 + Scale-RAE ViT-XL 解码器 + 解码器配置。
https://huggingface.co/nvidia/PiD#usage用法
解码器检查点由 PiD 代码库 (https://github.com/nv-tlabs/pid) 中的推理脚本加载。确切的 (backbone, ckpt_type) → path 映射的唯一真实来源是 pid/_src/inference/checkpoint_registry.py (https://github.com/nv-tlabs/PiD/blob/main/pid/_src/inference/checkpoint_registry.py) ——克隆仓库,将其指向此快照,演示程序会自动选取正确的文件:
``
将 checkpoints/ 目录树拉取到仓库根目录(跳过此 README 和
预告图,以免覆盖源仓库中的文件)。
hf download nvidia/PiD –local-dir . –include “checkpoints/*”
然后运行任意演示,例如:
PYTHONPATH=. python -m pid._src.inference.from_ldm_flux
–prompt “一只逼真的猫”
–ldm_inference_steps 28 –save_xt_steps 22 24 26
–output_dir ./results/demo
–cfg_scale 1 –pid_inference_steps 4 –scale 4
``
在 4K 解码时,通过 --pid_ckpt_type 2kto4k 选择 2kto4k 变体。
https://huggingface.co/nvidia/PiD#citation引用
@article{lu2026pid, title={PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion}, author={Lu, Yifan and Wu, Qi and Wu, Jay Zhangjie and Wang, Zian and Ling, Huan and Fidler, Sanja and Ren, Xuanchi}, journal={arXiv preprint arXiv:2605.23902}, year={2026} }
相似文章
PiD:基于像素扩散的快速高分辨率潜在解码
PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。
@FeitengLi: NVIDIA Spatial Intelligence Lab 提出 PiD,重新设计了 latent 扩散模型里的解码环节。 目前主流文生图都在 latent 空间生成,再用 VAE decoder 映射回像素。这个 decoder 的…
NVIDIA Spatial Intelligence Lab 提出 PiD,将 latent 扩散模型的解码环节重新设计为条件像素扩散过程,统一解码与上采样,实现低延迟高分辨率解码。
@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...
NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。
视频生成的并行解码(10分钟阅读)
NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。
来自NVIDIA的Nemotron-Labs-Diffusion
NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。