nVIDIA/PiD

Hugging Face Models Trending 模型

摘要

NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。

任务:image-to-image 标签:pytorch, diffusers, safetensors, 超分辨率, 扩散, pixel-diffusion-decoder, vae-decoder, image-to-image, arxiv:2605.23902, base_model:Tongyi-MAI/Z-Image, base_model:finetune:Tongyi-MAI/Z-Image, region:us
查看原文
查看缓存全文

缓存时间: 2026/05/26 07:58

nvidia/PiD · Hugging Face

来源:https://huggingface.co/nvidia/PiD

https://huggingface.co/nvidia/PiD#pid–pixel-diffusion-decoderPiD — 像素扩散解码器

PiD 预告图

论文 (https://arxiv.org/abs/2605.23902),项目页面 (https://research.nvidia.com/labs/sil/projects/pid/)

Yifan Lu (https://yifanlu0227.github.io/),Qi Wu (https://wilsoncernwq.github.io/),Jay Zhangjie Wu (https://zhangjiewu.github.io/),Zian Wang (https://www.cs.toronto.edu/~zianwang/),Huan Ling (https://www.cs.toronto.edu/~linghuan/),Sanja Fidler (https://www.cs.utoronto.ca/~fidler/),Xuanchi Ren (https://xuanchiren.com/)

PiD 将潜在到像素的解码器重新构建为条件像素空间扩散模型,将解码和上采样统一为一个生成模块。它直接在高分辨率像素空间中进行去噪,并一次性生成超分辨率图像。此仓库托管已发布的解码器检查点,以及它们所依赖的编码器/解码器(“VAE”)权重。

此仓库中的所有 PiD_* 检查点均为 4 步蒸馏。非 PiD_* 条目(ae.safetensorsflux2_ae.safetensorssd3_vae/rae/scale_rae/)是 PiD 所插入的对应编码器/解码器 VAE 权重——它们本身并非 PiD 检查点。

https://huggingface.co/nvidia/PiD#licenseterms-of-use许可/使用条款

该模型根据 NSCLv1 (https://huggingface.co/nvidia/PixelDiT-1300M-1024px/blob/main/LICENSE) 许可证发布。作品及任何衍生作品仅可用于非商业(研究或评估)用途。

https://huggingface.co/nvidia/PiD#deployment-geography部署地区:

全球

https://huggingface.co/nvidia/PiD#pid-checkpointsPiD 检查点

针对每个 diffusers 风格的主干,发布了两种变体:

  • 2k — 在 2048px 上训练,用作 4× 解码器(512 LDM → 2048 px),或者用于 Scale-RAE 主干时作为 8× 解码器(256 → 2048)。
  • 2kto4k — 使用多分辨率数据分桶 2048→3840 以及 SD3 风格的动态移位训练;设计用于 1024 LDM → 4K(4096 px)解码。

两种检查点变体均支持多种宽高比。

路径主干(编码器侧)SR 因子变体checkpoints/PiD_res2k_sr4x_official_flux_distill_4stepFlux1-dev(16 通道 VAE)4×2kcheckpoints/PiD_res2k_sr4x_official_flux2_distill_4stepFlux2-dev(128 通道 BN VAE)4×2kcheckpoints/PiD_res2k_sr4x_official_sd3_distill_4stepSD3 medium(16 通道 VAE)4×2kcheckpoints/PiD_res2k_sr4x_official_dinov2_distill_4stepDINOv2-B + RAE ViT-XL(768 通道)4×2kcheckpoints/PiD_res2k_sr8x_official_siglip_distill_4stepSigLIP-2 So400M + Scale-RAE ViT-XL(1152)8×2kcheckpoints/PiD_res2kto4k_sr4x_official_flux_distill_4stepFlux1-dev(16 通道 VAE)4×2kto4kcheckpoints/PiD_res2kto4k_sr4x_official_flux2_distill_4stepFlux2-dev(128 通道 BN VAE)4×2kto4kcheckpoints/PiD_res2kto4k_sr4x_official_sd3_distill_4stepSD3 medium(16 通道 VAE)4×2kto4k

Z-Image 共享 Flux1 的 VAE,因此其推理路径重用 flux 检查点(包括 2k2kto4k)——无需单独提供 zimage 检查点。

每个目录包含单个文件 model_ema_bf16.pth,即转换为 bfloat16 的 EMA 权重——推理脚本默认加载的格式。

https://huggingface.co/nvidia/PiD#vae–encoder-weightsVAE / 编码器权重

这些是 PiD 配对的每个主干的编码器(以及适用时的原始解码器)权重。将它们托管在此处,以便一次下载即可获得端到端所需的一切。

路径描述checkpoints/ae.safetensorsFlux1-dev / Z-Image 16 通道 VAE(编码器 + 原始 Flux 解码器)。checkpoints/flux2_ae.safetensorsFlux2-dev 128 通道 BN VAE。checkpoints/sd3_vae/SD3 medium 16 通道 VAE(diffusers 格式)。checkpoints/rae/DINOv2-B 图像编码器 + RAE ViT-XL 解码器 + ImageNet-512 归一化统计信息。checkpoints/scale_rae/SigLIP-2 So400M 编码器 + Scale-RAE ViT-XL 解码器 + 解码器配置。

https://huggingface.co/nvidia/PiD#usage用法

解码器检查点由 PiD 代码库 (https://github.com/nv-tlabs/pid) 中的推理脚本加载。确切的 (backbone, ckpt_type) → path 映射的唯一真实来源是 pid/_src/inference/checkpoint_registry.py (https://github.com/nv-tlabs/PiD/blob/main/pid/_src/inference/checkpoint_registry.py) ——克隆仓库,将其指向此快照,演示程序会自动选取正确的文件:

``

将 checkpoints/ 目录树拉取到仓库根目录(跳过此 README 和

预告图,以免覆盖源仓库中的文件)。

hf download nvidia/PiD –local-dir . –include “checkpoints/*”

然后运行任意演示,例如:

PYTHONPATH=. python -m pid._src.inference.from_ldm_flux
–prompt “一只逼真的猫”
–ldm_inference_steps 28 –save_xt_steps 22 24 26
–output_dir ./results/demo
–cfg_scale 1 –pid_inference_steps 4 –scale 4 ``

在 4K 解码时,通过 --pid_ckpt_type 2kto4k 选择 2kto4k 变体。

https://huggingface.co/nvidia/PiD#citation引用

@article{lu2026pid, title={PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion}, author={Lu, Yifan and Wu, Qi and Wu, Jay Zhangjie and Wang, Zian and Ling, Huan and Fidler, Sanja and Ren, Xuanchi}, journal={arXiv preprint arXiv:2605.23902}, year={2026} }

相似文章

PiD:基于像素扩散的快速高分辨率潜在解码

Hugging Face Daily Papers

PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。

视频生成的并行解码(10分钟阅读)

TLDR AI

NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。

来自NVIDIA的Nemotron-Labs-Diffusion

Reddit r/LocalLLaMA

NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。