PixRestore:通过像素扩散变换器实现统一图像恢复
摘要
PixRestore是一种无VAE的像素空间扩散变换器,用于统一图像恢复,通过流匹配和对抗性微调至单步生成器,实现高保真度和效率。
查看缓存全文
缓存时间: 2026/08/19 11:57
论文页面 - PixRestore:基于像素扩散Transformer的统一图像修复
来源:https://huggingface.co/papers/2608.16793
摘要
PixRestore是一款紧凑型、无需VAE的像素空间扩散Transformer,完全从头训练,用于统一图像修复。该模型采用基于分块像素的流匹配、基于DINO的可靠性引导特征融合,并通过对抗性微调实现单步生成器,从而实现高效的高保真推理。
统一图像修复(https://huggingface.co/papers?q=Unified%20image%20restoration)旨在使用单一模型从具有不同退化的低质量图像中恢复高质量内容。大多数近期方法采用大型预训练文本到图像潜在扩散模型,因其强大的能力和生成先验。然而,潜在T2I模型中的变分自编码器可能会丢弃修复敏感细节,而开放式合成先验可能引入内容不一致的伪影。我们提出PixRestore,一种无需VAE的像素空间扩散Transformer,用于统一图像修复。其扩散主干网络完全从头训练,不依赖T2I预训练。PixRestore直接在分块像素上执行流匹配,在保持标记序列易于处理的同时保留细粒度细节。为适应不同退化类型,PixRestore学习通过LHQ-DINO特征相似性来预测层特征的可靠性。更可靠层的特征作为密集条件融合,而较不可靠层则接收更强的高质量特征监督以促进退化去除。我们在大规模多样场景和退化语料库上训练PixRestore,并进一步将其微调为单步生成器,使用基于DINO的对抗目标以实现高效推理。在公开基准测试和真实世界测试集上的实验表明,仅约5000万参数和单步推理,PixRestore在所有竞争的统一图像修复模型中实现了最佳的整体保真度、感知质量和对退化的鲁棒性,同时效率显著更高。更大的PixRestore变体可进一步提升性能,证明了我们像素空间设计的可扩展性。代码和精选基准可在https://github.com/csslc/PixRestore找到。
查看arXiv页面 (https://arxiv.org/abs/2608.16793)查看PDF (https://arxiv.org/pdf/2608.16793)GitHub26 (https://github.com/csslc/PixRestore)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.16793)
在您的智能助手中获取此论文:
hf papers read 2608\.16793
没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.16793以从此页面链接它。
引用本文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.16793以从此页面链接它。
引用本文的Space0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.16793以从此页面链接它。
包含本文的收藏夹0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接它。
相似文章
PixWorld:在像素空间中统一3D场景生成与重建
PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。
PointDiT: 像素空间扩散用于单目几何估计
PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。
@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...
NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。
nVIDIA/PiD
NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。
PiD:基于像素扩散的快速高分辨率潜在解码
PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。