PixRestore:通过像素扩散变换器实现统一图像恢复

Hugging Face Daily Papers 论文

摘要

PixRestore是一种无VAE的像素空间扩散变换器,用于统一图像恢复,通过流匹配和对抗性微调至单步生成器,实现高保真度和效率。

统一图像恢复(UIR)旨在使用单一模型从具有不同降质的低质量(LQ)图像中恢复高质量(HQ)内容。最近的大多数方法利用大型预训练的文本到图像(T2I)潜在扩散模型,以其强大的能力和生成先验。然而,潜在T2I模型中的变分自编码器(VAE)可能丢弃恢复敏感的细节,而开放式合成先验可能引入内容不一致的伪影。我们提出了PixRestore,一种无VAE的像素空间扩散变换器(DiT),用于UIR,其中扩散骨干完全从零开始训练,不依赖T2I预训练。PixRestore直接在分块化的像素上执行流匹配,保留细粒度细节,同时保持令牌序列的可处理性。为了适应不同的降质,PixRestore学习使用LQ--HQ DINO特征相似度来预测层特征的可靠性。来自更可靠层的特征被融合为密集条件,而较不可靠的层接受更强的HQ特征监督,以鼓励降质移除。我们在一个包含多样场景和降质的大型语料库上训练PixRestore,并进一步使用基于DINO的对抗性目标将其微调为单步生成器,以实现高效推理。在公共基准和真实世界测试集上的实验表明,仅使用约50M参数和单步推理,PixRestore在竞争UIR模型中实现了最佳的整体保真度、感知质量和对降质的鲁棒性,同时效率远高。更大的PixRestore变体可以进一步提升性能,展示了我们像素空间设计的可扩展性。代码和精选基准可以在https://github.com/csslc/PixRestore找到。
查看原文
查看缓存全文

缓存时间: 2026/08/19 11:57

论文页面 - PixRestore:基于像素扩散Transformer的统一图像修复

来源:https://huggingface.co/papers/2608.16793

摘要

PixRestore是一款紧凑型、无需VAE的像素空间扩散Transformer,完全从头训练,用于统一图像修复。该模型采用基于分块像素的流匹配、基于DINO的可靠性引导特征融合,并通过对抗性微调实现单步生成器,从而实现高效的高保真推理。

统一图像修复(https://huggingface.co/papers?q=Unified%20image%20restoration)旨在使用单一模型从具有不同退化的低质量图像中恢复高质量内容。大多数近期方法采用大型预训练文本到图像潜在扩散模型,因其强大的能力和生成先验。然而,潜在T2I模型中的变分自编码器可能会丢弃修复敏感细节,而开放式合成先验可能引入内容不一致的伪影。我们提出PixRestore,一种无需VAE的像素空间扩散Transformer,用于统一图像修复。其扩散主干网络完全从头训练,不依赖T2I预训练。PixRestore直接在分块像素上执行流匹配,在保持标记序列易于处理的同时保留细粒度细节。为适应不同退化类型,PixRestore学习通过LHQ-DINO特征相似性来预测层特征的可靠性。更可靠层的特征作为密集条件融合,而较不可靠层则接收更强的高质量特征监督以促进退化去除。我们在大规模多样场景和退化语料库上训练PixRestore,并进一步将其微调为单步生成器,使用基于DINO的对抗目标以实现高效推理。在公开基准测试和真实世界测试集上的实验表明,仅约5000万参数和单步推理,PixRestore在所有竞争的统一图像修复模型中实现了最佳的整体保真度、感知质量和对退化的鲁棒性,同时效率显著更高。更大的PixRestore变体可进一步提升性能,证明了我们像素空间设计的可扩展性。代码和精选基准可在https://github.com/csslc/PixRestore找到。

查看arXiv页面 (https://arxiv.org/abs/2608.16793)查看PDF (https://arxiv.org/pdf/2608.16793)GitHub26 (https://github.com/csslc/PixRestore)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.16793)

在您的智能助手中获取此论文:

hf papers read 2608\.16793

没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.16793以从此页面链接它。

引用本文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.16793以从此页面链接它。

引用本文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.16793以从此页面链接它。

包含本文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接它。

相似文章

PixWorld:在像素空间中统一3D场景生成与重建

Hugging Face Daily Papers

PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。

PointDiT: 像素空间扩散用于单目几何估计

Hugging Face Daily Papers

PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。

nVIDIA/PiD

Hugging Face Models Trending

NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。

PiD:基于像素扩散的快速高分辨率潜在解码

Hugging Face Daily Papers

PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。