PixSDS:潜空间SDS为何产生噪声像素

Hugging Face Daily Papers 论文

摘要

PixSDS 识别了潜空间分数蒸馏采样中由 VAE 引起的像素漂移,并提出了一种梯度修复方法,该方法解码潜空间 SDS 的前瞻步骤以指导像素空间优化,从而减少文本到 3D 生成中的伪影。

分数蒸馏采样(SDS)通过使用预训练的扩散先验优化渲染图像来实现文本到 3D 的生成,但潜空间 SDS 常常会产生结构化的颜色伪影和高频纹理噪声。我们发现了潜空间 SDS 的一种由 VAE 引起的像素漂移所导致的失败模式:优化后的图像可能沿着 VAE 编码器约束较弱的像素空间方向移动,因此其潜空间表示保持干净且语义上有意义,而图像本身却积累了可见的伪影。我们通过受控的 2D SDS 实验、仅 VAE 优化以及一个简化分析来支持这一诊断,该分析表明,当到像素的逆映射约束不足时,类似编码器的潜空间目标会放大图像空间中的噪声。基于这一观察,我们提出了 PixSDS,一种轻量级的、与 VAE 一致的梯度修复方法。PixSDS 解码潜空间 SDS 的前瞻步骤,并将解码后的图像用作像素空间优化的干净方向,从而减少在 VAE 不一致方向上的移动,而无需重新训练扩散模型、更改渲染器或替换 SDS 目标。在 2D 优化和文本到 3D 生成中的实验表明,PixSDS 在保留语义内容的同时大幅减少了结构化伪影。代码公开于 https://sevashasla.github.io/pixsds-webpage/。
查看原文
查看缓存全文

缓存时间: 2026/08/14 11:27

论文页面 - PixSDS:为什么 latent SDS 会产生噪声像素

来源:https://huggingface.co/papers/2608.12997

摘要

PixSDS 通过使用解码图像方向引导优化,修复了 latent SDS 中由 VAE 引起的像素漂移,从而减少了 text

相似文章

PiD:基于像素扩散的快速高分辨率潜在解码

Hugging Face Daily Papers

PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。

L2P:释放像素生成的潜在潜力

Hugging Face Daily Papers

L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。

nVIDIA/PiD

Hugging Face Models Trending

NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。