PointDiT: 像素空间扩散用于单目几何估计
摘要
PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。
查看缓存全文
缓存时间: 2026/07/08 06:48
论文页面 - PointDiT:用于单目几何估计的像素空间扩散
来源:https://huggingface.co/papers/2607.02515
摘要
一种极简的像素空间扩散变压器,采用普通的 ViT 架构,直接处理以 DINOv3 图像标记为条件的3D点图块,在保持简单性和对模糊区域的鲁棒性的同时,超越了复杂的基于潜变量的模型。
当前最先进的单图像3D重建方法往往依赖复杂的混合架构(https://huggingface.co/papers?q=hybrid+architectures)和损失函数(https://huggingface.co/papers?q=loss+functions),或者将几何信息压缩到潜变量空间中,以利用预训练的潜变量扩散模型(https://huggingface.co/papers?q=latent+diffusion+models)。在这项工作中,我们证明了这样的架构开销和复杂的损失公式并非必要。我们引入了一种极简的像素空间(https://huggingface.co/papers?q=pixel-space)扩散变压器(https://huggingface.co/papers?q=Diffusion+Transformer),它基于普通的 ViT(https://huggingface.co/papers?q=ViT),直接对原始3D点图块(https://huggingface.co/papers?q=3D+point+map+patches)进行操作,并以来自预训练 DINOv3(https://huggingface.co/papers?q=DINOv3)的图像标记为条件。与现有的潜变量扩散方法不同,我们从头开始训练扩散主干,消除了对点图分词器的需求。尽管方法简单,我们的方法超越了复杂的基于潜变量的扩散模型,同时比混合替代方案简单得多。值得注意的是,它生成了更清晰的几何结构(https://huggingface.co/papers?q=geometric+structure),并且在高度模糊的区域(如透明物体(https://huggingface.co/papers?q=transparent+objects))具有更强的鲁棒性。
查看 arXiv 页面(https://arxiv.org/abs/2607.02515)查看 PDF(https://arxiv.org/pdf/2607.02515)项目页面(https://haofeixu.github.io/pointdit/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.02515)
在您的 agent 中获取此论文:
hf papers read 2607\.02515
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型引用此论文
在模型的 README.md 中引用 arxiv.org/abs/2607.02515 以从该页面链接。
引用此论文的数据集0
没有数据集引用此论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.02515 以从该页面链接。
引用此论文的 Space0
没有 Space 引用此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.02515 以从该页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从该页面链接。
相似文章
TrackCraft3R: 改造视频扩散变换器用于密集3D追踪
TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。
像素空间文本到图像扩散模型的训练实证研究
本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。
PiD:基于像素扩散的快速高分辨率潜在解码
PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。
PixWorld:在像素空间中统一3D场景生成与重建
PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。
PixRestore:通过像素扩散变换器实现统一图像恢复
PixRestore是一种无VAE的像素空间扩散变换器,用于统一图像恢复,通过流匹配和对抗性微调至单步生成器,实现高保真度和效率。