World Tracing:超越可见的生成式像素对齐几何
摘要
World Tracing 引入了一种生成式像素对齐几何表示,它在预测与观测像素对齐的3D点的同时,补全被遮挡的表面。它使用一个经过像素空间流匹配训练的扩散Transformer,在物体、场景和动态基准测试中的可见表面重建和完整几何生成上取得了强劲性能。
查看缓存全文
缓存时间: 2026/06/15 16:59
论文页面 - World Tracing: 超越可见区域的生成式像素对齐几何
来源:https://huggingface.co/papers/2606.13652
摘要
World Tracing 提出了一种生成式像素对齐几何表示,能够预测与输入像素对齐的3D点,同时补全隐藏表面,采用在像素空间流匹配上训练的扩散Transformer。
图像到3D的方法常常在保真度和完整性之间权衡:深度估计器 (https://huggingface.co/papers?q=depth%20estimators) 锚定于输入像素但止步于可见表面,而图像到3D模型 (https://huggingface.co/papers?q=image-to-3D%20models) 则生成完整形状但往往与输入错位。我们引入了World Tracing (https://huggingface.co/papers?q=World%20Tracing) ——一种生成式像素对齐几何表示,既能预测与观测像素对齐的3D点,又能补全可见表面之外的几何。对于每个输入像素,World Tracing (https://huggingface.co/papers?q=World%20Tracing) 预测一个有序的相机空间3D点 (https://huggingface.co/papers?q=camera-space%203D%20points) 堆叠,其中第一层表示可见表面,后续层表示从前到后与遮挡表面的交点。我们通过一个世界追踪扩散Transformer (https://huggingface.co/papers?q=diffusion%20transformer) ——WT-DiT (https://huggingface.co/papers?q=WT-DiT) 来实例化该表示,它将多个几何层视为通过分解和全局注意力 (https://huggingface.co/papers?q=global%20attention) 耦合的独立去噪令牌 (https://huggingface.co/papers?q=denoising%20tokens)。WT-DiT (https://huggingface.co/papers?q=WT-DiT) 采用像素空间流匹配 (https://huggingface.co/papers?q=pixel-space%20flow%20matching) 和一种混合噪声调度进行训练,该调度平衡了可见表面重建与遮挡几何生成。World Tracing (https://huggingface.co/papers?q=World%20Tracing) 在物体、场景和动态基准测试中,在可见表面重建和完整几何生成方面均表现出色,超越了深度预测器和图像到3D生成器。它还保持了2D到3D对应关系 (https://huggingface.co/papers?q=2D-to-3D%20correspondence),支持文本驱动的3D场景编辑 (https://huggingface.co/papers?q=text-driven%203D%20scene%20editing)、几何条件下的新视角视频合成 (https://huggingface.co/papers?q=novel-view%20video%20synthesis) 以及与纹理网格生成器 (https://huggingface.co/papers?q=textured-mesh%20generators) 的无训练集成。
查看arXiv页面 (https://arxiv.org/abs/2606.13652)查看PDF (https://arxiv.org/pdf/2606.13652)项目页面 (https://haoz19.github.io/world-tracing-page/)GitHub186 (https://github.com/haoz19/world-tracing)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.13652)
在你的智能体中获取此论文:
hf papers read 2606.13652
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型4
haoz19/object-model-6layer 图像到3D•4天前更新•8 (https://huggingface.co/haoz19/object-model-6layer)
haoz19/scene-model-6layer 图像到3D•4天前更新•5 (https://huggingface.co/haoz19/scene-model-6layer)
haoz19/scene-model-6layer-840 图像到3D•1天前更新•4 (https://huggingface.co/haoz19/scene-model-6layer-840)
haoz19/dynamic-model-16frame 图像到3D•4天前更新•3 (https://huggingface.co/haoz19/dynamic-model-16frame)
引用本论文的数据集0
暂无链接本论文的数据集
在数据集的README.md中引用 arxiv.org/abs/2606.13652 以从此页面链接。
引用本论文的Space1
包含本论文的收藏1
相似文章
PixWorld:在像素空间中统一3D场景生成与重建
PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。
Pixal3D:基于图像的像素对齐3D生成
Pixal3D提出了一种像素对齐的3D生成方法,通过反向投影条件化建立直接的像素到3D对应关系,从而提高保真度,解决了规范空间生成中的问题。
PointDiT: 像素空间扩散用于单目几何估计
PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。
SurGe:点地图中改进的表面几何
SurGe引入了一个Neighborhood Attention Decoder和一种重新制定的尺度不变梯度匹配损失,以改进前馈式3D重建中的局部表面几何精度,特别是对于薄结构。它在零样本单目几何基准测试中取得了最先进的平均排名,并在局部点图和法线度量方面表现更好。
World Machine:面向时间序列的生成式世界建模
World Machine 提出了一种基于 Transformer 的生成式世界建模架构,用于时间序列分析。该架构通过潜在状态自适应地处理不同长度的上下文,解决了传统 Transformer 的二次内存成本问题。在合成数据集上的实验验证了该方法的可行性,并显示出相比传统 Transformer 的改进。