@theworldlabs: 今天我们将分享三篇新研究论文,每篇都探索了利用大规模生成模型和2D先验生成3D内容的新方法…

X AI KOLs Following 论文

摘要

World Labs 宣布了三篇新研究论文,专注于利用大规模生成模型和2D先验生成3D内容,由实习生 Hao Zhang、Bert Duisterhof 和 Ben Tunnels 主导。

今天我们将分享三篇新研究论文,每篇都探索了利用大规模生成模型和2D先验生成3D内容的新方法。 这些项目由我们出色的实习生 @HaoZhang623 @BDuisterhof @DrTunnels 主导。 [1/4] https://t.co/5KBSG1AuBv
查看原文
查看缓存全文

缓存时间: 2026/06/12 17:01

今天我们分享了三个新的研究论文,每个都探索了利用大规模生成模型和2D先验来生成3D内容的新方法。

这些项目由我们杰出的实习生 @HaoZhang623 @BDuisterhof @DrTunnels 主导。

[1/4]

World Tracing 能够从单张图像预测完整的3D结构。它为每个输入像素输出一组深度值,将世界层层剥离,并通过扩散模型进行预测。这种方法在保持对图像忠实度的同时,能够预测完整的3D结构(甚至包括被遮挡的表面)。

[2/4]

Modality Forcing 使文本到图像模型能够联合推理文本、图像和深度。这表明文本到图像是一种可扩展的3D推理预训练目标,并展示了如何将文本到RGBD、深度估计和深度到图像统一在同一个模型中。

[3/4]

Flex4DHuman 将单目视频提升为动态4D高斯。我们对一个视频扩散模型进行微调,生成同步的多视角视频,然后蒸馏为4D高斯。通过这种方法,可以将一个人跳舞的视频提升到4D,并合成到3D世界中。

相似文章

@zhiwen_fan_: DUSt3R 团队的论文

X AI KOLs Timeline

DUSt3R 团队的一篇论文提出了用于多视图图像 3D 场景生成的稀疏自回归建模方法,使用了体素对齐的 3D 潜空间与占用感知的掩码自回归 Transformer。