@theworldlabs: 今天我们将分享三篇新研究论文,每篇都探索了利用大规模生成模型和2D先验生成3D内容的新方法…
摘要
World Labs 宣布了三篇新研究论文,专注于利用大规模生成模型和2D先验生成3D内容,由实习生 Hao Zhang、Bert Duisterhof 和 Ben Tunnels 主导。
查看缓存全文
缓存时间: 2026/06/12 17:01
今天我们分享了三个新的研究论文,每个都探索了利用大规模生成模型和2D先验来生成3D内容的新方法。
这些项目由我们杰出的实习生 @HaoZhang623 @BDuisterhof @DrTunnels 主导。
[1/4]
World Tracing 能够从单张图像预测完整的3D结构。它为每个输入像素输出一组深度值,将世界层层剥离,并通过扩散模型进行预测。这种方法在保持对图像忠实度的同时,能够预测完整的3D结构(甚至包括被遮挡的表面)。
[2/4]
Modality Forcing 使文本到图像模型能够联合推理文本、图像和深度。这表明文本到图像是一种可扩展的3D推理预训练目标,并展示了如何将文本到RGBD、深度估计和深度到图像统一在同一个模型中。
[3/4]
Flex4DHuman 将单目视频提升为动态4D高斯。我们对一个视频扩散模型进行微调,生成同步的多视角视频,然后蒸馏为4D高斯。通过这种方法,可以将一个人跳舞的视频提升到4D,并合成到3D世界中。
相似文章
@theworldlabs: OpenArt 现在可以将单张图像转化为一个持久的3D世界,创作者可以精确控制。广角镜头…
OpenArt 现在允许用户将单张图像转化为持久的3D世界,并实现精确的相机控制,该功能由 World Labs API 提供支持。
@zhiwen_fan_: DUSt3R 团队的论文
DUSt3R 团队的一篇论文提出了用于多视图图像 3D 场景生成的稀疏自回归建模方法,使用了体素对齐的 3D 潜空间与占用感知的掩码自回归 Transformer。
@vincieye: 从几张照片生成完整的3D场景通常意味着凭空想象盲点或内存爆炸。SPAR3S s…
SPAR3S是一种稀疏自回归生成模型,能高效地从稀疏多视角图像生成完整的3D场景,无需3D真值数据,使用体素对齐的潜在空间和可微分的3D Gaussian Splatting。
@svpino: 这个世界生成模型太不可思议了。我上传了一张图片(左边的那张),它就创建了一个完整的3…
一位用户展示了Hyper3D WorldGen,这是一个AI模型,能从单张图片生成完整、可编辑的3D场景,突出其令人印象深刻的功能。
@FinanceYF5: World Labs 发布了 Atlas:这是全球首个多模态世界模型,能够生成图像和视频…
World Labs 发布了 Atlas,这是全球首个多模态世界模型,能够生成具有像素级摄像头控制的图像和视频,并将其重建为 3D,实现世界建模和时空模拟。