@zhiwen_fan_: DUSt3R 团队的论文
摘要
DUSt3R 团队的一篇论文提出了用于多视图图像 3D 场景生成的稀疏自回归建模方法,使用了体素对齐的 3D 潜空间与占用感知的掩码自回归 Transformer。
查看缓存全文
缓存时间: 2026/09/06 10:48
Dust3R 团队的论文
Zhenjun Zhao (@zhenjun_zhao): 从多视图图像生成场景的稀疏自回归建模
Thomas Lucas, Maxime Pietrantoni, @WeinzaepfelP, Wonjune Cho, @bardienus, @Vinc3nt_Leroy, @JeromeRevaud
tl;dr:体素对齐的 3D 隐空间 + 占用感知的掩码自回归 Transformer
相似文章
面向3D生成的原生紧凑结构潜变量
本文介绍了O-Voxel,一种用于3D生成建模的新型稀疏体素表示方法,能够高效处理复杂拓扑和外观,并训练了包含4B参数的大规模流匹配模型,实现了最先进的生成质量。
3D Masked Autoencoders是显微镜下体积和多模态细胞表示的鲁棒学习器
本文提出了用于体积显微镜数据的3D Masked Autoencoders,并展示了在下游单细胞任务中,3D建模优于2D最大投影和基于切片的变体,而通过与蛋白质语言模型的跨模态对齐进一步提升了性能。
超越像素:从视频先验到4D世界
本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。
@artemZholus:谢谢!在第二篇论文(https://arxiv.org/abs/2605.06388)中,我们采用了您(和RAE)的方案,效果不错。
本文系统地比较了基于重建和基于语义的潜在空间在机器人行动条件潜在扩散世界模型中的应用。研究发现,像V-JEPA 2.1这样的语义编码器在策略相关指标上通常优于重建编码器,从而主张将语义潜在空间作为机器人世界模型的更强基础。
@theworldlabs: 今天我们将分享三篇新研究论文,每篇都探索了利用大规模生成模型和2D先验生成3D内容的新方法…
World Labs 宣布了三篇新研究论文,专注于利用大规模生成模型和2D先验生成3D内容,由实习生 Hao Zhang、Bert Duisterhof 和 Ben Tunnels 主导。