World Labs 推出 Atlas,一个模拟空间、时间和物理交互的全息世界模型

Reddit r/artificial 模型

摘要

World Labs 宣布了 Atlas,一个全息世界模型,原生处理文本、图像、视频和三维几何数据,并在共享的空间上下文中进行,以提升人工智能在模拟空间、时间和物理交互方面的能力。

World Labs 刚刚宣布了 Atlas,一个全息世界模型,旨在通过原生处理文本、图像、视频和三维几何数据,在单一架构内推进空间智能。Atlas 不将视频视为孤立的二维像素网格,而是使用自回归扩散变换器,将每个输入基于共享的三维“空间上下文”。时空模拟功能展示了这如何将人工智能从基本生成推向真正的物理模拟:民主化的“子弹时间”:通过处理仅来自3到5部消费级移动电话的镜头,Atlas 能够重建动态事件,冻结时间,并模拟不可能角度下的流畅摄像机轨迹,无需专用捕捉设备。可扩展的真实到模拟:除了扫描静态几何体,Atlas 还模拟动态机器人导航和操作。当代理移动时,模型会合成其机载传感器沿该路径捕获的确切RGB和度量深度流。交互式动力学:随意的真实世界视频可以转化为模拟,模拟刚体、铰接体和可变形物体的物理,允许研究人员改变物体放置、光照和摄像机路径以生成合成训练数据。原生三维表示:它直接输出点云和三维高斯溅射,以及新颖的视频视图,在标准基准测试如DTU、ETH3D和ScanNet上优于专用三维重建基线。
查看原文

相似文章

Atlas by World Labs

Product Hunt

Atlas by World Labs 是一款全能世界模型,支持从文本、图像、视频和3D输入生成摄像机控制的高清视频,实现场景重建与时空模拟,专为机器人设计,现已开放早期访问。