标签
SceneMosaic结合了学习的图像先验与视觉语言代理,高效生成多样且物理有效的室内场景,相较于现有方法实现了24倍加速和物理有效性的提升。
MIT CSAIL与丰田研究所推出SceneSmith,该系统利用GPT-5.2驱动的AI代理自动生成丰富的3D虚拟场景,为机器人训练提供多样化的模拟环境,无需大量真实世界测试。
小米机器人推出U0,这是一个380亿参数的多模态自回归模型,用于统一具身合成,将具身生成视为图像和视频生成的扩展。它在多个具身任务上取得了最先进的结果,超越了GPT-Image-2.0,并提高了真实世界操作的成功率。
MAGIC是一个系统,利用大语言模型从单个自然语言提示生成相互连接且可导航的多场景游戏世界,解决了跨场景一致性、场景内可导航性及过渡评估问题。在包含100个多场景案例的基准测试中,该系统实现了高精确率和召回率。
SynCity 3000 提出了一种框架,用于生成大规模、全局一致的3D场景,该框架通过将图像到3D生成器适配为卷积算子,并在来自新数据引擎的合成场景数据上进行微调来实现。
SimFoundry 是一个模块化系统,可从视频自动化真实到仿真场景构建,生成数字孪生体并保留功能属性的变体,用于零样本机器人策略训练,实现了向真实世界任务的强迁移和高仿真到真实性能预测。
FLAT 是一种方法,能够直接从压缩的视频扩散潜变量中,通过单次前向传递解码出显式的三角片元,从而提升几何精度,同时支持快速光栅化和基于物理的交互。
FLAT提出了一种方法,直接从视频扩散潜在表示中解码显式三角形溅射,用于几何精确的3D场景生成。它引入了以射线为中心的旋转参数化和乘积窗口函数来改善梯度流,实现了比先前前馈方法更好的几何精度,同时支持实时渲染。
Sat3DGen采用几何优先的方法,从单张卫星图像生成街景级3D场景,通过新颖的约束条件和训练策略,提高了几何精度和照片级真实感。该方法在VIGOR-OOD基准测试上相比先前工作有显著改进。
HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。
MetaSpatial是一个强化学习框架,旨在增强视觉语言模型(VLMs)的3D空间推理能力,能够生成连贯且物理上合理的3D场景,无需硬编码优化。