Image2Sim: 通过生成式神经模拟器实现具身导航规模化
摘要
Image2Sim是一个神经模拟框架,它能从RGB-D图像创建高保真交互环境,为具身导航智能体提供可扩展的训练。该框架生成了近20K场景和超过1000万训练样本,在基准测试上展现了显著改进,并实现了有效的真实世界零样本迁移。
查看缓存全文
缓存时间: 2026/07/09 07:54
论文页面 - Image2Sim:通过生成式神经模拟器实现可扩展的具身导航
来源:https://huggingface.co/papers/2607.05765
摘要
Image2Sim 通过解耦 3D 空间锚定与照片级真实感渲染技术,从 RGB-D 图像创建高保真交互环境,从而实现可扩展的具身导航训练。
具身导航(https://huggingface.co/papers?q=Embodied%20navigation)旨在构建能够理解多模态目标、在 3D 空间中推理,并在现实世界中可靠到达目标地点的智能体。然而,由于缺乏可扩展、高保真且物理上真实的交互环境(https://huggingface.co/papers?q=interactive%20environments),进展仍然受限。现实世界扫描数据集虽具有视觉真实感,但规模有限。相比之下,合成模拟器更易扩展,但往往存在较大的模拟到现实的差距(https://huggingface.co/papers?q=sim-to-real%20gap)。我们提出 Image2Sim,一个实时神经仿真框架(https://huggingface.co/papers?q=neural%20simulation%20framework),它从带有位姿的 RGB-D 图像序列(https://huggingface.co/papers?q=RGB-D%20image%20sequences)构建高质量的交互环境(https://huggingface.co/papers?q=interactive%20environments)。核心思想是将 3D 空间锚定与照片级真实感观测合成解耦。在场景构建方面,Image2Sim 使用前馈特征高斯模型(https://huggingface.co/papers?q=feed-forward%20feature%20Gaussian%20model),通过单次前向传播将带位姿的 RGB-D 观测提升为 3D 特征高斯表征(https://huggingface.co/papers?q=3D%20feature-Gaussian%20representation)。在渲染方面,我们提出几何感知单步像素流模型(https://huggingface.co/papers?q=Geometry-Aware%20One-Step%20Pixel%20Flow%20model),将稀疏且带噪声的高斯投影转换为高质量的全景 RGB-D 观测(https://huggingface.co/papers?q=panoramic%20RGB-D%20observations)。Image2Sim 还可作为全自动的具身数据引擎,大规模生成高保真观测、可执行动作以及多样化的导航指令。它将大量视频和图像转化为近 20K 个交互场景,并合成超过 1000 万个导航训练样本。完全在这些神经环境中训练的导航模型在主要基准测试上取得了显著提升,并能有效迁移到现实世界的零样本设置中。这些结果表明,可扩展的神经模拟可以作为大规模具身导航(https://huggingface.co/papers?q=embodied%20navigation)的实用训练基础。
查看 arXiv 页面(https://arxiv.org/abs/2607.05765)查看 PDF(https://arxiv.org/pdf/2607.05765)GitHub1(https://github.com/MrZihan/Image2Sim)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.05765)
在你的智能体中获取这篇论文:
hf papers read 2607\.05765
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.05765 即可从此页面链接。
引用本文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.05765 即可从此页面链接。
引用本文的 Space0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2607.05765 即可从此页面链接。
包含本文的收藏夹0
没有收藏夹包含此论文
将这篇论文添加到一个收藏夹(https://huggingface.co/new-collection)中即可从此页面链接。
相似文章
Niantic Spatial、Flexion 和 NVIDIA:弥合人形机器人的 Sim2Real 差距
Niantic Spatial、Flexion 和 NVIDIA 展示了基于数字孪生和强化学习的人形机器人 sim2real 流程,实现了从仿真到真实办公室导航的零样本迁移。
SimFoundry:模块化与自动化场景生成用于策略学习与评估
SimFoundry 是一个模块化系统,可从视频自动化真实到仿真场景构建,生成数字孪生体并保留功能属性的变体,用于零样本机器人策略训练,实现了向真实世界任务的强迁移和高仿真到真实性能预测。
行走于隐空间:基于神经场景表示的交互式世界探索
NeuWorld 是一个新的交互式视频生成系统,它利用紧凑的神经隐式场景表示以及结合扩散变换器的变换器VAE,实现轨迹条件渲染,达到长时一致性。
SimWorld Studio:利用进化型代码代理为具身智能体学习自动生成环境
SimWorld Studio 是一个开源平台,利用进化型代码代理自动生成并优化用于具身智能体学习的 3D 环境。它利用自我进化和协同进化机制创建自适应训练场景,显著提升了智能体的性能。
用想象力思考:基于世界模拟器的主动式视觉空间推理
本文提出了Astra,一个主动式空间推理框架,将经过强化学习训练的VLM策略与一个世界模拟器结合起来,生成新视角的观察结果,以改进视觉语言模型中的空间推理能力。