Image2Sim: 通过生成式神经模拟器实现具身导航规模化

Hugging Face Daily Papers 论文

摘要

Image2Sim是一个神经模拟框架,它能从RGB-D图像创建高保真交互环境,为具身导航智能体提供可扩展的训练。该框架生成了近20K场景和超过1000万训练样本,在基准测试上展现了显著改进,并实现了有效的真实世界零样本迁移。

具身导航旨在构建能够解释多模态目标、在3D空间中推理并在现实世界中可靠到达目标位置的智能体。然而,由于缺乏可扩展、高保真且物理驱动的交互环境,进展仍受到制约。尽管真实世界扫描数据集提供了视觉真实性,但其规模有限。相比之下,合成模拟器更容易扩展,但通常存在较大的模拟到真实差距。我们提出了Image2Sim,一个实时神经模拟框架,能够从带有位姿的RGB-D图像序列构建高质量交互环境。核心思想是将3D空间锚定与逼真观察合成解耦。在场景构建中,Image2Sim使用前馈特征高斯模型,将带有位姿的RGB-D观测一次性提升为3D特征高斯表示。在渲染方面,我们提出了几何感知单步像素流模型,将稀疏且嘈杂的高斯投影转换为高质量全景RGB-D观测。Image2Sim还充当全自动的具身数据引擎,能够大规模生成高保真观测、可执行动作和多样化的导航指令。它将大量视频和图像转换为近20K个交互场景,并合成超过1000万个导航训练样本。完全在这些神经环境中训练的导航模型在主要基准上取得了显著改进,并有效迁移到真实世界的零样本设置。这些结果表明,可扩展的神经模拟可以作为大规模具身导航的实用训练基础。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:54

论文页面 - Image2Sim:通过生成式神经模拟器实现可扩展的具身导航

来源:https://huggingface.co/papers/2607.05765

摘要

Image2Sim 通过解耦 3D 空间锚定与照片级真实感渲染技术,从 RGB-D 图像创建高保真交互环境,从而实现可扩展的具身导航训练。

具身导航(https://huggingface.co/papers?q=Embodied%20navigation)旨在构建能够理解多模态目标、在 3D 空间中推理,并在现实世界中可靠到达目标地点的智能体。然而,由于缺乏可扩展、高保真且物理上真实的交互环境(https://huggingface.co/papers?q=interactive%20environments),进展仍然受限。现实世界扫描数据集虽具有视觉真实感,但规模有限。相比之下,合成模拟器更易扩展,但往往存在较大的模拟到现实的差距(https://huggingface.co/papers?q=sim-to-real%20gap)。我们提出 Image2Sim,一个实时神经仿真框架(https://huggingface.co/papers?q=neural%20simulation%20framework),它从带有位姿的 RGB-D 图像序列(https://huggingface.co/papers?q=RGB-D%20image%20sequences)构建高质量的交互环境(https://huggingface.co/papers?q=interactive%20environments)。核心思想是将 3D 空间锚定与照片级真实感观测合成解耦。在场景构建方面,Image2Sim 使用前馈特征高斯模型(https://huggingface.co/papers?q=feed-forward%20feature%20Gaussian%20model),通过单次前向传播将带位姿的 RGB-D 观测提升为 3D 特征高斯表征(https://huggingface.co/papers?q=3D%20feature-Gaussian%20representation)。在渲染方面,我们提出几何感知单步像素流模型(https://huggingface.co/papers?q=Geometry-Aware%20One-Step%20Pixel%20Flow%20model),将稀疏且带噪声的高斯投影转换为高质量的全景 RGB-D 观测(https://huggingface.co/papers?q=panoramic%20RGB-D%20observations)。Image2Sim 还可作为全自动的具身数据引擎,大规模生成高保真观测、可执行动作以及多样化的导航指令。它将大量视频和图像转化为近 20K 个交互场景,并合成超过 1000 万个导航训练样本。完全在这些神经环境中训练的导航模型在主要基准测试上取得了显著提升,并能有效迁移到现实世界的零样本设置中。这些结果表明,可扩展的神经模拟可以作为大规模具身导航(https://huggingface.co/papers?q=embodied%20navigation)的实用训练基础。

查看 arXiv 页面(https://arxiv.org/abs/2607.05765)查看 PDF(https://arxiv.org/pdf/2607.05765)GitHub1(https://github.com/MrZihan/Image2Sim)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.05765)

在你的智能体中获取这篇论文:

hf papers read 2607\.05765

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.05765 即可从此页面链接。

引用本文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.05765 即可从此页面链接。

引用本文的 Space0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.05765 即可从此页面链接。

包含本文的收藏夹0

没有收藏夹包含此论文

将这篇论文添加到一个收藏夹(https://huggingface.co/new-collection)中即可从此页面链接。

相似文章