Robostral Navigate

Hugging Face Daily Papers 论文

摘要

Robostral Navigate 是一个仅使用单目 RGB 图像进行机器人导航的 80 亿参数视觉语言模型,在 R2R-CE 和 RxR-CE 基准测试中分别以 77.4% 和 75.1% 的成功率达到了最先进水平。

大规模部署导航系统需要一种能够最小化传感器假设、跨机器人形态泛化且高效训练的方案。然而,当今最先进的系统依赖于深度传感器、多相机支架或预建地图,这不仅限制了所支持的硬件,还增加了部署成本。我们提出了 Robostral Navigate,这是一个基于上述可扩展性目标构建的 80 亿参数视觉语言模型。该模型仅接收单目 RGB 图像流——这是机器人平台中最普遍的传感器——并通过在当前相机视角中指向下一个目标位置来预测航点。纯图像空间(而非机器人专用坐标)的操作使策略能够自然抵抗相机内参和场景尺度的变化,从而无需重新校准即可部署在轮式、腿式和空中机器人上。我们生成了 240 万个轨迹,覆盖 35 万个模拟场景,以减少对真实世界数据收集的依赖并轻松扩展。我们进一步引入了一种前缀缓存训练方案,将整个片段打包到单个训练序列中,将训练 token 减少 22 倍,并将训练时间从数月缩短至数天。基于树的注意力掩码防止模型依赖先前真实动作进行条件建模,从而鼓励基于视觉的动作预测,并使用强化学习进一步提升探索和恢复能力。在连续环境中的 Room-to-Room 和 Room-Across-Room(R2R-CE 和 RxR-CE)基准测试中,Robostral Navigate 树立了新的最先进水平。在 R2R-CE 上,它实现了 77.4% 的成功率,超越了最佳单目方法 10.5 个百分点,以及最强的深度或多相机系统 5.3 个百分点(尽管仅使用单个 RGB 相机)。在 RxR-CE 上,它达到了 75.1% 的成功率,超越了所有单目基线。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - Robostral Navigate

来源:https://huggingface.co/papers/2607.20785 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

大规模部署导航系统需要一种配方:最小化传感器假设、跨机器人本体泛化、高效训练。然而,当今最先进的系统依赖深度传感器、多摄像头装置或预建地图,限制了它们支持的硬件并增加了部署成本。我们提出 Robostral Navigate,一个围绕这一可扩展性目标构建的 8B 视觉语言模型。该模型仅消耗单目 RGB 图像流——这是机器人平台上最普遍的传感器——并通过在当前摄像头视图中的下一个目标位置来预测航点。完全在图像空间而非机器人特定坐标中操作,使得策略自然地鲁棒于相机内参和场景尺度的变化,从而无需重新标定即可在轮式、腿式和空中机器人上部署。我们生成了涵盖 35 万个模拟场景的 240 万条轨迹,以减少对真实世界数据采集的依赖并轻松扩展。我们还引入了一种前缀缓存训练配方,将整个回合打包成单个训练序列,将训练 token 减少了 22 倍,并将训练时间从数月缩短到数天。基于树的注意力掩码可防止对先前真实动作的条件依赖,鼓励基于视觉的预测,并利用强化学习进一步提高探索与恢复能力。在 Room-to-Room 和 Room-Across-Room 连续环境(R2R-CE 和 RxR-CE)基准上,Robostral Navigate 取得了新的最先进成果。在 R2R-CE 上,它实现了 77.4% 的成功率,超越最佳单目方法 10.5 个百分点,并且尽管仅使用单个 RGB 摄像头,仍比最强的深度或多摄像头系统高出 5.3 个百分点。在 RxR-CE 上,它达到了 75.1% 的成功率,超越了所有单目基线。

查看 arXiv 页面 (https://arxiv.org/abs/2607.20785)查看 PDF (https://arxiv.org/pdf/2607.20785)项目页面 (https://mistral.ai/news/robostral-navigate/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20785)

在您的代理中获取此论文:

hf papers read 2607\.20785

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.20785 即可从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.20785 即可从本页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.20785 即可从本页面链接。

包含此论文的合集0

没有合集包含此论文

将此论文添加到合集中 (https://huggingface.co/new-collection) 即可从本页面链接。

相似文章

ABot-N1:迈向通用视觉语言导航基础模型

Hugging Face Daily Papers

ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。