Robostral Navigate
摘要
Robostral Navigate 是一个仅使用单目 RGB 图像进行机器人导航的 80 亿参数视觉语言模型,在 R2R-CE 和 RxR-CE 基准测试中分别以 77.4% 和 75.1% 的成功率达到了最先进水平。
查看缓存全文
缓存时间: 2026/07/24 05:06
论文页面 - Robostral Navigate
来源:https://huggingface.co/papers/2607.20785 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
大规模部署导航系统需要一种配方:最小化传感器假设、跨机器人本体泛化、高效训练。然而,当今最先进的系统依赖深度传感器、多摄像头装置或预建地图,限制了它们支持的硬件并增加了部署成本。我们提出 Robostral Navigate,一个围绕这一可扩展性目标构建的 8B 视觉语言模型。该模型仅消耗单目 RGB 图像流——这是机器人平台上最普遍的传感器——并通过在当前摄像头视图中的下一个目标位置来预测航点。完全在图像空间而非机器人特定坐标中操作,使得策略自然地鲁棒于相机内参和场景尺度的变化,从而无需重新标定即可在轮式、腿式和空中机器人上部署。我们生成了涵盖 35 万个模拟场景的 240 万条轨迹,以减少对真实世界数据采集的依赖并轻松扩展。我们还引入了一种前缀缓存训练配方,将整个回合打包成单个训练序列,将训练 token 减少了 22 倍,并将训练时间从数月缩短到数天。基于树的注意力掩码可防止对先前真实动作的条件依赖,鼓励基于视觉的预测,并利用强化学习进一步提高探索与恢复能力。在 Room-to-Room 和 Room-Across-Room 连续环境(R2R-CE 和 RxR-CE)基准上,Robostral Navigate 取得了新的最先进成果。在 R2R-CE 上,它实现了 77.4% 的成功率,超越最佳单目方法 10.5 个百分点,并且尽管仅使用单个 RGB 摄像头,仍比最强的深度或多摄像头系统高出 5.3 个百分点。在 RxR-CE 上,它达到了 75.1% 的成功率,超越了所有单目基线。
查看 arXiv 页面 (https://arxiv.org/abs/2607.20785)查看 PDF (https://arxiv.org/pdf/2607.20785)项目页面 (https://mistral.ai/news/robostral-navigate/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20785)
在您的代理中获取此论文:
hf papers read 2607\.20785
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.20785 即可从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.20785 即可从本页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.20785 即可从本页面链接。
包含此论文的合集0
没有合集包含此论文
将此论文添加到合集中 (https://huggingface.co/new-collection) 即可从本页面链接。
相似文章
Robostral Navigate: 单摄像头AI导航(5分钟阅读)
Mistral AI发布了Robostral Navigate,这是一个8B模型,使机器人仅使用单个RGB摄像头就能在复杂环境中导航,在R2R-CE基准测试中取得了最先进的结果,并超越了多传感器方法。
Mistral 发布了其首个仅靠一个RGB相机、无需激光雷达的导航机器人模型
Mistral 发布了其首个机器人模型,该模型仅需一个RGB相机即可实现导航,无需激光雷达。
ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。
Qwen-RobotNav 技术报告:为自主导航系统设计的可扩展导航模型
Qwen-RobotNav 是一种可扩展的导航模型,通过参数化接口实现动态任务模式和观测参数,在多任务训练和零样本泛化到真实机器人领域达到了最先进水平。
RRS-10K:面向罕见遥感图像解读的多任务视觉-语言模型基准
RRS-10K是一个用于评估视觉-语言模型在罕见遥感图像解读方面的基准数据集,包含超过10,000张军事相关图像和多种任务格式。对52个模型的评估显示其零样本性能中等,且在视觉定位和复杂推理方面存在明显不足。