架构基础模型至物理世界智能体,推动长时程导航的前沿

Hugging Face Daily Papers 论文

摘要

NavMCP是一个代理脚手架框架,集成视觉语言模型与导航基础模型,以实现持久的长时程物理世界探索,并在基准测试和真实机器人任务中取得最先进的成果。

长时程物理世界智能体必须对远距离目标进行推理,同时将决策基于可靠的闭环行为。当今的基础模型将这些能力分割:视觉语言模型 (VLM) 推断缺失信息并适应高层计划,但在重复导航定位中仍脆弱且低效;而导航基础模型 (NFM) 稳健地执行语义目标,但作为有界事件运作,没有持久的任务级推理。我们引入NavMCP,一个代理脚手架框架,将VLM推理智能体与NFM执行器耦合用于长时程探索。VLM决定寻求何种证据、搜索何处以及何时停止,而NFM将每个语义子目标融入闭环导航。三个通道构建了他们的协作:意图将证据需求转化为导航调用,观察将展开的轨迹转化为基于源的轨迹证据,记忆跨调用累积发现、负面证据和未解决目标。这种设计将孤立的导航展开转化为持久的具身交互,无需重新训练任一模型。在具身问答任务中,NavMCP在HM-EQA、MT-HM3D和EXPRESS-Bench上取得了最先进的成果。在匹配的智能体和执行器骨干下,它在HM-EQA上比一个episodic接口高出14.9个百分点。在Unitree Go2上,NavMCP达到78.3%的成功率,随着任务时程的增加,其相对于最强基线的差距从10点增长到45点。这些结果展示了将互补基础模型架构成长时程物理世界智能体的潜力。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:51

论文页面 - 将基础模型搭建为物理世界代理以拓展长时域导航边界

来源: https://huggingface.co/papers/2608.30396

摘要

NavMCP 通过结构化协作通道将视觉-语言推理与导航执行相结合,无需重新训练即可实现持久的长时域具身探索。

长时域物理世界代理必须在基于可靠闭环行为进行决策的同时,对远距离目标进行推理。当前的基础模型将这些能力分离:视觉-语言模型(VLM)(https://huggingface.co/papers?q=vision-language%20models)用于推断缺失信息和调整高层计划,但在重复的导航定位中仍显脆弱且低效;而导航基础模型(NFM)(https://huggingface.co/papers?q=navigation%20foundation%20models)虽然能稳健执行语义目标,但作为有界片段运行,缺乏持久的任务级推理能力。我们提出了 NavMCP(https://huggingface.co/papers?q=NavMCP),一种代理框架,将 VLM 推理代理与 NFM 执行器耦合,用于长时域探索。VLM 负责决定需要何种证据、在何处搜索以及何时停止,而 NFM 则将每个语义子目标落实为闭环导航(https://huggingface.co/papers?q=closed-loop%20navigation)。三个通道构建了它们的协作结构:意图通道将证据需求转化为导航调用,观察通道将执行过程转化为基于源轨迹的证据,记忆通道则累积跨调用的发现、负面证据和未解决目标。这种设计无需重新训练任一模型,即可将孤立的导航执行过程转化为持久的具身交互。在具身问答任务(https://huggingface.co/papers?q=Embodied%20Question%20Answering)中,NavMCP(https://huggingface.co/papers?q=NavMCP)在 HM-EQA、MT-HM3D 和 EXPRESS-Bench 上取得了最先进成果。在匹配的代理和执行器骨干网络下,其在 HM-EQA 上比基于片段的接口高出 14.9 个百分点。在 Unitree Go2 机器人上,NavMCP(https://huggingface.co/papers?q=NavMCP)达到 78.3% 的成功率,其与最强基线的差距随着任务时域的增加从 10 个百分点扩大到 45 个百分点。这些结果证明了将互补的基础模型搭建为长时域物理世界代理的潜力。

查看 arXiv 页面 (https://arxiv.org/abs/2608.30396)查看 PDF (https://arxiv.org/pdf/2608.30396)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30396)

引用本文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.30396 以从此页面链接。

引用本文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.30396 以从此页面链接。

引用本文的空间0

无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2608.30396 以从此页面链接。

包含本文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

ABot-N1:迈向通用视觉语言导航基础模型

Hugging Face Daily Papers

ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。