架构基础模型至物理世界智能体,推动长时程导航的前沿
摘要
NavMCP是一个代理脚手架框架,集成视觉语言模型与导航基础模型,以实现持久的长时程物理世界探索,并在基准测试和真实机器人任务中取得最先进的成果。
查看缓存全文
缓存时间: 2026/09/01 11:51
论文页面 - 将基础模型搭建为物理世界代理以拓展长时域导航边界
来源: https://huggingface.co/papers/2608.30396
摘要
NavMCP 通过结构化协作通道将视觉-语言推理与导航执行相结合,无需重新训练即可实现持久的长时域具身探索。
长时域物理世界代理必须在基于可靠闭环行为进行决策的同时,对远距离目标进行推理。当前的基础模型将这些能力分离:视觉-语言模型(VLM)(https://huggingface.co/papers?q=vision-language%20models)用于推断缺失信息和调整高层计划,但在重复的导航定位中仍显脆弱且低效;而导航基础模型(NFM)(https://huggingface.co/papers?q=navigation%20foundation%20models)虽然能稳健执行语义目标,但作为有界片段运行,缺乏持久的任务级推理能力。我们提出了 NavMCP(https://huggingface.co/papers?q=NavMCP),一种代理框架,将 VLM 推理代理与 NFM 执行器耦合,用于长时域探索。VLM 负责决定需要何种证据、在何处搜索以及何时停止,而 NFM 则将每个语义子目标落实为闭环导航(https://huggingface.co/papers?q=closed-loop%20navigation)。三个通道构建了它们的协作结构:意图通道将证据需求转化为导航调用,观察通道将执行过程转化为基于源轨迹的证据,记忆通道则累积跨调用的发现、负面证据和未解决目标。这种设计无需重新训练任一模型,即可将孤立的导航执行过程转化为持久的具身交互。在具身问答任务(https://huggingface.co/papers?q=Embodied%20Question%20Answering)中,NavMCP(https://huggingface.co/papers?q=NavMCP)在 HM-EQA、MT-HM3D 和 EXPRESS-Bench 上取得了最先进成果。在匹配的代理和执行器骨干网络下,其在 HM-EQA 上比基于片段的接口高出 14.9 个百分点。在 Unitree Go2 机器人上,NavMCP(https://huggingface.co/papers?q=NavMCP)达到 78.3% 的成功率,其与最强基线的差距随着任务时域的增加从 10 个百分点扩大到 45 个百分点。这些结果证明了将互补的基础模型搭建为长时域物理世界代理的潜力。
查看 arXiv 页面 (https://arxiv.org/abs/2608.30396)查看 PDF (https://arxiv.org/pdf/2608.30396)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30396)
引用本文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.30396 以从此页面链接。
引用本文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.30396 以从此页面链接。
引用本文的空间0
无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.30396 以从此页面链接。
包含本文的收藏夹0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。
MCP-Cosmos:基于世界模型增强智能体在 MCP 环境中执行复杂任务
本文介绍了 MCP-Cosmos,这是一个将生成式世界模型集成到 Model Context Protocol (MCP) 生态系统中的框架,旨在通过潜在空间中的预测性模拟来增强智能体的规划与执行能力。
Qwen-RobotNav 技术报告:为自主导航系统设计的可扩展导航模型
Qwen-RobotNav 是一种可扩展的导航模型,通过参数化接口实现动态任务模式和观测参数,在多任务训练和零样本泛化到真实机器人领域达到了最先进水平。
Embodied-Navigator:指点、思考、记忆与对齐以实现高效导航
TAMP-Nav 是一个统一框架,通过将视觉语言模型与二维视觉提示对齐、使用压缩记忆的选择性推理以及策略优化来增强具身导航,实现了最先进的性能,并具有高运行时和样本效率。
LightNav-0:激发VLM空间智能以实现通用具身导航
LightNav-0 是一个紧凑的通用导航模型,它利用预训练视觉-语言模型的空间智能,实现了跨多样任务和机器人形态的具身导航最先进性能。