ABot-N1:迈向通用视觉语言导航基础模型
摘要
ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。
查看缓存全文
缓存时间: 2026/07/14 04:13
论文页面 - ABot-N1:迈向通用视觉语言导航基础模型
来源:https://huggingface.co/papers/2607.10383 发表于 7 月 11 日
#2 每日论文 (https://huggingface.co/papers/date/2026-07-14) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
视觉语言导航基础模型旨在统一深度推理以实现具身空间决策,同时具备广泛的多功能性以应对多样化的具身任务。当前方法通常通过将观测直接映射到动作的单一策略来实现这种整合,但常常遭受协同漂移以及长尾语义处理不佳的问题。此外,这些黑盒映射缺乏可解释性,阻碍了通用性、鲁棒性和透明性的同时实现。我们提出了 ABot-N1,这是迈向通用视觉语言导航基础模型的一步,通过采用基于双视觉-语言信号引导的快慢架构,将认知与解耦从控制中分离出来。具体而言,一个慢速视觉-语言推理器执行显式的思维链推理,同时生成一个像素目标。这组紧凑的图像空间锚点作为多种任务的通用接口,包括点目标、物体目标、兴趣点目标、指令跟随和人员跟随。随后,一个快速动作专家利用文本线索和像素引导在原生控制频率下生成连续航点。通过像素级锚点配以显式语言轨迹来桥接高层意图与低层控制,我们的方法确保了在仿真和真实世界基准测试中实现鲁棒、通用且可解释的导航。ABot-N1 建立了新的最先进记录,特别是在城市级导航中取得了巨大提升:兴趣点到达率提升 35.0%(达到 77.3%),在复杂的室内和室外场景中分别实现了 95.4%/92.9% 的成功率(SR)。它在物体到达、人员跟随和指令跟随任务中也保持了卓越的鲁棒性。为了推动城市级导航领域的发展,新的点目标/兴趣点目标基准已作为开源发布。
查看 arXiv 页面 (https://arxiv.org/abs/2607.10383) 查看 PDF (https://arxiv.org/pdf/2607.10383) 项目页面 (https://amap-cvlab.github.io/ABot-Navigation/ABot-N1/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10383)
引用本论文的模型 0
没有模型关联本论文
请在模型 README.md 中引用 arxiv.org/abs/2607.10383,以便从此页面链接。
引用本论文的数据集 0
没有数据集关联本论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.10383,以便从此页面链接。
引用本论文的 Space 0
没有 Space 关联本论文
请在 Space README.md 中引用 arxiv.org/abs/2607.10383,以便从此页面链接。
包含本论文的收藏集 0
没有收藏集包含本论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。
相似文章
LightNav-0:激发VLM空间智能以实现通用具身导航
LightNav-0 是一个紧凑的通用导航模型,它利用预训练视觉-语言模型的空间智能,实现了跨多样任务和机器人形态的具身导航最先进性能。
架构基础模型至物理世界智能体,推动长时程导航的前沿
NavMCP是一个代理脚手架框架,集成视觉语言模型与导航基础模型,以实现持久的长时程物理世界探索,并在基准测试和真实机器人任务中取得最先进的成果。
Embodied-Navigator:指点、思考、记忆与对齐以实现高效导航
TAMP-Nav 是一个统一框架,通过将视觉语言模型与二维视觉提示对齐、使用压缩记忆的选择性推理以及策略优化来增强具身导航,实现了最先进的性能,并具有高运行时和样本效率。
ABot-M0.5: 统一移动与操作的世界动作模型
ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。
PlatonicNav:用柏拉图拓扑地图揭示导航中的语义对应
PlatonicNav 提出了一种免训练的具体化导航框架,该框架仅使用视觉语义地图和盲匹配来锚定语言目标,无需显式的跨模态训练即可实现跨任务和跨形态的泛化。