ABot-N1:迈向通用视觉语言导航基础模型

Hugging Face Daily Papers 论文

摘要

ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。

视觉语言导航基础模型旨在将深度推理统一起来,以做出基于空间位置的有根据的决策,并具备广泛的通用性以应对多样化的具身任务。当前的方法通常通过将观测直接映射到动作的单一策略来实现这种集成,但它们常常遭受坐标漂移和对长尾语义处理不佳的问题。此外,这些黑箱映射缺乏可解释性,阻碍了通用性、鲁棒性和透明性的同时实现。我们提出了 ABot-N1,这是迈向通用视觉语言导航基础模型的一步,它通过采用由双重视觉语言信号引导的慢-快架构,将认知与控制解耦,从而解决了这些挑战。具体来说,一个慢速视觉语言推理器执行显式的思维链推理,同时生成像素目标。这组紧凑的图像空间锚点作为通用接口,适用于多种任务,包括点目标、物体目标、兴趣点目标、指令跟随和人物跟随。随后,一个快速动作专家利用文本线索和像素引导,以原生控制频率生成连续航点。通过像素级锚点与显式语言痕迹的配对,桥接高层意图和低层控制,我们的方法在仿真和真实世界基准测试中确保了稳健、可泛化且可解释的导航。ABot-N1 建立了新的最先进记录,特别是在城市场景导航中取得了巨大提升:将兴趣点到达率提高了 35.0%(达到 77.3%),并在复杂的室内和室外场景中分别实现了 95.4% 和 92.9% 的成功率。它还在物体到达、人物跟随和指令跟随任务中保持卓越的鲁棒性。为了推动城市场景导航领域的发展,我们开源了新的点目标/兴趣点目标基准测试。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:13

论文页面 - ABot-N1:迈向通用视觉语言导航基础模型

来源:https://huggingface.co/papers/2607.10383 发表于 7 月 11 日

#2 每日论文 (https://huggingface.co/papers/date/2026-07-14) 作者:

摘要

视觉语言导航基础模型旨在统一深度推理以实现具身空间决策,同时具备广泛的多功能性以应对多样化的具身任务。当前方法通常通过将观测直接映射到动作的单一策略来实现这种整合,但常常遭受协同漂移以及长尾语义处理不佳的问题。此外,这些黑盒映射缺乏可解释性,阻碍了通用性、鲁棒性和透明性的同时实现。我们提出了 ABot-N1,这是迈向通用视觉语言导航基础模型的一步,通过采用基于双视觉-语言信号引导的快慢架构,将认知与解耦从控制中分离出来。具体而言,一个慢速视觉-语言推理器执行显式的思维链推理,同时生成一个像素目标。这组紧凑的图像空间锚点作为多种任务的通用接口,包括点目标、物体目标、兴趣点目标、指令跟随和人员跟随。随后,一个快速动作专家利用文本线索和像素引导在原生控制频率下生成连续航点。通过像素级锚点配以显式语言轨迹来桥接高层意图与低层控制,我们的方法确保了在仿真和真实世界基准测试中实现鲁棒、通用且可解释的导航。ABot-N1 建立了新的最先进记录,特别是在城市级导航中取得了巨大提升:兴趣点到达率提升 35.0%(达到 77.3%),在复杂的室内和室外场景中分别实现了 95.4%/92.9% 的成功率(SR)。它在物体到达、人员跟随和指令跟随任务中也保持了卓越的鲁棒性。为了推动城市级导航领域的发展,新的点目标/兴趣点目标基准已作为开源发布。

查看 arXiv 页面 (https://arxiv.org/abs/2607.10383) 查看 PDF (https://arxiv.org/pdf/2607.10383) 项目页面 (https://amap-cvlab.github.io/ABot-Navigation/ABot-N1/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10383)

引用本论文的模型 0

没有模型关联本论文

请在模型 README.md 中引用 arxiv.org/abs/2607.10383,以便从此页面链接。

引用本论文的数据集 0

没有数据集关联本论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.10383,以便从此页面链接。

引用本论文的 Space 0

没有 Space 关联本论文

请在 Space README.md 中引用 arxiv.org/abs/2607.10383,以便从此页面链接。

包含本论文的收藏集 0

没有收藏集包含本论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。

相似文章

ABot-M0.5: 统一移动与操作的世界动作模型

Hugging Face Daily Papers

ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。