HarnessVLN:通过代理线束统一无训练实体导航
摘要
HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。
查看缓存全文
缓存时间: 2026/09/16 10:47
论文页面 - HarnessVLN:通过智能体协调框架统一免训练具身导航
来源:https://huggingface.co/papers/2609.15195
摘要
具身导航要求智能体解析视觉观测、积累空间知识并执行动作以遵循指令或定位物体。基于训练的方法面临泛化挑战,而免训练方法虽利用多模态大型语言模型(MLLMs),但往往缺乏协调提议动作与空间证据、任务进展及执行失败的机制。我们提出HarnessVLN,一个零样本、免训练框架,其智能体协调器通过统一工具接口协调感知、检索、定位、导航、恢复与终止过程。该协调器依据空间证据、几何可行性与子目标一致性验证规划器提议,并将结构化工具反馈整合到后续决策中。分层事件记忆追踪任务进展与执行历史,而持久时空图则维护可重用的空间证据与失败标注以用于验证与恢复。可更换的导航执行器将验证后的目标转化为可执行动作,使同一协调器协议能支持指令跟随与物体目标导航。HarnessVLN在R2R、RxR、HM3D-v2和HM3D-OVON数据集上分别取得60.8%、53.9%、76.0%和59.3%的成功率,超越了此前的免训练最先进结果。仿人机器人部署进一步证明了其在真实环境中适用于两种任务的能力。项目页面为:https://harnessvln.netlify.app/。
查看arXiv页面 (https://arxiv.org/abs/2609.15195) 查看PDF (https://arxiv.org/pdf/2609.15195) 项目页面 (https://agibot-harnessvln.netlify.app/) 添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.15195)
通过智能体获取本文:
hf papers read 2609.15195
尚未安装最新CLI?请运行 curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
无模型关联本文 在模型README.md中引用 arxiv.org/abs/2609.15195 以从本页面建立关联。
引用本文的数据集 0
无数据集关联本文 在数据集README.md中引用 arxiv.org/abs/2609.15195 以从本页面建立关联。
引用本文的空间 0
无空间关联本文 在空间README.md中引用 arxiv.org/abs/2609.15195 以从本页面建立关联。
包含本文的收藏夹 0
无收藏夹包含本文 将本文添加至收藏夹 (https://huggingface.co/new-collection) 以从本页面建立关联。
相似文章
Harness VLA:通过记忆引导的代理将冻结的VLA转化为可靠的操作原语
HarnessVLA是一个记忆增强框架,利用冻结的视觉-语言-动作模型作为机器人可靠操作的原语,在不进行微调的情况下实现了显著的性能提升。
LightNav-0:激发VLM空间智能以实现通用具身导航
LightNav-0 是一个紧凑的通用导航模型,它利用预训练视觉-语言模型的空间智能,实现了跨多样任务和机器人形态的具身导航最先进性能。
Show-Harness:仅凭VLM代理即可控制机器人
Show-Harness是一种方法,它使视觉语言模型能够通过离散的语义动作来控制机器人,实现零样本部署和跨不同机器人与GUI的高效微调。
HarnessBridge: LLM智能体的可学习双向控制器
介绍了HarnessBridge,一种可学习的双向控制器,它将智能体-环境接口参数化,用于LLM智能体。在Terminal-Bench和SWE-bench上,它以更少的计算开销达到了与专用框架相当的性能。
Hy-Embodied-0.5-VLA: 从视觉-语言-动作模型到真实世界机器人学习栈
HyVLA-0.5 是一个端到端机器人学习系统,整合了数据收集、模型设计、预训练、微调和强化学习,用于真实世界部署。