HarnessVLN:通过代理线束统一无训练实体导航

Hugging Face Daily Papers 论文

摘要

HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。

实体导航要求代理解释视觉观察、积累空间知识,并执行动作以遵循指令或定位物体。基于训练的方法面临泛化挑战,而无需训练的方法利用多模态大型语言模型(MLLMs),但往往缺乏机制来调和提出的动作与空间证据、任务进展和执行失败。我们提出了HarnessVLN,一个零样本、无需训练的框架,其代理线束通过统一工具接口协调感知、检索、定位、导航、恢复和终止。线束根据空间证据、几何可行性和子目标一致性验证规划器提案,并将结构化工具反馈纳入后续决策。分层事件记忆跟踪任务进展和执行历史,而持久的时空图维护可重用的空间证据和失败注释,用于验证和恢复。可替换的导航执行器将验证后的目标转换为可执行动作,使相同的线束协议支持指令遵循和目标物体导航。HarnessVLN在R2R、RxR、HM3D-v2和HM3D-OVON上的成功率分别为60.8%、53.9%、76.0%和59.3%,超过了之前的无需训练的最新成果。人形机器人部署进一步证明了其在实际环境中对两种任务的适用性。项目页面是:https://harnessvln.netlify.app/。
查看原文
查看缓存全文

缓存时间: 2026/09/16 10:47

论文页面 - HarnessVLN:通过智能体协调框架统一免训练具身导航

来源:https://huggingface.co/papers/2609.15195

摘要

具身导航要求智能体解析视觉观测、积累空间知识并执行动作以遵循指令或定位物体。基于训练的方法面临泛化挑战,而免训练方法虽利用多模态大型语言模型(MLLMs),但往往缺乏协调提议动作与空间证据、任务进展及执行失败的机制。我们提出HarnessVLN,一个零样本、免训练框架,其智能体协调器通过统一工具接口协调感知、检索、定位、导航、恢复与终止过程。该协调器依据空间证据、几何可行性与子目标一致性验证规划器提议,并将结构化工具反馈整合到后续决策中。分层事件记忆追踪任务进展与执行历史,而持久时空图则维护可重用的空间证据与失败标注以用于验证与恢复。可更换的导航执行器将验证后的目标转化为可执行动作,使同一协调器协议能支持指令跟随与物体目标导航。HarnessVLN在R2R、RxR、HM3D-v2和HM3D-OVON数据集上分别取得60.8%、53.9%、76.0%和59.3%的成功率,超越了此前的免训练最先进结果。仿人机器人部署进一步证明了其在真实环境中适用于两种任务的能力。项目页面为:https://harnessvln.netlify.app/。

查看arXiv页面 (https://arxiv.org/abs/2609.15195) 查看PDF (https://arxiv.org/pdf/2609.15195) 项目页面 (https://agibot-harnessvln.netlify.app/) 添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.15195)

通过智能体获取本文: hf papers read 2609.15195 尚未安装最新CLI?请运行 curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

无模型关联本文 在模型README.md中引用 arxiv.org/abs/2609.15195 以从本页面建立关联。

引用本文的数据集 0

无数据集关联本文 在数据集README.md中引用 arxiv.org/abs/2609.15195 以从本页面建立关联。

引用本文的空间 0

无空间关联本文 在空间README.md中引用 arxiv.org/abs/2609.15195 以从本页面建立关联。

包含本文的收藏夹 0

无收藏夹包含本文 将本文添加至收藏夹 (https://huggingface.co/new-collection) 以从本页面建立关联。

相似文章

HarnessBridge: LLM智能体的可学习双向控制器

Hugging Face Daily Papers

介绍了HarnessBridge,一种可学习的双向控制器,它将智能体-环境接口参数化,用于LLM智能体。在Terminal-Bench和SWE-bench上,它以更少的计算开销达到了与专用框架相当的性能。