NavHarness:迈向终身具身导航
摘要
论文提出了 NavHarness——一种免训练的具身导航框架(harness),将记忆处理融入导航循环,使智能体能够在不同会话之间携带经验,实现终身导航。在 GOAT-Bench 上,相比仅依赖上下文的独立会话,该方法将成功率最高提升 22.6 个百分点,并借助 GPT-6/Astra 达到当前最优结果。
查看缓存全文
缓存时间: 2026/10/01 16:23
论文页面 - NavHarness:迈向终身具身导航
Source: https://huggingface.co/papers/2609.34276
摘要
前沿模型如今通过结合简单工具的多轮多模态推理,已经在单个具身导航任务上表现出色。然而,在连续的任务中,智能体还必须依赖不断演变的地图和早期的搜索记录,而这两者都可能是不完整的,或与新观察相矛盾。我们提出 NavHarness,一个面向终身导航的免训练具身框架,它将记忆处理纳入导航循环之中。在导航过程中,其多轮智能体会话会调用地图、任务记录和房屋知识,并将它们与观察结果进行核对,记录修正信息以引导后续行动。NavHarness 将这些经验保留下来,供新任务或恢复尝试开启新对话时使用,而结果验证与运行结束时的总结则支撑着经验的后续复用。在 GOAT-Bench 上,与仅依赖上下文的独立会话相比,NavHarness 使 s-SR 在 Astra 上提升了 18.6 个百分点,在 Opus 5 上提升了 22.6 个百分点。使用 SLAM 估计的位姿,NavHarness 搭配 GPT-6 Astra 在 GOAT-Bench 上取得了 83.7 的 s-SR 与 36.9 的 e-SR 的最佳任务成功率,并在 IR2R-CE 上达到 85.9 的 s-SR。为了理解这些增益的来源,我们考察了经验如何在会话之间传递,发现结构化的恢复交接优于长度相当的摘要。在跨多栋房屋的长期部署中,知识巩固对导航的改进超越了仅保留地图和任务记录的做法,案例研究展示了智能体如何利用早期经验来解读新目标、探查未解决的问题,以及重新继续失败的搜索。我们认为,终身导航的进展取决于后续推理会话如何在先前经验的基础上展开,而不仅仅取决于单任务能力的提升。
查看 arXiv 页面 (https://arxiv.org/abs/2609.34276)|查看 PDF (https://arxiv.org/pdf/2609.34276)|项目页面 (https://billzhao1030.github.io/NavHarness/)|GitHub6 (https://github.com/billzhao1030/NavHarness)|添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.34276)
引用本文的模型:0
没有模型与本文关联。
在模型的 README.md 中引用 arxiv.org/abs/2609.34276,即可从本页链接到该论文。
引用本文的数据集:0
没有数据集与本文关联。
在数据集的 README.md 中引用 arxiv.org/abs/2609.34276,即可从本页链接到该论文。
引用本文的 Spaces:0
没有 Space 与本文关联。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.34276,即可从本页链接到该论文。
收录本文的合集:0
没有合集收录本文。
将本文添加到合集 (https://huggingface.co/new-collection) 即可从本页链接到该论文。
相似文章
HarnessVLN:通过代理线束统一无训练实体导航
HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。
Embodied-Navigator:指点、思考、记忆与对齐以实现高效导航
TAMP-Nav 是一个统一框架,通过将视觉语言模型与二维视觉提示对齐、使用压缩记忆的选择性推理以及策略优化来增强具身导航,实现了最先进的性能,并具有高运行时和样本效率。
超越记忆中的世界:面向演化场景下持久导航的预测性4D信念
论文提出EvolvingNav,一个面向具身智能体的预测性4D信念框架,用于在不断演化的环境中追踪目标、在检查时刻预测其位置,并在可见性受限时修正信念;同时提出EvoWorld-Bench基准,涵盖54个场景和803,680个任务,模拟实验与真实机器人实验均表明该方法提升了导航成功率。
RewardHarness:自演进的代理式后训练框架
RewardHarness 是一个用于后训练的自演进代理框架,通过迭代优化工具和技能库来替代大规模偏好标注,在图像编辑评估基准上的表现优于 GPT-5。
持续增强框架:面向自我改进基础智能体的在线适应
本文介绍了“持续增强框架”(Continual Harness),该框架使具身人工智能智能体能够在无需重置环境的情况下实现在线自我改进。研究展示了在《宝可梦》游戏中的显著进展,通过自动化提示词和技能优化,智能体达到了人类水平的表现。