Embodied-Navigator:指点、思考、记忆与对齐以实现高效导航
摘要
TAMP-Nav 是一个统一框架,通过将视觉语言模型与二维视觉提示对齐、使用压缩记忆的选择性推理以及策略优化来增强具身导航,实现了最先进的性能,并具有高运行时和样本效率。
查看缓存全文
缓存时间: 2026/08/19 03:56
论文页面 - Embodied-Navigator:指向、思考、记忆与对齐的高效导航框架
来源:https://huggingface.co/papers/2608.17512
作者:
,
,
,
,
,
,
,
,
,
,
摘要
TAMP-Nav 通过基于二维视觉提示的视觉语言模型对齐、结合压缩记忆的选择性推理以及密集策略优化,提升了具身导航的性能。
尽管大型视觉语言模型(https://huggingface.co/papers?q=Large%20Vision-Language%20Models)(VLMs)显著推动了具身导航的发展,但其直接部署仍面临挑战:现有方法常迫使 VLMs 适配与其二维预训练先验不匹配的非自然动作空间,加之僵化的推理调度与低效的记忆管理。为克服这些局限,我们提出 TAMP-Nav——一个高效的统一具身导航框架。首先,我们引入像素到三维动作形式化(https://huggingface.co/papers?q=Pixel-to-3D%20Action%20Formulation)(Point),将导航任务重构为二维视觉提示(https://huggingface.co/papers?q=2D%20visual%20prompting)形式。具体而言,VLM 仅需选择二维像素点,随后将其投影为三维坐标交由底层 SLAM 控制器(https://huggingface.co/papers?q=SLAM%20controller)执行。该设计自然将具身操作与 VLM 固有的二维视觉能力对齐。其次,我们提出集成选择性推理与锚轨迹记忆(https://huggingface.co/papers?q=Anchor-Trajectory%20Memory)机制(Think and Memorize),该机制在关键节点动态触发链式思维推理(https://huggingface.co/papers?q=Chain-of-Thought)并仅保留高保真记忆,同时将冗余轨迹压缩为轻量级时空指示符(https://huggingface.co/papers?q=Space-Time%20Indicators),从而在保持关键历史信息的同时增强时空感知能力。最后,我们设计了一种高效的两级对齐范式(Align),通过群组相对策略优化(https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)(GRPO)实现。通过叠加全局结果奖励(https://huggingface.co/papers?q=global%20outcome%20rewards)与细粒度过程奖励(https://huggingface.co/papers?q=process%20rewards),这种密集监督将智能体的认知规划与物理环境反馈紧密对齐,赋予模型自适应推理能力。实验表明,TAMP-Nav 以极高的运行时与样本效率(仅需 9 万条训练轨迹)取得了业界领先的性能(例如在 R2R-CE 基准上达到 66.2% SR)。
查看 arXiv 页面 (https://arxiv.org/abs/2608.17512)
查看 PDF (https://arxiv.org/pdf/2608.17512)
项目页面 (https://zju-omniai.github.io/Embodied-Navigator/)
GitHub (https://github.com/ZJU-OmniAI/Embodied-Omni)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.17512)
在智能体中获取本文:
hf papers read 2608.17512
没有最新 CLI?运行:curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型
0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.17512 即可从本页建立链接。
引用本文的数据集
0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.17512 即可从本页建立链接。
引用本文的空间
0
暂无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.17512 即可从本页建立链接。
包含本文的收藏
1
相似文章
NavHarness:迈向终身具身导航
论文提出了 NavHarness——一种免训练的具身导航框架(harness),将记忆处理融入导航循环,使智能体能够在不同会话之间携带经验,实现终身导航。在 GOAT-Bench 上,相比仅依赖上下文的独立会话,该方法将成功率最高提升 22.6 个百分点,并借助 GPT-6/Astra 达到当前最优结果。
从被动检索到主动记忆导航:学习将记忆作为结构化动作空间使用
NapMem是一个框架,将长期用户记忆视为结构化动作空间而非被动检索,通过多粒度记忆金字塔和强化学习训练代理进行记忆导航。实验表明,在记忆密集型任务上表现有竞争力。
超越记忆中的世界:面向演化场景下持久导航的预测性4D信念
论文提出EvolvingNav,一个面向具身智能体的预测性4D信念框架,用于在不断演化的环境中追踪目标、在检查时刻预测其位置,并在可见性受限时修正信念;同时提出EvoWorld-Bench基准,涵盖54个场景和803,680个任务,模拟实验与真实机器人实验均表明该方法提升了导航成功率。
ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。
LightNav-0:激发VLM空间智能以实现通用具身导航
LightNav-0 是一个紧凑的通用导航模型,它利用预训练视觉-语言模型的空间智能,实现了跨多样任务和机器人形态的具身导航最先进性能。