Embodied-Navigator:指点、思考、记忆与对齐以实现高效导航

Hugging Face Daily Papers 论文

摘要

TAMP-Nav 是一个统一框架,通过将视觉语言模型与二维视觉提示对齐、使用压缩记忆的选择性推理以及策略优化来增强具身导航,实现了最先进的性能,并具有高运行时和样本效率。

尽管大型视觉语言模型(VLMs)显著推进了具身导航,但其直接部署仍具挑战性,因为现有方法常迫使VLMs进入与其二维预训练先验不匹配的不自然动作空间,并伴有僵化的推理调度和低效的内存管理。为克服这些局限性,我们提出了TAMP-Nav,一个用于高效具身导航的统一框架。首先,我们引入像素到三维动作公式化(Point),将导航重新表述为二维视觉提示。具体而言,VLM仅选择二维像素,然后将其投影到三维坐标以供低级SLAM控制器使用。此设计自然地使具身执行与VLM固有的二维视觉能力对齐。其次,我们提出集成选择性推理与锚点轨迹记忆机制(Think and Memorize),该机制动态触发思维链,并仅在关键节点保留高保真记忆,将冗余轨迹压缩为轻量级时空指示符,从而保留关键历史信息并增强时空感知。最后,我们设计了高效的二级对齐范式(Align),通过群组相对策略优化(GRPO)。通过叠加全局结果奖励与细粒度过程奖励,这种密集监督紧密对齐代理的认知规划与物理环境反馈,赋予模型自适应推理能力。实验证明,TAMP-Nav实现了最先进的性能(例如,在R2R-CE上达到66.2%的成功率),并具有高运行时和样本效率(仅需90k训练轨迹)。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:56

论文页面 - Embodied-Navigator:指向、思考、记忆与对齐的高效导航框架

来源:https://huggingface.co/papers/2608.17512
作者:

,

,

,

,

,

,

,

,

,

,

摘要

TAMP-Nav 通过基于二维视觉提示的视觉语言模型对齐、结合压缩记忆的选择性推理以及密集策略优化,提升了具身导航的性能。

尽管大型视觉语言模型(https://huggingface.co/papers?q=Large%20Vision-Language%20Models)(VLMs)显著推动了具身导航的发展,但其直接部署仍面临挑战:现有方法常迫使 VLMs 适配与其二维预训练先验不匹配的非自然动作空间,加之僵化的推理调度与低效的记忆管理。为克服这些局限,我们提出 TAMP-Nav——一个高效的统一具身导航框架。首先,我们引入像素到三维动作形式化(https://huggingface.co/papers?q=Pixel-to-3D%20Action%20Formulation)(Point),将导航任务重构为二维视觉提示(https://huggingface.co/papers?q=2D%20visual%20prompting)形式。具体而言,VLM 仅需选择二维像素点,随后将其投影为三维坐标交由底层 SLAM 控制器(https://huggingface.co/papers?q=SLAM%20controller)执行。该设计自然将具身操作与 VLM 固有的二维视觉能力对齐。其次,我们提出集成选择性推理与锚轨迹记忆(https://huggingface.co/papers?q=Anchor-Trajectory%20Memory)机制(Think and Memorize),该机制在关键节点动态触发链式思维推理(https://huggingface.co/papers?q=Chain-of-Thought)并仅保留高保真记忆,同时将冗余轨迹压缩为轻量级时空指示符(https://huggingface.co/papers?q=Space-Time%20Indicators),从而在保持关键历史信息的同时增强时空感知能力。最后,我们设计了一种高效的两级对齐范式Align),通过群组相对策略优化(https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)(GRPO)实现。通过叠加全局结果奖励(https://huggingface.co/papers?q=global%20outcome%20rewards)与细粒度过程奖励(https://huggingface.co/papers?q=process%20rewards),这种密集监督将智能体的认知规划与物理环境反馈紧密对齐,赋予模型自适应推理能力。实验表明,TAMP-Nav 以极高的运行时与样本效率(仅需 9 万条训练轨迹)取得了业界领先的性能(例如在 R2R-CE 基准上达到 66.2% SR)。

查看 arXiv 页面 (https://arxiv.org/abs/2608.17512)
查看 PDF (https://arxiv.org/pdf/2608.17512)
项目页面 (https://zju-omniai.github.io/Embodied-Navigator/)
GitHub (https://github.com/ZJU-OmniAI/Embodied-Omni)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.17512)

在智能体中获取本文:

hf papers read 2608.17512

没有最新 CLI?运行:curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型

0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.17512 即可从本页建立链接。

引用本文的数据集

0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.17512 即可从本页建立链接。

引用本文的空间

0

暂无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2608.17512 即可从本页建立链接。

包含本文的收藏

1

相似文章

ABot-N1:迈向通用视觉语言导航基础模型

Hugging Face Daily Papers

ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。

视觉语言导航中用于语义探索的路径级事后指令

arXiv cs.AI

介绍 Φ-Nav,一种统一的在线策略框架,利用事后推理从探索轨迹中合成生成路径级指令,弥合视觉语言导航中的语义监督差距,并在 R2R-CE 和 RxR-CE 基准测试上以更少的专家演示取得了竞争性结果。