Embodied-Navigator:指点、思考、记忆与对齐以实现高效导航
摘要
TAMP-Nav 是一个统一框架,通过将视觉语言模型与二维视觉提示对齐、使用压缩记忆的选择性推理以及策略优化来增强具身导航,实现了最先进的性能,并具有高运行时和样本效率。
查看缓存全文
缓存时间: 2026/08/19 03:56
论文页面 - Embodied-Navigator:指向、思考、记忆与对齐的高效导航框架
来源:https://huggingface.co/papers/2608.17512
作者:
,
,
,
,
,
,
,
,
,
,
摘要
TAMP-Nav 通过基于二维视觉提示的视觉语言模型对齐、结合压缩记忆的选择性推理以及密集策略优化,提升了具身导航的性能。
尽管大型视觉语言模型(https://huggingface.co/papers?q=Large%20Vision-Language%20Models)(VLMs)显著推动了具身导航的发展,但其直接部署仍面临挑战:现有方法常迫使 VLMs 适配与其二维预训练先验不匹配的非自然动作空间,加之僵化的推理调度与低效的记忆管理。为克服这些局限,我们提出 TAMP-Nav——一个高效的统一具身导航框架。首先,我们引入像素到三维动作形式化(https://huggingface.co/papers?q=Pixel-to-3D%20Action%20Formulation)(Point),将导航任务重构为二维视觉提示(https://huggingface.co/papers?q=2D%20visual%20prompting)形式。具体而言,VLM 仅需选择二维像素点,随后将其投影为三维坐标交由底层 SLAM 控制器(https://huggingface.co/papers?q=SLAM%20controller)执行。该设计自然将具身操作与 VLM 固有的二维视觉能力对齐。其次,我们提出集成选择性推理与锚轨迹记忆(https://huggingface.co/papers?q=Anchor-Trajectory%20Memory)机制(Think and Memorize),该机制在关键节点动态触发链式思维推理(https://huggingface.co/papers?q=Chain-of-Thought)并仅保留高保真记忆,同时将冗余轨迹压缩为轻量级时空指示符(https://huggingface.co/papers?q=Space-Time%20Indicators),从而在保持关键历史信息的同时增强时空感知能力。最后,我们设计了一种高效的两级对齐范式(Align),通过群组相对策略优化(https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)(GRPO)实现。通过叠加全局结果奖励(https://huggingface.co/papers?q=global%20outcome%20rewards)与细粒度过程奖励(https://huggingface.co/papers?q=process%20rewards),这种密集监督将智能体的认知规划与物理环境反馈紧密对齐,赋予模型自适应推理能力。实验表明,TAMP-Nav 以极高的运行时与样本效率(仅需 9 万条训练轨迹)取得了业界领先的性能(例如在 R2R-CE 基准上达到 66.2% SR)。
查看 arXiv 页面 (https://arxiv.org/abs/2608.17512)
查看 PDF (https://arxiv.org/pdf/2608.17512)
项目页面 (https://zju-omniai.github.io/Embodied-Navigator/)
GitHub (https://github.com/ZJU-OmniAI/Embodied-Omni)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.17512)
在智能体中获取本文:
hf papers read 2608.17512
没有最新 CLI?运行:curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型
0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.17512 即可从本页建立链接。
引用本文的数据集
0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.17512 即可从本页建立链接。
引用本文的空间
0
暂无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.17512 即可从本页建立链接。
包含本文的收藏
1
相似文章
从被动检索到主动记忆导航:学习将记忆作为结构化动作空间使用
NapMem是一个框架,将长期用户记忆视为结构化动作空间而非被动检索,通过多粒度记忆金字塔和强化学习训练代理进行记忆导航。实验表明,在记忆密集型任务上表现有竞争力。
ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。
PlatonicNav:用柏拉图拓扑地图揭示导航中的语义对应
PlatonicNav 提出了一种免训练的具体化导航框架,该框架仅使用视觉语义地图和盲匹配来锚定语言目标,无需显式的跨模态训练即可实现跨任务和跨形态的泛化。
视觉语言导航中用于语义探索的路径级事后指令
介绍 Φ-Nav,一种统一的在线策略框架,利用事后推理从探索轨迹中合成生成路径级指令,弥合视觉语言导航中的语义监督差距,并在 R2R-CE 和 RxR-CE 基准测试上以更少的专家演示取得了竞争性结果。
UniNav:用于视觉导航的统一世界-动作扩散模型
UniNav是一个统一的世界-动作扩散模型,用于图像目标视觉导航。它在单个扩散过程中联合预测未来的视觉观察和航点轨迹,以高效推理实现了强大的基准测试结果。