LightNav-0:激发VLM空间智能以实现通用具身导航

Hugging Face Daily Papers 论文

摘要

LightNav-0 是一个紧凑的通用导航模型,它利用预训练视觉-语言模型的空间智能,实现了跨多样任务和机器人形态的具身导航最先进性能。

具身导航要求智能体将多样化的目标和视觉观察转化为行动,以适应不同的任务、环境和机器人形态。现代视觉-语言模型已经编码了用于视觉定位、空间推理和指向的空间先验,但这些能力很少被直接激发用于机器人控制。现有的导航系统则依赖于针对特定任务或特定形态的组件,割裂了感知、推理和行动,且泛化能力有限。在此,我们提出 LightNav-0,一个紧凑的通用具身导航模型。它激发预训练VLM的空间智能并与导航任务对齐,无需针对特定任务的预测头。LightNav-0 通过统一的令牌接口表征多样化的导航任务:双通道指向机制表达与任务、场景和形态无关的空间意图,而一个残差向量量化动作分词器将此意图映射为精确的、特定形态的轨迹。结合时间感知的视觉历史压缩、ER中期训练、监督微调和强化学习,这一方法在单一模型内支持指令跟随、开放词汇目标导航和视觉跟踪。导航训练语料库涵盖超过2000个场景和4000多小时的具身导航数据。用于初始化 LightNav-0 的具身推理检查点 LightNav-ER,在8个具身推理基准测试中获得了全集最高平均分,而 LightNav-0 在所有10个公开的导航仿真设置中实现了最先进的单目成功率。真实世界评估进一步证明了其在不同机器人形态、多样场景以及静态和动态目标间的零样本泛化能力。这些结果确立了紧凑型VLM作为通用具身导航统一且可迁移的骨干网络的地位。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:44

论文页面 - LightNav-0:激发视觉语言模型空间智能以实现通用体化导航

来源:https://huggingface.co/papers/2608.30935 作者:

, , , , , , , , , , , , , , , , , , ,

摘要

LightNav-0 是一个紧凑型通用导航模型,它通过统一的指向令牌和动作分词机制,利用预训练视觉语言模型(VLM)的空间推理能力,在多样化的任务和机器人平台上实现了最先进的体化导航表现。

体化导航要求智能体将异构的目标和视觉观测转化为跨越任务、环境与机器人实体差异的动作。现代视觉语言模型(VLM)已经编码了用于视觉定位、空间推理和指向操作的空间先验知识,但这些能力很少被直接用于机器人控制。现有的导航系统通常依赖于特定任务或特定实体的组件,这割裂了感知、推理与行动环节,且泛化能力有限。本文提出 LightNav-0,这是一个紧凑型通用体化导航模型,它直接激发预训练VLM的空间智能并与导航任务对齐,无需任务特定的预测头。LightNav-0通过统一的令牌接口来表示多样化的导航任务:双通道指向机制表达了与任务、场景和机器人实体无关的空间意图,而残差向量量化动作分词器则将该意图映射为精确的、针对特定机器人的轨迹。结合时序感知视觉历史压缩、ER中期训练、监督微调和强化学习,这一方法使得单一模型能够支持指令跟随、开放词汇物体导航和视觉跟踪。导航训练语料库涵盖2000多个场景和4000多小时的体化导航数据。用于初始化LightNav-0的体化推理检查点LightNav-ER在8个体化推理基准测试中取得了最高的完整集平均表现,而LightNav-0在所有10个公开导航仿真设置中均达到了最先进的单目成功率。现实世界评估进一步证明了其跨机器人实体、多样场景以及静态/动态目标的零样本泛化能力。这些结果确立了紧凑型VLM作为通用体化导航统一且可迁移主干网络的地位。

查看 arXiv 页面 (https://arxiv.org/abs/2608.30935) 查看 PDF (https://arxiv.org/pdf/2608.30935) 项目主页 (https://www.lightorigins.com/en/blog/lightnav-0) GitHub180 (https://github.com/lightorigins/LightNav-0) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30935)

获取此论文到您的智能代理中:

hf papers read 2608\.30935

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.30935 即可从本页面链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.30935 即可从本页面链接。

引用此论文的 Spaces 0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.30935 即可从本页面链接。

包含此论文的收藏夹 0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从本页面链接。

相似文章

ABot-N1:迈向通用视觉语言导航基础模型

Hugging Face Daily Papers

ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。

视觉语言导航中用于语义探索的路径级事后指令

arXiv cs.AI

介绍 Φ-Nav,一种统一的在线策略框架,利用事后推理从探索轨迹中合成生成路径级指令,弥合视觉语言导航中的语义监督差距,并在 R2R-CE 和 RxR-CE 基准测试上以更少的专家演示取得了竞争性结果。