LightNav-0:激发VLM空间智能以实现通用具身导航
摘要
LightNav-0 是一个紧凑的通用导航模型,它利用预训练视觉-语言模型的空间智能,实现了跨多样任务和机器人形态的具身导航最先进性能。
查看缓存全文
缓存时间: 2026/09/01 11:44
论文页面 - LightNav-0:激发视觉语言模型空间智能以实现通用体化导航
来源:https://huggingface.co/papers/2608.30935 作者:
, , , , , , , , , , , , , , , , , , ,
摘要
LightNav-0 是一个紧凑型通用导航模型,它通过统一的指向令牌和动作分词机制,利用预训练视觉语言模型(VLM)的空间推理能力,在多样化的任务和机器人平台上实现了最先进的体化导航表现。
体化导航要求智能体将异构的目标和视觉观测转化为跨越任务、环境与机器人实体差异的动作。现代视觉语言模型(VLM)已经编码了用于视觉定位、空间推理和指向操作的空间先验知识,但这些能力很少被直接用于机器人控制。现有的导航系统通常依赖于特定任务或特定实体的组件,这割裂了感知、推理与行动环节,且泛化能力有限。本文提出 LightNav-0,这是一个紧凑型通用体化导航模型,它直接激发预训练VLM的空间智能并与导航任务对齐,无需任务特定的预测头。LightNav-0通过统一的令牌接口来表示多样化的导航任务:双通道指向机制表达了与任务、场景和机器人实体无关的空间意图,而残差向量量化动作分词器则将该意图映射为精确的、针对特定机器人的轨迹。结合时序感知视觉历史压缩、ER中期训练、监督微调和强化学习,这一方法使得单一模型能够支持指令跟随、开放词汇物体导航和视觉跟踪。导航训练语料库涵盖2000多个场景和4000多小时的体化导航数据。用于初始化LightNav-0的体化推理检查点LightNav-ER在8个体化推理基准测试中取得了最高的完整集平均表现,而LightNav-0在所有10个公开导航仿真设置中均达到了最先进的单目成功率。现实世界评估进一步证明了其跨机器人实体、多样场景以及静态/动态目标的零样本泛化能力。这些结果确立了紧凑型VLM作为通用体化导航统一且可迁移主干网络的地位。
查看 arXiv 页面 (https://arxiv.org/abs/2608.30935) 查看 PDF (https://arxiv.org/pdf/2608.30935) 项目主页 (https://www.lightorigins.com/en/blog/lightnav-0) GitHub180 (https://github.com/lightorigins/LightNav-0) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30935)
获取此论文到您的智能代理中:
hf papers read 2608\.30935
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.30935 即可从本页面链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.30935 即可从本页面链接。
引用此论文的 Spaces 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.30935 即可从本页面链接。
包含此论文的收藏夹 0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从本页面链接。
相似文章
ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。
PlatonicNav:用柏拉图拓扑地图揭示导航中的语义对应
PlatonicNav 提出了一种免训练的具体化导航框架,该框架仅使用视觉语义地图和盲匹配来锚定语言目标,无需显式的跨模态训练即可实现跨任务和跨形态的泛化。
Embodied-Navigator:指点、思考、记忆与对齐以实现高效导航
TAMP-Nav 是一个统一框架,通过将视觉语言模型与二维视觉提示对齐、使用压缩记忆的选择性推理以及策略优化来增强具身导航,实现了最先进的性能,并具有高运行时和样本效率。
视觉语言导航中用于语义探索的路径级事后指令
介绍 Φ-Nav,一种统一的在线策略框架,利用事后推理从探索轨迹中合成生成路径级指令,弥合视觉语言导航中的语义监督差距,并在 R2R-CE 和 RxR-CE 基准测试上以更少的专家演示取得了竞争性结果。
Qwen-RobotNav 技术报告:为自主导航系统设计的可扩展导航模型
Qwen-RobotNav 是一种可扩展的导航模型,通过参数化接口实现动态任务模式和观测参数,在多任务训练和零样本泛化到真实机器人领域达到了最先进水平。