HRO:基于大型语言模型的零样本物体目标导航层次化房间到物体框架
摘要
提出了HRO,一种由大型语言模型驱动的层次化框架,用于零样本物体目标导航,模拟人类从粗到细的空间推理,在Gibson和HM3D数据集上实现了卓越的成功率和泛化能力。
arXiv:2607.13072v1 公告类型:cross
摘要:零样本物体目标导航旨在让智能体在未经特定目标训练的情况下,能够在陌生环境中探索并导航到未知类别的物体。在零样本导航任务中,通常使用预训练的大型模型,利用其先验知识来引导智能体的导航。然而,现有的基于大型语言模型(LLMs)的零样本物体目标导航方法仅仅将LLMs作为平面推理工具,直接关联物体或区域。它们缺乏类人房间语义到物体定位的层次化空间认知建模,这导致探索时存在较强的盲目性、语义关联精度不足,并且未能充分发挥LLMs的常识推理潜力。本文提出了一种由LLM驱动的层次化房间到物体(HRO)框架,用于零样本物体目标导航,以从粗到细的方式引导智能体探索并导航到目标物体。在Gibson和HM3D数据集上的实验验证了我们的HRO框架在成功率和泛化能力上优于现有的基于LLM的方法,突显了LLMs在零样本物体目标导航方面的强大潜力。
查看缓存全文
缓存时间: 2026/07/16 04:25
# 层次化“从房间到物体”框架:面向零样本物体目标导航的大语言模型方法†
来源:https://arxiv.org/html/2607.13072
陆远佳1,2,3,余银峰1,2,3,🖂\{\}^\{,\\mbox\{\\Letter\}\}†\\dagger本研究受国家自然科学基金(项目编号:62463029)资助。1新疆大学计算机科学与技术学院,乌鲁木齐 830017,中国。2新疆大学具身智能联合研究实验室。3丝绸之路多语种认知计算国际联合研究实验室,新疆大学。🖂\{\}^\{,\\mbox\{\\Letter\}\}余银峰为通讯作者(电子邮箱:[email protected])。
###### 摘要
零样本物体目标导航的目标是使智能体能够在陌生环境中,无需针对特定目标进行训练,即可探索并导航至未知类别的物体。在零样本导航任务中,通常利用预训练的大模型,借助其先验知识来引导智能体的导航。然而,现有基于大语言模型(LLM)的零样本物体目标导航方法仅将LLM用作“平面式”推理工具,直接进行物体或区域的关联。它们缺乏类似人类的空间层次化认知建模,即从房间语义到物体定位的推理,因此导致探索盲目性强、语义关联精度不足,并且未能充分发挥LLM的常识推理潜力。本文提出一种基于LLM的层次化“从房间到物体”(HRO)框架用于零样本物体目标导航,该框架以由粗到精的方式引导智能体探索并导航至目标物体。在Gibson和HM3D数据集上的实验验证了我们的HRO框架相比现有基于LLM的方法取得了更优的成功率和泛化能力,突显了LLM在零样本物体目标导航中的强大潜力。
## I 引言
与其他人工智能任务[28(https://arxiv.org/html/2607.13072#bib.bib45),27(https://arxiv.org/html/2607.13072#bib.bib46),24(https://arxiv.org/html/2607.13072#bib.bib47),30(https://arxiv.org/html/2607.13072#bib.bib48),29(https://arxiv.org/html/2607.13072#bib.bib49),8(https://arxiv.org/html/2607.13072#bib.bib50),12(https://arxiv.org/html/2607.13072#bib.bib51),35(https://arxiv.org/html/2607.13072#bib.bib52),10(https://arxiv.org/html/2607.13072#bib.bib53),33(https://arxiv.org/html/2607.13072#bib.bib54),34(https://arxiv.org/html/2607.13072#bib.bib55),31(https://arxiv.org/html/2607.13072#bib.bib56),21(https://arxiv.org/html/2607.13072#bib.bib57),4(https://arxiv.org/html/2607.13072#bib.bib58)]不同,未知环境下的物体目标导航对于家庭服务机器人和自主探索至关重要。现有的基于LLM的零样本方法,如ESC[36(https://arxiv.org/html/2607.13072#bib.bib5)]和L3MVN[26(https://arxiv.org/html/2607.13072#bib.bib6)],仅进行平面式推理,直接关联物体和区域。它们缺乏类似人类的层次化空间认知:人类首先通过观察到的物体判断房间类型,然后根据房间功能推断目标位置。缺乏此类建模会导致探索盲目、语义关联不精确,并且LLM的常识潜力未被充分利用。
参见图标题图1:该图展示了HRO框架。以“寻找植物”为例,智能体从观察到的物体推断房间语义,并利用物体-房间常识选择目标区域,体现了层次化的“物体到房间再到目标”推理机制。为解决这一问题,我们提出了HRO,一种层次化的LLM驱动的零样本导航框架。遵循人类认知,HRO采用由粗到精的范式,将导航分解为三个模块:(1) 高层模块利用LLM从观察到的物体推断房间类型分布;(2) 中层模块通过面向目标的语义亲和度评分评估候选前沿;(3) 低层模块规划最短路径并执行动作。
该框架使用“房间类型”作为LLM常识与物体定位之间的核心语义桥梁。一项并行工作LROGNav[20(https://arxiv.org/html/2607.13072#bib.bib44)]也探索了房间-物体关系,但依赖于监督训练,而HRO是无训练且层次化的。它将智能体的探索与“先判断场景,再寻找物体”的人类逻辑对齐,并提高了语义引导能力。如图1(https://arxiv.org/html/2607.13072#S1.F1)所示,以“寻找植物”为例,智能体首先从观察到的物体推断房间语义,然后搜索与物体-房间亲和度高的区域,实现了从感知到目标的层次化导航。
参见图标题图2:HRO框架的架构。该框架展示了层次化的“从房间到物体”导航过程。我们的贡献总结如下:
- •我们提出了HRO,一种层次化的“从房间到物体”零样本框架,具有三层结构(房间推理、区域决策、动作执行),其中“房间类型”作为核心语义桥梁,增强了探索的针对性。
- •依赖LLM丰富的先验知识,我们的框架可以直接适应未见过的物体和未知场景,无需额外的物体和场景训练数据标注或任务特定的微调,为零样本物体导航提供了一种新解决方案。
- •我们的方法在两个导航基准数据集上取得了最优的成功率,其性能优于基线方法。这验证了LLM在零样本物体目标导航领域发展中的巨大潜力。
## II 相关工作
传统的物体导航方法依赖于大量标注数据,但预训练的大模型现已实现具有强泛化能力的零样本学习[11(https://arxiv.org/html/2607.13072#bib.bib25),17(https://arxiv.org/html/2607.13072#bib.bib26),14(https://arxiv.org/html/2607.13072#bib.bib27)]。一些基于VLM的方法(例如VLFM[25(https://arxiv.org/html/2607.13072#bib.bib29)]、GAMap[32(https://arxiv.org/html/2607.13072#bib.bib30)])针对零样本导航执行前沿选择。我们聚焦于基于LLM的方法以挖掘其语义推理潜力。
现有的基于LLM的方法包括L3MVN[26(https://arxiv.org/html/2607.13072#bib.bib6)]、ESC[36(https://arxiv.org/html/2607.13072#bib.bib5)]、L-ZSON[7(https://arxiv.org/html/2607.13072#bib.bib33)]和PixNav[3(https://arxiv.org/html/2607.13072#bib.bib35)],它们采用平面式推理,直接关联物体和区域。这些方法缺乏房间-物体关系的层次化建模,从而限制了语义推理的准确性和探索效率。我们的层次化机制填补了这一空白,并为导航提供了更接近人类的认知范式。
同时,LROGNav[20(https://arxiv.org/html/2607.13072#bib.bib44)]利用基于LLM的房间-物体关系进行导航,但依赖于监督学习和标注的房间分割图。相比之下,我们的HRO是零样本、无训练且层次化的,无需任何标注或微调。它通过一个三阶段流水线进行即时LLM推理,与人类空间认知对齐。
## III 所提出的方法
### III-A 问题形式化
我们聚焦于零样本物体目标导航,其中智能体在未知室内环境\(S_{i}\)中探索以找到目标类别\(C_{i}\),无需任务特定的训练、微调或事先接触\(S_{i}\)和\(C_{i}\)。一个回合定义为\(E_{i}=\{S_{i},C_{i},P_{0}\}\),其中\(P_{0}\)表示智能体的初始位姿。在每一步\(t\),智能体获取RGB-D观测、位置\((x_{t},y_{t})\)和朝向\(\theta_{t}\)。动作空间包括前进、左转/右转、向上看/向下看和停止。智能体每步移动\(25\ \mathrm{cm}\),每次动作旋转\(30^{\circ}\)。如果智能体在\(T_{\text{max}}=500\)步内停在目标1米范围内,则任务成功。
### III-B 概述
本文提出HRO,一种基于LLM的层次化零样本物体目标导航框架。整体工作流程如图2(https://arxiv.org/html/2607.13072#S1.F2)所示,该框架通过将零样本物体导航问题分解为三个层次来解决挑战:高层推理模块基于LLM推断房间类型;中层决策模块通过面向目标的房间语义亲和度评分选择最优前沿;低层执行模块规划从当前位置到目标区域的最优路径并执行运动命令。通过由粗到精的层次化决策逻辑,该框架将LLM的高层语义推理能力与低层几何路径规划深度融合。所有模块协同工作构成闭环。这种设计使得智能体在零样本场景下能够像人类一样“先判断场景语义,再进行针对性物体探索”,显著提升了导航的目的性和效率。
### III-C 地图表示
我们首先构建语义地图,借鉴SemExp[5(https://arxiv.org/html/2607.13072#bib.bib21)]中提出的方法。初始时,我们初始化一个维度为\(K \times M \times M\)的矩阵来存储语义地图信息,其中\(M \times M\)表示地图的大小,\(K\)表示语义地图的总通道数,且\(K = C + 2\)。语义地图的前两个通道分别记录障碍物分布和已探索区域信息,其余\(C\)个通道各对应一个语义类别,用于表示环境中不同物体的分布。在智能体初始化阶段,我们将其起始位置设于地图中心,即坐标\((M/2, M/2, 0.0)\)。在每个时间步,智能体通过传感器获取当前观测数据,包括RGB图像和深度信息。我们首先从观测中提取深度数据,并基于相机内参将其转换为3D点云。随后,我们使用语义分割模型Mask R-CNN[9(https://arxiv.org/html/2607.13072#bib.bib36)]预测点云中每个点的语义标签,从而获得带有类别信息的语义点云。为了构建适合导航的2D地图表示,我们将语义点云投影到3D体素空间以形成体素化表示。通过对不同高度范围内的体素进行垂直投影和融合,得到2D语义地图。最后,我们分别生成障碍物地图、已探索区域地图以及对应不同语义通道的语义地图。
### III-D LLM驱动的房间类型推断
高层推理模块帮助智能体更好地理解周围环境,并根据观察到的物体类型推断当前候选前沿可能包含的房间语义类别。它利用LLM中嵌入的常识知识作为零样本房间分类器,无需在训练过程中获取房间类型标注信息,模拟了人类推理环境上下文的能力。
首先,从语义地图的前两个通道提取障碍物地图和已探索地图。为了进一步防止智能体与障碍物碰撞,我们对障碍物地图的边缘进行膨胀操作。然后,从已探索地图中减去膨胀后的障碍物地图以得到初始前沿单元。对这些前沿单元进行连通性分析、聚类,并去除小型聚类。最后,使用文献[13(https://arxiv.org/html/2607.13072#bib.bib37)]中提到的混合标准评分方法(一种结合距离成本和前沿点占用面积的加权评分机制)对前沿进行筛选,定义如下:
\[
S_{f_i}^{\text{MC}} = \alpha \cdot A(f_i) + \beta \cdot D(f_i), \quad f_i \in F \ (i=1,2,\dots,n).
\]
(1)
其中\(\alpha\)和\(\beta\)是权重,\(A(f_i)\)表示前沿所占面积,\(D(f_i)\)表示从前沿中心点到智能体的最短路径距离。通过这种方法,我们可以获得智能体当前位置的候选前沿\(f_i \in F\),此处候选前沿数量设为\(n=4\)。
我们预定义了一个候选房间类型集合,包含七种常见室内类别:
\[
R = \{\text{living room, bedroom, bathroom, kitchen, dining room, office, hallway}\}.
\]
这组房间类型涵盖了室内环境中的大多数功能空间,并支持家居场景中的房间语义推理。通过基于常识的空间分类而非数据驱动的聚类,我们确保零样本泛化能力未来能够扩展到其他室内环境。
为了使LLM执行房间预测任务,对于每个候选前沿,我们聚合前沿局部窗口内的已知物体,并构建如下提示模板:
\[
\mathrm{Prompt}(O, r) = \text{“A room containing ”} + \mathrm{concat}(O) + \text{“ is likely a ”} + r + \text{“.”}.
\]
(2)
其中\(O = \{o_1, o_2, \ldots, o_n\}\)表示前沿局部窗口内物体的类型,\(r \in R\)表示候选房间类型。
对于每个候选房间类型\(r_i\),我们使用LLM计算兼容性分数:
\[
\text{score}(r_i \mid O) = - \mathcal{L}_{\text{LLM}}(\text{Prompt}(O, r_i)).
\]
(3)
其中\(-\mathcal{L}_{\text{LLM}}\)表示提示序列的语言建模损失。由于较低的损失意味着较高的概率,我们取其负值作为前沿房间类型分数。最后通过softmax归一化得到房间类型概率分布:
\[
P(r_i \mid O) = \frac{\exp(\text{score}(r_i \mid O))}{\sum_{j=1}^{|R|} \exp(\text{score}(r_j \mid O))}.
\]
(4)
前沿的局部窗口机制如下:
\[
O_f = \{o \in O \mid \text{frontier}(o) \in \text{Window}(f, w, h)\}.
\]
(5)
其中\(O = \{o_1, o_2, \ldots, o_n\}\)表示语义地图中所有检测到的物体的集合,\(\text{Window}(f, w, h)\)定义了一个以前沿点\(f\)为中心、大小为\(w \times h\)的搜索区域。
参见图标题图3:在Habitat平台上寻找椅子的物体目标导航实验过程。
### III-E 面向目标的语义亲和度评分
中层决策模块负责评估所有候选前沿在实现当前导航目标方面的潜在价值。在高层推理模块提供的语义信息和几何数据的指导下,智能体综合评估并识别出最优探索前沿。基于房间类型的概率分布,中层决策模块对目标物体与候选房间之间的语义亲和度进行建模。相似文章
以对象为中心的残差强化学习用于零样本Sim-to-Real VLA增强
一个以对象为中心的残差强化学习框架提升了视觉-语言-动作模型的零样本模拟到真实迁移能力,在无需真实世界训练的情况下,将操作任务的成功率从42%提高到76%。
基于大语言模型的零样本目标识别
本文首次系统性地对前沿大语言模型在经典PDDL规划基准上的零样本目标识别能力进行评估,发现部分模型能随证据积累而扩展性能,而另一些模型则始终依赖世界知识先验,不受观测累积影响。
面向LLM智能体的层级图记忆:路径级定位与重写
本文介绍了HiGram,一种面向LLM智能体的演化式层级图记忆框架,具备路径级定位与协同重写功能,以提高长期推理任务中的检索效率和答案质量。
UniDoc-RL:基于层次化动作与密集奖励的粗到细视觉RAG
UniDoc-RL 提出了一种面向大型视觉-语言模型的强化学习框架,通过层次化决策与密集多奖励监督来优化检索、重排序和视觉推理,在视觉RAG任务上相较此前基于RL的方法实现了高达17.7%的性能提升。
通过分层推理和话语级目标奖励增强LLMs的社交智能
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。