视觉语言导航中用于语义探索的路径级事后指令

arXiv cs.AI 论文

摘要

介绍 Φ-Nav,一种统一的在线策略框架,利用事后推理从探索轨迹中合成生成路径级指令,弥合视觉语言导航中的语义监督差距,并在 R2R-CE 和 RxR-CE 基准测试上以更少的专家演示取得了竞争性结果。

arXiv:2607.01754v1 公告类型:新 摘要:在线策略探索是训练鲁棒视觉语言导航智能体的关键组成部分,因为它使策略暴露于更广泛的状态分布。然而,这种探索不可避免地导致偏离专家演示的轨迹,导致执行视觉流与原始语言指令之间的语义不匹配。在这项工作中,我们通过引入 Phi-Nav 来解决这一挑战,Phi-Nav 是一种统一的在线策略框架,利用事后推理来使指令与智能体的实际探索旅程对齐。具体来说,Phi-Nav 通过三阶段双重监督循环运行:1) 智能体执行 oracle 引导的在线策略探索,在从专家动作反馈中学习的同时采样轨迹,2) 一个事后说话者基于收集的视觉观察合成路径级事后指令,3) 智能体进行第二次模仿,将合成的轨迹-指令对视为额外的专家演示。通过这个过程,Phi-Nav 弥合了在线策略方法中固有的关键语义监督差距,将无语义标记的运动转化为密集的训练信号。在 R2R-CE 和 RxR-CE 基准上的评估表明,Phi-Nav 在仅使用当前基线所用专家演示的一小部分的情况下取得了竞争性性能。这些结果强调了 VLN 中语义探索的必要性,将 Phi-Nav 定位为在有限数据下训练具身智能体的有效解决方案。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:45

# 基于路径级事后指令的视觉-语言导航语义探索方法 来源: https://arxiv.org/html/2607.01754

11institutetext:高丽大学,首尔,韩国
22institutetext:密歇根大学,安娜堡,密歇根,美国
††footnotetext:⋆\\star 在密歇根大学作为访问研究员期间完成的工作。
††footnotetext:†\\dagger 通讯作者 \{[email protected]; [email protected]\}

###### 摘要

在线策略探索是训练鲁棒视觉-语言导航(VLN)智能体的关键组成部分,因为它使策略暴露于更广泛的状态分布。然而,这种探索不可避免地会导致轨迹偏离专家演示,从而在执行视觉流与原始语言指令之间产生语义不匹配。在这项工作中,我们通过引入 Φ\\Phi-Nav(一个统一的在线策略框架)来应对这一挑战,该框架利用事后推理将指令与智能体的实际探索旅程对齐。具体来说,Φ\\Phi-Nav 通过一个三阶段双监督循环运作:1)智能体在 oracle 指导下进行在线策略探索,采样轨迹的同时学习专家动作反馈;2)一个事后说话者根据收集到的视觉观测合成一条路径级事后指令;3)智能体执行第二次模仿,将合成的轨迹-指令对视为额外的专家演示。通过这一过程,Φ\\Phi-Nav 弥合了在线策略方法中固有的关键语义监督差距,将语义未标记的运动转化为密集的训练信号。在 R2R-CE 和 RxR-CE 基准上的评估表明,Φ\\Phi-Nav 在仅需当前基线所用专家演示一小部分的情况下,就能取得有竞争力的性能。这些结果强调了 VLN 中语义探索的必要性,并将 Φ\\Phi-Nav 定位为一种在有限数据下训练具身智能体的有效解决方案。

## 1 引言

视觉-语言导航(VLN)领域是具身 AI 的基石,要求智能体将自然语言指令嵌入复杂、未见过的环境中[anderson2018vision,wu2024vision]。为了实现鲁棒的泛化,现代 VLN 系统越来越多地在训练期间依赖在线策略探索,使智能体暴露于多样且动态演变的状态分布中[liu2024vision,an2024etpnav,cheng2024navila,lee2024learning,zeng2025janusvln]。尽管架构上的进步显著提升了感知和跨模态推理能力,但将探索行为与连贯的语言监督对齐这一根本挑战仍未解决。

为了增强鲁棒性,许多 VLN 策略采用在线策略方法,例如计划采样[bengio2015scheduled]和 DAgger[ross2011reduction],这些方法通过允许智能体在其自身策略下行动的同时接收专家动作反馈,来缓解暴露偏差¹。尽管这些方法拓宽了探索的状态空间,但它们仍然在语义上局限于静态、预采集的指令。例如,当智能体偏离专家预设路径时,原始指令不再准确描述执行中的视觉流。结果,很大一部分探索轨迹缺乏语义对齐的语言监督,从而限制了在线策略轨迹的充分利用。

[参见图标题]

图 1:VLN 训练策略的概念对比。(a) 离线策略 IL 依赖于静态专家路径,无法考虑智能体探索。(b) 在线策略 IL 使智能体暴露于探索状态,但在语义上仍局限于原始指令,造成监督不匹配。(c) 我们利用路径级事后重标来为探索轨迹生成新指令,将偏差转化为有意义的训练信号。

为了弥合在线策略 VLN 策略训练中的语义监督差距,我们提出 Φ\\Phi(phi)-Nav,一个从路径级事后指令中学习的框架。我们的方法认识到,每次探索 rollout 都包含可学习的叙事,而这些叙事对传统训练目标来说是看不见的。为了捕获这一潜在知识,Φ\\Phi-Nav 引入了一个三阶段双监督循环,作为现有在线策略算法的包装器。首先,智能体在接收来自专家 oracle 的实时动作修正的同时采样一条轨迹。接下来,Φ\\Phi-Nav 利用预训练大型视觉-语言模型(LVLM)[hurst2024gpt,bai2025qwen3] 鲁棒的多模态时空推理能力,回顾性地对其探索旅程进行重标。通过合成精确描述智能体实际视觉观测的路径级事后指令,Φ\\Phi-Nav 将任意的探索噪声转化为密集、语言基础的训练演示。最后,智能体执行第二次模仿,将合成的轨迹-指令对视为额外的专家演示,从而沿执行路径强化语义基础。

对 VLN 实施事后重标提出了独特的挑战:与通常在预定义目标空间内重标最终状态的传统事后范式不同[andrychowicz2017hindsight],我们的框架必须叙述时间延展的、开放式的轨迹,同时还要减轻 LVLM 的幻觉[li2023evaluating,wu2025generate]。我们通过两个关键机制来应对这些障碍。首先,我们提出专家上下文学习[brown2020language]来确保合成指令在结构和风格上与训练分布保持一致。这在强制分布对齐语言风格的同时,允许特定的视觉观测决定语义内容。其次,我们引入一种轨迹-指令对齐加权机制[shi2022emscore,hessel2021clipscore,sarto2023positive],根据语义保真度自适应地对事后监督进行加权。通过评估视觉轨迹与合成指令之间的一致性,该框架抑制被幻觉化或弱基础的信号,确保只有可靠的语言监督影响策略优化。这些组件共同将 Φ\\Phi-Nav 转变为一个自我修正、自主的监督引擎,显著提升样本效率。

我们在 R2R-CE 和 RxR-CE 数据集上进行了广泛实验,并展示了 Φ\\Phi-Nav 的独特优势。具体来说,Φ\\Phi-Nav 不仅在使用完整专家数据集时提升了当前在线策略训练的性能,而且在需要更少专家演示时仍然保持高度竞争力。这一优势表明,我们的路径级事后指令相比传统的固定轨迹演示提供了更丰富的监督信号,为能够有效自我监督并通过直接环境经验扩展其智能的自主智能体铺平了道路。

本工作的贡献可总结如下:

- • 我们提出了一种新颖的在线策略 VLN 框架 Φ\\Phi-Nav,通过将探索 rollout 转化为密集的路径级事后指令,弥合了训练中缺失的语义监督差距。
- • 我们将事后范式扩展到时间上连续的轨迹,利用专家上下文学习进行分布对齐,并使用轨迹-指令对齐加权确保准确、无幻觉的事后监督。
- • 在 R2R-CE 和 RxR-CE 上的评估表明,Φ\\Phi-Nav 具有样本高效性,在减少对专家数据依赖的同时取得了有竞争力的导航性能。

## 2 相关工作

### 2.1 视觉-语言导航

视觉-语言导航(VLN)是具身 AI 中的一项基本任务,要求智能体在 3D 环境中理解和遵循自然语言指令[anderson2018vision,wu2024vision,song2025towards,ko2025active,kim2025test,chen2025constraint]。VLN 任务的序列决策性质使其倾向于采用诸如强化学习(RL)或模仿学习(IL)等策略训练方法。基于 RL 的方法[wang2019reinforced,chen2021history,bundele2024scaling,zhang2025activevln,qi2025vln]通过学习最大化预定义的奖励/得分函数来优化导航策略。然而,由于 RL 在奖励建模方面固有的困难,许多 VLN 策略将 IL 作为其主要目标[anderson2018vision,krantz2020beyond,chen2022think,an2023bevbert,an2024etpnav,kamath2023new,gao20253d,wei2025streamvln]。这些方法利用诸如计划采样[bengio2015scheduled]和 DAgger[ross2011reduction]之类的在线策略轨迹采样方法,因为它们通过迫使智能体从自身错误中学习来有效缓解暴露偏差,从而缩小训练和推理之间的分布偏移。例如,[anderson2018vision]中的基础方法将学生迫使引入 VLN 领域,证明在智能体自身采样的动作上进行训练对于学习错误恢复行为至关重要。尽管有这些进步,一个根本瓶颈仍然存在:当智能体探索远离专家演示的路径时,原始指令变得语义无关,导致语义监督差距。我们提出的 Φ\\Phi-Nav 通过生成路径级事后指令来弥合这一差距,这些指令为智能体执行的任何探索动作提供精确、密集的监督,有效将训练扩展到静态专家数据的限制之外。

### 2.2 导航指令生成

导航指令生成是 VLN 研究中的一个重要子任务,它能够实现精确且可解释的人机交互。Speaker-Follower 框架[fried2018speaker]开创了 "说话者" 模型将路径反向翻译成指令的方法,从而可以创建大量合成训练数据。EnvDrop[tan2019learning]进一步细化这一概念,通过环境丢弃法合成导航对并显著提升泛化能力。Marky[wang2022less]通过提取视觉地标进一步扩展了增强方案。最近的工作利用 LVLM 丰富的预训练知识,要么将其用作零样本生成器[yan2024instrugen,zheng2026canespeaker],要么进一步微调以生成语言多样且空间基础的指令[fan2025scene,kong2024controllable,fan2024navigation]。在 Φ\\Phi-Nav 中生成事后指令带来了若干独特的挑战,使其目的与这些工作区分开来。虽然以前的工作侧重于预训练或离线增强,但我们的框架设计用于在在线策略训练流程中为探索路径提供语义监督,这是现有文献中被忽视的一个范式。此外,由于在线策略探索常常产生次优的循环或偏差,Φ\\Phi-Nav 必须严格验证指令流,确保只有语义和逻辑一致的标签被用于监督导航策略。

### 2.3 事后经验学习

事后经验学习被引入以在稀疏奖励设置中通过用替代的已达成目标对失败轨迹进行重标来提高样本效率。开创性的 Hindsight Experience Replay (HER)[andrychowicz2017hindsight]引入了目标替换以提高样本效率。后续工作将事后重标扩展到视觉目标条件设置[nair2018visual,pong2018temporal]、分层/多目标 RL[levy2019hierarchical,nachum2018data]、基于模型的想象[kaiser2020model,hafner2020dream]以及课程/优先重标[fang2019curriculum,luo2020energy]。最近,受事后原则启发,语言模型已被用于为策略学习提供回顾性反馈和自我改进信号[huang2022language,zhou2023language,xu2023reflexion,liang2023react]。THER[cideron2019self]和 HSL[li2026spinning]与我们工作密切相关,因为它们使用了语言引导的事后信号,然而这些方法主要在结构化的预定义目标空间上运行,通常重标终端状态或标量奖励。相比之下,Φ\\Phi-Nav 将事后学习从目标替换扩展到时间上连贯的、细粒度的路径级指令重标。通过整合基于 LVLM 的指令合成与语义验证,我们的框架建立了一个专用于在线策略 VLN 训练中具身语言基础的事后范式。

## 3 方法

在本节中,我们详细描述 Φ\\Phi-Nav 的架构和训练范式。我们首先在第 3.1 节 (https://arxiv.org/html/2607.01754#S3.SS1) 中定义导航环境和我们的探索策略。接下来,我们详细说明我们流程的三个阶段:在线策略轨迹采样(第 3.2 节 (https://arxiv.org/html/2607.01754#S3.SS2))、路径级事后指令生成(第 3.3 节 (https://arxiv.org/html/2607.01754#S3.SS3))以及最终的双监督优化过程(第 3.4 节 (https://arxiv.org/html/2607.01754#S3.SS4))。Φ\\Phi-Nav 的总体框架如图 2 (https://arxiv.org/html/2607.01754#S3.F2) 所示。

### 3.1 问题形式化

#### 3.1.1 视觉-语言导航

在视觉-语言导航(VLN)任务中,智能体必须穿越一个 3D 环境,以到达由自然语言指令 II 指定的目的地。在每个离散时间步骤 tt,智能体接收一个视觉观测 vtv_{t},无论是单目视图还是全景视图。基于当前视觉观测和指令,智能体预测下一个动作 at∈Aa_{t} \in \mathcal{A},其中 A\mathcal{A} 是总动作空间。主要目标是学习一个策略 πθ(at|vt,I)\pi_{\theta}(a_{t}|v_{t},I),该策略最大化成功到达目标的比率,同时确保每个导航动作都精确地基于指令的语义约束。

#### 3.1.2 在线策略探索策略

为了实现鲁棒的导航,VLN 策略经常采用在线策略探索策略,例如计划采样[bengio2015scheduled]和 DAgger[ross2011reduction],以使智能体暴露于更广的状态空间。在每个时间步骤 tt,动作 ata_{t} 根据以下方式采样:

at∼{at∗w.p.ε(i)πθ(a|vt,IE∗)w.p.1−ε(i),
a_{t}\sim\begin{cases}a_{t}^{*}&\text{w.p. }\epsilon^{(i)}\\
\pi_{\theta}(a|v_{t},I^{*}_{E})&\text{w.p. }1-\epsilon^{(i)},\end{cases}

其中 at∗a_{t}^{*} 表示专家动作,ε(i)\epsilon^{(i)} 是第 ii 个训练回合的衰减因子,它逐渐将采样从专家的教师迫使过渡到智能体当前策略 πθ\pi_{\theta}。虽然这些方法有效扩展了访问的状态空间,但它们引入了一个显著的语义差距。当智能体采样 at≠at∗a_{t}\neq a_{t}^{*} 时,它会生成一个探索轨迹 τ={v0,a0,...,vT,aT}\tau=\{v_{0},a_{0},\dots,v_{T},a_{T}\},该轨迹偏离专家路径 τE∗\tau^{*}_{E},使得指令

相似文章

OneVL:基于视觉语言解释的单步隐式推理与规划

Hugging Face Daily Papers

# 论文页面 - OneVL:基于视觉语言解释的单步隐式推理与规划 来源:[https://huggingface.co/papers/2604.18486](https://huggingface.co/papers/2604.18486) 发布于 4月20日 [\#1 每日论文](https://huggingface.co/papers/date/2026-04-21) 作者:, , , , , , , , , , , , , , , , , , , , ## 摘要 OneVL 提出了一个统一的视觉-语言-行动框架,通过整合语言和 v

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。

ABot-N1:迈向通用视觉语言导航基础模型

Hugging Face Daily Papers

ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。

H^2SD:混合事后自我蒸馏

Hugging Face Daily Papers

提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。