部分可观测环境中的生成模型预测规划导航
摘要
本文介绍了BeliefDiffusion,一种结合扩散模型表示多模态信念分布和使用模型预测控制在部分可观测环境中进行规划的框架,相比基线方法取得了更好的导航成功率和路径效率。
arXiv:2606.18888v1 公告类型: new
摘要:部分可观测环境中的导航对自主智能体来说是一个重大挑战,需要在未知环境中利用有限的感知信息进行有效决策。基于信念的方法,特别是那些使用神经网络近似信念空间的方法,往往无法捕捉信念空间固有的多模态性,尤其是在存在感知混淆的高维情况下。虽然生成模型提供了一种有吸引力的替代方案,但它们通常需要大量数据或专家演示,并且缺乏明确的长期规划机制。在本文中,我们介绍了BeliefDiffusion,一种结合了生成和规划优势的新框架。BeliefDiffusion利用扩散模型显式表征多模态信念分布,并利用模型预测控制(MPC)同时进行前瞻规划。它包含两个步骤:(1) 基于观测历史想象合理的环境配置,(2) 在聚合配置上规划高效的导航策略。通过在合成地图环境中的大量实验,我们证明BeliefDiffusion在导航成功率和路径效率上显著优于无模型强化学习基线和其他生成方法。我们的结果验证了将多模态信念表征显式融入规划可以在部分可观测环境中实现更鲁棒的导航。
查看缓存全文
缓存时间: 2026/06/18 05:41
# 面向部分可观测环境导航的生成式模型预测规划
来源:https://arxiv.org/html/2606.18888
\\authornote
这些作者对这项工作贡献相同。\\affiliation\\department计算机科学系\\institution曼彻斯特大学\\city曼彻斯特\\country英国
\\authornotemark
[1]\\affiliation\\department计算机科学系\\institution阿尔托大学\\city埃斯波\\country芬兰
\\authornotemark
[1]\\affiliation\\department计算机科学系\\institution曼彻斯特大学\\city曼彻斯特\\country英国
\\affiliation\\department
计算机科学系\\institution曼彻斯特大学\\city曼彻斯特\\country英国
\\affiliation\\department
计算机科学系\\institution阿尔托大学\\city埃斯波\\country芬兰
###### 摘要。
在部分可观测环境中导航对自主智能体构成了重大挑战,要求在未知环境中利用有限的感官信息进行有效决策。基于信念的方法,尤其是使用神经网络近似信念空间的方法,往往无法捕捉信念空间固有的多模态性,尤其是在存在感知混淆的高维情况下。虽然生成模型提供了一种有吸引力的替代方案,但它们通常需要大量数据或专家演示,并且缺乏长期规划的明确机制。在本文中,我们提出了*BeliefDiffusion*,一个结合了生成和规划优势的新型框架。*BeliefDiffusion*利用扩散模型显式表征多模态信念分布,并利用模型预测控制(MPC)同时进行前瞻规划。它包含两个步骤:(1)基于观测历史想象合理的环境配置,以及(2)在聚合的配置上规划高效的导航策略。通过在合成地图环境中的广泛实验,我们证明BeliefDiffusion在导航成功率和路径效率上显著优于无模型强化学习基线和其他生成方法。我们的结果验证了将多模态信念表征显式纳入规划,能够在部分可观测环境中实现更鲁棒的导航。
###### 关键词和短语:
扩散模型、部分可观测环境、模型预测控制
## 1. 引言
我们研究部分可观测环境中的点目标导航,其中智能体必须到达指定的目标位置,且事先不知道环境结构(即地图)。在我们的设置中,智能体只能观测到自身周围有限的局部区域以及其与目标坐标的相对位置。这类导航在多个领域提出了根本性挑战,例如机器人学ross2008bayesian和自动驾驶ort2018autonomous。在此设置中,智能体必须基于关于其周围环境的有限或不完整感官信息做出决策。解决这一挑战的一种传统方法是通过部分可观测马尔可夫决策过程(POMDP),其假设智能体无法直接观测真实状态,而是需要基于迄今为止收到的观测,维护一个关于所有可能状态的概率“信念”——也称为信念MDP。通过构建与观测一致的环境状态表示,智能体可以在不确定性下做出更明智的决策。由于信念状态是智能体历史的一个充分统计量,无需保留不断增长的过去动作和观测记录,从而使决策能够依赖固定大小的表示。此外,通过在信念状态空间上最大化期望总折扣奖励,智能体可以实现最优决策。同时定位与地图构建(SLAM)等技术已被用于构建环境的信念表示durrant2006simultaneous。最近的方法利用基于神经网络的世界模型从观测历史推断环境状态zou2024diffbev;zhang2024imagine。
然而,这些基于信念的方法常常将信念表示简化为单峰点估计,即最可能的状态zhang2024imagine,牺牲了在部分可观测环境下最优导航所需的概率推理。这一局限性在存在感知混淆和传感器范围受限的环境中尤为突出,因为此时存在多种合理的配置。在这种情况下,单峰近似无法捕捉信念空间真正的多模态性,导致次优决策gupta2024efficient。此外,这些方法难以应对高维信念空间,并且需要显式的环境模型,这在复杂、未知环境中难以获取karkus2017qmdp;hoerger2019pomdp。先前克服这些局限的尝试包括使用生成模型直接拼接导航轨迹而不进行显式规划ha2018world;janner2022planning,或采用强化学习wijmans2019dd,专注于无模型和端到端训练。通过学习结构化的隐空间,生成模型在不直接与真实环境交互的情况下提升了决策效率。它们有效地编码了复杂的状态分布hafner2019dream,捕获了多种可能的状态。这使得它们特别适用于大规模、高维环境。尽管有这些优势,这些模型仍然需要专家演示yu2024trajectory或大量离线轨迹janner2022planning,并且常常忽略导航中长期和鲁棒规划的需求hong2023diffused。
在本文中,我们结合了生成和规划两者的优势,提出了*BeliefDiffusion*,一个利用扩散模型显式表征多模态信念分布,并利用模型预测控制(MPC)同时进行前瞻规划的新型框架。BeliefDiffusion遵循两步过程:(1)基于观测历史想象合理的环境配置,以及(2)在聚合的配置上规划高效的导航策略。首先,我们的模型将信念估计泛化为分布生成,产生与过去观测一致的可能地图布局。我们的关键见解是将地图布局推断视为一个条件生成建模问题,从而捕获合理环境的多模态分布。通过学习生成多样且逼真的局部地图,我们的模型构建了一个关于可能世界的显式信念表示。
参见图注图1。BeliefDiffusion使用扩散模型显式表征多模态信念分布,从部分观测中生成合理的环境配置。然后我们利用模型预测控制(MPC)在这些信念上规划鲁棒的导航策略,从而在未知环境中实现高效导航。其次,我们将这种信念表示集成到MPC规划框架中。我们根据动态模型和来自潜在地图布局分布的动作提议迭代地最小化成本,然后在每个时间步选择局部最优轨迹。通过在采样的布局上联合执行路径规划,我们识别出在无法进行准确长时程规划的环境中鲁棒且高效的导航策略。图1(https://arxiv.org/html/2606.18888#S1.F1)展示了BeliefDiffusion的关键步骤,从初始观测到信念采样和路径规划。
通过在合成地图环境中的大量实验,我们证明BeliefDiffusion在导航成功率和路径效率上显著优于现有方法。我们的结果表明,通过将经过推理的信念空间显式纳入MPC,我们的框架能够在复杂、未知环境中实现更明智的决策,且不需要强化学习方法所需的大量训练数据。我们的主要贡献包括:
- •一种新颖的基于扩散的方法,用于在导航中显式建模多模态信念状态,
- •一个信念空间模型预测规划框架,集成了生成的地图布局以实现导航中的鲁棒决策,
- •强有力的实证证据表明,与无模型RL方法和依赖于单峰近似的方法相比,样本效率和性能均有提升。
本质上,我们的方法首先*想象*世界未知部分的几种合理版本,然后*规划*在这些可能性上都能良好工作的动作。具体来说,扩散模型接受智能体的部分经验(比如迄今为止瞥见的走廊草图),并提出多个可能的局部地图,而不是赌一个单一猜测。然后MPC在这一小束地图上评估短动作序列,并选择那些能朝着目标前进同时避免在任何合理替代方案中失败的移动。这个两步的“先想象再规划”循环随着新观测的到来而重复,因此差劲的假设被丢弃,好的假设得到强化,就像一个随着道路逐渐揭示而不断重新计算的卫星导航。一个简单的类比:如果前方可能存在两条通道,我们为两者都做好准备,选择那条无论哪条通道成真都保持安全且有用的转弯。这使得智能体对感知混淆具有鲁棒性,减少错误转弯,并节省数据,因为我们不需要为每种情况学习一个整体策略,只需要生成少数合理的地图并选择能够对冲这些地图的动作。简而言之,显式地对不确定性建模,然后*通过*不确定性进行规划,正是BeliefDiffusion在具有挑战性的部分可观测导航中取得成功的原因。
## 2. 相关工作
#### 用于部分可观测性的POMDP。
在未知环境中导航由于部分可观测性和未知环境动态而面临重大挑战。部分可观测马尔可夫决策过程(POMDP)kaelbling1998planning通过维护关于可能环境配置的信念状态,为部分可观测性下的决策提供了一个数学框架。这使得智能体能够执行信念空间规划,对隐状态分布进行推理以应对感知混淆和模糊观测。POMDP框架已在涉及部分可观测性的各种机器人任务中表现出成功,尤其是在导航场景中martinez2009bayesian;lauri2016planning。尽管理论上优雅,经典POMDP求解器面临严重的可扩展性挑战。这些算法难以处理高维信念状态hauskrecht2000value,并且通常需要显式的转移模型,这在复杂、未知环境中需要大量数据收集karkus2017qmdp;hoerger2019pomdp。虽然PPOschulman2017proximal;wijmans2019dd等强化学习方法提供了替代方案,但它们常常遭受数据低效和训练不稳定的困扰。最近的神经方法ramakrishnan2022poni;zhang2024imagine尝试在POMDP中对信念分布进行建模,但未能解决一个关键挑战:在地图环境中捕捉信念状态的多模态性。相反,这些方法倾向于坍塌到最可能的隐状态,或依赖于模型中的单个样本,而不是维护完整的信念分布,而后者对于部分可观测性下的最优决策是必要的。
#### 用于环境理解的世界模型。
生成模型在决策问题中扮演着越来越重要的角色,通常被称为世界模型。这些模型具有多种功能:(1)学习环境的抽象表示ha2018world,(2)预测未来状态hansen2022modem,以及最终为决策过程提供上下文信息。生成技术的最新进展,特别是扩散模型,已被应用于复杂场景中的未来状态预测janner2022planning,包括自动驾驶zheng2025diffusion。这些方法有效地为建模未来轨迹提供了概率框架。然而,大多数现有方法在范围上受到限制,主要关注预测观测级状态,而不是开发整体的环境表示。更简洁且面向任务的表示,如占据网格wang2024occsora或鸟瞰图表示zou2024diffbev,通常更为有效,特别是对于导航任务。虽然这些专门的模型提供了高度描述性的信息,但它们通常缺乏与决策过程的直接集成——这是有效导航的关键组成部分。
## 3. 预备知识
在这一节中,我们简要介绍部分可观测马尔可夫决策过程(POMDP)、模型预测控制以及带有无分类器引导的扩散模型。
### 3.1. 部分可观测马尔可夫决策过程(POMDP)
部分可观测马尔可夫决策过程(POMDP)正式定义为六元组⟨S,A,O,T,Z,R⟩\\langle\\mathcal\{S\},\\mathcal\{A\},\\mathcal\{O\},\\mathcal\{T\},\\mathcal\{Z\},\\mathcal\{R\}\\rangle。其中,S\\mathcal\{S\}表示状态集,A\\mathcal\{A\}表示可用动作集。智能体从观测集O\\mathcal\{O\}中接收观测,这些观测提供了关于底层状态的部分信息。系统根据转移概率函数T(s,a,s′)=P(st+1=s′∣st=s,at=a)\\mathcal\{T\}\(s,a,s^\{\\prime\}\)=P\(s\_\{t\+1\}=s^\{\\prime\}\\mid s\_\{t\}=s,a\_\{t\}=a\)演化。观测概率函数Z(s′,a,o)=P(ot+1=o∣st+1=s′,at=a)\\mathcal\{Z\}\(s^\{\\prime\},a,o\)=P\(o\_\{t\+1\}=o\\mid s\_\{t\+1\}=s^\{\\prime\},a\_\{t\}=a\),指定了在系统通过动作aa转移到状态s′s^\{\\prime\}后接收到观测oo的可能性。最后,奖励函数R(s,a)\\mathcal\{R\}\(s,a\)决定了在状态ss下执行动作aa时获得的即时奖励。POMDP问题可以转化为一个在信念状态上的完全可观测马尔可夫决策过程(MDP),通常称为信念MDP。更正式地说,状态空间由所有可能的信念状态组成,记为b∈Δ(S)b\\in\\Delta\(\\mathcal\{S\}\),其中Δ(S)\\Delta\(\\mathcal\{S\}\)表示状态空间S\\mathcal\{S\}上所有概率分布的集合。动作空间与原始POMDP相同,即A\\mathcal\{A\}。转移函数τ(b,a,b′)\\tau\(b,a,b^\{\\prime\}\)给出了在信念状态bb下采取动作aa后转移到信念状态b′b^\{\\prime\}的概率。奖励函数定义为ρ(b,a)=∑s∈Sb(s)R(s,a)\\rho\(b,a\)=\\sum\_\{s\\in\\mathcal\{S\}\}b\(s\)\\mathcal\{R\}\(s,a\),其中b(s)b\(s\)是状态ss的信念概率,R(s,a)\\mathcal\{R\}\(s,a\)是原始POMDP中的奖励函数。当智能体在信念状态bb下采取动作aa并接收到观测oo时,信念状态使用贝叶斯规则更新:b′(s′)=P(o∣s′,a)∑s∈SP(s′∣s,a)b(s)P(o∣b,a)b^\{\\prime\}\(s^\{\\prime\}\)=\\frac\{P\(o\\mid s^\{\\prime\},a\)\\sum\_\{s\\in\\mathcal\{S\}\}P\(s^\{\\prime\}\\mid s,a\)b\(s\)\}\{P\(o\\mid b,a\)\}其中P(o∣b,a)P\(o\\mid b,a\)由下式给出:P(o∣b,a)=∑s′∈SP(o∣s′,a)∑s∈SP(s′∣s,a)b(s)P\(o\\mid b,a\)=\\sum\_\{s^\{\\prime\}\\in\\mathcal\{S\}\}P\(o\\mid s^\{\\prime\},a\)\\sum\_\{s\\in\\mathcal\{S\}\}P\(s^\{\\prime\}\\mid s,a\)b\(s\)相似文章
面向部分可观测环境下自动驾驶的统一风险地图学习
提出了一种面向部分可观测环境的自动驾驶统一风险地图建模框架,该框架通过时空建模和基于扩散的场景生成,整合了交通流风险和碰撞风险。在Waymo Open Motion数据集上,该方法优于最先进的遮挡感知基线。
UniNav:用于视觉导航的统一世界-动作扩散模型
UniNav是一个统一的世界-动作扩散模型,用于图像目标视觉导航。它在单个扩散过程中联合预测未来的视觉观察和航点轨迹,以高效推理实现了强大的基准测试结果。
从噪声到控制:Parameterized Diffusion Policies
本文介绍了参数化扩散策略(Parameterized Diffusion Policy, PDP)框架,该框架通过以低维潜在参数为条件,使扩散策略变得可控,从而实现无需重新训练即可进行平滑的行为插值和自适应。在仿真和真实机器人实验中,该方法在复杂的多模态机器人任务上展现了更优的性能。
基于多AUV自组网的目标跟踪:一种价值梯度引导的多智能体扩散强化学习方法
本文提出了VGG-MADiffRL——一种价值梯度引导的多智能体扩散强化学习算法,以及MDCA——一种分层控制架构,用于在受限声学通信和动态水下扰动下多AUV自组网中的协同目标跟踪。
MBDiff:多视图行为感知扩散模型用于概率性公用事业数据插补
提出MBDiff,一种用于概率性公用事业数据填补的多视图行为感知扩散模型,该模型从全局、局部和实例级视图学习用户行为,并使用条件注意力去噪网络。在佛罗里达州的真实公用事业数据上进行的评估表明,它优于最先进的基线模型。