Dreamer-SAC:在潜在世界模型中进行离策略学习以实现样本高效的自动驾驶

arXiv cs.LG 论文

摘要

本文提出Dreamer-SAC,一种基于模型的强化学习框架,将递归状态空间世界模型与潜在空间中的软演员-评论家算法相结合,以实现样本高效的自动驾驶。该框架在需要更少的真实环境交互的情况下,优于DreamerV3、SAC和PPO基线。

arXiv:2608.10386v1 公告类型:新 摘要:自动驾驶的样本高效强化学习常常受到数据效率与模型偏差之间权衡的限制。尽管世界模型减少了对昂贵环境交互的依赖,但基于学习动态的策略优化仍然对预测误差敏感。本文提出了Dreamer-SAC框架,该框架将递归状态空间世界模型与直接在潜在空间中训练的离策略软演员-评论家算法相结合。该框架结合了真实交互和短视界生成轨迹,并采用n步目标估计和多目标监督。在以驾驶效率和安全性为目标的自动驾驶场景中评估时,所提出的框架持续优于包括DreamerV3、SAC和PPO在内的代表性强化学习基线,同时在显著减少真实环境交互的情况下实现更优性能。实验揭示了展开视界(rollout horizon)与策略性能之间的倒U型关系,其中短视界潜在展开在额外训练信号与累积模型偏差之间取得了最佳权衡。此外,n步目标估计在利用预测经验进行价值学习方面比单步时序差分目标更有效。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:29

# Dreamer-SAC:潜空间世界模型中的离策略学习用于样本高效的自动驾驶
来源:https://arxiv.org/html/2608.10386
李加卓 曹林江 刘琦 席翔 同济大学 2534457@tongji\.edu\.cn,2431743@tongji\.edu\.cn, liu\_qi@tongji\.edu\.cn,xi\_xiong@tongji\.edu\.cn

###### 摘要

样本高效的自动驾驶强化学习常常受限于数据效率与模型偏差之间的权衡。虽然世界模型减少了对昂贵环境交互的依赖,但基于学习到的动力学的策略优化仍然对预测误差敏感。本文提出Dreamer-SAC框架,将循环状态空间世界模型与直接在潜空间中训练的离策略软演员-评论家算法相结合。该框架结合真实交互与短视界生成的轨迹,使用n步目标估计和多目标监督。在自动驾驶场景中,以驾驶效率与安全性为目标的评估表明,该框架始终优于代表性强化学习基线(包括DreamerV3、SAC和PPO),同时以显著更少的真实环境交互实现更优性能。实验揭示了展开视界与策略性能之间的倒U型关系,其中短视界潜展开在额外训练信号与累积模型偏差之间实现了最佳权衡。此外,n步目标估计在利用预测经验进行价值学习方面比单步时间差目标更有效。

## 1 引言

自动驾驶是下一代智能交通系统的核心使能技术,有望减少交通事故死亡人数、缓解拥堵并提高出行便利性[1](https://arxiv.org/html/2608.10386#bib.bib1)。自动驾驶车辆需要在复杂且不确定的交通环境中做出连续的序列决策,涉及与周围道路使用者的动态交互。然而,大规模部署可靠的自动驾驶决策系统仍然具有挑战性。主要瓶颈在于安全验证的过高成本,因为在长尾和安全关键场景(如碰撞、意外切入和复杂交互)下确保可靠性能需要大量的驾驶经验。真实世界的测试不仅带来巨大的经济成本,还对公共道路安全构成潜在风险[2](https://arxiv.org/html/2608.10386#bib.bib2)。强化学习(RL)为序列决策提供了有前景的数据驱动框架[3](https://arxiv.org/html/2608.10386#bib.bib3),使自主智能体能够通过与环境的交互学习复杂的驾驶策略,而不是仅仅依赖人工设计的决策规则。尽管潜力巨大,但RL在自动驾驶中的实际应用仍然受到样本效率有限的严重制约,因为获得可靠策略通常需要大量交互数据[4](https://arxiv.org/html/2608.10386#bib.bib4)。

基于模型的强化学习(MBRL)近来作为该问题的一种有前景的解决方案引起了广泛关注。MBRL不是每次策略更新都与环境交互,而是学习一个预测环境动态的世界模型,并生成用于策略优化的轨迹。通过用潜空间轨迹展开替代昂贵的环境交互,世界模型在保持有竞争力的控制性能的同时显著提高了数据效率[5](https://arxiv.org/html/2608.10386#bib.bib5)。在此范式基础上,本文提出了一个专为自动驾驶定制的基于模型的RL框架。我们的方法将世界模型与离策略RL相结合,使智能体能够通过真实交互和展开的交互同时学习策略。这最大限度地提高了数据利用率,同时减轻了模型偏差的影响。

现有的自动驾驶决策方法经历了多种范式的演变。早期系统主要依赖基于规则的方法,如有限状态机、行为树和用于场景分解与机动选择的手工启发式规则[6](https://arxiv.org/html/2608.10386#bib.bib6),7(https://arxiv.org/html/2608.10386#bib.bib7)。虽然这些方法具有可解释性和确定性,但难以泛化到真实交通交互的组合复杂性,并且需要大量人工工程来扩展。随后引入了基于优化的技术——特别是模型预测控制(MPC)——以显式利用车辆动力学和约束进行轨迹规划与跟踪[8](https://arxiv.org/html/2608.10386#bib.bib8)。然而,对人工设计成本函数和简化动力学模型的依赖限制了它们在高度交互或不确定环境中的适应性。深度学习的出现使得范式转向数据驱动的策略学习。模仿学习(IL),特别是行为克隆,通过将原始传感器输入映射到控制命令,直接从专家示范中学习驾驶策略[9](https://arxiv.org/html/2608.10386#bib.bib9)。虽然IL在捕捉类人驾驶风格方面有效,但当学习到的策略偏离专家状态分布时,它从根本上受到协变量偏移和复合误差的影响[10](https://arxiv.org/html/2608.10386#bib.bib10)。强化学习(RL)提供了一种替代方案,使智能体能够通过试错交互发现策略,从而优化超出专家示范的长期性能。诸如近端策略优化(PPO)[11](https://arxiv.org/html/2608.10386#bib.bib11)和软演员-评论家(SAC)[12](https://arxiv.org/html/2608.10386#bib.bib12)等无模型RL算法已在连续控制任务中取得了显著成功。为了提高样本效率,基于模型的方法学习预测动力学模型以生成合成轨迹,从而减少对昂贵的真实交互的依赖。早期的研究如基于模型的策略优化(MBPO)[13](https://arxiv.org/html/2608.10386#bib.bib13)表明,来自概率动力学模型集的短视界轨迹展开可以有效地增强离策略SAC训练的真实数据。然而,MBPO在原始状态空间中直接使用显式动力学模型,这限制了其在高维视觉观测(自动驾驶中常见)上的适用性。为克服这一问题,潜空间世界模型学习环境动态的紧凑表示,使得规划与策略优化完全在压缩的潜空间中进行[14](https://arxiv.org/html/2608.10386#bib.bib14),15(https://arxiv.org/html/2608.10386#bib.bib15)。在近期方法中,Dreamer系列通过学习捕获潜动态的循环状态空间模型(RSSM),在连续控制基准测试中展现了显著成功[16](https://arxiv.org/html/2608.10386#bib.bib16)。学习到的潜表示使得规划和策略学习完全在潜空间中进行,避免了策略优化过程中昂贵的像素级重建。

已有若干工作将潜空间世界模型应用于自动驾驶:Gao等人通过语义掩蔽世界模型增强了鲁棒性[17](https://arxiv.org/html/2608.10386#bib.bib17),而Yang等人探索了原始观测与特权特征之间的表示对齐[18](https://arxiv.org/html/2608.10386#bib.bib18)。然而,这些方法主要侧重于提高世界模型本身的表示质量,而不是重新思考潜空间内的策略优化范式。大多数此类方法采用同策略演员-评论家优化策略,将智能体限制在“想象”的世界中训练,缺乏直接从真实世界数据学习的能力。与真实转移不同,预测轨迹不可避免地遭受累积预测误差[19](https://arxiv.org/html/2608.10386#bib.bib19),导致模型偏差随展开视界迅速增加,这将影响策略对安全关键驾驶场景(如碰撞)的评估。

为应对这些挑战,本文提出一个Dreamer-SAC框架,通过短视界轨迹展开和混合重放优化将潜空间世界模型与离策略强化学习相结合。该框架并非完全依赖预测轨迹,而是使用真实交互数据持续更新世界模型,同时从后验RSSM状态生成短潜轨迹展开。真实转移采用传统的单步时间差目标进行优化,而预测轨迹则采用n步目标,以更好地利用展开视界内的长期奖励信息。两种数据源被联合用于评论家和演员优化,使SAC能够受益于模型生成的体验,同时限制长视界模型偏差的不利影响。

本文的主要贡献总结如下:

1. 1.提出了一个基于模型的离策略强化学习框架,将软演员-评论家集成到循环状态空间模型中,使自动驾驶策略能够高效利用模型生成的轨迹展开。
2. 2.开发了一种真实与模型生成体验相结合的混合学习策略,通过将真实转移与采用不同价值估计方案的潜轨迹展开相结合来提高策略可靠性,从而在减轻模型预测误差影响的同时增强数据利用。
3. 3.综合实验证明了所提框架相对于代表性强化学习基线的优越性,并揭示了展开视界与性能之间的倒U型关系,表明短视界轨迹展开在学习收益与模型偏差之间提供了最佳平衡。

## 2 预备知识

本节介绍我们研究的问题,以及关于世界模型和软演员-评论家的背景知识。

### 2.1 问题定义

在真实驾驶中,自我车辆无法访问完整且精确的环境状态,例如其他驾驶者的确切意图或被遮挡的道路区域。相反,它必须仅仅依赖车载传感器,这些传感器提供部分且有噪声的观测。我们将自动驾驶任务建模为部分可观测马尔可夫决策过程(POMDP)[20](https://arxiv.org/html/2608.10386#bib.bib20)。POMDP由元组\(S,A,O,T,Ω,R,γ\)\(\\mathcal\{S\},\\mathcal\{A\},\\mathcal\{O\},\\mathcal\{T\},\\Omega,\\mathcal\{R\},\\gamma\)定义,其中S\\mathcal\{S\}表示真实但不可观测的环境状态。A\\mathcal\{A\}是动作空间,由连续的转向和油门/制动命令组成at=\(asteer,athrottle\)∈\[−1,1\]2\\mathbf\{a\}\_\{t\}=\(a\_\{\\text\{steer\}\},a\_\{\\text\{throttle\}\}\)\\in\[\-1,1\]^\{2\}。O\\mathcal\{O\}是观测空间。在每个时间步tt,自我车辆接收由两种模态组成的观测ot\\mathbf\{o\}\_\{t\}:

ot=\{It,vt\},\\mathbf\{o\}\_\{t\}=\\\{I\_\{t\},\\mathbf\{v\}\_\{t\}\\\},(1)其中It∈RH×W×3I\_\{t\}\\in\\mathbb\{R\}^\{H\\times W\\times 3\}是来自前视摄像头的图像,vt∈R125\\mathbf\{v\}\_\{t\}\\in\\mathbb\{R\}^\{125\}是车辆观测向量,包括LiDAR和自身状态信息。两者都可以通过原始传感器或物理计算直接获得。T\(s′∣s,a\):S×A×S→\[0,1\]\\mathcal\{T\}\(s^\{\\prime\}\\mid s,a\):\\mathcal\{S\}\\times\\mathcal\{A\}\\times\\mathcal\{S\}\\rightarrow\[0,1\]定义了下个状态的条件转移概率分布。Ω\(o∣s,a\):S×A×O→\[0,1\]\\Omega\(o\\mid s,a\):\\mathcal\{S\}\\times\\mathcal\{A\}\\times\\mathcal\{O\}\\rightarrow\[0,1\]定义了给定状态和动作下观测的概率。R:S×A→R\\mathcal\{R\}:\\mathcal\{S\}\\times\\mathcal\{A\}\\rightarrow\\mathbb\{R\}是平衡安全性和效率的奖励函数,γ∈\[0,1\]\\gamma\\in\[0,1\]是折扣因子。智能体的目标是学习一个策略π\(at\|o≤t\)\\pi\(a\_\{t\}\|o\_\{\\leq t\}\),最大化期望累积折扣奖励:

Eπ\[∑t=0∞γtrt\]\.\\mathbb\{E\}\_\{\\pi\}\\left\[\\sum\_\{t=0\}^\{\\infty\}\\gamma^\{t\}r\_\{t\}\\right\]\.(2)

### 2.2 潜空间世界模型

基于模型的强化学习通过学习环境动态的预测模型并生成轨迹以进行策略优化,从而提高样本效率。潜空间世界模型不是直接在高维图像空间中预测未来观测,而是首先将观测压缩为紧凑的潜表示s^t∈Slatent\\hat\{s\}\_\{t\}\\in\\mathcal\{S\}\_\{\\text\{latent\}\},并完全在潜空间中进行转移预测。这在保持控制相关信息的同时大幅降低了计算成本。

世界模型由以下组件组成:

表示模型:s^t∼p\(s^t∣s^t−1,at−1,ot\)\\displaystyle\\quad\\hat\{s\}\_\{t\}\\sim p\(\\hat\{s\}\_\{t\}\\mid\\hat\{s\}\_\{t\-1\},a\_\{t\-1\},o\_\{t\}\)(3)转移模型:s^t\+1∼p\(s^t\+1∣s^t,at\)\\displaystyle\\quad\\hat\{s\}\_\{t\+1\}\\sim p\(\\hat\{s\}\_\{t\+1\}\\mid\\hat\{s\}\_\{t\},a\_\{t\}\)(4)观测模型:o^t∼p\(o^t∣s^t\)\\displaystyle\\quad\\hat\{o\}\_\{t\}\\sim p\(\\hat\{o\}\_\{t\}\\mid\\hat\{s\}\_\{t\}\)(5)奖励模型:r^t∼p\(r^t∣s^t,at\)\\displaystyle\\quad\\hat\{r\}\_\{t\}\\sim p\(\\hat\{r\}\_\{t\}\\mid\\hat\{s\}\_\{t\},a\_\{t\}\)(6)继续模型:c^t∼p\(c^t∣s^t,at\)\\displaystyle\\quad\\hat\{c\}\_\{t\}\\sim p\(\\hat\{c\}\_\{t\}\\mid\\hat\{s\}\_\{t\},a\_\{t\}\)(7)

表示模型将高维观测映射为紧凑的潜状态,压缩原始传感器输入的同时保留任务相关信息。转移模型在给定当前状态和动作的情况下预测未来的潜状态,构成学习到的动力学的核心。观测模型从潜状态重建观测,提供自监督重建信号。奖励模型预测即时奖励用于价值估计。在我们的任务中,一个单独的继续模型预测终止信号,帮助智能体识别回合边界。通过学习到的潜动力学模型,智能体可以通过在潜空间中预测未来状态、奖励和终止信号来生成潜轨迹展开。这些模型生成的轨迹为策略优化提供了额外的训练经验,并减少了对直接环境交互的依赖。

### 2.3 软演员-评论家

软演员-评论家(SAC)[12](https://arxiv.org/html/2608.10386#bib.bib12)是一种离策略演员-评论家算法,同时优化期望回报和策略熵,鼓励高效探索的同时保持稳定学习。SAC求解最大熵目标:

J\(π\)=∑t=0∞E\(st,at\)∼ρπ\[γtr\(st,at\)\+αH\(π\(⋅∣st\)\)\],J\(\\pi\)=\\sum\_\{t=0\}^\{\\infty\}\\mathbb\{E\}\_\{\(s\_\{t\},a\_\{t\}\)\\sim\\rho\_\{\\pi\}\\}\\Bigl\[\\gamma^\{t\}r\(s\_\{t\},a\_\{t\}\)\+\\alpha\\mathcal\{H\}\\bigl\(\\pi\(\\cdot\\mid s\_\{t\}\)\\bigr\)\\Bigr\],(8)其中ρπ\\rho\_\{\\pi\}表示策略π\\pi诱导的状态-动作边缘分布,γ∈\[0,1\)\\gamma\\in\[0,1\)是折扣因子,α\\alpha控制奖励最大化与熵项H\\mathcal\{H\}之间的权衡,该熵项鼓励探索。评论家是

相似文章

通过世界模型从人类偏好和理由中学习安全智能体行为

arXiv cs.AI

本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。

预测潜在世界模型的闭环性能:LunarLander中非马尔可夫奖励下MPC和基于模型的强化学习的离线检查点选择

arXiv cs.LG

本文通过提出离线诊断方法来解决基于模型的强化学习中的目标失配问题,以预测潜在世界模型的闭环性能。在LunarLander-v3上,奖励可观性分数(ROF)和复合分数(CROF)能够选择出生成强大MPC和基于模型的强化学习策略的检查点,同时大幅减少与真实环境的交互次数。