Reason--Imagine--Act:基于世界模型的闭环大语言模型决策在自动驾驶中的应用

arXiv cs.AI 论文

摘要

提出了Reason-Imagine-Act (RIA),一种将大语言模型推理器与动作条件世界模型相结合的闭环框架,用于自动驾驶中的在线安全验证,在CARLA仿真中实现了80.05%的路线完成率和0.20%的碰撞率。

arXiv:2605.24004v1 公告类型: 新 摘要:大语言模型(LLMs)在自动驾驶中具有潜力,但仅基于语义的决策策略在动态交通中可能产生不安全的物理行为。现有方法要么在没有显式动力学验证的情况下进行在线语言推理,要么主要在离线流程中使用世界模型,导致决策时语义意图与物理可行性之间存在差距。我们提出了Reason--Imagine--Act (RIA),一种将大语言模型推理器与动作条件世界模型相结合的闭环框架,用于在线安全验证。每一步中,大语言模型提出动作模板和候选子动作,世界模型进行短视域滚动预测,安全评分器选择最安全的可执行动作,并将反馈提供给下一推理步骤。在统一的CARLA点目标协议(1000个回合)下,RIA实现了80.05%的路线完成率、51.10%的到达率和0.20%的碰撞率。在相同的闭环接口下,RIA在核心闭环指标上始终优于无训练的基线方案,包括CARLA TM和MADA。为便于复现,代码可在https://github.com/pku-smart-city/source_code/tree/main/RIA获取。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:04

# 推理–想象–执行:基于世界模型的闭环大语言模型自动驾驶决策
来源:https://arxiv.org/html/2605.24004
孙正奇¹,孙逸文²³\*,刘博轩⁴,陈泰来⁵,郭天旭⁶,刘嘉彬⁶本研究受国家自然科学基金项目(No. 62503015)资助。

###### 摘要

大语言模型(LLMs)在自动驾驶领域前景广阔,但仅基于语义的决策策略在动态交通中可能产生物理上不安全的行为。现有方法要么在线进行语言推理而缺乏显式的动力学验证,要么主要在离线流程中使用世界模型,导致决策时语义意图与物理可行性之间存在鸿沟。我们提出**推理–想象–执行(RIA)**,一种将LLM推理器与动作条件世界模型相结合的闭环框架,用于在线安全验证。在每一步,LLM提出一个动作模板和候选子动作,世界模型执行短时域推演,安全评分器选择最安全的可执行动作,并将反馈传递至下一步推理。在统一的CARLA点目标协议(1000个场景)下,RIA实现了80.05%的路线完成率、51.10%的到达率和0.20%的碰撞率。在相同的闭环接口下,RIA在核心闭环指标上持续优于无训练基线方法,包括CARLA TM和MADA。为确保可复现性,代码已开源在https://github.com/pku-smart-city/source_code/tree/main/RIA。

## I. 引言

自动驾驶正经历从传统模块化流水线(通常分解为感知、预测和规划)向基于大型基础模型的以模型为中心的决策制定模式的深刻范式转变。这类大规模预训练模型展现出强大的可迁移性和泛化能力,促使学界重新思考“智能”应如何在驾驶栈中实现。特别是,大语言模型(LLMs)引入了强大的常识推理和语义理解能力,使智能体能够解读交通规则、解释决策,并泛化到之前未见的长尾场景。

参见图标题图1:提出的推理–想象–执行框架概述。LLM提出高层意图和候选动作,世界模型想象短时域未来,安全评分器选择最安全的可执行动作并反馈以形成闭环。尽管有这些令人期待的能力,将LLMs直接部署用于实时驾驶决策面临一个根本性障碍:**缺乏物理基础**。LLMs主要基于文本或多模态语义语料训练,往往表现得像一个“缸中之脑”:它们能生成逻辑连贯的高层命令(例如,“执行紧急避让”),但无法精确捕捉车辆动力学约束,也无法可靠地预测命令在连续物理空间中的数值后果。这种语义逻辑与物理现实之间的脱节导致了严重的**物理幻觉**,即生成的意图在运动学/动力学上不可行,从而威胁驾驶安全。

与此同时,世界模型(WMs)通过学习环境演化并支持多步预测,在捕捉物理规律方面展现出巨大潜力。然而,现有关于自动驾驶世界模型的研究主要强调离线的视频生成质量,或作为预训练过程中的辅助预测器,而与LLM级别推理紧密结合用于**实时**决策制定仍十分有限。结果,高层推理往往是“感知规则但忽视物理”,而世界模型则是“感知动力学但忽视意图”,在语义决策逻辑与物理基础执行之间留下了明显的鸿沟。

为弥合这一鸿沟,我们提出一种新颖的闭环自动驾驶框架,称为**推理–想象–执行**。关键思想是在决策回路中,将基于LLM的高层语义推理与基于WM的数值动力学预测紧密结合。具体而言,LLM首先生成一个高层驾驶意图;世界模型随后根据该意图执行多步物理推演,以在**执行之前**揭示潜在的碰撞风险或运动学/动力学违规。由此产生的物理反馈进一步优化动作选择,并反馈给推理模块,形成一个“先思后行”的循环,从而减轻物理上不安全的决策。

我们在高保真3D模拟器CARLA中,于复杂城市动态环境下的点目标导航任务中验证了所提出的框架。实验结果表明,与纯LLM基线相比,我们的框架显著提升了路线完成率,同时大幅降低了碰撞率(ColR)。在相同的闭环接口下,我们的方法在挑战性场景中也优于其他无训练基线方法,展示了将语义推理与物理基础想象相结合的实际价值。

在本文中,我们关注**推理时**部署,不进行参数更新(即无微调或额外的策略训练)。因此,我们的比较仅限于能够在相同CARLA闭环接口和评估协议下复现的方法。

**贡献。** 我们的主要贡献有三个:

- •据我们所知,这是首个在闭环驾驶决策流水线中,将LLM推理器与动作条件世界模型紧密结合,用于在线**先思后行**验证的工作。
- •我们提出**推理–想象–执行**,一种世界模型增强的决策机制,通过短时域推演评估模板条件下的候选子动作,并将物理验证信号反馈给LLM进行迭代修正。
- •在相同的闭环接口下,我们的方法持续优于可比的零训练基线方法,实现了更强的路线完成率和碰撞结果。在闭环CARLA评估中,与LLM无世界模型验证的变体相比,我们的完整方法将路线完成率从61.21%提升至80.05%,到达率从30.20%提升至51.10%,同时将碰撞率从0.40%降至0.20%。

## II. 相关工作

### II-A 用于自动驾驶的大语言模型

随着大型基础模型的快速发展,近期研究探索利用大语言/视觉-语言模型来改进自动驾驶中的决策制定、可解释性和泛化能力[1 (https://arxiv.org/html/2605.24004#bib.bib1)]。第一类工作将LLMs(或多模态LLMs)视为**高层推理器**,它们基于结构化场景描述或学习到的token进行操作,生成可由下游控制器或规划器执行的语义决策或计划[2 (https://arxiv.org/html/2605.24004#bib.bib2),3 (https://arxiv.org/html/2605.24004#bib.bib3)]。这些系统强调常识推理、规则理解和可解释输出,并通常结合记忆、反思或分层规划来处理长时域任务。相关的ITSC研究还探讨了实车个性化与人机语言交互,包括经过现场测试的具有记忆适应的指令到控制系统[4 (https://arxiv.org/html/2605.24004#bib.bib4)],以及用于驾驶辅助个性化的多模态警告生成[5 (https://arxiv.org/html/2605.24004#bib.bib5)]。

第二类工作致力于通过基于多视角传感器(有时包括车辆状态)进行条件化,并直接生成轨迹或低层控制信号,推动**端到端闭环**驾驶[6 (https://arxiv.org/html/2605.24004#bib.bib6),7 (https://arxiv.org/html/2605.24004#bib.bib7),8 (https://arxiv.org/html/2605.24004#bib.bib8)]。为了更好地平衡推理质量和实时性约束,近期方法引入了高效推理方案,例如在“快速”和“慢速”模式之间切换,或通过语言-视觉协同逐步细化轨迹[9 (https://arxiv.org/html/2605.24004#bib.bib9),10 (https://arxiv.org/html/2605.24004#bib.bib10)]。尽管取得了令人鼓舞的进展,许多基于LLM的驾驶系统在分布偏移下仍面临**基础性**难题:语义上合理的顶层决策在面对复杂的城市动态、罕见交互或分布外的运动模式时,往往变得物理上不安全。这激励了通过推理过程中的显式物理反馈来强制可行性和安全性的机制,而非仅依赖语义一致性。

### II-B 用于自动驾驶的世界模型

世界模型旨在学习环境演化的预测性表示,从而支持反事实推理、规划以及数据增强。模型基强化学习和潜在动力学建模方面的早期成功激励了将学习到的前向模型用于驾驶类领域的决策[11 (https://arxiv.org/html/2605.24004#bib.bib11),12 (https://arxiv.org/html/2605.24004#bib.bib12)]。在自动驾驶中,一个突出的方向聚焦于**生成式世界模型**,用于合成未来驾驶观测(例如,多视角视频),以进行仿真、数据增强或评估[13 (https://arxiv.org/html/2605.24004#bib.bib13),14 (https://arxiv.org/html/2605.24004#bib.bib14)]。这些模型对于可控场景生成以及提升感知和预测的鲁棒性很有价值,但它们通常是在离线环境中使用的。

近期的努力更强调**结构化3D/BEV世界表示**,用于预测和规划。以占用为中心的世界模型预测细粒度3D场景状态的演化,并可以通过评估预测未来中的候选自车动作来支持规划[15 (https://arxiv.org/html/2605.24004#bib.bib15),16 (https://arxiv.org/html/2605.24004#bib.bib16)]。相关工作也探索将紧凑的3D表示(例如占用token)输入大型模型,以改善空间理解和预测[17 (https://arxiv.org/html/2605.24004#bib.bib17)]。然而,将世界模型集成到实时决策回路中仍然具有挑战性:许多系统要么(i)主要将世界模型用作离线生成器或预训练辅助工具,要么(ii)进行规划时高层推理与低层动力学之间的交互有限。

与仅将世界模型用于生成或作为被动预测器不同,我们的工作强调了高层语义推理与动作条件动力学推演之间**闭环耦合**的重要性,以便在执行之前能够通过数值物理反馈来评估和优化候选意图。

## III. 方法

### III-A 推理–想象–执行概述

我们提出一个闭环决策框架——**推理–想象–执行(RIA)**,旨在将自动驾驶中的高层语义推理与低层物理可行性对齐。在每个控制周期 \(t\),RIA将大语言模型(LLM)与动作条件世界模型(WM)耦合,执行**先思后行**验证。这里 \(t\) 表示离散的控制步索引。

**高层思想。** **推理:** LLM接收当前状态和环境描述,以及短期行为记忆,并选择一个**离散**的驾驶**动作模板**(例如,变道、速度调整)。**想象:** 基于所选模板,WM对一小部分**子动作**(参数化/原语)执行短时域推演,以预测未来的轨迹和交互。**执行:** 系统通过安全评分选择最安全的子动作,并通过基于TM的控制后端执行该动作,同时将验证结果和执行摘要返回给LLM以形成闭环。

图2 (https://arxiv.org/html/2605.24004#S3.F2) 展示了完整的推理–想象–执行闭环流水线。

参见图标题图2:推理–想象–执行(RIA)闭环框架。LLM提出动作模板;WM对候选子动作进行短时域推演;安全评分器选择最安全的选项,并将物理验证信号反馈给LLM。

**符号说明。** 令 \(o_t\) 表示原始观测(例如,自车状态、交通灯、周边智能体),\(s_t\) 表示LLM和WM均使用的结构化状态。LLM输出一个离散模板 \(g_t \in \mathcal{G}\) 以及在该模板下的一组候选 \( \mathcal{U}(g_t) = \{ u_t^{(j)} \}_{j=1}^J \)(子动作)。WM为每个候选预测一条推演轨迹 \(\hat{\tau}_t^{(j)} = \{ \hat{s}_{t+1}^{(j)}, \ldots, \hat{s}_{t+H}^{(j)} \}\)。安全评分器返回一个标量分数 \(S(\hat{\tau}_t^{(j)})\),并选择 \(u_t^{\star} = \arg\max_j S(\hat{\tau}_t^{(j)})\) 用于执行,其中 \(j\) 是候选索引,\(J\) 是候选子动作的数量,\(H\) 是推演时域(以控制步为单位)。

### III-B 世界模型训练

我们训练一个动作条件世界模型,以预测自车动作下的短时域环境演化。我们的WM遵循受循环状态空间模型(RSSM)[18 (https://arxiv.org/html/2605.24004#bib.bib18)]启发的潜在动力学形式。

##### 状态表示。

每一步,我们通过聚合以下信息构建紧凑的结构化状态 \(s_t\):(i)**自车特征**(位置、速度、偏航角、加速度、车道中心偏移量、路线进度),(ii)**道路特征**(车道拓扑、路线方向、限速、交通灯状态、到停止线的距离、到车道边界的距离),以及(iii)**社会性特征**(周围车辆和行人的相对姿态/速度)。动作输入 \(a_t\) 对应于数据收集期间执行的低层控制信号(或子动作参数化)。这些几何量使得规则和道路违规(例如,跨越车道边界、驶离道路、与红灯相关的穿越风险)可以直接从预测状态计算出。

##### 社会性注意力编码。

为了对自车周围的多智能体耦合进行建模,我们在附近智能体上使用基于注意力的社会性编码器。给定第 \(t\) 步的自车token \(x_e\) 和邻居token \(\{x_i\}_{i=1}^N\),我们计算

\[
\alpha_i = \mathrm{softmax}_i\!\left(\frac{(W_q x_e)^\top (W_k x_i)}{\sqrt{d}}\right), \quad c_t = \sum_{i=1}^N \alpha_i \, W_v x_i,
\]
(1)

其中 \(c_t\) 是社会性上下文特征。这种设计使得WM能够优先考虑交互风险而非原始距离,因此即使切入车辆不是最近的物体,高接近速度的切入也能主导注意力。

##### 模型架构。

WM维护一个循环更新的潜在信念状态 \(h_t\):

\[
h_t = f_{\text{dyn}}(h_{t-1}, z_{t-1}, a_{t-1}),
\]
(2)

其中 \(z_t\) 是从当前观测/状态推断出的随机潜在变量。这里 \(f_{\text{dyn}}(\cdot)\) 表示潜在转移函数。在实现中,编码器采用时空分解。空间分支从自车-邻居交互token计算社会性上下文 \(c_t\),时间分支则在融合序列 \(x_t = [s_t; c_t]\) 上应用GRU,以编码二阶趋势(例如加速度和偏航率演化):

\[
\tilde{h}_t = \mathrm{GRU}(x_t, \tilde{h}_{t-1}).
\]
(3)

融合的潜在特征 [...]

相似文章

模拟、推理、决策:基于LLM的科学推理驱动仿真决策

arXiv cs.AI

密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。

面向高效可控LLM推理的代理式思维链引导

Hugging Face Daily Papers

ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。