REARL:基于真实交通数据和大型语言模型的闭环自动驾驶模拟增强框架

arXiv cs.LG 论文

摘要

本文提出了REARL,一个使用真实交通数据和大型语言模型的闭环框架,通过持续监控和调整车辆行为来增强自动驾驶模拟的真实性。

arXiv:2609.19903v1 公告类型:新 摘要:准确的模拟对于自动驾驶开发至关重要,但捕捉现实世界交通的复杂性仍然具有挑战性。现有依赖于预定义规则或静态数据回放的模拟器在处理动态交通时存在困难。CRITICAL使用真实交通数据和大型语言模型(LLM)来调整初始模拟配置,但随着模拟的进行,模拟分布仍然与真实交通产生偏差。我们提出了REARL,一个将真实交通数据与LLM集成的闭环模拟增强框架。真实交通数据被聚类,每个聚类中心作为代表性场景,为LLM提供典型的现实世界交通模式。然后,一个定时滑动窗口检测器监控车辆速度分布和车辆对之间平均间距的差异。如果某个指标超过阈值,LLM调整车辆决策;否则,保留现有控制器。LLM还从交通快照中选择一辆匹配的真实车辆,并参考该真实动作来调制模拟车辆。在受控的HighD高速公路场景中,与CRITICAL基线和基于PPO的学习基线相比,REARL将速度分布的Hellinger距离降低到0.3067,平均间距的MAPE降低到0.8371,同时实现了22.8575的时间车头间距(THW)和0.0708的变道率。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:11

# REARL:一个结合真实交通数据与大语言模型的闭环自动驾驶仿真增强框架  
来源:https://arxiv.org/html/2609.19903  
出版物ID:0000–0000/00$00.00 © 2021 IEEE  
Jun Jiang, Yiwen Sun†, Quanyi Ou, Ke Cheng, Mingjie Bi, Yexin Li†  
††感谢:本工作得到国家自然科学基金(资助号 62503015)支持。(通讯作者:Yiwen Sun。)  
††感谢:Xiaojun Bi 隶属于中国北京中央民族大学教育部民族语言智能分析与安全治理重点实验室,邮编 100081(电子邮件:[email protected])。  
††感谢:Yiwen Sun 隶属于中国北京大学人工智能研究院,邮编 100871,同时兼任北京通用人工智能研究院通用人工智能重点实验室,邮编 100080(电子邮件:[email protected])。  
††感谢:Jun Jiang 隶属于中国北京中央民族大学教育部民族语言智能分析与安全治理重点实验室,邮编 100081(电子邮件:[email protected])。  
††感谢:Quanyi Ou 隶属于中国北京中央民族大学教育部民族语言智能分析与安全治理重点实验室,邮编 100081(电子邮件:[email protected])。  
††感谢:Ke Cheng 隶属于中国北京航空航天大学计算机学院,邮编 100191(电子邮件:[email protected])。  
††感谢:Mingjie Bi 隶属于北京通用人工智能研究院通用人工智能重点实验室,邮编 100080(电子邮件:[email protected])。  
††感谢:Yexin Li 隶属于北京通用人工智能研究院通用人工智能重点实验室,邮编 100080(电子邮件:[email protected])。  

###### 摘要  
精确的仿真对于自动驾驶开发至关重要。然而,捕捉真实世界的交通复杂性仍然充满挑战。现有的仿真器依赖于预定义规则或静态数据回放,难以处理动态交通场景。为解决这一问题,CRITICAL 提出利用真实交通数据和大语言模型来调整初始仿真环境配置。根据我们的实验,虽然这提高了真实性,但随着仿真的进行,数据分布逐渐偏离真实交通场景。我们提出了一种新框架 REARL,一个结合真实交通数据与大语言模型的闭环自动驾驶仿真增强框架,其主要优势在于将真实交通数据与大语言模型集成。首先,用于丰富仿真环境的真实世界交通数据通过聚类方法被划分为多个类别。每个类别的聚类中心被定义为代表性场景,作为目标仿真对象。这些代表性场景构成了典型的现实世界交通模式,大语言模型将其作为参考来学习真实世界交通分布的特征。其次,一个带滑动窗口的定时检测机制持续监控当前仿真与最相似的代表性场景之间的差异,特别是在车速分布和车辆对之间的平均间距方面。第三,如果任何评估指标超过预定义的阈值,大语言模型将介入调整车辆决策;否则,现有控制策略保持不变。最后,基于当前车辆的驾驶状态,大语言模型从真实交通数据快照中选择与当前驾驶场景最匹配的最相关车辆。然后,参考匹配的真实车辆的动作来调整仿真车辆的行为,从而在给定的仿真设置下促进更真实的行为调整。在受控的HighD高速公路场景下的评估表明,REARL在评估指标上实现了具有竞争力且依赖指标的表现。与CRITICAL基线和基于PPO的学习基线相比,它将车速分布的Hellinger距离降低到0.3067,车辆对之间平均间距的平均绝对百分比误差降低到0.8371,同时实现了更高的时间车头时距(22.8575),反映了更保守的跟车行为,以及中等的变道率(0.0708),表明在测试设置下具有中等程度的横向机动性。  

###### 索引关键词:交通仿真、大语言模型、自动驾驶。  

## I 引言  
自动驾驶技术对于推进智能交通系统至关重要,能够实现高效和自适应的交通系统。仿真环境作为测试和验证自动驾驶系统的核心平台,正变得越来越重要[1, 2]。因此,增强仿真环境对于开发自动驾驶至关重要。它为在受控的虚拟环境中测试算法提供了真实且动态的测试平台。图1展示了自动驾驶仿真环境面临的问题及其理想状态。图1(a)显示了初始仿真状态,其中仿真车辆的分布与真实交通数据略有偏差。图1(b)突出了没有仿真环境增强方法的局限性:随着仿真环境的演进,它逐渐偏离真实数据,增加了失真。图1(c)说明了理想的仿真状态,其中仿真的车速分布和车辆对之间的平均间距逐渐接近真实世界的分布。参见说明图 1:在某些情况下,仿真环境会随着过程的进行而逐渐偏离真实数据。所提出的范式监控仿真车辆分布与真实交通数据之间的差异,并在仿真展开过程中调整仿真环境以减少这些差异,如图1(a)所示。传统的自动驾驶仿真方法主要依赖于预定义的驾驶员模型和交通行为规则。这些包括启发式模型或基于日志回放的静态数据[3]。这些方法在简单的场景测试中效果良好。然而,它们在动态环境中的性能有限。它们难以准确模拟复杂的交互[4]。在高密度交通场景中,驾驶员的决策受到交通密度、车辆对之间的平均间距以及个体驾驶习惯等因素的影响。这些因素表现出显著的时变和非线性特征。传统模型过于简化。它们无法捕捉这些动态特征。因此,仿真结果偏离真实世界场景。为了解决传统方法的局限性,数据驱动的仿真环境受到了越来越多的关注。这些方法集成和分析大规模交通数据。这显著增强了仿真的动态性和精度。然而,数据驱动方法仍然面临数据偏差、过拟合和可解释性差等挑战。这些问题限制了它们在复杂交互场景中的应用[5, 6, 7, 8, 9]。此外,交通数据的随机性和噪声特性使得纯数据驱动的模型难以在关键场景中做出合理的决策,尤其是在应对紧急情况时[10, 11, 12]。大语言模型的最新进展为自动驾驶仿真开辟了新的可能性。例如,[13]提出了CRITICAL,利用大语言模型优化初始仿真配置,增强系统智能性和适应性。集成了大规模真实数据的仿真增强技术,通过捕捉动态交通流和复杂的驾驶员行为来提高真实性。大语言模型在推理和决策方面的优势使其能够基于真实世界数据模拟交通行为[14, 10]。然而,大语言模型在动态驾驶场景中的应用仍然面临挑战。这些挑战包括对历史数据和先验知识的依赖,以及在高度不可预测情况下的性能不佳[14, 4]。CRITICAL仅优化初始仿真配置,没有监控和纠正中间过程。因此,它在模拟交通流统计特性和灵活应对复杂交互方面存在不足。当前的自动驾驶仿真研究存在以下主要缺陷:第一,交通流统计特性仿真不足。现有方法未能捕捉动态交通流和复杂交互场景的统计特征,导致仿真与真实世界环境之间存在偏差[15, 16, 17, 14]。第二,缺乏闭环反馈机制。现有的基于规则或数据驱动的仿真系统难以模拟高密度交通或复杂交互场景中的动态驾驶行为。大多数仿真系统无法在仿真展开过程中调整仿真状态,降低了仿真真实性和适应性。这些缺陷凸显了对更真实和灵活的自动驾驶仿真环境的需求。这仍然是当前研究的关键方向[18, 19]。现有的交通仿真器缺乏机制来动态地将仿真车辆行为与不断演变的真实世界交通模式对齐;这项工作探讨了如何通过大语言模型增强的在线校准框架来实现这种对齐。为了解决上述问题,我们提出了一种在线校准框架,旨在改善仿真环境与真实世界交通数据在仿真过程中的对齐程度。为了抵消仿真过程中环境真实性的退化,我们引入了定时差异检测机制,并利用大语言模型来指导和调整车辆决策。在选定的HighD高速公路场景上的实验证明了我们方法在保持仿真有效性方面的有效性,如第IV-B节所示。本文的贡献如下:  
- •我们将REARL构建为一个用于自动驾驶仿真的闭环仿真校准框架,该框架在仿真展开过程中监控分布差异,并调整仿真环境以改善与真实交通统计数据的对齐(在测试设置下)。  
- •该方法集成了两个主要组件:交通流变化的定时检测和用于背景车辆的代表性场景引导的大语言模型决策。交通数据经过聚类,基于聚类中心提取代表性场景。随后,这些场景用于支持大语言模型中的决策和仿真过程。定时检测机制监控车速分布和车辆对之间的平均间距。当超过阈值时,它会触发大语言模型干预,以支持仿真展开过程中的差异感知调整。  
- •我们的实验在HighD数据集[20]和highway-env仿真环境[21]上进行。与CRITICAL方法相比,我们的方法将车速分布的Hellinger距离降低到0.3067,车辆对之间平均间距的平均绝对百分比误差降低到0.8371。提出的REARL框架的有效性和有效性依赖于四个关键假设。首先,我们假设从真实世界交通数据聚类得出的代表性场景捕捉了动态交通流的基本模式,并提供了现实的驾驶环境参考。其次,我们假设仅监控两个宏观指标——车速分布和背景车辆对之间的平均间距——提供了一个可行的代理来监控仿真保真度,因为这两个指标对交通流一致性高度敏感。第三,我们假设一个在场景引导提示下的大语言模型,能够在预定义的效率和交通规则约束下,合理地从静态观测快照中模仿驾驶员行为。第四,我们假设基于大语言模型的干预可以在测试设置下减少仿真展开过程中积累的分布偏差,从而使微观层面的调整有助于宏观层面的真实性。这些假设共同支撑了REARL的闭环自适应增强机制。该框架通过定时差异检测和调整机制不断优化仿真状态。这旨在提高在测试动态交通环境中的仿真真实性,为测试和验证自动驾驶系统提供可靠的平台。后续章节的结构如下:第2节介绍了自动驾驶仿真方法及其局限性相关工作。第3节详细描述了REARL方法。第4节从不同角度验证了REARL。第5节总结全文并讨论了未来方向。  

## II 相关工作  
自动驾驶技术的快速发展对高保真仿真环境提出了更高的要求。这些环境对于增强测试的客观性和可信度是必要的。现有研究主要集中在构建逼真的驾驶仿真器。这些可以分为三类:传统仿真方法、数据驱动方法以及大语言模型在自动驾驶中的应用。虽然这些方法推动了仿真技术的发展,但它们仍然存在显著的局限性。这些局限性在统计真实性、动态适应性和复杂场景建模方面尤为明显。  

### II-A 传统仿真方法  
传统仿真方法依赖于预定义的规则和启发式模型来模拟交通行为。代表性工具包括SUMO[22]、VISSIM[23]、AIMSUN[24]和Highway-env[21]。这些方法通常使用基于物理的模型,例如跟车模型[25, 26]和换道模型[27, 28]。它们在交通工程领域已被研究数十年。然而,这些方法存在局限性。它们的参数化和手动编码规则阻碍了它们捕捉动态特征。

相似文章

CARLA中的自动驾驶模仿学习

arXiv cs.AI

本文研究了在CARLA模拟器中基于离线专家演示训练的多模态行为克隆策略的闭环驾驶能力,展示了无碰撞的有效自动驾驶,并发布了所有相关成果。

基于结构化自回归建模的长期交通仿真

arXiv cs.AI

介绍了 RosettaSim,一种采用结构化自回归建模进行长期交通仿真的框架,在 Waymo Open Sim Agent Challenge 上取得了最先进的性能。同时提出了基于检索的交通评估(Retrieval-based Traffic Evaluation, RTE),用于更好地评估长时域保真度。