INTENT:一种用于交叉口场景中车辆意图预测的LSTM框架及全面的消融分析

arXiv cs.AI 论文

摘要

本文提出了INTENT,一个LSTM框架,用于在交叉口提前2秒预测车辆意图(直行、左转、右转),在InD数据集上达到了99.71%的准确率。

arXiv:2607.08316v1 公告类型:新 摘要: 车辆意图预测是自动驾驶汽车在所有驾驶场景中灵活性和安全性的关键方面;如果要真正提升自动驾驶汽车,我们需要让它们像人类一样解读驾驶员的意图,尤其是在需要大量人机交互以及复杂驾驶行为的场景中,例如交叉口、环岛和紧急情况(如突然停车)——在这些场景中,车辆意图预测有助于在实时时间内采取正确的规避动作,每一秒的行动都至关重要,可以防止灾难发生。在最坏的情况下,它有助于将损害降到最低,并将安全放在首位。意图预测还可用于增强轨迹预测(意图条件轨迹预测)。在本研究中,提出了INTENT框架,使用LSTM模型在事件发生前2秒预测车辆在交叉口的意图,即预测交叉口内的车辆是直行、左转还是右转。在InD数据集上进行了多种模型实验和全面的消融研究,达到了99.71%的准确率。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:08

# 意图:一个用于十字路口场景下车辆意图预测的LSTM框架及全面消融分析  
来源:https://arxiv.org/html/2607.08316  
Logine M\. Zaki1,2 and Catherine M\. Elias1,2\{\}^\{1,2\\href https://orcid\.org/0000\-0002\-1444\-9816\\,\}\*这项工作未受任何组织资助  
1C\-DRiVeS实验室:认知驾驶研究(车载系统),开罗,埃及  
cdrives\.researchlab@gmail\.com  
2计算机科学与工程系 – 媒体工程与技术学院 – 德国开罗大学,埃及  
logine\.elkelani@student\.guc\.edu\.eg, catherine\.elias@ieee\.org  

###### 摘要  

在所有驾驶场景中,车辆意图预测是提升自动驾驶车辆敏捷性和安全性的关键要素;若要真正增强自动驾驶车辆,我们需要让它们能够像人类一样理解驾驶员的意图,特别是在需要大量人类交互以及复杂驾驶行为的场景中,例如十字路口、环岛以及紧急情况(如突然停车)——在这些场景中,车辆意图预测有助于在实时时间内采取正确的避让措施,每一秒的行动都至关重要,并能防止灾难发生。在最坏情况下,它也有助于最小化损害,并将安全置于首位。意图预测还可用于增强轨迹预测(基于意图的轨迹预测)。在本研究中,提出了INTENT框架,该框架使用LSTM模型在事件发生前2秒预测十字路口车辆的意图,以判断十字路口的车辆是直行、左转还是右转。通过对InD数据集进行全面的模型实验和消融研究,该模型达到了99.71%的准确率。

## I引言与相关工作  

为了持续提升道路安全、减少事故,自动驾驶车辆若能避免事故的主要原因,将发挥主导作用。这些原因包括人为错误、误导性意图、错误行动、意外变道、十字路口模糊的驾驶行为,以及有时因遮挡而看不到其他车辆等。理解场景甚至预测目标车辆的意图,可以提醒驾驶员(若车辆非全自动驾驶),或在全自动驾驶情况下采取最安全的避让措施以确保最优安全。意图预测对所有道路使用者(例如行人、自行车和车辆)都至关重要。

对于每种道路使用者,还存在各种不同的交通和道路场景,例如十字路口和高速公路上的行人意图预测。本文主要关注车辆意图预测。十字路口的车祸由于几个原因导致高死亡率和严重性:车辆可能高速行驶,碰撞角度可能是致命的(90度);想象一下两辆车相撞,一辆从南向北行驶,另一辆从东向西行驶。这进一步强调了解决十字路口车辆意图预测挑战的迫切性,这将极大提升道路安全并加速自动驾驶车辆的发展进程。因此,十字路口的车辆意图预测是我们本文的动机。

车辆意图预测是自动驾驶车辆敏捷性和安全性的关键因素。意图预测是一个分类问题,因此在过去几年中,人们利用各种分类器来执行意图预测,其中一些被归类为机器学习技术,如支持向量机(SVM)[4]和隐马尔可夫模型(HMM)[22]。

另一类是深度学习模型,已被证明非常有效,例如循环神经网络(RNN),它最适合对短序列数据进行建模,但由于梯度消失问题,在长序列建模方面存在不足。这就是为什么长短期记忆网络(LSTM)被主要应用于利用车辆过去的位置序列信息来预测意图,克服了长序列的障碍[19]。LSTM在行人意图预测中也被广泛使用[15],并且许多研究人员使用LSTM进行车辆意图预测[2,3],然而,我们注意到他们主要是在高速公路上解决这个问题。

此外,许多近期研究推测了LSTM在车辆意图预测中的不同变体,如[9]中使用了双向LSTM与注意力机制。此外,一些研究人员开始使用其他算法,如知识图谱嵌入与贝叶斯推理进行高速公路车辆意图预测[16,14],以及Transformer架构[1,8],但同样也是用于行人意图预测。

从上述文献中,我们发现十字路口的车辆意图预测尚未使用不同架构进行充分研究,尤其是由于缺乏数据集。此外,在十字路口场景中,也没有适当的消融研究以达到高准确率。因此,本文提出了INTENT框架。该框架使用LSTM架构解决车辆意图预测模型,特别是在对自动驾驶车辆安全至关重要的十字路口场景中。此外,本文还提供了一个旨在实现高准确率架构的消融研究。

请参见图注  
图1:INTENT流水线阶段概览  

## II INTENT流水线实现  

### II-A INTENT流水线概览  

图1展示了所实现的详细流水线概览。INTENT流水线包含两个主要阶段:数据准备阶段(包括道路标注、真值标注和车辆过滤),以及预测模型阶段(包括数据不平衡分析和模型实现)。

### II-B 数据准备  

据我们所知,在经过长时间的深入搜索后,我们面临的一个巨大研究空白是缺乏捕捉十字路口驾驶行为的自车视角数据集,因此我们决定使用BEV(鸟瞰图)数据集,并利用其不受传感器遮挡或有限范围限制的优势。不仅决定使用BEV,还计划构建的模型将依赖于可忽略视角提取的特征,因此模型将足够通用且与视角无关,从而易于应用于多种视角和场景。

我们使用了InD数据集[5],这是一个BEV数据集,捕捉了不同十字路口结构(T型路口、十字路口等)下的不同驾驶行为,如图2所示。

请参见图注  
图2:inD数据集提供的可视化工具,用于观察不同帧中的车辆行为  

不幸的是,我们面临一个问题:数据集中的轨迹没有附带真值,因此开发了如下标注机制:

首先,道路标注算法(RLA)。使用数据集中包含的OpenDRIVE地图(如图3所示,通过在线open drive查看器打开),当光标在地图上移动时,会生成x和y坐标,因此我们手动提取每条道路的坐标。作为初步步骤,我们编码了所有道路的x和y坐标的上下限,以便根据车辆位置的x和y坐标标记每帧车辆所在的道路。仅使用x和y坐标时,发现道路之间存在共同区域,因此需要另一个属性来区分道路,于是加入了航向角,成功区分了不同道路。

请参见图注  
图3:一个十字路口的OpenDRIVE地图,用于提取不同道路的x和y坐标  

即使在加入航向角后,道路之间的共同区域仍然存在,因此我们提取了一个共同范围,并将道路列的值编码为“要么道路x,要么道路y”,直到车辆移动到仅与一条道路相关联的唯一范围。

可能会有人问:当OpenDRIVE地图仅提供x和y坐标时,如何提取航向角?使用可视化工具,例如,如果我们想提取某条道路的航向角,我们观察行驶在同一条道路上的不同车辆,获取它们的ID,然后参考csv文件查看它们的航向角,并提取一个适合每条道路上所有车辆的共同范围。

航向角的加入针对所有道路,不仅仅是那些有重叠的道路。如果某些值不在范围内,或者车辆没有遵守车道标记或允许方向,则道路列中填入未知值。

在每帧填充道路列之后,第二步是真值标注(GTL),其中道路转换被编码,以将事件/真值行为标记为直行、左转或右转。之后,使用可视化工具手动验证和修订,以确保真值与车辆实际采取的动作一致。

第三步也是最后一步是实现车辆过滤算法(VFA),这是另一个过滤算法,用于过滤并排除行人、停放车辆/静止车辆以及自行车等跟踪对象,以便仅专注于移动车辆的意图预测。

### II-C 特征  

以下是使用的主要特征:车辆中心位置和航向角 [Px, Py, θ],车辆速度和加速度 [vx, vy, ax, ay],纵向和横向速度与加速度 [vlon, vlat, alon, alat],以及车辆尺寸,包括长度 l 和宽度 w。

### II-D 模型  

#### II-D1 输入准备  

对于输入,使用了前述特征部分中提到的特征子集,但最初它们是以csv形式存在的,因此编写了一个输入准备算法,将过滤后的csv(排除行人、自行车和静止车辆)转换为3D numpy数组,以便输入模型,同时还有一个一维标签数组(来自之前提到的真值列)作为模型的真实值。

#### II-D2 控制不平衡  

使用pandas运行分析部分,以调查每个类别(直行、右转、左转)的输入样本数量。进行分析的原因是为了避免数据不平衡。我们的怀疑得到验证:直行的输入样本数量远超其他两个类别,因此使用了一个计数器,只输入与其他两个类别(右转和左转)样本数量相等的直行样本。

#### II-D3 输入重塑细节  

InD数据集的帧率为25帧/秒,因此在我们的模型中,使用了20帧的窗口大小,并对事件发生前不足20帧的车辆进行了填充。我们的模型在动作发生前2秒预测目标车辆的意图,因此根据上述帧率,在数据准备中编写了一个算法:对于过滤后csv中的每辆车,获取动作发生的行号,然后回溯50行(1行=1帧),获取每辆车第一帧的行号,然后以20帧的序列(与一维标签数组中的真值对齐)作为一个样本输入,直到达到结束行(即动作发生的行 - 50行)。

#### II-D4 模型架构  

输入层使用了特征部分提到的特征组合,更多细节将在实验部分进一步讨论。然后,我们的模型包含3个隐藏层,每层128个神经元,所有3个隐藏层都使用RELU激活函数作为基础模型。最后,输出层有3个输出节点,使用softmax函数将输出限制在0到1之间,类似于概率形式,其中概率最高的类别被视为输出属于该类/意图。

在隐藏层之间使用了批归一化。作为关键绩效指标/评估指标,使用了准确率、精确率、召回率、F1分数和损失。我们的数据集按80%训练数据、20%验证数据分割,测试数据集使用了同一位置的不同记录,以进一步评估模型。

使用了分类交叉熵作为损失函数,优化函数使用了Adam优化器,学习率为0.001。批量大小为32,共50个epoch。

表I:实验1的结果,比较了4种不同模型  
表II:实验2的结果,比较了所有模型变体相对于基础模型的表现  

## III实验与结果  

在本节中,将清晰讨论所设想的模型实验,进行分类,并分别在训练、验证和测试数据集上比较结果。此外,将附上部分实验的性能图以便可视化结果。

### III-A 实验1:测试不同特征  

本实验的主要目的是测试使用不同数量的输入特征对我们的基础模型以及模型准确率、精确率、召回率、F1分数和损失的有效性。在本实验中,创建了4个不同变体,分别使用5、7、11和13个特征。各模型的输入特征分别为:[Px, Py, θ, vx, vy],[Px, Py, θ, vx, vy, ax, ay],[Px, Py, θ, vx, vy, ax, ay, vlon, vlat, alon, alat],以及 [Px, Py, θ, vx, vy, ax, ay, vlon, vlat, alon, alat, l, w]。

为了比较,4个变体使用的架构是统一的,任何不同的参数将在每个实验中单独说明。统一架构是一个LSTM模型,包含3个隐藏层,使用relu激活函数,输出层使用softmax激活函数对应3个输出节点(直行、左转、右转)。使用的优化器是Adam优化器,损失函数为分类交叉熵,学习率为0.001。使用了批归一化。批量大小设为32,epoch为50,序列长度为20帧,步长为12帧,预测窗口为事件发生前2秒。

表I显示,11特征模型产生了最佳结果,因此我们继续……

相似文章

三思而后行:意图引导推理用于基于LLM的位置预测

arXiv cs.AI

IntentPOI是一个两阶段意图引导推理框架,用于下一个POI预测。它首先从历史移动模式、同伴行为和时间上下文中推断用户意图,然后选择与这些意图一致的位置,在十一个最先进的基线方法中表现最优。

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。