一种用于交通流预测的动态融合大语言模型
摘要
本文提出了一种用于交通流预测的动态融合大语言模型(DF-LLM),该模型集成了时空嵌入、融合模块以及具有适应策略的大语言模型骨干网络,以在智能交通系统中提升性能,优于传统方法。
arXiv:2609.11314v1 公告类型:新
摘要:交通流预测是智能交通系统的核心支撑技术。它利用历史数据推断特定区域未来的交通动态,从而有助于缓解拥堵并提高资源分配效率。传统的神经网络由于依赖单一特征建模,难以突破精度限制,而大语言模型(LLMs)在捕捉空间拓扑信息和挖掘时空关联方面存在不足。本研究提出了一种用于交通流预测的动态融合大语言模型(DF-LLM)。该模型包含三个核心组件:时空嵌入模块、时空融合模块和LLM骨干网络。时空嵌入模块实现了多尺度时空特征的协同表示。时空融合模块通过图卷积整合空间拓扑和动态依赖关系。LLM骨干网络采用差异化参数适应策略,以平衡训练效率和交通数据适应性。此外,它引入了一个上下文聚合注意力模块来增强全局依赖关系。更重要的是,LLM骨干网络采用残差连接来缓解深层网络中的梯度消失问题。实验表明,通过比较四个数据集上的指标,DF-LLM取得了更好的性能。
查看缓存全文
缓存时间: 2026/09/11 08:34
# 用于交通流预测的动态融合大语言模型 来源:https://arxiv.org/html/2609.11314 Xue Qiu https://orcid.org/0009-0006-6143-7558 所属机构:上海理工大学光电信息与计算机工程学院,中国上海,邮箱:[[email protected]](mailto:[email protected]) Jianli Xiao (✉) https://orcid.org/0000-0002-7363-0623 邮箱:[[email protected]](mailto:[email protected]) 所属机构:上海理工大学光电信息与计算机工程学院,中国上海,邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 交通流预测是智能交通系统的核心支撑技术。它利用历史数据推断特定区域未来的交通动态,从而有助于缓解拥堵和提高资源分配效率。传统的神经网络由于依赖于单一特征建模,难以突破精度限制,而大语言模型则存在空间拓扑信息捕获不足以及挖掘时空关联能力欠缺的问题。本研究提出了一种用于交通流预测的动态融合大语言模型。该模型包含三个核心组件:时空嵌入模块、时空融合模块和LLM骨干网络。时空嵌入模块实现了多尺度时空特征的协同表示。时空融合模块通过图卷积整合空间拓扑和动态依赖关系。LLM骨干网络采用差异化参数适应策略,以平衡训练效率和交通数据适应性。此外,它引入了一个上下文聚合注意力模块来增强全局依赖关系。更重要的是,LLM骨干网络采用残差连接来缓解深度网络中的梯度消失问题。实验表明,DF-LLM在所有四个数据集上的指标比较中取得了更好的性能。 ###### 关键词: 交通流预测 智能交通系统 大语言模型 时空特征 动态融合 ## 1 引言 在智能交通系统中,交通流预测扮演着关键角色,能够基于历史数据对未来交通状况进行准确预测。这一能力对于推进交通管理、缓解拥堵和优化资源分配至关重要[8 (https://arxiv.org/html/2609.11314#bib.bib1), 7 (https://arxiv.org/html/2609.11314#bib.bib2)]。 虽然像ARIMA和卡尔曼滤波这样的传统时间序列模型可以捕捉线性时间趋势,但它们难以建模交通数据中复杂的时空依赖关系。卷积神经网络和循环神经网络已被广泛用于捕捉空间和时间依赖关系[17 (https://arxiv.org/html/2609.11314#bib.bib3)]。然而,这些模型从根本上受到交通数据不规则、非欧几里得拓扑结构及其多尺度周期性模式的限制。图卷积网络已被引入以显式处理交通网络中的空间结构[1 (https://arxiv.org/html/2609.11314#bib.bib4), 15 (https://arxiv.org/html/2609.11314#bib.bib5), 16 (https://arxiv.org/html/2609.11314#bib.bib6), 9 (https://arxiv.org/html/2609.11314#bib.bib7)],但它们常常受到过平滑问题的困扰,限制了其捕捉全局模式的能力。基于注意力的模型提供了更多的灵活性,但架构复杂且计算开销巨大。 大语言模型在多个领域取得了显著进展,并逐渐被应用于时间序列研究。通过利用广泛的预训练和庞大的参数容量,LLM在保持结构稳定性的同时提升了性能[3 (https://arxiv.org/html/2609.11314#bib.bib8)]。然而,基于LLM的方法主要关注时间维度,在很大程度上忽略了交通网络中丰富的空间拓扑结构[2 (https://arxiv.org/html/2609.11314#bib.bib9), 18 (https://arxiv.org/html/2609.11314#bib.bib10)]。此外,语言与交通数据在结构和语义上的差异阻碍了LLM有效迁移知识,可能损害预测性能。 为应对这些挑战,我们提出了DF-LLM,一个统一的时空预测框架,将基于图的空间建模与预训练的Transformer骨干网络相结合用于交通流预测。所提出的框架包含一个带有残差连接和差异化参数适应策略的时空融合模块,能够在保留宝贵预训练知识的同时实现有效的领域适应。大量实验表明,DF-LLM与现有的先进方法相比,取得了具有竞争力或更优越的预测性能,凸显了其在智能交通系统中的潜力。 ## 2 所提模型 如图1 (https://arxiv.org/html/2609.11314#S2.F1)所示,DF-LLM框架旨在处理历史交通数据$X \in \mathbb{R}^{L \times M \times D}$作为输入。时空嵌入模块生成多尺度嵌入,包括初始特征、时间特征和空间特征表示。时空融合模块整合这些嵌入,引入残差连接,并利用两层图卷积网络建模空间拓扑关系,将融合后的特征投影到维度 $\mathbb{R}^{L \times M \times D'}$。LLM骨干网络集成了位置嵌入、Transformer块和一个上下文聚合多头注意力模块来捕获长程时间依赖关系,采用差异化参数适应策略实现部分参数冻结。最后,交通预测模块通过回归卷积输出预测的交通流 $\widehat{\mathbf{Y}} \in \mathbb{R}^{L' \times M \times D}$,以与真实值 $\mathbf{Y} \in \mathbb{R}^{L' \times M \times D}$ 对齐进行损失计算。 参见图注 图1:DF-LLM的框架。### 2.1 时空嵌入模块 时空嵌入模块对于从历史交通数据中提取判别性表示至关重要,由三个并行分支组成:初始特征嵌入、时间嵌入和空间嵌入。 初始特征嵌入。我们首先对输入数据采用逐点卷积以提取基本特征: $$\mathbf{E}_{I} = \text{Conv}_{1\times 1}(\mathbf{X}_{L}; \theta_{\text{conv}}) \quad (1)$$ 其中 $\text{Conv}_{1\times 1}$ 表示一个核形状为 $[1,1,D,D']$ 的 $1\times1$ 卷积操作,$\theta_{\text{conv}}$ 表示可学习参数。此步骤生成初始特征嵌入 $\mathbf{E}_{I} \in \mathbb{R}^{L \times M \times D'}$。 时间嵌入。为捕捉交通数据固有的周期性模式,我们引入两个可学习参数矩阵:$\mathbf{W}_{d}$ 和 $\mathbf{W}_{w}$。我们从输入数据中提取每日和每周时间索引 $x_{d}$ 和 $x_{w}$,然后采用绝对位置编码生成 $\mathbf{X}_{d} \in \mathbb{R}^{L \times M \times T_{d}}$(每日分辨率)和 $\mathbf{X}_{w} \in \mathbb{R}^{L \times M \times T_{w}}$(每周分辨率),其中 $T_{d}$ 和 $T_{w}$ 分别表示每天和每周的时间步数。时间嵌入 $\mathbf{E}_{T} \in \mathbb{R}^{L \times M \times D'}$ 计算如下: $$\mathbf{E}_{T} = \mathbf{W}_{d} \cdot \mathbf{X}_{d} + \mathbf{W}_{w} \cdot \mathbf{X}_{w} \quad (2)$$ 空间嵌入。为建模路段之间的空间拓扑相关性,我们提出了一种自适应空间嵌入机制: $$\mathbf{E}_{S} = \mathcal{E}(W_{S} \cdot \mathbf{X}_{L} + b_{S}) \quad (3)$$ 这里,$\mathcal{E}$ 表示非线性激活函数,参数 $W_{S} \in \mathbb{R}^{D \times D'}$ 和 $b_{S} \in \mathbb{R}^{D'}$ 是可学习的。此操作生成空间嵌入 $\mathbf{E}_{S} \in \mathbb{R}^{L \times M \times D'}$,用于捕获空间拓扑依赖关系。 嵌入 $\mathbf{E}_{I}$、$\mathbf{E}_{T}$ 和 $\mathbf{E}_{S}$ 被拼接并输入后续的时空融合模块,以实现多尺度时空特征整合。 ### 2.2 时空融合模块 该模块整合并精炼时空嵌入模块生成的嵌入,并通过动态图卷积操作捕获空间拓扑关系。 特征融合。通过沿特征维度拼接 $\mathbf{E}_{I}$、$\mathbf{E}_{T}$ 和 $\mathbf{E}_{S}$,我们得到 $\mathbf{E}_{\text{concat}} \in \mathbb{R}^{L \times M \times 3D'}$。随后,一个带有残差连接的 $1\times1$ 卷积层将此拼接特征投影到目标维度: $$\mathbf{E}_{\text{fused}} = \text{Conv}_{1\times 1}(\mathbf{E}_{\text{concat}}; \theta_{\text{fuse}}) + \mathbf{E}_{\text{res}} \quad (4)$$ 其中 $\theta_{\text{fuse}}$ 表示形状为 $[1,1,3D',D']$ 的 $1\times1$ 卷积核的可学习参数,$\mathbf{E}_{\text{res}} \in \mathbb{R}^{L \times M \times D'}$ 是 $\mathbf{E}_{\text{concat}}$ 到匹配 $1\times1$ 卷积层输出维度的线性投影。通过残差连接,在保留基本时空特征的同时实现了从 $3D'$ 到 $D'$ 的降维,缓解了梯度消失问题并增强了训练过程的稳定性。 基于图卷积网络的空间拓扑建模。采用带有残差连接的两层GCN处理 $\mathbf{E}_{\text{fused}}$ 以捕获空间拓扑依赖关系。给定表征路段固有连通性的邻接矩阵 $\mathbf{A} \in \mathbb{R}^{M \times M}$,GCN操作定义为: $$\mathbf{E}_{\text{att}} = \text{Softmax}\left(\text{ReLU}\left(\text{GCN}\left(\text{ReLU}\left(\text{GCN}(\mathbf{E}_{\text{fused}}, \mathbf{A}; \theta_{\text{gcn1}})\right), \mathbf{A}; \theta_{\text{gcn2}}\right)\right)\right) \quad (5)$$ $$\mathbf{E}_{\text{sft}} = \mathbf{E}_{\text{att}} + \mathbf{E}_{\text{fused}} \quad (6)$$ 其中 $\theta_{\text{gcn1}}$ 和 $\theta_{\text{gcn2}}$ 表示两个GCN层的可学习参数,GCN操作沿空间维度应用。此操作基于空间拓扑相关性聚合来自相邻节点的特征信息,而残差连接则保留了对原始融合特征的直接访问。输出 $\mathbf{E}_{\text{sft}} \in \mathbb{R}^{L \times M \times D'}$ 封装了丰富的多尺度时空信息,作为LLM骨干网络的输入。 ### 2.3 LLM骨干网络 本研究采用GPT-2作为LLM骨干网络,通过选择性参数适应和架构改进用于交通流预测。其自回归Transformer架构能够有效建模时间依赖关系,同时保持计算效率。 差异化参数适应。如图1 (https://arxiv.org/html/2609.11314#S2.F1)所示,GPT-2的 $K$ 个Transformer块被分为两个子集,采用不同的参数更新策略。对于前 $U$ 个多头自注意力层和前馈层被冻结以保留预训练知识,而层归一化层则可训练以适应交通数据分布。对于剩余的 $(K-U)$ 个块,MHA层被解冻以捕获交通时空依赖关系,而FF层保持冻结以减少过拟合。GPT-2的输入和输出分别表示为 $\mathbf{E}_{\text{sft}} \in \mathbb{R}^{L \times M \times D'}$ 和 $\mathbf{E}_{\text{in}} \in \mathbb{R}^{L \times M \times D'}$。 上下文聚合MHA模块。为增强适应后的GPT-2表示,我们引入了一个上下文聚合多头注意力模块来聚合全局时空信息。通过将特征划分为 $h$ 个并行子空间,该模块捕获多尺度关联并整合残差连接与层归一化: $$\mathbf{E}_{\text{out}} = \text{Norm}(\mathbf{E}_{\text{agg}}) + \mathbf{E}_{\text{in}} \quad (7)$$ 其中 $\mathbf{E}_{\text{agg}}$ 表示全局聚合特征。生成的表示 $\mathbf{E}_{\text{LLM}}$ 结合了预训练知识和交通特定的时空模式。 交通流预测。生成的表示 $\mathbf{E}_{\text{LLM}} \in \mathbb{R}^{L \times M \times D'}$ 被送入回归卷积层以预测未来交通流: $$\widehat{\mathbf{Y}}_{L'} = \text{RConv}(\mathbf{E}_{\text{LLM}}; \theta_{rc}) \quad (8)$$ 其中 $\widehat{\mathbf{Y}} \in \mathbb{R}^{L' \times M \times D}$ 代表对未来 $L'$ 个时间步的预测,$\theta_{rc}$ 表示可学习参数。 ## 3 实验与结果 ### 3.1 实验设置 实验在四个公开交通数据集上进行:PEMS04、PEMS08、METR-LA和PEMS-BAY。每个数据集按6:2:2的比例划分为训练集、验证集和测试集,历史和预测范围均设置为12个时间步。DF-LLM在BasicTS平台[13 (https://arxiv.org/html/2609.11314#bib.bib12)]上实现,并使用NVIDIA GeForce RTX 4090 GPU训练,采用Ranger21优化器,学习率为0.0007。LLM骨干网络包含六层GPT-2,批处理大小为32,训练500个epoch;若验证集性能30个epoch未改善则应用早停机制。性能使用MAE、RMSE和MAPE进行评估,值越低表示精度越高。DF-LLM与具有代表性的深度学习方法进行了比较,包括DCRNN[10 (https://arxiv.org/html/2609.11314#bib.bib13)]、STGCN[16 (https://arxiv.org/html/2609.11314#bib.bib6)]、GWNet[15 (https://arxiv.org/html/2609.11314#bib.bib5)]、STGODE[6 (https://arxiv.org/html/2609.11314#bib.bib14)]、STID[14 (https://arxiv.org/html/2609.11314#bib.bib15)]、AGCRN[1 (https://arxiv.org/html/2609.11314#bib.bib4)]、STWave[5 (https://arxiv.org/html/2609.11314#bib.bib16)]、STAEformer[12 (https://arxiv.org/html/2609.11314#bib.bib17)]、DGCRN[9 (https://arxiv.org/html/2609.11314#bib.bib7)]和STNorm[4 (https://arxiv.org/html/2609.11314#bib.bib18)],以及基于LLM的方法如ST-LLM[11 (https://arxiv.org/html/2609.11314#bib.bib19)]等。
相似文章
MambaLSTM:一种用于增强交通事故风险预测的时空框架
本文提出MambaLSTM,一种结合Mamba状态空间模型和LSTM的框架,用于时空交通事故风险预测,解决了特征融合中的噪声和全局空间关联问题。
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。
FlowLM: 基于扩散-流适配的少步语言建模
FlowLM 提出了一种流匹配语言模型,通过高效微调从预训练扩散模型衍生而来,能够实现高质量少步文本生成,其效果可与2000步扩散采样相媲美,而训练轮次更少。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
基于超球面流的语言建模
本文介绍了 S-FLM,一种新颖的基于流的语言模型。该模型在超球面潜在空间中运行,旨在解决现有离散扩散模型和连续流模型的计算成本高昂及语义表达受限等问题。