基于仿真的车辆交通数据增强:通过虚拟传感扩展传感器覆盖范围

arXiv cs.AI 论文

摘要

本文提出一种基于仿真的方法,用虚拟传感器替代物理传感器来生成增强交通数据集,从而在保持交通模式的同时扩展城市网络中的传感器覆盖范围。

arXiv:2608.13993v1 公告类型:新 摘要:城市交通管理依赖于传感器网络,其空间覆盖范围受部署成本和隐私法规限制。在如此稀疏的数据上训练的机器学习模型无法泛化到未监测的位置,并且每当传感器基础设施发生变化时必须重新训练。我们提出一种基于仿真的方法来解决这个问题,通过生成增强交通计数数据集,其中每个物理传感器被放置在道路网络中替代位置的虚拟传感器所取代。虚拟传感器通过图搜索启发式方法选择,该方法联合最大化车辆流量连续性和原始位置与替代位置之间的交通指标相似性,同时强制执行最小空间位移以确保观测交通条件的多样性。我们在两个比利时城市验证了该方法:使用校准模型的 Brussels,和使用合成模型的 Namur。增强数据集保留了每日需求的双峰剖面和观测位置的交通动态。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:00

# 基于仿真的车辆交通数据增强:通过虚拟传感扩展传感器覆盖范围  
来源:https://arxiv.org/html/2608.13993  

Davide Andrea Guastella  
隶属机构:艾克斯-马赛大学,CNRS,LIS,马赛,法国  
隶属机构:机器学习组,布鲁塞尔自由大学,布鲁塞尔,比利时  

Eladio Montero Porras  
隶属机构:机器学习组,布鲁塞尔自由大学,布鲁塞尔,比利时  
隶属机构:WEL研究院,瓦弗,比利时  

Gianluca Bontempi  
隶属机构:[email protected]  
隶属机构:[email protected]  
隶属机构:[email protected]  
隶属机构:[email protected]  
隶属机构:机器学习组,布鲁塞尔自由大学,布鲁塞尔,比利时  
隶属机构:WEL研究院,瓦弗,比利时  

###### 摘要  
城市交通管理依赖于传感器网络,其空间覆盖范围受限于部署成本和隐私法规。基于此类稀疏数据训练的机器学习模型无法泛化到未监测区域,并且在传感器基础设施发生变化时必须重新训练。我们提出一种基于仿真的方法论,通过生成*增强*交通计数数据集来解决此问题,其中每个物理传感器都被放置在道路网络中替代位置的*虚拟传感器*所取代。虚拟传感器通过图搜索启发式算法选择,该算法在确保最小空间位移以保证观测交通条件多样性的同时,联合最大化车辆流连续性以及原始与替代位置之间的交通指标相似性。我们在两个比利时城市验证了该方法:布鲁塞尔使用校准模型,那慕尔使用合成模型。增强数据集保留了观测位置的双峰日需求曲线和交通动态。  

(*)预印本版本。本文稿目前正在接受Transportation Science期刊的出版审查。  

## 1 引言  
全球各地的城市正在部署数据驱动的系统,用于交通信号控制、拥堵预测和路径推荐\[16 (https://arxiv.org/html/2608.13993#bib.bib11), 5 (https://arxiv.org/html/2608.13993#bib.bib2)\]。这些系统的性能取决于大规模、空间多样的交通计数数据集的可用性。然而在实践中,城市传感器网络仅覆盖道路网络的一小部分。尽管城市环境中交通检测器的应用日益增多,但由于高安装和维护成本,特别是在郊区交叉口或路段\[18 (https://arxiv.org/html/2608.13993#bib.bib6)\],其覆盖范围相当稀疏。  

考虑一个由放置在部分主干道上的传感器监测的网络。传感器的稀疏性造成了两个叠加问题。首先,基于固定传感器集合数据训练的预测模型会学习到特定于这些位置的模式。其次,当传感器基础设施发生变化(例如检测器被移位、新建道路或隐私政策强制移除监控摄像头)时,收集的数据集会部分过时,重新收集代表性训练数据的成本可能高得令人望而却步\[8 (https://arxiv.org/html/2608.13993#bib.bib10)\]。  

本文提出一个基于仿真的框架,该框架从校准或合成的交通模型生成增强的交通数据集,同时保留原始传感器网络的结构。它基于一种启发式算法,该算法识别虚拟传感器位置,并使用从校准或合成仿真模型得出的转弯计数数据和路段级交通统计信息在这些位置生成真实的交通测量值。由此产生的增强数据集在将覆盖范围扩展到未被物理传感器直接监测的路段时,仍保留了真实交通的结构和时间模式。  

本工作的目标并非改进特定的预测或控制任务,而是建立一种生成真实虚拟交通观测的方法论,可作为广泛应用的中间资产。然而,评估这些特定应用带来的益处超出了本文的范围。  

为了说明稀疏传感器部署带来的挑战,考虑比利时布鲁塞尔道路网络的一部分(图1 (https://arxiv.org/html/2608.13993#S1.F1))。该区域的交通状况由有限的物理传感器(红色圆圈)监测。这些传感器主要安装在主要干道和环路上,而许多次级和住宅街道仍未装设仪器。对于许多交通建模和管理任务(如需求估计、出行时间预测或场景分析),这些未监测位置的数据仍然需要。部署额外传感器以填补空白通常不可行,原因包括高安装成本、有限的维护预算、物理限制或隐私问题\[1 (https://arxiv.org/html/2608.13993#bib.bib7)\]。  

一个直接的替代方案是在网络中随机放置虚拟传感器(蓝色叉号)。然而,这些位置可能经历与原始传感器截然不同的交通模式,产生不真实或无信息的数据,对交通分析任务的帮助有限。生成式方法如GAN或LLM纯粹从历史观测中学习数据分布,而这恰恰是未监测位置稀缺或不可用的资源:在没有路段先验测量的情况下,纯数据驱动的生成器无从条件化,也无法保证其输出遵守道路网络的物理约束(流量守恒、转弯能力、信号配时)。  

提出的增强方法通过为每个现有传感器选择一个在网络有限拓扑跳数内的周边替代位置来解决此问题,该位置在流量、速度、占用率和出行时间方面表现出相似的交通行为。然后将虚拟传感器放置在这些位置(绿色圆圈),确保与原始传感器一一对应。这样生成的增强数据集在将空间覆盖扩展到先前未装设仪器的路段时,保留了原始观测的统计特征。  

(参考说明)图1:布鲁塞尔部分道路网络上的交通数据增强示例。物理传感器(红色)提供稀疏覆盖。我们的方法在有限拓扑距离内选择交通动态相似的位置放置虚拟传感器(绿色),在保持统计一致性的同时改善了空间覆盖。随机放置(蓝色)可能无法捕捉代表性的交通状况。  

本文其余部分组织如下:第2节 (https://arxiv.org/html/2608.13993#S2) 回顾了关于交通数据增强和传感器放置的相关工作。第3节 (https://arxiv.org/html/2608.13993#S3) 提出所建议的方法。第4节 (https://arxiv.org/html/2608.13993#S4) 描述了实验设置、两个案例研究、结果和基线比较。第5节 (https://arxiv.org/html/2608.13993#S5) 讨论了限制以及校准问题的欠定性,这本质上影响了增强过程。最后,第6节 (https://arxiv.org/html/2608.13993#S6) 总结并概述了未来工作的方向。  

## 2 背景  
在许多实际场景中,通常无法获得足够的训练数据来充分训练机器学习模型\[6 (https://arxiv.org/html/2608.13993#bib.bib13)\]。数据增强是解决此问题的有效方法\[16 (https://arxiv.org/html/2608.13993#bib.bib11)\]。生成合成数据是扩展小型或有偏数据集(可能包含敏感信息)的关键方法,特别是在数据有限的情况下\[15 (https://arxiv.org/html/2608.13993#bib.bib17)\]。它已被用于医疗保健和金融等领域,执行诊断分类和欺诈检测等任务\[11 (https://arxiv.org/html/2608.13993#bib.bib12)\]。  

在车辆交通领域,数据增强具有重要价值,因为诸如感应线圈和摄像头之类的传感器通常分布稀疏,无法在空间上覆盖整个道路网络。定期收集和分析用户存在的位置和时间有助于推断关于用户的多种重要信息,并识别其行为、社会习惯、风俗、爱好、工作场所以及出行时间\[2 (https://arxiv.org/html/2608.13993#bib.bib9)\]。然而,这对公民来说代价不小。  

最近的研究越来越多地将交通传感器放置与数据增强相结合,以解决网络可观测性有限和交通测量稀疏的挑战。Almutairi和Owais\[3 (https://arxiv.org/html/2608.13993#bib.bib15)\]提出了一个框架,将交通传感器位置问题(TSLP,在预算和覆盖约束下确定传感器的最优数量和位置)与基于机器学习的交通重建相结合。他们的方法首先识别一个能够提供足够网络覆盖的最小传感器位置集,然后使用堆叠稀疏自编码器推断未观测路段的交通状况。由此产生的增强交通信息用于支持最小化出行时间的路径推荐。在所考虑的合成网络中,作者报告称,仅需21%的路段装设仪器即可实现有效的全网交通估计和路径规划。  

TSLP文献的最新进展日益关注可观测性、信息增益和可扩展优化技术。Hu和Fan\[10 (https://arxiv.org/html/2608.13993#bib.bib4)\]将传感器放置表述为网络可观测性问题,并开发了代数和图论的补充方法,以在最小化部署传感器数量的同时最大化交通状态的可观测性。类似地,Yang等人\[19 (https://arxiv.org/html/2608.13993#bib.bib5)\]提出一个信息梯度框架,根据传感器对全网信息增益的预期贡献进行放置,从而在大型交通系统中实现高效部署。  

从优化角度来看,Li等人\[12 (https://arxiv.org/html/2608.13993#bib.bib3)\]证明,几类交通传感器放置问题具有子模性,因此可以通过计算高效的贪心算法获得近最优解,并具有理论性能保证。作为补充,Mashhadi等人\[15 (https://arxiv.org/html/2608.13993#bib.bib17)\]提出一种利用变分自编码器(VAE)进行施工区交通估计数据增强的方法,并引入自定义正则化损失函数以增强模型鲁棒性。VAE是参数化生成模型,学习捕获输入数据基本特征的低维潜在空间,用于生成真实的合成样本。该方法在犹他州施工区21.2万条小时交通量记录(2016-2019)的数据集上进行了评估。合成数据与实际流量非常接近,然而,输入数据集的性质可能影响数据增强过程的性能。值得注意的是,更大或更复杂的VAE架构需要更多数据以避免过拟合并学习有意义的潜在空间表示。在稀疏传感器环境中,这使得有效的数据增强更具挑战性。  

Pham等人\[17 (https://arxiv.org/html/2608.13993#bib.bib16)\]提出一种用于放置交通传感器以重建交通数据的数据驱动方法。其核心思想是根据交通链路在从稀疏放置的传感器重建交通信息中的重要性对其进行排序。该方法基于两个步骤:(i)使用列主元矩阵分解,从原始空间中选择一个测量子集以实现最大化重建;(ii)基于策略梯度和一维卷积神经网络(CNN)的深度强化学习模型,学习一种传感器放置策略,在保留原始数据最短路径的同时。该方法的一个局限是其时间复杂度,这可能影响其在非常大的网络中或通过更多分段增加链路数据粒度时的适用性。  

现有工作要么关注从稀疏观测重建缺失的交通状态,要么关注优化传感器部署。在这项工作中,我们将传感器观测生成视为一项网络级替代任务,要求生成的数据保留现有传感器配置的全局交通动态,而非进行局部插值。据我们所知,这种特定表述以前尚未被研究。  

## 3 提出的方法  
真实的交通传感器仅覆盖道路网络的一小部分,留下大部分路段未被观测。当校准方法从传感器数据估计起讫点需求或路径选择时,所得模型仅被约束在装设仪器的位置复现测量值。因此,传感器稀疏性限制了校准模型的空间分辨率和整体保真度。此处,交通校准是调整交通模型参数(轨迹、车辆数量和出发时间)的过程,以使仿真软件输出与真实交通动态相匹配。  

所提出的方法通过利用交通仿真来推导未被物理传感器覆盖的道路网络路段上的*虚拟*传感器读数来解决此限制。它接收交通模型作为输入,从中提取转弯计数和路段指标数据。该模型可以是根据历史传感器测量值或起讫点矩阵估计的*校准*模型,也可以是根据网络先验知识和合理需求模式构建的*合成*模型。在仿真中,可以在*任何*路段提取交通测量值,无需额外成本,从而可以构建一个扩展的数据集,该数据集镜像真实传感器网络的结构,但具有更广的空间覆盖范围。  

然后,将此增强数据集作为校准方法的输入。由于增强测量值来自定义参考交通曲线的同一仿真,因此期望增强模型能产生与输入模型一致的车辆流曲线。表1 (https://arxiv.org/html/2608.13993#S3.T1) 总结了本节使用的符号。  

表1:提出的方法中使用的符号和表示法。  

该方法构建一个单射映射 Z: Es→E∖Es \\mathcal{Z}: \\mathcal{E}_\\{s\\} \\to \\mathcal{E} \\setminus \\mathcal{E}_\\{s\\},将每个有物理传感器的路段 Es \\mathcal{E}_\\{s\\} 与放置在不同路段上的不同*虚拟传感器*相关联。配对不是任意的:当虚拟传感器在仿真中表现出的交通动态与传感器路段观测到的相似时,它被认为是物理传感器的良好替代品。相似性通过一个正则化评分函数量化,该函数联合考虑(i)在两个路段之间流动的车辆量(转弯计数相似性)和(ii)观测到的交通属性,如平均速度或占用率。  

该方法分解为两个过程。第一个是GetCandidates(算法1 (https://arxiv.org/html/2608.13993#alg1)),它是一个子程序,给定一个有传感器的路段 ee

相似文章

AI交通科学家自主发现交通法规

arXiv cs.AI

本文介绍了TrafficSci,一种自主AI系统,通过迭代工作流程自动化发现跨城市的通用交通法规,成功重新发现了已建立的法规,并识别出城市驾驶行为中一种新的时间记忆尺度。

基于结构化自回归建模的长期交通仿真

arXiv cs.AI

介绍了 RosettaSim,一种采用结构化自回归建模进行长期交通仿真的框架,在 Waymo Open Sim Agent Challenge 上取得了最先进的性能。同时提出了基于检索的交通评估(Retrieval-based Traffic Evaluation, RTE),用于更好地评估长时域保真度。