使用Temporal Convolutional Networks推断缺失轨迹数据
摘要
本文提出了一种具有对称膨胀的Temporal Convolutional Network用于轨迹修补,通过复合损失函数从观测上下文中重建缺失片段,并在合成的二维轨迹上进行了评估。
arXiv:2607.25147v1 Announce Type: new
摘要:现实环境中收集的轨迹数据常常因传感器故障、通信丢失或遮挡而不完整。我们研究的任务是\emph{轨迹修补}:从观测上下文中重建连续的缺失片段。我们提出了一种具有对称膨胀的Temporal Convolutional Network (TCN),它放宽了标准的因果约束,允许每个时间步同时利用过去和未来的观测,这一特性对于修补至关重要,但面向预测的架构中却不具备。该模型使用复合损失进行训练,该损失结合了加权均方误差、边界连续性惩罚和平滑正则化。在包含$1,000$条(训练)、$200$条(验证)和$300$条(测试)二维轨迹的合成数据集上,其中随机放置了20%的掩蔽片段,该模型取得了良好的R$^{2}$、MSE和MAE指标。
查看缓存全文
缓存时间: 2026/07/29 09:53
# 使用时间卷积网络推断缺失轨迹数据 来源:https://arxiv.org/html/2607.25147 11institutetext:独立研究员,英国牛津22institutetext:CEREMADE,巴黎多芬大学 - PSL,CNRS,法国巴黎 22email:[email protected],https://turinici.com/2026年5月 ###### 摘要 现实世界中收集的轨迹数据常常因传感器故障、通信丢失或遮挡而不完整。我们处理*轨迹修补*任务:从观察到的上下文中重建连续的缺失片段。我们提出了一种具有对称扩张的时间卷积网络(TCN),它放宽了标准的因果性约束,允许每个时间步同时利用过去和未来的观测,这一特性对于修补至关重要,但在面向预测的架构中却不存在。该模型通过复合损失进行训练,该损失结合了加权均方误差、边界连续性惩罚和平滑正则化。在包含1,000组训练、200组验证和300组测试的二维轨迹合成数据集上,这些轨迹带有随机放置的20%遮盖片段,模型取得了良好的R2、MSE和MAE指标。 ## 1引言 轨迹数据支撑着从基于GPS的导航到运动捕捉和自主机器人等一系列现实系统。然而,在实践中,此类数据很少是完整的:由信号遮挡、传感器故障或数据包丢失引起的丢包会引入连续的缺口,必须在进行任何下游处理之前将其填补。从观测不完整的数据中重建合理的轨迹——通常称为*轨迹修补*——需要模型同时尊重缺口边界处的局部连续性和整个序列更广泛的时间动态。 诸如线性插值之类的经典方法计算量轻,但忽略了底层运动模型,产生不现实的直线段,违背了轨迹的自然曲率。诸如LSTM[8 (https://arxiv.org/html/2607.25147#bib.bib10)]之类的循环模型捕获序列依赖关系,但遭受顺序计算瓶颈和梯度消失问题。基于Transformer的模型提供强大的长程上下文,但施加了巨大的计算成本,并且通常需要大量的训练语料库[19 (https://arxiv.org/html/2607.25147#bib.bib8)]。 时间卷积网络(TCNs)[3 (https://arxiv.org/html/2607.25147#bib.bib6)]提供了一个有吸引力的中间地带:通过堆叠的扩张卷积完全并行处理序列,训练稳定,并且有效感受野随网络深度呈指数增长。关键在于,由于我们的目标是修补而非预测,我们放宽了标准的因果填充约束,采用*对称*填充,使每个位置都能关注到过去和未来的上下文。这一设计选择使我们使用TCN的方式区别于其传统的序列预测应用。 我们在由具有随机相位偏移和加性高斯噪声的正弦分量叠加组成的合成二维轨迹上评估所提出的方法,报告了在试点和更大规模实验设置中的性能。 ### 1.1文献综述 行人轨迹建模已在自动驾驶、人群分析和人机交互的背景下得到广泛研究,历史上的主要焦点是*轨迹预测*而非重建。早期方法依赖于专家驱动和基于物理的模型,例如社会力公式和启发式人群动力学,这些模型具有可解释性,但在处理复杂的非线性运动模式和长时间依赖关系方面存在困难[7 (https://arxiv.org/html/2607.25147#bib.bib12)]。 数据驱动方法的出现将注意力转向直接从数据中学习轨迹动态。循环神经网络,特别是LSTM,因其捕获时间依赖性的能力而成为主导范式,其中Social-LSTM[1 (https://arxiv.org/html/2607.25147#bib.bib13)]通过池化机制引入了显式的社交交互建模。随后的生成式扩展,例如Social-GAN[6 (https://arxiv.org/html/2607.25147#bib.bib14)],通过采样多样化的可能未来实现了多模态预测,在ETH/UCY[14 (https://arxiv.org/html/2607.25147#bib.bib4),12 (https://arxiv.org/html/2607.25147#bib.bib21)]等标准基准上显著提高了性能。然而,这些模型主要是因果性和前向预测的,并未专门设计用于处理序列内的缺失观测。 最近的工作探索了卷积和基于图的架构以克服循环模型的局限性。时间卷积网络(TCNs)通过扩张[3 (https://arxiv.org/html/2607.25147#bib.bib6),10 (https://arxiv.org/html/2607.25147#bib.bib7)]提供并行计算和稳定训练,同时保持大的感受野。基于图的模型,包括Social-STGCNN和相关时空图网络,显式地对行人之间的交互进行建模,并在密集场景中取得了强劲的结果[13 (https://arxiv.org/html/2607.25147#bib.bib15),16 (https://arxiv.org/html/2607.25147#bib.bib16)]。注意力机制和基于Transformer的模型进一步改进了长程依赖建模,但代价是计算成本增加[19 (https://arxiv.org/html/2607.25147#bib.bib8)]。 除了架构上的进步,基准数据集和评估协议也发挥了核心作用。ETH/UCY[14 (https://arxiv.org/html/2607.25147#bib.bib4),12 (https://arxiv.org/html/2607.25147#bib.bib21)]和斯坦福无人机数据集仍然是使用最广泛的参考,通常使用基于位移的指标(如ADE和FDE)进行评估[6 (https://arxiv.org/html/2607.25147#bib.bib14),21 (https://arxiv.org/html/2607.25147#bib.bib20)]。然而,正如近期综述[15 (https://arxiv.org/html/2607.25147#bib.bib17),18 (https://arxiv.org/html/2607.25147#bib.bib11)]所指出的,这些数据集最初并非为研究缺失数据而设计。TrajImpute代表了近期通过引入系统性遮挡协议和基于修补的评估来形式化轨迹插补的最接近努力[5 (https://arxiv.org/html/2607.25147#bib.bib1)]。 总体而言,尽管轨迹预测取得了快速进展——特别是生成模型和扩散模型[17 (https://arxiv.org/html/2607.25147#bib.bib18),2 (https://arxiv.org/html/2607.25147#bib.bib19)]——但轨迹修补的具体问题仍然相对未得到充分探索。现有方法通常是事后调整以适应缺失数据场景,并且缺乏将重建与预测分离开来的标准化基准。这解释了为什么我们使用受控的合成数据集来隔离研究轨迹修补,从而能够精确分析架构和损失函数的设计选择。 ### 1.2总结与定位 与预测和跟踪相比,轨迹修补仍然相对未得到充分探索,存在标准不统一的基准和大多为适配的目标公式。这项工作做出了多项贡献:首先,我们引入了一个受控的合成基准;其次,我们通过用对称扩张卷积(利用过去和未来的上下文)替换因果卷积,将TCN架构适配到轨迹修补;第三,我们设计了一个为处理连续缺口而定制的损失函数。 ## 2方法论 ### 2.1合成数据生成 #### 动机: 没有单一的标准化轨迹修补基准;TrajImpute是近年最接近的努力,我们的合成数据提供了一个互补的、完全受控的测试平台[5 (https://arxiv.org/html/2607.25147#bib.bib1)]。因此,现有的评估依赖于合成轨迹、改编的行人数据集和跟踪基准的组合。 合成数据集广泛用于在受控条件下研究插值和插补,因为参数化和正弦运动模型生成平滑但非线性的轨迹,这些轨迹无法通过线性插值恢复[20 (https://arxiv.org/html/2607.25147#bib.bib2),4 (https://arxiv.org/html/2607.25147#bib.bib3)]。我们的合成数据遵循这一既定做法,同时能够精确控制曲率、噪声和缺口结构。 诸如ETH/UCY[14 (https://arxiv.org/html/2607.25147#bib.bib4),12 (https://arxiv.org/html/2607.25147#bib.bib21)]之类的现实数据集经常通过人为遮挡连续片段来适应修补任务[14 (https://arxiv.org/html/2607.25147#bib.bib4)]。TrajImpute通过标准化的遮挡协议和明确关注插补性能的评估指标将这种方法正式化[5 (https://arxiv.org/html/2607.25147#bib.bib1)]。相比之下,诸如MOT16-20之类的跟踪基准由于遮挡而包含自然缺口[11 (https://arxiv.org/html/2607.25147#bib.bib5)],但重建质量与检测噪声和数据关联相混淆。 在此背景下,合成轨迹并非作为现实数据的替代,而是作为一个有原则的实验基线,将修补问题与检测噪声和身份模糊等混淆因素隔离开来。这种受控环境能够精确分析模型行为和损失设计,这在完全无约束的基准上很难实现。 #### 技术细节: 轨迹生成为具有随机相位偏移和加性高斯噪声的正弦分量叠加。对于归一化时间轴t∈[0,1]t∈[0,1],在T=200T=200个均匀间隔点上采样,xx和yy坐标定义为: x(t) = sin(2πt+φx) + 0.3 sin(6πt+φy) + εx, (1) y(t) = cos(2πt+φy) + 0.3 sin(4πt+0.5+φx) + εy, (2) 其中φx, φy ~ U(0, 2π)是独立的随机相位偏移,εx, εy ~ N(0, σ²)且σ=0.02。相位随机化确保没有两条轨迹是相同的,而多频结构产生了非平凡的曲率,难以通过线性插值。 每个轨迹放置一个连续的遮盖片段,覆盖序列的20%(即40个时间步),其起始索引均匀随机抽样。我们生成了1,500个轨迹-遮盖对,其中1,000个用于训练,200个用于验证,300个用于测试。 ### 2.2输入表示 每个时间步t_i编码为一个四维向量: u_i = [x_i·(1 - m_i), y_i·(1 - m_i), m_i, \tilde{t}_i]^T, (3) 其中m_i ∈ {0, 1}是二进制掩码(1表示位置缺失,0表示已观测),\tilde{t}_i = i/(T-1)是归一化时间索引。将缺口内的坐标归零可防止模型在训练期间观察到真实值,而显式的掩码通道允许其区分缺失和观测位置,而无需依赖输入信号的幅度。时间通道提供了纯卷积架构中缺失的位置上下文。 ### 2.3模型架构 网络由五个堆叠的TCN块组成,后跟一个1×1卷积输出头,投影到两个输出维度(预测的\hat{x}和\hat{y})。每个块按顺序应用以下操作: 1. 具有核大小k=5和膨胀率d_l = 2^{l-1}(对于块l ∈ {1,...,5},即膨胀率为1, 2, 4, 8, 16)的扩张一维卷积; 2. 跨通道维度的层归一化; 3. ReLU激活; 4. 残差连接,将块的输入添加到其输出,当输入和输出通道数不同时使用1×1投影。 所有隐藏层使用64个通道。采用对称(零)填充,而不是预测型TCN中使用的因果填充,以便每个位置关注过去和未来相等大小的窗口。感受野覆盖125个时间步,允许从缺口两侧纳入大量上下文信息。表1 (https://arxiv.org/html/2607.25147#S2.T1)总结了NN架构。 | 层类型 | 通道数 | 膨胀率 | 目的 | |----------------|--------|--------|-------------------| | 位置输入 | — | — | — + 掩码 + 时间 | | 块 1: Conv1D + LN + ReLU + 残差 | 64 | 1 | 局部特征 | | 块 2: Conv1D + LN + ReLU + 残差 | 64 | 2 | 中等上下文 | | 块 3: Conv1D + LN + ReLU + 残差 | 64 | 4 | 更长依赖 | | 块 4: Conv1D + LN + ReLU + 残差 | 64 | 8 | 更广模式 | | 块 5: Conv1D + LN + ReLU + 残差 | 64 | 16 | 全局结构 | | 输出头: Conv1D (1×1) | 2 | – | 预测 (\hat{x},\hat{y}) | 表 1: 模型架构概览。 ### 2.4损失函数 大多数先前的基于学习的方法优化轨迹缺失点上的逐点重建损失,通常是均方误差。虽然这对于最小化平均误差有效,但仅靠此类目标并不强制连续性或平滑性,并且常常导致视觉上不合理的重建,尤其是在缺口边界处。 为了解决这个问题,先前的一些工作引入了辅助正则化项,例如速度或加速度惩罚,或端点一致性约束。这些项鼓励更平滑的运动,但通常是全局应用的,没有明确区分观测区域和缺失区域。 本文使用的损失函数旨在反映轨迹修补的具体要求: 1. 首先,重建损失(此处为LMSE)被加权以强调掩蔽区域内的准确性,同时仍弱锚定观测片段中的预测。这防止了模型改变观测点以减少全局误差的平凡解。 2. 其次,显式的连续性损失(此处为Lcont)惩罚掩蔽段入口和出口处的不匹配,直接针对修补模型最感知显著的失败模式。 3. 最后,一阶平滑惩罚(此处为Lsmooth)在不施加刚性参数模型的情况下鼓励全局连贯的运动。 通过将目标分解为区域感知的重建、边界连续性和全局平滑项,我们的公式不同于先前主要依赖统一MSE或通用时间正则化器的方法,并且专门与修补任务的结构约束保持一致。训练最小化复合目标: L = LMSE + λcont Lcont + λsmooth Lsmooth, (4) 其中 λcont = λsmooth = 0.5。我们现在描述总体损失函数的三个项。 #### 加权MSE。 重建项对掩蔽区域中的错误惩罚比观测区域更重: LMSE = (1/|M|) Σ_{i∈M} ||\hat{p}_i - p_i||² + α(1/|\bar{M}|) Σ_{i∉M} ||\hat{p}_i - p_i||², (5)
相似文章
你不需要强假设:基于时间差分的视觉表征学习
本文介绍了视觉时间差分法(TDV),这是一种用于视频的自监督学习方法,仅依赖于过去导致未来的因果假设,避免了强归纳偏差,同时在密集空间任务上达到最新技术水平。
使用时间段模型进行预测和控制
OpenAI 推出了一种使用深度生成模型在时间段上学习复杂非线性系统动力学的方法,能够实现稳定的长期预测和可微分的轨迹优化以进行基于模型的控制。
@ninaddaithankar: 视觉模型能否在没有数据增强、掩码、裁剪或重建的情况下学会观察?它可以!介绍……
介绍了时间差视觉表征学习范式(Temporal Difference in Vision, TDV),这是一种新颖的视觉表征学习范式,无需数据增强、掩码、裁剪或重建即可学习有用的表征,并在密集空间任务上达到与最先进方法相当的性能。
用于动力系统重构的循环神经网络的时间并行训练
本文研究了用于动力系统重构中训练循环神经网络的时间并行算法,提出了GTF-DEER,它能够在长序列上实现稳定学习,并提高重构精度。
基于时间增强符号图神经网络的动态链接预测
本文提出了一种面向符号图神经网络的模块化时间增强框架,通过历史上下文集成模块(HCIM)结合LSTM和多头时间注意力机制整合历史上下文,在真实世界的时间符号网络上进行动态链接预测时取得了持续改进。