基于条件注意力的上下文感知船舶轨迹预测

arXiv cs.LG 论文

摘要

本文提出条件信息器(Conditional Informer),一种基于Transformer的编码器-解码器架构,用于船舶轨迹预测。该方法通过条件注意力机制将船舶动态条件化于环境上下文,实现了15.4%的精度提升,并通过模态掩蔽(Modality Masking)实现了鲁棒的降级回退。

arXiv:2607.27418v1 公告类型:新 摘要:长期船舶轨迹预测是海上安全和自主导航的基础能力。尽管近期基于Transformer的架构已提升了预测时域,但它们主要依赖历史运动状态,将船舶运动视为孤立系统。实际上,海上航行深受天气等外部因素调节,并受静态船舶特征约束。现有的多模态方法从根本上建模状态和上下文的联合分布,将环境变量视为对等特征,而非编码船舶动态对环境条件的方向性物理依赖。 在本工作中,我们提出条件信息器(Conditional Informer),一种新颖的编码器-解码器架构,将轨迹预测表述为条件生成任务。我们采用专用的条件注意力机制,其中船舶状态通过交叉注意力显式查询环境上下文,编码了天气调节(而非生成)船舶动态的物理先验。此外,为应对真实世界数据的间歇性,我们引入模态掩蔽(Modality Masking)训练策略,以防止传感器回退期间的灾难性退化。在AIS和ERA5数据上的大量实验表明,当上下文可用时,我们的方法在预测精度上比基于运动学和拼接的基线提升15.4%。关键在于,模态掩蔽防止捷径学习,将回退误差相比无约束模型降低近一个数量级。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:02

# 基于条件注意力的上下文感知船舶轨迹预测

来源:https://arxiv.org/html/2607.27418
Chandler Squires 机器学习系,卡内基梅隆大学
Timothy Hu 先进技术实验室,洛克希德·马丁公司
Pradeep Ravikumar 机器学习系,卡内基梅隆大学

###### 摘要

长期船舶轨迹预测是海上安全和自主导航的一项基础能力。虽然近期基于 Transformer 的架构提升了预测时域,但它们主要依赖历史运动状态,将船舶运动视为一个孤立系统。然而在现实中,海上航行受到天气等外部因素的深刻调制,并受到静态船舶特征的约束。现有的多模态方法从根本上建模状态与上下文的联合分布,将环境变量视为同级特征,而不是编码船舶动力学对环境条件依赖的方向性物理关系。

在本工作中,我们提出了 Conditional Informer,一种新颖的编码器-解码器架构,将轨迹预测表述为条件生成任务。我们采用了一种专门的 Conditional Attention 机制,其中船舶状态通过交叉注意力显式查询环境上下文,从而编码了“天气调制——但并非由——船舶动力学生成”这一物理先验。此外,为了解决真实世界数据的不连续性,我们引入了一种模态掩蔽(Modality Masking)训练策略,以防止在传感器回退期间出现灾难性退化。在 AIS 和 ERA5 数据上的大量实验表明,当上下文可用时,我们的方法在预测精度上比基于运动学和拼接的基线高出 15.4%。至关重要的是,模态掩蔽阻止了捷径学习,与不受约束的模型相比,将回退误差降低了近一个数量级。

††脚注文本:© 2026 IEEE。允许个人使用本材料。所有其他用途,包括在当前或未来任何媒体中以广告或促销目的重印/再版本材料、创建新的集体作品、转售或再分发到服务器或列表,或在本作品以外的其他作品中重用任何受版权保护的部分,都必须获得 IEEE 的许可。

## 1 引言

随着自主船舶技术的发展,在长时间范围内预测船舶未来状态(位置、速度和航向)的能力变得日益关键。虽然自动识别系统(AIS)是实时船舶遥测的主要来源,但其信号会因传输故障、天线遮挡、卫星覆盖空洞或蓄意关闭应答器而出现丢失。在此类场景中,准确的轨迹预测模型对于维持海上领域感知至关重要,使操作员能够在 AIS 缺失期间跟踪船舶,并主动解除航道冲突。除 AIS 之外,类似的运动学特征也可以通过卫星图像和基于雷达的跟踪获得(Milios 等,2019 (https://arxiv.org/html/2607.27418#bib.bib12)),但时间分辨率较低,计算成本较高。深度学习模型,尤其是 Transformer,已基本取代 RNN(Capobianco 等,2021 (https://arxiv.org/html/2607.27418#bib.bib3))和运动学模型(如卡尔曼滤波器),用于 AIS 轨迹预测,因为它能有效捕获长程依赖。值得注意的是,Informer-TP(Xiong 等,2024 (https://arxiv.org/html/2607.27418#bib.bib17))利用 ProbSparse Attention,与标准 Transformer 相比显著减少了长期误差累积。

尽管取得了这些进展,一个关键局限仍然存在:最先进的模型将船舶运动视为一个孤立的运动学过程,仅依赖历史轨迹状态。然而在现实中,船舶是一个开放物理系统,其轨迹受到外部环境力(如风、浪和流)的深刻调制,并受到静态船舶特征的约束。虽然广泛的外部因素(包括季节性航运模式、港口拥堵和地缘政治事件(MarineTraffic 2025 (https://arxiv.org/html/2607.27418#bib.bib11)))可能影响航线决策,但我们关注的是那些对船舶动力学产生直接且连续机械影响、并可通过 ERA5 等再分析产品在全球范围内获取的物理可测环境力(风速和有效波高)。然而,我们提出的条件架构可以扩展到其他可用的外生信号。

在本工作中,我们提出了 Conditional Informer,一种新颖的架构,扩展了 Informer-TP 框架,以显式建模轨迹状态对环境上下文和静态元数据的条件依赖。我们的方法利用分离的嵌入路径和一种专门的 Conditional Attention 机制来捕获这些其他变量对船舶状态演化的影响。

(a) 状态轨迹 Xk\mathbf{X}^{k}
(b) 上下文轨迹 Wk\mathbf{W}^{k}
(c) 时间戳

图 1:上下文感知船舶轨迹预测的状态和上下文轨迹示例。在 (a) 中,LAT、LON、SOG 和 COG 分别是纬度、经度、对地航速和对地航向的缩写。在 (b) 中,SWH 和 WS 分别是有效波高和风速的缩写。

### 1.1 多模态数据融合

认识到外部因素的重要性,近期的研究已开始探索多模态轨迹预测。核心挑战在于有效融合高频、稀疏的运动学数据(AIS)与低频、稠密的环境场(天气)以及静态属性(元数据)。现有方法大致分为两类:

1. 1. 并行特征提取:Zhang 等 (2024 (https://arxiv.org/html/2607.27418#bib.bib18)) 提出了自适应多模态数据 (AMD) 模型,采用分别针对 AIS 的 GRU 和针对环境数据的 MLP 的独立特征提取分支,然后在中心融合块中合并。
2. 2. 门控融合:Chen 等 (2023 (https://arxiv.org/html/2607.27418#bib.bib4)) 引入了双路径时空注意力网络 (DualSTMA),通过门控机制将静态船舶属性注入 Transform 的动态流中,从而调制学习到的特征。

虽然这些架构超越了简单的输入拼接,但它们对状态 XX 和上下文 WW 的联合分布 P(X,W)P(X,W) 进行建模,将环境变量视为有助于解释输出方差的同级特征。关键在于,这种对称处理没有编码海事系统中方向性的物理关系:环境力影响船舶动力学,而船舶运动并不改变天气。正如我们在第 V-D 节中通过实验证明的那样,这种忽略会产生实际后果——如果没有强制正确方向性的结构约束,多模态模型容易陷入捷径学习(Geirhos 等,2020 (https://arxiv.org/html/2607.27418#bib.bib6)),即塌缩到最强的可用信号,同时抑制更弱但必不可少的模态。

### 1.2 因果视角

环境条件和船舶动力学呈现出严格的物理不对称性:天气扰动船舶运动,但反之不然。

遵循 Schölkopf 等 (2021 (https://arxiv.org/html/2607.27418#bib.bib13)) 的观点,将这种已知的因果结构编码为架构归纳偏置——将环境编码器与状态路径分离——得到比联合表示更稳健泛化的模型。

忽略这种不对称性的实际风险是捷径学习(Geirhos 等,2020 (https://arxiv.org/html/2607.27418#bib.bib6)):当多种输入模态携带不同水平的预测信号时,不受约束的模型可能利用最强信号,同时抑制更弱但必不可少的特征。在多模态轨迹预测中,这表现为特征塌缩——模型学会完全依赖环境上下文而忽略运动学状态,导致在推理时上下文不可用时发生灾难性失败。

因此,我们采用的设计原则是:已知的物理层级应反映在模型架构中。在我们的 Conditional Attention 机制中,船舶状态生成查询,而环境提供键和值,形成方向性的注意力矩阵,其中状态关注上下文,但反之不然。

## 2 问题定义

一般而言,我们引入*上下文感知轨迹预测*任务。设 kk 为我们希望预测轨迹的目标对象的索引。每个索引 kk 与*轨迹长度* Tk∈NT_{k}\in\mathbb{N} 和*状态轨迹* Xk\mathbf{X}^{k} 相关联。此外,每个 kk 可选地与*上下文轨迹* Wk\mathbf{W}^{k} 和*元数据向量* ak\mathbf{a}^{k} 相关联,具体如下。

### 2.1 状态、上下文和元数据

令 X=Rdx\mathcal{X}=\mathbb{R}^{d_{x}} 表示对象的*状态空间*,状态轨迹是状态的序列,即 Xk={xtk}t=1Tk\mathbf{X}^{k}=\{\mathbf{x}^{k}_{t}\}_{t=1}^{T_{k}},其中 xtk∈X\mathbf{x}^{k}_{t}\in\mathcal{X},t=1,...,Tkt=1,\ldots,T_{k}。类似地,令 W=Rdw\mathcal{W}=\mathbb{R}^{d_{w}} 表示*上下文空间*,上下文轨迹是上下文的序列,即 Wk={wtk}t=1Tk\mathbf{W}^{k}=\{\mathbf{w}^{k}_{t}\}_{t=1}^{T_{k}},其中 wtk∈W\mathbf{w}^{k}_{t}\in\mathcal{W},t=1,...,Tkt=1,\ldots,T_{k}。最后,令 A=Rda\mathcal{A}=\mathbb{R}^{d_{a}} 表示对象的*元数据空间*,元数据向量 ak∈A\mathbf{a}^{k}\in\mathcal{A} 是与每个对象关联的静态向量。

在我们考虑的船舶轨迹预测任务中,状态 xtk\mathbf{x}^{k}_{t} 包含自轨迹开始以来的经过时间(分钟)、船舶在时间 tt 的纬度、经度、对地航速(SOG)和对地航向(COG)。上下文 wtk\mathbf{w}^{k}_{t} 对应于与船舶相同纬度和经度、相同时间 tt 的有效波高和风速。最后,元数据 ak\mathbf{a}^{k} 包括船体特征(吃水、长度和宽度)和货物类型。在实践中,上下文和元数据特征可能部分缺失;我们为每个特征附加二元缺失指示符,得到 dw=3d_{w}=3(风速、有效波高和一个波高缺失指示符)和 da=9d_{a}=9(四个物理属性及其相关指示符,外加 MMSI)。图 1 (https://arxiv.org/html/2607.27418#S1.F1) 给出了一个示例轨迹。

### 2.2 上下文感知轨迹预测

对于我们的预测任务,考虑固定的*历史长度* LL 和*预测时域* PP,使得 L+P≤Tk∗L+P\leq T_{k^{*}},其中 k∗{k^{*}} 是目标对象的索引。在测试时,给定:

1. 1. 历史状态轨迹 Xpastk∗:={xtk∗}t=1L\mathbf{X}^{k^{*}}_{\text{past}}\mathrel{:}=\{\mathbf{x}^{k^{*}}_{t}\}_{t=1}^{L},
2. 2. 历史上下文轨迹 Wpastk∗:={wtk∗}t=1L\mathbf{W}^{k^{*}}_{\text{past}}\mathrel{:}=\{\mathbf{w}^{k^{*}}_{t}\}_{t=1}^{L},*或*一个指示符(例如 None),表示其不可用,以及
3. 3. 元数据向量 ak∗∈A\mathbf{a}^{k^{*}}\in\mathcal{A},*或*一个指示符(例如 None),表示元数据不可用。

我们通过最小化完整预测状态向量上的均方误差(MSE)来训练模型。对于模型选择和评估,我们使用预测地理坐标与真实地理坐标之间的平均 Haversine 距离,

m(Yk∗,Y^k∗)=1P∑t=L+1L+Phav(xtk∗,x^tk∗),m\!\!\left(Y^{k^{*}},\,\hat{Y}^{k^{*}}\right)=\frac{1}{P}\sum_{t=L+1}^{L+P}\mathrm{hav}\!\!\left(x_{t}^{k^{*}},\,\hat{x}_{t}^{k^{*}}\right),(1)

其中 hav(x,x′)\mathrm{hav}(x,x^{\prime}) 是由 xx 和 x′x^{\prime} 的纬度和经度坐标计算的大圆距离。我们选择该指标用于检查点保存,因为准确的地理位置预测是主要操作目标;辅助状态变量(速度、航向)对于海上领域感知而言是次要的。我们选择整个时域上的平均值,而不是终点指标 hav(x^L+Pk∗,xL+Pk∗)\text{hav}(\hat{x}^{k^{*}}_{L+P},x^{k^{*}}_{L+P}),因为碰撞避免和航线冲突解除等海事应用需要在整个时域内准确预测中间航路点,而不仅仅是最终位置。

在我们将该方法应用于船舶轨迹预测时,上下文和元数据的潜在不可用性与常见真实世界情况相符,例如天气数据可能因覆盖空洞或天气数据源的延迟而不可用,而船舶元数据可能因接收器中断或蓄意操纵而不可用或不可靠。

### 2.3 训练机制与相关学习设置

为了学习轨迹预测器,我们将考虑几种不同的训练机制,训练数据集中的 k≠k∗k\neq k^{*}:

- • 在*仅状态*(S)机制中,我们有一个仅包含状态轨迹 Xk\mathbf{X}^{k} 的训练数据集。
- • 在*状态+元数据*(S+M)机制中,我们有一个由元组 (Xk,ak)(\mathbf{X}^{k},\mathbf{a}^{k}) 组成的训练数据集。
- • 类似地,在*状态+上下文*(S+C)机制中,我们有一个由元组 (Xk,Wk)(\mathbf{X}^{k},\mathbf{W}^{k}) 组成的训练数据集。
- • 最后,在*状态+上下文+元数据*(S+C+M)机制中,我们有一个由元组 (Xk,Wk,ak)(\mathbf{X}^{k},\mathbf{W}^{k},\mathbf{a}^{k}) 组成的训练数据集。

值得注意的是,训练期间可用的数据模态可能与推理期间可用的模态不同,例如,如果我们考虑在上下文轨迹和元数据不可用(即 Wpastk∗=None\mathbf{W}^{k^{*}}_{\text{past}}=\textsc{None} 且 ak∗=None\mathbf{a}^{k^{*}}=\textsc{None})的情况下进行预测,但训练是在 S+C+M 机制下进行的。我们将这种可能性称为*部署模态失配(DMM)*问题,这是我们提出的架构和训练策略的关键设计考虑因素。

DMM 问题与两种现有学习设置密切相关。首先,DMM 设置推广了*利用特权信息学习(LUPI)*(Vapnik 和 Vashist,2009 (https://arxiv.org/html/2607.27418#bib.bib14);Vapnik 等,2015 (https://arxiv.org/html/2607.27418#bib.bib15);Lopez-Paz 等,2016 (https://arxiv.org/html/2607.27418#bib.bib10)),其中额外模态在推理期间保证不存在(或者如果存在则必须被“丢弃”)。其次,DMM 设置是更一般的*利用侧信息学习(LWSI)*(Jonschkowski 等,2015 (https://arxiv.org/html/2607.27418#bib.bib9);Adel 和 Levene,2023 (https://arxiv.org/html/2607.27418#bib.bib1))的一个重要特例,后者考虑更广泛的输入,例如来自知识库的事实。通过专注于 DMM 设置,我们可以在推理时额外模态可用时从中受益(不同于 LUPI),同时专注于具体的问题结构(不同于更一般形式的 LWSI)。

## 3 方法

我们提出了 Conditional InformerTP,一种编码器-解码器 Transformer 架构,设计用于高效地

相似文章

基于自回归序列模型的条件属性估计

arXiv cs.AI

本文介绍了条件属性变换器(Conditional Attribute Transformers),一种联合估计条件概率和属性值的方法,能够在单次前向传播中实现信用分配、反事实分析和可引导生成。

面向轨迹跟踪的预期强化学习

arXiv cs.LG

本文提出了一种预测性深度强化学习公式,通过将未来参考视界加入状态空间,实现轨迹跟踪的预期控制。仿真结果显示误差显著降低,但零样本迁移到物理硬件时暴露了仿真与现实的差距。