V2TATC:一个用于空中交通管制员情境感知的联合语音-轨迹嵌入框架与数据集
摘要
本文介绍了V2TATC,一个用于空中交通管制员情境感知的联合语音-轨迹嵌入框架,并引入了一个用于拥挤空域跨模态检索实验的新型数据集。
arXiv:2608.28981v1 公告类型:新
摘要:随着国家空域系统中的空中交通量持续增长,尤其是在低空域,空中交通管制员所使用的可扩展决策支持工具也需要更多开发。本文介绍了语音到轨迹的空中交通管制(Voice-to-Trajectory for Air Traffic Control),这是一个联合语音通信-飞行轨迹数据嵌入框架,可以作为拥挤空域中情境感知的一部分,并协助开发ATC工具,以便他们实时分析自动相关监视广播轨迹或飞行员用自然语言表达的意图。我们表明,这些数据模态并非独立,而是代表了一个共同的物理参照物:一架飞机在空域中飞行。V2TATC将语音指令和所涉飞机的轨迹映射到一个单一潜在空间中的邻近点,该空间可以双向查询。它结合了自监督轨迹编码器、冻结的大规模语音编码器、对比联合嵌入和通过归一化流实现的双向提升。我们展示了V2TATC在旧金山湾区的有效性,因其主要机场的集中以及商用和通用航空低空交通的混合。最后,我们发布了一个新颖的配对语音-轨迹数据集,并报告了跨模态检索、消融实验和潜在空间分析的实验。
查看缓存全文
缓存时间: 2026/09/01 13:03
# V2TATC:面向空管员态势感知的语音-轨迹联合嵌入框架与数据集
来源:https://arxiv.org/html/2608.28981
**作者**:Alexandre M. Bayen
**注**:Liao-Cho冠名教授,加州大学伯克利分校电气工程与计算机科学系
**单位**:加州大学伯克利分校,伯克利,CA,94720,美国
###### 摘要
随着国家空域系统(特别是低空空域)的空中交通量持续增长,空管员所需的决策支持工具(DST)也需要进一步发展。本文提出“面向空中交通管制的语音-轨迹转换”(V2TATC)——一种联合语音通信与飞行轨迹数据的嵌入框架。该框架可作为拥挤空域态势感知的组成部分,并辅助开发空管工具,使管制员能够实时处理基于“广播式自动相关监视”(ADS-B)的轨迹数据或飞行员用自然语言表达的意图。我们证明这些数据模态并非独立,而是代表了同一物理对象:穿越空域的飞行器。V2TATC将语音指令与被呼叫飞行器的轨迹映射至单一潜在空间中的邻近点,且支持双向查询。该框架结合了自监督轨迹编码器、冻结的大规模语音编码器、对比联合嵌入以及通过归一化流实现的双射提升。我们在旧金山湾区验证了V2TATC的有效性,该区域集中了主要机场,且混合了商业航空与通用航空的低空交通。最后,我们发布了一个新型的语音-轨迹配对数据集,并报告了跨模态检索、消融实验和潜在空间分析的实验结果。
## 术语表
(所有量均为无量纲,除非标注单位)
- \(X\):轨迹窗口,\(T \times F\) 维监控采样数组
- \(x_t\):时间步 \(t\) 的特征向量,其中 \(x_t \in \mathbb{R}^F\)
- \(w\):以 \(16\text{ kHz}\) 采样的原始语音波形
- \(\phi, \lambda, \theta\):大地纬度、经度和真航迹角(弧度)
- \(v, \dot{h}\):地速和垂直速率(米/秒)
- \(d_v, d_t, d_j\):语音、轨迹及联合嵌入维度(\(d_v=1280, d_t=1792, d_j=1024\))
- \(\mathcal{E}_v, \mathcal{E}_t\):语音与轨迹编码器
- \(P_v, P_t\):语音与轨迹投影器
- \(f_v, f_t\):\(\mathbb{R}^{d_j}\) 空间中的语音与轨迹归一化流
- \(\mathbf{v}, \mathbf{r}\):语音与轨迹嵌入(\(\mathbf{v} \in \mathbb{R}^{d_v}, \mathbf{r} \in \mathbb{R}^{d_t}\))
- \(\hat{\mathbf{v}}, \hat{\mathbf{r}}\):投影后的语音与轨迹嵌入(\(\hat{\mathbf{v}}, \hat{\mathbf{r}} \in \mathbb{R}^{d_j}\))
- \(\tilde{\mathbf{v}}, \tilde{\mathbf{r}}\):L2归一化的投影语音与轨迹嵌入
- \(\mathbf{j}\):联合空间表示(\(\mathbf{j} \in \mathbb{R}^{d_j}\))
- \(\mathcal{M}\):掩蔽时间步索引集
- \(\mathcal{L}_{\bullet}\):损失项(下标表示其作用)
- \(\lambda_{\bullet}\):损失中的权重项(下标表示其作用)
- \(S_{ij}\):语音 \(i\) 与轨迹 \(j\) 之间的余弦相似度
- \(\tau\):对比温度
- \(K\):Recall@K 中使用的检索截断值
## 1 引言
**国家空域系统的运行需求**
随着国家空域系统(NAS)的交通密度持续增加,空管员使用的决策支持工具(DST)也必须不断提升能力以支持高风险操作的增长\[5 (https://arxiv.org/html/2608.28981#bib.bib1)\]。空中交通管制(ATC)需要在序列化的安全关键场景中对多源多模态信息进行实时推理。管理拥挤终端空域的管制员往往在不自觉中持续分析来自*广播式自动相关监视(ADS-B)*的3D轨迹、飞行员通过无线电用自然语言表达的意图、*气象机场报告(METAR)*提供的环境条件、联邦航空管理局(FAA)的数字基础设施(导航辅助设备、甚高频全向信标等),以及许多其他辅助信号\[6 (https://arxiv.org/html/2608.28981#bib.bib2)\]。这些ATC数据代表了同一物理实体——穿越空域的飞行器,正是它们之间的隐式关系使人类管制员能够保持态势感知并确保安全间隔。相比之下,大多数现有DST孤立处理这些数据流。例如,语音识别管道将无线电音频转录为文本,后续模块从转录中恢复说话者角色和轮次边界\[16 (https://arxiv.org/html/2608.28981#bib.bib3), 38 (https://arxiv.org/html/2608.28981#bib.bib18)\]。轨迹预测系统仅基于ADS-B特征运行(无论源自运行监控还是OpenSky等大规模网络\[34 (https://arxiv.org/html/2608.28981#bib.bib34)\]),并通过循环或注意力模型预测未来位置\[37 (https://arxiv.org/html/2608.28981#bib.bib19), 12 (https://arxiv.org/html/2608.28981#bib.bib5)\]。天气信息通过单独的显示器使用,其整合由管制员负责\[5 (https://arxiv.org/html/2608.28981#bib.bib1)\]。管制员口头指令与相应机动之间的语义对应——安全高效运行的基础——被视为隐式存在,由人类处理。
本文总结了证明这种隐式关系可被学习的研究结果。我们提出**面向空中交通管制的语音-轨迹转换(V2TATC)**,这是一个使语音传输与ADS-B轨迹共存于单一表示空间的框架,使得语音传输与被呼叫飞行器的轨迹被映射到邻近点,且支持双向查询。该想法受多模态联合嵌入进展的启发,特别是*对比语言-图像预训练(CLIP)*\[29 (https://arxiv.org/html/2608.28981#bib.bib8)\]引入的对比语言-图像对齐及其后续视觉-语言工作\[18 (https://arxiv.org/html/2608.28981#bib.bib9), 25 (https://arxiv.org/html/2608.28981#bib.bib10)\],以及Whisper\[30 (https://arxiv.org/html/2608.28981#bib.bib11)\]和Wav2Vec 2.0\[1 (https://arxiv.org/html/2608.28981#bib.bib12)\]等大规模语音编码器的成熟。这些模型共享一个共同组件:预训练的模态编码器,后接一个在配对数据上通过对比目标训练的轻量级对齐头。我们采用相同方法,但有两个对ATC至关重要的特殊性。第一,对齐目标并非开放式的自然语言描述,而是以大致恒定速率广播的多个特征构成的结构化时间序列。这需要专门的轨迹编码器来捕获运动动态,我们通过掩码自编码器(MAE)目标实现这一点\[14 (https://arxiv.org/html/2608.28981#bib.bib16)\]。第二,仅检索是不够的,因为DST最终可能需要根据语音指令生成候选轨迹,反之亦然。这需要可逆的对齐,我们通过在对比联合空间之上训练两个归一化流\[9 (https://arxiv.org/html/2608.28981#bib.bib6), 22 (https://arxiv.org/html/2608.28981#bib.bib7)\]来实现。
联合嵌入旨在作为DST的构建模块,而非终端用户应用。在联合空间之上的少量操作已可映射到具体的管制需求。在监视显示器上选择一架飞行器并恢复其对应的近期语音传输(*轨迹→语音*检索)有助于在交接班和高工作负荷情况下快速恢复上下文。对称操作——从剪辑的语音传输到候选轨迹(*语音→轨迹*)——支持监听工具,帮助监督员验证正在呼叫哪架飞行器。联合空间中语音指令与对应轨迹的不一致为异常检测(包括遗漏的复诵和不合规的机动)提供了直接信号。最后,双射提升为生成式决策支持打开了大门:基于语音指令的短期轨迹预测、用于模拟器训练的合理指令合成,以及探索反事实机动的冲突探测。
**图1**:旧金山湾区数据收集的地理范围。a) 对应湾区纬度-经度边界框的地图边界,这也是从OpenSky网络(opensky-network.org)抓取ADS-B信息的地理窗口。红色圆圈标记了四个通过LiveATC.net流式传输其塔台频率的机场。蓝色标记表示通过aviationweather.gov定期收集METAR观测的气象报告站。b) 该区域的VFR(目视飞行规则)航图(取自vfrmap.com),显示了空域的密集程度,重叠的管制空域边界、航路和报告点密集分布在一个小区域内。
我们在旧金山湾区实例化V2TATC作为案例研究,地理区域如图1 (https://arxiv.org/html/2608.28981#S1.F1)所示。湾区是特别相关的研究区域,原因有四:(i)它容纳了多个主要商业机场,包括旧金山国际机场(KSFO)、奥克兰国际机场(KOAK)和圣何塞国际机场(KSJC),以及莫菲特机场(KNUQ),所有机场都在北加州航路终端管制区的重叠扇区内运行。(ii)交通密度在NAS中名列前茅,全天有持续的进场和离场流。(iii)商业交通和通用航空在同一频率上共存,因此数据自然地捕捉了这两类交通。(iv)同一空域预计将率先开展城市空中交通飞行器(例如电动垂直起降eVTOL飞行器)的运行试验,这将在不久的将来进一步加大管制员工作负荷\[20 (https://arxiv.org/html/2608.28981#bib.bib13)\]。这种特性的集中使得在保持地理边界较小的同时收集丰富的多模态数据集成为可能。
我们描述如何在该空域收集同步的语音和监视数据,如何大规模清洗和链接它们,以及如何训练框架的每个组件。然后我们展示跨模态检索、短期轨迹预测、基于语音的轨迹生成以及学习到的潜在空间结构的结果。本工作的一个副产品是语音-轨迹配对数据集本身。据我们所知,没有为此类数据集公开发布于湾区,因为现有的ATC数据集要么仅包含语音,要么仅包含轨迹,少数结合两者的工作使用封闭专有数据或针对较小、不拥挤的区域。构建该数据集需要音频归档摄取、实时ADS-B轮询、转录、呼号提取和时间链接,所有这些都在第4节 (https://arxiv.org/html/2608.28981#S4)中描述。我们发布数据集的子集111可在huggingface.co/datasets/Lbrusset/SF_bay_voice2traj_dataset获取及整个处理流程,以便未来工作(无论是语音识别、轨迹建模、联合嵌入还是运行决策支持工具)可以基于它开展。
本文的贡献有三方面。第一,我们提出了语音与轨迹子流形之间可学习的对应关系公式,并提出了一个结合自监督预训练、对比对齐和通过归一化流实现双射提升的框架。第二,我们描述了使用公开可用数据源和标准自监督技术实现的端到端V2TATC,并发布组装的数据集和代码。第三,我们报告了定量结果,表明尽管ATC音频存在噪声,两种模态仍可通过对比目标对齐,且该对齐支持有用的下游操作,如短期预测和跨模态检索。
## 相关工作
多篇文章探索了机器学习在ATC中的应用,主要关注单一ATC模态。用于ATC的**自动语音识别(ASR)**稳步发展,从基于隐马尔可夫模型的受限语法系统\[33 (https://arxiv.org/html/2608.28981#bib.bib17)\]到在航空特定语料库(如ATCO2)上训练的Transformer模型\[39 (https://arxiv.org/html/2608.28981#bib.bib4)\],并在其上构建了下游理解任务\[38 (https://arxiv.org/html/2608.28981#bib.bib18)\]。轨迹建模同样成熟,从循环架构\[37 (https://arxiv.org/html/2608.28981#bib.bib19)\]到在更丰富轨迹表示上运行的基于注意力的编码器\[12 (https://arxiv.org/html/2608.28981#bib.bib5)\]。关于ATC的**大型语言模型(LLM)**的相关工作表明,使用这些基于Transformer的架构进行短期轨迹预测是可行的\[7 (https://arxiv.org/html/2608.28981#bib.bib14)\],并且可以从自然语言通信数据中执行代理式ATC\[11 (https://arxiv.org/html/2608.28981#bib.bib15)\]。**复诵错误检测**——比较转录的飞行员复诵与管制员指令\[17 (https://arxiv.org/html/2608.28981#bib.bib21)\]——具有类似的单任务焦点。SIA-FTP\[13 (https://arxiv.org/html/2608.28981#bib.bib20)\]使用语音指令作为辅助信息来改进飞行轨迹预测,其设置在预测任务上进行端到端监督。V2TATC的不同之处在于它学习自监督的联合嵌入,然后在其上评估多个下游任务。据我们所知,此前没有工作在嵌入级别上对齐原始ATC语音与监视轨迹。据我们所知,本文是这一方向的首次探索,在概念上与LeCun提出的联合嵌入预测架构相关\[24 (https://arxiv.org/html/2608.28981#bib.bib22)\]。
## 2 问题表述
### 2.1 拥挤空域中的态势感知
态势感知(根据Endsley的定义\[10 (https://arxiv.org/html/2608.28981#bib.bib23)\])是指管制员感知、理解和预测空域状态的能力。在繁忙的终端区,该状态是高维的:数十架飞行器,每架都有动态轨迹、身份标识和活跃的口头指令流。现代管制员工作席位通过雷达图和ADS-B集成详细显示轨迹信息。相比之下,无线电通道在很大程度上仍作为原始音频被消费。虽然ASR工具正开始部署,但在标准运行环境中,语音很少被解释并与监视流对齐。这种直观的能力——在嘈杂、重叠的语音传输与同时发生的轨迹机动之间找到语义对应——是维持安全间隔的核心。相似文章
长期智能体轨迹归因:统一基准与细粒度标注框架
本文介绍了面向长期智能体轨迹归因的统一基准与细粒度标注框架,支持在不同场景下评估主要归因定位和归因链恢复。它提供了来自现有智能体基准的超过1,300条标注轨迹,并发布了一个可复用的标注技能,用于规范未来的轨迹。
面向社交机器人中话轮切换的多模态语音活动预测:基于语音活动相关预训练编码器
提出了一种多模态语音活动预测框架,将仅音频的VAP扩展至视听输入,用于社交机器人的话轮切换预测,采用预训练骨干网络和低秩适应方法。在NoXi和Haru EDR语料库上取得了改进。
OpenVisTool:合成指导性视觉工具使用轨迹的开放方法
本文介绍了 OpenVisTool,一个用于合成指导性视觉工具使用轨迹的开放框架,以及相应的数据集(OpenVisTool-42K)和基准。研究表明,在基于因果关系的监督下进行微调,能在多种模型骨干上提升视觉工具使用性能。
面向序列观测的轨迹感知跨视角地理定位
提出了SeqGeo-VL数据集和TrajLoc框架,用于基于序列观测(视频片段或路径描述)的轨迹感知跨视角地理定位,在性能上显著优于现有方法。
ENTRAP-VL: 面向视觉语言模型的双重语境夹带分类探测工具
介绍了ENTRAP-VL,这是一个由1500个条目构成的分类结构化数据集,用于探测视觉语言模型中的语境夹带现象,并研究文本语境与视觉语境如何独立影响模型输出。