使用大型语言模型的空中交通管制:提示工程、架构与评估
摘要
一项评估大型语言模型在空中交通管制通信中应用的实验性研究,表明较轻量的提示和上下文示例能提升性能,同时突显了错误累积的局限性。
arXiv:2608.19299v1 公告类型:新
摘要:空中交通管制(ATC)通信是一种安全关键对话,即使空中交通管理的其他部分已部分自动化,它仍主要由人类驱动。在本文中,我们通过实验评估大型语言模型(LLM)能否生成操作上真实的ATC通信。一架实验性通用航空飞机飞越旧金山“Bay Tour”航线,其通信被手动转录并用作真实数据(P0)。通过飞行员在环过程,我们设计了五个逐渐增加约束的提示结构(P1-P5),并将其嵌入有状态的多轮流程中,模型在固定飞行员转录的基础上扮演ATC,并基于累积的对话历史进行条件设定。在九个开源和闭源LLM中,我们改变提示、来自不同实验航班的完整转录作为上下文示例的存在与否,以及模型是否基于自身先前回复或注入的真实历史进行条件设定。各轮次通过词汇、结构和语义相似度指标以及LLM作为评判者(GPT-5.5)进行评分,并与人类专家标注验证。提供完整示例提高了相似度,但收紧提示则没有:最轻量的提示表现最佳,而最严格脚本化的提示因其自身错误在对话中累积而崩溃,注入正确历史可修复此问题。这些结果勾勒出迈向LLM辅助ATC的具体路径及其当前局限性。
查看缓存全文
缓存时间: 2026/08/21 09:55
# 使用大型语言模型进行空中交通管制:提示工程、架构与评估
来源:https://arxiv.org/html/2608.19299
Mahyar Ghazanfari
注:博士研究生,机械与航空航天工程系,乔治华盛顿大学,AIAA学生会员
隶属:乔治华盛顿大学,华盛顿特区 20052,美国
Matthias Casanova 和 Jordan Kam
注:本科生,机械与土木工程系,加州理工学院,AIAA学生会员
注:博士研究生,航空航天工程系,加州理工学院,AIAA学生会员
隶属:加州理工学院,帕萨迪纳,CA 91125,美国
Alex Zongo 和 Peng Wei
注:博士研究生,机械与航空航天工程系,乔治华盛顿大学,AIAA学生会员
注:教授,机械与航空航天工程系,乔治华盛顿大学,AIAA副会士
隶属:乔治华盛顿大学,华盛顿特区 20052,美国
Torsten Darrell 和 Alexandre Bayen
注:访问研究员,电气工程与计算机科学系,加州大学伯克利分校,AIAA学生会员
注:教授,电气工程与计算机科学系,加州大学伯克利分校
隶属:加州大学伯克利分校,CA 94720,美国
空中交通管制(ATC)通信是一种安全关键型对话,尽管空中交通管理的其他部分已实现半自动化,但其核心仍很大程度上依赖人工。本文通过实验评估大型语言模型(LLMs)能否生成具有操作现实性的ATC通信。我们手动转录了一次飞越旧金山“海湾航线”的通用航空实验飞行,并将其作为基准真相(P0)。通过飞行员在环流程,我们设计了五种约束程度递增的提示结构(P1–P5),并将其嵌入有状态的多轮对话流程中:模型扮演ATC角色,根据飞行员固定转录稿生成响应,并依据累积的对话历史进行条件生成。
我们测试了九个开源与闭源LLM,通过改变提示、提供另一实验飞行的完整转录稿作为上下文示例,以及让模型基于自身先前回复或注入的基准历史进行条件生成,来观察效果。每个对话回合通过词汇、结构和语义相似度指标进行评分,并采用LLM评判器(GPT-5.5)进行评估,该评判器已通过人类专家标注验证。
实验表明,提供示例可提升相似度,但收紧提示并无帮助:最简洁的提示表现最佳,而过度脚本化的提示则因自身错误在对话中累积而失效,注入正确历史后可修复此问题。这些结果为LLM辅助ATC勾勒出具体路径及其当前局限。代码与数据可在此处获取(https://github.com/AeroMatt5/ATC_LLM_Prompting)。
## 1 引言
空中交通管制(ATC)是美国交通网络中最具挑战性和安全关键性的工作之一[8]。人与人之间的沟通是该系统的基石,为管制员和飞行员提供标准化格式,以保持飞机间隔、管理交通流量并协调繁忙空域的运行[7,6]。与日常对话不同,ATC语音遵循美国联邦航空管理局(FAA)制定的严格术语规范,旨在消除歧义、降低认知负荷,并支持在压力下快速决策。
随着空中交通持续增长,ATC必须在维持严格安全边际的同时处理更密集的流量。然而,ATC通信仍是空中交通管理(ATM)系统中对人工依赖最高的部分之一,其建立在语音无线电、情境感知和程序纪律基础上,而非自动化[22]。这种对人类通信的依赖既是优势,也限制了当前运行在国家空域系统中的扩展能力。
随着先进空中移动(AAM)[18]的兴起——包括城市空中交通、密集低空运营、电动垂直起降(eVTOL)飞行器、无人系统及其他新空域用户[9,17,13]——这些压力正变得愈发紧迫。当前的ATC架构并非为适应这些概念所暗示的运行规模和多样性而设计。因此,研究人员正探索下一代ATM设计,将自动化、分布式决策和数字通信相结合,同时确保安全。在此背景下,AI驱动的通信工具可能有助于人类操作员与日益增多的自主飞行器协调工作。
理解基础模型处理真实、多轮ATC对话的能力,因此成为重要的第一步。本文即迈出这一步。我们测量大型语言模型(LLMs)在操作对话中复现人类管制员行为的程度,并探讨可信评估此类系统所需条件。本文贡献包括:
- **基准真相与有状态评估流程**:我们手动转录一次飞越旧金山“海湾航线”的通用航空实验飞行,并将其作为基准真相(P0)。我们不对孤立回合评分,而是让每个模型运行完整对话,每次回复均以不断增长的对话历史为条件,模拟实际管制员操作。
- **提示与对话语境化系统研究**:我们设计了五种提示结构(P1–P5),从最小化角色分配到高度约束的规则集,其中最强提示经飞行员反馈优化。通过比较基于模型自身回复构建的历史与基于真实管制员通信注入的历史,我们将提示质量与对话语境化分离,并测量添加不同实验飞行完整转录稿作为上下文示例的效果。
- **经验证的评估方法**:我们结合标准文本相似度指标与LLM评判器(评估七个操作维度),并通过人类专家标注验证该评判器。这表明哪些廉价自动指标可替代专家判断,哪些则不能。
在九个专有与开源LLM上,我们发现上下文示例能持续提升与人类ATC的一致性,而增加提示约束则无此效果。除了轻量级角色与上下文提示外,额外指令往往有害。我们还发现,准确的对话历史是防止性能在长对话中退化的关键,它甚至能拯救最高度脚本化的提示。在我们发现中,演示了当前模型能可靠复现管制员语音的*形式*,但在操作*内容*上仍有欠缺——这种区分对安全关键应用最为重要。
## 2 相关工作
自动化已重塑ATM的多个方面,包括监视、轨迹预测、决策支持工具和大规模交通流优化[3]。相比之下,管制员-飞行员对话的自动化进展滞后,因其需要严格的安全性、上下文推理和精确的标准语言。人工智能(尤其是LLM)的最新进展,通过生成上下文感知、类人响应开辟了新可能[21]。与旧式基于规则的系统不同,LLM灵活解释和生成自然语言,可支持管制员辅助、培训和现有工作流增强。
同时,将AI引入ATC通信引发了关于可靠性、一致性、程序合规性和验证的难题,这正是为何需要针对真实操作行为进行系统评估的原因。在更广泛的ATM领域,自动化聚焦于优化和系统级可扩展性,包括基础性交通流优化工作[3]。这些努力提升了系统级效率和可预测性,但管制员-飞行员通信仍主要是人工驱动过程。
越来越多的研究将自然语言处理(NLP)应用于结构化航空传统基于语音和文本的通信。NASA研究人员使用NLP分类和解读航行通告(NOTAM),将密集的程序通知转化为可操作信息[14],而ATCO2语料库支持对记录的管制员-飞行员无线电交换进行大规模自动语音识别和命名实体提取(如呼号、指令和数值)[22]。这些工作使用基于Transformer[19]或领域适配的模型进行分类、结构化或信息提取,而非生成通信。
近期,领域适配的基础模型已出现。AviationGPT在精选的航空文本上继续预训练开源LLaMA-2和Mistral骨干模型,以回答问题和总结国家空域系统文档[20],显示出向航空专用语言模型发展的明确势头。生成式应用随之而来,最著名的是CHATATC,其基于2000-2023年80,000多条历史地面延误计划记录训练对话代理,并在刻意*非*安全关键的策略性交通流环境中研究其行为[1]。
更接近战术循环的研究[2]将语言模型作为具有函数调用和学习能力的空中交通代理,无需人工干预即可解决冲突。另一系列工作将LLM应用于航空规划和安全评估,使用自然语言作为操作员与自动推理器之间的接口。[16]使用思维链提示,在风害条件下生成端到端航线,同时以自然语言获取操作员偏好,保持人在环中。FRAMe通过将规划LLM与检索增强记忆和多模态教练代理配对扩展此方法,使生成的计划既满足任务约束又匹配操作员偏好,在四个骨干LLM上达到最高93.8%的综合有效性[15]。
与我们研究最接近的是[4],其通过让视觉语言模型(VLM)联合分析转录的公共交通咨询频率(CTAF)通话、METAR气象数据、ADS-B轨迹和VFR扇区图,评估无塔台机场周围的安全性,将三个开源和三个闭源模型与十二类危险分类法进行基准测试,在名义-危险任务上超过宏F1(F\_\{1\})0.85。这些工作共同表明LLM可推理多样化航空数据并生成与操作员对齐的计划。
然而关键的是,它们要么事后分析通信,要么生成计划而非通信,且没有模型在实时、多轮交换中承担管制员角色。本研究针对此空白。我们评估LLM在由真实飞行员通信驱动的受控多轮ATC场景中的行为,生成随机化的管制员响应,并通过多个相似度指标与基准ATC对话进行比较。三项特征使此评估与众不同:首先,它是*有状态的*:模型以不断增长的对话历史为条件而非孤立回合,使我们能区分单回合能力与对话中的错误累积。其次,它是*提示条件化的*:我们比较五种系统变化的提示结构与相同基准真相。第三,它是*经验证的*:我们将自动指标与LLM评判器量表结合,并将该评判器与人类专家标注核对,使报告质量反映操作正确性而非表面重叠。
据我们所知,此前尚无工作运行过经人类验证评分的多轮、提示条件化、基准真相对齐的LLM生成ATC通信评估。
## 3 方法论
本研究组织为三阶段流程,如图1所示。在*生成*阶段,从通用航空(GA)实验飞行中逐字获取的飞行员通信,逐条输入给被指示扮演空中交通管制员的语言模型;每个模型回复都追加到对话历史中,使后续回合在上下文中回答。在*教师强制生成*阶段,我们重复相同流程,但用基准真相管制员通信覆盖历史中的管制员侧,从而将模型回答单个回合的能力与其从自身累积错误中恢复的能力分离。
在*评估*阶段,每个生成回合通过三种方式评分:与真实管制员回复的自动相似度指标、应用操作量表的LLM评判器,以及人类专家对分层子样本的重新评分(用于验证评判器)。参考图例
**图1:整体架构**
(1) **生成**:从实验海湾航线飞行中转录的飞行员通信逐回合输入语言模型,模型以系统提示和累积通信历史为条件;每个伪ATC响应追加回历史。
(2) **教师强制生成**:回放相同场景,但历史中的管制员侧替换为基准真相通信。示例对比第24回合的两种模式:基于自身回复(左),模型陷入确认循环,仅回复“收到”,遗漏所需的雷达服务终止和海沃德移交;给定真实历史(右),同一回合以正确设施、正确“保持代码”指令和正确频率120.2响应。
(3) **评估**:每个回合通过自动相似度指标、LLM评判器评分,以及——在分层子样本上——人类专家评分。
### 3.1 参考数据
使用两个实验GA飞行,它们扮演严格分开的角色。完整飞行数据见附录7。
#### 评估场景(P0)
我们手动转录一次由GA飞行员执行的“旧金山湾区飞行游览”的完整管制员-飞行员交换[5]。该飞行为赛斯纳(呼号715 Mike Tango),从帕洛阿尔托(KPAO)出发,经圣卡洛斯附近和海湾过渡,最终在海沃德和奥克兰区域恢复,使场景涉及地面管制、塔台和进近交互以及设施移交。转录产生36个对齐回合,每个为(飞行员通信,管制员回复)对,按回合标识符索引。此转录稿称为P0,是所有生成通信评分的唯一基准真相,未在任何条件下展示给模型。
#### 上下文示例飞行
*第二架*(此处原文截断)相似文章
面向空中交通管制语言理解系统的安全导向评估
本文提出了一个面向安全、感知后果的大型语言模型空中交通管制评估框架,揭示了高总体准确率掩盖了在处理高风险语义错误方面的显著可靠性问题。
Pre-Flight: 评估大型语言模型航空运行知识的基准测试
本文介绍了Pre-Flight,这是一个包含300道多选题的开源基准测试,旨在评估大型语言模型在航空运行知识方面的表现,覆盖国际法规和地面操作。结果显示,即使是2026年最强模型也只能达到82.7%的准确率,远低于约95%的专家参考水平,突显了持续存在的可靠性差距。
心理健康中的大语言模型:应用、创新与伦理挑战的系统性综述
本系统综述探讨了大语言模型在心理健康领域的应用,涵盖了临床对话代理和多模态学习等领域的创新,同时强调了伦理挑战并倡导安全部署框架。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
提示语言与翻译理论驱动的提示在大型语言模型中的作用:以西中新闻翻译为例
本研究探讨了提示语言和翻译理论驱动的提示设计如何影响GPT-5.2生成的西中新闻翻译质量,发现尽管自动化指标偏好基线提示,但在专家评估下,理论驱动提示改善了文体。