AFDBench:一个以推理为先的AI科学家在国家气象服务预报讨论中的应用

arXiv cs.LG 论文

摘要

AFDBench是一个用于评估国家气象服务预报讨论中生成式气象推理的基准,通过强化学习提升LLM在准确性、风格一致性和数据保真度方面的表现。

arXiv:2608.24954v1 公告类型:新 摘要:大语言模型 (LLMs) 在生成高风险气象文本时会产生数值幻觉,给天气交流带来风险。我们推出 AFDBench,这是一个 AI 气象学家,通过推理结构化的 Google WeatherNext 2 AI 天气预报数据来生成专业的区域预报讨论 (AFDs)。我们介绍了 AFDBench,这是首个评估生成式气象推理的基准,包含来自13个国家气象服务 (NWS) 办公室的7,732份专家撰写的讨论,配对真实的AI天气预报输入,以及三个互补指标:Met-Align(数值准确性)、Style-Align(专业方言遵守度)和Input-Grounding(对源天气数据的保真度)。零样本评估显示,开源 LLMs 的 Style-Align 较低(约0.33),Input-Grounding 中等(约0.88),未能以专业的 NWS 风格写作或忠实使用输入数据。我们应用了带有领域特定奖励的 Group Relative Policy Optimization (GRPO),目标指向温度准确性、天气系统正确性和格式合规性。在来自两个未见 NWS 办公室的1,033个保留样本上,GRPO 将 Style-Align 从0.318近乎翻倍至0.619,并将 Input-Grounding 从0.881提升至0.940,证明强化学习教会了一个7B参数模型像专业气象学家一样写作,并忠实解释AI天气数据。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:29

# 优先推理的AI科学家用于国家气象局预报讨论
来源:https://arxiv.org/html/2608.24954
Manmeet Singh 单位:美国西肯塔基大学地球、环境与大气科学系,博灵格林,KY,美国 通讯作者:[manmeet\.singh@wku\.edu](mailto:[email protected]) Somnath Luitel 单位:美国西肯塔基大学地球、环境与大气科学系,博灵格林,KY,美国 Prabhjot Singh 单位:美国德克萨斯大学奥斯汀分校计算机科学系,奥斯汀,TX,美国 单位:RediMinds Inc\.,南菲尔德,MI,美国 Manraaj Banga 单位:美国西肯塔基大学地球、环境与大气科学系,博灵格林,KY,美国 Naveen Sudharsan Josh Durkee 单位:美国西肯塔基大学地球、环境与大气科学系,博灵格林,KY,美国

###### 摘要

大型语言模型(LLMs)在生成高风险气象文本时会虚构数值,给天气信息传播带来风险。我们提出了AFDBench,一个通过推理结构化AI天气预报数据(来自Google的WeatherNext 2)来生成专业区域预报讨论的AI气象学家系统。我们介绍了AFDBench,这是首个用于评估生成式气象推理的基准测试,包含来自13个国家气象局办公室的7,732篇专家撰写的讨论,与真实的AI天气预报输入配对,并包含三个互补的评估指标:Met-Align(数值准确性)、Style-Align(专业方言遵循度)和Input-Grounding(对源天气数据的忠实度)。零样本评估表明,开源LLMs在Style-Align(约0.33)和中等Input-Grounding(约0.88)方面得分较低,未能使用专业的NWS文体写作,或忠实地使用其输入数据。我们应用了群组相对策略优化,并设计了针对温度准确性、天气系统正确性和格式合规性的领域特定奖励。在来自两个未见的NWS办公室的1,033个留出样本上,GRPO将Style-Align从0.318几乎翻倍至0.619,Input-Grounding从0.881提升至0.940,这表明强化学习能够教会一个70亿参数的模型像专业气象学家一样写作,并忠实地解读AI天气数据。

###### 关键词:

AI天气预测,气象文本生成,强化学习,GRPO,基准测试,科学文本生成,幻觉缓解,NWS预报讨论

## 1引言

区域预报讨论是美国天气传播的基石。由122个国家气象局预报办公室的专业气象学家撰写,AFDs将复杂的大气模型数据转化为可操作的自然语言指导。与常规预报产品不同,AFDs需要天气系统推理:解释天气为何会如预测般演变,而不仅仅是将会发生什么。AFDs中的错误可能危及生命安全——错误的温度预报会影响农业决策,而错过恶劣天气信号可能延误疏散。

近年来AI天气预测的进展已显著提高了数值预报能力,但这些系统预测的是网格场,而非文本。关键的“最后一公里”——将模型输出转化为专家级的自然语言推理——仍未解决。

当被要求根据结构化天气数据生成AFDs时,当前的LLMs表现出气象文体差距:它们产出缺乏NWS专业词汇的通用文本,并且未能忠实地将其输出锚定在所提供的天气数据中。我们对三个开源模型(7-80亿参数)的零样本评估显示,Style-Align得分约为0.33,Input-Grounding约为0.88——这些模型既不能像气象学家那样写作,也不能可靠地使用其输入数据。

我们通过三项贡献来应对这一挑战:

1. 1\.AFDBench:首个用于评估AI生成的气象推理的基准测试,包含来自13个NWS办公室的7,732篇专家讨论,与真实的AI天气预报数据配对,以及三个指标(Met-Align,Style-Align,Input-Grounding)。
2. 2\.领域特定GRPO:带有可验证天气领域奖励的强化学习,在一个70亿参数的模型上,将Style-Align几乎翻倍(0.318→0.619),并将Input-Grounding从0.881提升至0.940,教会它使用NWS专业文体写作,并忠实地解读天气数据。
3. 3\.地理泛化性:训练后的模型为训练期间留出的两个预报办公室生成了忠实的AFDs,证明了其学习的是气象推理能力,而非特定站点的记忆。

## 2相关工作

#### AI天气预测\.
GraphCast、Pangu-Weather、GenCast和WeatherNext在网格上预测大气状态变量。这些系统与我们的工作互补:它们提供了气象学家必须解释和传达的数值输入。AFDBench解决了从这些预测中生成专家级文本这一正交挑战。

#### 领域特定文本生成\.
先前的工作涉及临床报告生成、法律文件起草和科学写作辅助。据我们所知,此前没有系统针对专业气象讨论,这类讨论独特地要求数值精度和领域特定推理。

#### 幻觉缓解\.
思维链提示、自洽性和检索增强生成可以减少LLM幻觉。我们优先推理的方法最接近思维链,但我们是将推理结构直接嵌入训练数据,而不仅仅依赖提示。

#### 用于文本对齐的强化学习\.
RLHF、DPO和GRPO将LLM输出与人类偏好对齐。我们将GRPO应用于科学文本生成,使用可验证的数值准确性作为奖励信号,而非主观偏好标签。

## 3AFDBench:气象推理基准测试

### 3\.1任务定义

给定来自AI数值天气预报系统的结构化天气预报数据,生成一篇专业的区域预报讨论,该讨论需在数值上忠实于提供的数据,并在文体上符合NWS专业标准。

#### WeatherNext 2集成\.
每个AFDBench样本都与一个结构化JSON输入配对,包含来自Google WeatherNext 2系统的单一时间步预报,包括地面条件(温度、风速/风向、相对湿度、平均海平面气压、降水)、舒适度指数(体感指数、风寒指数)、高空场(850毫巴和500毫巴的温度与风,1000-500毫巴厚度)以及集合离散度。此设计测试了整个流程:模型必须解读真实的AI天气数据并撰写专家文本,而非机械模仿目标值。一个局限性是每个输入只提供单一预报时间步,而人类AFDs综合了多个预报时段;这限制了可达到的Met-Align(第5节)。

### 3\.2数据集

我们从Iowa Environmental Mesonet存档中收集了7,732篇专业AFDs,涵盖13个NWS天气预报办公室,选择标准是地理分散性和气候多样性。办公室的选择覆盖了七个不同的气候区域——太平洋西北部、西海岸、山地、中部平原、上中西部、俄亥俄河谷/东南部以及东北部/中大西洋——确保模型能遇到各种天气系统、地形驱动的天气和区域预报惯例。选择包括主要大都市办公室(OKX/纽约,LOX/洛杉矶,PHI/费城)以及因复杂地形或恶劣天气需要更详细AFDs的办公室(BOU/丹佛,TOP/托皮卡,DMX/得梅因)。

收集期为2026年1月至4月,针对冬季和春季过渡的核心季节。这个窗口捕捉了气象上最复杂的AFDs:冬季风暴、寒潮爆发、背风坡气旋生成和需要详细天气系统推理的早春恶劣天气形势。我们注意到,龙卷风高峰期(5-6月)和大风高峰期(11月)超出了这个范围;未来工作的优先事项是扩展对这些时段的覆盖。

AFDBench站点网络:横跨7个美国气候区的13个NWS办公室。蓝色圆圈 = 训练办公室(每个393-888个样本);红色方块 = 用于地理评估的留出办公室。标记标签显示WFO代码和样本数量。每个AFD被处理成四字段的优先推理格式:任务提示(指定NWS办公室)、输入(包含该站点和有效时间的WeatherNext 2预报数据的结构化JSON)、思考(从人类AFD的概述中提取的天气系统推理——气象学的“思维链”)以及输出(完整的专业AFD文本)。我们留出两个办公室——BOX(马萨诸塞州波士顿)和MRX(田纳西州莫里斯敦)——用于地理评估,得到6,701/1,033的训练/测试划分。图2显示了一个代表性的训练样本。

任务提示:扮演DMX的NWS气象学家。生成一份预报讨论。
输入:
{
  “station”: “DMX”,
  “surface”: {
    “temperature_F”: 42.1,
    “wind_direction”: “NW”,
    “mslp_hPa”: 1018.3,
    ...
  },
  “upper_air”: {…}
}
目标输出(人类NWS专家):
.SHORT TERM /THROUGH MONDAY NIGHT/...
Issued at 332 AM CDT Sat Apr 4 2026
Storm activity has shifted eastward out of the state as surface low pressure over northeastern Iowa exits into Wisconsin this morning. Winds becoming from the northwest. These winds will increase as modest cold air advection prevails and steepens low level lapse rates. [...] sustained winds at 15 to 25 mph with gusts of 30 to 40 mph. Highs near 40 degrees at the MN border to near 50 degrees at the MO border.&&.LONG TERM /TUESDAY THROUGH FRIDAY/... High pressure drops into the central Plains with milder conditions as highs recover to near 60 degrees [...]
图2:来自DMX(爱荷华州得梅因)的AFDBench训练样本。模型接收结构化的WeatherNext 2预报数据;目标是包含结构化部分(.SHORT TERM, &&)、天气系统推理(下划线部分)和上下文中数值的完整专业AFD。

### 3\.3评估指标

#### Met-Align(百分比)\.
通过计算AI生成文本和人类参考文本中提取的多位数字(2-3位)的集合交集来衡量数值准确性:Met-Align = |N_ai ∩ N_ref| / |N_ref| × 100,其中 N 表示提取的数字标记集合。0%表示完全数值虚构;100%表示与人类专家的数值选择完全一致。

#### Style-Align(0-1)\.
通过计算生成文本和参考文本中领域词汇标记(如SYNOPSIS、DISCUSSION、AVIATION、CONVECTION、TROUGH、RIDGE、FRONTAL、PRECIPITATION、MESOSCALE、VORTICITY、ADVECTION)的重叠度来衡量对NWS专业方言的遵循度:Style-Align = |V_ai ∩ V_ref| / |V_ref|。

#### Input-Grounding(0-1)\.
衡量模型是否忠实使用了WeatherNext 2输入数据,而非虚构数值。我们检查三个独立评分的条件:(1) 输出中的任何数字是否在输入温度的3°F(1.0分)或10°F(0.5分)范围内;(2) 是否出现了正确的风向;(3) 是否正确识别了气压状况(例如,当MSLP > 1020 hPa时为“高压”)。Input-Grounding是这三个检查的平均值。

### 3\.4零样本基线

表1显示,零样本模型达到了约13-14%的Met-Align,但只有约0.33的Style-Align和约0.88的Input-Grounding,证实了气象文体差距:模型生成的是通用文本而非专业的NWS文本,并且未能完全将其输出锚定在所提供的天气数据上。

## 4方法:优先推理的训练流程

### 4\.1优先推理的数据格式

关键洞察是专业气象学家在撰写预报(会发生什么)之前会进行天气系统分析(天气为何会如此演变)。我们通过提取每篇人类AFD中的概述/分析部分作为专门的“思考”字段,将这种推理结构直接编码到训练数据中。这迫使模型在生成预报讨论之前先生成天气系统推理,模拟专家的认知过程。

### 4\.2阶段1:监督微调(SFT)

我们使用LoRA和4位量化来微调Qwen2.5-7B-Instruct,以节省内存:LoRA rank=16,alpha=16,应用于查询、键、值和输出投影;bfloat16计算;6,699个训练样本(不包括留出办公室),1个epoch,学习率2×10^-4,梯度检查点。

在此设置中,单次epoch的SFT相较于零样本基线并未显著提升评估指标,这可能是由于激进的量化和有限的训练时长。然而,SFT为GRPO提供了初始化,而GRPO在Style-Align和Input-Grounding上取得了显著改进。

### 4\.3阶段2:群组相对策略优化(GRPO)

我们应用GRPO,采用一个领域特定的双重奖励系统,提供无需人工标注的可验证监督信号:

#### 奖励设计\.
总奖励结合了三个基于WeatherNext 2输入数据计算的可验证领域特定信号:

- •Rtemp(温度准确性):检查生成文本中的任何温度值是否在WeatherNext 2地面预报的3°F(奖励1.0)或10°F(0.5)范围内,或更远(0.1)。这将模型的数值输出锚定在其输入数据上。
- •Rsyn(天气系统准确性):正确引用输入风向可获得最高0.4分,正确识别气压状况(与MSLP匹配的高压/低压)可获得0.3分,根据1000-500毫巴厚度正确识别热力状况可获得0.3分。
- •Rfmt(格式合规性):为段落分隔符(例如.SHORT TERM)获得0.3分。

相似文章

ForecastBench-Sim:模拟世界预测基准

arXiv cs.AI

介绍 ForecastBench-Sim,这是一个基于 Freeciv 游戏回放构建的模拟世界预测基准,旨在为评估 AI 系统的概率推理提供可控且可立即解析的任务。