SynopticBench:评估视觉语言模型生成未来天气预报讨论的能力
摘要
本文介绍了SynopticBench,这是一个包含130万份以上天气预报讨论及其对应气象图像的数据集;同时提出了SPACE,一个用于评估VLM生成天气预报质量的全新评估框架。
arXiv:2604.16451v1 发布类型:新增
摘要:视觉语言模型(VLM)的最新进展已显著推动了图像描述、报告生成及视觉感知等诸多复杂多模态任务的发展。然而,基于气象数据生成文本极具挑战性,因为大气属于混沌系统,会在不同空间与时间尺度上发生快速演变。鉴于大气现象的复杂性,对现有VLM在气象预测数据上的有效性进行可验证的量化评估显得尤为重要。在本研究中,我们推出了SynopticBench数据集,其中包含由National Weather Service针对美国本土发布的1,367,041份Area Forecast Discussions文本样本,这些文本与天气预报中的500百帕位势高度、2米气温以及850百帕风速图像进行了配对。此外,我们还提出了Synoptic Phenomena Alignment and Coverage Evaluation (SPACE)框架,该创新框架能够有效衡量针对综合天气现象文本描述的质量。利用当前最先进的VLM进行的广泛实验表明,现有评估指标在此领域具有较高的敏感性,并为进一步探索天气与气候文本生成奠定了基础。
查看缓存全文
缓存时间: 2026/04/21 07:02
# SynopticBench:评估视觉-语言模型在生成未来天气预报讨论方面的表现
来源:https://arxiv.org/html/2604.16451
Antonios Mamalakis、Chirag Agarwal \\orgdiv环境科学系,\\orgname弗吉尼亚大学,\\orgaddress\\city夏洛茨维尔,\\postcode22903,\\state弗吉尼亚州,\\country美国\\orgdiv数据科学学院,\\orgname弗吉尼亚大学,\\orgaddress\\city夏洛茨维尔,\\postcode22903,\\state弗吉尼亚州,\\country美国
###### 摘要
近年来,视觉-语言模型(VLMs)的进步已在图像描述、报告生成和视觉感知等诸多复杂的多模态任务中取得了显著成效。然而,从气象数据生成文本极具挑战性,因为大气是一个混沌系统,在不同空间和时间尺度上快速变化。鉴于大气现象的复杂性,切实量化现有 VLMs 在天气预报数据上的有效性至关重要。在本工作中,我们提出 SynopticBench,这是一个高质量数据集,包含由美国国家气象局(NWS)在美国本土生成的 1,367,041 份“区域天气预报讨论”(Area Forecast Discussions)文本样本,并与天气预报中的 500mb 位势高度、2米气温以及 850mb 风速图像配对。我们还提出了“天气形势现象对齐与覆盖度评估”(Space)框架,这是一种新颖的评估方法,可有效估算对天气形势现象文本描述的质量。使用最先进的 VLMs 生成预报讨论的广泛实验揭示了该领域现有评估指标的敏感性,并为进一步探索天气形势和气候文本生成铺平了道路。
###### 关键词:
多模态、数值天气预报、视觉-语言模型、天气预报
††journal:Data/Math††articletype:Data Paper\{Frontmatter\}
\\authormark
Higgins 等人
\\authormark
Higgins et al\.
## 影响声明
据我们所知,本研究是首个从数值天气预报图像生成文本讨论的研究。我们引入了 i) 最大的基准数据集,包含 1,367,041 个图文样本,用于开展探索从数值天气预报生成文本讨论潜力的实验;ii) 一套用于评估生成的天气形势与气候文本讨论的方法论。
\\localtableofcontents
## 1 引言
视觉-语言模型(VLMs)的最新进展已在图像描述、文档理解、视觉问答和多模态摘要等复杂多模态任务中取得了实质性突破。随着这些模型能力的提升,并越来越多地被部署或提议部署于高风险应用场景中,业界亟需超越表面文本相似度、转而量化生成内容是否忠实可信、具有空间依据且符合领域相关性的评估框架。
在此背景下,天气预报是一个尤为关键且技术挑战极高的应用领域。数值天气预报(NWP)已深度融入数亿人的商业运营、农业、政府决策、公共安全和日常生活中\[jones\_potential\_2000,jain\_big\_2017,uccellini\_evolving\_2019,ukhurebor\_precision\_2022,noauthor\_valuing\_2015\]。庞大的观测网络与再分析产品推动了模型开发、资料同化及预测可靠性评估的持续改进\[hersbach\_era5\_2020,randles\_merra\-2\_2017\]。然而,大气动力学具有混沌特性,跨越广泛的空间和时间尺度,因此预报检验依赖于许多互补的技能指标(例如异常相关系数、RMSE、MAE 和技能分数)来刻画性能的不同方面\[brady\_climpred\_2021\]。相比之下,尽管叙事型预报产品具有重要的业务价值,但可用于切实量化大气状态及演变文本表示可靠性的方法依然有限。
近年来,越来越多研究致力于探索大气数据的多模态学习,包括微调前沿 VLMs 以及创建用于气象问答(QA)和事件理解的数据库。代表性工作包括 CLLMate\[li\_cllmate\_2024\],将极端事件新闻与再分析数据配对用于问答;RadarQA\[he\_radarqa\_2025\],引入雷达标注和启发式规则以辅助 VLM 微调;以及聚焦灾害的数据集,如 SEVIR\[veillette\_sevir\_2020\] 和 GridRad-Severe\[murphy\_development\_2023\]。另有研究将结构化气象输入与文本输出配对,构建面向 QA 的基准测试,例如 MeteorPred\[tang\_meteorpred\_2025\]、Climate IQA\[chen\_climateiqa\_2025\]、Zephyrus\[varambally\_zephyrus\_2025\] 和 WeatherQA\[ma\_weatherqa\_2024\]。尽管这些研究展示了多模态模型在大气应用中的潜力,但由于目标输出、空间尺度、预报时效和训练数据选择等方面的严格限制,跨基准的直接比较往往难以进行。此外,许多评估侧重于问答准确率,或过度依赖传统文本指标(BLEU、ROUGE、METEOR、BERTScore)和/或大语言模型裁判评分,这不足以评估生成的讨论是否准确识别了天气形势现象、捕捉了其空间范围,并反映了与预报领域相关的尺度依赖性特征。
**本文工作**。为弥补上述所有空白,我们推出了一套专为生成和验证天气形势尺度预报讨论而设计的新基准与评估方法。我们提出 SynopticBench,这是一个大规模数据集,包含 1,367,041 份美国国家气象局的区域天气预报讨论,与美国本土的 500mb 位势高度、2m 气温和 850mb 风速预报图像配对。与现有基准不同,SynopticBench 是首个针对全天气类型、在中尺度与天气尺度两个空间尺度上评估数值天气预报气象样本的基准测试(参见表4 (https://arxiv.org/html/2604.16451#A1.T4))。关键在于,我们还提出了“天气形势现象对齐与覆盖度评估”(Space),这是一个评估框架,明确考虑了大气现象的尺度依赖性以及不同变量所需的差异化空间精度(例如降水与气压模式)。Space 旨在分别评估不同的现象,同时纳入空间覆盖度和相关性,从而更准确地估算 VLM 生成气象文本的能力。基于 SynopticBench,我们训练了用于生成天气形势讨论的模型,并对广泛使用的 VLMs 进行了微调。结果表明,微调后模型的物理推理能力得到提升。SynopticBench 的核心目标是推进人们对视觉-语言模型在天气预报中应用的研究与理解。因此,我们公开了数据集、评估指标以及多款 VLM 的微调权重,以支持可重复性研究,并促进在天气预报领域对 VLM 进行更严谨、更贴合领域的评估。
| 数据集 | 气象数据 | 文本规模 | 空间尺度 | 目标场景 |
|---|---|---|---|---|
| GridRad-Severe \[murphy\_development\_2023\] | 遥感 x 单胞/多胞/中小尺度 | / | 中尺度 | 极端天气 |
| SEVIR \[veillette\_sevir\_2020\] | 遥感 x 中小尺度 | / | 中尺度 | 极端天气 |
| WeatherQA \[ma\_weatherqa\_2024\] | 再分析 | 8,000 | 中尺度 | 极端天气 |
| ClimateIQA \[chen\_climateiqa\_2025\] | 再分析 | 762,120 | 中尺度、综观尺度 | 极端天气 |
| CLLMate \[li\_cllmate\_2024\] | 再分析 | 41,000 | 中尺度 | 极端天气 |
| RadarQA \[he\_radarqa\_2025\] | 遥感 | 69,000 | 中尺度 | 全天气类型 |
| MP-Bench \[tang\_meteorpred\_2025\] | 再分析 | 421,363 | 中尺度 | 极端天气 |
| Zephyrus Bench \[varambally\_zephyrus\_2025\] | 再分析 | 2,158 | 中尺度、综观尺度、全球尺度 | 全天气类型 |
| **SynopticBench** | **NWP** | **1,367,041** | **中尺度与综观尺度** | **全天气类型** |
**表1:** SynopticBench 与现有使用多模态数据集的大气数据研究的对比。此处展示了气象数据类型(RS→遥感;NWP→数值天气预报)、文本样本数量、相关空间尺度(SC→单胞;MC→多胞;MS→中尺度)及各研究的目标。SynopticBench 是首个从 NWP 生成文本的大型基准,包含 1,367,041 个文本样本。
## 2 SynopticBench
在此,我们将详细介绍数据集构建流程(第2.1节)、数据采集(第2.2节)、数据预处理(第2.3节)以及我们提出的 Space 评估指标(第2.5节)。
### 2.1 数据集构建流程
制约大气数据多模态模型发展的最大瓶颈之一,就是缺乏可与数值数据配对的高质量文本。我们提出使用美国国家气象局(NWS)编写的“区域天气预报讨论”(AFDs)作为解决多模态数据问题的一种潜在方案。AFD 文本数据已公开,并从爱荷华环境中网(Iowa Environmental Mesonet)[111] https://arxiv.org/html/2604.16451v1/mesonet.agron.iastate.edu/wx/afos/list.phtml 提取。AFDs 遍布全美各地的 NWS 站点,通常每天发布多次。它们能够极其详细且可靠地描述天气预报,经常提前一周向公众通报天气情况\[noauthor\_completing\_2006\]。此外,它们还描述了众多物理变量、垂直层级、空间尺度和过程。AFDs 通常还包括对天气现象时间演变的高质量描述,这为训练模型生成描述大气数据随时间变化的文本提供了可能。
### 2.2 数据集采集
(见图1说明)
**图1:** 训练集中单个样本的示例(上栏)。每个训练样本图像中的黄色方框标示了讨论文本对应的位置。示例答案为经过筛选的 AFD。下栏显示了讨论中使用的所有位置。训练样本格式如下所示,每份预报匹配了117份AFD。
我们通过将美国国家环境预报中心(NCEP)的全球预报系统(GFS)模型\[national\_centers\_for\_environmental\_predictionnational\_weather\_servicenoaaus\_department\_of\_commerce\_ncep\_2015\]与 AFDs 配对来构建 SynopticBench。该数据集包含从 2016年1月1日至 2025年12月31日发布的 GFS 预报(共 14,159 次预报),并与 1,367,041 份 AFD 文本样本配对。每次 GFS 预报均由 2m 气温、降水率、500mb 位势高度、850mb 纬向风和 850mb 经向风组成,并与时间上最近的 AFD(通常在几小时内)匹配。由于研究中使用了 117 个 NWS 站点位置(图1),我们将每份预报与 117 个文本样本配对。这使得针对不同预报时段内美国本土主要天气形势特征的描述在文本样本之间保持一致。
### 2.3 数据预处理
在开始训练和评估视觉-语言模型之前,我们对 AFDs 和 GFS 预报均执行了多项数据预处理步骤。预处理时,我们首先剔除超过 48 小时的预报时效。尽管 AFDs 主要与 GFS 预报一致,但它们有时也基于其他模型,由于大气的混沌特性,随着预报时效增加,不同模型的结果会产生分歧。空间范围裁剪为北纬15°至65°、西经60°至160°。我们以阴影等高线绘制平均2米温度距平,以实线等高线绘制平均500mb位势高度,并以风羽形式展示850mb风速。一个 5°×5° 的黄色方框居中置于每张配对图像的讨论所在位置。
为了保持文本与图像内容可匹配的目标,我们为实验对 AFDs 中的信息进行了预处理。AFDs 通常参考 GFS 预报,但也可能使用多种其他模型的信息。我们删除了提及任何其他预报模型或在图像未展示的尺度或垂直层级上不存在天气系统的句子。我们也仅保留包含明确描述天气系统或温度距平的关键词的句子,包括:**trough(槽)、ridge(脊)、low pressure(低压)、high pressure(高压)、cold front(冷锋)和 warm front(暖锋)**。完整的包含与排除关键词列表见附录。在评估最长 48 小时的天气形势现象时,我们也可以期望大范围图案具有高度一致性。AFDs 中描述的信息按时间顺序排列,通常包含不同现象发生的具体星期几。一旦提到发行日期两天后的某一天,其后的所有文本将被移除,以保持与预报时效的一致性。
### 2.4 基线模型
我们采用了四种不同的基线方法以增强结果的对比视角。Gemini-3.1 Pro 用作当前最先进模型的基线。最近邻基线通过计算测试集每张图像与训练集所有图像之间的 SSIM 得分构建。测试集中每个样本的文本取自 SSIM 得分最高的训练集配对图像。气候学基线通过在训练集中随机抽取与测试集每个样本位于同一月份和地点的样本来获取文本。盲LLM基线则在运行 LLaMA-3.2-11B 之前剥离测试集中的图像标记。
### 2.5 天气形势现象对齐与覆盖度评估(Space)指标
(见图2说明)
**图2:** 大尺度(绿色)、中尺度(紫色)和小尺度(橙色)位置关键词匹配的多个示例。蓝线表示如果在预测文本或参考文本中发现这些位置时可能产生的潜在匹配。
传统的文本评估指标无法充分满足描述大气过程的文本需求,因为它们不包含任何物理推理。**Space** 的目的是评估 VLM 生成能在目标位置预测正确现象文本的能力。从文本中评估位置准确性是一项复杂的任务,因为许多术语可能完全不同,但代表相似的位置(例如落基山脉与科罗拉多州),且位置术语的精确度容忍度可能因现象尺度而异(例如,“槽穿过丹佛地区”比“雨落在丹佛地区”更可接受,正如“槽穿过科罗拉多州”优于“雨落在科罗拉多州”一样)。为了适应这些关系,我们引入了一棵专门为评估描述天气形势现象文本而设计的空间层次树。该层次结构包含三个级别,涵盖了北美常用于详细描述天气形势现象位置的术语(见图2 (https://arxiv.org/html/2604.16451#S2.F2) 了解层次树一小部分的示例)。
Space 可应用于具有正负相分类的各种天气形势现象(例如,高/低气压系统、暖/冷锋、湿/干事件)。接下来,为演示 Space 的方法论,我们以气压系统为例。我们开始 Space 的步骤是将气压术语与位置匹配。如果文本中存在“低气压”、“高气压”、“槽”(排除“短波槽”实例)或“脊”,该术语首先会与句中紧随其后的任何位置进行匹配。对于某一个样本的相似文章
PlanBench-V: 面向视觉语言模型的空间规划地图基准
本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。
时空预测基准数据集与基线的批判性审查
本文批判性审查了时空预测的基准数据集与基线,表明经典线性模型常与图神经网络 (GNNs) 相媲美,突出了区分可靠性问题,并倡导更严格的评估。
AFDBench:一个以推理为先的AI科学家在国家气象服务预报讨论中的应用
AFDBench是一个用于评估国家气象服务预报讨论中生成式气象推理的基准,通过强化学习提升LLM在准确性、风格一致性和数据保真度方面的表现。
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。