CDEP Agent:连接气象检测的时序复合事件与现实世界的文档证据

arXiv cs.AI 论文

摘要

CDEP Agent 是一个可审计的大型语言模型代理框架,它将气象检测的复合干旱到极端降水事件与现实世界的文档证据相连接,揭示出大多数此类事件在当前报告系统中未被记录。

arXiv:2608.28628v1 公告类型:新 摘要:复合干旱到极端降水(CDEP)事件在气候科学中被认可为一种日益增长的极端影响驱动因素,但这种认可是否转化为现实世界的早期预警和事后文档记录尚不清楚,因此一个气象上真实的CDEP事件可能在既无预警也无后续记录的情况下发生。我们在此提出CDEP Agent,一个可审计的大型语言模型代理框架,通过将从气象再分析中检测到的CDEP候选事件与来自不同空间尺度、时间分辨率和报告惯例来源的真实世界危害和影响证据相连接,直接测试这种不匹配。以加利福尼亚州为案例研究,我们从2021年至2025年的ERA5观测中识别出408个候选CDEP事件,并根据美国干旱监测、NOAA Storm Events和公共网页在五个维度上评估每个事件:前期干旱、极端降雨、局部影响、灾害影响归因以及明确的干旱到降雨关联。只有34.3%的候选事件在危害组件上得到证实,仅1.5%被明确链接到其前期干旱,表明大多数气象检测的CDEP事件未被记录,且其复合性质几乎从未进入记录。我们的框架为气候科学家提供了一种方法,将物理事件定义与实际记录内容进行测试,并为社会科学家、经济学家和灾害响应机构提供了复合事件的溯源链接证据库,而当前的预警和报告系统在很大程度上未能捕捉到这些事件。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:33

# CDEP代理:连接气象检测的时间复合事件与现实文献证据 来源:https://arxiv.org/html/2608.28628

###### 摘要

干旱-极端降水复合事件在气候科学界已被认为是加剧极端影响的重要驱动因素,但这种认知是否已转化为现实世界的预警与事后记录尚不明确。这意味着,一个气象学意义上的CDEP事件可能在没有预先警告、也没有后续记录的情况下悄然发生。本文提出CDEP Agent,一个可审计的LLM代理框架,通过直接检验这种不匹配性——将气象再分析数据中检测到的CDEP候选事件,与不同空间尺度、时间分辨率和报告规范下的真实灾害与影响证据相关联——来评估这一问题。以加州为例,我们利用ERA5观测数据在2021-2025年间识别出408个CDEP候选事件,并依据美国干旱监测局、NOAA风暴事件数据库及公开网页信息,从五个维度进行评估:前期干旱、极端降水、局部影响、灾害-影响归因以及干旱-降水间的显式关联。结果显示,仅34.3%的候选事件在灾害的两个组成部分均得到证实,而明确将其与前期干旱关联的记录仅占1.5%。这表明大多数气象检测到的CDEP事件未被记录,其复合特性几乎从未进入文献记载。本框架为气候科学家提供了一种检验物理事件定义与实际记录之间差异的方法,也为社会科学家、经济学家和灾害响应机构提供了当前预警与报告系统未能有效捕捉的、具有来源追溯性的复合事件证据基础。

## 引言

气候变化正在全球范围内加剧水文气候极端事件,全面理解其现实影响对早期预警、适应规划和灾害风险管理至关重要。越来越多的研究指出,干旱与极端降水事件是这一趋势中最明显的标志(Rodell and Li 2023 (https://arxiv.org/html/2608.28628#bib.bib1)),这些事件不仅发生频率增加,强度也更为剧烈(Gue et al. 2023 (https://arxiv.org/html/2608.28628#bib.bib2); Satoh et al. 2022 (https://arxiv.org/html/2608.28628#bib.bib3))。更引人注目的是气候系统在两种极端状态间转换的速度:自1980年以来,从干旱到强降雨的快速转变在全球范围内显著增加,这一模式表明这些转变日益表现为独立的复合事件,而非恰好相继发生的两种无关灾害(Qing et al. 2023 (https://arxiv.org/html/2608.28628#bib.bib4))。联合国政府间气候变化专门委员会(IPCC)第六次评估报告将复合极端事件列为重要的气候风险类别,近年事件也显示了其在不同地区的严重影响(IPCC 2021 (https://arxiv.org/html/2608.28628#bib.bib5); Zscheischler et al. 2025 (https://arxiv.org/html/2608.28628#bib.bib6))。然而,一个复合事件在气象学上的真实性并不等同于它被文献记录。干旱向极端降水的转变在再分析数据中可能清晰可见,但在政府、记者和灾害数据库实际产生的记录中却可能几乎无痕,因为这些记录围绕的是离散的风暴、离散的干旱和离散的行政辖区,而非气象学定义的连接它们的序列(Jones et al. 2022 (https://arxiv.org/html/2608.28628#bib.bib10); Li et al. 2026 (https://arxiv.org/html/2608.28628#bib.bib24))。尽管复合事件至今已被仔细定义为独立的灾害类别,并有描述其如何源于单个可能不极端的驱动因素共同或连续发生的类型学和概念框架(Leonard et al. 2014 (https://arxiv.org/html/2608.28628#bib.bib8); Zscheischler et al. 2020 (https://arxiv.org/html/2608.28628#bib.bib7))。即使是近期改进灾害档案可用性的努力,如GDIS(Rosvold and Buhaug 2021 (https://arxiv.org/html/2608.28628#bib.bib11))和Geo-Disasters(Teber et al. 2026 (https://arxiv.org/html/2608.28628#bib.bib12)),也只是在现有单一条目中增加了空间精度,而未追问某个复合序列在最初是否被如此识别。与此同时,复合事件的气象检测能力日益增强(Yin et al. 2025 (https://arxiv.org/html/2608.28628#bib.bib13)),这使得问题更为尖锐:当检测器从气象数据中标记出数百个候选复合事件时,其中有多少曾被气候科学界以外的人注意到、报道或采取行动?又是什么决定一个事件能否达到这个标准?为此,我们提出CDEP Agent,一个可审计的LLM代理框架,将气象检测到的CDEP候选事件与表明它们被识别的现实世界灾害和影响证据相连接。语言代理在科学检索与综合方面展现出潜力(Skarlinski et al. 2024 (https://arxiv.org/html/2608.28628#bib.bib20); Asai et al. 2026 (https://arxiv.org/html/2608.28628#bib.bib21)),以及在特定领域的决策支持(Xie et al. 2025 (https://arxiv.org/html/2608.28628#bib.bib23)),但需要严格的任务级评估(Chen et al. 2025 (https://arxiv.org/html/2608.28628#bib.bib22))。CDEP是更广泛的复合气候事件的一个例子,由一段长期干旱期后紧接短时间内强降雨组成。给定一个由县、前期干旱期和后续降雨窗口指定的候选事件,该代理从美国干旱监测局、NOAA风暴事件数据库和公开网页等来源检索并对齐证据,并沿五个明确维度评估每个候选事件:前期干旱是否被记录、后续极端降水是否被记录、是否产生局部影响、该影响是否归因于该灾害,以及任何来源是否明确将干旱与后期的极端降水事件联系起来。每个决策都保留了其来源出处、支持引文,以及日期、地点和同期事件匹配结果,保守的标注协议确保未解决或否定的结果被如实记录,而非视为无事发生的证据。CDEP作为演示案例有几个原因:它在气象学上已有良好表征(Qing et al. 2023 (https://arxiv.org/html/2608.28628#bib.bib4); Deng et al. 2024 (https://arxiv.org/html/2608.28628#bib.bib29)),它在气象数据上可通过阈值定义,并且加州特别经历了此类降水波动性的记录增长(Swain et al. 2018 (https://arxiv.org/html/2608.28628#bib.bib18); Swain et al. 2025 (https://arxiv.org/html/2608.28628#bib.bib19))。加州的历史也说明了这种“鞭击”效应的破坏性。2012年至2017年间,该州经历了五年创纪录的严重干旱,随后干旱因一场强风暴带来全区域的暴雨而突然结束。突如其来的洪水严重损坏了奥罗维尔大坝的溢洪道,导致下游约19万居民被迫疏散(Vahedifard et al. 2017 (https://arxiv.org/html/2608.28628#bib.bib16))。要确定其他CDEP候选事件是否被识别,需要将联邦干旱监测、风暴日志和地方新闻与候选事件的地点、时间和灾害进行匹配。人工审核无法扩展到数百个候选事件,也无法在记录或检测阈值变更时高效重新运行。将CDEP Agent应用于加利福尼亚州识别出的408个干旱-极端降水转变候选事件,为每个候选事件生成了结构化的、可追溯来源的记录;只有34.3%的候选事件在干旱和极端降水两个方面得到官方或公共记录的证实,而任何来源明确将其与前期干旱联系起来的仅占1.5%。这一差距对依赖于了解哪些灾害实际在地面被识别的早期预警、适应和灾害响应决策具有直接影响。然而,在存在证实性网页的情况下,它们通常捕捉到了实质性的现实后果,如洪水、疏散、停电和财产损失,这表明差距在于事件是否被记录,而非一旦记录后能恢复什么。然后,我们利用这些结构化的、可追溯来源的记录来探究:是什么将进入文献记录的候选事件与那些没有进入的区分开来;气象强度与持续时间或局部影响是否预测了文献记录的存在,这与单纯反映证据可用性或检索限制的情况有所不同。通过使这些文献记录差距明确化和可审计,我们的框架为气候科学家提供了一种系统化的方法,用以根据实际被识别为与社会相关的记录来检验和完善气象候选事件定义,也为社会科学家和经济学家提供了研究复合气候事件如何以及何时被认知的、具有来源追溯性的证据基础。

## 方法

本研究包含两个独立阶段:基于再分析数据的候选事件构建和基于代理的证据审查。首先,我们使用基于标准化降水蒸散指数(SPEI-3)、针对特定地点的极端降水阈值以及最长三个月干旱至极端降水间隔的固定操作定义,从ERA5-Land数据中识别加利福尼亚州的历史CDEP候选事件。这一阶段在应用代理之前完成。它为每个候选事件生成了一个县、一个前期干旱期、一个后续极端降水事件窗口以及相应的候选特征。代理未选择或修改用于构建这些候选事件的气象阈值。给定这些固定的候选记录后,代理首先将每个候选事件与结构化的官方记录进行匹配,并对公开网页进行了初步搜索。然后,它检查是否存在前期干旱、后续极端降水事件、局部影响或干旱与后期极端降水事件之间明确联系的合格证据缺失的情况,并针对缺失项目指导进行后续搜索。对于检索到的每个来源,代理提取报告的日期、地点、干旱或极端降水状况、记录在案的后果、陈述的关系和支持引文。确定性检查随后应用与审查组件相对应的时间窗口和位置要求。对于极端降水事件影响和灾害-影响关联,检查还要求灾害和后果指代同一事件。图1 (https://arxiv.org/html/2608.28628#Sx2.F1) 总结了完整的工作流程,从ERA5-Land候选事件构建,到证据检索、结构化来源审查、特定候选事件检查以及气象-文献记录对齐。

### 从气象数据构建历史CDEP候选事件

**图1:CDEP Agent工作流程概述。** 首先从ERA5-Land干旱和极端降水数据构建气象候选事件。对于每个固定的候选事件,代理检索官方记录和公开网页,结构化检索到的证据,并应用时间、空间、同期事件和引文支持检查。生成的文献证据随后与气象候选事件对齐,产生可追溯来源的评估。

我们使用ERA5-Land导出的三个月SPEI-3来表征前期干旱(Muñoz Sabater 2019 (https://arxiv.org/html/2608.28628#bib.bib25))。SPEI衡量选定累积期的降水与大气水分需求之间的平衡;此处使用的三个月尺度代表极端降水转变前的水分状况(Vicente-Serrano et al. 2010 (https://arxiv.org/html/2608.28628#bib.bib26), 2020 (https://arxiv.org/html/2608.28628#bib.bib27))。在候选事件构建中,当SPEI-3低于-1时,网格单元被归类为处于干旱状态,值越低表示干旱越严重(Deng et al. 2024 (https://arxiv.org/html/2608.28628#bib.bib29))。此SPEI规则仅用于构建气象候选集;后续的前期干旱评估使用了来自美国干旱监测局和合格公共网页的独立文献证据。极端降水事件通过ERA5-Land的每日降水数据独立检测(Muñoz Sabater 2019 (https://arxiv.org/html/2608.28628#bib.bib25)),基于三日累积降水(PR3)。对于每个网格单元,P99阈值从1985-2014年参考期计算,超过此阈值的降水期被归类为强降雨事件。这与区分短和长降雨过程的事件性洪水分类一致(Stein et al. 2020 (https://arxiv.org/html/2608.28628#bib.bib31)),也与在中国使用三日降雨最大值作为指标的洪水风险研究一致(Li et al. 2012 (https://arxiv.org/html/2608.28628#bib.bib30))。这些研究共同支持将复合事件的极端降水部分锚定在与洪水相关的高百分位数,而非通用的强降雨定义。本研究重点关注在干旱后三个月内检测极端降水事件,遵循评估一、二、三月转变间隔的先前CDEP工作(Deng et al. 2024 (https://arxiv.org/html/2608.28628#bib.bib29))。这有助于更全面地识别CDEP事件。SPEI-3阈值、针对特定地点的三日降水99百分位数以及最长三个月的干旱至极端降水间隔共同定义了用于本研究构建候选集的操作性CDEP规范。这些基于文献的选择提供了一种一致的识别候选转变的方法;它们并非旨在代表CDEP的唯一有效定义。由于代理接收候选地点和事件窗口作为输入,相同的检索和证据审查程序可以在使用替代阈值构建的候选集上重新运行,尽管当前评估仅使用此处报告的规范。

### 搜索公共记录和网页

在气象候选事件构建完成后,每个固定的候选记录进入基于代理的检索和证据审查阶段。检索阶段首先通过可用的县、日期、事件类型和后果字段,将每个候选事件与美国干旱监测局和NOAA风暴事件数据库的结构化记录对齐。它还进行了初步的公共网页搜索,涵盖机构网页、地方和区域新闻以及回顾性报告。网页查询将候选地点和相关日期与描述所寻求证据的术语相结合,例如干旱、缺水、干旱相关限制、强降雨、洪水、道路中断、财产损失、停电、疏散或农业损失。目的是找到描述指定地点和事件时期的记录,而不仅仅是泛泛讨论干旱或洪水的网页。

相似文章

Agent-MD:面向有状态GCMC-MD模拟活动的选择性LLM干预与事件驱动升级

arXiv cs.AI

Agent-MD是一个框架,选择性地将LLM推理应用于长期分子模拟活动,使用确定性规则型代理处理常规任务,并对异常情况采用事件触发的LLM审查。在GCMC–MD水蒸气解吸模拟中的演示表明,可审计、可复现的科学工作流可以避免将每项操作都置于LLM推理循环中。

Evidence Core

Product Hunt

Evidence Core 是一款利用编码代理构建实时分析功能的产品。

Didact:面向国防的跨域能力发现系统

arXiv cs.CL

Didact 是一个面向国防的跨域能力发现系统,它将国防报告和政策文件与来自研究出版物的知识图谱相结合,使用复合 RAG 流水线进行自然语言对话,并通过交互式证据轨道(Evidence Rail)实现来源可视化。