MULTISEISMO:多模态地震数据集与模型,用于跨模态地震理解
摘要
本文介绍了MultiSeismo,一个大规模多模态地震数据集,包含超过16,000个事件,整合了波形、烈度图和元数据,以及MISCE指令集和SeisModal——一个经过微调的多模态模型,用于跨模态地震理解。
arXiv:2605.26320v1 公告类型:新论文
摘要:通用多模态模型(GMM)在专业科学领域的应用仍受到限制,因为缺乏整合文本和图像之外多种数据模态的全面领域专用数据集。在地震学中,理解地震现象需要综合时间序列波形数据、地理图像和上下文元数据——而现有地震数据集中缺乏这种多模态整合。我们提出了MultiSeismo,一个大规模结构化的多模态地震数据集,包含跨越13年(2010年至2023年)不同地理区域的超过16,000个地震事件。每个事件的数据整合了来自全球台网记录的波形、烈度图、人口暴露可视化以及标准JSON格式中的全面文本描述。此外,我们开发了MISCE,一个基于原始数据的多模态指令集,用于对GMM进行监督训练和评估,涵盖从基本信息检索到复杂跨模态分析的地震推理任务。我们利用MISCE对现有多模态模型(Unified IO 2)进行微调,并增加了专门的时序编码器,从而得到SeisModal——第一个用于全面地震分析的领域专用多模态模型。对MultiSeismo上最先进多模态模型的评估揭示了重大挑战,尤其是通用模型在处理时间序列数据方面的困难,同时展示了SeisModal在地震多模态推理任务上的优越性能。这些结果证明,MultiSeismo为未来地震学多模态研究提供了严格的基准,也验证了我们领域专用架构调整的成功。
查看缓存全文
缓存时间: 2026/05/27 09:08
# MultiSeismo:面向跨模态地震理解的多模态地震数据集与模型 来源:https://arxiv.org/html/2605.26320 Sai Munikoti, Ian Stewart, Chengping Chai, Lisa Linville, Scott Vasquez, Sameera Horawalavithana, and Karl Pazdernik 本研究由美国能源部国家核安全局防核扩散研究与开发办公室支持;部分由太平洋西北国家实验室(Battelle纪念研究所为美国能源部运营,合同号DEAC05–76RLO1830)承担;部分由UT-Battelle有限责任公司根据与美国能源部(DOE)的合同DE-AC05-00OR22725承担。本手稿已获PNNL公开发布许可:PNNL-SA-221837。本工作已提交至IEEE待发表。版权可能在没有通知的情况下转移,之后此版本可能不再可访问。 S. Munikoti, I. Stewart, S. Vasquez, S. Horawalavithana, 和 K. Pazdernik 就职于太平洋西北国家实验室(PNNL),美国华盛顿州里奇兰99354。 C. Chai 就职于橡树岭国家实验室(ORNL),美国田纳西州橡树岭37830。 L. Linville 就职于桑迪亚国家实验室(SNL),美国新墨西哥州阿尔伯克基87123。 K. Pazdernik 同时任职于北卡罗来纳州立大学(NCSU),美国北卡罗来纳州罗利27695。 S. Munikoti 和 I. Stewart 对本文贡献相同。 S. Vasquez:此工作完成于作者在PNNL任职期间。 ###### 摘要 通用多模态模型(GMMs)在专业科学领域中的应用仍然有限,原因是缺乏集成文本和图像之外多种数据模态的全面领域特定数据集。在地震学中,理解地震现象需要综合时间序列波形数据、地理图像和上下文元数据——这种多模态集成在现有地震数据集中是缺失的。我们提出了**MultiSeismo**,一个大规模、结构化的多模态地震数据集,包含跨越13年(2010-2023年)、覆盖不同地理区域的超过**16K**个地震事件。每个事件数据集成了来自全球台网记录的波形、烈度图、人口暴露可视化图以及标准化JSON格式中的全面文本描述。我们还开发了**MISCE**(多模态地震事件表征指令集),基于原始数据构建多模态指令集,以实现GMMs在地震推理任务上的监督训练和评估,任务范围从基本信息检索到复杂的跨模态分析。我们利用MISCE对现有增强型多模态模型(Unified-IO 2)进行微调,为其增加了专门的时间序列编码器,从而得到**SeisModal**——首个用于全面地震分析的领域特定多模态模型。在MultiSeismo上对最先进多模态模型的评估揭示了显著挑战,尤其是通用模型在处理时间序列数据方面的困难,同时展示了SeisModal在地震多模态推理任务上的优越性能。这些结果证明MultiSeismo为未来地震学多模态研究提供了严格的基准,并验证了我们领域特定架构调整的成功。本工作为基础地震学多模态AI应用提供了必要的资源和方法框架,并为其他专业科学领域提供了可迁移的方法。 ## I. 引言 机器学习研究中对通用多模态模型的兴趣日益增长,这些模型能够学习和理解超越标准文本和视觉[1]的多种模态(如视频、音频和时间序列)。通用多模态模型(GMMs)的快速发展在从医疗到自动驾驶等多个领域展示了卓越的能力。然而,GMMs在专业科学领域的应用仍然有限,主要原因是缺乏超越文本和图像的领域特定多模态数据集和模型。在其他科学领域中,地震学为多模态AI带来了独特的挑战。理解地震事件的起源和影响通常需要整合时间序列波形数据、空间地理信息(如卫星图像、地下模型或地形图)以及文本形式的上下文元数据。传统的地震分析数据集[2, 3]和模型[4]通常只包含单一模态,往往只共享时间序列数据,而没有与其他模态对齐。从GMM开发的角度来看,将波形、图像和文本元数据整合在一起,既能更全面地分析地震事件,也有利于模型训练。 图1:MultiSeismo数据集中地震事件的空间密度(颜色越深表示事件越频繁)。 为了填补这一关键空白,我们通过系统整理美国地质调查局国家地震信息中心(NEIC)[5]的数据,开发了一个全面的多模态地震数据集:**MultiSeismo**(用于跨模态地震理解的多模态地震数据集)。我们的数据收集方法包括来自全球数百个台站的原始波形记录;文本形式的技术和地理细节;以及显示烈度、人口暴露和传感器记录的地图图像。MultiSeismo包含超过16000个事件,涵盖2010-2023年13年的地震活动,分布在不同地理区域,包括震级2.5以上、深度各异的事件,确保了对全球地震现象的广泛代表性。每个代表地震事件的数据样本将所有数据模态整合到标准化的JSON格式中,将传统上分散的地震数据模态转化为统一的结构,便于GMMs的无缝训练和评估。为确保可重复性并支持系统化的数据集扩展,我们在MultiSeimo开发过程中建立了标准化的数据处理流程,利用NEIC输入数据的一致性格式,便于未来将更多地震事件无缝集成到数据集中。MultiSeismo数据集可在此处获取:https://huggingface.co/datasets/PNNL/MultiSeismo。 利用MultiSeimo中的标准化数据,我们还开发了一套全面的模型就绪指令集——**MISCE**(地震事件表征多模态指令集),用于对GMMs进行地震任务的训练和评估。这些指令测试模型的地震推理能力,涵盖各种复杂度级别,从基本的事件信息检索和波形解释,到涉及图像分析和时间模式识别的复杂推理任务。除了数据集创建,我们还做出了方法论贡献:对现有多模态模型(即Unified-IO 2)进行了增强,为其增加了专门处理地震波形数据的时间序列编码器。我们在MISCE上训练了这个增强架构,得到了地震领域多模态模型**SeisModal**——首个专为全面地震分析定制的通用多模态模型。SeisModal展示了如何通过有针对性的架构修改和领域特定训练,将通用多模态架构适配到专业科学领域。 为了展示数据集的实用性,我们测试了多个GMMs(包括SeisModal、Unified-IO 2[6]和Phi-4[7])的地震推理能力。我们测试了跨模态推理(IV-B节)、处理越来越长的时间序列(IV-C节)以及检索多模态数据(IV-D节)。我们的评估显示,SeisModal在地震多模态推理任务上优于通用模型,验证了我们数据集的质量和领域特定模型调整的效果。基于所有模型得分普遍较低(尤其是在时间序列模态上),我们判断这些任务具有挑战性但可解,从而为在整理的MultiSeismo数据集上评估未来模型的地震多模态推理能力提供了强有力的基准。 因此,这项工作为地震学研究人员提供了全面的多模态数据集和专用模型,同时为发展领域特定的通用多模态AI系统提供了宝贵见解。 ## II. 相关工作 地震学是AI社区广泛研究的课题,特别是在理解和表征时间序列波形数据方面。该领域最突出的工作之一是SeisBench[2],它提供了一套广泛的地震数据集和工具,专为地震学中AI算法的基准测试而定制。SeisBench整合了多个成熟的地震数据集,包括STEAD(斯坦福地震数据集;[3])、INSTANCE(意大利地震数据集;[8])、ETHZ、GEOFON、LENDB、NEIC和SCEDC等,每个数据集服务于不同的分析目的,包括地震检测、相位拾取和地面运动预测等。SeisBench中的NEIC数据集包含来自国家地震信息中心[9]精心筛选的子集,这也是本研究的数据来源。截至2025年,NEIC共包含130万个全球源-台站路径的地震相位到时。然而,它不包含有关迹线起始时间和台站信息。类似地,SeisBench中的STEAD数据集[3]包含局部地震信号(包括地震和非地震信号)以及噪声样本。总共包含约120万条时间序列,其中约10万条为噪声样本,其余包含地震事件信号。总的来说,SeisBench主要包含地震事件元数据和相关参数,针对传统地震学任务(如到时拾取和事件分类)进行了优化。现有的基准数据集主要集中在定义明确的地震分析任务上,如波形分类、P/S波到时拾取和事件检测,这些任务促进了地震学界可重复研究的发展[10, 11, 12]。地理覆盖的多样性(从区域台网到全球台网)以及所代表的各种地震现象,使SeisBench尤其成为开发和对齐地震学深度学习模型的基础资源。 然而,现有的地震数据集主要是单模态的,主要关注波形数据及其附带的元数据。这些数据缺乏训练和评估跨模态AI模型所需的集成多模态结构,特别缺少文本数据和图像数据来为波形提供上下文背景(对比社交媒体地震数据[13])。此外,地震数据集中缺乏自然语言指令,限制了它们训练多模态语言模型的能力,而这些模型能够以人类可理解的格式解释、推理和交流发现[7]。 最近多模态模型的进展展示了集成和推理不同数据模态的卓越能力,超越了传统的文本和视觉,扩展到了音频、视频和专业科学数据类型[1, 14, 15]。特别是在科学领域,已有一些工作开始探索多模态AI应用,但大多数仍局限于文本和图像模态。一些值得注意的工作包括多模态科学问答[16, 17]、结合文本报告的医学影像[18]以及结合图像与目录信息的天文数据分析[19]。时间序列集成在多模态模型中仍然特别具有挑战性,最近的方法如Time-LLM展示了通过用时间嵌入“重新编程”大型LLM,这些系统可以将数值序列与自然语言对齐[20]。此外,以视觉为中心的方法如Time-VLM将时间序列信号视为视觉模式,利用预训练的视觉-语言模型的空间推理来增强跨模态特征提取和对噪声数据的鲁棒性[21, 22]。然而,尚无现有工作全面解决地震数据特有的挑战,这要求同时理解时间波形模式、空间地理上下文和领域特定的文本信息。这一差距凸显了对能够有效处理地震学分析多模态性质的专业数据集和模型的需求。我们的工作填补了这一关键需求,提供了真正的多模态地震数据集和地震多模态模型,弥合了传统地震学数据分析与新兴AI能力之间的鸿沟。 ## III. 地震多模态数据集 本节全面概述MultiSeismo数据集的开发流程。以下小节详细介绍了我们从NEIC资料库[5]系统收集数据的方法,描述了为确保数据集完整性和标准化而应用的预处理与聚合程序,并介绍了旨在实现对GMMs在地震分析任务上进行全面评估的指令生成框架。 ### III-A. 原始数据集收集 我们从美国地质调查局(USGS)NEIC震动图档案中收集原始地震数据。地震事件的时间跨度从2010年1月1日到2023年12月31日,覆盖近14年。我们收集了全球所有震级在2.5级及以上的事件。这些事件中大多数(99%)是地震,只有少数归因于采矿爆炸、火山喷发和其他非构造原因。 表I:事件页面信息。 除波形外,所有其他事件数据均从USGS震动图档案[5]中抓取。对于每个地震事件,我们抓取了多个HTML页面并下载了内容,详见表I。为了下载事件特定的波形数据,我们利用了美国国家科学基金会国家地球物理设施IRIS[23]提供的Web服务和Obspy包。我们只收集了在USGS震动图档案和IRIS中均可获取的事件数据。 ### III-B. 数据后处理与分析 收集到的文本和图像数据大部分以HTML和PDF格式存在,包含大量与目标内容无关的额外信息。
相似文章
分离、细化、整合:为情感分析分解多模态融合
一篇研究论文,提出了SeRIn,一种多模态融合方案,将模态特定细化与跨模态交互分离,在CH-SIMS和CMU-MOSEI情感分析基准上取得了最先进的结果。
EmoS:面向细粒度流式情感理解的高保真多模态基准
本文介绍了 EmoS,这是一个专为细粒度流式情感理解设计的高保真多模态基准,旨在解决现有数据集中存在的生态效度不足和标注可靠性低的问题。
用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件
本文介绍了用于可复现的AI驱动热流体研究的开放多模态数据集和开源软件包,提出了时空维度框架及SeqReg等序列回归工具。
跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准综述
对跨视觉、语言、视频和音频的多模态遗忘方法、数据集和基准的综合综述,提供了分类法并强调了未解决问题。
从模态到命题:一种以语言为中心的多模态智能框架
本文提出将多模态数据(图像、视频、文本)表示为原子命题(例如'人拿着杯子')的包,通过全局语义码本统一,实现可解释、组合化和跨模态理解。该框架在自动驾驶和开放世界数据上进行了演示。