社交媒体中因果关系提取的大型语言模型:灾害情报的验证框架

arXiv cs.CL 论文

摘要

本文提出了一个验证框架,用于评估大型语言模型(LLM)在灾害期间从社交媒体帖子中提取因果关系的有效性。通过将LLM生成的结果与基于专家知识的参考图谱进行比较,评估其在识别因果关系方面的可靠性及潜在风险。

arXiv:2605.11348v1 公告类型:新文章 摘要:在灾害期间,从社交媒体中提取因果关系有助于通过识别与人员伤亡、物理损坏、基础设施中断及连锁影响相关的因素来增强态势感知。然而,灾害相关的帖子往往是非正式、碎片化且依赖语境的,它们可能描述个人经历而非明确的因果关系。在这项工作中,我们探讨了大型语言模型(LLM)是否能有效地从灾害相关的社交媒体帖子中提取因果关系。为此,我们(1)提出了一种基于专家知识的评估框架,将LLM生成的因果图谱与源自灾害特定报告的参考图谱进行比较;(2)评估提取出的关系是否有灾后证据支持,还是仅反映了模型的先验知识。我们的研究结果强调了在灾害决策支持系统中使用LLM进行因果关系提取的潜力与风险。
查看原文
查看缓存全文

缓存时间: 2026/05/13 06:11

# 社交媒体中因果关系抽取的大语言模型:灾害情报的验证框架
来源: https://arxiv.org/html/2605.11348
Ujun Jeong1, Saketh Vishnubhatla1, Bohan Jiang1, Andre Harrison2, Adrienne Raglin2, Huan Liu1 1Arizona State University, Tempe, Arizona, USA 2DEVCOM Army Research Laboratory, Adelphi, Maryland, USA \{ujeong1, svishnu6, bjiang14, huanliu\}@asu\.edu \{andre\.v\.harrison2\.civ, adrienne\.raglin2\.civ\}@army\.mil

###### 摘要

在灾害期间,从社交媒体中提取因果关系可以通过识别与人员伤亡、物理破坏、基础设施中断以及级联影响相关的因素来增强态势感知。然而,与灾害相关的帖子往往非正式、碎片化且依赖上下文,它们可能描述的是个人经历,而非明确的因果关系。在本工作中,我们研究了大语言模型(LLMs)是否能有效地从与灾害相关的社交媒体帖子中提取因果关系。为此,我们(1)提出了一种以专家知识为基础的评估框架,该框架将LLM生成的因果图与基于特定灾害报告得出的参考图进行比较,并(2)评估所提取的关系是否得到事后证据的支持,还是仅仅反映了模型的先验知识。我们的研究结果突显了在灾害决策支持系统中使用LLMs进行因果关系抽取的潜力与风险。

社交媒体中因果关系抽取的大语言模型:灾害情报的验证框架

Ujun Jeong1, Saketh Vishnubhatla1, Bohan Jiang1, Andre Harrison2, Adrienne Raglin2, Huan Liu1 1Arizona State University, Tempe, Arizona, USA 2DEVCOM Army Research Laboratory, Adelphi, Maryland, USA \{ujeong1, svishnu6, bjiang14, huanliu\}@asu\.edu \{andre\.v\.harrison2\.civ, adrienne\.raglin2\.civ\}@army\.mil

## 1 引言

正如2021年的一篇系统综述所强调的那样,因果性是灾害情报中至关重要但尚未被充分探索的一个维度 Wiegmann et al. (2020) (https://arxiv.org/html/2605.11348#bib.bib69)。美国国家海洋和大气管理局(NOAA)等机构会发布详细的事后报告,记录危害、影响及促成因素。然而,这些报告具有回顾性且耗费人力,通常只能为灾害快速变化的动态提供有限的见解 Kryvasheyeu et al. (2016) (https://arxiv.org/html/2605.11348#bib.bib17)。

相比之下,Twitter等社交媒体平台通过用户观察、警告和损坏报告提供实时的灾害信息 Vieweger et al. (2010) (https://arxiv.org/html/2605.11348#bib.bib21)。例如,哈维和艾尔玛飓风展示了社交媒体帖子如何在事件发生时捕捉到洪水、交通中断和停电等影响,突显了众包数据在揭示灾害期间早期因果关系信号方面的潜力 King (2018) (https://arxiv.org/html/2605.11348#bib.bib83)。

然而,从社交媒体中提取因果关系仍然具有挑战性。帖子通常简短、非正式、碎片化且依赖上下文,因果关系往往是暗示的而非明确陈述的。因此,依赖“导致”或“致使”等标记的规则方法会遗漏许多相关关系。尽管自然语言处理(NLP)方法在结构化事件和知识提取方面取得了进展 Liu et al. (2023) (https://arxiv.org/html/2605.11348#bib.bib48); Lu et al. (2021) (https://arxiv.org/html/2605.11348#bib.bib65),但许多方法仍然依赖人工标注的模板或特定领域的模式,限制了它们在复杂且快速变化的灾害背景下的泛化能力。

大语言模型(LLMs)提供了一个有希望的替代方案,因为它们能够处理噪声文本、在不完全的上下文中进行推理,并推断未明确陈述的关系 Hao et al. (2026) (https://arxiv.org/html/2605.11348#bib.bib20)。然而,这种能力引入了一个关键风险:LLMs可能会从先验知识中生成看似合理的因果联系,而不是基于帖子中的证据。这激发了我们的研究问题:“LLMs能否从关于灾害事件的社交媒体帖子中提取有效的因果关系?”

为了解决这个问题,我们开发了一个评估框架,该框架将LLM生成的因果图与基于专家知识的报告进行比较,并检查模型输出是否得到帖子级证据的支持,或是受到先验知识的影响。该框架促成了以下三点贡献:

- • **以专家知识为基础的因果图:** 我们通过将影响链框架与事后报告对齐,构建了特定灾害的真实因果图,以保留基于专家知识的证据。
- • **社交媒体因果提取:** 我们评估LLMs从社交媒体帖子中提取一组固定变量之间的因果关系的能力,这与开放式的因果发现有所区别。
- • **证据与先验知识:** 我们考察了社交媒体帖子的质量如何影响LLMs的因果提取,并揭示了由模型先验知识驱动的看似合理但无根据的输出所带来的风险。

## 2 相关工作

### 2.1 用于灾害情报的社交媒体

社交媒体已被广泛用于灾害情报,包括事件检测、损害评估、危机分类、地理位置定位和态势感知 Ma et al. (2025) (https://arxiv.org/html/2605.11348#bib.bib10); Vishnubhatla et al. (2025b) (https://arxiv.org/html/2605.11348#bib.bib9); Zou et al. (2023) (https://arxiv.org/html/2605.11348#bib.bib40); Imran et al. (2016) (https://arxiv.org/html/2605.11348#bib.bib46)。CrisisMMD和HumAID提供了用于相关性和影响分类的标注灾害帖子 Alam et al. (2018) (https://arxiv.org/html/2605.11348#bib.bib35), 2021 (https://arxiv.org/html/2605.11348#bib.bib41)。以前的方法范围从基于关键词和位置的聚类 Atefeh and Khreich (2015) (https://arxiv.org/html/2605.11348#bib.bib68); Becker et al. (2011) (https://arxiv.org/html/2605.11348#bib.bib75) 到捕捉语义和时间模式的神经模型 Zhao et al. (2017) (https://arxiv.org/html/2605.11348#bib.bib76); Lee et al. (2021) (https://arxiv.org/html/2605.11348#bib.bib78); Zhou et al. (2022) (https://arxiv.org/html/2605.11348#bib.bib79)。(某研究)利用GPT-2分析了社交媒体帖子,但未经过验证。

### 2.2 从文本中提取因果关系

因果关系抽取已被广泛研究,从基于词汇线索的系统到神经事件提取框架 Liu et al. (2023) (https://arxiv.org/html/2605.11348#bib.bib48); Lou et al. (2023) (https://arxiv.org/html/2605.11348#bib.bib67); Lu et al. (2021) (https://arxiv.org/html/2605.11348#bib.bib65); Susanti and Färber (2025) (https://arxiv.org/html/2605.11348#bib.bib54)。最近的工作还探讨了使用LLMs从自然文本构建因果图。与我们的设置最接近的是,Saklad et al. (https://arxiv.org/html/2605.11348#bib.bib15) 评估了LLMs是否可以从学术文档中推断因果图,这需要外部判断来使生成的图与参考图保持一致。

我们的工作有两个方面的不同。首先,我们使用影响链框架预先定义目标变量及其抽象水平,这消除了节点等价性的歧义,并实现了直接图评估。其次,据我们所知,这是第一项从社交媒体中提取与灾害相关的因果关系并使用标准化专家报告中记录的事后证据进行验证的研究。

## 3 构建真实因果图

### 3.1 专家证据匹配与记录

特定灾害事件的真实因果图,在这里定义为有向关系集合 (Cause, Effect),并不容易获得。为了弥补这一空白,我们采用了一种**匹配与记录**方法,将既定的灾害管理框架与特定事件的专家证据相结合 Zebisch et al. (2021) (https://arxiv.org/html/2605.11348#bib.bib22)。我们从每种灾害类型的影响链框架基于的一般因果图开始,然后使用来自事后报告的因果关系证据对其进行细化。

1.  **1. 初始变量和边:** 我们基于影响链框架,该框架在灾害风险分析中表示危害、暴露、脆弱性和影响之间的因果路径 Zebisch et al. (2021) (https://arxiv.org/html/2605.11348#bib.bib22), 2022 (https://arxiv.org/html/2605.11348#bib.bib16)。具体而言,我们使用 Pittore et al. (https://arxiv.org/html/2605.11348#bib.bib14) 提出的风暴相关框架作为初始变量和边的集合,以确保抽象水平。
2.  **2. 收集事后专家证据:** 对于每个灾害事件,我们咨询官方、标准化的专家报告,例如NOAA的事后报告 Cangialosi et al. (2021) (https://arxiv.org/html/2605.11348#bib.bib26), 2018 (https://arxiv.org/html/2605.11348#bib.bib25),而不是聚合临时来源。这些报告提供了特定灾害事件因果关系专家基础证据。
3.  **3. 基于证据的剪枝:** 我们仅保留在报告中得到文本证据明确支持的边,并移除未支持的关系。因果关系证据以表格文档形式进行管理以供审查。

图1 (https://arxiv.org/html/2605.11348#S3.F1) 总结了从影响链框架和权威事后报告中构建真实因果图的过程。生成的图表和支持证据表由两名灾害响应和预测领域的博士级研究人员审查,并在录用后将与数据源一起发布。

### 3.2 灾害案例与数据整理

我们关注满足以下两个标准的灾害:(1) 可公开访问的社交媒体数据可用性;(2) 存在标准化的、权威的事后报告,以实现一致的因果分析。使用CrisisMMD Alam et al. (2018) (https://arxiv.org/html/2605.11348#bib.bib35) 和HumAID Alam et al. (2021) (https://arxiv.org/html/2605.11348#bib.bib41) 基准,我们确定艾尔玛和哈维飓风是唯一满足这两项要求的事件。这一限制使我们的研究专注于由NOAA报告记录的基于美国的灾害,这些报告提供了结构化的、特定事件的因果机制证据。在去除重复的帖子ID后,整理后的数据集包含9,824条艾尔玛飓风帖子和10,662条哈维飓风帖子。

图1:将影响链与特定灾害的事后报告进行匹配,以记录真实因果关系。

## 4 因果关系抽取

### 4.1 LLMs与因果图生成

我们沿着两个维度比较LLMs:(1) 对社交媒体数据的访问权限;(2) 模型的开放性,区分闭源和开源权重系统。这种设计允许我们检查平台特定的上下文知识和模型规模是否影响因果关系抽取。

- • **Grok4.3:** xAI的闭源LLM,具有推理能力和原生社交媒体访问权限,可用于历史和实时灾害相关帖子。
- • **GPT-5.5:** OpenAI的闭源LLM,具有推理和长上下文能力,但没有原生社交媒体访问权限。
- • **Mistral-7B:** Mistral AI的开源权重LLM,代表较小的、资源受限的模型,上下文窗口有限。

由于如Mistral-7B等较小模型的上下文窗口有限,我们以每批20条帖子进行处理,而不是作为单个输入。这种方法遵循长上下文LLM处理的分块策略,其中较小的片段独立分析,然后合并。对于每批,模型提取有向因果对,然后在批次间聚合并合并重复边 Ratner et al. (2023) (https://arxiv.org/html/2605.11348#bib.bib18)。在实践中,批处理还有助于减轻在处理长上下文提示时可能出现的“迷失在中间”效应 Friedman et al. (2022) (https://arxiv.org/html/2605.11348#bib.bib19)。

### 4.2 提示模板标准化

提示设计遵循基于指令的信息提取中的既定实践,通过指定任务、约束输出模式并将提取 grounded 在特定事件的上下文中。在本研究中,因果关系的范围仅限于每种灾害事件类型的影响链框架中定义的目标变量。每个模型接收三个输入:灾害事件类型、来自影响链框架的标准目标变量列表以及一批帖子。提示指导模型识别帖子中的因果提及,将它们映射到提供的变量,并输出有向因果对。

**提示模板:因果图生成**
**任务:** 从与\[灾害事件\]相关的社交媒体帖子中识别因果和效应关系。
**指令:**
• 如果可用,对与\[灾害事件\]相关的帖子进行原生社交媒体搜索;否则,仅依赖提供的帖子。
• 将所有原因和效应限制在这些变量中:\[灾害类型的变量\]。
• 提取帖子中明确陈述或合理暗示的因果关系。
• 以(Cause, Effect)格式表示每个因果关系作为有向边。
**输入:** \[一批社交媒体帖子\]。
**输出:** 因果关系列表。

### 4.3 评估指标

为了与因果发现的标准实践保持一致,我们使用 Saklad et al. (https://arxiv.org/html/2605.11348#bib.bib15) 采用的比较指标来评估生成的因果图。这些指标包括节点和边的精确率和召回率、F1分数、结构汉明距离(SHD)以及归一化SHD(nSHD)。由于篇幅限制,详细定义在附录B (https://arxiv.org/html/2605.11348#A2) 中提供。

在解释这些指标时,重要的是要注意我们的设置与 Saklad et al. (https://arxiv.org/html/2605.11348#bib.bib15) 不同。在他们的设置中,LLMs从长文本中生成变量和边,需要外部评判者(例如另一个LLM)来解决生成变量和参考变量之间的语义不匹配。相比之下,我们的评估提供了基于影响链框架的固定标准变量集。我们的任务仅限于识别要包含的相关变量,并提取它们之间是否存在因果关系。

表1:LLMs在10次运行中从灾害相关帖子中抽取因果关系的表现。粗体表示基于配对t检验(p<0.05)Grok4.3和GPT-5.5之间性能显著更好。
表2:使用非信息性帖子在10次运行中对LLMs先验知识依赖性的受控评估。N/A表示由于非信息性帖子中证据不足,模型拒绝生成因果图。

## 5 结果与分析

### 5.1 从相关灾害帖子中抽取

为了确认LLMs从社交媒体帖子中提取有意义的因果关系而不是依赖随机猜测,我们将它们的性能与随机基线进行了比较。该随机模型使用 Erdős–Rényi 模型 Erd6s and Rényi (1960) (https://arxiv.org/html/2605.11348#bib.bib82) 在提示中提供的固定标准变量集上生成因果图,以0.5的概率连接对。如表2 (https://arxiv.org/html/2605.11348#S4.T2) 所示,所有评估的LLMs在两个灾害事件中都大幅优于随机基线。这些发现表明,模型受益于理解社交媒体帖子以推断特定灾害的因果关系。

在LLMs中,Grok4.3显示出最高的F1分数(艾尔玛为0.75,哈维为0.71),主要由较高的边召回率驱动,同时保持较强的节点精确率。这种优越的性能源于

相似文章

大型语言模型能否革新调查研究?以灾害防备响应的实验为例

arXiv cs.AI

本文提出一个五阶段框架,将大型语言模型整合到调查研究中,以应对回复率下降、样本偏差和欺诈性完成等问题。基于2024年米尔顿飓风调查数据,作者提出了一种理论知情的LLM(A-TLM),在缺失数据场景中优于经典插补方法,并通过基于事实的拒答机制展示了可控的幻觉风险。

医学因果假设验证与大语言模型

arXiv cs.CL

本文介绍了一项初步研究,评估大语言模型在验证医学因果假设方面的准确性,发现尽管它们表现出较高的召回率,但往往无法提供有效的科学证据或拒绝无支持的声明。