超越大语言模型:从叙事文本生成因果图的语言学方法

arXiv cs.CL 论文

摘要

本文提出了一种混合框架,结合了LLM摘要、语言学基础的专家指数(Expert Index)以及STAC分类,用于从叙事文本生成因果图,在基准故事上超越了GPT-4o和Claude 3.5。

arXiv:2504.07459v2 公告类型:替换 摘要:我们提出了一种新颖的框架,用于从叙事文本生成因果图,桥接了高层因果关系与详细的事件具体关系。我们的方法首先利用大语言模型(LLM)摘要提取简洁、以主体为中心的顶点。我们引入了一个“专家指数”(Expert Index),包含七个基于语言学的特征,并将其集成到情境-任务-行动-后果(STAC)分类模型中。该系统结合了RoBERTa嵌入和专家指数,在因果链接识别上比纯LLM方法实现了更高的精确度。最后,一个结构化的五轮提示过程精炼并构建了连通的因果图。在100个叙事章节和短篇小说上的实验表明,我们的方法在因果图质量上始终优于GPT-4o和Claude 3.5,同时保持了可读性。该开源工具提供了一种可解释、高效的解决方案,用于捕捉叙事中微妙的因果链。
查看原文
查看缓存全文

缓存时间: 2026/07/13 08:00

# 超越大语言模型:一种从叙事文本生成因果图的语言学方法
来源:https://arxiv.org/html/2504.07459
###### 摘要

我们提出了一种新颖的框架,用于从叙事文本生成因果图,弥合高层级因果关系与更细粒度的事件特定关系之间的鸿沟。我们的方法首先使用基于大语言模型的摘要策略,提取简洁、以施动者为中心的“顶点”。然后,我们引入一个**专家索引**——包含七项基于语言学的特征——并将其整合到一个**STAC(情境、任务、行动、后果)** 分类模型中。与仅依赖大语言模型的基线方法相比,这种混合系统(RoBERTa 嵌入 + 专家索引)在识别因果链接方面实现了更高的精确度。最后,我们采用一个结构化的五轮提示过程来优化并构建一个连通的因果图。实验结果表明,在 100 个章节和短篇故事的测试中,我们的方法在因果图质量的多个关键维度上始终优于 GPT-4o 和 Claude 3.5,同时保持了可比的文本可读性。由此产生的开源工具为捕捉叙事文本中细微的因果链提供了一种可解释且高效的解决方案。

超越大语言模型:一种从叙事文本生成因果图的语言学方法

Zehan Li Ruhua Pan Xinyu Pi
加州大学圣地亚哥分校
\{zel025, r3pan, xpi\}@ucsd.edu

## 1 引言

因果关系研究历来利用知识图谱来探索事件之间的关系 [JM; (1999)](https://arxiv.org/html/2504.07459#bib.bib17)。现代方法,例如由人工智能驱动的因果图生成,因其能够大规模总结因果事件而备受关注 [Jaimini and Sheth (2022)](https://arxiv.org/html/2504.07459#bib.bib2); [Pieper et al. (2023)](https://arxiv.org/html/2504.07459#bib.bib6)。然而,当前的人工智能模型主要关注高层级因果关系(例如,“HIV 导致艾滋病”),但在捕捉特定叙事(如政治事件或历史事件)中的细微因果联系方面存在不足 [(Donnelly, 2025)](https://arxiv.org/html/2504.07459#bib.bib32)。为弥补这一差距,我们提出了一种从描述离散、特定事件叙事的文本中生成因果图的方法。

理解这些更细粒度的因果关系,对于分析特定事件如何在诸如社会运动、政策制定和历史趋势等领域导致可感知结果的研究人员和实践者至关重要。通过从叙事文本中捕捉因果链接,利益相关者可以更准确地追溯引发重大变化的事件链,从而实现更优决策、更深层的历史洞见以及更有针对性的干预。此外,自动化因果图生成有助于对大量文档集合进行可扩展分析,提供易于解释、查询和扩展的结构化表示。

大多数现有的因果图生成方法遵循一个两阶段流水线:(1) 一个**因果发现器**用于检测因果关系,(2) 一个**图生成器**用于从这些关系中构建知识图谱。尽管这些方法有效,但在处理复杂句子结构或隐式因果链接时,在可解释性和准确性方面存在局限性 [Kyono et al., 2024](https://arxiv.org/html/2504.07459#bib.bib34)。

因果发现器经历了三个发展阶段:(1) 早期基于模式的方法,从固定句子结构中学习因果关系 [Hidey and McKeown, 2016](https://arxiv.org/html/2504.07459#bib.bib4); [Heindorf et al., 2020](https://arxiv.org/html/2504.07459#bib.bib5); (2) 基于 BERT 的方法,解决了文本训练中的问题,但未能考虑语义上下文 [Tan et al., 2023](https://arxiv.org/html/2504.07459#bib.bib24); [Dasgupta et al., 2018](https://arxiv.org/html/2504.07459#bib.bib26); [Li et al., 2020](https://arxiv.org/html/2504.07459#bib.bib28); (3) 大语言模型,改进了上下文推理,但在区分复杂的因果关系方面仍有困难 [Kıcıman et al., 2024](https://arxiv.org/html/2504.07459#bib.bib7); [Shen et al., 2022](https://arxiv.org/html/2504.07459#bib.bib29); [Luo et al., 2024](https://arxiv.org/html/2504.07459#bib.bib31)。

在本文中,我们提出了一个新颖的框架,利用语言学特征提取来增强从叙事文本生成因果图。我们的方法引入了一个**四类分类**系统,将句子分为四个组成部分:(1) **情境**,(2) **任务**,(3) **行动**,和 (4) **后果**。这种结构化的分解使得因果链接的识别更加精确。我们还提出了一个基于这些语言学特征训练的神经网络模型,与基于大语言模型的方法相比,在降低计算成本的同时,实现了更高的准确性和可解释性。

我们专家索引的前三个维度——**通用性**、**事件性**和**有界性**——建立在 Hemmatian et al. (2021) [bib.bib66](https://arxiv.org/html/2504.07459#bib.bib66) 引入并由 Hemmatian Borujeni (2022) [bib.bib67](https://arxiv.org/html/2504.07459#bib.bib67) 详细阐述的从句级话语框架和标注语料库之上。在本文中,我们将这些维度适配到叙事因果图的生成,并将它们与另外四个特征以及 STAC 分类流水线相结合。

我们的贡献有两方面:(1) 我们开发了一个开源、端到端的因果图生成模型,显著提高了可解释性和准确性。(2) 我们引入了一个**语言学特征系统**,该系统能高效地对句子进行分类以构建因果图,并在各种叙事文本上通过实验得到了验证。

参见图注 图 1:我们的 DA 框架概览。这是一个端到端的模型。首先,我们输入一个随机叙事文本。然后,在第一阶段,我们贡献图的顶点。在第二阶段,我们使用我们的专家索引来指示顶点。接下来,在第三阶段,我们使用一个 STAC 系统来标记顶点。在第四阶段,我们使用 STAC 标签 + 顶点来完成因果图。

## 2 问题设定

本文研究如下的因果关系图问题。给定一个叙事文本,例如欧·亨利的一篇故事或一篇叙事新闻,我们可以生成包含主要因果关系及其关系的因果图。更具体地说,当我们输入一组叙事句子 S = {s₁, s₂, ..., sₙ} 时,我们的目标是获得一个连通图 G = (V, E) 来表示故事的结构,其中:

- V 是顶点集合,每个顶点代表故事中的一个主要事件。
- E 是边集合,其中每条边 (u, v) ∈ E 表示从事件 u 到事件 v 的时间或因果关系。

对于边 E 的定义,我们说事件 A 导致事件 B,如果:
- (多因素定义):结合其他因素,事件 A 是事件 B 的必要条件或充分条件 [Oppenheimer and Susser, 2007](https://arxiv.org/html/2504.07459#bib.bib21)。
- (概率定义):事件 A 的发生提高了事件 B 发生的概率 [Reichenbach, 1991](https://arxiv.org/html/2504.07459#bib.bib22)。

## 3 方法论

我们完整的因果图模型是一个端到端的模型。我们希望输入任何故事,并生成一个连通图 G。该模型包含四个主要部分:(1) 顶点提取,(2) 专家索引提取,(3) STAC 分类,(4) 图构建。

### 3.1 顶点提取

我们将因果图中的每个顶点定义为一个单独的事件或状态,表示为:
V = {v₁, v₂, ..., vₙ | vᵢ = 一个单独的事件/状态}。
这些顶点作为顶点,捕捉叙事中具有因果关系的关键信息。我们的目标是利用大语言模型和提示工程,将原始文本转化为简洁、事件特定的句子。具体来说,我们使用 LangChain 框架来引导大语言模型生成反映核心情节元素的简单句子。

#### 每个顶点的要求

1. **简洁**:每个句子最多包含两个从句。
2. **以施动者为中心**:必须明确识别动作的主体(或施动者),每个句子只能有一个主体。
3. **主动语态**:每个句子应清晰地传达由其主体发起的动作。

#### 提取步骤

我们应用了一个结构化的提示工作流,将文本简化为简短、自包含的句子,每个句子代表一个叙事事件:

1. **摘要**:大语言模型接收一个段落,生成一个简短摘要,确保每个结果句子尽可能简单。
2. **代词替换**:所有代词都被替换为明确的指代对象。对于第一人称叙事,说话者被替换为一个清晰的标识符,例如说话者的名字,如果未提供则替换为“主角”。
3. **从句简化**:复杂句或复合句被拆分为多个简单句,每个句子包含一个核心动作或状态。去除不影响情节的不重要细节。
4. **连续流动**:检查生成的句子,确保它们保留了逻辑、因果的事件流,丢弃无关或偏离主题的信息。

通过强制执行这些要求并遵循此工作流,我们得到了一组简洁、以施动者为中心的句子——每个句子都成为我们因果图中的一个顶点。这种方法保留了基本的叙事结构,同时确保每个顶点仅封装一个事件或状态。

### 3.2 专家索引提取

本节描述我们从每个句子中提取**专家索引**特征,并随后训练模型对其进行分类的方法。前三个特征——**通用性**、**事件性**和**有界性**——改编自 Hemmatian et al. (2021) [bib.bib66](https://arxiv.org/html/2504.07459#bib.bib66) 和 Hemmatian Borujeni (2022) [bib.bib67](https://arxiv.org/html/2504.07459#bib.bib67) 描述的通用性/事件性/有界性-习惯性框架;其余四个特征是为了叙事因果图情境而加入的。我们采用了七项基于传统和计算语言学文献的关键特征;完整描述见表 3 (https://arxiv.org/html/2504.07459#A1.T3):

1. **通用性**:判断句子的主语是**特定**(例如,一个人,一只狗)还是**通用**(例如,一个季节,一种情感)[Becker et al., 2017](https://arxiv.org/html/2504.07459#bib.bib8); [Carlson, 1980](https://arxiv.org/html/2504.07459#bib.bib9)。
2. **事件性**:将动词分为**动态**(可观察的动作,如说话或跑步)或**静态**(表达状态或非动作,如决定或思考)[Becker et al., 2017](https://arxiv.org/html/2504.07459#bib.bib8); [Vendler, 1967](https://arxiv.org/html/2504.07459#bib.bib10)。
3. **有界性**:识别事件是**偶发**(发生在特定时间)、**习惯**(随时间重复)还是**静态**(始终为真或处于存在状态)[Becker et al., 2017](https://arxiv.org/html/2504.07459#bib.bib8); [Smith, 1991](https://arxiv.org/html/2504.07459#bib.bib11)。
4. **主动性**:区分主语是**发起**动作(有施动性)还是**接收**动作(无施动性)[Dai and Huang, 2018](https://arxiv.org/html/2504.07459#bib.bib13); [Comrie, 1976](https://arxiv.org/html/2504.07459#bib.bib12)。
5. **开始时间**:指出事件相对于叙事时间线是从**过去**还是**现在**开始 [Dowty, 1979](https://arxiv.org/html/2504.07459#bib.bib14); [Allen, 1983](https://arxiv.org/html/2504.07459#bib.bib15)。
6. **结束时间**:判断事件是在**现在**还是**未来**结束 [Dowty, 1979](https://arxiv.org/html/2504.07459#bib.bib14); [Allen, 1983](https://arxiv.org/html/2504.07459#bib.bib15)。
7. **影响**:指示事件的效果是持续存在(有影响)还是在事件结束时完全**解决**[Dowty, 1979](https://arxiv.org/html/2504.07459#bib.bib14); [Moens and Steedman, 1988](https://arxiv.org/html/2504.07459#bib.bib16)。

除**有界性**有三个类别外,每个特征都有两个类别,总共 192 种可能的组合。我们将每种结果组合称为一个**专家索引**。受先前将句子分类为偶发、习惯或静态的工作启发,我们采用了更细粒度的方法,以更好地捕捉与我们四个主要叙事标签(**情境**、**任务**、**行动**和**后果**)相关的区别。

为了训练这些特征的模型,我们使用 RoBERTa,一种经过稳健优化的 BERT 变体 [Liu et al., 2019](https://arxiv.org/html/2504.07459#bib.bib65)。我们准备了一个包含 750 个从 23 篇短篇故事和小说章节中标注的句子的数据集,确保时态和叙事类型的平衡覆盖。人工评估作为真实值。模型分别针对七个特征及其各自类别进行训练,从而能够透明地预测每个句子的**专家索引**。

### 3.3 STAC 分类

我们开发了 STAC 模型,将叙事句子分为四个类别——**情境**、**任务**、**行动**和**后果**——该模型借鉴了商业管理中的结构化思维。在实践中,我们观察到叙事事件通常遵循一个逻辑流程:环境的变化(情境)引发一个需求(任务),导致一项活动(行动),进而产生一个持久的结果(后果)[Minto, 2009](https://arxiv.org/html/2504.07459#bib.bib63)。具体来说:

1. **情境**:提供背景上下文或为未来事件奠定基础。
2. **任务**:陈述必须满足的明确需求或责任。
3. **行动**:指示主动执行或刚刚完成的活动。
4. **后果**:描述先前事件改变状态的结果。

为了自动分配这四个 STAC 标签,我们训练了一个模型,同时使用 RoBERTa 嵌入和**专家索引**特征作为输入。它们的关系如下:A.6 (https://arxiv.org/html/2504.07459#A1.SS6)。具体来说,我们从 RoBERTa 的默认自动分词器中提取每个句子的嵌入(一个 768 长度的数组),以捕捉语义和上下文含义。然后,我们对**专家索引**类别(非顺序属性)进行独热编码以获得二进制向量。通过连接这些嵌入和编码特征,我们形成了一个全面的输入数组。

对于分类,我们使用 **XGBoost**,因为它相对于传统模型具有高效和稳健的性能。该模型使用人工标注的 STAC 类别和人工标注的**专家索引**特征作为真实值进行训练,并采用正则化技术来避免过拟合。训练完成后,该模型可以根据句子的分词化 RoBERTa 嵌入和**专家索引**属性预测其 STAC 类别。

### 3.4 图构建

在使用 STAC 模型(**情境**、**任务**、**行动**和**后果**)对所有顶点进行分类后,我们的目标是构建一个能捕捉叙事事件复杂性的因果图。最初,我们考虑了四个 STAC 类别之间的 16 种可能连接(即关系);然而,在实际叙事语境中,只有 11 种连接是有意义的。此外,我们观察到现实世界的事件常常表现出诸如**行动 → 行动**或**情境 → 情境**这样的关系,强调了叙事的非线性本质。

为了系统地确定顶点之间的边,我们采用了一个基于 LangChain 的五轮提示过程。该方法分阶段细化因果关系,确保每条边都相关、逻辑一致且受到叙事支持。

#### 第 1 轮:STAC 连接学习

我们首先提示大语言模型...

相似文章

基于反事实链和因果图的LLM可解释性

Hugging Face Daily Papers

本文提出了一种四阶段方法,用于构建建模LLM推理过程的因果图,利用反事实增强实现稳定的因果发现,并提供透明、概念级的可解释性。

使用大语言模型自动标注汉语叙事转录文本

arXiv cs.CL

本文评估了使用大语言模型自动标注汉语口语叙事宏观结构的效果,发现最佳模型在降低65%标注时间的同时,达到了接近人类水平的可靠性,但在语义复杂或词汇多样的叙事文本上性能有所下降。

BIASEDTALES-ML:用于分析大语言模型生成故事中叙事属性分布的多语言数据集

arXiv cs.CL

# BIASEDTALES-ML:用于分析大语言模型生成故事中叙事属性分布的多语言数据集 来源:[https://arxiv.org/html/2604.17008](https://arxiv.org/html/2604.17008) Yuxuan Ouyang1,Yingfeng Luo1,Tong Xiao1,2,Jingbo Zhu1,2 1中国沈阳东北大学计算机科学与工程学院 2中国沈阳 NiuTrans Research [email protected] {xiaotong,zhujingbo}@mail.neu.edu.cn ###### 摘要 大型语言模型(LLM)正日益被广泛用