模式约束的文档级事件论元提取与轻量级LLM微调

arXiv cs.CL 论文

摘要

本文提出了一种模式约束的文档级事件论元提取方法,使用经过LoRA微调的中型开源LLM,结合角色集注入和确定性解码,在MAVEN-ARG上取得了最先进的结果。

arXiv:2607.16808v1 公告类型:新 摘要:事件论元提取(EAE)通过识别论元跨度并为其分配模式定义的角色,将文档转换为结构化事件记录。文档级EAE面临挑战,因为触发词与论元之间存在长距离依赖、跨句子上下文以及严格的角色约束,这常常导致边界错误、角色不确定性以及与受限模式的不一致。 本文研究了中型开源LLM是否能够在MAVEN-ARG上可靠地执行模式约束的文档级EAE。我们的方法结合了:(i) 在提示中注入角色集以确保模式合规,(ii) 使用与推理时相同的纯JSON界面进行参数高效的监督微调(LoRA),以及(iii) 确定性解码和后处理,包括验证JSON、过滤无效角色、去重论元以及将跨度对齐到文档窗口。 在官方MAVEN-ARG评估器下,微调的中型开源模型在提及、实体共指和事件共指评估中均优于之前报告的GPT基线;我们最好的模型(Phi-4,14B)在事件共指层面达到了42.39\%的F1值。重现实验的代码已公开在https://github.com/dessertlab/EAE/。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:43

# 基于轻量级LLM微调的模式约束文档级事件论元提取
来源:https://arxiv.org/html/2607.16808  
11institutetext:University of Naples Federico II, Naples, Italy  
11email:roberto\.pietrantuono@unina\.it, p\.sattari@studenti\.unina\.it  
22institutetext:University of Salerno, Fisciano, Italy  
22email:antguerriero@unisa\.it  

###### 摘要

事件论元提取(Event Argument Extraction, EAE)将文档转换为结构化事件记录,通过识别论元片段并将其分配给模式定义的角色。文档级EAE因触发词与论元之间的长距离依赖、跨句子上下文以及严格的角色约束而具有挑战性,这常常导致边界错误、角色不确定性以及与受限模式的不一致性。在本文中,我们研究中等规模的开源大语言模型(LLMs)是否能在MAVEN-ARG上可靠地执行模式约束的文档级EAE。我们的方法结合了:(i)在提示中注入角色集以实现模式合规,(ii)使用推理时相同的仅JSON接口进行参数高效的监督微调(LoRA),以及(iii)确定性解码与后处理,包括验证JSON、过滤无效角色、去重论元以及将片段对齐到文档窗口。在官方MAVEN-ARG评估器下,微调的中等规模开源模型在提及、实体共指和事件共指评估上均优于先前报告的GPT基线;我们的最佳模型(Phi-4,14B)在事件共指级别达到42.39%的F1值。重现实验的代码已公开在https://github.com/dessertlab/EAE/。

## 1 引言

事件论元提取(Event Argument Extraction, EAE)在事件检测的基础上更进一步,不仅识别触发词和事件类型,还通过识别**论元片段**并将其分配给模式定义的角色,来还原谁对谁做了什么、何时、何地及如何发生。EAE是将非结构化文档转换为结构化事件记录的关键步骤,用于下游应用如时间线构建、分析和信息检索。图1(https://arxiv.org/html/2607.16808#S1.F1)提供了文档级事件理解的高层级视角。该句子包含两种**事件类型**(*Military Operation* 和 *Loss*),每种类型由文本中的一个**触发词**锚定(例如,*invasion* 对应 *Military Operation*,*lost* 对应 *Loss*)。对于每个事件,EAE的目标是从文档中提取一个**论元**片段,并将其分配给事件模式中的**论元角色**(例如,*Agent*、*Patient*、*Location*、*Content*),如虚线链接所示。该图还展示了事件类型之间的跨事件关系(例如,BEFORE 和 CAUSE),从而体现了文档级上下文的重要性。在本工作中,我们聚焦于模式约束的EAE:给定一个文档、一个事件类型和一个标记的触发词,我们预测角色到论元片段的映射,输出符合角色模式的合法JSON,并可由官方评分器评估。

EAE的先前工作从基于规则的系统 [bui-etal-2013-fast] 发展到传统机器学习方法 [Kalimoldayev2023MAPPINGTS, valenzuela-escarcega-etal-2015-domain] 和深度学习模型——如CNN、RNN、Transformer架构——以更好地捕捉上下文和语义关系 [Li2021ACS]。最近,大语言模型(LLMs)通过提示学习和少样本学习被探索用于事件提取,提供了跨领域和语言的灵活性 [Rollo2024LeveragingLF]。然而,文档级EAE仍然具有挑战性,因为正确输出必须同时满足两个约束。首先,预测必须遵循**严格角色模式**:对于给定事件类型,只有固定的角色集是有效的,模型必须避免产生额外的键或不匹配的角色。其次,提取的论元必须是**片段忠实**的:论元字符串必须对应于文档的子字符串,即使支持证据分布在多个句子中或远离触发词。这些约束放大了常见错误,例如边界不匹配、长尾角色集中的角色混淆,以及无效或不一致的结构化输出,尤其是在LLM生成偏离为自由文本时。

在本工作中,我们研究**中等规模的开源LLMs** 是否能在MAVEN-ARG(一个具有大规模本体和共指感知评估的基准)上可靠地执行**模式约束的文档级EAE**。我们解决的一个核心问题是:当使用严格的模式条件化接口进行适配时,轻量级LLM能否在官方MAVEN-ARG评估协议下达到有竞争力的文档级EAE性能?我们的目标不是提出新的模型架构,而是提供一个**可复现的端到端流水线**,以生成官方评估器所需的精确格式的结构化输出。因此,贡献是经验性和系统导向的,因为它在一个模式条件化接口和官方评分器下,对中等规模的开源LLMs进行了受控的单GPU比较,而不是提出新的建模范式。该流水线使用仅JSON的指令格式,将每个事件类型的有效角色集注入提示以约束输出,应用参数高效的监督微调来适配开源模型到该任务,并在评估前执行确定性验证以确保模式一致性和片段忠实性。

我们将贡献总结如下:

![图1:EAE问题示例 [wang-etal-2024-maven]](https://arxiv.org/html/2607.16808#S1.F1)

- **端到端模式约束的EAE流水线**。我们在官方MAVEN-ARG JSON输出格式和评估器要求下,将文档级EAE形式化为每个触发词的角色到片段的生成任务。
- **开源LLMs的受控比较**。我们在一致的仅JSON提示接口、确定性解码以及相同的评估和归一化下,对多个中等规模的开源LLM家族进行了基准测试。
- **实际的模式合规性和输出有效性**。我们使用角色集注入和确定性输出验证(JSON提取、模式过滤、去重和片段对齐)来确保预测满足严格的提交约束。
- **官方评分下的经验性提升**。在官方MAVEN-ARG评估器下,微调的开源模型在提及、实体共指和事件共指级别评估上均优于先前报道的少样本闭源模型基线。所有重现实验的代码、提示和处理后的数据已公开在https://github.com/dessertlab/EAE/。

## 2 相关工作

### 2.1 大语言模型与事件提取

#### 2.1.1 使用LLM的最新进展

近期工作突出了事件提取中的几个挑战,包括标注数据的高成本以及为狭窄任务形式化设计的模型可移植性有限。事件挖掘旨在理解文本中发生了什么,并对事件相关信息进行分类 [Meng2024CEANCE],但历史上需要大量有监督标注才能达到强性能。最近,大语言模型(如GPT风格模型、LLaMA和Phi)被应用于事件提取,通过提示学习和指令遵循,实现了更灵活的提取,并在某些情况下改善了跨事件类型和领域的迁移 [Yang2024PromptbasedCE]。总体而言,这一趋势反映了从高度特定任务的架构(例如,基于BERT的分类器或BiLSTM流水线)向更通用的LLM的转变,这些LLM可以用更少的定制建模来适应不同的提取设置 [Meng2024CEANCE]。然而,一个关键困难是,良好的性能仍然依赖于仔细控制模型行为,并弥合开放生成与事件提取精确要求(例如,严格模式和片段忠实输出)之间的差距。此外,结果可能仍然对任务设计选择敏感,例如提示格式、上下文选择和输出约束 [sivarajkumar2023empiricalevaluationpromptingstrategies]。

#### 2.1.2 事件提取方法

基于LLM的事件提取已经通过几种越来越常见的方法进行了研究,包括提示工程、少样本学习、零样本学习和检索增强生成。提示工程侧重于设计指令和模板,引导模型在零样本和少样本设置中做出正确的结构化预测,通常只需最少的额外训练 [sivarajkumar2023empiricalevaluationpromptingstrategies]。少样本学习使用少量标注示例,在数据稀疏时有用,其中示范选择和模板设计起着重要作用。零样本学习更进一步,旨在没有标注示例的情况下识别事件类型和角色,通常通过将上下文与标签描述或外部知识对齐;它对于跨语言设置也有用,其中语言无关的提示可以支持角色和论元识别 [yue-etal-2023-zero, zhang2022efficientzeroshoteventextraction]。检索增强生成可以通过在推理时检索相关示例或辅助上下文进一步提高鲁棒性,当检索到的信息与目标模式和格式要求良好对齐时,可以提高准确性。在这些方法中,一个持续的挑战是改进往往依赖于提示设计、提供给模型的上下文,以及模型的生成行为是否与提取模板和模式约束对齐 [sivarajkumar2023empiricalevaluationpromptingstrategies]。此外,跨LLM家族(例如,GPT风格模型、Gemini和LLaMA-2)的比较可能因提示、上下文长度限制和解码设置而混淆,因此如果没有受控协议,跨模型结果应谨慎解释 [geminiteam2025geminifamilyhighlycapable, touvron2023llama2openfoundation]。

##### 我们的方法

尽管先前的工作探索了提示、少/零样本学习和增强用于事件提取,但当输出必须满足严格的JSON接口并由官方MAVEN-ARG评估器评分时,开源LLM在**文档级、模式约束**的EAE上表现如何仍不清楚。现有结果通常在不同的提示、上下文窗口和解码设置下报道,使得比较困难。相比之下,我们提供了一个统一的流水线——角色集条件化提示、参数高效的监督微调、确定性解码和模式感知输出验证——并在一致的协议下对多个**中等规模开源**LLM进行了基准测试。我们最佳微调的开源模型(Phi-4,14B)达到了42.39的事件共指F1,在官方MAVEN-ARG评估器下,显著优于最强报道的GPT基线(GPT-4)的事件共指F1,高出+12.89个绝对点。这表明轻量级开源模型可以超越少样本GPT提示,同时能够在单个GPU上以4位基础权重进行低成本本地推理。

### 2.2 数据集与基准

#### 2.2.1 事件提取的关键数据集

ACE 2005 [walker2006ace2005multilingual] 是最广泛使用的事件提取数据集之一,包含英语、阿拉伯语和中文文档,带有标注的事件类型、子类型和论元角色。它已被广泛用于触发词识别和论元分类,并经常作为事件提取研究中的参考点 [liu2021overvieweventextractionapplications, deng-etal-2022-title2event]。DEIE 是一个大型文档级数据集,包括触发词、论元、摘要和关系,支持更广泛的文档级事件信息提取 [ren-etal-2024-deie]。Title2Event 专注于从新闻标题大规模提取事件 [deng-etal-2022-title2event]。在本工作中,MAVEN-ARG 是我们的主要基准。它提供了一个包含许多事件类型和论元角色的大型模式,并包括专家编写的定义以及支持论元和共指感知评估的标注 [wang-etal-2024-maven]。该数据集和官方评估工具包由 MAVEN-ARG 基准作者公开发布,并可通过官方仓库获取¹¹¹https://github.com/THU-KEG/MAVEN-Argument。由于 MAVEN-ARG 评估要求严格的结构化输出和共指感知聚合,它为研究基于LLM的EAE中的模式合规性和输出有效性提供了一个严格的测试床。MAVEN-ARG 上的先前结果表明,更强的闭源LLM(例如 GPT-4)可以在提及、实体共指和事件共指评估级别上,在官方评分器下优于较弱的闭源基线(例如 GPT-3.5) [wang-etal-2024-maven]。这些特性使得 MAVEN-ARG 成为在严格模式和评估约束下进行文档级论元提取的一个具有挑战性的基准。ACE 2005 上的基准结果也常用于比较。例如,ChatGPT 已被评估用于对话导向的事件提取以及数据生成/增强,报告了改进,包括更好的长尾事件类型覆盖 [kan-etal-2024-emancipating]。然而,ACE 2005 包含更多以实体为中心的论元和比 MAVEN-ARG 更有限的本体;因此,它对于研究具有共指感知评估的文档级论元提取不够全面 [kan-etal-2024-emancipating]。

## 3 方法

本文评估了LLM在**严格模式**和**结构化输出**约束下进行**文档级**事件论元提取的能力。我们遵循 MAVEN-ARG 设置,其中每个实例提供一个文档、一个目标事件类型和一个特定的触发词提及。给定这些输入,系统必须从文档中提取论元片段,并将每个片段分配给目标事件类型的有效角色。我们的方法基于在基于LLM的EAE中观察到的两个反复出现的失败模式。第一个是**模式不一致**:模型可能幻觉出给定事件类型无效的角色,或引入不属于允许角色集的额外键。这种行为降低了准确性,也可能破坏官方评估器预期的严格接口。为了解决这个问题,我们在每个提示中明确注入事件特定的角色集,并在后处理期间应用模式过滤以移除任何超出模式的键。第二个失败模式是**不可靠的结构化输出和片段忠实性**。模型生成可能包含无效JSON、不一致结构、重复值或与文档文本不完全匹配的论元字符串。这在文档级EAE中尤为有害,因为系统必须对长文档中的许多触发词产生一致的结构化预测。为缓解这些问题,我们使用严格的仅JSON指令格式、确定性解码以及一个后处理流水线,该流水线验证JSON、标准化特殊情况(例如,"NA")、移除重复项,并强制与评估所需的模式约束对齐。

总的来说,我们的方法实现为一个包含五个阶段的统一流水线:任务形式化、角色集条件化、监督微调、确定性推理和模式感知后处理。下面我们描述每个阶段。图2(https://arxiv.org/html/2607.16808#S3.F2)总结了从 MAVEN-ARG 输入到提交就绪预测的端到端流水线。

训练/验证 MAVEN-ARG → 任务形式化 + 角色集条件化 → LoRA SFT + 保存适配器 (unsloth) → 训练

测试实例 (文档, 事件类型, 触发词) + 角色集注入提示 → 确定性推理 (贪心, EOS停止) → 模式感知后处理 (解析/过滤/去重) → 提交

相似文章

面向多模态核监管文件多跳推理的LLM引导规划

arXiv cs.AI

本文将监管文件审查问题建模为LLM引导的规划问题,采用无向量文档树,配备浏览、读取和搜索工具,并以动态知识图谱作为状态。在针对NuScale FSAR文档的200个问题基准测试中,该系统达到了81.5%的准确率和0.93的RAGAS忠实度,显著优于现有RAG方法。

用于模式约束临床信息抽取的检索增强型大语言模型

arXiv cs.CL

本文提出了一种模块化的检索增强生成(RAG)流水线,用于从护理人员与患者的对话转录中提取结构化临床观察结果,采用模式约束提示和第二遍审核,基于Llama和GPT骨干模型,取得了80.36%的F1分数。