基于细粒度分类法从SEC 8-K文件中进行可溯事件抽取

arXiv cs.CL 论文

摘要

本文提出一个基于大语言模型(LLM)的两阶段系统,利用包含119种事件类型的三层分类法,从SEC 8-K文件中提取可溯事件标签,并具备约束与可审计机制。该系统在近30万份文件上进行了评估,在高质标签上展现出高精确度,并支持区分经济意义上不同事件的事件研究。

arXiv:2607.08346v1 公告类型:新提交 摘要:8-K表格是美国上市公司披露重大事件的主要渠道,但附带的SEC项目代码较为粗糙:单个项目涵盖常规行政变更和首席执行官离职,而许多对市场影响最大的披露则归属于一个综合项目。大语言模型使得在语料库规模上进行细粒度标注成为可能,但前提是标签能够追溯到源文本并证明其可靠性。我们提出一个两阶段系统,针对包含119种事件类型的三层分类法对8-K披露进行标注。第一阶段将输出限制为有效的分类法条目,并通过模糊n-gram验证将每个标签锚定到逐字引用;第二阶段根据类别定义对每个引用进行重新评分,生成质量分数。将该系统应用于2022年至2026年的292,984份文件,产生了601,088个可溯事件标签,我们予以发布。在5,125个分层标签上,LLM评判结果显示精确度随质量分数单调上升,从12%到96%,而无支持的标签从8%降至接近零。消融实验表明,只有在专用的第二遍中分配分数时,分数才具有校准性。一项基于无符号异常收益的事件研究证实,无需任何语言模型,该分类法即可区分共享同一项目代码但经济意义上不同的事件。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:14

# 基于细粒度分类体系从SEC 8-K申报文件中进行有据可依的事件抽取
来源:https://arxiv.org/html/2607.08346
\(2018\)

###### 摘要

Form 8-K 申报文件是美国上市公司披露重大事件的主要渠道,但其所附的 SEC 项目代码较为粗略:单个项目既涵盖常规行政变动,又包括首席执行官离职,而且许多对市场影响最大的披露都归入一个包罗万象的项目中。大型语言模型使得在语料库规模上进行细粒度标注成为可能,但前提是这些标签能够追溯到源文本,并且被证明是可靠的。我们提出一个两阶段系统,该系统根据一个包含119种事件类型的三层分类体系对8-K披露进行标签标注。第一阶段将输出限制为有效的分类条目,并通过模糊n-gram验证将每个标签锚定到逐字引文上;第二阶段根据类别定义对每条引文进行重新评分,以产生一个质量分数。将该系统应用于2022年至2026年的292,984份申报文件,生成了601,088个有据可依的事件标签,我们已将其公开。在5,125个分层标签上,LLM评估器发现精确度随质量分数单调上升,从12%到96%,而无证据支持的标签则从8%降至接近零。消融实验表明,只有在专门的第二轮评分中分配该分数时,分数才是校准的。一项关于未调整异常收益的事件研究,未使用任何语言模型,证实了该分类体系能够区分共享同一项目代码但经济意义不同的事件。

SEC 申报文件,事件抽取,大型语言模型,事件研究,LLM作为评估器

††copyright:acmlicensed††journalyear:2018††doi:XXXXXXX.XXXXXXX††conference:请确保从您的权利确认邮件中输入正确的会议标题; June 03–05, 2018; Woodstock, NY††isbn:978-1-4503-XXXX-X/2018/06

## 1. 引言

美国上市公司必须在四个工作日内以Form 8-K报告重大公司事件。每份申报文件附带的32个SEC项目代码,例如涉及高管和董事变动的第5.02项或涉及重大协议的第1.01项,是标准的机器可读事件标签:它们决定了法律申报义务,组织了披露数据库,并在大量实证文献中作为事件类型控制变量(Lerman and Livnat,2010(https://arxiv.org/html/2607.08346#bib.bib1);He and Plumlee,2020(https://arxiv.org/html/2607.08346#bib.bib2))。这些代码被设计为法律申报类别,而非经济事件类型,因此在两个维度上显得粗略。首先,单个项目混淆了经济意义不同的事件:第5.02项既涵盖首席执行官离职,也包括单一外部董事的常规退休。其次,大量实质性披露并未附带信息性项目:第8.01项(“其他事件”)是一个自愿性的兜底项目,我们发现它是我许多最具价格相关性的事件类型(包括临床试验结果、兼并完成和监管决定)的模态位置。

大型语言模型使得在语料库规模上分配细粒度、经济动机明确的事件标签成为可能。为研究和应用目的这样做提出了两个通用提示无法满足的要求。标签必须是*受约束的*,以便输出映射到下游用户可依赖的固定词汇表,并且必须是*可审计的*,以便每个标签都能追溯到源文档中的特定表述,并能在不重新运行模型的情况下评估其可靠性。

本文介绍并评估了一个围绕这些要求构建的基于LLM的抽取系统。该系统在一个紧凑型指令调优语言模型的提示中放置了一个包含119种公司事件类型的三层分类体系,并分两个阶段对每份申报文件进行标签标注。第一阶段在输出层通过两个结构可靠性机制提取事件标签:模式验证拒绝分类体系之外的标签并触发自我纠正重试;模糊n-gram引文验证要求每个标签引用一个确凿存在于申报文件中的支持文本片段。第二阶段通过将每个标签的引用引文与其类别定义进行重新对比,为其分配一个从1到5的质量分数,这是一种明确的根据验证检查,提供了一个经过校准的可靠性量表。我们将该系统应用于2022年1月至2026年6月期间的292,984份Form 8-K申报文件,生成了601,088个经过验证的事件标签。

我们沿着两条互补的路线评估生成的标签。内在评估使用一个更强的语言模型作为评估器,对分布在所有119种事件类型和所有五个质量分数上的5,125个标签进行评判,其判断结果将正确的标签与应用于错误类别的标签以及所声称事件在申报文件中不存在的标签区分开来。质量分数对精确度具有很强的预测性:从最低分数的12%单调上升到最高分数的96%,而标签所声称事件在申报文件中不存在的比率从8%降至接近零。仅保留最高分数保留了34%的标签,精确度为96%;放宽到分数4及以上则保留55%的标签,精确度为93%。在一个专门的第二轮中分配分数(重新读取每个标签的引文),而不是在抽取过程中内联进行,是使其成为可用量表的关键:内联自评过于自信且接近一个二元标志,将四分之三的标签置于最高分数,而第二阶段重新评分则将相同的标签分布在整个范围内,并达到了内联评分无法实现的精确度。经济评估是一项针对182,174个清晰可归因的申报事件的事件研究,使用了未调整的、方差标准化的异常收益;它不声称具有收益预测能力。在单一项目代码5.02内,反应大小因标签而异:首席执行官离职在17%的情况下使价格变动超过两个标准差,而常规高管任命则为10%。在整个分类体系中,标签级别的平均反应跨度达三倍,反应最强烈的标签主要归入不具信息量的第8.01项,而将标签添加到项目代码中,将反应大小的解释方差提高了1.3个百分点,大约是向标签添加项目代码所带来增量(0.4个百分点)的三倍。这两个评估通过精确度联系起来:评估器标记为低精确度的标签获得低质量分数,因此根据分数进行过滤会移除这些标签,并使反应排名基本保持不变。

贡献有四个方面。首先,一个可验证的事件抽取方案,其可靠性不依赖于模型自身的判断:模式约束输出和逐字引文验证使单个标签可对照申报文件进行检查,而一个重新评估每段引用引文的专门第二轮则分配一个经过校准的质量分数。核心方法学发现是,这第二轮使得分数可用,因为内联自评会饱和并表现为二元标志,而重新评估相同的标签则会将其分布在整个范围内,并达到内联分数无法达到的精确度。其次,校准后的分数充当一个过滤量表:下游用户通过阈值化分数来权衡精确度与保留标签的比例,无需更改模型或对语料库进行进一步运行。第三,通过一项不使用语言模型的事件研究,我们证明了SEC项目代码在经济上是粗略的,并且细粒度分类标签携带了项目代码所缺乏的相关信息。第四,包含601,088个有据可依、带有质量分数的事件标签的完整语料库(覆盖292,984份申报文件)可供进一步研究使用。

## 2. 相关工作

我们的工作借鉴了三个研究方向:使用Form 8-K申报文件及其项目代码的实证文献、语言模型在金融文本中的应用,以及大规模评估语言模型输出。

### 2.1. 8-K申报文件和项目代码

2004年Form 8-K要求的扩展确立了项目代码作为重大公司事件标准分类体系的地位。Lerman and Livnat(Lerman and Livnat,2010(https://arxiv.org/html/2607.08346#bib.bib1))记录了在新要求和先前存在的项目申报文件周围出现的异常交易量和收益波动率,后续工作使用项目代码和项目数量作为披露度量(He and Plumlee,2020(https://arxiv.org/html/2607.08346#bib.bib2))。项目代码系统作为事件类型标签存在已知局限性:诸如2.02、7.01和8.01等自愿性项目混杂了异质内容(He and Plumlee,2020(https://arxiv.org/html/2607.08346#bib.bib2)),而单个强制性项目可能涵盖经济意义截然不同的事件。我们对该文献的贡献是对这种粗略性的直接测量:我们使用比项目系统更精细的标签量化了同一项目内市场反应的异质性,并展示了最具反应性的事件类型不成比例地集中在兜底项目第8.01项中。

### 2.2. 用于金融文本的语言模型

金融领域的文本分析从词典方法(Loughran and McDonald,2011(https://arxiv.org/html/2607.08346#bib.bib5),2016(https://arxiv.org/html/2607.08346#bib.bib6))发展到为金融情感微调的预训练编码器(Araci,2019(https://arxiv.org/html/2607.08346#bib.bib12)),再到针对金融领域训练或调整的大型生成模型(Wuet al.,2023(https://arxiv.org/html/2607.08346#bib.bib10))。来自新闻文本的公司事件检测已被作为具有固定事件词汇表的监督任务进行研究(Zhouet al.,2021(https://arxiv.org/html/2607.08346#bib.bib13)),大型申报文件语料库已发布用于语言模型训练(Loukaset al.,2021(https://arxiv.org/html/2607.08346#bib.bib21)),近期工作记录了通用语言模型从标题中提取经济意义信号的能力(Lopez-Lira and Tang,2023(https://arxiv.org/html/2607.08346#bib.bib11));带有专门验证层的增强型LLM流水线也被用于从金融新闻中提取结构化的公司级信号,如股票代码和情感(Dolphinet al.,2024(https://arxiv.org/html/2607.08346#bib.bib24))。与我们的设置最为接近的是,将分类体系对齐的抽取应用于10-K风险因素,通过将引文基于LLM的抽取与基于嵌入的到分类体系的映射以及LLM作为评估器的虚假分配过滤相结合(Dolphinet al.,2026(https://arxiv.org/html/2607.08346#bib.bib23))。相对于这一方向,我们的系统在比典型事件检测词汇表细一个数量级的三层分类体系下对离散公司事件进行标注,为每个抽取的标签附加结构有效性保证(模式约束(Willard and Louf,2023(https://arxiv.org/html/2607.08346#bib.bib14);Genget al.,2023(https://arxiv.org/html/2607.08346#bib.bib22))和逐字引文验证),而不是依赖模型未受约束的输出,并用一个通过专门根据验证通道分配的校准质量分数替换事后评估器过滤,我们通过事件研究在经济上验证了这一点。

### 2.3. 评估模型生成的标签

语言模型越来越多地被用作标注器(Gilardiet al.,2023(https://arxiv.org/html/2607.08346#bib.bib15)),尽管标注研究强调模型标签需要特定任务的验证(Pangakiset al.,2023(https://arxiv.org/html/2607.08346#bib.bib19)),并被用作其他模型输出的评估器(Zhenget al.,2023(https://arxiv.org/html/2607.08346#bib.bib7)),在这种情况下,对其自身生成物的自我偏好是一种有记录的偏见(Panicksseryet al.,2024(https://arxiv.org/html/2607.08346#bib.bib18))。两个已知的失败表面推动了我们的评估设计:生成模型会编造其输入不支持的虚假内容(Jiet al.,2023(https://arxiv.org/html/2607.08346#bib.bib9)),并且自我报告的置信度虽然具有信息性但需要实证验证(Linet al.,2022(https://arxiv.org/html/2607.08346#bib.bib17);Tianet al.,2023(https://arxiv.org/html/2607.08346#bib.bib8))。通常这种置信度是与答案内联获取的,而我们则将其分配在一个专门的通道中,该通道仅重新读取引用的证据与类别定义进行比较,我们发现这产生了一个更敏锐、校准更好的量表。我们将一项LLM评估器审计(按事件类型和置信度水平分层,并配备能区分类别错误和编造的判断)与事件研究传统中的经济验证(MacKinlay,1997(https://arxiv.org/html/2607.08346#bib.bib3);Boehmeret al.,1991(https://arxiv.org/html/2607.08346#bib.bib4))相结合。使用市场反应作为标签质量的外部检查,并使用标签置信度来完善事件研究,将两个评估表面以一种任何一方单独都无法提供的方式联系起来。

## 3. 抽取系统

抽取系统为每份申报文件分配一组来自固定分类体系的事件标签,每个标签都带有支持引文和质量分数。标注分两个阶段进行:一个抽取阶段,识别事件并引用每个事件的支持引文;一个评分阶段,通过根据类别定义判断引用的引文来为每个标签分配其质量分数。本节描述分类体系、两个阶段以及应用于模型输出的可靠性机制。

### 3.1. 分类体系

该分类体系是一个三层层次结构,包括8个主要类别、29个次级类别和119个三级事件类型,旨在描述经济事件而非申报义务。主要类别划分了广泛的领域(领导与治理、财务结果、战略交易、资本与融资、运营与战略、风险事件、监管与合规以及股东活动)。三级类别区分了,例如,首席执行官离职与另一位指定高管的离职,以及合并协议与合并完成或交易撤销。每个三级类型都有一到两句话的定义,模型根据这些定义(而不是仅凭类型名称)进行工作。该分类体系根据发生的事件进行组织,而非根据SEC项目编号,因此给定的事件类型可以出现在任何项目下。

### 3.2. 两阶段抽取和可靠性机制

#### 抽取(第一阶段)。

第一阶段对每份申报文件进行一次模型调用。完整的分类体系(含定义)被放入提示中,连同申报文件文本,模型返回一个标签列表,每个标签包含一个三级类型和支持引文。我们使用一个紧凑型、商业可用的指令调优模型,温度为0;设计目标是通过周围的结构(而非模型规模)来实现可靠性,第5节(https://arxiv.org/html/2607.08346#S5)中的评估直接测试了这一目标。在此阶段,对模型输出运行两项检查。

#### 约束输出。

每个标签都会根据输出模式进行检查:事件类型不是精确分类体系条目的标签将被拒绝,错误信息返回给模型,模型重试,最多三次。这保证了系统输出的每个标签都是有效的分类体系条目,同时不会在模型生成时逐令牌约束它(Willard and Louf,2023(https://arxiv.org/html/2607.08346#bib.bib14))。

#### 引文验证。

每个标签必须引用申报文件中的支持引文。验证器使用四个单词的序列检查引文与申报文件文本:它将引文分解为连续四个单词的重叠运行,并且只有当这些运行的至少40%在申报文件中逐字出现时才接受引文,否则触发重试。这使得编造的引文在结构上不可能:一个标签存活的条件是

相似文章