DECODEM: 通过增强方法从公司组织文档中提取数据

arXiv cs.CL 论文

摘要

介绍DECODEM,这是一个基准数据集,用于评估使用大型语言模型从法律文档中自动提取公司治理变量的方法,结果显示对许多条款具有高准确性。

arXiv:2607.15879v1 公告类型:新 摘要:许多实证法律研究依赖于将非结构化文本转化为结构化变量。在公司治理研究中,这一转化传统上依赖于人工对章程和细则等文档进行编码,这一过程成本高昂、难以扩展且通常不透明。本文介绍了DECODEM,这是一组基准数据集,用于评估从组织文档中自动提取公司治理变量的方法。这些基准将随机抽样的公司章程和细则与高质量的人工标注配对,涵盖了实证研究中常见的各种治理条款。 利用这些数据集,本文评估了多种大型语言模型提取流水线,这些流水线在提示设计、任务分解和文档处理方面有所不同。底层任务由一组文档级别的二元分类问题组成,每个治理变量对应一个问题。结果显示,对于许多条款,自动提取可以达到高精度,中位数性能接近各种方法的上限。同时,不同变量的性能存在系统性差异,少数条款占据了大部分剩余错误。更复杂的提示策略和级联流水线并未持续提升前沿模型的性能,但在某些情况下显著缩小了前沿模型与效率导向模型之间的差距,这表明流水线设计可以在一定程度上替代模型能力。 通过提供标准化的基准和对提取方法的系统评估,本文证明当前的前沿模型能够以高精度从复杂的公司文档中提取具有法律意义的信息,并指出自动特征提取在构建公司治理数据集方面未来的重要作用。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:35

# DECODEM:通过增强方法从公司组织文件中提取数据
来源:https://arxiv.org/html/2607.15879

###### 摘要

许多实证法律研究依赖于将非结构化文本转化为结构化变量。在公司治理研究及其他领域中,这种转化传统上依赖于人工对章程和细则等文件进行编码,这一过程成本高昂、难以规模化且常常不透明。本文介绍了DECODEM,这是一组用于评估从组织文件中自动提取公司治理变量的基准数据集。这些基准将随机抽取的公司章程和细则与涵盖实证研究中常见的一系列治理条款的高质量人工标注配对。利用这些数据集,本文评估了几种在提示设计、任务分解和文档处理方面各有不同的大型语言模型提取流水线。底层任务由一组文档级别的二分类问题组成,每个问题对应一个治理变量。结果表明,对于许多条款,自动提取可以达到高准确度,各方法的中位性能接近上限。同时,不同变量之间的性能存在系统性差异,少数条款占据了大部分剩余错误。更复杂的提示策略和级联流水线并不能持续提升前沿模型的性能,但在某些情况下显著缩小了前沿模型与效率导向型模型之间的差距,这表明流水线设计可以部分替代模型能力。通过提供标准化基准和对提取方法的系统评估,本文表明当前的前沿模型能够以高精度从复杂的公司文件中提取具有法律意义的信息,并预示着自动化特征提取在构建公司治理数据集方面将发挥重要的未来作用。

## 1 引言

许多实证法律研究依赖于将非结构化文本转化为结构化变量。一个突出的例子是法律与金融领域的研究,数十年的工作研究了公司治理安排的实际影响(例如,[gompers2003corporate_governance, bebchuk2009what_matters])。传统上,这种转化由人工编码员执行,他们阅读并编码法律文件,如公司章程和细则[hall2008systematic_content_analysis]。虽然可行,但这种方法给研究带来了重要限制,限制了实证分析的规模和范围,并提出了这一步骤能否自动化的问题。

法律文本,包括公司章程和细则,为自然语言处理带来了独特的挑战。它们通常篇幅较长、结构复杂,并且使用专业语言,不同文件之间差异很大[Ariai_2025, premasiri2025legalie]。此外,关键条款的含义往往依赖于上下文,措辞上的微小差异可能具有重大的法律影响。传统的NLP方法在处理更标准化的文本时表现良好,但在处理这种长度、多变性和上下文依赖性的组合时却遇到了困难。

大型语言模型的出现使得从这类文件中进行大规模提取成为可能。然而,迄今为止,几乎没有系统性证据表明自动化方法能否可靠地大规模从公司章程和细则中恢复具有法律意义的变量。

本文介绍了两个基准数据集(DECODEM基准),旨在评估从公司章程和细则中自动提取公司治理变量。这些基准基于真实的公司治理文件语料库构建,重点关注涉及股东大会、董事选举、董事会结构、赔偿、免责和收购相关安排的条款,这些是实证研究中发挥核心作用的条款类型。对于每个条款,数据集提供了手工编码的标签,以指示相关治理安排是否存在。

在这些数据集的基础上,本文评估了一系列提取流水线,这些流水线在多个维度上有所不同,包括用于查询模型的提示的复杂度,以及模型是接收完整文档还是通过预处理步骤选择的摘录。这种设计使得不仅能够评估整体性能,还能评估不同提示工程和文档处理方法之间的权衡。

结果表明,大型语言模型能够以高精度恢复许多治理变量。同时,不同变量之间的性能差异很大。少数可以说更复杂的条款——例如股东大会权利以及罢免和补缺权力——占据了大部分观察到的错误。重要的是,更复杂的提示和级联提取流水线并不能持续提升前沿模型的性能,但对于细则基准,它们显著缩小了前沿模型与效率导向型模型之间的差距。这表明流水线设计可以部分替代模型能力。同时,最强模型中剩余的错误似乎更多源于特定治理变量的解释需求,而非提取架构。

总体而言,本文做出了三项不同的贡献。首先,它介绍了DECODEM,这是一对用于从公司章程和细则中评估长文档法律信息提取的基准数据集。第二,它提供了对文档级治理变量分类任务中提取架构和前沿语言模型的系统比较。第三,它分析了提取失败的情况,表明剩余错误集中在特定的治理条款和观测值上,而非均匀分布在基准中。一篇配套论文[frankenreiter2026measuring]使用相同的基准来解决一组互补的问题,将自动提取与真实的人工编码工作流程进行比较,并评估集成编码和LLM辅助人工编码数据审计。

## 2 实证法律研究中的文本到变量转化

许多实证法律研究项目的核心步骤是将非结构化文本转化为用于统计分析的结构化变量[hall2008systematic_content_analysis, gentzkow2019text]。研究人员利用文本来源——合同、法规、监管文件、法院意见或公司披露——来研究制度安排及其经济或社会后果,但相关信息很少以可直接分析的格式存在。必须首先将其编码为结构化数据,通常是通过识别文档中是否出现特定概念,并根据预定义的编码规则将其映射到分类或二元变量。

传统上,这种编码是手工完成的:受过训练的编码员阅读文档并标注特定特征的存在与否。手工编码耗时且成本高昂[hall2008systematic_content_analysis],因此数据集往往覆盖有限的样本,而回报不确定的项目可能根本不会尝试。编码决策也是解释性的,即使设计良好的协议也可能在不同编码员之间或不同时间产生不一致。标准化数据集可以将这些成本分摊给众多用户,但代价是变量菜单固定,且编码过程的透明度有限。

法律和监管文件通常篇幅较长、结构复杂,并使用专业语言,因此相关信息往往分散在条款或章节中,并对措辞的微小差异敏感[beltagy2020longformerlongdocumenttransformer, NEURIPS2020_c8512d14]。这使得基于规则和关键词的提取具有挑战性。早期的NLP方法在目标可以通过词汇识别时有效[nyarko2021stickiness_incomplete_contracts, rauterberg2017contracting_innovation],但当提取需要上下文或法律依据的解释时,其性能就会下降。这些方法还依赖于大型标注训练集,而这在此处通常不可用。

机器学习中的一种应对措施是通过弱监督或远程监督来减少对人工标注的依赖。这些方法用程序化或噪声标签替代黄金标准标注,以标签保真度换取规模[ratner2017snorkel, mintz-etal-2009-distant]。现代大型语言模型提供了一条不同的路径:它们捕捉上下文关系,执行需要语义理解的任务,并且在许多设置中几乎不需要或不需要特定任务的标注数据[NEURIPS2020_1457c0d6]。原则上,这使得结构化信息可以直接从复杂文档中提取,至少自动化了部分文本到结构的转化。

然而,要实现这一潜力,需要将原始文档与高质量人工标注配对的基准。这样的基准可以衡量提取准确性,实现不同方法之间的比较,跟踪随时间推移的进展,并揭示仍然难以自动解释的文本结构。因此,构建此类基准是朝着自动化法律信息提取迈出的重要一步。

## 3 实证公司治理研究与数据瓶颈

本文在实证公司治理研究的背景下研究这一基准问题,这是将法律文本转化为结构化数据的天然场景。法律与金融领域的大量工作依赖于捕捉上市公司治理安排的变量——董事选举、股东权利、反收购防御和诉讼相关条款[bebchuk2009what_matters, gompers2003corporate_governance]。这些信息大多存在于公司章程和细则中,它们定义了公司治理框架的关键要素,但几乎仅以文本形式存在,在统计分析前必须转化为结构化变量。

这种转化传统上依赖于手工收集[kastiel2022corporate_governance_gap]或标准化的商业数据集[bebchuk2009what_matters, gompers2003corporate_governance]。两者都促成了有影响力的工作,但都有局限性。手工编码成本高昂且难以规模化,特别是对于需要法律依据解释的特征或大型纵向数据集。商业数据集降低了最终用户的成本,但通常只覆盖变量的子集,并且对这些变量如何定义和编码的能见度有限。先前的研究也对一些广泛使用的治理数据集的准确性提出了质疑,表明数据质量应成为方法论的核心关注点,而非背景假设[frankenreiter2021cleaning_governance]。

这些限制不仅限制了可用数据的数量,也限制了研究议程本身。由于结构化形式的治理变量很少,研究人员倾向于转向这些变量可以回答的问题,而许多潜在的重要安排由于相关信息从未被系统提取而难以大规模研究。因此,实证公司治理仍然受限于传统数据收集的范围和质量。

从公司章程和细则中自动提取提供了一条超越这些限制的途径。可靠的大规模识别和分类法律相关条款将使研究人员能够复制现有数据集的部分内容,并研究标准来源中缺失的安排,从而拓宽实证议程并减少对不透明编码过程的依赖。最近的研究显示了其潜力:对公司文件大型语料库的计算分析可以揭示否则难以系统观察到的治理实践[frankenreiter2026sticky_charters, frankenreiter2025other_delaware_effect]。

公司章程和细则也是现代NLP的一个要求苛刻且具有实际重要性的测试案例。它们具有法律性质,通常篇幅较长,并且在不同公司和时间之间差异很大,因此提取依赖于上下文和法律依据的解释,而非表面词汇模式。因此,基于它们构建的基准服务于两个目的:支持实证公司治理研究,并为在长篇幅、异质性文档中进行法律文本到结构转化提供更广泛的评估环境。

## 4 相关工作

本文贡献于几个文献脉络。首先,自然语言处理领域的一个重要文献已经为广泛的任务开发了基准数据集,包括法律任务(例如,[guha2023legalbench, chalkidis-etal-2022-lexglue, hariri2026, afane2026benchmarking])。然而,这些基准通常侧重于旨在评估模型执行某种法律推理、分类或检索能力的任务,而非从冗长的组织文件中提取结构化变量。相比之下,实证法律研究中出现的提取问题通常需要处理长篇幅、结构复杂的文本,并以适合定量分析的形式恢复具有法律意义的信息。

在任务设计上,与DECODEM最接近的是Marotta-Wurgler和Stein的隐私政策语料库,该语料库开发了一个手工编码的数据集和编码工具包,用于将冗长的法律文件转化为结构化变量[marottaWurglerStein2025PrivacyPolicyCorpus]。该语料库旨在解决法律文本编码中出现的挑战,包括法律含义的模糊性以及条款在文档内的相互作用方式。DECODEM与这种基于法律的文本到变量转化有着共同的关注点,但在其对公司组织文件的关注以及其对用于下游实证公司治理研究的治理变量提取流水线的评估上有所不同。

其他以合同为重点的基准也是相关的,因为它们识别或分类合同文件中的条款[tuggener2020ledgar, hendrycks2021cuad]。实质上,最接近的现有基准是CHANCERY[irwin2025chanceryevaluatingcorporategovernance],该基准评估模型在源自真实公司章程的公司治理推理任务上的表现。在CHANCERY中,模型被要求判断提议的高管、董事会或股东行动是否与章程中包含的治理规则一致。因此,该基准与本文对公司组织文件以及治理条款的法律解释有着共同的兴趣。然而,这两个项目在重要方面有所不同。CHANCERY主要是一个推理基准:它测试模型能否将章程中的治理规则应用于提议的行动。相比之下,DECODEM基准旨在评估文本到变量的提取。任务不是推理假设行动的可允许性,而是直接从原始文件中恢复结构化的治理变量。相关地,CHANCERY依赖于基于章程的、围绕治理原则构建的场景,而本文则侧重于由手工编码标签定义的文档级提取任务,这些标签附加在随机抽样的真实公司章程和细则上。

更广泛地说,本文与自然语言处理中的信息提取文献相关,该文献研究如何从非结构化文本中恢复结构化信息[sarawagi2008information_extraction, premasiri2025legalie]。该领域的现有工作...

相似文章

ExtractBench:面向模式引导的企业文档抽取基准

Hugging Face Daily Papers

ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。

DeepCode:开放式智能体编程

Papers with Code Trending

DeepCode 是一个完全自主的框架,用于从文档到代码库的合成,通过原则性的信息流管理将科学论文转化为生产级代码,在 PaperBench 上取得了最先进的结果,并超越了博士级人类专家。

欺骗语义:法律领域欺骗检测与通用领域最先进方法的基准测试

arXiv cs.CL

本文综述并评测了法律语境下基于NLP的自动欺骗检测,比较了微调Transformer和七个大语言模型(LLM)在七个数据集上采用多种提示策略的表现。结果表明存在明显的领域敏感性:微调模型在数据丰富的通用领域表现出色,而少样本LLM在低资源法律场景中具有竞争力。