一些好条款:比较LLMs与领域训练的小型语言模型在结构化合同提取中的表现

arXiv cs.CL 论文

摘要

本文比较了领域训练的小型语言模型(Olava Extract)与前沿LLMs在结构化合同提取中的表现,结果显示该专业化模型获得了更高的F1分数且成本显著降低。

arXiv:2605.05532v1 公告类型: 新 摘要:本文评估了一个领域训练的小型语言模型(SLM)是否能够以极低的成本超越前沿大型语言模型(LLM)在结构化合同提取中的表现。我们对Olava Extract(一个自托管的法律领域混合专家模型)与五个前沿模型进行了测试。 Olava Extract 在研究中的综合表现最强,宏观F1为0.812,微观F1为0.842,同时与测试的前沿模型相比,推理成本降低了78%至97%。它还获得了最高的精确度分数,产生了更少的幻觉和未支持的提取结果,这在法律工作流中是一个重要的区别,因为幻觉会带来操作风险和下游审查负担。 研究结果表明,高性能、可与人类媲美的法律人工智能不再需要最大的外部托管模型。更广泛地说,它们挑战了以下假设:具有商业价值的企业人工智能能力必须始终与更大的模型、巨额基础设施支出和集中托管的提供商绑定。
查看原文
查看缓存全文

缓存时间: 2026/05/08 06:28

# 一些好的条款:比较大型语言模型与领域训练的小型语言模型在结构化合同提取方面的表现
来源:https://arxiv.org/html/2605.05532

###### 摘要

本文评估了一个经过领域训练的小型语言模型(SLM)是否能在结构化合同提取任务上超越前沿大型语言模型(LLM),同时运行成本显著降低。我们测试了 Olava Extract(一个自托管的法律领域混合专家模型),与五个商业可用的前沿系统相比较,使用了 24 份由法律专业人士标注的公开合同,涵盖 508 个标注字段实例,涉及 26 个提取目标。

Olava Extract 在研究中的综合表现最强,宏观 F1 为 0.812,微观 F1 为 0.842,超过了所有评估的前沿基线模型,而其推理成本仅为它们的一小部分。在批量推理下,提取成本相比测试的前沿模型下降了 78% 至 97%。Olava Extract 在评估中还取得了最高的精确率分数,产生的不支持提取和幻觉答案少于前沿基线模型。这一区别在法律工作流中尤为重要,因为幻觉输出可能带来巨大的下游审查负担、操作风险以及对自动化系统信任的丧失。

其影响不仅限于合同提取本身。对于法律服务而言,结果表明,高性能、接近人类水平的法律 AI 现在可以通过更小的领域训练系统以基础设施级的吞吐量和显著更低的成本运行,从而增加对围绕初级律师和法律流程外包商构建的传统审查模式的经济压力。更广泛地说,这些发现挑战了当前 AI 市场的一个核心假设:即具有商业价值的企业级 AI 能力必须紧密耦合于越来越大的模型、庞大的基础设施支出以及集中托管的提供商。在一个具有商业意义的企业任务中,一个相对紧凑的专业化模型能够直接与前沿规模的系统竞争,同时在成本和部署效率上大幅超越它们。

合同提取,小型语言模型,微调,法律自然语言处理,自托管 AI,信息提取

††copyright:acmlicensed
††ccs:Computing methodologies 自然语言生成
††ccs:Computing methodologies 信息提取
††ccs:Applied computing 法律
††ccs:Applied computing 文档搜索

## 1. 引言

从合同中提取关键条款是法律运营中最耗时的任务之一。协议在结构、术语、起草风格上差异很大。相关信息可能出现在条款、附表、附件或定义中,分散在许多页面中。审查者必须识别条款、日期、当事方、义务和财务条款,同时保留足够的源上下文以验证提取的答案。

最近的研究表明,大型语言模型(LLM)可以自动化这部分工作。在 *Better Call GPT* (Martin et al., 2024 (https://arxiv.org/html/2605.05532#bib.bib10)) 中,我们评估了前沿 LLM 与初级律师和法律流程外包商(LPO)在合同审查方面的表现。这些模型在准确性上达到或超过了人类,同时减少了审查时间和成本。在 *Better Bill GPT* (Whitehouse et al., 2025 (https://arxiv.org/html/2605.05532#bib.bib11)) 中,我们将比较扩展到法律发票审查,发现 LLM 在评估的决策和分类任务上优于人类审查者。

这些结果表明,前沿 LLM 能够很好地执行结构化法律分析任务。但它们也留下了一个重要的部署问题。这些研究中评估的模型是通过第三方 API 访问的大型商业托管系统。对于法律团队来说,这种设置可能在数据控制、安全审查、成本可预测性、模型版本控制和长期可用性方面产生实际约束。

小型语言模型(SLM)提供了一条新路径。它们可以在领域特定数据上进行微调,并部署在组织自己的基础设施内部。如果这样的模型在合同提取上能达到前沿模型的质量,它可能更适合那些重视保密性、成本控制和部署稳定性的工作流。在本文中,我们使用“SLM”来包括高效的混合专家(MoE)模型,这些模型的活动推理足迹通常与较小稠密模型的范围相关联,即使其名义参数数量更高。

本研究评估了 Olava Extract,一个领域训练的合同提取模型。我们在一个全文档结构化提取任务上测试它,涵盖 24 份保留的公共合同中的 26 个常见合同字段,共 508 个人工标注字段实例。这些字段包括提取的条款、持续时间字段、日期、货币值、布尔和分类选择,以及标识直接从合同陈述或推断出的信息的短文本字段。我们将 Olava Extract 与五个前沿模型进行比较,使用相同的合同集、输出模式、提示结构、推理方法和评分规则。

本研究关注三个问题:

1. (1) 一个经过领域训练的小型语言模型能否达到与领先前沿模型相当的综合提取性能?
2. (2) 小型语言模型是否比大型语言模型更便宜,超出自托管的明显优势?
3. (3) 小型语言模型是否比大型语言模型更快?

这些问题共同延续了 *Better Call GPT* 和 *Better Bill GPT* 中确立的研究方向。在 *Better Call GPT* 中,我们假设 LLM 将颠覆初级律师和 LPO,因为我们展示了它们能以相当的准确性、更高的速度和更低的成本执行法律审查任务。本研究通过考察一个高容量任务——结构化合同提取,继续这一实验。现在的焦点从模型能力转向生产可行性。前沿 LLM 能够以高准确性执行法律任务,但在结构化合同提取所需的规模下,它们的成本、延迟和数据控制约束可能降低相对于人类审查的实际优势。

本文评估一个更小、经过领域训练的模型是否能在保持足够提取准确性的同时,提供一条更具成本效益和操作实用性的规模化法律 AI 部署路径。

## 2. 相关工作

本研究建立在三个先前工作的基础上:法律领域模型适应、合同特定提取基准以及高效微调较小模型。

先前的法律 NLP 研究表明,法律文本受益于领域特定的建模。Chalkidis 等人 (https://arxiv.org/html/2605.05532#bib.bib3) 评估了将 BERT 适应法律语料库的策略,并发布了一系列法律领域的 BERT 模型用于法律 NLP 应用 (Chalkidis et al., 2020 (https://arxiv.org/html/2605.05532#bib.bib3))。这支持了核心前提:法律语言足够专业化,值得进行领域适应,而不是仅仅依赖通用模型。

合同审查也已成为法律 AI 的有用基准,因为它需要同时进行结构化信息提取和处理长且可变的文档。CUAD 引入了一个专家标注的合同审查数据集,将审查定义为识别对人类审查者重要的合同条款 (Hendrycks et al., 2021 (https://arxiv.org/html/2605.05532#bib.bib6))。ContractNLI 将合同分析视为文档级别的自然语言推理,要求模型将假设分类为蕴含、矛盾或未提及,并识别支持证据跨度 (Koreeda and Manning, 2021 (https://arxiv.org/html/2605.05532#bib.bib9))。这些数据集共同表明,合同分析是可自动化的,但仍然困难,尤其是在文档长、起草惯例多样或证据必须跨多个条款收集的情况下。

最近的法律行业评估表明,前沿 LLM 能够以等于或高于人类审查者基线的表现执行结构化法律审查任务。本系列的前期研究在采购合同问题发现和法律发票审查中发现了强大的 LLM 性能,速度和成本效率方面有巨大提升 (Martin et al., 2024 (https://arxiv.org/html/2605.05532#bib.bib10); Whitehouse et al., 2025 (https://arxiv.org/html/2605.05532#bib.bib11))。那些研究确立了 LLM 对结构化法律工作流的有用性,但它们依赖于大型 API 托管的前沿模型。

目前的研究关注的是,使用更小、可自托管的模型是否能实现类似的效用。法律领域之外的最新工作表明,在精心策划的数据上训练的紧凑模型可以在标准基准上媲美更大的系统,如 Phi-3 所示 (Abdin et al., 2024 (https://arxiv.org/html/2605.05532#bib.bib2))。在法律领域,SaulLM-7B 表明,在法律语料库上继续训练可以产生能力强的法律领域模型,且规模适中 (Colombo et al., 2024 (https://arxiv.org/html/2605.05532#bib.bib4))。参数高效微调方法(如 LoRA)通过仅训练少量额外参数进一步降低了适应该预训练模型的成本 (Hu et al., 2022 (https://arxiv.org/html/2605.05532#bib.bib7))。稀疏混合专家架构提供了另一条提高效率的途径,通过增加总模型容量,同时仅针对每个 token 激活部分模型 (Fedus et al., 2022 (https://arxiv.org/html/2605.05532#bib.bib5); Jiang et al., 2024 (https://arxiv.org/html/2605.05532#bib.bib8))。

本研究通过测试 Olava Extract(一个领域训练的 SLM)在全文档结构化合同提取(涵盖 26 种字段类型)上的表现,扩展了该工作线。与 CUAD 的条款跨度基准或 ContractNLI 的推理任务不同,本评估衡量的是字段级提取质量、成本和部署实用性。因此,问题不仅在于合同提取能否自动化,还在于一个更小、经过领域训练的模型是否能使自动化在经济上可行,用于那些传统上分配给初级律师、LPO 和其他人类审查者的高努力法律任务。

## 3. 方法论

### 3.1. 任务定义与输出模式

本研究将合同提取评估为全文档结构化生成任务。每个合同被直接插入模型上下文,不进行分块、检索或向量存储增强。在评估中,每个模型在单轮 LLM 调用中从每个合同中提取所有目标字段,对 Olava Extract 和所有前沿基线使用相同的结构化模式返回输出。这种设计避免了引入检索、分块或多步编排效应,这些可能会混淆比较结果。因此,性能差异更直接地反映了每个模型在相同任务条件下解释整个合同并填充目标模式的能力。

对于每个目标字段,输出模式需要两个元素:显示答案和支持性逐字合同跨度。显示答案表示规范化的值或简洁答案,供下游使用。支持性跨度提供用于证明答案的源合同文本,与使用标注条款跨度或证据跨度的合同分析基准一致,包括 CUAD 和 ContractNLI (Hendrycks et al., 2021 (https://arxiv.org/html/2605.05532#bib.bib6); Koreeda and Manning, 2021 (https://arxiv.org/html/2605.05532#bib.bib9))。它们还允许针对人工标注进行字段级评分。

提取任务涵盖六个字段类别中的 26 个字段,如表 1 (https://arxiv.org/html/2605.05532#S3.T1) 所示。这些类别既用于描述任务,也用于在结果中解释字段级性能。

表 1. 用于提取的字段类别和组成字段。

### 3.2. 数据与模型开发

#### 3.2.1. 源数据

模型开发和评估数据来自公开的 SEC EDGAR 附件文件;未使用任何私人、机密或特权材料。源池限于 token 数在 10,000 到 100,000 之间的合同,以及通过初步提取至少找到 26 个目标字段中 22 个的文档。开发数据涵盖了商业合同审查中常见的多种协议类型。

#### 3.2.2. 训练与验证分割

训练和验证分割包含 89,517 个训练标签和 5,453 个验证标签,按合同类型分层,并按文档标识符分开。

训练集中协议类型的百分比分布和标签流行率可分别参见附录 A.2 (https://arxiv.org/html/2605.05533#A1.SS2) 和附录 A.3 (https://arxiv.org/html/2605.05533#A1.SS3)。保留的人工评估集在第 3.3.1 节 (https://arxiv.org/html/2605.05533#S3.SS3.SSS1) 中单独描述。

#### 3.2.3. 标签生成与过滤

训练语料标签使用前沿语言模型合成生成,并由 LLM 作为法官的小组进行过滤,评分答案质量和跨度有效性。引用的跨度通过模糊匹配回源文本。此过程产生了带有显示答案和支持性跨度的字段级标签,匹配评估时所需的输出格式。

图 1 (https://arxiv.org/html/2605.05533#S3.F1) 总结了合成标注的模型开发数据与独立人工标注的评估集之间的分离。

参见图注

图 1. 模型开发与评估流程。一个两列流程图,左侧为模型开发,右侧为保留评估。左侧包括 SEC EDGAR 池、过滤、训练-验证分割、合成标签、法官过滤、LoRA 微调和 Olava Extract。右侧包括保留合同、法律标注、裁决、黄金标准集创建、模型推理、评分和结果。一条虚线箭头从 Olava Extract 连接到模型推理。

#### 3.2.4. 模型与微调

训练使用了参数高效微调(LoRA),采用 bfloat16 精度,并在 89,517 个训练标签上运行一个周期。最终检查点根据 5,453 个验证标签上的验证损失选择。

### 3.3. 评估协议

评估协议旨在比较 Olava Extract 与前沿系统在相同任务、合同集、输出模式、提示结构、推理方法和评分规则下进行。本节描述保留的评估集、比较的模型、推理过程、字段级匹配规则、准确性指标以及成本和延迟测量。

#### 3.3.1. 评估数据集与人工标注

评估集包含 24 份保留的 SEC EDGAR 合同和 508 个人工标注。法律专业人员在 Label Studio 中标注合同。每份合同由至少两名律师审查,分歧由一名高级律师裁决。评估合同通过文档标识符从训练和验证分割中排除。

#### 3.3.2. 比较的模型

Olava Extract 与五个商业可用的前沿模型进行比较:Claude Opus 4.6、Claude Sonnet 4.6、Gemini 2.5 Pro、Gemini 3.1 Pro Preview 和 GPT-5.4。每个模型在相同的 24 份合同数据集上使用相同的结构化输出规范进行评估。前沿模型采用零样本评估:系统提示指定了预期的输出模式和格式,但不包含任何工作提取示例。

#### 3.3.3. 推理协议

所有模型接收相同的合同、系统提示、用户提示、输出指令

相似文章

小型LLM:剪枝与从头训练

arXiv cs.LG

本文实证比较了剪枝与从头训练小型语言模型的差异,发现在有限token预算下剪枝具有明显优势,但随着训练规模扩大,优势逐渐减小,尤其是在粗粒度剪枝情况下。

超小型LLM真的有用吗?

Reddit r/singularity

探讨了非常小的语言模型是否能妥善处理日常对话,以及哪些训练因素使它们表现更佳。

Fence:面向LLM应用的专用SLM护栏

arXiv cs.AI

Fence提出使用在高质量合成数据上训练的小语言模型作为LLM应用的专用护栏,展示了相对于基于提示的LLM护栏的性能提升。