DocAnnot——利用生成式AI驱动的自动标注加速关键信息提取数据集的创建
摘要
介绍DocAnnot框架,该框架使用大型视觉语言模型、OCR以及一种空间感知的上下文匹配算法,自动生成用于文档关键信息提取的训练数据集,减少人工标注工作量。在CORD和SROIE基准测试中评估,取得了合理的F1分数,并实现了高效的人工验证。
arXiv:2607.24745v1 公告类型:交叉
摘要:关键信息提取(KIE)对许多文档应用至关重要,但创建训练数据集传统上是一个耗时的手动过程。我们介绍了DocAnnot,一个显著加速KIE数据集生成的框架。DocAnnot利用大型视觉语言模型(LVLM)进行标签值提取,OCR进行文本/边界框检测,以及一种新颖的空间感知上下文匹配(SICM)算法。SICM通过将空间关系和邻近性分析与文本匹配相结合,改进了标签-值的关联。我们在CORD和SROIE基准测试上评估了我们的框架,证明了其自动生成标注的能力,F1分数分别为0.679和0.846。此外,我们研究了使用自动标注数据微调下游KIE模型的有效性。虽然人工标注的数据仍然更优,但仅基于DocAnnot输出训练的模型取得了可观的性能(例如,LayoutLMv3在CORD上实现了0.6765的F1分数)。这些结果表明,虽然我们的框架显著减少了对人工的依赖,但尚未完全消除人类干预的必要性。然而,通过将流程自动化到审阅者能够高效完善输出的程度,我们的系统能够以远高于从头手动标注的效率实现近乎完美的标注。这种方法节省了大量时间和成本,使其在资源受限的环境和快速模型原型设计中极具价值。
查看缓存全文
缓存时间: 2026/07/29 09:56
# 使用GenAI驱动的自动标注加速关键信息提取数据集的创建
来源:https://arxiv.org/html/2607.24745
11institutetext:Phi Labs, Quantiphi India
22institutetext:Phi Labs, Quantiphi Canada
https://quantiphi.com/###### 摘要
从文档中进行关键信息提取(KIE)是许多应用中的关键任务,但传统上为KIE模型创建训练数据集是一个耗时且昂贵的手动过程。本文介绍了一种名为DocAnnot的新颖框架,它能显著加速并降低KIE数据集生成的成本。我们的框架利用大型视觉语言模型(LVLM)进行标签值提取,利用光学字符识别(OCR)进行文本和边界框检测,并提出一种新颖的空间感知上下文匹配(SICM)算法,以准确地将提取的值与对应的标签关联起来。SICM通过结合空间关系和邻近性分析与文本匹配,增强了标签-值的关联。我们在两个基准KIE数据集CORD和SROIE上评估了我们的框架,证明其能够以合理的准确度自动生成标注(F1分数分别为0.679和0.846)。此外,我们研究了使用自动标注数据微调下游KIE模型的有效性。虽然基于人工标注数据训练的模型性能更优,但我们的实验表明,仅使用自动标注数据训练的模型仍能达到可观的性能水平(例如,LayoutLMv3在CORD上达到0.6765的F1分数)。这些结果表明,虽然我们的框架显著减少了对人工标注的依赖,但尚未完全消除人工干预的需求。然而,通过将标注过程自动化到人工审核员能够高效验证和完善输出的程度,我们的系统能够以远高于从头手动标注的效率实现近乎完美的标注。这种方法在优化自动化与准确性平衡的同时,提供了显著的时间和成本节省,使其在资源受限的环境和快速模型原型开发中特别有价值。
††发表于ICDAR 2025。DOI:10.1007/978-3-032-04624-6_33 (https://doi.org/10.1007/978-3-032-04624-6_33)
## 1引言
从文档中进行关键信息提取(KIE)[6 (https://arxiv.org/html/2607.24745#bib.bib6)]是智能文档处理中的一项基础任务,应用范围涵盖自动数据录入、文档理解、机器人流程自动化和知识库构建等。KIE是从非结构化文档源中自动识别和提取特定信息片段(通常是预定义的键或实体类别),并将其转换为结构化格式的过程[23 (https://arxiv.org/html/2607.24745#bib.bib23)]。这些系统的有效性严重依赖于大规模、高质量的标注数据集[18 (https://arxiv.org/html/2607.24745#bib.bib18)]。然而,创建此类数据集的传统方法涉及人工专家手动标注,这一过程本质上耗时、劳动密集且昂贵[9 (https://arxiv.org/html/2607.24745#bib.bib9)]。这种人工标注瓶颈严重阻碍了KIE模型的开发、部署和规模化,限制了它们对新文档类型的适应性,并增加了总体成本。
现有的应对方法分为几类,各有局限性。人工标注虽能产生高质量数据,但本质上缓慢且成本高昂。基于模板的方法依赖于预定义的规则和结构,灵活性差,难以适应不同布局的文档或未见过的全新文档类型。
主动学习试图通过选择最具信息量的样本进行标注来优化人工投入[22 (https://arxiv.org/html/2607.24745#bib.bib22)],但仍需要大量人工参与。大型视觉语言模型(LVLM)[2 (https://arxiv.org/html/2607.24745#bib.bib2),25 (https://arxiv.org/html/2607.24745#bib.bib25),1 (https://arxiv.org/html/2607.24745#bib.bib1),15 (https://arxiv.org/html/2607.24745#bib.bib15),5 (https://arxiv.org/html/2607.24745#bib.bib5)]的最新进展在理解和推理结合文本的视觉信息方面展现了令人印象深刻的能力,但这些模型尚未针对从文档中进行结构化信息提取的特定需求进行精细调整,且可能在没有适当依据的情况下产生幻觉[29 (https://arxiv.org/html/2607.24745#bib.bib29)]。因此,一个显著的差距仍然存在:迫切需要一种完全自动化、精确且灵活的方法来生成KIE数据集,其中准确地将标签分配给实体至关重要。
为了满足这一需求,我们的论文引入了一种新颖的多模态GenAI驱动的自动标注框架(DocAnnot),以完全自动化KIE数据集的创建过程。我们的框架利用了三个关键组件的优势:用于标签值提取的LVLM、用于精确文本和边界框检测的光学字符识别(OCR),以及一种新颖的空间感知上下文匹配(SICM)算法,该算法智能地将LVLM提取的值与它们对应的标签关联起来。SICM算法是一项关键贡献,它有效地弥合了LVLM的语义理解与OCR提供的空间信息之间的鸿沟。这一方法受到最近利用大语言模型(LLM)进行数据增强和知识蒸馏的成功启发[9 (https://arxiv.org/html/2607.24745#bib.bib9),14 (https://arxiv.org/html/2607.24745#bib.bib14)],但它是专门为从视觉丰富文档中提取结构化信息的挑战而量身定制的。
我们在两个广泛使用的基准KIE数据集CORD[21 (https://arxiv.org/html/2607.24745#bib.bib21)]和SROIE[12 (https://arxiv.org/html/2607.24745#bib.bib12)]上评估了我们提出的框架,证明了它能够以合理的准确度生成标注,接近但尚未完全达到人工标注的质量。关键的是,我们还证明了仅使用我们框架自动标注的数据微调的KIE模型(LayoutLMv3[11 (https://arxiv.org/html/2607.24745#bib.bib11)]和UDOP[24 (https://arxiv.org/html/2607.24745#bib.bib24)])能够达到可观的性能水平。这意味着可以在没有任何直接人工干预的情况下开发出功能正常的KIE模型,从而大幅减少与KIE数据集创建相关的时间和成本。
我们的主要贡献是:
1. 1. 一个完全自动化的KIE数据集生成框架。
2. 2. 一种新颖的空间感知上下文匹配(SICM)算法,该算法整合LVLM和OCR输出以实现准确的标签分配。
3. 3. 在该框架于基准KIE数据集上的有效性演示。
4. 4. 对自动标注数据用于训练KIE模型的验证。
## 2相关工作
### 2.1 关键信息提取(KIE)模型与数据集
早期的KIE方法通常依赖基于规则的系统[20 (https://arxiv.org/html/2607.24745#bib.bib20)]或模板匹配,这缺乏对不同文档布局的泛化能力。Transformer架构[26 (https://arxiv.org/html/2607.24745#bib.bib26)]的引入彻底改变了这一领域,相较于使用CNN[19 (https://arxiv.org/html/2607.24745#bib.bib19)]和LSTM[10 (https://arxiv.org/html/2607.24745#bib.bib10)]等模型的早期深度学习方法,它带来了显著的改进。基于Transformer的模型,如BERT[8 (https://arxiv.org/html/2607.24745#bib.bib8)],在各种NLP任务上展示了卓越的性能。这引发了专门用于文档理解的模型的开发,例如LayoutLM[28 (https://arxiv.org/html/2607.24745#bib.bib28)]、LayoutLMv2[27 (https://arxiv.org/html/2607.24745#bib.bib27)]和LayoutLMv3[11 (https://arxiv.org/html/2607.24745#bib.bib11)],这些模型整合了文本和布局信息,并在后续版本中整合了视觉特征。LayoutLM[28 (https://arxiv.org/html/2607.24745#bib.bib28)]及其后继者在大规模文档语料上进行预训练,使用掩码语言建模和其他目标来学习捕捉文本、布局和图像之间相互作用的丰富表示。UDOP(统一文档处理)[24 (https://arxiv.org/html/2607.24745#bib.bib24)]代表了更进一步的发展——它将文本、图像和布局模态统一在一个单一模型中,并处理多种理解和生成任务。这些模型(我们在实验中也使用了它们)构成了KIE领域的最新技术水平。为了训练和评估这些KIE模型,已经创建了几个基准数据集,包括FUNSD[13 (https://arxiv.org/html/2607.24745#bib.bib13)]、CORD[21 (https://arxiv.org/html/2607.24745#bib.bib21)]、SROIE[12 (https://arxiv.org/html/2607.24745#bib.bib12)]和DocVQA[16 (https://arxiv.org/html/2607.24745#bib.bib16)]。这些数据集为比较不同方法和衡量该领域的进展提供了共同基础。
### 2.2 用于文档标注的生成式AI
LLM和LVLM的出现为自动数据标注开辟了新的可能性。最近的工作探索了使用LLM进行各种NLP任务的数据增强和知识蒸馏。一些方法使用LLM来指导未标注数据的标注,或者将推理能力蒸馏到较小的KIE模型中[9 (https://arxiv.org/html/2607.24745#bib.bib9),14 (https://arxiv.org/html/2607.24745#bib.bib14)]。在近期的努力中,据我们所知,DocKD[14 (https://arxiv.org/html/2607.24745#bib.bib14)]是唯一尝试类似任务的先前工作。DocKD将KIE表述为视觉问答问题,需要为每个标签-值对分别进行LLM查询,导致较高的计算开销,并用于微调一个非公开的DocFormerv2模型[4 (https://arxiv.org/html/2607.24745#bib.bib4)]。相比之下,我们的方法通过一次LLM调用为整个文档图像生成完整的KIE标注,借助新颖的SCIM算法显著降低了延迟和成本。
参见图注图1:用于自动KIE数据集生成的DocAnnot框架。输入文档和相应的数据标签被提供给系统。大型视觉语言模型(LVLM)提取标签-值对,而光学字符识别(OCR)提取文本和边界框信息。然后,空间感知上下文匹配(SICM)模块整合这些输出,生成标注文档,将文本跨度与它们对应的标签关联起来。
## 3方法:多模态GenAI驱动的自动标注框架
### 3.1 框架概述
我们引入了一个自动化文档标注的新颖框架,旨在解决文档KIE任务中与手动标注相关的高成本和高时间挑战。如图1 (https://arxiv.org/html/2607.24745#S2.F1)所示,该框架遵循多阶段方法,整合了以下组件:
- •大型视觉语言模型(LVLM):通过理解文本和视觉上下文,用于从文档中提取标签-值对。
- •光学字符识别(OCR):用于将文档图像转换为机器可读的文本。
- •空间感知上下文匹配(SICM)算法:一种新颖的技术,通过利用空间和上下文线索增强关键信息提取。
### 3.2 自动KIE数据集生成:通过SCIM融合LVLM洞察与OCR
对于像LayoutLMv3、UDOP及其类似的KIE模型,训练数据集的结构应为:每个文档作为图像提供,伴随的OCR系统提取一系列文本片段及其对应的边界框。此外,每个文本片段被分配一个来自预定义标签集合L=\{l_1,l_2,...,l_m\}的实体标签。训练完成后,模型需要为OCR输入的每个单词预测一个标签,这是一个令牌分类问题[7 (https://arxiv.org/html/2607.24745#bib.bib7)]。这种结构化格式(包括文档图像、带有边界框的OCR文本以及相关的实体标签)构成了我们自动标注框架的基础。
参见图注图2:使用DocAnnot框架的输出微调KIE模型。DocAnnot生成的标注文档作为训练数据用于KIE模型微调流水线。
#### 3.2.1 基于LVLM的标签值提取:
该过程从一组用户提供的文档D=\{d_1,d_2,...,d_n\}和一组与KIE任务相关的用户定义实体标签L开始。一个记为Φ_LVLM的LVLM从这些文档中提取标签-值对。重要的是,对于每个标签,LVLM不仅输出对应的值,还输出文档中实际出现的键文本。这可以表示为如下映射:
\{label:\{actual key text in document:value\}\}
例如,一个标签-值对可能显示为'sub_total.subtotal_price':{'SUBTOTAL':'10,000'}。在此上下文中,提取出的键文本(例如“SUBTOTAL”)记为t_k,并将在后续的空间匹配中使用。整体提取过程表示为:
LV = Φ_LVLM(D,L)
其中LV是包含值和键文本的标签-值对集合。
#### 3.2.2 使用OCR进行文本和边界框提取:
一个记为Φ_OCR的OCR引擎处理同一组文档D。OCR引擎执行以下操作:
1. 1. 带边界框的文本检测:确定每个文本段的精确空间坐标(边界框)。
2. 2. 文本识别:识别文档中所有检测到的文本实例。
OCR输出表示为:
TB = Φ_OCR(D) = {(t_1:b_1), (t_2:b_2), ..., (t_n:b_n)}
其中每个b_i对应文本段t_i的边界框。
#### 3.2.3 空间感知上下文匹配(SICM):
SICM算法(记为Φ_SICM)是我们框架的核心创新。其目标是通过将正确的标签从L分配给OCR提取的文本段,来协调LVLM和OCR模块的输出。回想一下,LVLM产生包含实际键文本的标签-值对LV,而OCR模块输出一组带有边界框的文本段TB。SICM算法在两个层次步骤中运行:
1. 1. 文本相似度过滤:对于LV中的每个标签-值对(l_i, v_i)以及TB中的每个OCR文本段t_j(带有边界框b_j),计算文本相似度分数:Similarity(v_i, t_j),使用诸如Levenshtein距离之类的度量。然后根据此分数进行候选过滤(例如,选择超过预定义相似度阈值的或选择前N个候选)。将此过滤后的集合记为TB'(v_i) ⊂ TB。
2. 2. 通过最近邻进行空间消歧:在相同的值(例如“$3.50”)出现多次的场景中,仅文本相似度可能相似文章
谁在进行NLP注释?2018-2025年间人类注释报告的大规模评估
本文对2018-2025年间自然语言处理领域的人类注释报告进行了大规模审计,结果显示关键细节的记录虽然随时间有所改善,但仍不一致,并为此提供了框架和建议,以改进报告质量。
DocOCR-Eval:一种无需真实标注、基于校正的OCR工具选择框架
DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。
DocAtlas:跨越80多种语言的多语言文档理解
DocAtlas是一个框架,通过差异渲染和合成生成,构建了覆盖82种语言的高保真OCR数据集和基准。它表明,直接偏好优化能够改善多语言模型的适配,而不会降低基础语言的性能。
@DataScienceDojo: 一家中国公司刚刚开源了一个𝐎𝐂𝐑,它修复了大多数AI驱动OCR工具默默挣扎的一个问题:……
Unlimited-OCR,一家中国公司新发布的开源OCR模型,解决了AI OCR工具中常见的内存增长问题——无论文档多长,内存使用都保持平稳,从而能够在32K上下文长度下一次性读取数十页。它采用MIT许可,拥有30亿参数,支持多语言,并且在GitHub上已经广受欢迎。
@neural_avb: https://x.com/neural_avb/status/2072294078805684613
本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。