从像素到键值对:在噪声文档设置中基于LLM的键值提取综合基准测试

arXiv cs.CL 论文

摘要

本文介绍了一个综合基准测试,用于评估大型语言模型在OCR噪声下进行文档键值提取的能力,揭示了显著的性能下降,并强调了需要联合优化OCR质量和LLM推理。

arXiv:2609.17538v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地用于从文档中提取结构化信息,但它们在真实OCR噪声下的行为仍然知之甚少。我们提出了一个系统性的基准测试,针对开源指令调优的大型语言模型在干净文本和噪声OCR条件下进行键值对(KVP)提取。 我们评估了代表性的仅解码器模型(Gemma, Mistral, Qwen2.5, LLaMA 3, 和 DeepSeek)在FUNSD, CORD, 和 SROIE基准测试上的表现,使用了来自PaddleOCR, EasyOCR, 和 Tesseract的金文本注释和OCR输出。统一的评估协议在一致条件下隔离了输入质量、模型设计和提示的影响。 结果显示,当有高质量文本时,现代LLMs充当强大的语义提取器,在某些情况下接近监督式布局感知系统。然而,在OCR噪声下,性能显著下降,并且随着输入损坏增加,模型之间的性能差距缩小。 跨所有数据集,提取性能由两个因素控制:文本的语义推理和OCR噪声下文本保真度的保留。虽然较大的模型在干净文本上改进了结果,但这些增益在噪声输入下减弱,此时OCR质量成为主导因素。我们还识别出反复出现的故障模式,包括键值错位、幻觉和数字损坏。我们的发现突出了干净文本评估与现实部署之间的差距,强调需要联合改进OCR质量、结构推理和基于LLM的语义建模。
查看原文
查看缓存全文

缓存时间: 2026/09/17 08:43

# 从像素到键值对:噪声文档环境中基于LLM的键值提取综合基准评测
**来源:** https://arxiv.org/html/2609.17538  
Vassilis Athitsos,德克萨斯大学阿灵顿分校计算机科学与工程系教授。电子邮件:[email protected]

###### 摘要
大语言模型正日益被用于从文档中提取结构化信息,然而其在真实OCR噪声下的行为仍未被充分理解。本研究对开源指令微调大语言模型在干净文本和噪声OCR两种条件下的键值对提取能力进行了系统性、可控的基准评测。我们使用Gemma、Mistral、Qwen2.5、LLaMA 3和DeepSeek等代表性的仅解码器模型,在FUNSD、CORD和SROIE三个文档基准数据集上进行评估,输入文本同时采用PaddleOCR、EasyOCR和Tesseract生成的OCR输出以及人工标注的黄金标准文本。统一的评估协议在相同条件下隔离了输入质量、模型设计和提示策略的影响。结果表明,当文本质量较高时,现代大语言模型表现出强大的语义提取能力,在某些干净文本条件下,其性能接近监督式布局感知系统。然而,这一能力无法可靠地迁移到真实场景中。在OCR噪声下,性能显著下降,且随着输入损坏程度加剧,模型间的性能差距趋于缩小。我们观察到,提取性能受制于两个瓶颈阶段:(1)文本语义推理能力,(2)OCR噪声下的文本保真度维护。模型规模扩展在干净文本环境中能提升性能,但在噪声输入中收益递减,此时上游文本质量成为主导因素。研究进一步揭示了反复出现的失败模式——包括键值错位、幻觉和数值损坏——这些模式会被OCR错误和提示敏感性所放大。总体而言,我们的研究揭示了干净文本评估与真实场景部署之间的根本性差距,证明稳健的文档提取需要同时解决OCR质量、结构推理和基于大语言模型的语义建模问题。

## 1 引言
键值对提取是文档人工智能的核心任务,支撑着发票处理、收据理解、表单数字化和企业自动化等应用[11,9]。传统流程通常将光学字符识别与启发式后处理及领域特定规则相结合。虽然在受控环境中有效,但当文档存在噪声、不规则布局和非标准字段结构时,这些方法在真实条件下性能会下降。实践中,OCR错误——如标记碎片化、行合并和数值损坏——会直接传播到下游提取系统并降低可靠性。

大语言模型近期为文档理解引入了新范式[1,12,26]。指令微调大语言模型无需显式建模布局或视觉结构,而是通过大规模预训练和上下文推理直接推断文本间的语义关系。先前研究已证明,在干净输入条件下,大语言模型无需任务特定微调即可执行结构化提取任务[27,25]。然而,现有评估大多依赖人工整理的干净文本而非OCR生成的输入。这一区别至关重要,因为OCR噪声仍是真实文档处理流程中的主要错误来源。这种差异导致基准评估与部署条件之间存在鸿沟。报告的性能提升可能反映的是理想化输入下的表现,而非对真实噪声的鲁棒性。此外,模型比较常受不一致的提示策略、后处理流程或数据集特定假设的影响,难以孤立评估模型能力的真实效果。现有研究也倾向于单独评估数据集,而表单与收据实际上施加着不同的结构和语义挑战。

本文提出了一种在干净文本和OCR衍生输入条件下评估基于大语言模型的键值对提取的可控基准。该基准在多个代表不同文档类型的数据集上评估模型,包括表单(FUNSD[11])和收据(SROIE[9]、CORD[19])。为模拟真实部署场景,性能在两种输入模式下评估:源自真实标注的黄金标准文本,以及由常用OCR引擎(包括Tesseract[23]、EasyOCR[10]和PaddleOCR[5])生成的文本。我们的分析考察了提取性能如何随模型能力和输入质量变化。虽然更强大的模型在干净文本条件下能提升性能,但随着输入质量下降,这些增益变得不明显。这表明模型容量的提升并不总能在真实OCR条件下带来相应的性能增益。

我们评估了多样化的指令微调开源大语言模型,包括Gemma[26]、Mistral[12]、Qwen2.5[20]、DeepSeek[3]和LLaMA 3[1]。为确保公平比较,所有模型均采用统一的提示框架、确定性解码和严格的非语义标准化流程(在不引入启发式提取逻辑的前提下标准化输出格式)进行评估。性能通过互补指标测量:键准确率、精确匹配和值级别F1分数,分别捕捉字段覆盖率、严格正确性和对文本变体的鲁棒性。该设置实现了对不同数据集和输入模式下模型行为的受控分析。

我们的结果呈现几个一致模式:第一,指令微调大语言模型在所有数据集的干净文本条件下均达到强提取性能;第二,OCR输入下性能下降,下降幅度因数据集和文档结构而异;第三,随着输入质量降低,模型间差异变得不明显;第四,少样本提示在许多情况下能提升性能,但其效果取决于数据集规律性和输入质量。该基准实现了真实OCR条件下基于大语言模型的文档提取的系统性评估,并支持跨模型、提示策略和文档集合的受控比较。总体而言,我们的研究强调了在真实输入条件下评估模型的重要性,并阐明了基于提示的大语言模型提取在实际中何时有效。

##### 贡献
本文做出以下贡献:
- 我们提出了一个受控基准,用于评估指令微调开源大语言模型在干净文本和OCR衍生输入条件下的纯文本键值对提取,实现了跨真实文档处理条件的提取鲁棒性系统分析。
- 我们使用统一评估协议,在多个指令微调大语言模型、多样文档集合(FUNSD、SROIE和CORD)及多种OCR引擎上进行了全面实证研究。
- 我们引入了标准化评估协议,采用确定性解码和非语义输出标准化,实现了跨模型和提示策略的公平可重复比较。
- 我们详细分析了OCR质量、文档结构、提示策略和模型规模的影响,并识别了限制纯文本大语言模型文档提取的主要失败模式。
- 该基准为未来基于大语言模型的文档理解研究提供了可重复的评估框架。

## 2 相关工作
### 2.1 文档AI中的键值对提取
键值对提取是文档AI的基础任务,支持发票处理、表单数字化、身份证件解析和企业自动化等应用。早期方法依赖手工模板、正则表达式启发式规则和空间规则[21,6]。虽然在受控环境中有效,但这些系统较为脆弱:微小的布局变化、OCR瑕疵或领域转移常导致失效。其对固定模式的依赖限制了语义泛化能力,且需要大量人工适配不同文档类型。

深度学习显著推进了这一领域。Chargrid[13]引入了同时编码文本和空间布局的网格表示,使卷积模型能联合推理内容和结构。FUNSD[11]的发布通过提供表单理解和键值链接基准进一步加速了进展。然而,许多神经方法仍依赖大规模标注数据集,且难以泛化到未见过的布局或文档领域。

### 2.2 布局感知架构
布局感知Transformer通过整合文本内容与空间和视觉特征取得了重大进展。LayoutLM[30]证明将语言建模与二维位置嵌入相结合能在关键信息提取任务上取得强性能。后续变体LayoutLMv2和LayoutLMv3[31,8]通过多模态预训练及视觉与文本信号的更好对齐进一步提升了结果。后续模型——包括DocFormer[2]、FormNet[15]、StructuralLM[16]和UDOP[25]——采用更复杂的融合机制和层次表示扩展了这一范式。这些方法在FUNSD[11]、CORD[19]和SROIE[9]等基准上取得了强性能。

尽管有效,布局感知模型存在实际限制:它们依赖精确的OCR边界框,在噪声扫描或低分辨率输入下性能会下降;训练通常需要大规模标注语料,部署则需完整的视觉-语言流程,增加了工程复杂性和计算成本;此外,对显式布局信号的依赖可能在结构退化时限制鲁棒性。近期多模态生成系统如Donut[14]、DocVLM[22]和LayoutLLM[17]试图统一视觉理解与生成建模。虽然这些方法可利用完整文档图像,但与许多真实系统中使用的现有OCR流程兼容性较差。

### 2.3 用于结构化提取的大语言模型
大语言模型为从半结构化文本中提取结构化信息引入了灵活范式。现代仅解码器指令微调模型——如Mistral[12]、Gemma[26]、Qwen2.5[20]、DeepSeek[3]和LLaMA 3[1]——在广泛提取任务中展现出强大的零样本和少样本能力。这些模型无需任务特定训练,即可通过自然语言提示直接推断键值关系、执行实体识别并生成结构化输出。指令微调[29]和统一提取框架如InstructUIE[27]进一步凸显了大语言模型通过单一提示接口泛化到不同提取任务的能力。

然而,基于大语言模型的文档提取现有评估仍有限:许多研究依赖人工整理的干净文本而非OCR输出,使其无法代表真实条件;其他研究仅评估少量模型或使用不一致的提示和后处理策略,阻碍了可重复性和公平比较。因此,现代开源大语言模型在真实OCR噪声下的鲁棒性仍需充分理解。

### 2.4 OCR噪声与鲁棒性
OCR诱导的损坏是文档处理流程失效的主要来源。字符替换、标记碎片化和行重排等错误直接影响下游提取。虽然噪声鲁棒性在自然语言处理中已有研究[24,18],但鲜有工作考察大语言模型在OCR生成文本下的行为。在文档AI中,评估通常在干净标注上进行,或使用绕过OCR的端到端多模态系统。因此,对于纯文本大语言模型提取流程在Tesseract[23]、EasyOCR[10]和PaddleOCR[5]等常用引擎生成的真实OCR条件下的表现,仍缺乏实证理解。

### 2.5 本工作的定位
本研究通过提供对开源指令微调仅解码器大语言模型在干净文本和噪声OCR条件下键值对提取的可控、可重复基准来填补这些空白。我们评估了多个模型家族在不同文档类型(表单和收据)上的表现,并系统改变OCR质量以隔离其对提取性能的影响。我们的框架采用统一提示策略、确定性解码和严格的非语义标准化流程,确保跨模型的公平比较。通过分离模型能力与输入质量,我们更清晰地理解了基于提示的提取在真实文档处理设置中何时成功、何处失效。据我们所知,这是首个使用统一、完全可重复的评估协议,在多个OCR引擎下系统评估多个开源指令微调大语言模型在FUNSD、SROIE和CORD上表现的基准。

#### 2.5.1 数据集样本与视觉特征
图1、2和3展示了来自...

相似文章