评估开源模型在高风险公共部门应用中的结构化信息提取

arXiv cs.AI 论文

摘要

本文对开源OCR、LLM和VLM系统在高风险公共部门应用中的结构化信息提取进行了基准测试,发现VLM通常优于OCR+LLM流水线,但大多数配置在零样本设置中表现不佳,强调了输入质量的关键作用。

arXiv:2608.18289v1 公告类型:新 摘要:从非结构化文档中提取结构化信息是所有部门数字化转型的关键组成部分。虽然专有解决方案主导商业应用,但快速发展的开源光学字符识别(OCR)引擎、大型语言模型(LLM)和视觉语言模型(VLM)生态系统提供了易于获取的替代方案。然而,对现实、多步骤提取流水线的系统评估仍然稀缺。负责任地使用此类提取工具需要对现实任务进行全面评估,尤其是这些解决方案将成为欧盟AI法案分类为高风险的公共部门应用的关键组成部分。为弥补这一差距,我们提出一个全面的基准测试,评估开源系统在复杂现实世界文档处理任务(分类为高风险:国际学习项目的学生申请)上的端到端性能。我们使用最先进的OCR引擎、LLM和VLM进行实证评估。结果显示,尽管VLM通常优于OCR+LLM流水线,但即使是先进的开源模型在零样本设置中也难以可靠处理此类任务。在35个配置中,只有4个的F1分数高于0.5,最佳OCR+LLM流水线与顶级VLM性能相当,但大多数OCR+LLM组合表现显著较差。大约75%的所有配置得分低于0.25。模型规模影响性能,但关系是非线性的:显著更大的模型并不保证成比例更好的结果。输入质量,特别是OCR输出的结构保留,成为独立于下游模型能力的关键因素。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:06

# 使用开放模型评估高风险公共部门应用中的结构化信息提取
来源:https://arxiv.org/html/2608.18289
Elias Schubert  
所属机构:柏林应用科学大学,德国柏林 Luxemburger 街10号,邮编13353  
https://www.bht-berlin.de/  
电子邮箱:[\{s92538,felix\.biessmann\}@bht\-berlin\.de](mailto:{s92538,felix.biessmann}@bht-berlin.de)

Felix Bießmann  
ORCID:0000\-0002\-3422\-1026 (https://orcid.org/0000-0002-3422-1026)  
所属机构:柏林应用科学大学,德国柏林 Luxemburger 街10号,邮编13353  
https://www.bht-berlin.de/  
电子邮箱:[\{s92538,felix\.biessmann\}@bht\-berlin\.de](mailto:{s92538,felix.biessmann}@bht-berlin.de)  
所属机构:Einstein数字未来中心,德国柏林 Wilhelmstraße 67号,邮编10117  
https://www.digital-future.berlin/

###### 摘要

从非结构化文档中提取结构化信息是所有行业数字化转型的关键组成部分。虽然专有解决方案在商业应用中占据主导地位,但开源光学字符识别(OCR)引擎、大型语言模型(LLM)和视觉语言模型(VLM)的快速增长生态系统提供了易于获取的替代方案。然而,针对现实的多步骤提取流程的系统性评估仍然稀缺。负责任地使用此类提取工具需要针对现实任务进行综合评估,特别是当这些解决方案将被用于欧盟《人工智能法案》归类为高风险的公共部门应用时。为解决这一差距,我们提出一个综合基准,评估开源系统在一项复杂的现实世界文档处理任务(被归类为高风险:国际学习项目的申请材料)上的端到端性能。我们使用最前沿的OCR引擎、LLM和VLM进行了全面的实证评估。结果表明,虽然VLM通常优于OCR+LLM流水线,但即使是前沿的开源模型也难以在零样本设置中可靠地处理此类任务。在35种配置中,仅有4种的F1分数高于0.5,其中最佳的OCR+LLM流水线与顶级VLM的性能相当,但大多数OCR+LLM组合的表现显著较差。约75%的所有配置得分低于0.25。模型规模影响性能,但这种关系是非线性的:显著更大的模型并不保证按比例带来更好的结果。输入质量,特别是OCR输出的结构保留,是独立于下游模型能力的关键因素。这些发现为从业者在文档处理工作流中选择模型提供了实用指导,同时突出了当前开源结构化信息提取方法的根本局限性。

###### 关键词:

光学字符识别 大型语言模型 视觉语言模型 基准测试 开源

## 1 引言

从非结构化或半结构化来源提取结构化信息的能力,已成为现代数据驱动工作流中日益关键的功能。跨行业的数字化转型要求这些工作流能够可靠地整合来自扫描文档或数字编辑表单的信息。光学字符识别(OCR)、大型语言模型(LLM)和视觉语言模型(VLM)的快速发展从根本上改变了这一格局,使得此类提取任务比以往更准确、更具扩展性且更易于实现。除了通常被宣传为通用全能模型的专有解决方案外,一个丰富的、可免费使用的开源OCR引擎、LLM和VLM生态系统也已兴起。这些公开可用的模型为处理大量非结构化数据(如普遍存在的PDF格式)提供了巨大机会,而无需承担商业系统的成本或限制。

要利用这一潜力,需要对现成模型在现实提取任务上的表现进行更多、更系统的实证评估。考虑到大多数技术的发展速度超过了相应的监管,这一点尤为重要。虽然许多基准测试和评估关注的任务要么简单,要么未被欧盟《人工智能法案》[6 (https://arxiv.org/html/2608.18289#bib.bib1)]归类为“高风险”,但在高风险环境中(如医疗保健或公共部门工作流)使用该技术需要广泛的实证评估。尽管此类评估更偏向于应用研究,但我们认为,研究人员能够也应当进行此类评估,以建立公众对开源技术在公共部门应用的信任。

为应对这一挑战,本工作做出两项主要贡献。首先,我们设计了一个针对公共部门高风险用例(国际学习项目的申请材料)的提取性能评估方案。这项任务具有代表性,涉及许多其他复杂任务:它需要处理包含结构化和非结构化数据混合的异构PDF文档,提取目标信息,并以明确定义的结构化格式返回。如图2 (https://arxiv.org/html/2608.18289#S3.F2) 所示的工作流代表了许多领域中遇到的典型操作用例。其次,我们使用此评估方案进行基准测试,评估开放OCR系统与LLM结合的能力,以及独立VLM的性能。结果从提取性能以及与实际使用相关的其他因素(如计算效率)两方面进行了讨论。

## 2 相关工作

尽管OCR引擎、LLM和VLM在单步骤场景中已被广泛评估,但评估它们在复杂、多步骤提取任务零样本设置下的单独或组合性能的基准测试仍然很少。这类任务涉及将文档转换为机器可读文本、提取指定信息,并以严格定义的结构返回,这与这些模型在实际部署中的使用方式非常接近,正是本工作评估的端到端流水线。现有基准测试往往将该流水线的各个组件分离开来。

关于OCR,Khan等人 [18 (https://arxiv.org/html/2608.18289#bib.bib2)] 在CBC报告数据集上评估了多种引擎,测量了准确性、处理时间和错误率。PaddleOCR和EasyOCR脱颖而出,成为性能最强的引擎,这一发现直接影响了本工作所使用的OCR模型的选择。在从未结构化和半结构化文档中提取信息方面,Ntinopoulos等人 [21 (https://arxiv.org/html/2608.18289#bib.bib6)] 在零样本设置下对主要LLM和表格转换器在电子健康记录上进行了基准测试,发现专有模型始终能取得强劲结果,F1分数超过0.9,优于几个开源模型。他们还发现,当仅考虑布局结构时,表格转换器的提取性能高于LLM,但当单元格内容变得相关时,LLM则超越了表格转换器。类似地,Gao等人 [7 (https://arxiv.org/html/2608.18289#bib.bib7)] 研究了跨多种信息类型的细粒度提取,观察到编码器-解码器架构能更好地泛化到未见过的信息类型,而仅解码器架构能更有效地处理未见过的任务形式。值得注意的是,模型规模并不能一致地预测性能,这一点在文献中反复出现。

Nunes等人 [22 (https://arxiv.org/html/2608.18289#bib.bib3)] 研究了OCR与多模态LLM在表格提取中的相互作用,他们使用PubTables-1M的一个非复杂表格子集,对OCR系统和MLLM在从图像中提取表格的能力上进行了基准测试。尽管他们的设置不包括完整的端到端提取流水线,但与本文提出的基准测试非常接近,并提供了有价值的见解。与本工作类似,他们通过使用预定义的Pydantic模式来提示模型,强制执行结构化输出。评估了专有和开放模型后,他们报告了各类别中都表现强劲,多个模型的F1分数在85到95之间,具体取决于评估方面。

关于结构化输出生成,Tenckhoff等人 [28 (https://arxiv.org/html/2608.18289#bib.bib4)] 在一个合成生成的数据集上,使用五种提示策略对22个开源模型进行了基准测试,评估了它们从自然语言文本中提取结构化数据并生成有效JSON的能力,其中GPT-4o作为专有参考被包含在内。结果强化了提示策略和模型架构至少与模型规模同样重要,并且领先的开源模型如Gemma3-27B可以与专有系统相媲美。

最后,Roberts等人 [26 (https://arxiv.org/html/2608.18289#bib.bib5)] 评估了VLM直接从图像中提取结构的能力,使用了一种基于渲染模型输出并与原始图像进行比较的自动评估方法。闭源模型,特别是GPT-4o,显著优于开源替代方案,并且VLM难以捕捉视觉细微差别,且对提示公式敏感,这表明零样本标准化提示对于此类任务可能并非最优。

总之,这些工作突出了文档提取流水线相关各个组件的重要进展,同时也强调了缺乏评估免费开放模型在文档摄取、信息提取和结构化输出生成这一完整三步问题上的整体能力的基准测试,而这正是本文直接探讨的内容。

## 3 方法

以下我们首先描述学习项目申请数据和提取任务,然后描述提取工作流和评估指标。

### 3.1 数据

本基准测试使用的数据集包含100份作为申请德国数据科学硕士项目材料提交的学术成绩单,以PDF文档形式提供。其中,94份完全用英语书写,3份为英语和土耳其语双语,2份为德语,1份结合了英语和俄语。绝大多数申请者来自亚洲国家,占数据集的90%以上。每个文件通常包含表格形式的结构化数据以及自由文本、图像和机构徽章等非结构化元素。由于文档包含个人信息,数据集无法以当前形式发布,必须在发布前进行匿名化处理。示例文档如图1 (https://arxiv.org/html/2608.18289#S3.F1) 所示。

所有文档均标准化为A4格式,并额外转换为JPG图像以适应需要图像输入的模型。随后,手动解析每个文档以提取与提取任务相关的所有课程,形成用于评估模型输出的“真实值”。提取遵循一套规则集,旨在处理国际学术文件典型的异质性和格式不一致性:

- • 仅提取计算机科学或数学课程。
- • 在多语言文件中,优先使用英语版本。
- • 在多种成绩格式情况下,优先选择字母成绩。
- • 缺失值用N/A填充。
- • 在未明确标明总学分的情况下,选择该行的第一个值。
- • 格式不一致(如错误间距或不正确字符)在“真实值”中保持原样。

表1 (https://arxiv.org/html/2608.18289#S3.T1) 展示了与图1 (https://arxiv.org/html/2608.18289#S3.F1) 所示文档对应的“真实值”,说明了这些规则的应用。当提供多个学分列且无明确指定时,为每门课程选择第一个学分值。例如,“操作系统”在原始文件中同时出现理论(3.0)和实践(1.0)学分,但仅提取3.0,因为它是该课程的第一个学分值。

提取的“真实值”包含四列:学术领域、课程名称、成绩和授予学分,所有文档共计952个唯一条目。每个文档提取的行数从0到44不等,任何单个文档内无重复条目。

参见标题图1:匿名化示例文档。
表1:图1 (https://arxiv.org/html/2608.18289#S3.F1) 文档的手动提取“真实值”。

### 3.2 提取

我们在一个三步流水线中比较了OCR引擎与LLM结合的性能与独立VLM的性能:数字化并准备文档内容、按照提示提取任务相关信息、并以结构化输出返回。所有LLM和VLM均使用Ollama平台运行,该平台为所有模型提供一致的基础设置以及一个集成格式参数,该参数通过Pydantic模式强制执行结构化输出。

参见标题图2:提取和评估流水线的工作流。

本基准测试中使用的OCR引擎基于两个标准选择:从业者的流行度(以GitHub星标数衡量)以及最近基准测试文献中报告的性能 [9 (https://arxiv.org/html/2608.18289#bib.bib9)] [20 (https://arxiv.org/html/2608.18289#bib.bib8)]。所有模型均使用预训练权重,未进行任何进一步微调。评估了以下引擎:Pytesseract [27 (https://arxiv.org/html/2608.18289#bib.bib11)]、PP-OCRv5 (PaddleOCR) [5 (https://arxiv.org/html/2608.18289#bib.bib12)]、PP-StructureV3 (PaddleOCR) [5 (https://arxiv.org/html/2608.18289#bib.bib12)]、MinerU [30 (https://arxiv.org/html/2608.18289#bib.bib13)]、EasyOCR [11 (https://arxiv.org/html/2608.18289#bib.bib14)] 和 docTR [15 (https://arxiv.org/html/2608.18289#bib.bib15)]。表2 (https://arxiv.org/html/2608.18289#S3.T2) 概述了每个模型的输入、输出和语言配置。表3 (https://arxiv.org/html/2608.18289#S3.T3) 详细说明了指定引擎的架构组件,选择基于每个引擎官方文档和基准测试中指示的最高性能选项。

表2:OCR模型配置和输出格式。
表3:OCR模型架构组件(仅指定模型)。

为了从OCR输出中提取相关的结构化信息,我们特意选择了一个LLM以减少变量,并将重点放在模型规模的影响上。选择了Qwen3 [31 (https://arxiv.org/html/2608.18289#bib.bib10)],这是一个2025年发布的现代模型家族,因为它在单一架构内提供了广泛的参数数量。评估了五种参数规模,详见表4 (https://arxiv.org/html/2608.18289#S3.T4)。

表4:Qwen3模型架构参数 [31 (https://arxiv.org/html/2608.18289#bib.bib10)]。上下文长度由Ollama [23 (https://arxiv.org/html/2608.18289#bib.bib22)] 指定。Q/KV头指查询和键值注意力头 [29 (https://arxiv.org/html/2608.18289#bib.bib21)]。

#### 基于VLM的提取

VLM的选择遵循与OCR引擎类似的标准,参考了Ollama模型库中最常用的模型以及近期文献 [14 (https://arxiv.org/html/2608.18289#bib.bib28)]。努力使各模型的参数数量大致相当,约为300亿参数,尽管并非所有模型都提供了变体。

相似文章

大型语言模型用于安全数据提取的基准测试

arXiv cs.CL

本文对四种大型语言模型(Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70B)从安全数据表中提取结构化信息的能力进行了基准测试,发现基于文本的提取结合思维链提示可获得最高准确率(Gemini 1.5 Pro 为84%),但没有任何模型超过工业可靠部署所需的90%阈值。