DocOCR-Eval:一种无需真实标注、基于校正的OCR工具选择框架

arXiv cs.LG 论文

摘要

DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。

arXiv:2607.16203v1 公告类型:新 摘要:文档解析是文档理解任务(如视觉问答和关键信息提取)的基础步骤,它通过提取文本、视觉和布局信息,将非结构化的扫描图像转化为结构化表示。尽管已开发出众多光学字符识别(OCR)引擎和多模态大语言模型(MLLMs),但在标签稀缺的场景中,为给定的文档集合选择适当的文档解析方案仍然具有挑战性。在本工作中,我们对多种OCR引擎和最先进的MLLM在多个跨领域和语言的扫描文档基准上的文本识别性能进行了系统评估。受限于许多OCR引擎的上下文推理能力不足以及手动标注成本高昂,我们提出了DocOCR-Eval——一种无需标注的评估框架,用于自动评估和选择OCR工具。DocOCR-Eval采用三阶段校正和排序策略,在无需真实标签的情况下近似基于标注的工具排序。我们表明,聚合多个MLLM逐步提高了与基于标注的排序的一致性。大量实验进一步证明,在现实的、标签有限的场景中可以实现可靠的OCR工具选择,为在不同真实文档集合中部署文档解析系统提供了实用指导。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:45

# DocOCR-Eval: 一种无需真值、基于修正的OCR工具选择框架

来源: https://arxiv.org/abs/2607.16203  
查看PDF (https://arxiv.org/pdf/2607.16203)

> 摘要:文档解析是文档理解任务(如视觉问答和关键信息提取)的基础步骤,它将非结构化的扫描图像通过提取文本、视觉和布局信息,转化为结构化表示。尽管已有众多光学字符识别(OCR)引擎和多模态大语言模型(MLLMs)被开发用于此目的,但针对给定的文档集合选择恰当的文档解析方案仍具挑战性,尤其是在标签稀缺的场景下。在本工作中,我们对多种OCR引擎和前沿MLLMs在不同领域和语言的多个扫描文档基准上进行了系统的文本识别性能评估。受限于许多OCR引擎有限的上下文推理能力以及人工标注的高昂成本,我们提出了DocOCR-Eval——一种无需标注的自动OCR评估与选择框架。DocOCR-Eval采用三阶段的修正与排序策略,在无真实标签的情况下近似实现基于标注的工具排序。我们证明,整合多个MLLMs能够逐步提升与基于标注排序的一致性。大量实验进一步表明,在现实且标签有限的场景下可以实现可靠的OCR工具选择,从而为在多样化的实际文档集合中部署文档解析系统提供实践指导。

## 提交历史

来自: 丁一浩 [查看邮箱 (https://arxiv.org/show-email/372a8354/2607.16203)]  
**[v1]** 2026年5月5日星期二 10:59:34 UTC (927 KB)

相似文章

DocAtlas:跨越80多种语言的多语言文档理解

Hugging Face Daily Papers

DocAtlas是一个框架,通过差异渲染和合成生成,构建了覆盖82种语言的高保真OCR数据集和基准。它表明,直接偏好优化能够改善多语言模型的适配,而不会降低基础语言的性能。

在Papers with Code一站式寻找最佳开源OCR模型 [P]

Reddit r/MachineLearning

Papers with Code上的一个精选页面列出了顶级开源OCR模型和基准测试,重点介绍了百度(Unlimited OCR)和Mistral(OCR 4)的新发布,旨在支持RAG等AI智能体应用场景。