ICDAR 2026 HIPE-OCRepair竞赛:基于LLM的历史文档OCR后校正
摘要
本文介绍了ICDAR 2026的HIPE-OCRepair-2026竞赛,评估了使用LLM对英语、法语和德语历史文档进行OCR后校正的效果。结果表明,现代LLM系统能显著提升OCR质量,但在低噪声输入上的过校正仍是一个挑战。
arXiv:2607.08143v1 公告类型:新
摘要:我们展示了HIPE-OCRepair-2026的结果,这是ICDAR关于基于LLM的历史文档OCR后校正竞赛。OCR后校正仍是数字遗产领域长期存在的挑战:大规模数字化文档集受到遗留OCR错误的影响,而大规模重新数字化仍不现实。大语言模型(LLM)为重新审视这一挑战提供了重要机遇,但其在不同语言、文档类型和噪声条件下的有效性,以及其产生幻觉的倾向,仍未被充分理解。HIPE-OCRepair-2026追求两个目标:(i)评估现代OCR后校正系统的能力;(ii)提供一个基于HIPE-OCRepair-2026数据集的可重复评估框架,该数据集是一个合并了现有和新整理的历史数据集的统一多语言资源。参赛者的任务是在不访问源图像的情况下,对来自17至20世纪英语、法语和德语的历史报纸和印刷作品的噪声OCR转录进行校正,工作在连贯的转录单元(段落或文章)级别。评估采用面向检索而非外交式的评分方法,反映了对数字化文档集进行搜索和访问的实际用例。四支队伍提交了系统,范围从零样本提示到持续预训练和微调,提供了对不同适应策略优缺点的见解。结果表明,基于LLM的现代系统可以显著提升OCR质量,但性能在不同数据集、语言和噪声水平上有所差异。对低噪声输入的过校正成为反复出现的挑战,凸显了超越字符错误减少的评估的重要性。数据集、评分器和评估管道已公开发布,以支持未来研究。
查看缓存全文
缓存时间: 2026/07/10 06:13
# ICDAR 2026 HIPE-OCRepair 竞赛:基于 LLM 的历史文档 OCR 后校正 来源:https://arxiv.org/html/2607.08143 11institutetext:École Polytechnique Fédérale de Lausanne \(EPFL\),瑞士 11email:22institutetext:苏黎世大学,瑞士 22email:Emanuela BorosJuri OpitzAndrianos MichailFlorian WagnerSimon Clematide ###### 摘要 我们介绍了 HIPE-OCRepair-2026 竞赛的结果,这是一项关于利用大语言模型(LLM)对历史文档进行 OCR 后校正的 ICDAR 竞赛。OCR 后校正一直是数字遗产领域的一项长期挑战:大规模数字化文档集合受到遗留 OCR 错误的影响,而大规模重新数字化又不切实际。大语言模型(LLM)为重新审视这一挑战提供了重大机遇,然而它们在跨语言、跨文档类型和跨噪声条件下的有效性——以及它们倾向于产生幻觉的问题——仍未得到充分理解。 HIPE-OCRepair-2026 追求两个目标:(i) 评估现代 OCR 后校正系统的能力,以及 (ii) 提供一个可复现的评估框架,该框架基于 HIPE-OCRepair-2026 数据集,这是一个整合了现有和新策划的历史数据集的统一多语言资源。参赛者负责校正来自历史报纸和印刷品(英语、法语和德语,17 至 20 世纪)的噪声 OCR 转录文本,工作在连贯的转录单元级别(段落或文章),且无法访问源图像。评估采用面向检索而非外交式记分的方法,反映了在数字化馆藏中进行搜索和访问的实际应用场景。 四支队伍提交了系统,方法涵盖从零样本提示到继续预训练和微调,为不同适应策略的优劣提供了见解。结果表明,现代 LLM 辅助系统可以显著提高 OCR 质量,但性能因数据集、语言和噪声水平而异。对低噪声输入的过度校正成为一个反复出现的挑战,凸显了评估不能仅限于字符错误率的降低。数据集、评分器和评估流程已公开发布以支持未来研究。 ## 1 引言 历史馆藏的大规模数字化已使数百万页的报纸、书籍和档案记录可供世界各地的研究人员搜索和获取[17 (https://arxiv.org/html/2607.08143#bib.bib22),3 (https://arxiv.org/html/2607.08143#bib.bib3)]。然而,所得文本的质量参差不齐。许多馆藏是在多年前使用当时技术受限的 OCR 系统处理的,即使现代引擎也难以应对历史文档带来的特定挑战:劣化的纸张和墨水、非标准字体、复杂布局以及多语言内容都导致了难以避免的识别失败[14 (https://arxiv.org/html/2607.08143#bib.bib15),22 (https://arxiv.org/html/2607.08143#bib.bib30)]。结果是,数字化所提供的内容与下游应用(从关键词搜索和信息检索到命名实体识别和大规模语料分析)所需的内容之间,存在系统性差距[8 (https://arxiv.org/html/2607.08143#bib.bib8),29 (https://arxiv.org/html/2607.08143#bib.bib38),12 (https://arxiv.org/html/2607.08143#bib.bib14),6 (https://arxiv.org/html/2607.08143#bib.bib6),9 (https://arxiv.org/html/2607.08143#bib.bib44)]。 OCR 后校正,即在不重新处理源图像的情况下自动改进现有转录文本,是对这一挑战的长期回应[19 (https://arxiv.org/html/2607.08143#bib.bib24)]。尽管数十年研究涵盖了基于规则的方法、统计模型和神经序列到序列方法[1 (https://arxiv.org/html/2607.08143#bib.bib2),21 (https://arxiv.org/html/2607.08143#bib.bib29)],但该问题远未解决。性能对语言、历史时期、文档类型和噪声特征高度敏感,且在异质馆藏中的稳健泛化仍然难以实现[25 (https://arxiv.org/html/2607.08143#bib.bib33)]。与此同时,累积的“OCR 债务”——大量已数字化但转录质量不足的页面——使得重新数字化不切实际,因为处理数百万页需要大多数机构无法维持的基础设施、资金和协调。 大语言模型(LLM)的兴起为重新审视这一挑战提供了新的机遇。这些模型在大量高质量文本上训练,能够在零样本和少样本设置下执行“噪声到干净”的转换。它们利用广泛上下文信息的能力使其成为大规模校正退化历史转录文本的有前途的候选方案。近期研究探索了一系列方法:基于提示的零样本校正(使用大型专有和开源模型)[11 (https://arxiv.org/html/2607.08143#bib.bib13),31 (https://arxiv.org/html/2607.08143#bib.bib41),5 (https://arxiv.org/html/2607.08143#bib.bib5),15 (https://arxiv.org/html/2607.08143#bib.bib16)];在配对 OCR/真实文本对上对编码器-解码器或仅解码器架构进行微调和指令微调[23 (https://arxiv.org/html/2607.08143#bib.bib31),28 (https://arxiv.org/html/2607.08143#bib.bib34),16 (https://arxiv.org/html/2607.08143#bib.bib19)];以及结合错误检测与生成校正的混合流程[4 (https://arxiv.org/html/2607.08143#bib.bib4),16 (https://arxiv.org/html/2607.08143#bib.bib19)]。在这些研究中,微调模型通常优于零样本方法,而元数据和上下文线索提供了不同程度的益处。然而,更全面的图景仍不明朗:LLM 性能因语言、历史时期和错误类型而有很大差异,现有结果分散在难以直接比较的异质实验设置中[5 (https://arxiv.org/html/2607.08143#bib.bib5),15 (https://arxiv.org/html/2607.08143#bib.bib16)]。 关键在于,OCR 后校正并非无约束的文本生成,因为历史文档是一手资料,其文本内容应被保留。一个默默现代化词汇或引入合理但不存在的欺骗性内容(即产生幻觉而非校正)的模型,并非改进转录文本,而是篡改了源材料。因此,LLM 能否在不同馆藏中可靠地校正历史 OCR 而不会降低内容质量或产生幻觉,仍然是一个悬而未决的问题。一个主要应用场景是信息检索:搜索数字化档案的用户依赖准确的转录文本来定位相关文档,而字符级错误,即使发生率不高,也可能导致单词不可搜索,从而产生不完整的检索结果。 HIPE-OCRepair-2026^1^1https://hipe-eval.github.io/HIPE-OCRepair-2026/ 直接针对这些问题:现代基于 LLM 的系统能否减少遗留数字化馆藏中的 OCR 错误,同时避免过度校正和幻觉?我们的评估活动采用面向检索的视角,优先考虑语言准确性而非完全外交式转录。特别是,它强调恢复正确的词形,而非忠实地再现对搜索和基于文本的分析影响较小的排版或布局特征。这一设计选择体现在评分前应用的规范化中(第4节 (https://arxiv.org/html/2607.08143#S4))。 OCR 后校正此前已在 ICDAR 共享任务中得到解决。2017 年竞赛[7 (https://arxiv.org/html/2607.08143#bib.bib7)]首次引入了对历史报纸数据的系统评估,2019 年版[20 (https://arxiv.org/html/2607.08143#bib.bib27)]扩展了范围并完善了评估协议。HIPE-OCRepair-2026 继承这一传统,并在三个方面进行了扩展。第一,它明确针对基于 LLM 及其他现代生成式方法的 OCR 校正。第二,它基于 HIPE-OCRepair-2026 数据集,这是一个统一的跨语言基准,将现有和新策划的数据集按照统一的分割和转录指南进行整合,并在需要时对参考转录文本进行选择性修正。第三,它提供了一个完全可复现的评估框架,包括标准化指标、官方评分器和用于系统性跨系统比较的评估流程。 本文其余部分结构如下。第2节 (https://arxiv.org/html/2607.08143#S2) 定义了任务。第3节 (https://arxiv.org/html/2607.08143#S3) 描述了 HIPE-OCRepair-2026 数据集。第4节 (https://arxiv.org/html/2607.08143#S4) 介绍了评估框架。第5节 (https://arxiv.org/html/2607.08143#S5) 描述了基线及参赛系统。第6节 (https://arxiv.org/html/2607.08143#S6) 展示并讨论了结果。第7节 (https://arxiv.org/html/2607.08143#S7) 总结了发现与展望。 ## 2 任务定义 HIPE-OCRepair-2026 是一个后校正任务:给定历史文档的噪声 OCR 转录文本,系统必须生成一个更接近人工校验参考文本的校正后转录文本。遵循 OCR 后校正的标准做法,系统仅对文本进行操作,无法访问源文档图像。这反映了 OCR 债务场景的实际状况,即目标是在不重新处理原始扫描件的情况下,大规模改进现有转录文本。 输入包括一个*OCR 假设*和相关的*文档元数据*。OCR 假设是一个*转录单元*的原始转录文本——该单元是一段连贯的文本,为校正提供足够的上下文,通常是一个段落或一篇文章——可能包含字符替换、插入、删除和布局伪影。元数据指定源文档的语言,以及可用的额外上下文信息,如大致日期和出版物标题。预期输出是 OCR 假设的校正后转录文本。系统将针对同一转录单元的人工校验*参考转录文本*进行评估^2^2参见:https://github.com/hipe-eval/HIPE-OCRepair-2026-data/blob/main/README-Participation-Guidelines.md。 此任务对基于 LLM 的方法提出了特殊挑战。输入可能包含严重扭曲,掩盖了词汇和句法结构,但系统必须仅凭文本证据推断校正,无法访问源图像。更根本的是,后校正是一个受约束的任务:系统应恢复预期的词形并提高转录忠实度,但不得引入源文本中不存在的内容或推测性解决歧义。这使该任务与自由文本生成或释义截然不同。这也意味着 LLM 的特性——其流畅性、对当代语言的偏向、产生幻觉的能力——既可能成为优点也可能成为缺点。这些困难因系统必须处理的多样化的语言、历史时期、文档类型和噪声特征而加剧;OCR 假设及其参考转录文本的具体示例可在任务网站上找到。 ## 3 数据:HIPE-OCRepair-2026 数据集 该竞赛基于 HIPE-OCRepair-2026 数据集,这是一个历史文档的平行 OCR 与真实文本对的统一多语言基准。它涵盖三种语言——英语、法语和德语——以及两种文档类型——历史报纸和印刷书籍——时间跨度从 17 世纪到 20 世纪。该数据集结合了经过大量重新整理的四个现有数据集和一个为此共享任务新创建的数据集(impresso-snippets)。表1 (https://arxiv.org/html/2607.08143#S3.T1) 提供了概览^3^3另见 https://github.com/hipe-eval/HIPE-OCRepair-2026-data/blob/main/documentation/README.md。 ### 3.1 整理原则 现有数据集在转录策略、分割策略和真实文本质量方面存在显著差异。因此,所有数据集都通过一个统一的整理流程处理,包括格式标准化、质量过滤(移除 CER>0.15 或极短单元的文档)、转录单元统一以及开发和测试真实文本的系统性人工修订。统一确保校正目标既不过短(避免单行)也不过长(无关内容的过度聚合)。相比之下,训练集保留其原始转录文本,统一仅限于分割和格式化。 一个核心整理决策是采用半外交式转录标准,该标准优先考虑语言学上可解释的词形,同时不保留所有历史字形或排版细节,如连字或非现代字母形式(如长 s)。此外,将从连字符换行继承而来的空白伪影进行了规范化,例如,原本跨行分割的单词在原始真实文本中以内部空白表示的情况。这一选择反映了信息检索的主要应用场景,对于该场景,轻量标准化的词形比严格保留历史或排版变体更有用。 如果原始数据中存在布局信息,则将其保留在基准文件中,以支持潜在的布局感知使用。特别是,软连字符被明确整理以标记跨行断词,而不是作为偶然的布局伪影被丢弃。系统不需要在其输出中复现布局信息。整理过程及转录指南的完整文档将在专门的基准论文中提供。 ### 3.2 数据集描述 #### 3.2.1 dta19 该数据集由来自德国文本档案馆(Deutsches Textarchiv,DTA)[24 (https://arxiv.org/html/2607.08143#bib.bib32)] 的 39 本德语书籍(18-19 世纪)的页面样本组成,使用哥特体印刷。由于原始数据集包含图像/真实文本对但没有 OCR 假设,因此通过应用 Tesseract 哥特体模型生成 OCR[30 (https://arxiv.org/html/2607.08143#bib.bib42)]^4^4https://ub-backup.bib.uni-mannheim.de/~stweil/tesstrain/german_print_20231218/tessdata_best/german_print_20.traineddata。由于原始图像上的 OCR 对于具有挑战性的后校正设置来说过于准确,因此引入了受控图像退化,分为三个噪声级别:级别 0(无添加噪声)、级别 1(目标约 ≈3% CER)和级别 2(目标约 ≈7% CER)。定义了两个采样策略:*匹配*(所有噪声级别的相同页面)和*不匹配*(每个级别使用不同页面,以避免共享任务中的信息泄露)。官方竞赛评估使用了不匹配策略。 表 1:HIPE-OCRepair-2026 数据集概览。 #### 3.2.2 icdar2017 该数据集由来自 ICDAR 2017 OCR 后校正竞赛[7 (https://arxiv.org/html/2607.08143#bib.bib7)]的历史报纸组成,来源于法国国家图书馆和大英图书馆,作为 IMPACT 项目[2 (https://arxiv.org/html/2607.08143#bib.bib47)]的一部分进行数字化。原始材料包含非常长的连续文本序列,因此需要进行语义分块;低质量块被过滤掉(CER>0.15)。真实文本 o
相似文章
利用外部知识通过检索增强型大语言模型进行历史文档修复
本文介绍了ARI,一个利用检索增强型大语言模型修复历史文档中难以辨认部分的框架,通过将隐式的大语言模型知识与显式检索的外部历史背景相结合,显著提升了命名实体的修复效果。
@DanKornas:Dicklesworthstone/llm_aided_ocr 使用LLM驱动的文本校正对扫描PDF进行OCR GitHub:存档:
llm_aided_ocr 是一个 GitHub 项目,它对扫描的 PDF 执行 OCR,并使用 LLM 来纠正和改进提取的文本。
DocOCR-Eval:一种无需真实标注、基于校正的OCR工具选择框架
DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。
18 款 LLM OCR 实测(7k+ 次调用):便宜/旧模型常吊打旗舰,完整数据集+框架已开源 [R]
对 18 款大模型在 OCR 任务上的全面评测(7k+ 次调用)发现,便宜或旧模型往往能以极低成本达到与旗舰模型相当的准确率,数据集与评测框架已完全开源。
具备视觉能力的LLM与OCR在长文档(包括图表、图片、表格等)问答中的对比
一项对比测试,将具备视觉能力的LLM(原生PDF阅读模式)与基于OCR的流程在30份长且图片密集的PDF上进行比较,发现带有布局提取的OCR在图表/表格密集的页面上仍优于视觉模型,且失败率为0%,而原生PDF为7%,尽管样本量较小且许多差距在噪声范围内。