LV-ROVER: 多流Tesseract投票用于马耳他语段落OCR
摘要
本文介绍了LV-ROVER,一个用于马耳他语OCR的多流Tesseract集成系统,通过合成数据训练和后处理,字符错误率降低了70%,解决了马耳他语低资源OCR的挑战。
arXiv:2607.00250v1 公告类型:新
摘要:马耳他语拥有不错的文本语料库和预训练语言模型,但与那些拥有大型OCR基准测试的少数语言一样,只有一个人所共知的真实标记PDF语料库用于OCR训练,共57页,远低于段落级训练所需:即专门针对OCR的低资源场景。由于缺乏可大规模训练的真实语料库,我们构建了一个合成训练流程和一个5流Tesseract LV-ROVER集成系统,并在一个包含422段落的基准测试上报告结果,与微调后的Tesseract基线(字符错误率CER为0.0234)进行比较。仅集成识别就将CER降低了44%,降至0.01317;一个五阶段后处理链使得整个流程的CER降至0.00700,降低了70%。该链的大部分是排版规范化,但其中一个阶段是恢复误读的变音符号,而不是对齐标点符号,因此我们将其报告为识别增益,而不是将整个链归为一个标签。我们将44%的数字视为识别器所学内容的可移植估计,而70%的数字则特定于该基准测试的标签约定。
查看缓存全文
缓存时间: 2026/07/02 05:36
# LV-ROVER:面向马耳他语段落 OCR 的多流 Tesseract 投票集成 来源:https://arxiv.org/html/2607.00250 ###### 摘要。 马耳他语拥有不错的文本语料库和预训练语言模型(Micallef 等人,2022 (https://arxiv.org/html/2607.00250#bib.bib17)),但与拥有大规模 OCR 基准测试的少数几种语言不同,据我们所知,它只有一个已知的、带标签的真实 PDF 语料库可用于 OCR 训练,共 57 页(Tanti 等人,2023 (https://arxiv.org/html/2607.00250#bib.bib22)),远低于段落级训练的需求:在 OCR 领域属于低资源语言。由于缺乏可用于大规模训练的真实语料库,我们构建了一个合成训练流水线和一个 5 流 Tesseract LV-ROVER 集成系统,并在一个包含 422 个段落的基准测试上报告了结果,该基准测试基于微调后的 Tesseract 基线,字符错误率(CER)为 0.0234。仅集成识别就使 CER 降低了 44%,达到 0.01317;一个五阶段的后处理链将完整流水线的 CER 降至 0.00700,降低了 70%。该链的大部分工作是字体规范化,但有一个阶段是恢复误读的变音符号,而不是对齐标点符号,因此我们将其报告为识别增益,而不是将整个链归为一个标签。我们将 44% 的降幅视为识别器所学内容的可移植估计值,而 70% 的降幅则特定于该基准测试的标签约定。 OCR,低资源语言,马耳他语,合成数据,字符错误率 ††copyright:none工作论文,未经同行评审。 ## 1. 引言 马耳他语是唯一拥有欧盟官方地位的闪米特语言。其大约 52 万母语者积累了数个世纪的档案文本(议会记录、法律公报、教会文件、历史报刊),这些文本因未大规模数字化而无法被搜索。OCR 是前提条件。但马耳他语也是一个困难的 OCR 目标:其 30 个字母的字母表在标准拉丁字母基础上增加了 Ċ ċ, Ġ ġ, H̄ h̄, Ż ż 以及二合字母 Gh̄ gh̄ 和 Ie ie,字体经常无声地将带变音符号的字母替换为基础字母,定冠词通过结构连字符(il-kelb, id-dar, fis-seh̄h̄)附着在后面的名词上,该连字符与软换行连字符共享 U+002D 码位。我们所知的唯一带标签的真实马耳他语 PDF 数据来自于 NOMOCRAT 注释项目(Tanti 等人,2023 (https://arxiv.org/html/2607.00250#bib.bib22)):57 个 PDF 页面,包含行和段落转录。这比训练一个段落级识别器所需的量级低了几个数量级,并且我们发现没有迹象表明该数据集已在该项目之外发布供重复使用。 三个技术挑战塑造了此处描述的系统。首先,任何静默地将 c 替换为 ċ 的分词器或字体都会在编码器或渲染阶段破坏标签;我们将四个变音符号对(ċ/c, ġ/g, h̄/h, ż/z)视为不合格哨兵(或称金丝雀),在流水线的每个阶段进行跟踪。其次,软连字符与结构连字符之间的区别无法仅凭字形在词汇层面决定:两者都使用 U+002D 码位,因此解析需要语言模型或具有马耳他语形态学知识的基于规则的连接器(Borg and Gatt,2017 (https://arxiv.org/html/2607.00250#bib.bib6);马耳他语语言资源服务器,2025 (https://arxiv.org/html/2607.00250#bib.bib15))。第三,基准测试的金标约定决定了哪些改进是真实的。开发集金标标签使用弯引号(‘ ’ “ ”)和长破折号(—);Tesseract 的原始输出使用直 ASCII 码。将一种规范化到另一种会产生巨大的 CER 下降,这与识别质量无关。我们通过双 CER 协议使其明确化。 本文描述了 LV-ROVER 系统:五个并行的 Tesseract LSTM 流在一个软马耳他语词典下对每个单词进行投票,然后进行一个五阶段的标签约定规范化链和一个基于规则的行连接器。我们在一个包含 422 个段落的马耳他语基准测试上对其进行了评估,微调后的 Tesseract 基线 CER 为 0.0234,并使用一个留出测试集(DocEng 2026 组织者,2026 (https://arxiv.org/html/2607.00250#bib.bib8))。推理在严格的计算限制下运行:仅 CPU,无 GPU,初始化后无网络连接,这排除了将大型神经解码器作为直接的替代方案,并促使了小型模型集成设计。 贡献如下: - • 一个可复现的马耳他语段落合成流水线:涵盖十一种带变音符号领域配置的语料文本,经过字形映射和光栅层面金丝雀集验证的 68 种字体,接近真实 PDF 的数据增强,以及在训练时对软连字符、结构连字符和复合连字符进行逐个样本标记。 - • 一个双 CER 报告协议,将识别增益与标签约定对齐增益分开,并附带消融审计,检查每个规范化规则在留出合成 CER 上的表现,以排除对基准测试的过拟合。 - • 一个基于规则的行连接器,其输出随后被规范化,去除软连字符标记并将仅存在于图像中的短破折号转换为标签所需的长破折号,该连接器在编写任何自定义逻辑之前就针对基准测试的连字符子集进行了验证。 - • 一个为低资源投票调整的 5 流 LV-ROVER 集成:软词典置信度加权、保留变音符号的编辑距离边界、以及通过语言链和图像尺度而非训练数据重采样实现的多样性。 - • 一个变音符号金丝雀检查,在每次流水线运行的分词器、字体和后处理阶段跟踪四个哨兵对。 马耳他语 OCR 的先前工作仅限于 NOMOCRAT(Tanti 等人,2023 (https://arxiv.org/html/2607.00250#bib.bib22)),该工作确立了本系统所要解决的连字符连接和标签约定挑战,但其规模太小,无法训练段落级识别器。 ## 2. 系统概览 该系统包含训练端和推理端。训练端从文本源渲染合成裁剪图像,并在此之上微调 Tesseract LSTM。推理端在图像上运行五个并行的 Tesseract 流;每个流的原始逐行输出被独立连接成一个段落字符串并进行规范化(去除软连字符,将短破折号转换为长破折号),然后由一个基于词典的 ROVER 对连接后的各流结果进行投票,之后对投票结果运行标签约定规范化链。 五流集成的设计原则是在不重训练的情况下实现多样性。一个有用的投票要求各流在不同字符上出错。我们改变三个独立的轴:语言链(仅马耳他语、马耳他语加意大利语、马耳他语加意大利语和法语)、训练数据(微调后的识别器与库存识别器),以及图像尺度(原生裁剪与 2 倍放大裁剪)。每个轴都会改变识别器混淆的字符,因此投票可以恢复任何单个流会丢失的字符。这是运行五流而不是一流的主要原因;流水线中的其他所有部分都是为了支持这个投票而存在或服务的。 ### 2.1. 流水线 图 1 (https://arxiv.org/html/2607.00250#S2.F1) 展示了五个阶段:一个文本源从大型语料库中抽取马耳他语段落(第 3.1 节 (https://arxiv.org/html/2607.00250#S3.SS1));一个渲染器将它们转换成具有真实字体和退化的段落裁剪图像(第 3.2 节 (https://arxiv.org/html/2607.00250#S3.SS2));这些裁剪图像微调 Tesseract 5 LSTM(第 4 节 (https://arxiv.org/html/2607.00250#S4));在推理时,五个并行流各自转录图像并将逐行输出连接成一个段落字符串,之后一个基于词典的 LV-ROVER 投票按单词合并各流结果(第 4 节 (https://arxiv.org/html/2607.00250#S4));一个规范化链将排版约定解析为最终字符串(第 4 节 (https://arxiv.org/html/2607.00250#S4))。无需 GPU。 参见图注图 1。LV-ROVER 流水线。左侧:离线合成训练。右侧:逐图像推理。 ## 3. 合成数据流水线 由于缺乏可用规模下带标签的真实马耳他语 PDF 数据,合成流水线就是该项目的核心。本节描述了对于迁移到其他低资源文字而言重要的选择。 ### 3.1. 文本源 马耳他语文本从 korpus_malti 语料库(版本 4.2)(Micallef 等人,2022 (https://arxiv.org/html/2607.00250#bib.bib17);MLRS,2026 (https://arxiv.org/html/2607.00250#bib.bib18))中抽取,该语料库包含 4.67 亿词元,涵盖 19 个领域。我们使用了十一种带变音符号的领域配置¹¹¹议会记录、维基百科、政府公报、法律、非虚构作品、学位论文、法律文本、演讲、博客、大学存储库资料和通用网络文本。并跳过了两种配置。一种配置的句子顺序被打乱,破坏了段落级别的一致性;另一种配置去除了变音符号,其金丝雀字母密度比其他配置低两个数量级,这会稀释变音符号信号,导致模型在 ċ, ġ, h̄, ż 上训练不足。这两种排除都是数据质量决策,而非随意决定。当主要语料库不可用时,一个后备流从维基百科 mt 和马耳他语通用依存树库(均为 CC-BY-SA 许可,无需申请)抽取数据。英语代码切换材料以 12% 的比例从一个小的干净固定集混合进来。抽取过程按领域保留段落和句子顺序。 ### 3.2. 渲染器 渲染器是一个与 SynthTIGER 兼容的封装器(Yim 等人,2021 (https://arxiv.org/html/2607.00250#bib.bib24)),使用 Pillow 进行段落布局。每个渲染的样本输出一张图像、一个标签字符串、每行标签部分(在每行断开位置带有一个不可见的软连字符标记 U+00AD,该标记仅在实际换行时渲染)、以及记录每行边界框、字体和连字符类型的元数据。 最重要的校准是分辨率。合成图像与真实图像之间的领域差异是更广泛的合成数据和场景文本文献中公认的问题,既存在于合成训练图像如何生成方面(Gupta 等人,2016 (https://arxiv.org/html/2607.00250#bib.bib11)),也存在于不一致的条件如何混淆模型比较方面(Baek 等人,2019 (https://arxiv.org/html/2607.00250#bib.bib2));我们的分辨率不匹配是该类问题的一个特定的、可测量的实例。早期版本的渲染器在未降采样的情况下以 300 DPI 生成图像。真实的基准测试裁剪图像的有效分辨率约为 150–200 DPI(10 pt 下每行平均 42 像素),因此 300 DPI 的渲染图像太大了一倍,抑制了向真实图像的迁移。修正后的渲染器应用半分辨率 Lanczos 缩放并以 JPEG 质量 72 重新编码,以匹配真实裁剪图像的统计数据,通过一次干运行确认,其每行像素数为 39-40,而真实值为 42。这个分辨率不匹配是项目中合成到真实领域差距的最大单一来源;而发现它较晚是神经解码器分支(第 6 节 (https://arxiv.org/html/2607.00250#S6))未能达到公平比较的一个促成因素。 接近真实 PDF 的数据增强以固定链的形式应用:旋转、模糊、亮度/对比度抖动、可选墨迹扩散和列边缘裁剪、轻微弹性变形、椒盐噪声以及 JPEG 重新编码。后续添加的内容包括块状噪声、页面边缘阴影和亚像素模糊,以匹配扫描 PDF 的伪影。场景文本操作(透视扭曲、运动模糊、眩光)被禁用,因为它们不会出现在 PDF 裁剪图像中。TRDG(Belval,2019 (https://arxiv.org/html/2607.00250#bib.bib4))曾被评估用于行裁剪,但在段落合成中未被采用,因为 SynthTIGER 的布局原语更适合。 渲染器还会标记它绘制的每个连字符的类型:软连字符(换行分割)、结构连字符(附着词素表面形式,如 il- 和 fis-)或复合连字符(单词内部)。这个标记使我们能够仅测量连接器在软连字符上的准确性,而软连字符正是连接器旨在修复的情况,不会因需要保留而非移除的结构连字符而污染测量结果。 ### 3.3. 字体目录 字体是第二个失败点:字体可能在渲染时静默地将基础拉丁字母替换为马耳他语变音符号,这是在阿姆哈拉语 OCR 流水线中报告过的一种失败模式(Belay 等人,2020 (https://arxiv.org/html/2607.00250#bib.bib3));跨文字迁移相关低资源文字具有其自身相关的风险(Medhanie and Ni,2026 (https://arxiv.org/html/2607.00250#bib.bib16))。我们从更大的候选池中精心挑选了 68 种字体(62 种印刷体,6 种手写体),均采用宽松许可证(SIL Open Font License、GUST、Apache 2.0、DejaVu),占用磁盘空间 31 MB。每个候选字体在进入渲染器池之前,都会通过 fontTools 检查字符映射中是否存在金丝雀字形 Ċ ċ Ġ ġ H̄ h̄ Ż ż à ì ò ù;有五个候选字体未能通过此检查,其字符映射中缺少一个或多个 Ċ ċ Ġ ġ H̄ h̄,还有一组候选字体在下载时无法访问。此检查能捕获完全缺失的字形;但它不能验证存在的字形在视觉上是否与其 ASCII 基础字形有区别,因此,如果一种字体声明了变音符号但渲染效果与普通字母相同(这是先前低资源 OCR 工作中指出的特定风险),则此检查无法单独捕获。我们将此视为验证器中的一个开放差距,而非已解决的问题。 ### 3.4. 数据分片 三个批次的合成数据被具体化到磁盘上;表 1 (https://arxiv.org/html/2607.00250#S3.T1) 给出了大小和用途。 表 1. 合成训练数据分片。批次 2 还用作连接器的往返测试集(第 4 节 (https://arxiv.org/html/2607.00250#S4))。 ## 4. 模型与连接器 ### 4.1. 识别器与基准锚点 识别器是 Tesseract 5 LSTM(Smith,2007 (https://arxiv.org/html/2607.00250#bib.bib19);Smith 等人,2009 (https://arxiv.org/html/2607.00250#bib.bib20)),在 50k 个合成段落裁剪图像上进行了微调。结合基于规则的行连接器,它在基准测试上独立达到了 CER 0.01605;我们将其视为内部回归标杆,后续每个候选方案都将与之进行比较,并依次报告相对于该内部标杆以及基准测试自身微调 Tesseract 基线(CER 0.0234)的结果。金丝雀变音符号和两个标签所需的破折号通过包含 117 个字符的训练库存进行往返验证。结构附着词素连字符(il-, is-, id-, fis- 等)在连接器的换行修复中永远不会被移除;仅存在于图像中的短破折号被规范化为长破折号。一个独立的附着词素列表在评分时合并金标侧的间距噪声(第 6 节 (https://arxiv.org/html/2607.00250#S6))。Tesseract 是确定性的;推理在 CPU 上运行。 ### 4.2. LV-ROVER 集成 五种 Tesseract 配置在一个软马耳他语词典下对每个单词进行投票:微调的马耳他语;微调的马耳他语+意大利语;微调的马耳他语+意大利语法语;库存的马耳他语;在 2 倍放大裁剪图像上的微调马耳他语+意大利语。每个轴都会产生独立的错误:意大利语和法语提供了拉丁变音符号,其训练方式与仅马耳他语链不同;库存与微调改变了训练先验;放大则使字符跨越模糊阈值。当错误轴独立时,投票可以恢复任何单个流丢失的内容。在运行时出错的流会被丢弃;投票会退回到少于五个候选流,而不是导致转录失败。 完整程序见算法 1 (https://arxiv.org/html/2607.00250#algbox1)(附录 A (https://arxiv.org/html/2607.00250#A1))。该投票改编自 LV-ROVER(Stuner 等人,2017 (https://arxiv.org/html/2607.00250#bib.bib21)),它是 ROVER(Fiscus,1997 (https://arxiv.org/html/2607.00250#bib.bib10))的一个扩展。原始方法对齐许多识别器实例的输出,并在封闭集词典约束下按位置进行投票。我们针对马耳他语低资源环境做了两个修改。首先,词典是一个软 Ma
相似文章
@techNmak:1.7B 参数轻量 VLM,在 OmniDocBench 上碾压巨头的 OCR 新王者
仅 1.7B 参数的多语言文档解析器 dots.ocr,用轻量体积实现 SOTA,证明文档理解无需巨无霸模型。
OvisOCR2:一款有前景的0.8B本地文档解析器
OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。
跨时间僧伽罗语OCR:页面级自适应与历时分析
本文介绍了 sinhala-ocr-lk-acts-1010,这是首个公开可用的真实场景页面级僧伽罗语OCR数据集,并使用QLoRA对三种视觉语言模型(DeepSeek-OCR V1、DeepSeek-OCR V2、LightOnOCR-2-1B)进行了微调。LightOnOCR-2-1B实现了1.05%的字符错误率(CER),优于开源和商业OCR模型,并在不同时期的退化文档中保持了稳定的性能。
OvisOCR2 技术报告
OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。
基于LLM的跨语言手写OCR自动机器学习:利用GPT-5、GPT-4o和Claude Sonnet 4的闭环神经架构搜索
本文提出了一种基于LLM的流水线,利用GPT-5、GPT-4o和Claude Sonnet 4自动设计跨语言手写OCR的神经网络架构,在阿拉伯语、英语和波斯语文本上实现了超过93%的准确率,无需人工干预。