更新模型,同样优势

Hugging Face Blog 模型

摘要

DharmaOCR,一个专门用于巴西葡萄牙语OCR的模型,通过领域特定的微调和直接偏好优化,优于Mistral OCR4等较新的模型。文章解释了训练流程并展示了基准测试结果。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/16 16:24

更新模型,相同优势

来源:https://huggingface.co/blog/Dharma-AI/newer-models-same-advantages 返回文章列表 (https://huggingface.co/blog)

- 尽管架构更新,DharmaOCR 通过在巴西葡萄牙语上的领域专精和定向训练,仍然优于 Mistral OCR4 和 Unlimited-OCR。本文展示了这一优势的证据及其背后的机制。(https://huggingface.co/blog/Dharma-AI/newer-models-same-advantages#despite-newer-architectures-dharmaocr-outperformed-mistral-ocr4-and-unlimited-ocr-on-brazilian-portuguese-through-domain-specialization-and-targeted-training-this-article-presents-the-evidence-and-the-mechanism-behind-that-advantage)- 来源 (https://huggingface.co/blog/Dharma-AI/newer-models-same-advantages#source) - 延伸阅读 (https://huggingface.co/blog/Dharma-AI/newer-models-same-advantages#further-reading) https://huggingface.co/blog/Dharma-AI/newer-models-same-advantages#despite-newer-architectures-dharmaocr-outperformed-mistral-ocr4-and-unlimited-ocr-on-brazilian-portuguese-through-domain-specialization-and-targeted-training-this-article-presents-the-evidence-and-the-mechanism-behind-that-advantage尽管架构更新,DharmaOCR 通过在巴西葡萄牙语上的领域专精和定向训练,仍然优于 Mistral OCR4 和 Unlimited-OCR。本文展示了这一优势的证据及其背后的机制。

三个月前,我们发表了关于 DharmaOCR 的论文 (https://arxiv.org/abs/2604.14314),并开源了其中一个模型 (https://huggingface.co/Dharma-AI/Dharma-OCR-LITE)。目标非常具体:为巴西葡萄牙语设计的光学字符识别系统。

训练流程分两个阶段构建。第一阶段是监督微调,利用大量来自不同来源、格式和复杂度的葡萄牙语文件。这一阶段将模型权重与巴西葡萄牙语的特定词汇、语法和文档结构对齐,将表征能力集中在目标语言上,而不是分散到更广泛的多语言空间中。第二阶段应用了直接偏好优化:模型不仅学习正确的转录,还从竞争输出之间的比较偏好数据中学习,从而在推理时始终选择更好的提取结果。这一阶段解决了一个不同的问题:不是准确性,而是稳定性。通过抑制导致生成模型产生重复或混乱输出的失败模式,DPO 减少了推理时间和成本,并切实提高了模型在生产环境中的可靠性。

两者结合的结果是,在一个专注于葡萄牙语的基准测试中,该模型实现了最高的提取质量分数和最低的退化率。两个阶段都是必要的。微调阶段构建了领域能力;DPO 阶段确保了这种能力在模型容易失败的条件下的稳定性。

---

OCR 模型发展迅速。但最初促使 DharmaOCR 设计的差距——在复杂文档的提取质量和生产条件下的模型稳定性方面——并未消失。可以说,随着领域的变化,这些差距反而更具启发性。

多模态生成模型的普及使得基于语言模型的 OCR 广泛可用,随后涌现的大量微调 OCR 变体也反映了这种采纳的速度。然而,这种普及并没有改变这项技术的基本特征。每一个基于生成模型的 OCR 系统都是概率性的。转录错误是这种概率性技术的固有变量。区分模型的是它们犯了多少错误以及错误的类型。这由两个因素决定:模型的结构(其架构和参数数量)以及这些参数是如何针对任务训练的。

架构和参数数量决定了模型可以学习的上限。而训练决定了这些能力如何分配。

这种区别正是专精从设计偏好变为结构性问题的地方。当模型在受限领域(单一语言、有限的文档类型、特定任务)上训练时,其所有参数都专用于该特定任务。当模型训练覆盖更广泛的领域时(例如处理 N 种语言的多语言模型),这些相同的参数必须分散到所有领域中。这种分配并非线性:神经元叠加原理意味着单个参数可以同时编码多个特征。但这种划分是真实存在的,其后果也是真实的。覆盖更多领域的模型对任何特定部分的投入都会减少。

DharmaOCR 的训练反向接受了这一约束。该模型并非为成为其他语言的最佳选择而设计,也从未有此意图。作为交换,网络中所有可用的参数都可以针对巴西葡萄牙语的特定词汇、词法和正字法模式进行定向——这是模型资源在该领域最直接的利用方式。

这种集中性是对多语言和更广领域模型固有优势的结构基础。这一优势并不依赖于拥有比竞争对手更大的架构或更复杂的训练流程——新的架构和新的训练技术会提升任何模型的能力。它取决于这些资源的投向:集中于一个领域,而不是分散到多个领域。

三个月后,更新的模型已经出现。当这些模型更新且能力更强时,专精的论点是否仍然成立,这是一个不同的问题。

在 DharmaOCR 论文发表三个月后,两个新的 OCR 模型引起了研究界的广泛关注:Mistral OCR4 和 Unlimited-OCR。两者都代表了真正的技术进步——新的训练技术、新的数据集,以及在多种语言的各种基准评估中取得的强劲结果。它们属于那种会提高 OCR 系统预期交付标准的模型。

当我们在 DharmaOCR 基准测试(一个专门为葡萄牙语设计的评估)上对两者进行测试时,结果是决定性的。

DharmaOCR 得分 0.925。Mistral OCR4 得分 0.798。Unlimited-OCR 得分 0.7587。

差异是显著的。Mistral OCR4 比 DharmaOCR 低约 13 个百分点;Unlimited-OCR 低超过 16 个百分点。两者都在我们的模型之后发布,并且都得到了大量研究资源的支持。在一个 DharmaOCR 的基本设计决策是完全专注于葡萄牙语的任务上,专精优势是可测量且显著的。

基准测试是核心发现。下面的内容将说明为什么差距呈现为特定的形式。

---

处理非平凡的葡萄牙语文档可以精确揭示多语言模型容易失败的地方。ENEM 论文(巴西全国高中考试)结合了手写文本以及巴西葡萄牙语特有的词汇、专有名词和文化参考。这正是语言特定训练能够产生回报的那类文档。

ENEM 论文手稿 (https://cdn-uploads.huggingface.co/production/uploads/67b22efa9b36260fe286e99f/XVbylBZ_TyY98EvfkO9pT.png)

图 1:基准评估中使用的 ENEM 论文手稿及各模型输出。误读处标红。

Mistral OCR4 在这类文档评估中,将 Chico Buarque(巴西最广为人知的音乐家和诗人之一)转录为 “Chico Barque”。Unlimited-OCR 则将同一名字呈现为 “chico bique”。面对短语 “O Brasil não exclui, assimila”(“巴西不排斥,而是同化”,同一文档中引用的 Chico Buarque 语句),Unlimited-OCR 返回:“a dose de chico bique, ’o Brasil no exclu, eliminila.”

这些并非随机错误。一个对巴西葡萄牙语接触不足的模型不会随意失败——它恰恰会在那些将巴西葡萄牙语与更广泛的多语言语料库区分开来的词汇和专有名词上失败。Chico Buarque 并非冷门指代;这个名字在全国范围内都是公认的。它在多个输出中被系统性破坏,这并非边缘情况。这是一次诊断:证据表明模型的训练并未触及这些领域。

DharmaOCR 在相同文档上正确处理了这些情况。原因很直接:模型的训练集中在这个语言空间,将其资源定向到表征巴西葡萄牙语的词汇和专有名词分布,而不是将它们一次分散到多种语言中。

这些例子是为了说明基准测试,而非取代它。基准测试确定了差距的规模;例子则说明了为什么差距集中在语言特定识别上,而不是通用能力上。

然而,提取准确性只是生产性能的一个维度。视觉困难下的稳定性是另一个维度——而且在操作上,它失败起来后果更严重。

当生成模型遇到无法清晰解析的文档时(小字体、扫描质量差、密集的手写),其输入信号会面临不确定性。主要基于下一个 token 预测目标训练的模型面临一个特定的脆弱性:当视觉信号变得模糊时,模型可能会继续基于之前学到的模式生成,而不是基于源文档。结果是文本退化——输出变得重复、混乱,并且与页面内容语义脱节。

面对一个有小字体的文档,Mistral OCR4 会产生与书写内容毫无关联的输出。

小字体文档 (https://cdn-uploads.huggingface.co/production/uploads/69d815b52c6db28cfdfdd422/3YRHeWDsJ8twDlf7ArbZr.png)

图 2:小字体文档

DharmaOCR 输出与 Mistral OCR4 退化输出 (https://cdn-uploads.huggingface.co/production/uploads/67b22efa9b36260fe286e99f/yBwDuIrqnY0xQ8RLY5Gbe.png)

图 3:DharmaOCR 输出与 Mistral OCR4 退化输出

这不是对源文档的低质量转录。这是完全不同类别的失败。

其操作后果与转录错误截然不同。错误的转录虽然错误但可以恢复——它与源文档存在关系,原则上可以识别并纠正错误。退化输出则没有这种关系。它无法被纠正,因为没有可以纠正的目标。对于依赖结构化 OCR 输出的下游流程(文档分类、信息提取、合规工作流),退化输出不是不准确的数据。它是结构上无法使用的数据。自动化本应带来的效率,恰好在输出不再是信息的那一刻被抵消了。

Mistral OCR4 和 Unlimited-OCR 是优秀的模型,背后有显著的技术进步。这里描述的退化行为并不能定义它们;它识别了一个特定的失败条件,即它们当前的训练尚未针对此领域解决这个问题。问题在于,旨在解决该问题的训练管道是什么样的。

---

在 DharmaOCR 中,答案是 DPO 阶段。

监督微调将模型资源集中在目标领域——这是构建上述语言对齐的阶段。但 SFT 训练的是单个 token 预测:模型学习根据前面的上下文生成正确的下一个 token。在视觉复杂的情况下,这创造了导致退化的条件。如果输出中的早期 token 偏离了源文档,那么每个后续预测都基于该偏离状态进行条件化,输出会继续漂移。重复循环和混乱序列在这种情况下是固有特征——它们是逐步骤优化目标而不考虑整个提取一致性的可预测结果。

DPO 则针对不同的信号进行训练。SFT 逐 token 训练,而 DPO 针对完整输出的质量训练模型——教它根据整个提取的一致性来区分竞争响应,而不是根据单个预测的准确性。其效果是稳定的:在那些视觉复杂性会触发漂移的文档上,模型不太可能走上偏离路径,因为其训练惩罚了在提取级别失去连贯性的输出。

结果正如最初的基准测试所证明的那样:在那些没有此训练阶段的模型会失去连贯性的相同文档上,实现了更低的退化率和更高的提取准确性。

基准测试确立了当前的真相。但对于两年后的情况,它不那么精确。

有可能——而且很可能——未来的新模型即使在巴西葡萄牙语上也会最终超越当前的 DharmaOCR。架构会改进。训练技术会进步。数据集会扩大。该领域在各个层面都在向更高能力发展,没有理由认为这一轨迹会停止。这是意料之中的,也是令人欢迎的。

每一代架构改变的是绝对性能的上限。而不会改变的是决定哪些系统在给定领域最接近其上限的结构逻辑。

可用的资源——计算、参数、训练数据——是有限的。它们必须被投向某个方向。一个将这些资源投向单一领域的系统,在那一领域会比将相同资源分散到多个领域的系统获得更多。无论通用模型的能力变得多强,这种关系都成立。专精者与通才者之间的差距可能会随着架构的改进而演变。但结构性动态不会逆转。我们在之前的一篇文章中更深入地探讨了这一原则,该文章阐述了为什么随着 AI 系统进步,专精仍在产生优势(为什么专精是不可避免的 (https://huggingface.co/blog/Dharma-AI/why-specialization-is-inevitable))。

这塑造了 Dharma 接下来将如何行动。目标不是捍卫当前模型的基准位置。而是保持在新兴技术的前沿——新的架构、新的训练方法、新的对齐和评估方法——并将它们应用于同一个目标:为巴西葡萄牙语 OCR 构建一个专业系统,以尽可能低的成本和最短的推理时间,最佳地利用可用资源。

更好的工具不会与专精背道而驰。它们会扩大专精所能取得的成就。

三个月前,我们证明了将模型训练集中在特定领域会产生相对于通才系统的可测量优势,包括那些更新、资源更丰富的系统。这种优势仍然成立。同样的原则将决定 DharmaOCR 如何继续演进——不是停滞不前,而是将领域取得的任何进步应用于一个保持不变的领域。

https://huggingface.co/blog/Dharma-AI/newer-models-same-advantages#source来源

  • Cardoso, Gabriel Pimenta de Freitas, 等. “DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines.“arXiv 预印本 arXiv:2604.14314 (https://arxiv.org/abs/2604.14314)(2026).

https://huggingface.co/blog/Dharma-AI/newer-models-same-advantages#further-reading延伸阅读

  • 为什么专精是不可避免的 (https://huggingface.co/blog/Dharma-AI/why-spe

相似文章

Mistral OCR 4.1

Hacker News Top

Mistral AI 发布 OCR 4.1,这是一项更新的 OCR 服务,支持原生段落级边界框提取、结构块标签以及块级置信度评分,现已公开预览。

在Papers with Code一站式寻找最佳开源OCR模型 [P]

Reddit r/MachineLearning

Papers with Code上的一个精选页面列出了顶级开源OCR模型和基准测试,重点介绍了百度(Unlimited OCR)和Mistral(OCR 4)的新发布,旨在支持RAG等AI智能体应用场景。

Mistral OCR 4

Hacker News Top

Mistral AI 发布了 Mistral OCR 4,一款紧凑型文档智能模型,能够提供边界框、块分类和内置信度评分,用于结构化文本提取。该模型支持170种语言,可在单个容器中运行以实现自托管部署,并与 Mistral Search Toolkit 集成,用于企业搜索和 RAG 管线。