寻求多文档ERP系统OCR模型选型的建议

Reddit r/AI_Agents 新闻

摘要

作者正在为处理多种语言、手写文本及复杂扫描格式的多文档ERP系统挑选OCR模型,希望得到有实际文档OCR项目经验人士的建议。

大家好,我正在为ERP系统开发OCR组件,目前正在评估一些较新的OCR/VLM模型。非常希望得到那些有过实际文档OCR项目经验的人的建议。我们的文档主要是商业文件(发票、表格等),内容可能包含阿拉伯文和法文,还有手写阿拉伯文、印章、签名、表格以及质量较差的扫描件/照片等。需要特别说明的是,一个上传的文件可能包含多页属于不同文档类型的内容。例如,一个文件里可能有4页属于同一类型文档,之后又是另一种类型的文档。因此我们不仅需要对这些页面进行OCR识别,还要能够正确识别并分割不同的文档。我们目前正在考虑PaddleOCR-VL和Unlimited-OCR这类模型,也考虑过将通用文档OCR模型与专门的阿拉伯文手写识别模型结合使用。我的主要疑问是关于多页处理的问题:与逐页处理相比,像Unlimited-OCR这样的长上下文OCR模型何时才会真正发挥作用?保持跨页上下文是否能在文档分割/分类、跨页连续表格识别以及一致字段提取等方面带来显著优势?还是说逐页OCR再加上独立的文档分类/合并层才是更好的方案?对于我们的应用场景,您会更倾向于选择能够处理长文档的VLM模型,还是更注重OCR准确率与文档分割能力?此外,我们对阿拉伯文OCR也非常关注,尤其是手写阿拉伯文,如果您有使用过在这方面表现优异的模型的经验,也欢迎分享。谢谢!
查看原文

相似文章

在Papers with Code一站式寻找最佳开源OCR模型 [P]

Reddit r/MachineLearning

Papers with Code上的一个精选页面列出了顶级开源OCR模型和基准测试,重点介绍了百度(Unlimited OCR)和Mistral(OCR 4)的新发布,旨在支持RAG等AI智能体应用场景。

更新模型,同样优势

Hugging Face Blog

DharmaOCR,一个专门用于巴西葡萄牙语OCR的模型,通过领域特定的微调和直接偏好优化,优于Mistral OCR4等较新的模型。文章解释了训练流程并展示了基准测试结果。