在Papers with Code一站式寻找最佳开源OCR模型 [P]
摘要
Papers with Code上的一个精选页面列出了顶级开源OCR模型和基准测试,重点介绍了百度(Unlimited OCR)和Mistral(OCR 4)的新发布,旨在支持RAG等AI智能体应用场景。
大家好,我创建了一个最重要的OCR基准测试概述,以及顶级开源模型及其论文和代码链接:https://paperswithcode.co/tasks/ocr。本周,百度和Mistral发布了新的OCR模型。百度发布了Unlimited OCR,这是一个3B参数模型,引入了名为参考滑动窗口注意力(R-SWA)的关键创新,并基于DeepSeek OCR构建。Mistral发布了OCR 4,可通过API使用。OCR即光学字符识别,是将PDF或扫描文档数字化的任务。当然,这项任务备受关注,因为它能够摄取所有公司数据以支持智能体应用场景。AI智能体喜欢Markdown格式;将那些杂乱的PDF文档转化为标准化的机器可读格式非常有价值。这支持了智能体RAG(检索增强生成)等应用场景,为内部和外部客户支持的聊天机器人提供动力。过去几个月,Hugging Face上发布了大量OCR模型,可能让人难以选择。因此,我构建了这个页面,列出了主要的OCR基准测试以及性能最好的模型和代码链接。显然,这发布在Papers with Code上,这是我维护的网站(是对旧网站的复兴,该网站曾被关闭)。推荐的顶级基准测试包括Ai2创建的OlmOCRBench和上海人工智能实验室创建的OmniDocBench。当前最佳推荐是Datalab的Chandra OCR 2和Mistral OCR v4。前者是开放的,因此您可以自行部署或使用其无服务器API。请告诉我您现在还想看到哪些其他任务的主要基准测试!祝好,Niels open-source @ HF
相似文章
@vanstriendaniel: OCR模型又来了!百度公司的Unlimited-OCR是其中比较有趣的一个。你可以无需太多…
这篇文章展示了如何在Hugging Face Jobs上将百度的Unlimited-OCR模型作为临时的、兼容OpenAI的端点提供服务,支持多页文档解析,具有表格转HTML和公式转LaTeX提取等功能。
baidu/Unlimited-OCR
百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。
@TeksEdge: 需要OCR文档吗?PP-OCRv6已发布——目前你可以下载的最佳开源OCR模型 ◆︎ 完全开源…
PP-OCRv6是百度PaddleOCR新推出的开源OCR模型系列,提供Tiny/Small/Medium三种尺寸,精度和速度优秀,优于多个商业模型。
Mistral OCR 4.1
Mistral AI 发布 OCR 4.1,这是一项更新的 OCR 服务,支持原生段落级边界框提取、结构块标签以及块级置信度评分,现已公开预览。
@geekbb: 百度开源的视觉语言模型 OCR 项目,在 DeepSeek-OCR 基础上做了升级,主打一次性解析超长文档。模型有两种推理模式:gundam 模式用来对付单张图里的密集文字,base 模式处理多页或 PDF。 https://github…
百度开源了视觉语言模型Unlimited-OCR,基于DeepSeek-OCR升级,支持一次性解析超长文档,提供gundam(单图密集文字)和base(多页/PDF)两种推理模式。