在Papers with Code一站式寻找最佳开源OCR模型 [P]

Reddit r/MachineLearning 新闻

摘要

Papers with Code上的一个精选页面列出了顶级开源OCR模型和基准测试,重点介绍了百度(Unlimited OCR)和Mistral(OCR 4)的新发布,旨在支持RAG等AI智能体应用场景。

大家好,我创建了一个最重要的OCR基准测试概述,以及顶级开源模型及其论文和代码链接:https://paperswithcode.co/tasks/ocr。本周,百度和Mistral发布了新的OCR模型。百度发布了Unlimited OCR,这是一个3B参数模型,引入了名为参考滑动窗口注意力(R-SWA)的关键创新,并基于DeepSeek OCR构建。Mistral发布了OCR 4,可通过API使用。OCR即光学字符识别,是将PDF或扫描文档数字化的任务。当然,这项任务备受关注,因为它能够摄取所有公司数据以支持智能体应用场景。AI智能体喜欢Markdown格式;将那些杂乱的PDF文档转化为标准化的机器可读格式非常有价值。这支持了智能体RAG(检索增强生成)等应用场景,为内部和外部客户支持的聊天机器人提供动力。过去几个月,Hugging Face上发布了大量OCR模型,可能让人难以选择。因此,我构建了这个页面,列出了主要的OCR基准测试以及性能最好的模型和代码链接。显然,这发布在Papers with Code上,这是我维护的网站(是对旧网站的复兴,该网站曾被关闭)。推荐的顶级基准测试包括Ai2创建的OlmOCRBench和上海人工智能实验室创建的OmniDocBench。当前最佳推荐是Datalab的Chandra OCR 2和Mistral OCR v4。前者是开放的,因此您可以自行部署或使用其无服务器API。请告诉我您现在还想看到哪些其他任务的主要基准测试!祝好,Niels open-source @ HF
查看原文

相似文章

baidu/Unlimited-OCR

Hugging Face Models Trending

百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。

Mistral OCR 4.1

Hacker News Top

Mistral AI 发布 OCR 4.1,这是一项更新的 OCR 服务,支持原生段落级边界框提取、结构块标签以及块级置信度评分,现已公开预览。