@S0N_IA: | 中国已终结OCR业务——一个花生大小的30亿参数模型可以一口气读完整份100页的PDF……

X AI KOLs Timeline 模型

摘要

百度发布Unlimited-OCR,一个30亿参数的开源模型,拥有32K上下文窗口,可一口气读完整份100页PDF,准确率达93%,且完全本地运行。该模型在Hugging Face上已有190万下载量,却鲜有关注。

| 中国已终结OCR业务 一个30亿参数、花生大小的模型可以一口气读完整份100页的PDF。 无需拆分页面。 无需丢失上下文。 无需云账单。 认识一下Unlimited-OCR • 以32K上下文窗口读取完整文档 • 在标准OCR分析基准上达到93%(比基线高出6%) • 即使超过40页,错误率仍低于0.11 • 开箱即用,支持多语言 • 100%在本地硬件上运行 • 支持Transformers、vLLM、SGLang、Docker、Ollama和llama.cpp 疯狂之处在于: 大多数OCR工具仍然逐页处理文档。 Unlimited-OCR将整个文档作为单一上下文读取,保留表格、引用、布局和页面间的关系。 这改变了一切。 与此同时,企业正在支付: • 每1000页1.50–15美元 • 将敏感PDF发送到云服务商 • 等待API响应 这个模型离线运行。 免费。 永远。 由百度构建,超越DeepSeek-OCR。 它在Hugging Face上已有超过190万次下载…… ……而几乎还没有人讨论它。 开源的速度比大多数企业软件更快。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:39

| 中国终结了OCR业务

一个只有30亿参数、花生大小的模型,可以一次性读取一整份100页的PDF。

无需拆分页面。 无需丢失上下文。 无需云服务账单。

认识一下 Unlimited-OCR

• 以32K上下文窗口读取完整文档 • 在标准OCR分析基准上达到93%(比基线高出6个百分点) • 即使超过40页,错误率仍保持在0.11以下 • 开箱即支持多语言 • 完全在本地硬件上运行 • 支持 Transformers、vLLM、SGLang、Docker、Ollama 和 llama.cpp

疯狂的是:

大多数OCR工具仍然逐页处理文档。

Unlimited-OCR 将整个文档作为一个单一上下文进行读取,保留表格、引用、布局以及页面之间的关系。

这改变了一切。

与此同时,企业仍在支付:

• 每1000页1.50–15美元 • 将敏感的PDF发送给云服务商 • 等待API响应

而这个模型可以离线运行。 免费。 永远免费。

由百度打造,超越 DeepSeek-OCR。

它已经在 Hugging Face 上获得了超过190万次下载……

……而几乎没有人谈论它。

开源的速度比大多数企业软件都快。

相似文章

baidu/Unlimited-OCR

Hugging Face Models Trending

百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。