@S0N_IA: | 中国已终结OCR业务——一个花生大小的30亿参数模型可以一口气读完整份100页的PDF……
摘要
百度发布Unlimited-OCR,一个30亿参数的开源模型,拥有32K上下文窗口,可一口气读完整份100页PDF,准确率达93%,且完全本地运行。该模型在Hugging Face上已有190万下载量,却鲜有关注。
查看缓存全文
缓存时间: 2026/07/21 06:39
| 中国终结了OCR业务
一个只有30亿参数、花生大小的模型,可以一次性读取一整份100页的PDF。
无需拆分页面。 无需丢失上下文。 无需云服务账单。
认识一下 Unlimited-OCR
• 以32K上下文窗口读取完整文档 • 在标准OCR分析基准上达到93%(比基线高出6个百分点) • 即使超过40页,错误率仍保持在0.11以下 • 开箱即支持多语言 • 完全在本地硬件上运行 • 支持 Transformers、vLLM、SGLang、Docker、Ollama 和 llama.cpp
疯狂的是:
大多数OCR工具仍然逐页处理文档。
Unlimited-OCR 将整个文档作为一个单一上下文进行读取,保留表格、引用、布局以及页面之间的关系。
这改变了一切。
与此同时,企业仍在支付:
• 每1000页1.50–15美元 • 将敏感的PDF发送给云服务商 • 等待API响应
而这个模型可以离线运行。 免费。 永远免费。
由百度打造,超越 DeepSeek-OCR。
它已经在 Hugging Face 上获得了超过190万次下载……
……而几乎没有人谈论它。
开源的速度比大多数企业软件都快。
相似文章
@CoderDaMing: 中国开源了一个花生大小的OCR,能一次性解析整个100页PDF。 叫'Unlimited-OCR'。仅3B参数。本地运行。 其他OCR工具都是逐页切割文档,容易丢失上下文。这个一次性读取整个文档。 → 单次'长视野'解析(32K上下文窗口…
中国开源了仅3B参数的OCR模型Unlimited-OCR,能一次性解析整个100页PDF,支持本地运行,准确率93%,完全免费开源。
@BaiduAI_News: 我们正在开源Unlimited OCR——专为一次性读取长文档而构建。总参数3B,仅500M激活…
百度开源Unlimited OCR,一个3B参数模型(500M激活参数),使用Reference Sliding Window Attention(R-SWA)一次性读取长文档,在OmniDocBench上取得最先进的SOTA结果。
baidu/Unlimited-OCR
百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。
@thesupermanmx: 中国刚刚开源了一款OCR模型,可一次性转录整本书。它名为Unlimited OCR。构建于…
中国开源了Unlimited OCR,这是一款基于DeepSeek OCR的OCR模型,可以一次性转录整本书,内存使用恒定,在标准解析基准上达到93%的准确率。
@ErickSky: 百度刚刚打破了当前OCR最大的限制之一。Unlimited-OCR一次性处理整个文档…
百度发布了Unlimited-OCR,它可以一次性处理整个文档而无需分块,克服了当前OCR技术的一个主要限制。