@CoderDaMing: 中国开源了一个花生大小的OCR,能一次性解析整个100页PDF。 叫'Unlimited-OCR'。仅3B参数。本地运行。 其他OCR工具都是逐页切割文档,容易丢失上下文。这个一次性读取整个文档。 → 单次'长视野'解析(32K上下文窗口…
摘要
中国开源了仅3B参数的OCR模型Unlimited-OCR,能一次性解析整个100页PDF,支持本地运行,准确率93%,完全免费开源。
查看缓存全文
缓存时间: 2026/07/20 17:31
中国开源了一个花生大小的OCR,能一次性解析整个100页PDF。
叫’Unlimited-OCR’。仅3B参数。本地运行。
其他OCR工具都是逐页切割文档,容易丢失上下文。这个一次性读取整个文档。
→ 单次’长视野’解析(32K上下文窗口) → 开箱即用多语言支持 → 标准基准测试93%准确率(+6超基线) → 40页以上<0.11错误率 → 100%本地运行 → 支持Transformers、vLLM、SGLang、Docker、Ollama、llama.cpp
传统云端OCR(Textract、Google Vision、Azure)成本1.5-15美元/千页。
这个在你的机器上运行。永久免费。
百度开发它来推进’DeepSeek-OCR’。已在HuggingFace获190万次下载,多数人还不知道它。
100%开源。
相似文章
@S0N_IA: | 中国已终结OCR业务——一个花生大小的30亿参数模型可以一口气读完整份100页的PDF……
百度发布Unlimited-OCR,一个30亿参数的开源模型,拥有32K上下文窗口,可一口气读完整份100页PDF,准确率达93%,且完全本地运行。该模型在Hugging Face上已有190万下载量,却鲜有关注。
@GoSailGlobal: 现在的 OCR 处理几十页文档,是逐页跑的 每翻一页,记忆清零一次 百度今天悄悄在 GitHub 和 HuggingFace 开源了一个模型,叫 Unlimited OCR,它的灵感,来自人类抄书: - 你抄一本书,不会每写一个字就把前面…
百度开源了 Unlimited OCR 模型,采用参考滑动窗口注意力(R-SWA)机制,实现了对长达 32K 上下文的一次性文档解析,无需逐页推理。
@geekbb: 百度开源的视觉语言模型 OCR 项目,在 DeepSeek-OCR 基础上做了升级,主打一次性解析超长文档。模型有两种推理模式:gundam 模式用来对付单张图里的密集文字,base 模式处理多页或 PDF。 https://github…
百度开源了视觉语言模型Unlimited-OCR,基于DeepSeek-OCR升级,支持一次性解析超长文档,提供gundam(单图密集文字)和base(多页/PDF)两种推理模式。
@thesupermanmx: 中国刚刚开源了一款OCR模型,可一次性转录整本书。它名为Unlimited OCR。构建于…
中国开源了Unlimited OCR,这是一款基于DeepSeek OCR的OCR模型,可以一次性转录整本书,内存使用恒定,在标准解析基准上达到93%的准确率。
baidu/Unlimited-OCR
百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。