@DataScienceDojo: 一家中国公司刚刚开源了一个𝐎𝐂𝐑,它修复了大多数AI驱动OCR工具默默挣扎的一个问题:……
摘要
Unlimited-OCR,一家中国公司新发布的开源OCR模型,解决了AI OCR工具中常见的内存增长问题——无论文档多长,内存使用都保持平稳,从而能够在32K上下文长度下一次性读取数十页。它采用MIT许可,拥有30亿参数,支持多语言,并且在GitHub上已经广受欢迎。
查看缓存全文
缓存时间: 2026/07/21 08:38
一家中国公司刚刚开源了一款 OCR 工具,它解决了大多数 AI 驱动的 OCR 工具都会悄悄遇到的难题:文档越长,速度就越慢,内存占用也越大。
原因在于,这类模型在处理文档时,会逐段生成文本,同时持续跟踪已读内容。
你喂入的页面越多,积累的内存就越大——处理一份 40 页的文件,系统压力远大于 2 页的文件。
Unlimited-OCR 改变了模型对已读内容的注意力机制,使得无论你扔进去多少页,内存占用都保持稳定。这样一来,它就能在标准 32K 上下文长度下一次性读取几十页文档,无需拆分文档,也不会丢失页面之间的连贯性。
- MIT 许可证,3B 参数
- 开箱即支持多语言
- 可直接配合 Transformers 和 SGLang 使用
- 发布几天内已在 GitHub 上获得 6.7k 星标
如果你正通过 Textract、Google Vision 或 Azure Document Intelligence 运行文档解析,那么这款工具值得在本地测试。它体积小巧,可以自行托管,而且百度表示,同样的底层技术不仅适用于 OCR,也适用于语音识别和翻译。
#UnlimitedOCR #DeepSeekOCR #OpenSourceAI #LLMEngineering #DocumentAI #AIEngineering
相似文章
@thesupermanmx: 中国刚刚开源了一款OCR模型,可一次性转录整本书。它名为Unlimited OCR。构建于…
中国开源了Unlimited OCR,这是一款基于DeepSeek OCR的OCR模型,可以一次性转录整本书,内存使用恒定,在标准解析基准上达到93%的准确率。
@BaiduAI_News: 我们正在开源Unlimited OCR——专为一次性读取长文档而构建。总参数3B,仅500M激活…
百度开源Unlimited OCR,一个3B参数模型(500M激活参数),使用Reference Sliding Window Attention(R-SWA)一次性读取长文档,在OmniDocBench上取得最先进的SOTA结果。
@S0N_IA: | 中国已终结OCR业务——一个花生大小的30亿参数模型可以一口气读完整份100页的PDF……
百度发布Unlimited-OCR,一个30亿参数的开源模型,拥有32K上下文窗口,可一口气读完整份100页PDF,准确率达93%,且完全本地运行。该模型在Hugging Face上已有190万下载量,却鲜有关注。
@GoSailGlobal: 现在的 OCR 处理几十页文档,是逐页跑的 每翻一页,记忆清零一次 百度今天悄悄在 GitHub 和 HuggingFace 开源了一个模型,叫 Unlimited OCR,它的灵感,来自人类抄书: - 你抄一本书,不会每写一个字就把前面…
百度开源了 Unlimited OCR 模型,采用参考滑动窗口注意力(R-SWA)机制,实现了对长达 32K 上下文的一次性文档解析,无需逐页推理。
Unlimited OCR: 一次性长程解析
百度发布Unlimited-OCR,这是一个基于Deepseek-OCR构建的开源模型,用于一次性长程文档解析,支持单张图片、多页文档和PDF。