@DataScienceDojo: 一家中国公司刚刚开源了一个𝐎𝐂𝐑,它修复了大多数AI驱动OCR工具默默挣扎的一个问题:……

X AI KOLs Timeline 模型

摘要

Unlimited-OCR,一家中国公司新发布的开源OCR模型,解决了AI OCR工具中常见的内存增长问题——无论文档多长,内存使用都保持平稳,从而能够在32K上下文长度下一次性读取数十页。它采用MIT许可,拥有30亿参数,支持多语言,并且在GitHub上已经广受欢迎。

一家中国公司刚刚开源了一个𝐎𝐂𝐑,它修复了大多数AI驱动OCR工具默默挣扎的一个问题:文档越长,它们就会变慢,内存占用也越大。 原因如下。这些模型大多通过逐片段生成文本来处理文档,并在处理过程中记录所有已读取的内容。 输入的页数越多,内存积累就越多,因此处理40页的文件比处理2页的文件对系统压力大得多。 Unlimited-OCR改变了模型对已读内容的注意力方式,因此无论输入多少页,内存占用都保持平稳。这使得它能够在标准32K上下文长度下一次性读取数十页,而无需分割文档,从而避免页间内容断裂。 - MIT许可,30亿参数 - 开箱即支持多语言 - 直接兼容Transformers和SGLang - 发布数天内GitHub星标已超过6.7k 如果你正在使用Textract、Google Vision或Azure Document Intelligence进行文档解析,这个模型值得在本地测试。它足够小,可以自行托管,而且百度表示同样的底层技术不仅适用于OCR,还应适用于语音识别和翻译。 #UnlimitedOCR #DeepSeekOCR #OpenSourceAI #LLMEngineering #DocumentAI #AIEngineering
查看原文
查看缓存全文

缓存时间: 2026/07/21 08:38

一家中国公司刚刚开源了一款 OCR 工具,它解决了大多数 AI 驱动的 OCR 工具都会悄悄遇到的难题:文档越长,速度就越慢,内存占用也越大。

原因在于,这类模型在处理文档时,会逐段生成文本,同时持续跟踪已读内容。

你喂入的页面越多,积累的内存就越大——处理一份 40 页的文件,系统压力远大于 2 页的文件。

Unlimited-OCR 改变了模型对已读内容的注意力机制,使得无论你扔进去多少页,内存占用都保持稳定。这样一来,它就能在标准 32K 上下文长度下一次性读取几十页文档,无需拆分文档,也不会丢失页面之间的连贯性。

  • MIT 许可证,3B 参数
  • 开箱即支持多语言
  • 可直接配合 Transformers 和 SGLang 使用
  • 发布几天内已在 GitHub 上获得 6.7k 星标

如果你正通过 Textract、Google Vision 或 Azure Document Intelligence 运行文档解析,那么这款工具值得在本地测试。它体积小巧,可以自行托管,而且百度表示,同样的底层技术不仅适用于 OCR,也适用于语音识别和翻译。

#UnlimitedOCR #DeepSeekOCR #OpenSourceAI #LLMEngineering #DocumentAI #AIEngineering

相似文章

Unlimited OCR: 一次性长程解析

Hacker News Top

百度发布Unlimited-OCR,这是一个基于Deepseek-OCR构建的开源模型,用于一次性长程文档解析,支持单张图片、多页文档和PDF。