@BaiduAI_News: 我们正在开源Unlimited OCR——专为一次性读取长文档而构建。总参数3B,仅500M激活…
摘要
百度开源Unlimited OCR,一个3B参数模型(500M激活参数),使用Reference Sliding Window Attention(R-SWA)一次性读取长文档,在OmniDocBench上取得最先进的SOTA结果。
我们正在开源Unlimited OCR——专为一次性读取长文档而构建。
Unlimited OCR总参数3B,仅500M激活,在OmniDocBench v1.5和v1.6上创下了新的端到端SOTA结果。
关键创新在于Reference Sliding Window Attention(R-SWA),其灵感来源于人类抄写书籍的方式:保持对源文本、近期上下文和下一个单词的关注,同时温和地遗忘不再需要的内容。
凭借恒定的KV Cache大小和更低的注意力成本,Unlimited OCR可以在单次前向传播中转录40+页——不会丢失上下文或减慢速度。
探索模型:
--GitHub: https://github.com/baidu/Unlimited-OCR…
--Hugging Face: https://huggingface.co/baidu/Unlimited-OCR…
查看缓存全文
缓存时间: 2026/06/24 10:22
无限OCR工作
欢迎一次性长视界解析时代。
相似文章
@S0N_IA: | 中国已终结OCR业务——一个花生大小的30亿参数模型可以一口气读完整份100页的PDF……
百度发布Unlimited-OCR,一个30亿参数的开源模型,拥有32K上下文窗口,可一口气读完整份100页PDF,准确率达93%,且完全本地运行。该模型在Hugging Face上已有190万下载量,却鲜有关注。
Unlimited OCR: 一次性长程解析
百度发布Unlimited-OCR,这是一个基于Deepseek-OCR构建的开源模型,用于一次性长程文档解析,支持单张图片、多页文档和PDF。
@vista8: 感觉百度的技术底子还是很硬的。 最近这个Unlimited OCR,竟然连杨立昆(Yann LeCun)都关注到了! Unlimited OCR 提出了 Reference Sliding Window Attention (R-SWA)…
百度开源的Unlimited OCR模型提出Reference Sliding Window Attention(R-SWA)机制,以30亿参数实现数十页文档连续解析,在GitHub和HuggingFace上获得极高关注。
baidu/Unlimited-OCR
百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。
@ErickSky: 百度刚刚打破了当前OCR最大的限制之一。Unlimited-OCR一次性处理整个文档…
百度发布了Unlimited-OCR,它可以一次性处理整个文档而无需分块,克服了当前OCR技术的一个主要限制。