Unlimited OCR 的工作原理
摘要
Unlimited OCR 引入了 Reference Sliding Window Attention,以消除长序列 OCR 任务中不断增长的内存消耗,从而能够在单次前向传播中高效转录多页文档。
查看缓存全文
缓存时间: 2026/06/23 05:40
论文页面 - Unlimited OCR Works
来源:https://huggingface.co/papers/2606.23050 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Unlimited OCR 引入了参考滑动窗口注意力机制,消除了长序列 OCR 任务中不断增长的内存消耗,从而能够在单次前向传播中高效转录多页内容。
近期,以 DeepSeek OCR 为代表的端到端 OCR 模型再次将 OCR 推至聚光灯下。一种普遍观点是,使用大语言模型作为解码器可以让模型利用语言的先验分布,从而提升 OCR 性能。然而,其缺点同样明显:随着输出序列长度的增加,累积的 KV 缓存会推高内存消耗,并逐步拖慢生成速度。这与人类在长距离抄写任务中效率不下降的现象形成鲜明对比。在本技术报告中,我们提出了 Unlimited OCR,一种旨在模拟人类解析工作记忆的模型。以 DeepSeek OCR 为基线,我们将其解码器中的所有注意力层替换为我们提出的参考滑动窗口注意力机制,该机制在降低注意力计算成本的同时,在整个解码过程中保持 KV 缓存恒定。通过将 DeepSeek OCR 编码器的高压缩率与我们的恒定 KV 缓存设计相结合,Unlimited OCR 能够在标准最大长度 32K 下,单次前向传播转录数十页文档。更重要的是,R‑SWA 是一种通用的解析注意力机制——除了 OCR,它同样适用于 ASR、翻译等任务。代码和模型权重已在 http://github.com/baidu/Unlimited-OCR 上公开。
查看 arXiv 页面 (https://arxiv.org/abs/2606.23050)查看 PDF (https://arxiv.org/pdf/2606.23050)GitHub756 (https://github.com/baidu/Unlimited-OCR)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.23050)
在你的 agent 中获取这篇论文:
hf papers read 2606\.23050
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到这篇论文
请在模型 README.md 中引用 arxiv.org/abs/2606.23050,以便从此页面链接。
引用此论文的数据集0
没有数据集链接到这篇论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.23050,以便从此页面链接。
引用此论文的 Space0
没有 Space 链接到这篇论文
请在 Space README.md 中引用 arxiv.org/abs/2606.23050,以便从此页面链接。
包含此论文的收藏集0
没有收藏集包含这篇论文
请将这篇论文添加到一个收藏集中,以便从此页面链接。
相似文章
@AdinaYakup: Unlimited-OCR——@PaddlePaddle的新OCR模型,能够单次处理数百页文档,同时保持速度稳定…
PaddlePaddle发布了Unlimited-OCR,一种新的OCR模型,使用参考滑动窗口注意力(R-SWA)在解码过程中保持恒定的KV缓存,在OmniDocBench上达到了93%的准确率,相比之前的方法提升了6%。
@BaiduAI_News: 我们正在开源Unlimited OCR——专为一次性读取长文档而构建。总参数3B,仅500M激活…
百度开源Unlimited OCR,一个3B参数模型(500M激活参数),使用Reference Sliding Window Attention(R-SWA)一次性读取长文档,在OmniDocBench上取得最先进的SOTA结果。
Unlimited OCR: 一次性长程解析
百度发布Unlimited-OCR,这是一个基于Deepseek-OCR构建的开源模型,用于一次性长程文档解析,支持单张图片、多页文档和PDF。
@vista8: 感觉百度的技术底子还是很硬的。 最近这个Unlimited OCR,竟然连杨立昆(Yann LeCun)都关注到了! Unlimited OCR 提出了 Reference Sliding Window Attention (R-SWA)…
百度开源的Unlimited OCR模型提出Reference Sliding Window Attention(R-SWA)机制,以30亿参数实现数十页文档连续解析,在GitHub和HuggingFace上获得极高关注。
@GoSailGlobal: 现在的 OCR 处理几十页文档,是逐页跑的 每翻一页,记忆清零一次 百度今天悄悄在 GitHub 和 HuggingFace 开源了一个模型,叫 Unlimited OCR,它的灵感,来自人类抄书: - 你抄一本书,不会每写一个字就把前面…
百度开源了 Unlimited OCR 模型,采用参考滑动窗口注意力(R-SWA)机制,实现了对长达 32K 上下文的一次性文档解析,无需逐页推理。