MonkeyOCRv2: 用于文档AI的视觉-文本基础模型
摘要
MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。
查看缓存全文
缓存时间: 2026/07/15 16:22
论文页面 - MonkeyOCRv2: 面向文档AI的视觉-文本基础模型
来源: https://huggingface.co/papers/2607.11562 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
主流视觉编码器在自然图像上预训练,若不经过面向文档的适配,则无法有效应用于文档图像,因为密集文本和精细字符笔画需要字符级视觉感知能力。我们提出MonkeyOCRv2,一个面向文档AI的视觉-文本预训练模型。首先,我们构建了MonkeyDocv2,据我们所知,这是最大的文档图像预训练语料库,包含1.13亿张图像,涵盖17种语言。其次,我们提出一种预训练策略,联合学习图像到文本生成和像素级文档重建:前者将视觉表示与文本内容对齐,后者保留字符笔画和布局细节。我们在五个代表性文档分析任务上进行了广泛实验,包括文本识别、公式识别、文本检测、文档篡改检测和重叠文本分割。将原始编码器替换为MonkeyOCRv2后,所有五个任务的性能均得到一致提升。最后,我们验证了其作为多模态大语言模型视觉编码器在更具挑战性的文档解析和文档理解任务中的有效性。保持冻结并与轻量级语言模型配对,它产生了一个0.7B的文档解析模型,在MDPBench(一个涵盖17种语言的数字原生和拍摄文档的最新基准)上创造了新的开源最佳水平,以约11倍小的视觉编码器,在绝对性能上超越先前最好的3B模型2.8%。该冻结编码器还驱动了一个文档理解模型,在相同训练设置下跨越八个基准,超越了基于CLIP、DINO和SAM构建的同类模型。这些结果表明,面向文档的视觉预训练本身可以作为文档智能的基础。
查看arXiv页面 (https://arxiv.org/abs/2607.11562)查看PDF (https://arxiv.org/pdf/2607.11562)GitHub144 (https://github.com/Yuliang-Liu/MonkeyOCRv2)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11562)
引用此论文的模型7个
zenosai/MonkeyOCRv2-B-Parsing 图像-文本-到-文本• 0.9B• 更新于1天前 • 16 • 2 (https://huggingface.co/zenosai/MonkeyOCRv2-B-Parsing)
zenosai/MonkeyOCRv2-S 图像-文本-到-文本• 28.5M• 更新于1天前 • 6 • 2 (https://huggingface.co/zenosai/MonkeyOCRv2-S)
zenosai/MonkeyOCRv2-B 图像-文本-到-文本• 0.1B• 更新于1天前 • 16 • 2 (https://huggingface.co/zenosai/MonkeyOCRv2-B)
zenosai/MonkeyOCRv2-S-Parsing 图像-文本-到-文本• 0.8B• 更新于1天前 • 15 • 1 (https://huggingface.co/zenosai/MonkeyOCRv2-S-Parsing)
浏览引用此论文的7个模型 (https://huggingface.co/models?other=arxiv:2607.11562)## 引用此论文的数据集0个
没有与此论文关联的数据集
在数据集README.md中引用arxiv.org/abs/2607.11562,以便在此页面链接。
引用此论文的Spaces1个
包含此论文的收藏1个
相似文章
OvisOCR2 技术报告
OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。
OvisOCR2:一款有前景的0.8B本地文档解析器
OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。
ATH-MaaS/OvisOCR2
OvisOCR2 是一个紧凑的0.8B端到端模型,用于页面级文档解析,在OmniDocBench和PureDocBench基准测试中达到了最先进的性能。
olmOCR:利用视觉语言模型解锁PDF中的数万亿Token
olmOCR 是一个开源工具包,使用微调的视觉语言模型从PDF中提取干净的文本,同时保留结构,并针对大规模批处理进行了优化。
@geekbb: 百度开源的视觉语言模型 OCR 项目,在 DeepSeek-OCR 基础上做了升级,主打一次性解析超长文档。模型有两种推理模式:gundam 模式用来对付单张图里的密集文字,base 模式处理多页或 PDF。 https://github…
百度开源了视觉语言模型Unlimited-OCR,基于DeepSeek-OCR升级,支持一次性解析超长文档,提供gundam(单图密集文字)和base(多页/PDF)两种推理模式。