MonkeyOCRv2: 用于文档AI的视觉-文本基础模型

Hugging Face Daily Papers 论文

摘要

MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。

主流的视觉编码器在自然图像上预训练,如果没有针对文档的适配,无法有效应用于文档图像,因为密集的文字和细粒度的字符笔画需要字符级别的视觉感知。我们提出了MonkeyOCRv2,一个用于文档AI的视觉-文本预训练模型。首先,我们构建了MonkeyDoc v2——据我们所知,这是最大的文档图像预训练语料库,包含1.13亿张图像,涵盖17种语言。其次,我们提出了一种联合学习图像到文本生成和像素级文档重建的预训练策略:前者将视觉表示与文本内容对齐,后者保留字符笔画和布局细节。我们在五个代表性的文档分析任务上进行了大量实验,包括文字识别、公式识别、文本检测、文档篡改检测和重叠文本分割。将原始编码器替换为MonkeyOCRv2后,所有五个任务的性能均得到一致提升。最后,我们验证了其作为多模态大语言模型视觉编码器在更具挑战性的文档解析和文档理解任务上的有效性。保持冻结并与轻量级语言模型配对,它生成了一个0.7B的文档解析模型,在MDPBench(一个涵盖17种语言数字原生和拍摄文档的最新基准)上创造了新的开源最优结果,以约11倍小的视觉编码器,绝对比此前最佳的3B dots.mocr提高了2.8%。该冻结编码器还驱动了一个文档理解模型,在相同的训练设置下,在八个基准测试中优于基于CLIP、DINO和SAM构建的对应模型。这些结果表明,面向文档的视觉预训练可以单独作为文档智能的基础。
查看原文
查看缓存全文

缓存时间: 2026/07/15 16:22

论文页面 - MonkeyOCRv2: 面向文档AI的视觉-文本基础模型

来源: https://huggingface.co/papers/2607.11562 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

主流视觉编码器在自然图像上预训练,若不经过面向文档的适配,则无法有效应用于文档图像,因为密集文本和精细字符笔画需要字符级视觉感知能力。我们提出MonkeyOCRv2,一个面向文档AI的视觉-文本预训练模型。首先,我们构建了MonkeyDocv2,据我们所知,这是最大的文档图像预训练语料库,包含1.13亿张图像,涵盖17种语言。其次,我们提出一种预训练策略,联合学习图像到文本生成和像素级文档重建:前者将视觉表示与文本内容对齐,后者保留字符笔画和布局细节。我们在五个代表性文档分析任务上进行了广泛实验,包括文本识别、公式识别、文本检测、文档篡改检测和重叠文本分割。将原始编码器替换为MonkeyOCRv2后,所有五个任务的性能均得到一致提升。最后,我们验证了其作为多模态大语言模型视觉编码器在更具挑战性的文档解析和文档理解任务中的有效性。保持冻结并与轻量级语言模型配对,它产生了一个0.7B的文档解析模型,在MDPBench(一个涵盖17种语言的数字原生和拍摄文档的最新基准)上创造了新的开源最佳水平,以约11倍小的视觉编码器,在绝对性能上超越先前最好的3B模型2.8%。该冻结编码器还驱动了一个文档理解模型,在相同训练设置下跨越八个基准,超越了基于CLIP、DINO和SAM构建的同类模型。这些结果表明,面向文档的视觉预训练本身可以作为文档智能的基础。

查看arXiv页面 (https://arxiv.org/abs/2607.11562)查看PDF (https://arxiv.org/pdf/2607.11562)GitHub144 (https://github.com/Yuliang-Liu/MonkeyOCRv2)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11562)

引用此论文的模型7个

zenosai/MonkeyOCRv2-B-Parsing 图像-文本-到-文本• 0.9B• 更新于1天前 • 16 • 2 (https://huggingface.co/zenosai/MonkeyOCRv2-B-Parsing)

zenosai/MonkeyOCRv2-S 图像-文本-到-文本• 28.5M• 更新于1天前 • 6 • 2 (https://huggingface.co/zenosai/MonkeyOCRv2-S)

zenosai/MonkeyOCRv2-B 图像-文本-到-文本• 0.1B• 更新于1天前 • 16 • 2 (https://huggingface.co/zenosai/MonkeyOCRv2-B)

zenosai/MonkeyOCRv2-S-Parsing 图像-文本-到-文本• 0.8B• 更新于1天前 • 15 • 1 (https://huggingface.co/zenosai/MonkeyOCRv2-S-Parsing)

浏览引用此论文的7个模型 (https://huggingface.co/models?other=arxiv:2607.11562)## 引用此论文的数据集0个

没有与此论文关联的数据集

在数据集README.md中引用arxiv.org/abs/2607.11562,以便在此页面链接。

引用此论文的Spaces1个

包含此论文的收藏1个

相似文章

OvisOCR2 技术报告

Hugging Face Daily Papers

OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。

OvisOCR2:一款有前景的0.8B本地文档解析器

Reddit r/LocalLLaMA

OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。

ATH-MaaS/OvisOCR2

Hugging Face Models Trending

OvisOCR2 是一个紧凑的0.8B端到端模型,用于页面级文档解析,在OmniDocBench和PureDocBench基准测试中达到了最先进的性能。