OvisOCR2 技术报告

Hugging Face Daily Papers 模型

摘要

OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。

我们介绍OvisOCR2,一个0.8B参数的文档解析模型。OvisOCR2被设计为一个端到端解析器:给定一个文档页面图像,它按自然阅读顺序生成Markdown表示,涵盖文本、公式、表格和视觉区域。我们构建了一个数据引擎,结合了过滤后的真实文档标注和合成页面,这些合成页面的渲染图像和Markdown目标来自同一个HTML源。训练方案包括监督微调、在4B分支上使用多组件奖励设计的强化学习、将结果蒸馏到0.8B模型的在策略蒸馏,以及模型融合。在OmniDocBench v1.6上,OvisOCR2取得了96.58的最先进总体分数,将端到端模型推至此前由流水线方法主导的排行榜榜首,突显了端到端文档解析的潜力。在PureDocBench上,OvisOCR2也取得了最高的Avg3分数75.06。除了这两个公开基准,我们还在一个内部基准上评估了OvisOCR2,该基准旨在覆盖更广泛的长期和挑战性场景。OvisOCR2在比较的方法中获得了最佳总体性能,进一步证明了其泛化能力和鲁棒性。OvisOCR2可在 https://huggingface.co/ATH-MaaS/OvisOCR2 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/16 05:42

论文页面 - OvisOCR2 技术报告

来源:https://huggingface.co/papers/2607.13639 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

我们推出 OvisOCR2,一个 0.8B 的文档解析模型。OvisOCR2 被设计为端到端解析器:给定文档页面图像,它以自然阅读顺序生成 Markdown 表示,涵盖文本、公式、表格和视觉区域。我们构建了一个数据引擎,结合了过滤后的真实文档标注与合成页面,后者的渲染图像和 Markdown 目标均源自同一 HTML 源。训练方案包括监督微调、在 4B 分支上采用多组件奖励设计的强化学习、将策略蒸馏到 0.8B 模型,以及模型融合。在 OmniDocBench v1.6 上,OvisOCR2 取得了 96.58 的最新总体分数,使一个端到端模型登顶此前由流水线方法主导的排行榜,突显了端到端文档解析的潜力。在 PureDocBench 上,OvisOCR2 也以 75.06 的 Avg3 分数获得最高成绩。除了这两个公开基准,我们还在一个内部基准上评估了 OvisOCR2,该基准旨在覆盖更广泛的长尾和挑战性场景。OvisOCR2 在对比方法中取得了最佳总体性能,进一步证明了其泛化性和鲁棒性。OvisOCR2 可在 https://huggingface.co/ATH-MaaS/OvisOCR2 获取。

查看 arXiv 页面(https://arxiv.org/abs/2607.13639)查看 PDF(https://arxiv.org/pdf/2607.13639)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.13639)

在您的代理中获取本文:

hf papers read 2607.13639

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型1

ATH-MaaS/OvisOCR2 图像-文本-文本• 0.9B• 更新于约3小时前 • 745 • 121(https://huggingface.co/ATH-MaaS/OvisOCR2)

引用本文的数据集0

没有数据集链接本文

请在数据集的 README.md 中引用 arxiv.org/abs/2607.13639,以在此页面建立链接。

引用本文的空间2

包含本文的收藏1

相似文章

OvisOCR2:一款有前景的0.8B本地文档解析器

Reddit r/LocalLLaMA

OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。

ATH-MaaS/OvisOCR2

Hugging Face Models Trending

OvisOCR2 是一个紧凑的0.8B端到端模型,用于页面级文档解析,在OmniDocBench和PureDocBench基准测试中达到了最先进的性能。

MonkeyOCRv2: 用于文档AI的视觉-文本基础模型

Hugging Face Daily Papers

MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。

allenai/olmocr

GitHub Trending (daily)

olmOCR 是 AI2 开发的一个开源工具包,可将 PDF、PNG 和 JPEG 文件转换为干净的 Markdown 文本,支持公式、表格和复杂布局。它包含一个基准测试套件和多个模型版本(截至 2025 年 10 月为 v0.4.0),性能和效率均有提升。