OvisOCR2 技术报告
摘要
OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。
查看缓存全文
缓存时间: 2026/07/16 05:42
论文页面 - OvisOCR2 技术报告
来源:https://huggingface.co/papers/2607.13639 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
我们推出 OvisOCR2,一个 0.8B 的文档解析模型。OvisOCR2 被设计为端到端解析器:给定文档页面图像,它以自然阅读顺序生成 Markdown 表示,涵盖文本、公式、表格和视觉区域。我们构建了一个数据引擎,结合了过滤后的真实文档标注与合成页面,后者的渲染图像和 Markdown 目标均源自同一 HTML 源。训练方案包括监督微调、在 4B 分支上采用多组件奖励设计的强化学习、将策略蒸馏到 0.8B 模型,以及模型融合。在 OmniDocBench v1.6 上,OvisOCR2 取得了 96.58 的最新总体分数,使一个端到端模型登顶此前由流水线方法主导的排行榜,突显了端到端文档解析的潜力。在 PureDocBench 上,OvisOCR2 也以 75.06 的 Avg3 分数获得最高成绩。除了这两个公开基准,我们还在一个内部基准上评估了 OvisOCR2,该基准旨在覆盖更广泛的长尾和挑战性场景。OvisOCR2 在对比方法中取得了最佳总体性能,进一步证明了其泛化性和鲁棒性。OvisOCR2 可在 https://huggingface.co/ATH-MaaS/OvisOCR2 获取。
查看 arXiv 页面(https://arxiv.org/abs/2607.13639)查看 PDF(https://arxiv.org/pdf/2607.13639)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.13639)
在您的代理中获取本文:
hf papers read 2607.13639
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型1
ATH-MaaS/OvisOCR2 图像-文本-文本• 0.9B• 更新于约3小时前 • 745 • 121(https://huggingface.co/ATH-MaaS/OvisOCR2)
引用本文的数据集0
没有数据集链接本文
请在数据集的 README.md 中引用 arxiv.org/abs/2607.13639,以在此页面建立链接。
引用本文的空间2
包含本文的收藏1
相似文章
OvisOCR2:一款有前景的0.8B本地文档解析器
OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。
ATH-MaaS/OvisOCR2
OvisOCR2 是一个紧凑的0.8B端到端模型,用于页面级文档解析,在OmniDocBench和PureDocBench基准测试中达到了最先进的性能。
OvisOCR2 (0.8B): 首个登顶OmniDocBench的端到端模型——我用827份真实医学扫描文档测试了它,以下是我学到的所有内容
OvisOCR2是一个0.8B参数的端到端文档解析视觉语言模型,在OmniDocBench排行榜上位居榜首,在实际扫描的医学文档上,其准确性和效率均优于流水线OCR系统。
MonkeyOCRv2: 用于文档AI的视觉-文本基础模型
MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。
allenai/olmocr
olmOCR 是 AI2 开发的一个开源工具包,可将 PDF、PNG 和 JPEG 文件转换为干净的 Markdown 文本,支持公式、表格和复杂布局。它包含一个基准测试套件和多个模型版本(截至 2025 年 10 月为 v0.4.0),性能和效率均有提升。