OvisOCR2:一款有前景的0.8B本地文档解析器

Reddit r/LocalLLaMA 模型

摘要

OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。

刚刚看到OvisOCR2,一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型。https://preview.redd.it/adj3m8wu9zch1.png?width=5108&format=png&auto=webp&s=c4f14a0f7bfd6e1417fa8f476479db76498af51b 它能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。模型卡显示其在OmniDocBench v1.6上得分为96.58,在PureDocBench上为75.06。权重基于Apache 2.0协议发布,支持vLLM。从模型规模来看,结果令人印象深刻,但仍需独立进行实际测试。有人将它和GLM-OCR、PaddleOCR-VL、MinerU或Chandra比较过吗?HF:https://huggingface.co/ATH-MaaS/OvisOCR2
查看原文

相似文章

OvisOCR2 技术报告

Hugging Face Daily Papers

OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。

ATH-MaaS/OvisOCR2

Hugging Face Models Trending

OvisOCR2 是一个紧凑的0.8B端到端模型,用于页面级文档解析,在OmniDocBench和PureDocBench基准测试中达到了最先进的性能。

allenai/olmocr

GitHub Trending (daily)

olmOCR 是 AI2 开发的一个开源工具包,可将 PDF、PNG 和 JPEG 文件转换为干净的 Markdown 文本,支持公式、表格和复杂布局。它包含一个基准测试套件和多个模型版本(截至 2025 年 10 月为 v0.4.0),性能和效率均有提升。