OvisOCR2:一款有前景的0.8B本地文档解析器
摘要
OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。
刚刚看到OvisOCR2,一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型。https://preview.redd.it/adj3m8wu9zch1.png?width=5108&format=png&auto=webp&s=c4f14a0f7bfd6e1417fa8f476479db76498af51b 它能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。模型卡显示其在OmniDocBench v1.6上得分为96.58,在PureDocBench上为75.06。权重基于Apache 2.0协议发布,支持vLLM。从模型规模来看,结果令人印象深刻,但仍需独立进行实际测试。有人将它和GLM-OCR、PaddleOCR-VL、MinerU或Chandra比较过吗?HF:https://huggingface.co/ATH-MaaS/OvisOCR2
相似文章
OvisOCR2 技术报告
OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。
ATH-MaaS/OvisOCR2
OvisOCR2 是一个紧凑的0.8B端到端模型,用于页面级文档解析,在OmniDocBench和PureDocBench基准测试中达到了最先进的性能。
OvisOCR2 (0.8B): 首个登顶OmniDocBench的端到端模型——我用827份真实医学扫描文档测试了它,以下是我学到的所有内容
OvisOCR2是一个0.8B参数的端到端文档解析视觉语言模型,在OmniDocBench排行榜上位居榜首,在实际扫描的医学文档上,其准确性和效率均优于流水线OCR系统。
@techNmak:1.7B 参数轻量 VLM,在 OmniDocBench 上碾压巨头的 OCR 新王者
仅 1.7B 参数的多语言文档解析器 dots.ocr,用轻量体积实现 SOTA,证明文档理解无需巨无霸模型。
allenai/olmocr
olmOCR 是 AI2 开发的一个开源工具包,可将 PDF、PNG 和 JPEG 文件转换为干净的 Markdown 文本,支持公式、表格和复杂布局。它包含一个基准测试套件和多个模型版本(截至 2025 年 10 月为 v0.4.0),性能和效率均有提升。