我用6种文档类型对比了MinerU、Granite-Docling和PaddleOCR-VL的12项PDF解析能力

Reddit r/LocalLLaMA 新闻

摘要

一位开发者对三种PDF解析模型(MinerU、Granite-Docling、PaddleOCR-VL)在六种文档类型和十二项能力上进行了基准测试,发现MinerU会丢失页脚,除非重建其markdown,而Granite-Docling输出更干净的原生markdown表格。

我通过自己的webapp发送了6份文档(每份代表一种不同的文档类型),并将每个输出与源文件进行了比较。它们都在同一块L4 GPU上运行。这些文档包括:带有合并多级表头的财务报表(典型的年度报告)、一篇双栏arXiv论文的两页(“Deep Residual Learning for Image Recognition”)、没有文本层的扫描版德语发票、带有嵌入式条形图的法语市政报告、混合了德语、法语、中文和俄语的典型数据手册页面,以及一篇2页3栏的通讯文章。需要注意的一点是,能力评分没有显示:Granite-Docling是唯一输出markdown原生管道表格和真实标题级别的模型(MinerU提供HTML表格,并把所有标题都提升为#级别),所以在干净的电子文档上,它的原始markdown读起来最舒服。MinerU默默读取了条形图并将数值以表格形式返回,还为嵌入式图像编写了自己的描述(标记为“生成”)。MinerU似乎从页脚中丢掉了发票的IBAN。但实际上模型确实转录了它,只是MinerU的markdown生成器会静默丢弃任何它归类为页面装饰(例如页脚、页码、小字等)的内容,而且没有任何选项或配置能真正改变这一行为。因此,我改用从其块列表重建markdown,并重新运行那一列,以进行公平比较。如果你使用原版MinerU的.md输出,很可能会缺少页脚。如果有人对这些模型处理其他文档类型的表现感兴趣,请告诉我,我很乐意进行对比。我是通过自己的服务(hexread.com)提供的API来运行这一基准测试的。你也可以直接在网站上测试PDF(有免费试用,但只能使用自动模型选择)。
查看原文

相似文章

opendatalab/MinerU

GitHub Trending (daily)

MinerU 是 OpenDataLab 开发的一款开源工具,用于从 PDF 和文档中提取数据。

PaddlePaddle/PaddleOCR

GitHub Trending (daily)

PaddleOCR是一个功能强大、轻量级的OCR工具包,可将PDF和图像转换为结构化数据,适用于AI应用,支持100多种语言,旨在连接文档与大语言模型。