我用不同类型,比较了更多解析器在14项PDF解析能力上的表现

Reddit r/LocalLLaMA 新闻

摘要

一项基准测试比较了8款PDF解析器在14项能力上的表现,发现Chandra最准确,同时也指出了速度等方面的权衡;LightOnOCR-1B以小体积令人印象深刻,但在无法辨认的文本上会产生幻觉。

在之前的一篇文章中,我比较了MinerU、Granite-Docling和PaddleOCR-VL。许多评论者建议我加入他们最喜欢的解析器。所以我照做了。我还增加了一些新能力来区分顶级模型。以下是被比较解析器的完整列表: MinerU 2.5 (1.2B VLM) Granite-Docling (258M VLM) PaddleOCR-VL (0.9B VLM) XBerg 1.0 (文本层解析器,CPU) HURIDOCS PDLA v0.0.35 (VGT布局模型 + Tesseract) LiteParse 2.11 (基于Tesseract,CPU) Chandra (Datalab的OCR模型) LightOnOCR-1B 我的发现: Chandra横扫了所有测试:14项全部忠实。它能处理真正的合并单元格HTML表格,生成正确的LaTeX(显示公式和行内公式),在1909年的手写草书上近乎完美,并且是八个解析器中唯一一个在1904年页面上保留了斜体的。面对污渍时它做得对:跳过而不是猜测。缺点:在L4上每页耗时91秒。 手写体部分的表现惨不忍睹。XBerg、LiteParse和PDLA返回的是乱码或什么都没有(草书让传统OCR无能为力)。Granite将原始DocTags泄漏到了输出中。PaddleOCR-VL读出了大部分内容,但把普通的“Maude”编造成了一个贵族名字“Maulevrier”。LightOnOCR在模糊不清的污渍上写出了流畅、自信但错误的文本,考虑到其使用场景,这是你最担心的失败方式。 LightOnOCR-1B就它的规模而言令人印象深刻:能输出真正的LaTeX、干净的管道表格,在L4上每页只需7.9秒。但它在一句话中间丢掉了某一页的结尾,并且在手写体上产生了幻觉。 与之前相同的披露:最初的三个VLM解析器运行在hexread.com(我的产品)上,其余解析器在本地或L4上运行。 编辑注:源文件、原始输出、测试文件和脚本都在此仓库中供参考:alaamroue/pdf-parser-bench
查看原文

相似文章