我用不同类型,比较了更多解析器在14项PDF解析能力上的表现
摘要
一项基准测试比较了8款PDF解析器在14项能力上的表现,发现Chandra最准确,同时也指出了速度等方面的权衡;LightOnOCR-1B以小体积令人印象深刻,但在无法辨认的文本上会产生幻觉。
在之前的一篇文章中,我比较了MinerU、Granite-Docling和PaddleOCR-VL。许多评论者建议我加入他们最喜欢的解析器。所以我照做了。我还增加了一些新能力来区分顶级模型。以下是被比较解析器的完整列表:
MinerU 2.5 (1.2B VLM)
Granite-Docling (258M VLM)
PaddleOCR-VL (0.9B VLM)
XBerg 1.0 (文本层解析器,CPU)
HURIDOCS PDLA v0.0.35 (VGT布局模型 + Tesseract)
LiteParse 2.11 (基于Tesseract,CPU)
Chandra (Datalab的OCR模型)
LightOnOCR-1B
我的发现:
Chandra横扫了所有测试:14项全部忠实。它能处理真正的合并单元格HTML表格,生成正确的LaTeX(显示公式和行内公式),在1909年的手写草书上近乎完美,并且是八个解析器中唯一一个在1904年页面上保留了斜体的。面对污渍时它做得对:跳过而不是猜测。缺点:在L4上每页耗时91秒。
手写体部分的表现惨不忍睹。XBerg、LiteParse和PDLA返回的是乱码或什么都没有(草书让传统OCR无能为力)。Granite将原始DocTags泄漏到了输出中。PaddleOCR-VL读出了大部分内容,但把普通的“Maude”编造成了一个贵族名字“Maulevrier”。LightOnOCR在模糊不清的污渍上写出了流畅、自信但错误的文本,考虑到其使用场景,这是你最担心的失败方式。
LightOnOCR-1B就它的规模而言令人印象深刻:能输出真正的LaTeX、干净的管道表格,在L4上每页只需7.9秒。但它在一句话中间丢掉了某一页的结尾,并且在手写体上产生了幻觉。
与之前相同的披露:最初的三个VLM解析器运行在hexread.com(我的产品)上,其余解析器在本地或L4上运行。
编辑注:源文件、原始输出、测试文件和脚本都在此仓库中供参考:alaamroue/pdf-parser-bench
相似文章
我用6种文档类型对比了MinerU、Granite-Docling和PaddleOCR-VL的12项PDF解析能力
一位开发者对三种PDF解析模型(MinerU、Granite-Docling、PaddleOCR-VL)在六种文档类型和十二项能力上进行了基准测试,发现MinerU会丢失页脚,除非重建其markdown,而Granite-Docling输出更干净的原生markdown表格。
@jerryjliu0: 以光速解析PDF(此视频为1倍速)简直是电影
Jerry Liu宣布了LiteParse v2,一款基于Rust的PDF解析器,据称是目前最快、最准确的开源、无模型PDF解析器。
@jerryjliu0:上周我们重做了Liteparse,使其成为目前最快的PDF解析器。Liteparse的一个被低估之处是它不仅能提取文本,还能提供边界框,让编码代理能够精确绘制出原始文档的审计轨迹。
Jerry Liu宣布重做后的LiteParse是一款快速的PDF解析器,可提供用于审计轨迹的边界框,并附带示例演示。
@jerryjliu0:LiteParse,我们的开源文档解析器,在将复杂 PDF 布局、文本和表格解析为清晰的空间网格方面表现出色……
LiteParse 是一款基于启发式规则的开源 PDF 解析器,无需依赖 ML 模型即可快速将复杂布局、文本和表格转换为整洁的空间网格。
@jerryjliu0: 我们让Claude在理解PDF方面变得更好更快。秘诀不仅仅是打造最快的免费文档解析器…
LlamaIndex改进了其用于Claude代理的LiteParse PDF解析技能,通过评估轨迹优化代理行为,使其成本降低37%,准确性更高。