在将PDF输入本地模型之前,你们都用什么来预处理PDF?
摘要
一位用户寻求PDF预处理工具推荐,以提升本地大语言模型文档问答的输入质量。该用户比较了pymupdf、pdfplumber、docling和llamaparse,用于处理表格、多栏文本等杂乱布局。
我一直在本地搭建文档问答系统,但输出质量因PDF输入给大模型时的样子而异。干净的纯文本文档没问题,但遇到表格或多栏布局时,内容就会变得杂乱,模型只能基于破损的输入来工作(没有抱怨,只是陈述事实)。我之前试过pymupdf和pdfplumber,处理简单情况还行。现在纠结的是,对于更复杂的文档,是选docling还是llamaparse——这两者经常被提及,但我分不清哪个更适合我的环境,或者是否有其他本地工具更稳定。你们对这些工具有什么看法?哪个更实用?
相似文章
我用6种文档类型对比了MinerU、Granite-Docling和PaddleOCR-VL的12项PDF解析能力
一位开发者对三种PDF解析模型(MinerU、Granite-Docling、PaddleOCR-VL)在六种文档类型和十二项能力上进行了基准测试,发现MinerU会丢失页脚,除非重建其markdown,而Granite-Docling输出更干净的原生markdown表格。
@jerryjliu0:LiteParse,我们的开源文档解析器,在将复杂 PDF 布局、文本和表格解析为清晰的空间网格方面表现出色……
LiteParse 是一款基于启发式规则的开源 PDF 解析器,无需依赖 ML 模型即可快速将复杂布局、文本和表格转换为整洁的空间网格。
@jerryjliu0: 对纯文本PDF进行OCR不需要重型VLM。这就像用火箭筒去参加刀战,……
LlamaIndex 宣布在 LlamaParse 中改进了路由机制,该机制为简单的文本密集型 PDF 选择轻量级解析,而为包含表格或图表的复杂页面选择更重的基于 VLM 的解析,从而优化成本和准确性。
如何从PDF中解析表格
关于从PDF中解析表格的建议:将PDF转换为PNG并使用Gemini 3.1 Pro配合low thinking模式,声称准确率达95%。其他工具如Extend、Reducto、Landing在此任务中表现不佳。
我看到很多人问“本地 LLM 真的能做些有用的事吗?”
作者分享了一个个人工作流,使用本地 Qwen 模型,通过 Google Docs 和 PDF 自动化数据库评估、邮件往来以及文档生成。