在将PDF输入本地模型之前,你们都用什么来预处理PDF?

Reddit r/LocalLLaMA 工具

摘要

一位用户寻求PDF预处理工具推荐,以提升本地大语言模型文档问答的输入质量。该用户比较了pymupdf、pdfplumber、docling和llamaparse,用于处理表格、多栏文本等杂乱布局。

我一直在本地搭建文档问答系统,但输出质量因PDF输入给大模型时的样子而异。干净的纯文本文档没问题,但遇到表格或多栏布局时,内容就会变得杂乱,模型只能基于破损的输入来工作(没有抱怨,只是陈述事实)。我之前试过pymupdf和pdfplumber,处理简单情况还行。现在纠结的是,对于更复杂的文档,是选docling还是llamaparse——这两者经常被提及,但我分不清哪个更适合我的环境,或者是否有其他本地工具更稳定。你们对这些工具有什么看法?哪个更实用?
查看原文

相似文章

如何从PDF中解析表格

Reddit r/AI_Agents

关于从PDF中解析表格的建议:将PDF转换为PNG并使用Gemini 3.1 Pro配合low thinking模式,声称准确率达95%。其他工具如Extend、Reducto、Landing在此任务中表现不佳。