标签
一项基准测试比较了8款PDF解析器在14项能力上的表现,发现Chandra最准确,同时也指出了速度等方面的权衡;LightOnOCR-1B以小体积令人印象深刻,但在无法辨认的文本上会产生幻觉。
LiteParse 现在支持从 PDF 中提取结构化数据——表单字段、复选框状态、注释、图像、矢量图形和词级边界框——无需视觉模型,并提供复杂度信号,将更困难的页面路由到 LlamaParse 等工具。
一位开发者对三种PDF解析模型(MinerU、Granite-Docling、PaddleOCR-VL)在六种文档类型和十二项能力上进行了基准测试,发现MinerU会丢失页脚,除非重建其markdown,而Granite-Docling输出更干净的原生markdown表格。
作者解释了为什么客户的PDF银行对账单上所有金额都显示为负数:PDF在与背景相同的灰度级别中编码了不可见的尾随负号,提取代码将其当作可见文本读取。他们讨论了OCR或剥离非黑色文本等解决方案。
Vik Paruchuri 宣布,他的 PDF 解析工具 Marker 已发展为 Datalab 项目,拥有 72k GitHub 星标和每月 6M 次下载,并且他们正在招聘一位创始级开源工程师。
LiteParse是一个快速、轻量级、开源的PDF解析工具,使用Rust编写,原生支持图像到PDF的转换,并提供带有边界框的空间文本解析,可通过多种包(Rust、Node.js、Python、WASM)使用。
LlamaIndex 和 LanceDB 合作构建了一个管道,使用 LiteParse 进行 PDF 解析,并使用 LanceDB 进行多模态存储,从而能够从复杂的企业 PDF 中实现更好的检索,以支持自主工作流。
介绍了五个开源工具(MarkItDown、MinerU、Docling、marker、surya),用于将PDF、Office文档等转换为Markdown或JSON,以便直接供RAG或AI代理使用。
使用 LlamaIndex 的开源工具 LiteParse 和 Cursor AI 的帮助,构建了一个快速的 PDF 解析服务。
LiteParse 是一个快速、开源的文档解析器,在不使用 AI 模型的情况下,其在 Markdown 解析方面的表现优于一些前沿 VLM。它支持多种语言和平台,由 LlamaIndex 开发。
LlamaIndex改进了其用于Claude代理的LiteParse PDF解析技能,通过评估轨迹优化代理行为,使其成本降低37%,准确性更高。
LlamaIndex的博客文章描述了为Claude代理构建自定义LiteParse技能,通过分析代理轨迹来修复PDF解析中的低效问题,从而将每个问题的成本降低了37%,并提高了答案质量。
LiteParse 是一款快速的开源文档解析器,采用 Rust 编写,提供带边界框的高质量空间文本提取功能,支持多种语言和平台,适用于 AI 文档工作负载。
Parse-Flow 是 LlamaIndex 构建的一个开源可视化工作流设计器,它将四个文档处理原语——Parse(解析)、Classify(分类)、Split(分割)和 Extract(提取)——串联到一个由 LlamaAgents 工作流驱动的拖拽画布中,能够从非结构化企业文档(如PDF、合同和发票)中可靠地提取结构化数据。
LlamaIndex 的 Jerry Liu 宣布在旧金山投入超过100万美元的广告牌宣传活动,推广其用于AI代理的PDF解析服务,并列出即将在技术会议上参展的展位。
LlamaIndex 展示了如何使用 LlamaParse 从金融 PDF 中提取结构化数据,实现贷款承销流程的自动化,包括跨文档分析和人工审核。
OpenDataLoader-PDF 是一款开源 PDF 解析工具,在真实学术论文测试中达到 0.907 的高准确率,支持将复杂的 PDF 文档(含表格、公式、扫描件)高效转换为 Markdown 和 JSON,非常适合本地知识库和 RAG 应用。
OpenDataLoader 是一个开源工具,可将 PDF 转换为结构化的 Markdown 和 JSON,支持 100 页/秒的本地处理速度,无需 GPU 或 API 成本,专为 RAG 管道和 PDF 无障碍自动化设计。
Jerry Liu讨论了使用视觉语言模型进行PDF解析所面临的挑战,特别是关于确保文本正确性和保持正确阅读顺序的同时避免出现幻觉问题。
PaddleOCR是一个功能强大、轻量级的OCR工具包,可将PDF和图像转换为结构化数据,适用于AI应用,支持100多种语言,旨在连接文档与大语言模型。