标签
LiteParse 现在支持从 PDF 中提取结构化数据——表单字段、复选框状态、注释、图像、矢量图形和词级边界框——无需视觉模型,并提供复杂度信号,将更困难的页面路由到 LlamaParse 等工具。
LlamaIndex 推出了 Parse Gateway,这是一个页面级文档 OCR 路由器,能够估算每一页的复杂度,并将其路由到相应的解析层级(LiteParse 或 LlamaParse),在成本、延迟和质量之间取得平衡。
LlamaIndex 和 LanceDB 合作构建了一个管道,使用 LiteParse 进行 PDF 解析,并使用 LanceDB 进行多模态存储,从而能够从复杂的企业 PDF 中实现更好的检索,以支持自主工作流。
Jerry Liu 发布了 LiteParse,这是一个快速且准确的文件解析器,用于代理循环,现已集成到 Vercel 的 Eve 框架中。
Jerry Liu 提出了一个涵盖准确性、成本和延迟权衡的文档解析框架,介绍了 LiteParse 作为一个面向 AI 智能体循环的开源低延迟解析工具,以及 LlamaParse 用于高精度模式。
面向大学使用场景的本地文档处理工具(Docling、Liteparse、Mineru 和 Unstructured)对比,评估它们对本地部署的适用性。
LlamaIndex的Jerry Liu演示了如何使用LiteParse构建一个财务尽职调查AI代理。LiteParse是一个免费的开源PDF解析器,能够提供精确引用和边界框坐标,从而在代理工作流中实现信任和透明度。
sandboxed-lit 是一个 Rust CLI 代理,通过 LiteParse 和 microsandbox 安全解析 PDF、图像和 Office 文档,结合本地文件访问与沙盒化的 Bash 环境。