@llama_index:LiteParse v2.1 来了,它带来了迄今为止最快的 Markdown 输出。在此版本中,我们实现了我们的……
摘要
LiteParse v2.1 发布,提供了最快的无 LLM PDF 转 Markdown 转换,在无模型工具中基准测试得分最高。
查看缓存全文
缓存时间: 2026/06/18 20:11
LiteParse v2.1 现已发布,为您带来最快的 Markdown 输出。
本次更新实现了我们最迫切的需求:Markdown 输出。但本着“轻量”精神,我们完全摆脱了 LLM,速度飞快。
不仅快,而且在三个独立的基准测试数据集中,它的表现也超过了所有其他无模型竞争对手。
更多详情请阅读我们的发布博客:https://llamaindex.ai/blog/markdown-comes-to-liteparse?utm_medium=socials&utm_source=twitter&utm_campaign=2026-jun-…
Markdown 来到 LiteParse
来源:https://www.llamaindex.ai/blog/markdown-comes-to-liteparse?utm_medium=socials&utm_source=twitter&utm_campaign=2026-jun- 几周前,我们推出了 LiteParse 2.0,作为将 PDF 转换为文本的最快工具。然而,有几个问题不断被提及:基准测试在哪里?它输出 Markdown 吗?
LiteParse v2.1(https://developers.llamaindex.ai/liteparse/)通过提供最快的开源、无模型 PDF 到 Markdown 流水线回答了这一需求。我们在三个标准基准测试上测量了性能,并在无模型方法中取得了三项总体最高分:opendataloader-bench 为 0.875,olmOCR-bench 为 0.391,ParseBench 为 0.3279。
访问演示站点(https://www.llamaindex.ai/liteparse-demo)(在浏览器中通过 WASM 运行)或立即安装最新版本!
$ pip install liteparse $ lit parse doc.pdf --format markdown
`` from liteparse import LiteParse
lp = LiteParse(output_format=“markdown”) result = lp.parse(“doc.pdf”) print(result.text) ``
它是如何工作的?
构建启发式流水线以生成 Markdown,基本上分为两部分:可以检测的信号,以及监听这些信号的输出元素类型。与任何机器学习模型类似,这本质上可以归结为输入、权重和激活!
PDF 包含大量数据:字体族、字号、文本位置等等。这些都被视为输入信号,用于将文本分类为特定的 Markdown 元素,如段落、表格、列表和标题。
LiteParse 使用了定制的 PDFium 分支来捕获尽可能多的信号,然后将其与我们现有网格投影算法的信号相结合,以提供我们能够通过纯启发式规则方法实现的最佳 Markdown 输出。
随着时间的推移,我们预计这种模式会变得更好。有大量长尾 PDF 可以逐步适应,而时间正是让这种模式变得更好的关键。
测量 Markdown 性能
事实证明,Markdown 不仅是一个强烈要求的输出选项,而且没有它,对 PDF 解析工具进行基准测试也非常困难。
所有现有的基准测试(ParseBench、olmOCR-bench、opendataloader-bench)都强烈适用于测量 Markdown。通过构建这个 Markdown 流水线,我们不仅能够提供全新的输出模式,还能衡量并提升整体提取质量。
本着“轻量”精神,我们构建了 LiteParse 中的 Markdown 模式,使其尽可能轻巧快速。这种方法优先考虑速度,但也必须接受准确性的上限(通过这种方式,我们不会比 LlamaParse 做得更好)。
为了公平比较,我们将比较范围限定在不依赖大型 AI 模型进行解析的开源工具。这意味着在基准测试时,OCR 和其他模型集成功能被禁用。
基准测试结果
ParseBench
我们已经写了很多关于 ParseBench 的内容(https://www.llamaindex.ai/blog/parsebench)。2000 多份文档,涵盖最终用户真正关心的 5 个关键指标。这些文档都是故意挑选的困难文档,因此如果没有大型 AI 模型,这些分数实际上相当令人印象深刻。
LiteParse 在总体指标上领先。图表和视觉基础列对于这里的所有无模型工具来说基本上是噪声。ParseBench 通过比较从图表中提取的结构化数据来评估图表(以及其布局/视觉基础指标的部分),这从根本上需要 ML 模型来恢复。启发式引擎在这方面没有任何东西可以输出,因此所有无模型工具都集中在零附近。我们报告这些列只是为了完整性。
分类LiteParsepymupdf4llmopendataloaderpdf-inspectormarkitdown总体****0.3280.3100.2940.2660.186表格0.4030.3730.3520.2660.158内容忠实度0.6860.6090.6610.5610.645语义格式0.4090.4460.3410.3510.009图表*0.0340.0150.0010.0530.020视觉基础*0.1070.1070.1080.0990.099
- 这里的数字大多是噪声,这些工具都没有输出正确的数据来正确地进行这些指标的基准测试
opendataloader-bench
opendataloader-bench 是一个小型基准测试,包含 200 份文档(https://github.com/opendataloader-project/opendataloader-bench)。它主要衡量三件事:阅读顺序相似度(NID)、表格结构相似度(TEDS)和标题级别相似度(MHS)。你可以在他们的 GitHub 仓库中阅读更多关于这些指标的信息。
在这里,LiteParse 在所有类别中领先。官方仓库还报告了实际 AI 模型的分数,LiteParse 在这方面的表现也很有竞争力,但在这篇博客文章中,我们只比较类似的无模型开源工具。
分类LiteParsepymupdf4llmopendataloaderpdf-inspectormarkitdown总体****0.8710.7320.8310.7920.589NID(阅读顺序)0.9080.8850.9020.8760.844TEDS(表格)0.6930.4010.4830.6300.273MHS(标题)0.8160.4120.7390.6020.000
olmOCR-bench
LiteParse 在 olmOCR-bench 的大多数类别中领先。他们的一些规则检查并不总能反映期望的输出,有时甚至互相矛盾(我们之前已经写过相关文章(https://www.llamaindex.ai/blog/olmocr-bench-review-insights-and-pitfalls-on-an-ocr-benchmark)),但这仍然是有用的信号。
LiteParse 在基本健全性检查上得分不错,在页眉/页脚、多列和表格测试中表现强劲。在旧扫描/数学上的低分是预期的,因为这些通常需要 OCR。其他分数与其他工具相差不远。
分类LiteParsepymupdf4llmopendataloaderpdf-inspectormarkitdown**总体****39.2%32.9%32.7%30.5%28.7%基线99.9%84.5%86.9%82.9%86.8%页眉/页脚55.9%39.5%37.5%52.0%38.8%多列67.1%66.7%62.8%38.2%39.3%表格测试48.0%**46.3%25.7%40.0%19.9%长小文本29.2%12.7%**35.1%**17.4%31.2%旧扫描13.3%13.3%13.3%13.3%13.3%arXiv数学0.0%0.0%0.0%0.0%0.0%旧扫描数学0.0%0.0%0.0%0.0%0.0%
速度测试
速度是在一组固定 PDF 上测量的,这些 PDF 具有不同的布局、页数和内容类型。报告的时间是整个测试集处理单页的平均时间。你可以在此找到源数据(https://huggingface.co/datasets/llamaindex/liteparse_bench_small/tree/main/bench-docs)和基准测试代码(https://github.com/run-llama/liteparse/tree/main/dataset_eval_utils)。
提供商毫秒/页(汇总)liteparse3.16 mspdf-inspector3.83 msopendataloader66.3 mspymupdf4llm-md141.5 msmarkitdown182.5 ms
许可与可移植性
在所有测试的工具中,存在不同许可证和支持的运行环境。
LiteParse 采用宽松许可证(Apache-2.0),并在四个生态系统中作为单一引擎运行,包括通过 WASM 在浏览器中本地运行。纯 Python 工具无法在浏览器或 Node 服务所需的环境中运行,而 pymupdf4llm 继承了 PyMuPDF 的 AGPL-3.0 copyleft,这对许多商业代码库来说如果没有付费许可则无法使用。
工具许可证语言/运行时LiteParse****Apache-2.0Rust、Python、Node、WASM(浏览器)pymupdf4llmAGPL-3.0(可商用)PythonmarkitdownMITPythonopendataloaderApache-2.0Java 核心(+ Python、Node.js 封装)pdf-inspectorMITRust
关于 v2.1 范围的说明
这三个基准测试并不总是对什么是“好”的 Markdown 达成一致。我们反复发现,为了在一个基准测试(例如 olmOCR-bench)上获胜而调整输出,会降低另一个基准测试(例如 ParseBench)的表现,反之亦然。目测 PDF 时,你经常会看到“得分高”但视觉上效果不佳的结果。我们没有针对任何一个测试工具进行过度优化,而是将 v2.1 调整为在所有三个测试工具上都能提供稳健、均衡的性能。未来还有很大的空间来提升各个子类别(我们会的!)。
立即尝试!
LiteParse 随处可用,v2.1 现已发布:
``
Node 库 + CLI
npm i @llamaindex/liteparse
Python 库 + CLI
pip install liteparse
Rust 库 + CLI
cargo install liteparse
WASM 库
npm i @llamaindex/liteparse-wasm ``
或者,直接将其作为技能与你喜爱的编码代理一起使用:
``
Claude Code、Codex、OpenCode 等
npx skills add run-llama/llamaparse-agent-skills –skill liteparse
Pi Coding Agent 扩展
pi install npm:@llamaindex/liteparse-pi-extension@latest ``
通过以下链接查看文档和源代码详情:
- 入门文档(https://developers.llamaindex.ai/liteparse/)
- GitHub(https://github.com/run-llama/liteparse)
- 包:
- PyPi(https://pypi.org/project/liteparse/)
- Node(https://www.npmjs.com/package/@llamaindex/liteparse)
- WASM(https://www.npmjs.com/package/@llamaindex/liteparse-wasm)
- Rust(https://crates.io/crates/liteparse)
相似文章
@jerryjliu0: 这太疯狂了,LiteParse 在 Markdown 文档解析上的表现甚至能与前沿 VLM 一较高下——当它…
LiteParse 是一个快速、开源的文档解析器,在不使用 AI 模型的情况下,其在 Markdown 解析方面的表现优于一些前沿 VLM。它支持多种语言和平台,由 LlamaIndex 开发。
@itsafiz:使用 LiteParse 构建了一个超快的 PDF 解析服务!LiteParse 是由 @llama_index 开发的独立开源 PDF 解析工具 f…
使用 LlamaIndex 的开源工具 LiteParse 和 Cursor AI 的帮助,构建了一个快速的 PDF 解析服务。
@llama_index: 当我们说“LiteParse 无处不在”时,我们是认真的。我们的 WASM 包轻量、精简,专为浏览器和…
LiteParse 是一个基于 WASM 的轻量级 PDF 解析器,专为浏览器和边缘运行时(如 Cloudflare Workers)设计,可在边缘环境中高效解析文档。
@jerryjliu0:上周我们重做了Liteparse,使其成为目前最快的PDF解析器。Liteparse的一个被低估之处是它不仅能提取文本,还能提供边界框,让编码代理能够精确绘制出原始文档的审计轨迹。
Jerry Liu宣布重做后的LiteParse是一款快速的PDF解析器,可提供用于审计轨迹的边界框,并附带示例演示。
@jerryjliu0: 我们让Claude在理解PDF方面变得更好更快。秘诀不仅仅是打造最快的免费文档解析器…
LlamaIndex改进了其用于Claude代理的LiteParse PDF解析技能,通过评估轨迹优化代理行为,使其成本降低37%,准确性更高。