@llama_index:LiteParse v2.1 来了,它带来了迄今为止最快的 Markdown 输出。在此版本中,我们实现了我们的……

X AI KOLs Following 工具

摘要

LiteParse v2.1 发布,提供了最快的无 LLM PDF 转 Markdown 转换,在无模型工具中基准测试得分最高。

LiteParse v2.1 来了,它带来了迄今为止最快的 Markdown 输出。 在此版本中,我们实现了最迫切的需求:Markdown 输出。但秉承“轻量”精神,我们完全无需 LLM,并且速度极快。 它不仅速度快,还在三个独立的基准测试数据集中击败了所有其他无模型竞争对手。 更多详情请参阅我们的发布博客:https://llamaindex.ai/blog/markdown-comes-to-liteparse?utm_medium=socials&utm_source=twitter&utm_campaign=2026-jun-…
查看原文
查看缓存全文

缓存时间: 2026/06/18 20:11

LiteParse v2.1 现已发布,为您带来最快的 Markdown 输出。

本次更新实现了我们最迫切的需求:Markdown 输出。但本着“轻量”精神,我们完全摆脱了 LLM,速度飞快。

不仅快,而且在三个独立的基准测试数据集中,它的表现也超过了所有其他无模型竞争对手。

更多详情请阅读我们的发布博客:https://llamaindex.ai/blog/markdown-comes-to-liteparse?utm_medium=socials&utm_source=twitter&utm_campaign=2026-jun-…


Markdown 来到 LiteParse

来源:https://www.llamaindex.ai/blog/markdown-comes-to-liteparse?utm_medium=socials&utm_source=twitter&utm_campaign=2026-jun- 几周前,我们推出了 LiteParse 2.0,作为将 PDF 转换为文本的最快工具。然而,有几个问题不断被提及:基准测试在哪里?它输出 Markdown 吗?

LiteParse v2.1(https://developers.llamaindex.ai/liteparse/)通过提供最快的开源、无模型 PDF 到 Markdown 流水线回答了这一需求。我们在三个标准基准测试上测量了性能,并在无模型方法中取得了三项总体最高分:opendataloader-bench 为 0.875,olmOCR-bench 为 0.391,ParseBench 为 0.3279。

访问演示站点(https://www.llamaindex.ai/liteparse-demo)(在浏览器中通过 WASM 运行)或立即安装最新版本!

$ pip install liteparse $ lit parse doc.pdf --format markdown

`` from liteparse import LiteParse

lp = LiteParse(output_format=“markdown”) result = lp.parse(“doc.pdf”) print(result.text) ``

它是如何工作的?

构建启发式流水线以生成 Markdown,基本上分为两部分:可以检测的信号,以及监听这些信号的输出元素类型。与任何机器学习模型类似,这本质上可以归结为输入、权重和激活!

PDF 包含大量数据:字体族、字号、文本位置等等。这些都被视为输入信号,用于将文本分类为特定的 Markdown 元素,如段落、表格、列表和标题。

LiteParse 使用了定制的 PDFium 分支来捕获尽可能多的信号,然后将其与我们现有网格投影算法的信号相结合,以提供我们能够通过纯启发式规则方法实现的最佳 Markdown 输出。

随着时间的推移,我们预计这种模式会变得更好。有大量长尾 PDF 可以逐步适应,而时间正是让这种模式变得更好的关键。

测量 Markdown 性能

事实证明,Markdown 不仅是一个强烈要求的输出选项,而且没有它,对 PDF 解析工具进行基准测试也非常困难。

所有现有的基准测试(ParseBench、olmOCR-bench、opendataloader-bench)都强烈适用于测量 Markdown。通过构建这个 Markdown 流水线,我们不仅能够提供全新的输出模式,还能衡量并提升整体提取质量。

本着“轻量”精神,我们构建了 LiteParse 中的 Markdown 模式,使其尽可能轻巧快速。这种方法优先考虑速度,但也必须接受准确性的上限(通过这种方式,我们不会比 LlamaParse 做得更好)。

为了公平比较,我们将比较范围限定在不依赖大型 AI 模型进行解析的开源工具。这意味着在基准测试时,OCR 和其他模型集成功能被禁用。

基准测试结果

ParseBench

我们已经写了很多关于 ParseBench 的内容(https://www.llamaindex.ai/blog/parsebench)。2000 多份文档,涵盖最终用户真正关心的 5 个关键指标。这些文档都是故意挑选的困难文档,因此如果没有大型 AI 模型,这些分数实际上相当令人印象深刻。

LiteParse 在总体指标上领先。图表和视觉基础列对于这里的所有无模型工具来说基本上是噪声。ParseBench 通过比较从图表中提取的结构化数据来评估图表(以及其布局/视觉基础指标的部分),这从根本上需要 ML 模型来恢复。启发式引擎在这方面没有任何东西可以输出,因此所有无模型工具都集中在零附近。我们报告这些列只是为了完整性。

分类LiteParsepymupdf4llmopendataloaderpdf-inspectormarkitdown总体****0.3280.3100.2940.2660.186表格0.4030.3730.3520.2660.158内容忠实度0.6860.6090.6610.5610.645语义格式0.4090.4460.3410.3510.009图表*0.0340.0150.0010.0530.020视觉基础*0.1070.1070.1080.0990.099

  • 这里的数字大多是噪声,这些工具都没有输出正确的数据来正确地进行这些指标的基准测试

opendataloader-bench

opendataloader-bench 是一个小型基准测试,包含 200 份文档(https://github.com/opendataloader-project/opendataloader-bench)。它主要衡量三件事:阅读顺序相似度(NID)、表格结构相似度(TEDS)和标题级别相似度(MHS)。你可以在他们的 GitHub 仓库中阅读更多关于这些指标的信息。

在这里,LiteParse 在所有类别中领先。官方仓库还报告了实际 AI 模型的分数,LiteParse 在这方面的表现也很有竞争力,但在这篇博客文章中,我们只比较类似的无模型开源工具。

分类LiteParsepymupdf4llmopendataloaderpdf-inspectormarkitdown总体****0.8710.7320.8310.7920.589NID(阅读顺序)0.9080.8850.9020.8760.844TEDS(表格)0.6930.4010.4830.6300.273MHS(标题)0.8160.4120.7390.6020.000

olmOCR-bench

LiteParse 在 olmOCR-bench 的大多数类别中领先。他们的一些规则检查并不总能反映期望的输出,有时甚至互相矛盾(我们之前已经写过相关文章(https://www.llamaindex.ai/blog/olmocr-bench-review-insights-and-pitfalls-on-an-ocr-benchmark)),但这仍然是有用的信号。

LiteParse 在基本健全性检查上得分不错,在页眉/页脚、多列和表格测试中表现强劲。在旧扫描/数学上的低分是预期的,因为这些通常需要 OCR。其他分数与其他工具相差不远。

分类LiteParsepymupdf4llmopendataloaderpdf-inspectormarkitdown**总体****39.2%32.9%32.7%30.5%28.7%基线99.9%84.5%86.9%82.9%86.8%页眉/页脚55.9%39.5%37.5%52.0%38.8%多列67.1%66.7%62.8%38.2%39.3%表格测试48.0%**46.3%25.7%40.0%19.9%长小文本29.2%12.7%**35.1%**17.4%31.2%旧扫描13.3%13.3%13.3%13.3%13.3%arXiv数学0.0%0.0%0.0%0.0%0.0%旧扫描数学0.0%0.0%0.0%0.0%0.0%

速度测试

速度是在一组固定 PDF 上测量的,这些 PDF 具有不同的布局、页数和内容类型。报告的时间是整个测试集处理单页的平均时间。你可以在此找到源数据(https://huggingface.co/datasets/llamaindex/liteparse_bench_small/tree/main/bench-docs)和基准测试代码(https://github.com/run-llama/liteparse/tree/main/dataset_eval_utils)。

提供商毫秒/页(汇总)liteparse3.16 mspdf-inspector3.83 msopendataloader66.3 mspymupdf4llm-md141.5 msmarkitdown182.5 ms

许可与可移植性

在所有测试的工具中,存在不同许可证和支持的运行环境。

LiteParse 采用宽松许可证(Apache-2.0),并在四个生态系统中作为单一引擎运行,包括通过 WASM 在浏览器中本地运行。纯 Python 工具无法在浏览器或 Node 服务所需的环境中运行,而 pymupdf4llm 继承了 PyMuPDF 的 AGPL-3.0 copyleft,这对许多商业代码库来说如果没有付费许可则无法使用。

工具许可证语言/运行时LiteParse****Apache-2.0Rust、Python、Node、WASM(浏览器)pymupdf4llmAGPL-3.0(可商用)PythonmarkitdownMITPythonopendataloaderApache-2.0Java 核心(+ Python、Node.js 封装)pdf-inspectorMITRust

关于 v2.1 范围的说明

这三个基准测试并不总是对什么是“好”的 Markdown 达成一致。我们反复发现,为了在一个基准测试(例如 olmOCR-bench)上获胜而调整输出,会降低另一个基准测试(例如 ParseBench)的表现,反之亦然。目测 PDF 时,你经常会看到“得分高”但视觉上效果不佳的结果。我们没有针对任何一个测试工具进行过度优化,而是将 v2.1 调整为在所有三个测试工具上都能提供稳健、均衡的性能。未来还有很大的空间来提升各个子类别(我们会的!)。

立即尝试!

LiteParse 随处可用,v2.1 现已发布:

``

Node 库 + CLI

npm i @llamaindex/liteparse

Python 库 + CLI

pip install liteparse

Rust 库 + CLI

cargo install liteparse

WASM 库

npm i @llamaindex/liteparse-wasm ``

或者,直接将其作为技能与你喜爱的编码代理一起使用:

``

Claude Code、Codex、OpenCode 等

npx skills add run-llama/llamaparse-agent-skills –skill liteparse

Pi Coding Agent 扩展

pi install npm:@llamaindex/liteparse-pi-extension@latest ``

通过以下链接查看文档和源代码详情:

  • 入门文档(https://developers.llamaindex.ai/liteparse/)
  • GitHub(https://github.com/run-llama/liteparse)
  • 包:
    • PyPi(https://pypi.org/project/liteparse/)
    • Node(https://www.npmjs.com/package/@llamaindex/liteparse)
    • WASM(https://www.npmjs.com/package/@llamaindex/liteparse-wasm)
    • Rust(https://crates.io/crates/liteparse)

相似文章