@llama_index: “OCR 现在只是一个功能。前沿模型将吞噬它。”我们不断听到这种说法。数据却表明并非如此。在三个……
摘要
LlamaIndex 认为,文档 OCR 并未被前沿模型商品化,基准数据显示专业解析器仍然更准确且成本更低。
查看缓存全文
缓存时间: 2026/08/05 16:29
“OCR 现在只是一个功能而已。前沿模型会把它吃掉。”
我们经常听到这种说法。但数据并非如此。
在 GPT 的三代产品中,解析准确率提升了约 24 个百分点,而单页成本却涨了 4 倍。而且最新的前沿模型仍然落后于专门的解析器。
继续阅读下文,了解为什么这个差距会持续存在(并且会不断累积)https://llamaindex.ai/blog/document-ocr-is-not-getting-commoditized…
文档 OCR 并没有被商品化
来源:https://www.llamaindex.ai/blog/document-ocr-is-not-getting-commoditized 关于文档解析,最常见的观点是它就像一块正在融化的冰块。其推理逻辑如下:每一代前沿模型的发布都会让 PDF 阅读能力好一点点,因此在几代模型之后,OCR 就会变成模型 API 的一个勾选功能,再为专门的供应商付费就显得很傻。
我们认为正在发生的情况恰恰相反,基准测试数据也同意这一点。文档 OCR 的帕累托前沿(在每个价格点上可达到的最佳准确率)远高于最新的前沿模型,而且自 GPT-4o 以来,每一次重大发布都没有缩小这个差距。无论最新前沿模型带来了怎样的视觉理解能力,你都可以将其提炼成一个在文档上更准确、且成本便宜一个数量级的引擎,有时两者兼得。
随着时间推移,模型在视觉理解方面会变得更好。但我们坚信这个差距会继续存在,甚至可能扩大。
前沿模型正在为推理而非阅读调优
前沿实验室将后训练算力投入到基准测试和营收所在的地方:数学、代码和智能体工具使用。GPT-5 系统卡(https://cdn.openai.com/gpt-5-system-card.pdf)在显著改进中提到了“写作、编码和健康”,而文档解析在文中根本没有出现。谷歌的 Gemini 3 发布文章(https://blog.google/products/gemini/gemini-3/)以“最先进的推理能力”和“我们有史以来最好的 vibe coding 和智能体编码模型”开头——阅读文档并未提及。Anthropic 算是个部分例外,Fable 5 的发布说明宣称在图表和表格解释方面有提升,但即便如此,其卖点也是文档上的推理,而不是忠实地数字化那些杂乱的文档。
你可以从 ParseBench(https://www.llamaindex.ai/blog/parsebench)看到由此带来的后果。这是我们在开源方面的文档解析基准测试(约 2000 页人工核验的企业文档,167,000 多条测试规则,涵盖表格、图表、内容忠实度、语义格式和视觉锚定)。我们让整个 GPT 系列模型都跑了一遍。从 GPT-4o 到 GPT-5.5 的三代发布,解析准确率只提升了约 24 个百分点,而单页成本大约翻了两番;最新的、最贵的模型仍然比专门解析器的前沿水平低 20 个百分点。
GPT 系列的 ParseBench 综合得分与单页成本对比。曲线向右上方爬升;任务前沿远在曲线之上。
第三方基准测试也讲述了同样的故事。在 olmOCR-Bench(https://www.idp-leaderboard.org/benchmarks/olmocr/)上,表现最好的专门模型比最佳前沿模型 GPT-5.4 高出 6 个多百分点。Dr.DocBench(https://arxiv.org/html/2606.01393v1)是 5 月发布的专家级解析基准,发现最新的前沿 VLM 都聚集在 60 分出头,并得出结论:“没有哪个前沿 VLM 能主导专家级文档解析。”而 OmniDocBench,即此前的主流标准基准,已经饱和(https://www.llamaindex.ai/blog/omnidocbench-is-saturated-what-s-next-for-ocr-benchmarks)。
单模型在这里之所以会吃亏,有一个结构性原因:锚定。消费解析结果的智能体需要知道每个元素来自哪里,而单次生成在空间定位上表现不佳——GPT-5 Mini 和 Haiku 在 ParseBench 的视觉锚定维度上得分低于 8%,而围绕版面检测构建的解析器得分在 55% 到 80% 之间。一个能对表格进行出色推理、但无法告诉你某个数字来自哪个单元格的模型,在生产环境中是个隐患,因为当表头错列一列时,智能体会悄悄地提取到错误的数字。
文档 OCR 的帕累托前沿位于模型之上
对于固定任务,每种方法都是准确率-成本平面上的一个点,而帕累托前沿就是一组不被任何其他点支配的点。我的观点是,文档 OCR 的帕累托前沿将始终比最新前沿模型更准确、成本更低。
ParseBench 为这种图景提供了数据。LlamaParse(https://cloud.llamaindex.ai/)的 Agentic 模式综合得分为 84.9%,是目前唯一在所有五个维度上都具备竞争力的方法。我们的高性价比模式,性能与最佳前沿 VLM 运行结果相差在几分之内,而单页成本仅约三分之一美分。Gemini Pro 每页消耗 8 美分以上,得分却比 Agentic 模式低 15 个百分点,而后者的运行成本约为其七分之一。
没有任何方法接近 100%,这是有意为之——这个基准测试本身就设定了较高难度。但请注意散点图的分布形态:LlamaParse 的点位于所有 VLM 和所有专门解析器的左上方。我们的基础模型并不比谷歌更聪明。一个为单一任务打造的引擎,就是能以通用模型无法做到的方式“作弊”。
你总是可以提炼前沿模型的智能
我们有四种方式利用这个差距:
- 基于学习到的难度分布对每一页进行路由:“互联网上所有 prompt”的难度分布,在任何有用意义上都是不可学习的。但企业文档页面的难度分布绝对可学。在超十亿页的解析量之后,一个文档复杂度模型可以在你花钱之前就预测:某一页是需要前沿 VLM、小型专门模型,还是根本不需要模型。一个智能体评判器会对值得处理的页面进行验证并优化输出。大多数页面根本不需要调用前沿模型。
- **使用 RL 后训练专门文档 VLM:**文档 OCR 异常适合 RLVR,因为其奖励是可验证的——提取出来的表格要么与基准真值对得上,要么对不上。我们专门针对表格、图表和手写内容后训练文档 VLM,这些正是通用模型最弱的失败模式,从而以远小于前沿模型的规模和成本获得专门化的准确率。
- **利用文件容器内已有的文本和元数据:**这是前沿模型极致论者始终忽略的部分。数字 PDF 本身就包含文本;对它的截图运行视觉模型,意味着花钱重新推导已经存在于文件中的信息。我们定制的 PDFium fork 在内容只有文本时直接提取文本,这将视觉 token 减少了 50-90%,运行速度快了约 60%。Word、PowerPoint 和 Excel 文件是结构化的 OOXML,带有格式、批注、版本历史和演讲者备注;纯像素方案会把这些全部丢掉。对于曲线上你希望完全不使用模型的那个点,我们开源了 LiteParse(https://github.com/run-llama/liteparse),这是一个无模型解析器,能在不到一秒内处理完一本 457 页的 PDF。
- **在评测和引擎之间闭环:**除非你能测量,否则上述每一项改进都无法发现。这就是为什么 ParseBench 是一个庞大得多的内部评测与自动研究循环的公开产物,这个循环能在几天内从失败案例走到测试框架或模型更新。Sarah Guo 的 “The Untrainable”(https://saranormous.substack.com/p/the-untrainable)对为什么这种机制具有复利效应给出了最清晰的阐述:“能力会吞噬许多东西,但更好的模型并不会让私有真值变成公开的。”下个季度更聪明的模型,并不会把我们的评测数据、难度模型或路由策略交给任何人。
将通用智能体加上工具,指向一个具有可验证奖励的任务,然后将结果编译成提炼模型、提炼工作流和存储的上下文。
每家 AI 创业公司都在做同样的事
Greg Kamradt(https://x.com/GregKamradt)在 X 上说得好:“如果你的整个创业公司就是‘我们帮你针对关心的指标做爬山优化,作为一项服务’——你会做得相当不错。”
编码领域有最公开的例子。Factory 的路由器(https://factory.ai/news/factory-router)在 Terminal-Bench 2 上保持了 Claude Opus 4.7 的 99% 通过率,同时每会话成本降低 20%。Cognition 一直在推出自己的专门模型,而不是直接使用前沿模型:SWE-grep(https://cognition.com/blog/swe-grep)“比前沿模型快一个数量级,同时在与上下文检索相关的指标上持平或更优”;SWE-1.7(https://cognition.com/blog/swe-1-7)上周发布,标题是“以极小成本获得前沿智能”。Cursor 使用 RL 训练了 Composer(https://cursor.com/blog/composer) ,以前沿模型 4 倍的生成速度达到前沿编码水平。
在客户支持领域,Decagon 为其智能体栈中的每个功能微调小模型(https://decagon.ai/blog/fine-tuning-ai-agents) 。他们关于蒸馏的帖子(https://decagon.ai/blog/why-off-policy-training-isnt-enough)直白地说明了这个约束:“前沿模型太大,无法满足生产延迟约束;小模型自身能力又不够,因此知识蒸馏成了默认选择。”
在电子表格领域,Shortcut(https://shortcut.ai/)运行着与为 Excel 提供支持的 Claude Opus 4.8 相同的模型,他们的测试框架在困难金融任务上得分为 76%,而 Anthropic 自己产品是 66%,成本却低了约 40%——相同模型,更好的引擎。在法律领域,Harvey 和 Fireworks(https://fireworks.ai/blog/open-source-agents-frontier-advisors)展示了一个经过调优的开源模型加上一个前沿“顾问”,在端到端成本和质量上都击败了 Claude Opus(18/100 任务完全通过,成本 368 美元;对比 14/100,成本 954 美元)。他们的表述完全正确:前沿模型“作为可调用的工具出现,而不是产品所依赖的基础”。甚至连聚合器也加入了:OpenRouter 的 Fusion(https://openrouter.ai/blog/announcements/fusion-beats-frontier/)将一个预算型的模型组合并行展开,在深度研究任务上击败了 GPT-5.5 和 Opus 4.8,以一半成本达到 Fable 5 的 99% 以内。
这些公司的具体机制各不相同——路由、蒸馏、测试框架工程——但赌注是一样的:选择一个任务,拥有评测,同时优化准确率和成本,这是任何通用模型发布都无法做到的。文档,就是我们选择的任务。
即使模型改进,差距依然存在
即使前沿 VLM 的视觉理解能力变得更好,帕累托曲线上的差距仍将继续存在。
每一次新发布都是一条新的基准线,可供衡量和蒸馏。例如,Fable 5 在表格方面比其他前沿模型强(约 90%),尽管它在图表和视觉锚定方面仍有不足——当然,它对于真正的生产环境来说也太贵了。我们可以利用这一点,将其表格解析能力蒸馏到我们以极小规模和成本运行的专门 VLM 中。然后,我们可以将其与引擎中其他调优良好的部分(PDF 文本层、OOXML 结构、版面与边界框元数据)结合起来。最终结果是一个比最新前沿模型便宜好几倍、但同时也更好的解决方案。
差距持续存在的另一个原因是,文档 OCR 并不是一条需求曲线。有些工作负载需要 99% 以上的准确率,且几乎不在乎价格,例如金融数据室提取;在那里,字段级准确率每提升一个百分点,都会转化为更高的直通处理率。有些工作负载每天需要处理一百万份文档且达到某个准确率阈值,例如为 PB 级 SharePoint 做离线索引。有些工作负载需要在数秒内在实时智能体产品中给出答案,此时用户刚刚上传了文件,正在等待。没有任何单一模型能同时落在准确率-成本-延迟这个三维曲面的所有三个关键点上。一个带路由的引擎能覆盖整条曲线,而延迟正是我们预期下一个会像成本一样崩塌的维度。
准确率和成本的差异在大规模场景下至关重要。智能体正在成为文档的主要阅读者,而每一次阅读都要先经过解析。超过 10 万亿页的人类知识被锁在 PDF、PowerPoint、Word 文档和 Excel 工作表中。智能体有望在十年内每年处理数十万亿页。这相当于人类实际阅读量的数倍。在如此规模下,几个百分点的准确率和每页几美分的成本,决定哪些工作负载在经济学上可以被自动化。
所以,不,文档解析不是一块正在融化的冰块。冰块的比喻把因果关系搞反了:每一次前沿模型的发布并不会侵蚀专门引擎,而是在喂养它。解析层的经济学由该任务的最佳引擎决定,而不是由最佳通用模型决定。
ParseBench(https://parsebench.ai/)的数据集和评测代码完全开放;你可以拿自己的解析器跑一遍,看看它在哪里失败。LiteParse(https://github.com/run-llama/liteparse)是免费且无模型的。LlamaParse(https://cloud.llamaindex.ai/)就是本文所描述的引擎。如果你觉得“从每一分钱中榨出每一个文档准确率百分点”听起来很有趣,我们正在招聘(https://www.llamaindex.ai/careers)。
相似文章
@jerryjliu0: 随着前沿模型(例如 Fable 5)不断拓展知识工作自动化的任务边界,人类越来越需要……
LlamaIndex 在 LlamaParse 中推出了细粒度边界框,支持对文档中每一个单词进行可视化引用,从而让用户能够人工审核确切的数字和图表。
@jerryjliu0:我们当前的核心使命是利用 AI 解决文档 OCR 问题。我们所有的产品线,从商业产品(LlamaParse)到……
LlamaIndex 对其官网进行了全面改版,并重申了以 AI 驱动文档 OCR 的核心使命,旗下产品涵盖商业产品 LlamaParse 以及开源工具 LiteParse 和 ParseBench。LlamaParse 采用基于 VLM 的智能文档理解技术,可大规模处理复杂版式、表格、图表及手写文字。
18 款 LLM OCR 实测(7k+ 次调用):便宜/旧模型常吊打旗舰,完整数据集+框架已开源 [R]
对 18 款大模型在 OCR 任务上的全面评测(7k+ 次调用)发现,便宜或旧模型往往能以极低成本达到与旗舰模型相当的准确率,数据集与评测框架已完全开源。
@llama_index: 如何知道你的文档解析器已经可以投入生产?现有的基准测试忽略了AI代理实际需要的…
LlamaIndex 宣布推出 ParseBench,这是一个用于评估 AI 代理文档解析的新基准,并邀请 AI 工程师参加 5 月 27 日的线上研讨会,讨论其方法论以及如何弥补像 OlmOCR 这样的现有基准中的空白。
@itsclelia: 你真的拥有你的文档解析基础设施吗?在 @llama_index,我们想让它更简单,所以构建了…
LlamaIndex 推出了 liteparse-server,这是一个开源、可自托管的 HTTP 后端,用于解析 PDF、图像和 Office 文档,支持空间布局提取、OCR 和截图生成,专为 AI 和数据工作流设计。