ExtractBench:面向模式引导的企业文档抽取基准
摘要
ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。
查看缓存全文
缓存时间: 2026/08/03 05:30
论文页面 - ExtractBench:用于 Schema 引导的企业文档提取基准
来源:https://huggingface.co/papers/2607.29677
摘要
企业工作流越来越依赖 agent 进行 Schema 引导的提取:给定一个文档和用户定义的 schema,agent 会忠实地遵循 schema 生成正确输出,并将来源证据作为 grounding 元数据。我们提出了 ExtractBench,这是一个用于 Schema 引导提取的基准,并且据我们所知,是第一个将值准确性、规模化记录完整性、grounding 和实测成本一并评分的基准。该评估系统包含 370 份企业文档、8 个业务领域和 67 种文档类型,共 4,869 页,并带有清晰标签以区分其挑战场景。可扩展的 schema 与真值整理流水线结合了对真实文档的独立系统一致性、合成列表的已知值以及表单的人工验证。我们报告顺序不敏感的值 F1 来衡量值准确性,以及两个用于来源可追溯性的 grounding 指标:词级和页面级 F1。商业 VLM 在短文档上表现出色,但在长文档上经常截断记录列表,而编码 agent 以高得多的成本保持了更高的准确性。LlamaExtract AgenticPlus 在所有三项指标上均排名第一,其准确性与编码 agent 相当,但成本仅为其一小部分。数据集和评估代码可在 https://huggingface.co/datasets/llamaindex/ExtractBench{HuggingFace} 和 https://github.com/run-llama/ExtractBench{GitHub}. 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2607.29677) 查看 PDF (https://arxiv.org/pdf/2607.29677) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.29677)
在你的 agent 中获取此论文:
hf papers read 2607\.29677
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型
0
没有链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2607.29677 以从此页面链接它。
引用此论文的数据集
0
没有链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.29677 以从此页面链接它。
引用此论文的 Space
0
没有链接此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.29677 以从此页面链接它。
包含此论文的收藏
0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
@llama_index: 大多数文档提取API无法告知数据来源。对于ExtractBench,我们严格评估了溯源性:一个…
ExtractBench 是一个新的文档提取基准测试,严格评分溯源准确性,显示 VLMs 和编码代理缺乏证据,而 LlamaExtract Agentic Plus 以高性能领先于页面级和单词级指标。
@jerryjliu0:ParseBench 是首个在完整企业文档中评测 VLM 图表理解能力的基准
ParseBench 首次把图表理解放进整份企业文档中评测视觉-语言模型,填补了以往仅针对孤立图表的基准空白。
@VikParuchuri: 结构化提取难以评估,大多数基准测试有偏差,或者评分/地面标准不佳。这就是为什么我们制作了 OmniE…
OmniExtractBench 是一个新的基准测试,包含来自多个供应商的 620 份文档,旨在为结构化提取提供公平评估,突出显示 Datalab 和 Reducto 的顶级性能。
超越表格:Doc2DB-Bench —— 用于关系保真的文档到数据库构建
介绍了 Doc2DB-Bench,这是一个基准测试,用于评估基于 LLM 从长文档中提取关系数据库的能力,包含 42 个模式和七个领域的 203 个实例。
@jerryjliu0: 我们观察到的一个有趣属性是,在模式引导的复杂文档提取任务中,编码代理…
文章总结了ParseBench论文的研究结果,指出像Claude Code和Codex这样的编码代理在模式引导的文档提取任务中提供了成本效益高的基线,尤其是在较长文档上,与专业OCR工具相比。