@llama_index: 大多数文档提取API无法告知数据来源。对于ExtractBench,我们严格评估了溯源性:一个…
摘要
ExtractBench 是一个新的文档提取基准测试,严格评分溯源准确性,显示 VLMs 和编码代理缺乏证据,而 LlamaExtract Agentic Plus 以高性能领先于页面级和单词级指标。
查看缓存全文
缓存时间: 2026/08/17 16:14
大多数文档提取API无法告知数据的来源依据。
在ExtractBench评测中,我们严格评估了数据溯源能力:只有当字段值及其引用位置都正确时才计分(单词级框体IoU≥0.5)。即使完美框选了错误数值,也不能得分。
评测结果显示:视觉语言模型和代码智能体完全未返回任何溯源证据——两个层级的得分均为零。在能返回框体定位的系统中,最佳的单词级F1分数仍不足50%。且溯源能力随文档长度急剧衰减:某个专业API在短文档上还能达到61.7%的页面级准确率,长文档时则骤降至0.0%。
LlamaExtract智能增强版在两个层级均表现领先——页面级84.9%,单词级46.4%——并在其他系统完全失效的长文档场景中,仍保持87.1%的高准确率。
每个提取出的数据都应附有溯源依据。ExtractBench现已为这个领域建立了评估基准。
博客:https://lnkd.in/gNm97fXp 论文:https://lnkd.in/euAfScWx
来源:https://lnkd.in/gNm97fXp
该链接将跳转至非LinkedIn页面
由于这是外部链接,我们无法验证其安全性。
https://www.llamaindex.ai/blog/introducing-extractbench
本页面针对Chrome、Edge和Safari浏览器进行了优化
相似文章
ExtractBench:面向模式引导的企业文档抽取基准
ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。
@jerryjliu0:我们LlamaParse中的"agentic plus"提取器非常适合从长文档中提取大量字段(例如,10k-100k+字段…
Jerry Liu介绍了ExtractBench,并重点介绍了LlamaParse中的'agentic plus'提取器,用于处理长文档中的大量字段,基准测试结果可在ExtractBench上查看。
@llama_index: 如何知道你的文档解析器已经可以投入生产?现有的基准测试忽略了AI代理实际需要的…
LlamaIndex 宣布推出 ParseBench,这是一个用于评估 AI 代理文档解析的新基准,并邀请 AI 工程师参加 5 月 27 日的线上研讨会,讨论其方法论以及如何弥补像 OlmOCR 这样的现有基准中的空白。
@jerryjliu0:目前有很多针对AI智能体的编码和推理基准测试,但在文档理解方面却很少——而这正是所有下游知识工作的前提。
LlamaIndex发布了ParseBench,这是一个用于评估AI智能体文档理解能力的全面基准测试,涵盖包含表格、图表和布局的复杂企业文档。将举办一场在线研讨会,讨论该基准测试的方法和结果。
@llama_index: “OCR 现在只是一个功能。前沿模型将吞噬它。”我们不断听到这种说法。数据却表明并非如此。在三个……
LlamaIndex 认为,文档 OCR 并未被前沿模型商品化,基准数据显示专业解析器仍然更准确且成本更低。