@llama_index: 大多数文档提取API无法告知数据来源。对于ExtractBench,我们严格评估了溯源性:一个…

X AI KOLs Timeline 工具

摘要

ExtractBench 是一个新的文档提取基准测试,严格评分溯源准确性,显示 VLMs 和编码代理缺乏证据,而 LlamaExtract Agentic Plus 以高性能领先于页面级和单词级指标。

大多数文档提取API无法告知数据来源。 对于ExtractBench,我们严格评估了溯源性:一个字段只有当值和其引用都正确时才计数,单词级框的IoU阈值为0.5。围绕错误值的完美框不得分。 结果:VLMs和编码代理根本没有返回证据——两个级别都是零。在确实返回框的系统中,最佳的单词级F1得分仍低于50%。溯源性随长度下降:一个专业API在短文档上页面级得分为61.7%,在长文档上降至0.0%。 LlamaExtract Agentic Plus在两个级别上领先——页面级84.9%,单词级46.4%——并在长文档上保持87.1%,而其他系统降至零。 每个提取的值都应带有证据。ExtractBench现在为该领域提供了一个基准来跟踪它 博客:https://lnkd.in/gNm97fXp 论文:https://lnkd.in/euAfScWx
查看原文
查看缓存全文

缓存时间: 2026/08/17 16:14

大多数文档提取API无法告知数据的来源依据。

在ExtractBench评测中,我们严格评估了数据溯源能力:只有当字段值及其引用位置都正确时才计分(单词级框体IoU≥0.5)。即使完美框选了错误数值,也不能得分。

评测结果显示:视觉语言模型和代码智能体完全未返回任何溯源证据——两个层级的得分均为零。在能返回框体定位的系统中,最佳的单词级F1分数仍不足50%。且溯源能力随文档长度急剧衰减:某个专业API在短文档上还能达到61.7%的页面级准确率,长文档时则骤降至0.0%。

LlamaExtract智能增强版在两个层级均表现领先——页面级84.9%,单词级46.4%——并在其他系统完全失效的长文档场景中,仍保持87.1%的高准确率。

每个提取出的数据都应附有溯源依据。ExtractBench现已为这个领域建立了评估基准。

博客:https://lnkd.in/gNm97fXp 论文:https://lnkd.in/euAfScWx


LinkedIn

来源:https://lnkd.in/gNm97fXp

该链接将跳转至非LinkedIn页面

由于这是外部链接,我们无法验证其安全性。

https://www.llamaindex.ai/blog/introducing-extractbench
本页面针对Chrome、Edge和Safari浏览器进行了优化

相似文章

ExtractBench:面向模式引导的企业文档抽取基准

Hugging Face Daily Papers

ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。