@jerryjliu0:我们LlamaParse中的"agentic plus"提取器非常适合从长文档中提取大量字段(例如,10k-100k+字段…
摘要
Jerry Liu介绍了ExtractBench,并重点介绍了LlamaParse中的'agentic plus'提取器,用于处理长文档中的大量字段,基准测试结果可在ExtractBench上查看。
查看缓存全文
缓存时间: 2026/08/16 08:04
我们的 LlamaParse “agentic plus” 提取器非常擅长从长文档(100-500 页)中提取海量字段(例如 1 万至 10 万以上字段)。
我们使用一份包含 FTX 所有债权人庞大矩阵的文档(75k 字段,114 页)进行了测试。请参见下方截图。
完整的基准测试结果可在 ExtractBench 上查看(http://extractbench.ai)。与此同时,欢迎来我们的 playground 试用该模式!https://cloud.llamaindex.ai
Jerry Liu (@jerryjliu0): 推出 ExtractBench——目前最全面的企业复杂文档信息提取基准测试。
最新模型在编码和知识工作方面不断突破极限,但令人惊讶的是,在生产环境中的复杂文档提取任务上它们依然举步维艰。
相似文章
@jerryjliu0: 我们已在 LlamaParse 中构建了以下文档检索端点:* 混合搜索(grep + 向量搜索)* 文件 g…
LlamaParse 引入了新的文档检索端点,包括混合搜索、文件 grep、文件 find 和文件 read,旨在提高非结构化文档上的智能检索质量。
@jerryjliu0:我们在 LlamaParse 中构建了一项新功能,可让你自动将任何复杂表单提取为结构化 JSON 输出…
LlamaIndex 推出了新的 LlamaParse 功能,可自动将复杂表单字段提取为结构化 JSON,无需预定义模式,从而简化文档表单处理。
@jerryjliu0: 我们自豪地构建文档处理系统,不仅准确且成本低廉,还能大规模扩展到百万……
LlamaParse 现在为 Parse、Extract 和 Classify 任务提供延迟指标,包括排队时间、处理时间和总延迟的详细分解。这有助于用户监控和扩展其文档处理。
@jerryjliu0: 我们很高兴为LlamaParse推出官方的批量解析体验。不再是一次一个文件地访问我们的API,而是……
LlamaIndex宣布为LlamaParse推出官方批量解析体验,允许用户通过专用界面一次解析多达10,000个文件,并支持批量审计和故障检查,无需再编写自定义异步脚本。
@llama_index: 大多数文档提取API无法告知数据来源。对于ExtractBench,我们严格评估了溯源性:一个…
ExtractBench 是一个新的文档提取基准测试,严格评分溯源准确性,显示 VLMs 和编码代理缺乏证据,而 LlamaExtract Agentic Plus 以高性能领先于页面级和单词级指标。