标签
本文研究了是否可以在推理之前使用低成本特征预测文档提取难度,从而使路由器能够在廉价模型与强大模型之间进行选择。路由在某些体裁中最多可降低77%的成本,同时保持质量,但前提是难度存在差异且可从文档特征中预测。
Xberg 是一个本地内容智能框架(Rust 核心,MIT 许可),通过 MCP 服务器或 CLI 从 101 种文档格式中提取文本,重建阅读顺序和表格,并为上下文窗口分块——所有操作均在设备端完成,服务于 AI 智能体。
ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。
介绍DECODEM,这是一个基准数据集,用于评估使用大型语言模型从法律文档中自动提取公司治理变量的方法,结果显示对许多条款具有高准确性。
Kreuzberg,一个本地文档提取工具,被重命名为 Xberg,其当前版本处于长期支持(LTS)阶段。
Google 发布了 LangExtract,一款开源免费且性能超越昂贵企业工具的文档提取工具。
一位开发者分享了在RTX 3060上使用本地Qwen VL模型将日语收据解析为JSON的经验,取代了Google Vision,结果显示关键字段提取准确,每张收据约需31秒。
Hyper-Extract 是一款命令行工具,可将凌乱的非结构化文档转化为结构化知识,如知识图谱、超图、时间/空间图及Obsidian vault,支持本地LLM推理与MCP集成。
ExtractConf是一种用于基于LLM的文档字段提取的置信度估计方法,它通过两种结构不同的调用(字段引导和文档引导)来推导不一致信号,在DocILE发票数据集上实现了0.928的ROC AUC,并为高风险自动化场景提供了可靠的选择性预测能力。
Agentic Document Extraction 是一款利用AI智能体从非结构化文档中提取结构化数据,使文档变得可计算化的工具。
LlamaIndex 在 LlamaParse 中引入了 Extract 功能,利用布局感知解析和 LLM,将非结构化的合同数据转换为结构化的、机器可读的元数据,以应对非标准模板和交叉引用等挑战。
docext是一个本地部署的工具包,无需OCR即可将图像和PDF转换为Markdown,利用视觉语言模型。它还引入了Nanonets-OCR-s,一个紧凑的3B参数模型,用于高效的图像到Markdown转换。
olmOCR 是一个开源工具包,使用微调的视觉语言模型从PDF中提取干净的文本,同时保留结构,并针对大规模批处理进行了优化。