标签
作者正在开发一个信用承保AI代理,并寻求开源本地部署方法,从多样化的印度银行对账单PDF中提取结构化交易表格,面临布局变化的挑战,需要可靠的提取方法。
Mistral AI 发布 OCR 4.1,这是一项更新的 OCR 服务,支持原生段落级边界框提取、结构块标签以及块级置信度评分,现已公开预览。
Unlimited-OCR,一家中国公司新发布的开源OCR模型,解决了AI OCR工具中常见的内存增长问题——无论文档多长,内存使用都保持平稳,从而能够在32K上下文长度下一次性读取数十页。它采用MIT许可,拥有30亿参数,支持多语言,并且在GitHub上已经广受欢迎。
MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。
Datalab 发布了 lift,一个通过模式约束解码从 PDF 和图像中提取结构化 JSON 的模型,支持本地推理和托管推理选项。
本文提出了一种面向生产级文档AI管道的微服务架构,该架构结合了分类、OCR和LLM提取,分享了设计决策和批量分析洞察,揭示了OCR(而非LLM解析)主导了延迟。
PaddleOCR是一个功能强大、轻量级的OCR工具包,可将PDF和图像转换为结构化数据,适用于AI应用,支持100多种语言,旨在连接文档与大语言模型。