标签
RAG-Anything 是一个基于 LightRAG 构建的多模态文档处理 RAG 系统,它解析文档、构建多模态知识图谱,并使用混合向量-图检索来回答问题。
Xberg v1 作为 Kreuzberg 的继任者发布,是一个高性能内容智能框架,支持 101 种文档格式、367 种代码/数据类型、音视频转录和 URL 抓取,拥有纯 Rust 的 PDF 和 OCR 后端、多种语言绑定以及移动端/WASM 支持。
本文介绍了IDP AutoOpt,一个自主的LLM智能体,用于优化智能文档处理流水线配置,以更低的成本达到或超过人类专家的准确率,并将配置时间从数周缩短至两小时以内。
LlamaIndex宣布为LlamaParse推出官方批量解析体验,允许用户通过专用界面一次解析多达10,000个文件,并支持批量审计和故障检查,无需再编写自定义异步脚本。
一个完全离线的AI使用OCR和向量数据库读取了超过4000页解密的UFO文件,在本地提供带引用的答案,无需云端或API密钥。
介绍DocAnnot框架,该框架使用大型视觉语言模型、OCR以及一种空间感知的上下文匹配算法,自动生成用于文档关键信息提取的训练数据集,减少人工标注工作量。在CORD和SROIE基准测试中评估,取得了合理的F1分数,并实现了高效的人工验证。
一个团队使用AI自动化了手动文件分类流程,通过将扫描页面分组为文档并生成PDF,将每月工作量从50-70小时减少到3-5小时。
百度开源的Unlimited OCR模型提出Reference Sliding Window Attention(R-SWA)机制,以30亿参数实现数十页文档连续解析,在GitHub和HuggingFace上获得极高关注。
PyMuPDF 1.28 新增了对 Markdown 的一流支持,允许通过 CSS 控制样式,从 Markdown 文本生成 PDF。
Parsewise 是一个YC支持的API,可将非结构化文档转换为符合模式且具有可追溯来源的数据,实现跨文档的AI推理。
TurboOCR v3 是一款自托管的高速OCR服务器,在RTX 5090上使用PP-OCRv6模型实现约每秒520张图片的处理速度,并新增了表格和公式的结构化解析功能。
Mistral Devs发布了一篇教程,介绍如何使用Mistral OCR、Agents和Workflows构建医疗文档处理工作流,其中包括一个用于低置信度分类的人工审核步骤。
olmOCR 是来自Ai2的开源OCR工具,能够将PDF、扫描件和图像转换为干净的Markdown格式,旨在通过保留阅读顺序和处理复杂布局,为LLM流水线准备文档。
LlamaIndex 已发布面向 n8n 的 LlamaParse 平台社区节点 v5 和 v6 版本,现已获得官方验证,提供文档解析、分类、拆分、提取和检索功能,可用作 AI 代理的工具。
Hyper-Extract 是一款 Apache 2.0 开源工具,能将非结构化文档转换为结构化知识库,支持知识图谱、时间序列数据、空间信息,实现高精度AI查询。
这篇推文汇总了6个开源工具,涵盖PDF转markdown、文档理解、OCR、论文翻译和自动文献综述,旨在打通文档工作流。
MinerU 是一款免费开源工具,可从 PDF 和扫描文档中提取文本、表格和公式,支持109种语言和批量处理,节省数小时的手动工作。
面向大学使用场景的本地文档处理工具(Docling、Liteparse、Mineru 和 Unstructured)对比,评估它们对本地部署的适用性。
百度发布了Unlimited-OCR,它可以一次性处理整个文档而无需分块,克服了当前OCR技术的一个主要限制。