标签
Datalab's Marker v2 是一款开源文档解析工具,能够处理PDF、图像、DOCX和PPTX,输出干净的Markdown,并支持超过90种语言,适用于批量整理、知识库构建和AI文档处理。
对16个前沿视觉语言模型在文档解析方面的综合评估显示,Opus 5.5在性价比上表现最佳,尤其在表格解析方面,而GPT-6 Luna在成本效益解析方面表现良好。对于大规模使用,推荐使用LlamaParse等专用工具,但Opus 5.5在应用内解析方面领先。
对超过100个模型在文档解析方面的评估,涵盖前沿VLMs、开源权重VLMs、OCR工具和开源解析器,结果通过parsebench分享。
WeVisDoc是一款基于Qwen3-VL模型微调的端到端文档解析器,可将页面图像转换为包含LaTeX公式和HTML表格的结构化Markdown,在OmniDocBench v1.6等基准测试中实现了顶级性能。
WeVisDoc 是一个两阶段的以数据为中心的框架,用于稳健的端到端文档解析,通过扩展覆盖范围并使用针对性诊断来提升性能,在基准测试中取得了最先进的结果。
这篇文章强调了处理复杂真实文档的困难,并推荐LlamaParse作为一款使用多个AI代理进行高效、可扩展和多模态文档解析的工具。
LlamaParse 引入高投入置信度评分,以增强AI文档解析的准确性,实现敏感流程的人工审核和自动回退。
LlamaIndex已训练新的AI模型,用于解析来自任何尺寸和形状表单的复选框,将它们转换为结构化JSON,以便在保险和税务处理等应用程序中进行编程使用。
LlamaIndex 在过去三个月里显著改进了 LlamaParse。在 ParseBench 基准测试中,其在复杂表格、图表和 grounding 方面的准确率提升了 10%–20%,同时每页成本仍控制在 0.4 美分以下。
Jina-OCR-v1 是一款高效的端到端文档解析模型,通过结合推测解码与密集可验证奖励技术,可在低预算 GPU 上实现高精度与高处理速度,在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4。
官方的LlamaParse连接器已在Claude上推出,为复杂表格、表单和视觉元素提供增强的文档解析,具有高精度和规模化的成本效益。
Cohere推出了Parse,这是一种经济高效的视觉语言模型,用于处理大量企业文档并将其转化为结构化数据,为RAG和文档索引等用例提供高性能和可扩展性。
LlamaParse引入了原生的代理式电子表格提取功能,使用经过调优的模型和框架进行模式引导的提取,能够将资产负债表等密集表格转换为清晰的结构化字段。
Datalab发布了Marker v2,这是一个开源的文档解析管道,可以高效地将PDF、图像、DOCX和PPTX文件转换为markdown,支持超过90种语言,并在GPU上表现出高性能。
LlamaParse 已添加版本跟踪功能,以提取 Word 风格的修订跟踪和审阅者评论作为结构化元数据,使 AI 代理能够访问文档的完整修订历史记录,从而增强法律和金融等行业中的协作。
LlamaParse 现在处理文档中的修订跟踪,提供最终状态的干净 markdown 以及编辑、删除和评论的结构化数据,解决解析器误解修订跟踪的问题。
TeleOCR 是一个轻量级的开源视觉-语言模型,专为文档解析设计,统一处理数字文档和相机拍摄文档,并在基准测试中达到了最先进的性能。
NaviDC-OCR是一个统一的视觉-语言框架,通过变形感知学习和自适应采样提高文档解析准确性,在多个基准测试中达到了最先进的结果。
LlamaIndex 推出了新的 LlamaParse 功能,可自动将复杂表单字段提取为结构化 JSON,无需预定义模式,从而简化文档表单处理。
PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。