标签
Opus 5.5 在 ParseBench 上针对 PDF 表格解析的得分为 93.9%,超越了 Opus 5 和其他模型,但与 LlamaParse 相比成本较高。
DocJev 是一个免费、开源的 Python 工具,用于分类和拆分复杂文档包,支持 PDF、DOCX 和 PPTX,并可选择 OCR。
DocJev 是一个使用 Jev 的超快开源库,用于文档分类和分割,支持 OCR 后端如 liteparse 和 LlamaParse,声称比 GPT-5.6-luna 快 6 倍且准确率相当。
对超过100个模型在文档解析方面的评估,涵盖前沿VLMs、开源权重VLMs、OCR工具和开源解析器,结果通过parsebench分享。
百度的开源Unlimited-OCR模型同时处理多个PDF页面,优于DeepSeek-OCR等基线模型,并支持本地执行与社区集成。
Jina-ocr-v1是一款专为高级文档智能设计的多模态视觉语言模型,能够从多语言图像中读取文本。
Thoughts for Mac 是一款菜单栏应用程序,支持使用文本、图像和语音快速记笔记,并具有AI驱动的音频转录和文本转换功能。
作者正在为处理多种语言、手写文本及复杂扫描格式的多文档ERP系统挑选OCR模型,希望得到有实际文档OCR项目经验人士的建议。
本文介绍了如何利用人工智能工具进行光学字符识别及合同起草,从而重新出版书籍,同时重点阐述了在格式处理及特殊文本元素处理方面所面临的挑战。
LlamaIndex 在过去三个月里显著改进了 LlamaParse。在 ParseBench 基准测试中,其在复杂表格、图表和 grounding 方面的准确率提升了 10%–20%,同时每页成本仍控制在 0.4 美分以下。
Jina-OCR-v1 是一款高效的端到端文档解析模型,通过结合推测解码与密集可验证奖励技术,可在低预算 GPU 上实现高精度与高处理速度,在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4。
本文评估了开放多模态大语言模型在高棉文档视觉问答上的性能,发现虽然模型在处理英语和数字内容方面表现良好,但理解原生高棉脚本仍然具有挑战性。该研究使用了KH-FUNSD集合中的诊断子集,并比较了不同的模型配置。
HSK Manga是一款免费工具,通过AI和OCR技术将漫画对话简化为适合中文学习者的HSK水平,使阅读对初学者更容易。
Cohere推出了Parse,这是一种经济高效的视觉语言模型,用于处理大量企业文档并将其转化为结构化数据,为RAG和文档索引等用例提供高性能和可扩展性。
AnyDoc现在包含OCR功能,可用于读取扫描文档,提供快速处理时间和通过Firecrawl的免费托管选项。
OpenCode Senses 是一款专为 OpenCode 设计的本地视觉插件,提供先进的图像理解功能,如 OCR、物体检测和颜色分析,完全在本地硬件上私密运行,无需 API 密钥。
一个 Claude Code 插件,通过在 macOS 上从 Amazon 的笔记本和 Kindle 应用数据中逐字提取,来恢复 Kindle 导出受限的高亮。
OCR It 是一款 Chrome 扩展,使用本地 OCR 从无法复制的文档中提取文本,旨在帮助用户为 Claude 或 ChatGPT 等 LLM 准备内容。