@josesilesdata: 这款免费的OCR可以读懂医生的手写、复杂表格和数学方程。它叫做 **Chandra**,来自……
摘要
Chandra 是 Datalab 开发的一款免费OCR工具,能够读取医生的手写、复杂表格、数学方程和表单,并以 Markdown、HTML 或 JSON 格式输出结果。它支持超过40种语言,可以通过 pip 安装。
查看缓存全文
缓存时间: 2026/07/20 09:30
这款免费的OCR可以识别医生的笔迹、复杂表格和数学公式。
它叫做 Chandra,来自 Datalab。
这是我见过功能最全面的OCR之一。
它可以处理:
手写文字 医疗笔记、填写好的表格、连笔或难以辨认的手写内容。
复杂表格 保留合并单元格、行和列。非常适合发票、财务报表以及数据量大的PDF。
数学公式 直接将方程转换为LaTeX。
表单 识别复选框、按钮和输入的值。
排版复杂的文档 多栏文本、报纸、书籍以及带有图片的文档。
它可以将结果输出为Markdown、HTML或JSON格式。
支持超过40种语言。
安装方法:
pip install chandra-ocr
个人使用免费。
我会在评论区留下该仓库的链接。
相似文章
@atomic_chat_hq: Mistral OCR 4 将手写的微积分考试卷转化为干净的LaTeX!我们给它一张手写考试页面的照片。这…
Mistral OCR 4 将手写的微积分考试卷转换为干净的LaTeX,准确读取公式并处理图表,但不会重新绘制它们。该模型提供带有边界框和置信度分数的结构化输出,支持170种语言。
@datalabto: 发布Chandra 2.1 — 更小、更快,并且在OCR模型最难处理的两方面显著改进…
发布Chandra 2.1,一个改进的OCR模型,更小、更快,并且在处理复杂表格和多语言内容方面显著改进,现已上线Datalab API。
allenai/olmocr
olmOCR 是 AI2 开发的一个开源工具包,可将 PDF、PNG 和 JPEG 文件转换为干净的 Markdown 文本,支持公式、表格和复杂布局。它包含一个基准测试套件和多个模型版本(截至 2025 年 10 月为 v0.4.0),性能和效率均有提升。
@oliviscusAI: 您现在可以用一个 17 亿参数的模型解析任何文档,它就是 dots-ocr。一个处理文本、表格等的系统。
本文介绍了 dots-ocr,这是一个拥有 17 亿参数的模型,能够在超过 100 种语言中解析文档中的文本、表格、公式和图像,而无需单独的 OCR 处理流程。
@noctus91: Mistral OCR 4 读取一封 Henri Poincaré 1905 年的手写信件。历史手稿通常会导致OCR模型失效。T…
Mistral AI 发布了 Mistral OCR 4,该模型能够读取历史手写手稿,并提供边界框、块分类以及内联置信度分数,支持170种语言。