@0x0SojalSec: 疯狂,99%准确率的OCR推理模型,堪比专业人类,这款8B推理OCR模型能瞬间从图像中提取文字…
摘要
一款8B推理OCR模型实现了近乎完美的99%准确率,瞬间从图像中提取文字,并将复杂布局转换为整洁的Markdown,在文档任务上优于GPT-4o等更大模型。
疯狂,99%准确率的OCR推理模型,堪比专业人类,
这款8B推理OCR模型能以99%的准确率瞬间从图像中提取文字。
- 近乎完美的OCR,复杂表格,奇怪布局
- 瞬间提取,
- 几秒内将图像转换为完美无瑕的Markdown。
- 处理复杂文档比更大模型更好。
- 像人类一样推理棘手布局(但更快)。
- 将混乱转化为干净可用的Markdown。
- 在文档混乱处理上击败GPT-4o。
查看缓存全文
缓存时间: 2026/07/20 09:28
惊为天人!99%准确率的OCR推理模型,媲美人类专业水平
这款8B参数规模的推理式OCR模型,能从图像中瞬间提取文本,准确率高达99%。
- 近乎完美的OCR表现,复杂表格、怪异布局轻松应对
- 即时提取,秒级完成
- 从图片到整洁无瑕的完美Markdown,只需几秒钟
- 处理复杂文档的能力超越更大规模的模型
- 像人类一样(但更快)推理出复杂布局的逻辑
- 将杂乱无章的数据转化为清晰可用的Markdown
- 在文档混乱度处理上胜过GPT-4o
相似文章
@0x0SojalSec: 想象一下,把一整本书喂给AI,它就能完美理解。一款全新的OCR模型,能一次读取一整本书……
这条推文介绍了DeepSeek Unlimited OCR,这是一款AI模型,能一次读取整本书,内存占用保持平稳,在40+页面上达到93%基准分数和低于0.11的错误率。
OvisOCR2:一款有前景的0.8B本地文档解析器
OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。
OvisOCR2 技术报告
OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。
MonkeyOCRv2: 用于文档AI的视觉-文本基础模型
MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。
@geekbb: 百度开源的视觉语言模型 OCR 项目,在 DeepSeek-OCR 基础上做了升级,主打一次性解析超长文档。模型有两种推理模式:gundam 模式用来对付单张图里的密集文字,base 模式处理多页或 PDF。 https://github…
百度开源了视觉语言模型Unlimited-OCR,基于DeepSeek-OCR升级,支持一次性解析超长文档,提供gundam(单图密集文字)和base(多页/PDF)两种推理模式。