@cognitivelab_ai:推出NayanaOCR语料库——包含22种语言的100多万张文档图像,最大规模开源合成、多语言、多模态、多任务文档语料库

X AI KOLs Following 工具

摘要

推出NayanaOCR语料库,这是一个开源的合成文档语料库,包含22种语言的100多万张图像,专为多语言、多模态、多任务的OCR研究而设计。

推出NayanaOCR语料库 👉🏼 涵盖22种语言的100多万张文档图像 最大规模开源合成 > 多语言 > 多模态 > 多任务 文档语料库 https://t.co/01zvjzESLe
查看原文
查看缓存全文

缓存时间: 2026/05/25 16:41

Launching NayanaOCR Corpus 👉🏼 超 100 万张文档图像,涵盖 22 种语言

最大开源合成

多语言 多模态 多任务 文档语料库 https://t.co/01zvjzESLe

相似文章

使用合成数据构建快速多语言OCR模型

Hugging Face Blog

NVIDIA推出Nemotron OCR v2,一个使用合成数据生成技术构建的快速多语言OCR模型。该模型通过采用统一的基于FOTS的架构,在检测、识别和关系组件之间实现特征复用,在单个A100 GPU上达到34.7页/秒的性能。

MonkeyOCRv2: 用于文档AI的视觉-文本基础模型

Hugging Face Daily Papers

MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。