@cognitivelab_ai:推出NayanaOCR语料库——包含22种语言的100多万张文档图像,最大规模开源合成、多语言、多模态、多任务文档语料库
摘要
推出NayanaOCR语料库,这是一个开源的合成文档语料库,包含22种语言的100多万张图像,专为多语言、多模态、多任务的OCR研究而设计。
推出NayanaOCR语料库
👉🏼 涵盖22种语言的100多万张文档图像
最大规模开源合成
> 多语言
> 多模态
> 多任务
文档语料库 https://t.co/01zvjzESLe
查看缓存全文
缓存时间: 2026/05/25 16:41
Launching NayanaOCR Corpus 👉🏼 超 100 万张文档图像,涵盖 22 种语言
最大开源合成
多语言 多模态 多任务 文档语料库 https://t.co/01zvjzESLe
相似文章
使用合成数据构建快速多语言OCR模型
NVIDIA推出Nemotron OCR v2,一个使用合成数据生成技术构建的快速多语言OCR模型。该模型通过采用统一的基于FOTS的架构,在检测、识别和关系组件之间实现特征复用,在单个A100 GPU上达到34.7页/秒的性能。
MonkeyOCRv2: 用于文档AI的视觉-文本基础模型
MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。
@HuggingModels: OCR刚刚经历了一次重大升级。jina-ocr-v1是一款专为文档智能设计的多模态视觉语言模型。它 rea…
Jina-ocr-v1是一款专为高级文档智能设计的多模态视觉语言模型,能够从多语言图像中读取文本。
加速研究人员和开发者使用新开放数据集构建多语言AI(7分钟阅读)
GitHub宣布推出GitHub多语言仓库数据集,这是一个开放的元数据集,涵盖4000万个仓库中的超过8000万条分类记录,旨在帮助研究人员和开发者构建多语言AI工具。
@BaiduAI_News: 我们正在开源Unlimited OCR——专为一次性读取长文档而构建。总参数3B,仅500M激活…
百度开源Unlimited OCR,一个3B参数模型(500M激活参数),使用Reference Sliding Window Attention(R-SWA)一次性读取长文档,在OmniDocBench上取得最先进的SOTA结果。