dots.ocr:单个视觉语言模型中的多语言文档布局解析
摘要
本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。
查看缓存全文
缓存时间: 2026/05/18 12:34
论文页面 - dots.ocr:多语言文档布局解析的统一视觉语言模型
来源: https://huggingface.co/papers/2512.02498
摘要
一个统一的视觉语言模型 dots.ocr,通过联合学习版面检测、文本识别和关系理解,在文档布局解析任务上取得了最先进的性能,并在 OmniDocBench 和 XDocParse 基准上得到了验证。
文档布局解析是人工智能(AI)访问和解读全球海量结构化知识的关键入口。该流程涵盖版面检测 (https://huggingface.co/papers?q=layout%20detection)、文本识别 (https://huggingface.co/papers?q=text%20recognition) 以及关系理解,对于赋能下一代视觉语言模型 (https://huggingface.co/papers?q=Vision-Language%20Model) 尤为关键。然而,当前的方法依赖碎片化的多阶段流水线,易受错误传播影响,且无法充分利用联合训练 (https://huggingface.co/papers?q=joint%20training) 的协同效应。本文介绍了 dots.ocr——一个单一的视觉语言模型,首次证明了在统一的端到端框架中联合学习三个核心任务的优势。这得益于一个高度可扩展的数据引擎,它合成了庞大的多语言语料库,使模型能够在涵盖多种语言、布局和领域的广泛任务中展现出稳健的性能。我们统一范式的有效性已在综合性基准 OmniDocBench (https://huggingface.co/papers?q=OmniDocBench) 上通过最先进的性能得到验证。此外,为了推动全球文档智能的研究,我们推出了 XDocParse (https://huggingface.co/papers?q=XDocParse)——一个涵盖 126 种语言、具有挑战性的新基准。在该测试平台上,dots.ocr 建立了一个强大的新基线,以 +7.4 个百分点的显著优势超越次优竞争者,证明了其无与伦比的多语言能力。
查看 arXiv 页面 (https://arxiv.org/abs/2512.02498)查看 PDF (https://arxiv.org/pdf/2512.02498) GitHub8.7kauto (https://github.com/rednote-hilab/dots.ocr) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2512.02498)
在你的 Agent 中获取此论文:
hf papers read 2512.02498
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
未找到链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2512.02498 即可从本页链接。
引用此论文的数据集0
未找到链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2512.02498 即可从本页链接。
引用此论文的 Space0
未找到链接此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2512.02498 即可从本页链接。
包含此论文的合集1
相似文章
@techNmak:1.7B 参数轻量 VLM,在 OmniDocBench 上碾压巨头的 OCR 新王者
仅 1.7B 参数的多语言文档解析器 dots.ocr,用轻量体积实现 SOTA,证明文档理解无需巨无霸模型。
@oliviscusAI: 您现在可以用一个 17 亿参数的模型解析任何文档,它就是 dots-ocr。一个处理文本、表格等的系统。
本文介绍了 dots-ocr,这是一个拥有 17 亿参数的模型,能够在超过 100 种语言中解析文档中的文本、表格、公式和图像,而无需单独的 OCR 处理流程。
OvisOCR2:一款有前景的0.8B本地文档解析器
OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。
SmolDocling:一种超紧凑的端到端多模态文档转换视觉语言模型
SmolDocling 是一款紧凑型 2.56 亿参数视觉语言模型,专为端到端多模态文档转换设计。它引入了一种名为 DocTags 的新型通用标记格式,用于捕获带有位置信息的页面元素,其表现可与体积大 27 倍的模型相媲美。
ATH-MaaS/OvisOCR2
OvisOCR2 是一个紧凑的0.8B端到端模型,用于页面级文档解析,在OmniDocBench和PureDocBench基准测试中达到了最先进的性能。