dots.ocr:单个视觉语言模型中的多语言文档布局解析

Papers with Code Trending 论文

摘要

本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。

文档布局解析是人工智能(AI)访问和解读世界海量结构化知识的关键入口。该过程涵盖布局检测、文本识别和关系理解,对于赋能下一代视觉语言模型尤为重要。然而,当前方法依赖碎片化的多阶段流水线,存在错误传播且未能利用联合训练的协同效应。本文介绍了 dots.ocr,这是一个单一的视觉语言模型,首次展示了在统一的端到端框架中联合学习三项核心任务的优势。这得益于一个高度可扩展的数据引擎,它合成大规模多语言语料库,使模型能够在涵盖多种语言、布局和领域的广泛任务中提供稳健性能。我们统一范式的有效性通过在全面 OmniDocBench 上的最先进性能得到验证。此外,为了推动全球文档智能研究,我们引入了 XDocParse,这是一个涵盖 126 种语言的挑战性新基准。在该测试平台上,dots.ocr 建立了强大的新基线,以惊人的 +7.4 分优势超越次优竞争者,证明其无与伦比的多语言能力。
查看原文
查看缓存全文

缓存时间: 2026/05/18 12:34

论文页面 - dots.ocr:多语言文档布局解析的统一视觉语言模型

来源: https://huggingface.co/papers/2512.02498

摘要

一个统一的视觉语言模型 dots.ocr,通过联合学习版面检测、文本识别和关系理解,在文档布局解析任务上取得了最先进的性能,并在 OmniDocBench 和 XDocParse 基准上得到了验证。

文档布局解析是人工智能(AI)访问和解读全球海量结构化知识的关键入口。该流程涵盖版面检测 (https://huggingface.co/papers?q=layout%20detection)、文本识别 (https://huggingface.co/papers?q=text%20recognition) 以及关系理解,对于赋能下一代视觉语言模型 (https://huggingface.co/papers?q=Vision-Language%20Model) 尤为关键。然而,当前的方法依赖碎片化的多阶段流水线,易受错误传播影响,且无法充分利用联合训练 (https://huggingface.co/papers?q=joint%20training) 的协同效应。本文介绍了 dots.ocr——一个单一的视觉语言模型,首次证明了在统一的端到端框架中联合学习三个核心任务的优势。这得益于一个高度可扩展的数据引擎,它合成了庞大的多语言语料库,使模型能够在涵盖多种语言、布局和领域的广泛任务中展现出稳健的性能。我们统一范式的有效性已在综合性基准 OmniDocBench (https://huggingface.co/papers?q=OmniDocBench) 上通过最先进的性能得到验证。此外,为了推动全球文档智能的研究,我们推出了 XDocParse (https://huggingface.co/papers?q=XDocParse)——一个涵盖 126 种语言、具有挑战性的新基准。在该测试平台上,dots.ocr 建立了一个强大的新基线,以 +7.4 个百分点的显著优势超越次优竞争者,证明了其无与伦比的多语言能力。

查看 arXiv 页面 (https://arxiv.org/abs/2512.02498)查看 PDF (https://arxiv.org/pdf/2512.02498) GitHub8.7kauto (https://github.com/rednote-hilab/dots.ocr) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2512.02498)

在你的 Agent 中获取此论文:

hf papers read 2512.02498

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

未找到链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2512.02498 即可从本页链接。

引用此论文的数据集0

未找到链接此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2512.02498 即可从本页链接。

引用此论文的 Space0

未找到链接此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2512.02498 即可从本页链接。

包含此论文的合集1

相似文章

OvisOCR2:一款有前景的0.8B本地文档解析器

Reddit r/LocalLLaMA

OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。

ATH-MaaS/OvisOCR2

Hugging Face Models Trending

OvisOCR2 是一个紧凑的0.8B端到端模型,用于页面级文档解析,在OmniDocBench和PureDocBench基准测试中达到了最先进的性能。