NaviDC-OCR:数字与相机捕获文档的解析导航

Hugging Face Daily Papers 论文

摘要

NaviDC-OCR是一个统一的视觉-语言框架,通过变形感知学习和自适应采样提高文档解析准确性,在多个基准测试中达到了最先进的结果。

文档解析旨在将非结构化文档转换为结构化且机器可读的表示。视觉-语言模型(VLMs)的最新进展显著推动了文档解析的发展。然而,现有方法仍面临两大挑战。首先,基于解耦的VLM方法严重依赖于精确的布局分析,其中相机捕获文档中的几何失真可能引入级联错误。其次,尽管基于端到端的VLM方法缓解了对显式布局检测的依赖,但在高分辨率场景中常遭遇冗余生成、幻觉和结构推理不足的问题。为解决这些挑战,我们提出了NaviDC-OCR,一个统一的文档解析框架。NaviDC-OCR引入变形感知学习,将几何感知融入VLMs,并提出自适应采样机制以处理复杂布局表示。此外,开发了一种内容-结构解耦学习策略,以显式建模公式语法和表格结构,从而实现更有效的结构化表示学习。大量实验表明,NaviDC-OCR在多个文档解析基准测试中达到了最先进的性能。在OmniDocBench v1.6、Wild-OmniDocBench和PureDocBench上分别获得了96.87、88.53和78.41的总分,并在ICDAR 2026 Sci-ImageMiner挑战赛中排名第一。这些结果验证了NaviDC-OCR在复杂文档解析场景中的有效性和泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:54

论文页面 - NaviDC-OCR:跨数字与相机捕获文档的文档解析导航

来源:https://huggingface.co/papers/2608.12898

摘要

NaviDC-OCR 是一个统一的视觉-语言框架,它整合了变形感知学习、自适应布局采样与内容-结构解耦训练,旨在提升文档解析的准确性及结构推理能力。

文档解析 (https://huggingface.co/papers?q=Document%20parsing) 旨在将非结构化文档转换为结构化、机器可读的表示。视觉-语言模型 (https://huggingface.co/papers?q=Vision-Language%20Models) (VLMs) 的最新进展显著推动了文档解析 (https://huggingface.co/papers?q=document%20parsing) 的发展。然而,现有方法仍面临两大主要挑战。首先,基于 VLM 的解耦方法严重依赖于精确的布局分析,而相机捕获文档中的几何畸变可能引发连锁错误。其次,尽管基于 VLM 的端到端方法减轻了对显式布局检测的依赖,但在高分辨率场景中,它们常会出现冗余生成、幻觉以及结构推理不足的问题。为应对这些挑战,我们提出了 NaviDC-OCR,一个用于文档解析 (https://huggingface.co/papers?q=document%20parsing) 的统一框架。NaviDC-OCR 引入了变形感知学习 (https://huggingface.co/papers?q=deformation-aware%20learning),将几何感知整合到 VLM 中,并提出了一种针对复杂布局表示的自适应采样机制 (https://huggingface.co/papers?q=adaptive%20sampling%20mechanism)。此外,开发了一种内容-结构解耦学习 (https://huggingface.co/papers?q=content-structure%20decoupled%20learning) 策略,以显式建模公式文法 (https://huggingface.co/papers?q=formula%20grammars) 和表格结构 (https://huggingface.co/papers?q=table%20structures),从而实现更有效的结构化表示学习。大量实验表明,NaviDC-OCR 在各类文档解析 (https://huggingface.co/papers?q=document%20parsing) 基准测试中均达到了最先进水平。其在 OmniDocBench v1.6、Wild-OmniDocBench 和 PureDocBench 上的总体得分分别为 96.87、88.53 和 78.41,并在 ICDAR 2026 Sci-ImageMiner 竞赛中位列第一。这些结果验证了 NaviDC-OCR 在复杂文档解析 (https://huggingface.co/papers?q=document%20parsing) 场景下的有效性与泛化能力。

查看 arXiv 页面 (https://arxiv.org/abs/2608.12898)查看 PDF (https://arxiv.org/pdf/2608.12898)GitHub17 (https://github.com/caipeng328/NaviDC-OCR)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.12898)

通过您的代理获取此论文:

hf papers read 2608\.12898

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

StarDoc-AI/NaviDC-OCR 图像-文本到文本• 1B• 更新于14分钟前 • 3 (https://huggingface.co/StarDoc-AI/NaviDC-OCR)

引用此论文的数据集0

无数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.12898 以从本页面链接。

引用此论文的空间0

无空间链接到此论文

在空间 README.md 中引用 arxiv.org/abs/2608.12898 以从本页面链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

MonkeyOCRv2: 用于文档AI的视觉-文本基础模型

Hugging Face Daily Papers

MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。

baidu/Unlimited-OCR

Hugging Face Models Trending

百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。

dots.ocr:单个视觉语言模型中的多语言文档布局解析

Papers with Code Trending

本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。