NaviDC-OCR:数字与相机捕获文档的解析导航
摘要
NaviDC-OCR是一个统一的视觉-语言框架,通过变形感知学习和自适应采样提高文档解析准确性,在多个基准测试中达到了最先进的结果。
查看缓存全文
缓存时间: 2026/08/18 03:54
论文页面 - NaviDC-OCR:跨数字与相机捕获文档的文档解析导航
来源:https://huggingface.co/papers/2608.12898
摘要
NaviDC-OCR 是一个统一的视觉-语言框架,它整合了变形感知学习、自适应布局采样与内容-结构解耦训练,旨在提升文档解析的准确性及结构推理能力。
文档解析 (https://huggingface.co/papers?q=Document%20parsing) 旨在将非结构化文档转换为结构化、机器可读的表示。视觉-语言模型 (https://huggingface.co/papers?q=Vision-Language%20Models) (VLMs) 的最新进展显著推动了文档解析 (https://huggingface.co/papers?q=document%20parsing) 的发展。然而,现有方法仍面临两大主要挑战。首先,基于 VLM 的解耦方法严重依赖于精确的布局分析,而相机捕获文档中的几何畸变可能引发连锁错误。其次,尽管基于 VLM 的端到端方法减轻了对显式布局检测的依赖,但在高分辨率场景中,它们常会出现冗余生成、幻觉以及结构推理不足的问题。为应对这些挑战,我们提出了 NaviDC-OCR,一个用于文档解析 (https://huggingface.co/papers?q=document%20parsing) 的统一框架。NaviDC-OCR 引入了变形感知学习 (https://huggingface.co/papers?q=deformation-aware%20learning),将几何感知整合到 VLM 中,并提出了一种针对复杂布局表示的自适应采样机制 (https://huggingface.co/papers?q=adaptive%20sampling%20mechanism)。此外,开发了一种内容-结构解耦学习 (https://huggingface.co/papers?q=content-structure%20decoupled%20learning) 策略,以显式建模公式文法 (https://huggingface.co/papers?q=formula%20grammars) 和表格结构 (https://huggingface.co/papers?q=table%20structures),从而实现更有效的结构化表示学习。大量实验表明,NaviDC-OCR 在各类文档解析 (https://huggingface.co/papers?q=document%20parsing) 基准测试中均达到了最先进水平。其在 OmniDocBench v1.6、Wild-OmniDocBench 和 PureDocBench 上的总体得分分别为 96.87、88.53 和 78.41,并在 ICDAR 2026 Sci-ImageMiner 竞赛中位列第一。这些结果验证了 NaviDC-OCR 在复杂文档解析 (https://huggingface.co/papers?q=document%20parsing) 场景下的有效性与泛化能力。
查看 arXiv 页面 (https://arxiv.org/abs/2608.12898)查看 PDF (https://arxiv.org/pdf/2608.12898)GitHub17 (https://github.com/caipeng328/NaviDC-OCR)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.12898)
通过您的代理获取此论文:
hf papers read 2608\.12898
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
StarDoc-AI/NaviDC-OCR 图像-文本到文本• 1B• 更新于14分钟前 • 3 (https://huggingface.co/StarDoc-AI/NaviDC-OCR)
引用此论文的数据集0
无数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.12898 以从本页面链接。
引用此论文的空间0
无空间链接到此论文
在空间 README.md 中引用 arxiv.org/abs/2608.12898 以从本页面链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
PaddleOCR-VL:通过 0.9B 超紧凑视觉语言模型提升多语言文档解析能力
PaddleOCR-VL 是一个紧凑的 0.9B 视觉语言模型,通过集成 NaViT 风格的动态分辨率与 ERNIE 语言模型,在多语言文档解析和元素识别方面实现了最先进的性能。
PaddleOCR-VL-1.6:通过欠优化区域精炼与渐进式后训练拓展文档解析前沿
PaddleOCR-VL-1.6 通过识别并精炼欠优化区域,结合针对性的数据优化与渐进式后训练,提升了文档解析性能,在 OmniDocBench v1.6 上达到 96.33% 的最新最优水平。
MonkeyOCRv2: 用于文档AI的视觉-文本基础模型
MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。
baidu/Unlimited-OCR
百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。
dots.ocr:单个视觉语言模型中的多语言文档布局解析
本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。