PaDoc: 基于布局的并行解码用于文档解析

Hugging Face Daily Papers 论文

摘要

PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。

端到端文档解析器提供了统一的接口,但将页面布局和区域内容序列化为一个自回归序列。这种建模方式将相互独立的区域强制置于一条解码路径上,其长度随总内容增长;而基于裁剪的两阶段解析器虽然揭示了区域级并行性,却以重复的视觉预填充和碎片化的页面上下文为代价。为了在消除依赖的同时保留整页上下文,我们提出了 PaDoc,一种基于布局的解析器,将预测的布局视为共享页面表示上的分支结构。在区域充分性假设下,我们推导出一种前缀条件分解,其中布局流和区域内容分支并发推进,将解码深度减少到最长的布局-内容路径。我们在单个多模态大语言模型(MLLM)中实现了这种分解:打包的可变长度祖先注意力在标准的下一个词元训练下保持可见性,而掩码并行解码创建多个分支,所评估的 vLLM 后端将这些分支作为并发请求处理,并复用缓存中的共享前缀。在 OmniDocBench Full 上,PaDoc 取得了 91.1 的总体布局 F1,并且在端到端解析器中,总体得分达到顶尖的 94.24,同时拥有最佳文本编辑距离(0.038)和公式 CDM(95.59)。在包含 384 页的子集和单块 A800 GPU 上,它是五种并发级别下最快的端到端解析器,相比同骨干网络的顺序 SFT 基线,有效页面吞吐量提升了 67.4%–118%,P95 延迟降低了 39.2%–54.9%。代码可在 https://github.com/Longin-Yu/Padoc 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:55

论文页面 - PaDoc:面向文档解析的布局引导并行解码

来源:https://huggingface.co/papers/2608.06146 发布于 8月6日

·

提交自 https://huggingface.co/Longin-Yu

Hao Yu (https://huggingface.co/Longin-Yu) 于 8月7日

作者:

,

,

,

,

,

,

,

,

,

摘要

端到端文档解析器提供了统一接口,但会将页面布局和区域内容串行化为一个自回归序列。这种定义将独立区域强制放在一条解码路径上,其长度随总内容增长;而基于裁剪的两阶段解析器虽然实现了区域级并行,但代价是重复的视觉预填充和破碎的页面上下文。为了在去除依赖的同时保留整页上下文,我们提出了 PaDoc,一种基于布局的解析器,它将预测的布局视为共享页面表示上的分支结构。在区域充分性假设下,我们推导出一种前缀条件分解,使布局流和区域内容分支能够并发推进,从而将解码深度缩减到最长的布局-内容路径。我们在单个 MLLM 内实现了这种分解:打包的可变长度祖先注意力在标准 next-token 训练下保持可见性,而掩码并行解码创建分支,所评估的 vLLM 后端将其作为并发请求处理,并复用缓存驻留的共享前缀。在 OmniDocBenchFull 上,PaDoc 取得了 91.1 的 Overall layout F1 ;在端到端解析器中,以 94.24 的顶级 Overall 分数,以及最佳的 TextEdit(0.038)和 FormulaCDM(95.59)表现突出。在包含 384 页的子集和单张 A800 GPU 上,它在五个并发级别下都是最快的端到端解析器,与同骨干网络顺序 SFT 基线相比,有效页面吞吐量提升了 67.4%-118%,P95 延迟降低了 39.2%-54.9%。代码可在 https://github.com/Longin-Yu/Padoc 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.06146) 查看 PDF (https://arxiv.org/pdf/2608.06146) GitHub2 (https://github.com/Longin-Yu/Padoc) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06146)

在您的 agent 中获取此论文:

hf papers read 2608.06146

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.06146 即可从此页面链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.06146 即可从此页面链接到该数据集。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.06146 即可从此页面链接到该 Space。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到该收藏集。

相似文章

HPD-Parsing:层次化并行文档解析

Hugging Face Daily Papers

HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。

dots.ocr:单个视觉语言模型中的多语言文档布局解析

Papers with Code Trending

本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。