PaDoc: 基于布局的并行解码用于文档解析
摘要
PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。
查看缓存全文
缓存时间: 2026/08/07 05:55
论文页面 - PaDoc:面向文档解析的布局引导并行解码
来源:https://huggingface.co/papers/2608.06146 发布于 8月6日
·
提交自 https://huggingface.co/Longin-Yu
Hao Yu (https://huggingface.co/Longin-Yu) 于 8月7日
作者:
,
,
,
,
,
,
,
,
,
摘要
端到端文档解析器提供了统一接口,但会将页面布局和区域内容串行化为一个自回归序列。这种定义将独立区域强制放在一条解码路径上,其长度随总内容增长;而基于裁剪的两阶段解析器虽然实现了区域级并行,但代价是重复的视觉预填充和破碎的页面上下文。为了在去除依赖的同时保留整页上下文,我们提出了 PaDoc,一种基于布局的解析器,它将预测的布局视为共享页面表示上的分支结构。在区域充分性假设下,我们推导出一种前缀条件分解,使布局流和区域内容分支能够并发推进,从而将解码深度缩减到最长的布局-内容路径。我们在单个 MLLM 内实现了这种分解:打包的可变长度祖先注意力在标准 next-token 训练下保持可见性,而掩码并行解码创建分支,所评估的 vLLM 后端将其作为并发请求处理,并复用缓存驻留的共享前缀。在 OmniDocBenchFull 上,PaDoc 取得了 91.1 的 Overall layout F1 ;在端到端解析器中,以 94.24 的顶级 Overall 分数,以及最佳的 TextEdit(0.038)和 FormulaCDM(95.59)表现突出。在包含 384 页的子集和单张 A800 GPU 上,它在五个并发级别下都是最快的端到端解析器,与同骨干网络顺序 SFT 基线相比,有效页面吞吐量提升了 67.4%-118%,P95 延迟降低了 39.2%-54.9%。代码可在 https://github.com/Longin-Yu/Padoc 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06146) 查看 PDF (https://arxiv.org/pdf/2608.06146) GitHub2 (https://github.com/Longin-Yu/Padoc) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06146)
在您的 agent 中获取此论文:
hf papers read 2608.06146
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.06146 即可从此页面链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.06146 即可从此页面链接到该数据集。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.06146 即可从此页面链接到该 Space。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到该收藏集。
相似文章
HPD-Parsing:层次化并行文档解析
HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。
dots.ocr:单个视觉语言模型中的多语言文档布局解析
本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。
PaddleOCR-VL-1.6:通过欠优化区域精炼与渐进式后训练拓展文档解析前沿
PaddleOCR-VL-1.6 通过识别并精炼欠优化区域,结合针对性的数据优化与渐进式后训练,提升了文档解析性能,在 OmniDocBench v1.6 上达到 96.33% 的最新最优水平。
@jerryjliu0:完全解决文档解析包括覆盖准确性、成本和延迟的帕累托曲线上的每一个点:高…
Jerry Liu 提出了一个涵盖准确性、成本和延迟权衡的文档解析框架,介绍了 LiteParse 作为一个面向 AI 智能体循环的开源低延迟解析工具,以及 LlamaParse 用于高精度模式。
@jerryjliu0:LiteParse,我们的开源文档解析器,在将复杂 PDF 布局、文本和表格解析为清晰的空间网格方面表现出色……
LiteParse 是一款基于启发式规则的开源 PDF 解析器,无需依赖 ML 模型即可快速将复杂布局、文本和表格转换为整洁的空间网格。