HPD-Parsing:层次化并行文档解析

Hugging Face Daily Papers 论文

摘要

HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。

高效的团队合作通常结合全局协调与并行执行,这一原则在统一的基于视觉语言模型(VLM)的文档解析器中尚未得到充分体现。现有的统一解析器联合处理整个页面,但通过单令牌逐令牌的自回归轨迹生成输出,从而产生随着文档长度增长的顺序瓶颈。这种整页顺序生成忽略了一个关键特性:布局必须全局分析,而块内容可以并行解析。基于这一观察,我们提出了HPD-Parsing,用层次化并行解码范式取代整页自回归生成。一个主布局分支组织整体文档结构,并动态地将块级内容解码分配给并发分支,同时渐进式多令牌预测(P-MTP)进一步减少了每个分支内的解码步骤。在公开基准上的实验表明,HPD-Parsing实现了每秒4752个令牌的吞吐量,是最快现有文档解析模型吞吐量的2.62倍,是基础自回归基线的3.06倍,同时保持了有竞争力的解析准确率。这些结果确立了层次化并行解码作为整页自回归生成的有效替代方案,为高效统一的文档解析开辟了新方向。
查看原文
查看缓存全文

缓存时间: 2026/07/22 06:41

论文页面 - HPD-Parsing:层次化并行文档解析

来源:https://huggingface.co/papers/2607.18839 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

高效团队协作通常结合全局协调与并行执行,这一原则在基于统一视觉语言模型(VLM)的文档解析器中尚未得到充分体现。现有统一解析器虽能整体处理整页内容,但通过单一逐词的自回归轨迹生成输出,形成了随文档长度增长的顺序瓶颈。这种全页顺序生成忽略了文档解析的一个关键特性:布局必须全局分析,而块内容可以并行解析。基于这一观察,我们提出了 HPD-Parsing,用层次化并行解码范式取代全页自回归生成。主布局分支负责组织整体文档结构并动态分配块级内容解码至并发分支,而渐进式多词元预测(P-MTP)进一步减少了每个分支内的解码步骤。在公开基准上的实验表明,HPD-Parsing 每秒处理 4,752 个词元,吞吐量是现有最快文档解析模型的 2.62 倍,是朴素自回归基线的 3.06 倍,同时保持了具有竞争力的解析精度。这些结果确立了层次化并行解码作为全页自回归生成的有效替代方案,为高效统一文档解析开辟了新方向。

查看 arXiv 页面 (https://arxiv.org/abs/2607.18839) 查看 PDF (https://arxiv.org/pdf/2607.18839) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18839)

在你的 agent 中获取这篇论文:

hf papers read 2607.18839

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.18839 即可从此页面关联。

引用此论文的数据集 0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.18839 即可从此页面关联。

引用此论文的空间 0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.18839 即可从此页面关联。

收录此论文的收藏 0

没有收藏包含此论文

添加此论文到一个收藏 (https://huggingface.co/new-collection) 即可从此页面关联。

相似文章

PaDoc: 基于布局的并行解码用于文档解析

Hugging Face Daily Papers

PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。