HPD-Parsing:层次化并行文档解析
摘要
HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。
查看缓存全文
缓存时间: 2026/07/22 06:41
论文页面 - HPD-Parsing:层次化并行文档解析
来源:https://huggingface.co/papers/2607.18839 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
高效团队协作通常结合全局协调与并行执行,这一原则在基于统一视觉语言模型(VLM)的文档解析器中尚未得到充分体现。现有统一解析器虽能整体处理整页内容,但通过单一逐词的自回归轨迹生成输出,形成了随文档长度增长的顺序瓶颈。这种全页顺序生成忽略了文档解析的一个关键特性:布局必须全局分析,而块内容可以并行解析。基于这一观察,我们提出了 HPD-Parsing,用层次化并行解码范式取代全页自回归生成。主布局分支负责组织整体文档结构并动态分配块级内容解码至并发分支,而渐进式多词元预测(P-MTP)进一步减少了每个分支内的解码步骤。在公开基准上的实验表明,HPD-Parsing 每秒处理 4,752 个词元,吞吐量是现有最快文档解析模型的 2.62 倍,是朴素自回归基线的 3.06 倍,同时保持了具有竞争力的解析精度。这些结果确立了层次化并行解码作为全页自回归生成的有效替代方案,为高效统一文档解析开辟了新方向。
查看 arXiv 页面 (https://arxiv.org/abs/2607.18839) 查看 PDF (https://arxiv.org/pdf/2607.18839) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18839)
在你的 agent 中获取这篇论文:
hf papers read 2607.18839
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.18839 即可从此页面关联。
引用此论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.18839 即可从此页面关联。
引用此论文的空间 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.18839 即可从此页面关联。
收录此论文的收藏 0
没有收藏包含此论文
添加此论文到一个收藏 (https://huggingface.co/new-collection) 即可从此页面关联。
相似文章
PaDoc: 基于布局的并行解码用于文档解析
PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。
@jerryjliu0:完全解决文档解析包括覆盖准确性、成本和延迟的帕累托曲线上的每一个点:高…
Jerry Liu 提出了一个涵盖准确性、成本和延迟权衡的文档解析框架,介绍了 LiteParse 作为一个面向 AI 智能体循环的开源低延迟解析工具,以及 LlamaParse 用于高精度模式。
MinerU2.5:一种用于高效高分辨率文档解析的解耦视觉-语言模型
MinerU2.5 是一个拥有 12 亿参数的视觉-语言模型,通过采用由粗到细的解析策略,在保持高计算效率的同时实现了最先进的文档解析准确率。
PaddleOCR-VL:通过 0.9B 超紧凑视觉语言模型提升多语言文档解析能力
PaddleOCR-VL 是一个紧凑的 0.9B 视觉语言模型,通过集成 NaViT 风格的动态分辨率与 ERNIE 语言模型,在多语言文档解析和元素识别方面实现了最先进的性能。
PaddleOCR-VL-1.6:通过欠优化区域精炼与渐进式后训练拓展文档解析前沿
PaddleOCR-VL-1.6 通过识别并精炼欠优化区域,结合针对性的数据优化与渐进式后训练,提升了文档解析性能,在 OmniDocBench v1.6 上达到 96.33% 的最新最优水平。