Infinity-Parser2 技术报告
摘要
Infinity-Parser2 技术报告介绍了一个用于端到端文档解析的大型多模态模型,该模型具有可扩展的数据合成流水线及多任务强化学习能力。它在多项基准测试中取得了领先结果,同步发布了开源模型变体及一个包含500万样本的双语语料库。
arXiv:2607.07836v1 公告类型:新
摘要:我们提出了 Infinity-Parser2,一个大型多模态模型,它将可控数据合成流水线与多任务强化学习相结合,用于端到端文档解析,解决了忠实标注解析语料库长期匮乏的问题。我们的贡献有三方面。首先,我们构建了一个可扩展的合成引擎,将可控渲染框架与迭代优化循环相结合,并利用它构建并开源了 Infinity-Doc2-5M:一个包含 500 万个样本的双语(中文/英文)语料库,涵盖多种文档类型,标注了元素边界框、规范内容形式(Markdown、HTML、LaTeX、SMILES、结构化图表)以及整页阅读顺序。其次,我们引入了一个可验证的多任务奖励系统,实现了跨八个协同训练目标(文档解析、版面分析、表格解析、数学公式解析、图表解析、化学公式解析、文档 VQA 和通用多模态理解)的联合强化学习,将感知、结构和推理统一到单个优化信号中。第三,我们在共享架构下发布了两个变体:Infinity-Parser2-Flash,针对低延迟推理进行了优化,相对于 Infinity-Parser-7B 实现了 $3.68\times$ 的吞吐量提升;以及 Infinity-Parser2-Pro,专为精度关键场景而设计。Infinity-Parser2-Pro 在 olmOCR-Bench 上达到了 87.6% 的最新水平,在 ParseBench 上达到了 74.3%,超越了 DeepSeek-OCR-2、PaddleOCR-VL-1.5 和 MinerU2.5,并且对图表、化学公式和文档 VQA 具有较强的泛化能力。
查看缓存全文
缓存时间: 2026/07/10 06:05
# Infinity-Parser2 技术报告 来源:https://arxiv.org/html/2607.07836 ###### 摘要 我们提出了Infinity\-Parser2,一个大型多模态模型,它将可控的数据合成流水线与多任务强化学习相结合,用于端到端的文档解析,解决了忠实标注的解析语料库长期匮乏的问题。我们的贡献有三方面。首先,我们构建了一个可扩展的合成引擎,将可控的渲染框架与迭代优化循环相结合,并利用它构建并开源了Infinity\-Doc2\-5M:一个500万样本的双语(中文/英文)语料库,涵盖多种文档类型,标注有元素边界框、规范内容形式(Markdown、HTML、LaTeX、SMILES、结构化图表)以及全页阅读顺序。其次,我们引入了一个可验证的多任务奖励系统,该系统能够在八个共同训练的目标(文档解析、版面分析、表格解析、数学公式解析、图表解析、化学公式解析、文档视觉问答和通用多模态理解)上实现联合强化学习,将感知、结构和推理统一在一个单一的优化信号中。第三,我们在共享架构下发布两个变体:Infinity\-Parser2\-Flash,针对低延迟推理进行了优化,相较于Infinity\-Parser\-7B实现了3.68倍的吞吐量提升;以及Infinity\-Parser2\-Pro,专为精度关键场景而设计。Infinity\-Parser2\-Pro在olmOCR\-Bench上达到了最先进的87.6%,在ParseBench上达到了74.3%,超越了DeepSeek\-OCR\-2、PaddleOCR\-VL\-1.5和MinerU2.5,并在图表、化学公式和文档视觉问答方面具有强大的泛化能力。 参见图注 参见图注 图1:性能评估。顶部:文档解析基准。底部:跨领域多任务能力。###### 目录 1. 引言 (https://arxiv.org/html/2607.07836#S1) 2. 相关工作 (https://arxiv.org/html/2607.07836#S2) 1. 2.1 基于流水线的方法 (https://arxiv.org/html/2607.07836#S2.SS1) 2. 2.2 端到端方法 (https://arxiv.org/html/2607.07836#S2.SS2) 3. 2.3 基于强化学习的方法 (https://arxiv.org/html/2607.07836#S2.SS3) 3. 数据策展 (https://arxiv.org/html/2607.07836#S3) 1. 3.1 数据迭代飞轮 (https://arxiv.org/html/2607.07836#S3.SS1) 2. 3.2 基于DOM的文档合成引擎 (https://arxiv.org/html/2607.07836#S3.SS2) 3. 3.3 数据集准备 (https://arxiv.org/html/2607.07836#S3.SS3) 4. 模型训练 (https://arxiv.org/html/2607.07836#S4) 1. 4.1 总体训练策略 (https://arxiv.org/html/2607.07836#S4.SS1) 2. 4.2 监督微调 (https://arxiv.org/html/2607.07836#S4.SS2) 3. 4.3 带可验证奖励的联合强化学习 (https://arxiv.org/html/2607.07836#S4.SS3) 5. 实验 (https://arxiv.org/html/2607.07836#S5) 1. 5.1 实现细节 (https://arxiv.org/html/2607.07836#S5.SS1) 2. 5.2 文档结构任务评估 (https://arxiv.org/html/2607.07836#S5.SS2) 3. 5.3 元素级解析任务评估 (https://arxiv.org/html/2607.07836#S5.SS3) 4. 5.4 推理与泛化任务评估 (https://arxiv.org/html/2607.07836#S5.SS4) 5. 5.5 消融研究 (https://arxiv.org/html/2607.07836#S5.SS5) 6. 5.6 推理速度 (https://arxiv.org/html/2607.07836#S5.SS6) 7. 5.7 真实世界文档信息抽取评估 (https://arxiv.org/html/2607.07836#S5.SS7) 6. 局限性 (https://arxiv.org/html/2607.07836#S6) 7. 结论 (https://arxiv.org/html/2607.07836#S7) 8. 贡献 (https://arxiv.org/html/2607.07836#S8) 9. 参考文献 (https://arxiv.org/html/2607.07836#bib) 10. 附录 (https://arxiv.org/html/2607.07836#A1) 1. A.1 评估基准 (https://arxiv.org/html/2607.07836#A1.SS1) 2. A.2 评估提示 (https://arxiv.org/html/2607.07836#A1.SS2) 3. A.3 金融信息抽取:任务定义与流水线 (https://arxiv.org/html/2607.07836#A1.SS3) 4. A.4 可视化结果 (https://arxiv.org/html/2607.07836#A1.SS4) ## 1 引言 文档解析已成为多模态理解领域的一个关键前沿,它充当了将非结构化视觉内容转化为机器可读、语义基础表示的桥梁。随着大型语言模型(LLMs)从被动回应者演变为能够摄取、推理并对现实世界工件采取行动的自主智能体,忠实解读异构文档(从科学论文和财务报表到发票、幻灯片和化学笔记)的能力已成为下游推理和决策的先决条件。因此,该领域早已超越了经典的光学字符识别(OCR):它现在要求整体的、页面级别的理解,需要同时处理版面分析、细粒度元素解析、全局一致的阅读顺序以及结构化信息抽取。然而,在这样的技术栈上实现可靠的、接近人类水平的准确性仍然困难重重,原因在于布局的多样性组合、跨模态线索的密集性以及目标本身固有的结构化特性。 尽管进展迅速,但两个结构性瓶颈仍然制约着该领域。首先,在数据方面,基于视觉语言模型(VLMs)[45](https://arxiv.org/html/2607.07836#bib.bib11), [12](https://arxiv.org/html/2607.07836#bib.bib12), [74](https://arxiv.org/html/2607.07836#bib.bib13)的主流监督微调(SFT)方案受限于大规模、忠实标注的解析语料库的缺乏,这些语料库需要同时覆盖异构布局、细粒度元素语义和全局一致的阅读顺序。因此,在分布内表现有竞争力的SFT模型,在遇到分布外(OOD)模板、低资源语言或图表、化学公式等专业垂直领域时,性能往往急剧下降。其次,在优化方面,文档解析本质上是一个多任务问题(文本识别、布局定位、表格和公式结构化、图表解码以及文档级推理紧密耦合),但现有的流水线通常将这些目标视为孤立的模块或顺序阶段。即使是最近的强化学习(RL)方法[67](https://arxiv.org/html/2607.07836#bib.bib15), [9](https://arxiv.org/html/2607.07836#bib.bib16), [53](https://arxiv.org/html/2607.07836#bib.bib18)也主要优化单一的、窄文本信号,导致结构化保真度、空间对齐和跨任务迁移未被充分利用。 为了克服这些限制,我们引入了Infinity\-Parser2,一个大型多模态模型,它将可控的数据合成流水线与多任务强化学习相结合,以实现全面的端到端文档解析。为了打破数据瓶颈,我们构建了一个可扩展的合成引擎,包含一个可控的渲染框架和一个迭代优化循环,并利用它构建了Infinity\-Doc2\-5M,一个500万样本的双语(中/英文)语料库,涵盖广泛的文档类型和布局(包括学术论文、研究报告和财务报告、报纸、教科书、试卷和杂志),覆盖单栏和多栏布局、图文表混合排版,以及嵌入的数学、表格和分子内容。每个样本都带有丰富的标注:元素边界框、规范内容形式(Markdown、HTML、LaTeX、SMILES、结构化图表)以及全页阅读顺序,为下游训练提供了结构化先验。为了整合分散的优化格局,我们进一步推进了后训练配方,引入了一个可验证的多任务奖励系统,该系统在八个共同训练的目标(文档解析、版面分析、表格解析、数学公式解析、图表解析、化学公式解析、文档视觉问答和通用多模态理解)上实现联合强化学习,将感知、结构和推理统一在一个单一的端到端优化信号下。最后,为了满足现实部署的不同需求,我们在共享架构下发布了两个模型变体:Infinity\-Parser2\-Flash,针对低延迟推理调整;以及Infinity\-Parser2\-Pro,专为精度关键场景设计以追求最大准确度。 在广泛公开基准上的大量实验验证了Infinity-Parser2的有效性(图1)。我们的系统在端到端文档解析上建立了新的最先进结果:Infinity-Parser2-Pro在olmOCR-Bench上达到87.6%,在ParseBench上达到74.3%,超越了包括DeepSeek-OCR-2、PaddleOCR-VL-1.5和MinerU2.5在内的当代强系统。Flash变体相较于我们之前的Infinity-Parser-7B实现了3.68倍的吞吐量提升(441 → 1,624 tokens/s),同时在准确性上保持竞争力,支持高效的大规模部署。除了文档中心指标外,Infinity-Parser2在图表、化学公式和文档视觉问答方面展现出强大的泛化能力,并保留了鲁棒的通用多模态推理能力,证明了联合多任务强化学习所解锁的广泛能力。我们的主要贡献总结如下: - •我们设计了一个可控的渲染框架,并结合迭代优化流水线,以克服解析数据瓶颈,并利用它构建并开源了Infinity\-Doc2\-5M,一个500万样本的双语语料库,涵盖学术论文、研究报告和财务报告、报纸、教科书、试卷和杂志,标注有元素级边界框、规范内容形式(Markdown、HTML、LaTeX、SMILES、结构化图表)以及全页阅读顺序。 - •我们提出了一个可验证的多任务奖励系统,驱动在八个共同训练目标(文档解析、版面分析、表格解析、数学公式解析、图表解析、化学公式解析、文档视觉问答和通用多模态理解)上的联合强化学习,将感知、结构和推理统一在一个单一的优化信号中。 - •我们在共享架构下发布两个面向部署的变体:Infinity\-Parser2\-Flash,相较于Infinity\-Parser\-7B实现了3.68倍的吞吐量提升;以及Infinity\-Parser2\-Pro,在olmOCR\-Bench上达到87.6%,在ParseBench上达到74.3%,超越了DeepSeek\-OCR\-2、PaddleOCR\-VL\-1.5和MinerU2.5。 - •为促进社区创新,我们发布了全套资产,包括Infinity\-Doc2\-5M数据集、源代码以及两个模型变体(Infinity\-Parser2\-Flash和Infinity\-Parser2\-Pro)。 ## 2 相关工作 文档解析已迅速发展成为视觉、语言和结构理解交叉领域的核心研究方向,其目标是将异构的数字和扫描页面转化为忠实的机器可读表示。根据解析能力的训练和组装方式,主流方法大致可分为三类:基于流水线的方法、端到端方法和基于强化学习的方法。 ### 2.1 基于流水线的方法 一条长期的研究路线遵循基于流水线的范式。诸如MinerU2.5[45](https://arxiv.org/html/2607.07836#bib.bib11)和PaddleOCR-VL[12](https://arxiv.org/html/2607.07836#bib.bib12)等系统将文档解析分解为一系列专门的阶段:首先,版面分析器检测并分类语义区域(文本块、表格、公式和图形);然后,任务特定的专家模型并行识别每个区域的内容;最后,可选的阅读顺序模块将页面重组为结构化格式,如Markdown或HTML。这种模块化设计提供了良好的工程易用性,支持各个组件的针对性优化,并能在标准化布局上实现高吞吐量推理。然而,正是这种赋予模块化的分阶段特性引入了沿流水线累积的错误:不完美的区域提议或错误分类的块会传播到下游的识别器和阅读顺序预测器中,且难以恢复。对阶段间手工设计的接口的依赖进一步限制了系统对布局偏离每个模块假设的文档的适应性。 ### 2.2 端到端方法 端到端方法则试图将整个解析栈纳入一个单一的模型。代表性的系统如dots.ocr系列[19](https://arxiv.org/html/2607.07836#bib.bib21), [89](https://arxiv.org/html/2607.07836#bib.bib88)和DeepSeek-OCR系列[74](https://arxiv.org/html/2607.07836#bib.bib13), [75](https://arxiv.org/html/2607.07836#bib.bib14)通过监督微调(SFT)微调大型视觉语言模型(VLMs),将文档图像直接映射到其结构化表示,同时处理文本识别、版面定位、表格和公式结构化以及阅读顺序重建。通过学习整体的视觉-文本表示,这些模型避免了手工制作的阶段间接口,并实现了强大的分布内准确性。然而,它们的有效性高度依赖于训练语料库的多样性和保真度:大规模、忠实标注的解析数据(覆盖异构布局、细粒度元素语义和全局一致的阅读顺序)的缺乏仍然是一个根本性瓶颈,仅使用SFT的模型在面对分布外(OOD)模板、低资源语言或图表和化学公式等专业垂直领域时,性能通常会明显下降。 ### 2.3 基于强化学习的方法 为了超越令牌级模仿的限制,越来越多的研究探索将强化学习作为文档解析的后训练策略。诸如[67](https://arxiv.org/html/2607.07836#bib.bib15), [9](https://arxiv.org/html/2607.07836#bib.bib16), [53](https://arxiv.org/html/2607.07836#bib.bib18), [28](https://arxiv.org/html/2607.07836#bib.bib19)等方法优化VLMs面向反映解析输出质量的结果导向奖励,并在各种文档类型上展示了令人鼓舞的改进。然而,现有的大多数强化学习流水线范围仍然狭窄:它们优化单一的、主要是文本的奖励信号,并将相关的子能力(元素解析、表格和图表解码、化学公式识别以及文档级问答)视为孤立的模块或顺序阶段,导致结构化保真度、空间对齐和跨任务迁移未被充分利用。相比之下,我们的Infinity-Parser2引入了一个可验证的多任务奖励系统,驱动在八个共同训练目标(文档解析、版面分析、表格解析、数学公式解析、图表解析、化学公式解析、文档视觉问答和通用多模态理解)上的联合强化学习,将感知、结构和推理统一在一个单一的端到端优化信号中,从而促进了跨异构文档和下游任务的鲁棒泛化。 ## 3 数据策展 我们的方法围绕三个支柱展开,共同驱动Infinity-Parser2的构建。首先,我们提出了一个**数据迭代飞轮**(第3.1节),这是一种闭环方法论,其中模型评估、坏例挖掘、数据构建和微调不断相互强化。其次,为了大规模支持数据构建步骤,我们开发了一个专用的**文档数据合成引擎**(第3.2节),通过一个三阶段流水线生成布局保真的文档。第三,我们描述由此产生的**任务**
相似文章
@jerryjliu0:一组新的开源权重模型正在登顶文档理解排行榜,INF 刚刚发布了两个模型:Inf…
Infinity 发布了两个开源权重模型,Infinity-Parser2-Pro(35B)和 Infinity-Parser2-Flash(2B),它们登顶了 ParseBench 文档理解排行榜,利用了合成数据引擎和一种新颖的联合强化学习算法。
MinerU2.5:一种用于高效高分辨率文档解析的解耦视觉-语言模型
MinerU2.5 是一个拥有 12 亿参数的视觉-语言模型,通过采用由粗到细的解析策略,在保持高计算效率的同时实现了最先进的文档解析准确率。
@jerryjliu0: LiteParse 是为 AI 智能体设计的最佳开源、无模型文档解析器。支持解析 50 多种文档类型,并…
LlamaIndex 发布了 liteparse-server,这是一个可自托管、无模型的 HTTP API,能够以高空间保真度和隐私保护能力解析多种多样的文档类型。
@jerryjliu0:完全解决文档解析包括覆盖准确性、成本和延迟的帕累托曲线上的每一个点:高…
Jerry Liu 提出了一个涵盖准确性、成本和延迟权衡的文档解析框架,介绍了 LiteParse 作为一个面向 AI 智能体循环的开源低延迟解析工具,以及 LlamaParse 用于高精度模式。
@oliviscusAI: 您现在可以用一个 17 亿参数的模型解析任何文档,它就是 dots-ocr。一个处理文本、表格等的系统。
本文介绍了 dots-ocr,这是一个拥有 17 亿参数的模型,能够在超过 100 种语言中解析文档中的文本、表格、公式和图像,而无需单独的 OCR 处理流程。