@jerryjliu0:一组新的开源权重模型正在登顶文档理解排行榜,INF 刚刚发布了两个模型:Inf…

X AI KOLs Following 模型

摘要

Infinity 发布了两个开源权重模型,Infinity-Parser2-Pro(35B)和 Infinity-Parser2-Flash(2B),它们登顶了 ParseBench 文档理解排行榜,利用了合成数据引擎和一种新颖的联合强化学习算法。

一组新的开源权重模型正在登顶文档理解排行榜。INF 刚刚发布了两个模型:Infinity-Parser2-Pro(35B)和 Infinity-Parser2-Flash(2B),它们在我们的 @huggingface 的 ParseBench 排行榜上名列前茅。两个关键洞察:一个扩展的合成数据引擎,包含超过500万个多样化的解析样本;一个新颖的联合强化学习算法,能够协同优化多个复杂任务:文档解析、元素解析、图表解析等。ParseBench 是一个开放基准测试,旨在评估对真实企业文档的语义理解;它包含对表格、图表、语义格式等方面的全面指标。快来 ParseBench 上查看结果!HuggingFace:https://huggingface.co/datasets/llamaindex/ParseBench… 网站:https://parsebench.ai Infinity-Parser Flash 模型:https://huggingface.co/infly/Infinity-Parser2-Flash…
查看原文
查看缓存全文

缓存时间: 2026/05/15 23:09

一批新的开放式权重模型在文档理解排行榜上登顶。INF 刚刚发布了两款模型:Infinity-Parser2-Pro (35B) 和 Infinity-Parser2-Flash (2B),它们在我们的 @huggingface ParseBench 排行榜上名列前茅。两大关键洞察:

  • 一个涵盖超过 500 万个多样化解析样本的扩展合成数据引擎
  • 一种新颖的联合强化学习算法,可协同优化多个复杂任务:文档解析、元素解析、图表解析等。

ParseBench 是一个开放的基准测试,旨在评估真实企业文档的语义文档理解能力;它包含表格、图表、语义格式等方面的综合指标。快来 ParseBench 上查看结果吧! HuggingFace: https://huggingface.co/datasets/llamaindex/ParseBench… 网站: https://parsebench.ai Infinity-Parser Flash 模型: https://huggingface.co/infly/Infinity-Parser2-Flash…


llamaindex/ParseBench · Hugging Face 数据集

来源: https://huggingface.co/datasets/llamaindex/ParseBench ParseBench (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/thumbnails/parsebench_teaser.png)

快速链接:[🌐 网站][📜 论文][💻 代码]

ParseBench 是一个用于评估真实企业文档解析系统的基准测试,具有以下特点:

  • 多维度评估。 该基准测试分为五个能力维度——表格、图表、内容忠实度、语义格式和视觉定位——每个维度都有针对性的任务指标,旨在捕捉智能体工作流所依赖的关键要素。
  • 真实企业文档。 评估集包含约 2,000 个人工验证的页面,来自 1,200 多份公开文档,涵盖保险、金融、政府等领域,难度从简单到对抗性难。
  • 密集的测试覆盖。 五个维度共有超过 169,000 条测试规则,提供细粒度的诊断能力,精确指出解析器在何处失效。
  • 人工验证的标注。 所有标注均通过两阶段流程生成:前沿 VLM 自动标注,然后进行定向人工修正。
  • 评估代码套件。 该基准测试附带完整的评估框架,支持端到端流程评估、各维度评分以及跨流程比较。评估代码可在 ParseBench (https://github.com/run-llama/ParseBench) 找到。

https://huggingface.co/datasets/llamaindex/ParseBench#dataset-introduction 数据集介绍

ParseBench 包含约 2,000 个人工验证的、带标注的页面,这些页面来自公开的企业文档,涵盖保险、金融、政府等领域。该基准测试分为五个能力维度,每个维度针对一个持续破坏生产级智能体工作流的故障模式:

  • 表格。 合并单元格和层级表头的结构保真度。一个表头位置偏移或合并单元格错误会导致智能体从错误的列提取数值,从而悄然破坏财务分析。
  • 图表。 从柱状图、折线图、饼图和复合图表中精确提取带正确标签的数据点。智能体需要精确的数值,而非自然语言描述。
  • 内容忠实度。 遗漏、幻觉和阅读顺序违规。遗漏或虚构的内容意味着智能体在错误的上下文上行动。
  • 语义格式。 保留具有语义意义的内联格式:删除线(标记已取代的内容)、上标/下标(脚注引用、化学式)、粗体(定义术语、关键值)、标题、LaTeX 和代码块。
  • 视觉定位。 将每个提取的元素追溯到其在页面上的精确源位置。这对于受监管工作流中的可审计性至关重要。
维度指标页面数文档数规则数
表格GTRM (GriTS + TableRecordMatch)503284
图表ChartDataPointMatch568994,864
内容忠实度内容忠实度评分506506141,322
语义格式语义格式评分4764765,997
布局(视觉定位)元素通过率50032116,325
总计(唯一)2,0781,211169,011

内容忠实度和语义格式共享相同的 507 份底层文本文档,但使用不同的规则集进行评估。总计显示的是唯一页面和文档。表格使用连续指标(无离散规则)。

https://huggingface.co/datasets/llamaindex/ParseBench#usage 使用方法

您可以使用我们的评估框架 (https://github.com/run-llama/ParseBench) 在五个维度上运行评估:

  • 表格 — GTRM(GriTS 和 TableRecordMatch 的平均值):GriTS 测量结构相似性;TableRecordMatch 将表格视为记录包,并评估结构保真度。
  • 图表 — ChartDataPointMatch:验证标注的数据点是否与解析器的表格输出匹配。
  • 内容忠实度 — 基于规则的检测,识别单词、句子和数字粒度的遗漏、幻觉和阅读顺序违规。
  • 语义格式 — 验证格式保留情况(粗体、删除线、上标/下标、标题、LaTeX、代码块)。
  • 视觉定位 — 联合评估定位 (IoA)、分类和归因。

评估数据集文件包括:

  • chart.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/chart.jsonl) — 568 页中的 4,864 条图表数据点抽查规则
  • table.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/table.jsonl) — 用于结构评估的 503 个真值 HTML 表格
  • text_content.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/text_content.jsonl) — 506 页中的 141,322 条内容忠实度规则(遗漏、幻觉、阅读顺序)
  • text_formatting.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/text_formatting.jsonl) — 476 页中的 5,997 条格式保留规则
  • layout.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/layout.jsonl) — 500 页中的 16,325 条布局元素和阅读顺序规则
  • docs/ (https://huggingface.co/datasets/llamaindex/ParseBench/tree/main/docs) — 按类别组织的源文档(PDF、JPG、PNG)

数据集格式

数据集格式为 JSONL,每行一条测试规则。结构和字段说明:

{
    "pdf": "docs/chart/report_p41.pdf",   // 源文档的相对路径(PDF、JPG 或 PNG)
    "category": "chart",                   // 评估类别
    "id": "unique_rule_id",                // 该测试规则的唯一标识符
    "type": "chart_data_point",            // 规则类型(见下文)
    "rule": "{...}",                       // JSON 编码的规则负载,包含评估参数
    "page": null,                          // 页码(从 1 开始),用于布局规则
    "expected_markdown": null,             // 真值 HTML/markdown,用于表格规则
    "tags": ["need_estimate"]              // 文档级标签,用于过滤和分组
}

各类别的标签:

  • chart:need_estimate(值需要视觉估计),3d_chart(3D 图表渲染)
  • table: 难度(easyhard
  • text_content / text_formatting: 难度(easyhard)和文档类型(densesparsesimplemulticolumnsocrmultilangmischandwritting
  • layout: 难度(easyhard

各类别的规则类型:

  • chart:chart_data_point — 一个抽查数据点,指定一个数值和一个或多个标签(系列名称、x 轴类别),这些应在解析器的表格输出中找到,并带有可配置的容差。
  • table:expected_markdown — 真值 HTML 表格结构。评估将表格视为记录包(行由列标题键控)。
  • layout:layout(边界框 + 语义类 + 内容 + 阅读顺序索引),order(成对阅读顺序断言)。
  • text_content:missing_word_percent, unexpected_word_percent, too_many_word_occurence_percent, missing_sentence_percent, unexpected_sentence_percent, too_many_sentence_occurence_percent, bag_of_digit_percent, order, missing_specific_word, missing_specific_sentence, is_footer, is_header
  • text_formatting:is_bold, is_italic, is_underline, is_strikeout, is_mark, is_sup, is_sub, is_title, title_hierarchy_percent, is_latex, is_code_block

评估类别

图表规则类型 — chart_data_point

每条规则指定一个预期数值和一个或多个标签(系列名称、x 轴类别、图表标题)。如果一个数据点的值及其所有关联标签都可在解析器的表格输出中找到,则该数据点验证通过。评估对表格方向不敏感(行和列可以互换),并且对数字格式差异(货币符号、单位后缀、千位分隔符)有容错性。每个数据点包含一个可配置的容差,因为从图表中精确检索数值通常不精确。

chart_data_point    # 抽查数据点:值 + 标签与解析器的表格输出匹配
                    # 规则字段:labels (列表),value (字符串),max_diffs (整数),normalize_numbers (布尔值)

表格expected_markdown

每条规则提供一个真值 HTML 表格。评估使用 TableRecordMatch 指标,该指标将表格视为记录包:每行是一条记录,单元格值由其列标题键控。真值记录与预测记录匹配,每对匹配通过二进制单元格级一致进行评分。TableRecordMatch 对列和行的顺序不敏感(不会改变键值关系),而删除或转置的表头会导致大的不匹配并受到相应惩罚。

expected_markdown   # 用于 TableRecordMatch 评估的真值 HTML 表格
                    # 规则字段:{} (真值存储在 expected_markdown 字段中)

文本内容规则类型测量解析器是否忠实地再现文本内容:

# 文本正确性——遗漏和幻觉
missing_word_percent              # 输出中缺失的真值单词比例
unexpected_word_percent           # 输出中不在真值中的单词比例(幻觉)
too_many_word_occurence_percent   # 多余的单词重复
missing_sentence_percent          # 输出中缺失的真值句子比例
unexpected_sentence_percent       # 输出中不在真值中的句子比例
too_many_sentence_occurence_percent  # 多余的句子重复
bag_of_digit_percent              # 数字频率分布匹配(捕捉 OCR 错误,如 6→8)
missing_specific_word             # 二进制:特定单词是否存在
missing_specific_sentence         # 二进制:特定句子是否存在

# 结构
order                             # 成对阅读顺序断言(之前/之后)
is_footer                         # 页脚检测
is_header                         # 页眉检测

文本格式规则类型验证具有语义意义的格式是否保留:

# 文本样式
is_bold                   # 粗体格式保留
is_italic                 # 斜体格式保留
is_underline              # 下划线格式保留
is_strikeout              # 删除线保留(标记已取代的内容)
is_mark                   # 高亮/标记保留
is_sup                    # 上标保留(脚注、指数)
is_sub                    # 下标保留(化学式)

# 文档结构
is_title                  # 文本以标题形式出现在正确层级
title_hierarchy_percent   # 标题父子层级结构评分

# 特殊内容
is_latex                  # 数学公式以 LaTeX 表示法
is_code_block             # 带语言注释的围栏代码块

布局规则类型评估视觉定位:

layout    # 元素标注:边界框(归一化 [0,1]),
          # 语义类(Text,Table,Picture,Page-Header,Page-Footer),
          # 内容关联,以及阅读顺序索引
order     # 布局级阅读顺序断言

文档类别

图表文档(568 页)——来自公司报告、财务申报和政府出版物的柱状图、折线图、饼图和复合图表。数据集确保多样性,涵盖带/不带显式值标签的图表、离散和连续系列、不同数据密度以及单/多图表页面。

表格文档(503 页)——主要来自保险申报(SERFF)、公共财务文件和政府报告。表格保留在其原始 PDF 页面中,保留完整的视觉上下文。数据集包括合并单元格、层级表头、跨行和多页表格。

文本文档(508 页,由内容忠实度和语义格式共享)——每份文档一页,按标签分类:

标签描述文档数
simple带有一些样式的简单文本170
ocr扫描/图像文档,质量不一119
multicolumns1–8 列,不同布局97
multilang20+ 种语言,所有主要文字47
misc不寻常的内容/布局/阅读顺序33
dense密集的大文档(例如报纸)14
sparse稀疏文本内容,每页文本极少14
handwritting大量手写文本13

布局文档(500 页)——单列、多列和复杂布局,包含混合媒体(文本、图像、表格、图表)。包括 PDF、JPG 和 PNG 输入。评估使用紧凑的标签集:Text、Table、Picture、Page-Header 和 Page-Footer。

https://huggingface.co/datasets/llamaindex/ParseBench#submit-results-to-the-leaderboard 向排行榜提交结果

我们欢迎并感谢社区对 ParseBench 排行榜 (https://huggingface.co/datasets/llamaindex/ParseBench) 的贡献!

如需贡献模型的分数,请在模型 HuggingFace 仓库上开启一个 PR,添加一个 .eval_results/parsebench.yaml 文件,格式参考此示例 PR (https://huggingface.co/google/gemma-4-31B-it/discussions/72)。更多详情请参阅 HuggingFace eval-results 文档 (https://huggingface.co/docs/hub/eval-results)。

https://huggingface.co/datasets/llamaindex/ParseBench#data-display 数据展示

https://huggingface.co/datasets/llamaindex/ParseBench#charts 图表

https://huggingface.co/datasets/llamaindex/ParseBench#tables 表格

[](https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/docs/table

相似文章

Infinity-Parser2 技术报告

arXiv cs.AI

Infinity-Parser2 技术报告介绍了一个用于端到端文档解析的大型多模态模型,该模型具有可扩展的数据合成流水线及多任务强化学习能力。它在多项基准测试中取得了领先结果,同步发布了开源模型变体及一个包含500万样本的双语语料库。