@jerryjliu0:一组新的开源权重模型正在登顶文档理解排行榜,INF 刚刚发布了两个模型:Inf…
摘要
Infinity 发布了两个开源权重模型,Infinity-Parser2-Pro(35B)和 Infinity-Parser2-Flash(2B),它们登顶了 ParseBench 文档理解排行榜,利用了合成数据引擎和一种新颖的联合强化学习算法。
查看缓存全文
缓存时间: 2026/05/15 23:09
一批新的开放式权重模型在文档理解排行榜上登顶。INF 刚刚发布了两款模型:Infinity-Parser2-Pro (35B) 和 Infinity-Parser2-Flash (2B),它们在我们的 @huggingface ParseBench 排行榜上名列前茅。两大关键洞察:
- 一个涵盖超过 500 万个多样化解析样本的扩展合成数据引擎
- 一种新颖的联合强化学习算法,可协同优化多个复杂任务:文档解析、元素解析、图表解析等。
ParseBench 是一个开放的基准测试,旨在评估真实企业文档的语义文档理解能力;它包含表格、图表、语义格式等方面的综合指标。快来 ParseBench 上查看结果吧! HuggingFace: https://huggingface.co/datasets/llamaindex/ParseBench… 网站: https://parsebench.ai Infinity-Parser Flash 模型: https://huggingface.co/infly/Infinity-Parser2-Flash…
llamaindex/ParseBench · Hugging Face 数据集
来源: https://huggingface.co/datasets/llamaindex/ParseBench ParseBench (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/thumbnails/parsebench_teaser.png)
ParseBench 是一个用于评估真实企业文档解析系统的基准测试,具有以下特点:
- 多维度评估。 该基准测试分为五个能力维度——表格、图表、内容忠实度、语义格式和视觉定位——每个维度都有针对性的任务指标,旨在捕捉智能体工作流所依赖的关键要素。
- 真实企业文档。 评估集包含约 2,000 个人工验证的页面,来自 1,200 多份公开文档,涵盖保险、金融、政府等领域,难度从简单到对抗性难。
- 密集的测试覆盖。 五个维度共有超过 169,000 条测试规则,提供细粒度的诊断能力,精确指出解析器在何处失效。
- 人工验证的标注。 所有标注均通过两阶段流程生成:前沿 VLM 自动标注,然后进行定向人工修正。
- 评估代码套件。 该基准测试附带完整的评估框架,支持端到端流程评估、各维度评分以及跨流程比较。评估代码可在 ParseBench (https://github.com/run-llama/ParseBench) 找到。
https://huggingface.co/datasets/llamaindex/ParseBench#dataset-introduction 数据集介绍
ParseBench 包含约 2,000 个人工验证的、带标注的页面,这些页面来自公开的企业文档,涵盖保险、金融、政府等领域。该基准测试分为五个能力维度,每个维度针对一个持续破坏生产级智能体工作流的故障模式:
- 表格。 合并单元格和层级表头的结构保真度。一个表头位置偏移或合并单元格错误会导致智能体从错误的列提取数值,从而悄然破坏财务分析。
- 图表。 从柱状图、折线图、饼图和复合图表中精确提取带正确标签的数据点。智能体需要精确的数值,而非自然语言描述。
- 内容忠实度。 遗漏、幻觉和阅读顺序违规。遗漏或虚构的内容意味着智能体在错误的上下文上行动。
- 语义格式。 保留具有语义意义的内联格式:删除线(标记已取代的内容)、上标/下标(脚注引用、化学式)、粗体(定义术语、关键值)、标题、LaTeX 和代码块。
- 视觉定位。 将每个提取的元素追溯到其在页面上的精确源位置。这对于受监管工作流中的可审计性至关重要。
| 维度 | 指标 | 页面数 | 文档数 | 规则数 |
|---|---|---|---|---|
| 表格 | GTRM (GriTS + TableRecordMatch) | 503 | 284 | — |
| 图表 | ChartDataPointMatch | 568 | 99 | 4,864 |
| 内容忠实度 | 内容忠实度评分 | 506 | 506 | 141,322 |
| 语义格式 | 语义格式评分 | 476 | 476 | 5,997 |
| 布局(视觉定位) | 元素通过率 | 500 | 321 | 16,325 |
| 总计(唯一) | 2,078 | 1,211 | 169,011 |
内容忠实度和语义格式共享相同的 507 份底层文本文档,但使用不同的规则集进行评估。总计显示的是唯一页面和文档。表格使用连续指标(无离散规则)。
https://huggingface.co/datasets/llamaindex/ParseBench#usage 使用方法
您可以使用我们的评估框架 (https://github.com/run-llama/ParseBench) 在五个维度上运行评估:
- 表格 — GTRM(GriTS 和 TableRecordMatch 的平均值):GriTS 测量结构相似性;TableRecordMatch 将表格视为记录包,并评估结构保真度。
- 图表 — ChartDataPointMatch:验证标注的数据点是否与解析器的表格输出匹配。
- 内容忠实度 — 基于规则的检测,识别单词、句子和数字粒度的遗漏、幻觉和阅读顺序违规。
- 语义格式 — 验证格式保留情况(粗体、删除线、上标/下标、标题、LaTeX、代码块)。
- 视觉定位 — 联合评估定位 (IoA)、分类和归因。
评估数据集文件包括:
- chart.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/chart.jsonl) — 568 页中的 4,864 条图表数据点抽查规则
- table.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/table.jsonl) — 用于结构评估的 503 个真值 HTML 表格
- text_content.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/text_content.jsonl) — 506 页中的 141,322 条内容忠实度规则(遗漏、幻觉、阅读顺序)
- text_formatting.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/text_formatting.jsonl) — 476 页中的 5,997 条格式保留规则
- layout.jsonl (https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/layout.jsonl) — 500 页中的 16,325 条布局元素和阅读顺序规则
- docs/ (https://huggingface.co/datasets/llamaindex/ParseBench/tree/main/docs) — 按类别组织的源文档(PDF、JPG、PNG)
数据集格式
数据集格式为 JSONL,每行一条测试规则。结构和字段说明:
{
"pdf": "docs/chart/report_p41.pdf", // 源文档的相对路径(PDF、JPG 或 PNG)
"category": "chart", // 评估类别
"id": "unique_rule_id", // 该测试规则的唯一标识符
"type": "chart_data_point", // 规则类型(见下文)
"rule": "{...}", // JSON 编码的规则负载,包含评估参数
"page": null, // 页码(从 1 开始),用于布局规则
"expected_markdown": null, // 真值 HTML/markdown,用于表格规则
"tags": ["need_estimate"] // 文档级标签,用于过滤和分组
}
各类别的标签:
- chart:
need_estimate(值需要视觉估计),3d_chart(3D 图表渲染) - table: 难度(
easy,hard) - text_content / text_formatting: 难度(
easy,hard)和文档类型(dense,sparse,simple,multicolumns,ocr,multilang,misc,handwritting) - layout: 难度(
easy,hard)
各类别的规则类型:
- chart:
chart_data_point— 一个抽查数据点,指定一个数值和一个或多个标签(系列名称、x 轴类别),这些应在解析器的表格输出中找到,并带有可配置的容差。 - table:
expected_markdown— 真值 HTML 表格结构。评估将表格视为记录包(行由列标题键控)。 - layout:
layout(边界框 + 语义类 + 内容 + 阅读顺序索引),order(成对阅读顺序断言)。 - text_content:
missing_word_percent,unexpected_word_percent,too_many_word_occurence_percent,missing_sentence_percent,unexpected_sentence_percent,too_many_sentence_occurence_percent,bag_of_digit_percent,order,missing_specific_word,missing_specific_sentence,is_footer,is_header - text_formatting:
is_bold,is_italic,is_underline,is_strikeout,is_mark,is_sup,is_sub,is_title,title_hierarchy_percent,is_latex,is_code_block
评估类别
图表规则类型 — chart_data_point:
每条规则指定一个预期数值和一个或多个标签(系列名称、x 轴类别、图表标题)。如果一个数据点的值及其所有关联标签都可在解析器的表格输出中找到,则该数据点验证通过。评估对表格方向不敏感(行和列可以互换),并且对数字格式差异(货币符号、单位后缀、千位分隔符)有容错性。每个数据点包含一个可配置的容差,因为从图表中精确检索数值通常不精确。
chart_data_point # 抽查数据点:值 + 标签与解析器的表格输出匹配
# 规则字段:labels (列表),value (字符串),max_diffs (整数),normalize_numbers (布尔值)
表格 — expected_markdown:
每条规则提供一个真值 HTML 表格。评估使用 TableRecordMatch 指标,该指标将表格视为记录包:每行是一条记录,单元格值由其列标题键控。真值记录与预测记录匹配,每对匹配通过二进制单元格级一致进行评分。TableRecordMatch 对列和行的顺序不敏感(不会改变键值关系),而删除或转置的表头会导致大的不匹配并受到相应惩罚。
expected_markdown # 用于 TableRecordMatch 评估的真值 HTML 表格
# 规则字段:{} (真值存储在 expected_markdown 字段中)
文本内容规则类型测量解析器是否忠实地再现文本内容:
# 文本正确性——遗漏和幻觉
missing_word_percent # 输出中缺失的真值单词比例
unexpected_word_percent # 输出中不在真值中的单词比例(幻觉)
too_many_word_occurence_percent # 多余的单词重复
missing_sentence_percent # 输出中缺失的真值句子比例
unexpected_sentence_percent # 输出中不在真值中的句子比例
too_many_sentence_occurence_percent # 多余的句子重复
bag_of_digit_percent # 数字频率分布匹配(捕捉 OCR 错误,如 6→8)
missing_specific_word # 二进制:特定单词是否存在
missing_specific_sentence # 二进制:特定句子是否存在
# 结构
order # 成对阅读顺序断言(之前/之后)
is_footer # 页脚检测
is_header # 页眉检测
文本格式规则类型验证具有语义意义的格式是否保留:
# 文本样式
is_bold # 粗体格式保留
is_italic # 斜体格式保留
is_underline # 下划线格式保留
is_strikeout # 删除线保留(标记已取代的内容)
is_mark # 高亮/标记保留
is_sup # 上标保留(脚注、指数)
is_sub # 下标保留(化学式)
# 文档结构
is_title # 文本以标题形式出现在正确层级
title_hierarchy_percent # 标题父子层级结构评分
# 特殊内容
is_latex # 数学公式以 LaTeX 表示法
is_code_block # 带语言注释的围栏代码块
布局规则类型评估视觉定位:
layout # 元素标注:边界框(归一化 [0,1]),
# 语义类(Text,Table,Picture,Page-Header,Page-Footer),
# 内容关联,以及阅读顺序索引
order # 布局级阅读顺序断言
文档类别
图表文档(568 页)——来自公司报告、财务申报和政府出版物的柱状图、折线图、饼图和复合图表。数据集确保多样性,涵盖带/不带显式值标签的图表、离散和连续系列、不同数据密度以及单/多图表页面。
表格文档(503 页)——主要来自保险申报(SERFF)、公共财务文件和政府报告。表格保留在其原始 PDF 页面中,保留完整的视觉上下文。数据集包括合并单元格、层级表头、跨行和多页表格。
文本文档(508 页,由内容忠实度和语义格式共享)——每份文档一页,按标签分类:
| 标签 | 描述 | 文档数 |
|---|---|---|
simple | 带有一些样式的简单文本 | 170 |
ocr | 扫描/图像文档,质量不一 | 119 |
multicolumns | 1–8 列,不同布局 | 97 |
multilang | 20+ 种语言,所有主要文字 | 47 |
misc | 不寻常的内容/布局/阅读顺序 | 33 |
dense | 密集的大文档(例如报纸) | 14 |
sparse | 稀疏文本内容,每页文本极少 | 14 |
handwritting | 大量手写文本 | 13 |
布局文档(500 页)——单列、多列和复杂布局,包含混合媒体(文本、图像、表格、图表)。包括 PDF、JPG 和 PNG 输入。评估使用紧凑的标签集:Text、Table、Picture、Page-Header 和 Page-Footer。
https://huggingface.co/datasets/llamaindex/ParseBench#submit-results-to-the-leaderboard 向排行榜提交结果
我们欢迎并感谢社区对 ParseBench 排行榜 (https://huggingface.co/datasets/llamaindex/ParseBench) 的贡献!
如需贡献模型的分数,请在模型 HuggingFace 仓库上开启一个 PR,添加一个 .eval_results/parsebench.yaml 文件,格式参考此示例 PR (https://huggingface.co/google/gemma-4-31B-it/discussions/72)。更多详情请参阅 HuggingFace eval-results 文档 (https://huggingface.co/docs/hub/eval-results)。
https://huggingface.co/datasets/llamaindex/ParseBench#data-display 数据展示
https://huggingface.co/datasets/llamaindex/ParseBench#charts 图表
https://huggingface.co/datasets/llamaindex/ParseBench#tables 表格
[](https://huggingface.co/datasets/llamaindex/ParseBench/blob/main/docs/table
相似文章
Infinity-Parser2 技术报告
Infinity-Parser2 技术报告介绍了一个用于端到端文档解析的大型多模态模型,该模型具有可扩展的数据合成流水线及多任务强化学习能力。它在多项基准测试中取得了领先结果,同步发布了开源模型变体及一个包含500万样本的双语语料库。
@FinanceYF5: 阅读文章:https://openrouter.ai/blog/insights/the-open-weight-models-that-matter-june-2026/…
这篇文章强调了截至2026年6月开放权重AI模型日益增长的重要性,DeepSeek V4 Flash作为一种高性价比、高性能模型出现,在代理任务上与GPT-5.5等前沿模型相媲美。
@jerryjliu0: LiteParse 是为 AI 智能体设计的最佳开源、无模型文档解析器。支持解析 50 多种文档类型,并…
LlamaIndex 发布了 liteparse-server,这是一个可自托管、无模型的 HTTP API,能够以高空间保真度和隐私保护能力解析多种多样的文档类型。
@jerryjliu0:目前有很多针对AI智能体的编码和推理基准测试,但在文档理解方面却很少——而这正是所有下游知识工作的前提。
LlamaIndex发布了ParseBench,这是一个用于评估AI智能体文档理解能力的全面基准测试,涵盖包含表格、图表和布局的复杂企业文档。将举办一场在线研讨会,讨论该基准测试的方法和结果。
@mr_r0b0t: 开放权重的大好一周!inclusionAI刚刚发布了LLaDA2.2-flash100B MoE扩散LLM,专为代理打造,莱文斯坦编辑(Levenshtein E…
inclusionAI发布了LLaDA2.2-flash,一个面向代理的100B MoE扩散LLM,具有莱文斯坦编辑(Levenshtein Editing)、128K上下文和高达2.3倍的吞吐量提升,在τ²-Bench和PinchBench等代理基准测试中取得了优异成绩,采用Apache 2.0许可证。