@jerryjliu0:ParseBench 是首个在完整企业文档中评测 VLM 图表理解能力的基准

X AI KOLs Timeline 论文

摘要

ParseBench 首次把图表理解放进整份企业文档中评测视觉-语言模型,填补了以往仅针对孤立图表的基准空白。

ParseBench 是首个在完整企业文档中评测 VLM 图表理解能力的基准。以往的基准(ChartQA、ChartXiv)仅针对图表本身,而未考虑图表在整份文档中的上下文,也不包含真实业务场景中的引用。
查看原文
查看缓存全文

缓存时间: 2026/04/22 08:23

ParseBench 是首个包含 VLM 对企业文档中图表理解能力的基准。现有基准(ChartQA、ChartXiv)仅针对图表本身进行测试,并未考察图表在整个文档中的上下文理解,也不包含真实场景引用。

相似文章

ExtractBench:面向模式引导的企业文档抽取基准

Hugging Face Daily Papers

ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。

ChartArena:跨语言、场景和格式的图表解析基准测试

Hugging Face Daily Papers

ChartArena是一个全面的双语图表解析基准,覆盖八个图表系列和三种视觉场景(数字、打印、手绘),使用人机协同标注流程和格式无关评估。对26个多模态大语言模型的评估显示,虽然专有模型整体领先,但开源模型正在追赶,而图示结构和手绘场景仍具挑战性。