ICDAR 2026 原子层沉积/刻蚀(ALD/E)科学图表信息提取竞赛
摘要
本文介绍了ICDAR 2026原子层沉积/刻蚀(ALD/E)科学图表信息提取竞赛,提出了包含四个互补任务的Sci-ImageMiner基准数据集。结果表明,最先进的多模态模型在分类和摘要任务上表现良好,但在数据提取和科学推理方面存在困难,尤其是在视觉问答任务中。
查看缓存全文
缓存时间: 2026/08/04 13:39
论文页面 - ICDAR 2026 原子层沉积/刻蚀(ALD/E)科学图表信息抽取竞赛
Source: https://huggingface.co/papers/2607.26848
摘要
基于多模态AI的科学图表理解与推理,需要将视觉感知与领域特定推理相结合,以提取有意义的知识,而这些知识往往不会出现在研究论文的正文中。Sci-ImageMiner基准数据集及其附带的社区驱动竞赛,通过策划一个包含四项端到端互补任务的全面、专家标注数据集,提升了此前科学竞赛的标准。该竞赛从2026年1月9日到2026年4月8日,吸引了68名活跃参与者和1,263次公共/私有提交。我们的结果表明,最先进的多模态模型在分类和摘要任务上表现良好,但在数据提取和科学推理方面存在困难,尤其是在视觉问答中。这些发现揭示了关键局限,并凸显了改进领域感知多模态AI系统的挑战与机遇。总体而言,Sci-ImageMiner基准和竞赛为推进科学图表理解与推理研究建立了一个严谨的平台,并展示了最先进方法在该挑战性复杂研究领域的潜力。
查看arXiv页面 (https://arxiv.org/abs/2607.26848)查看PDF (https://arxiv.org/pdf/2607.26848)项目页面 (https://huggingface.co/datasets/SciKnowOrg/ALD-E-ImageMiner)GitHub4 (https://github.com/sciknoworg/ALD-E-ImageMiner)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26848)
在你的Agent中获取此论文:
hf papers read 2607\.26848
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2607.26848,即可从本页面链接到该模型。
引用此论文的数据集2
SciKnowOrg/Sci-ImageMiner 查看器• 约3小时前更新 • 1.95k (https://huggingface.co/datasets/SciKnowOrg/Sci-ImageMiner)
SciKnowOrg/ALD-E-ImageMiner 查看器• 29分钟前更新 • 1.95k • 1 (https://huggingface.co/datasets/SciKnowOrg/ALD-E-ImageMiner)
引用此论文的Spaces0
没有Space关联此论文
在Space的README.md中引用arxiv.org/abs/2607.26848,即可从本页面链接到该Space。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接到它。
相似文章
通往通用科学人工智能之路:科学图像的多模态理解
本文介绍了用于科学图像多模态理解的ALD/E-ImageMiner基准,并基于ICDAR 2026竞赛的见解,讨论了通用科学人工智能的未来研究方向。
AI能绘制科学图吗?一个用于评估文本到图像和多模态模型生成科学图形的基准
介绍了SciDraw-Bench,一个用于评估文本到图像和多模态模型生成科学图形的基准,采用四维评估协议。结果显示,领域专用系统优于通用模型,文本保真度仍然是最具挑战性的方面。
ICDAR2026多领域文档多模态推理竞赛
ICDAR2026竞赛展示了来自8支团队的结果,重点介绍了使用结构化证据提取和多组件协调来处理跨多种文档领域的VQA任务的先进系统。
针对SeePhys Pro的多智能体辩论与视觉信息提取:来自ICML 2026 AI4Math Track 3挑战赛的第一名技术报告
本技术报告介绍了ICML 2026 AI4Math Workshop中SeePhys Pro挑战赛的第一名解决方案,该方案采用两阶段框架,结合视觉信息提取和多智能体辩论,从图像中回答大学物理问题。
IOL-AI 挑战赛:迈向语言推理进步的开放挑战
IOL-AI 挑战赛是一项开源科学竞赛,利用国际语言学奥林匹克竞赛2026年的未公开题目来评估AI模型的语言推理能力,结果表明性能更依赖于解码和输出处理而非模型规模。