Sci-MMR:多模态代理中多步骤证据科学推理的基准测试
摘要
Sci-MMR 是一个用于评估多模态代理中多步骤证据基础科学推理的基准,揭示了答案准确率超过证据恢复率超过20%的差距。
arXiv:2609.11243v1 公告类型:新
摘要:自主研究代理日益被期望能够搜索文献、分析实验证据并生成科学假设。这些能力需要多步骤基于证据的推理,即在得出结论之前逐步获取、整合和验证证据。然而,现有的多模态基准主要评估最终答案的准确性,而未解决预测是否实际由可追溯的科学证据支持的问题。我们引入Sci-MMR,这是一个基于结构化论证图谱构建的多步骤基于证据科学推理的基准,该图谱将科学主张、引用基础的知识、视觉证据和支持区域连接起来。Sci-MMR包含235个跨四个科学学科的多跳推理任务,每个任务平均有九个图表面板。评估八个前沿多模态模型后,我们发现答案准确率始终比完整证据恢复率高出20%以上,揭示了仅评估答案的结构性方法无法捕捉的重大差距。通过受控干预,我们识别出两个基本瓶颈。首先,证据获取:模型难以从科学图表中提取完整的结构化证据,占失败的57.2%。虽然裁剪工具有适度提升(+4.5分),但提供黄金证据可将准确率提高多达37.0分,表明组装完整的多区域证据存在困难。其次,证据整合:模型难以将可用证据转化为正确结论,占失败的31.8%,即使有黄金证据,最强模型在最难任务上的准确率仅为69.1%。这些发现表明,当前以答案为中心的基准大大高估了多模态研究代理的基于证据推理能力。
查看缓存全文
缓存时间: 2026/09/12 08:25
# Sci-MMMR:评估多模态智能体在多步证据科学推理中的基准测试 来源:https://arxiv.org/html/2609.11243 杨雅洁\*,席志恒\*,陈家栋,周恩宇,金森杰,杨楠,张佳政,王涵,李彦鑫,朱丁威,邓必成,王宇辉,郑翔,张雷,白磊,马行军,桂韬 复旦大学自然语言处理组 ###### 摘要 自主研究智能体越来越被期望能够搜索文献、分析实验证据并生成科学假设。这些能力需要多步证据推理,即在得出结论之前逐步获取、整合和验证证据。然而,现有的多模态基准测试主要评估最终答案的准确性,尚未解决预测是否真正得到可追溯科学证据支持的问题。我们引入Sci-MMMR,一个基于结构化论证图构建的多步证据科学推理基准,该图连接了科学主张、基于引用的知识、视觉证据和支持区域。Sci-MMMR包含235个多跳推理任务,涵盖四个科学学科,每个任务平均包含九个图表子图。在评估八种前沿多模态模型后,我们发现答案准确率始终比完整证据恢复率高出20%以上,揭示了仅评估答案的评估方式在结构上无法捕捉的重大差距。通过控制干预,我们确定了两个基本瓶颈。首先,证据获取:模型难以从科学图表中提取完整的结构化证据,这占失败原因的57.2%。虽然裁剪工具带来适度提升(+4.5分),但提供标准答案证据可将准确率提高高达37.0分,表明组装完整多区域证据存在困难。其次,证据整合:模型难以将可用证据转化为正确结论,这占失败原因的31.8%,即使有标准答案证据,最强模型在最难任务上的准确率也仅为69.1%。这些发现表明,当前以答案为中心的基准测试大大高估了多模态研究智能体基于证据的推理能力。 ## 1 引言 科学推理很少依赖孤立的事实。相反,研究人员在得出科学结论之前,会逐步从文本描述、视觉观察和实验结果中获取、整合和验证证据[Pramanick等人,2024 (https://arxiv.org/html/2609.11243#bib.bib5),Li等人,2024 (https://arxiv.org/html/2609.11243#bib.bib4)]。随着自主研究智能体在文献分析、实验解释和假设生成方面的能力日益增强[Lu等人,2024 (https://arxiv.org/html/2609.11243#bib.bib1),Schmidgall等人,2025 (https://arxiv.org/html/2609.11243#bib.bib2),Gottweis等人,2025 (https://arxiv.org/html/2609.11243#bib.bib3)],多步证据推理成为一项基本能力。与传统的多模态问答不同,这些智能体必须主动获取分布在图表、实验和先前科学知识中的证据,然后才能综合出可靠的结论。然而,现有的多模态评估主要衡量最终答案的正确性[Pramanick等人,2024 (https://arxiv.org/html/2609.11243#bib.bib5),Wang等人,2025 (https://arxiv.org/html/2609.11243#bib.bib6),Zhao等人,2026 (https://arxiv.org/html/2609.11243#bib.bib9)],留下了一个未解决的问题:模型是否真的能够获取和组织证明其预测所需的证据。为解决这一差距,我们引入Sci-MMMR,一个评估多模态智能体多步证据科学推理能力的基准。Sci-MMMR基于同行评审的科学出版物构建,将每个任务表示为一个结构化论证图,连接科学主张、基于引用的知识、视觉证据和支撑图像区域,从而实现对证据获取和证据整合的细粒度评估(图1 (https://arxiv.org/html/2609.11243#S1.F1))。该基准包含235个多跳推理任务,涵盖四个科学学科和35个领域,每个任务需要跨越平均九个图表子图(而非单个图表或表格)来聚合证据。在四种推理设置下评估八种前沿多模态模型——仅描述、直接视觉推理、证据提示推理和智能体工具使用——揭示了答案准确率与证据覆盖率之间的持续差距:模型经常得出正确结论,但只恢复了部分支持证据。通过控制干预,我们确定了两个基本瓶颈。第一个是证据获取。模型通常能识别相关的视觉区域,但未能组装分布在多个图表中的完整证据。在直接视觉推理设置下,证据访问和定位占错误的57.2%。在62.1%的运行中,模型至少定位到一个相关区域,但只有12.7%的运行恢复了完整证据集,这表明挑战不在于找到任何相关区域,而在于组装多子图任务所需的完整集合。为模型配备视觉裁剪工具可将准确率提高4.5分,证实了主动定位确实有帮助,尽管其收益与直接提供标准答案证据语句带来的19.1-37.0%的提升相比仍然有限——这表明大部分剩余困难在于实现完整的多区域定位,而非在找到区域后提取证据。参见标题图1:Sci-MMMR任务示例。一个需要跨多个图表子图获取证据、中间主张推理、知识检索和前提审查的科学推理任务,旨在协调实验动力学与计算能量景观。 第二个瓶颈是证据整合。模型难以将可用证据转化为正确结论,这占失败原因的31.8%,即使有标准答案证据,最强模型在最难任务上的准确率也仅为69.1%。这些发现表明,即使所需证据完全可用,基于证据的推理仍然是一个超越证据获取的独特挑战。我们的主要贡献总结如下: - •我们引入Sci-MMMR,这是首个用于多步证据科学推理的基准。它基于同行评审的出版物构建,包含235个多跳推理任务,涵盖四个科学学科和35个领域,基于连接科学主张、基于引用的知识、视觉证据和支撑图像区域的结构化论证图。 - •我们开发了一个四设置评估协议,用于分离证据获取、证据整合和最终答案推理中的失败,从而实现多模态科学推理的细粒度诊断。 - •我们对8种前沿多模态模型的分析揭示了两个基本瓶颈:1)它们难以将复杂的科学图表转化为完整的结构化证据;2)即使提供了标准答案证据,证据整合仍然具有挑战性,表明基于证据的推理远远超出了视觉感知的范畴。 ## 2 相关工作 ##### 合成多跳推理任务。现有的科学多模态基准评估图表问答、主张验证和论文级理解,但通常将推理视为恢复最终答案,而非重构支持科学主张的证据[Pramanick等人,2024 (https://arxiv.org/html/2609.11243#bib.bib5),Wang等人,2025 (https://arxiv.org/html/2609.11243#bib.bib6),Ansari等人,2026 (https://arxiv.org/html/2609.11243#bib.bib7),Zhao等人,2026 (https://arxiv.org/html/2609.11243#bib.bib9)]。现有的多跳任务构建方法在单个图像内组合推理步骤[Wang等人,2026 (https://arxiv.org/html/2609.11243#bib.bib11),Tran等人,2025 (https://arxiv.org/html/2609.11243#bib.bib14)],从知识或内容图中采样路径[Ning等人,2026 (https://arxiv.org/html/2609.11243#bib.bib12),Du等人,2026 (https://arxiv.org/html/2609.11243#bib.bib13),Sung等人,2026 (https://arxiv.org/html/2609.11243#bib.bib15)],或通过图扩展和信息混淆合成检索轨迹[Li等人,2025 (https://arxiv.org/html/2609.11243#bib.bib16)]。相比之下,Sci-MMMR直接从同行评审论文中重构证据依赖关系,将每个推理步骤锚定在有引用支持的证据和视觉区域上。 ##### 超越以答案为中心的评估。最近的工作已经超越了仅评估答案的方式,开始评估中间推理和智能体行为。PhysicsArena[Dai等人,2025 (https://arxiv.org/html/2609.11243#bib.bib10)]评估变量识别、过程表述和解决方案推导,而VDR-Bench[Zeng等人,2026 (https://arxiv.org/html/2609.11243#bib.bib8)]在评估答案正确性的同时衡量中间实体的恢复。研究智能体基准进一步引入了专家编写的评分标准、过程-报告一致性、能力感知评估器、任务特定判断和多模态证据保真度检查[Sharma等人,2025 (https://arxiv.org/html/2609.11243#bib.bib17),Ye等人,2026 (https://arxiv.org/html/2609.11243#bib.bib18),Ben-Avraham等人,2026 (https://arxiv.org/html/2609.11243#bib.bib19),Ai等人,2026 (https://arxiv.org/html/2609.11243#bib.bib20),Huang等人,2026 (https://arxiv.org/html/2609.11243#bib.bib21)]。这些方法揭示了最终答案准确性之外的中间失败,但并未评估模型是否获取了支持科学结论的完整证据。Sci-MMMR则通过评估证据覆盖率和证据到主张的推理作为互补信号,将证据获取与证据整合分离开来。表1:与现有基准的比较。学科数量(-表示开放域覆盖)。图像和跳数表示每个任务的平均值。智能体:基于智能体的执行;过程:过程级评估。参见标题图2:Sci-MMMR概览。科学论文基于视觉证据,并表示为分层的论证图。采样的论证子图驱动任务生成和质量控制,生成235个任务,涵盖四个学科和35个领域,每个任务平均包含9个图表子图。模型响应通过答案准确率、证据覆盖率和主张覆盖率进行评估。 ## 3 Sci-MMMR与评估 科学推理本质上是证据驱动的:结论是通过整合分布在文本、图表和先前知识中的多个证据项来确立的。然而,现有的科学多模态基准主要评估最终答案,而没有明确建模支撑科学主张的证据依赖关系。即使具有多跳推理的基准,通常也是通过图采样或检索扩展来合成构建推理路径,而不是重构原始论文中呈现的论证。Sci-MMMR通过直接从同行评审的科学出版物中重构证据依赖关系来解决这一限制。每个任务被表示为一个论证图,连接科学主张、证据语句、基于引用的知识和支撑的视觉区域。这种表示实现了对证据获取(模型是否检索到所需证据)和证据整合(是否正确地将获取的证据连接到目标科学主张)的细粒度评估。 ### 3.1 论证图表述 科学论证本质上是分层的:视觉证据支持观察,这些观察递归地组合成越来越抽象的科学主张[Teufel等人,1999 (https://arxiv.org/html/2609.11243#bib.bib31),Lauscher等人,2018 (https://arxiv.org/html/2609.11243#bib.bib32),Moser和Mercer,2020 (https://arxiv.org/html/2609.11243#bib.bib33)]。我们将这种结构表示为一个论证图,一个有向无环图:G=(V,E),其中节点V表示不同抽象级别的信息,边E编码支持关系。 ##### 节点。节点集被划分为四个不相交的类型:V=Vv∪Ve∪Vk∪Vc。 - •Vv(视觉源节点):表示包含实验信息的图表子图、表格和其他视觉元素。 - •Ve(证据节点):表示基于视觉源的证据,并将科学语句链接到其支撑的视觉元素。 - •Vk(知识节点):表示基于论文引用参考文献的外部科学知识、方法论定义或先前发现。 - •Vc(主张节点):表示分层的科学主张,从由证据支持的中间结论到最终的科学结论。 ##### 边。每条边(u,v)∈E表示节点u直接支持节点v。支持关系限制为: E⊆(Vv×Ve)∪(Ve×Vc)∪(Vk×Vc)∪(Vc×Vc), 其中Vv×Ve将证据锚定在视觉区域上,Ve×Vc将证据链接到主张,Vk×Vc捕获对基于引用的科学知识的依赖,Vc×Vc将低级主张组合成高级主张。由于G是一个有环,每个主张都由一个终止于任务结论的、由证据和中间主张组成的非循环链所支持。 ##### 根节点和任务结构。每个图有一个唯一的根主张c*∈Vc,对应于任务的最终科学结论。解决任务需要恢复相关的证据和知识节点,并通过论证图将它们整合以推断c*。我们用跳数Hop=|E|(图深度,定义为终止于c*的最长有向路径)和子图计数|Vv|(不同视觉源的数量)来表征每个任务。 ### 3.2 基准构建与组成 我们采用一种人在环路中的流程,其中自动化工具执行可扩展的提取和图构建,而领域专家仅在需要科学判断时介入:证据标注和最终验证。 ##### 图构建。我们从包括Nature、Science、Cell和PNAS在内的顶级会议收集了2020年至2026年发表的800篇论文;最终基准主要由2026年的论文组成(附录A.1)。对于每篇论文,MinerU[Wang等人,2024 (https://arxiv.org/html/2609.11243#bib.bib37)]提取图表、表格和标题。一个LLM构建一个初始论证图,连接视觉源、证据、科学知识和主张,并在需要时从论文的引用参考文献中检索科学知识。然后,领域专家将每个证据节点定位到其支撑的视觉区域,将其重写为保守的、直接可观察的语句,并验证完整的论证图。 ##### 任务生成。从每个经过验证的论证图中,我们采样一个足以推导出目标主张的论证子图。采样的图指定了所需的观察结果、中间主张和科学知识,然后LLM生成一个自然的、不泄露目标结论的多跳问题。
相似文章
SMMBench:面向源分布的多模态智能体记忆基准测试
提出SMMBench,一个用于评估多模态智能体从独立来源(如对话、表格和文档)中检索、对齐和组合分散证据能力的基准。实验表明,当前系统在此类源分布记忆组合任务上仍存在困难。
SciR:用于LLMs科学推理的可控基准
SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。
M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准
本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。
RRM:经验驱动的反思性检索记忆用于长时程多模态推理
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。
多视角证据合成与推理的无监督多模态实体链接
MSR-MEL 提出一种无监督框架,利用大语言模型对多视角证据进行合成与推理,实现多模态实体链接,在标准基准上全面超越既有方法。