Science Edge Evaluation:SEE——迈向真正科学发现所缺失的一步

arXiv cs.AI 论文

摘要

本文介绍了SEE,一个由专家策划的、面向化学、生物学和材料科学科学发现的多模态基准。对19个多模态大语言模型(MLLMs)的评估显示,最佳模型的准确率仅达到48.7%,即使使用工具也只有52.7%,这表明当前模型缺乏可靠的、受证据约束的科学推理能力。

arXiv:2608.06931v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地参与科学发现,但目前尚不清楚它们能否支持复杂的真实实验室科学。在此,我们引入了科学边缘评估(Science Edge Evaluation,SEE),这是一个多模态基准,包含基于同行评审文献以及化学、生物学和材料科学实验实践的专家策划问题。对19个多模态大型语言模型(MLLMs)的评估显示,即使表现最佳的模型,准确率也仅达到48.7%。此外,通用模型在平均表现上优于科学专用模型。在视觉智能体评估中,使用工具将最高准确率提升至52.7%。工具使用可以扩展模型可用的信息,但更多信息并不一定能带来可靠的科学推理。关键挑战在于,模型能否在原始实验证据的边界内管理来自工具的信息。总之,这些发现表明,当前的多模态大型语言模型仍无法可靠地从实验结果中做出有根据且受证据约束的推断,而这正是真实科学发现中不可或缺的能力。弥合这一差距,需要多模态大型语言模型从解释已有科学概念,转向从实验数据中提炼新颖且基于证据的见解。
查看原文
查看缓存全文

缓存时间: 2026/08/10 07:59

# 1 引言 来源:https://arxiv.org/html/2608.06931 ![[未命名图片]](https://arxiv.org/html/2608.06931v1/x1.png)![[未命名图片]](https://arxiv.org/html/2608.06931v1/figures/alibaba_data_logo.jpg)![[未命名图片]](https://arxiv.org/html/2608.06931v1/figures/skylenage.jpg) 科学边缘评估:SEE——迈向真实科学发现所缺失的一步 Taolin Han1,3\*, Yuchen Zhang1,4\*, Jinghang Wang1\*, Yun Wu1, Wai Yuet Chiu1, Zhaohai Li2, Yifei Zhang1,5, Jinxin Wang1,4, Yuhao Zhou1,6, Chen Zhao1,4, Jiajia Li1, Jiaxin Li1, Qile Jin1, Kewei Sun1, Shuang Wu1, Weiqi Zhai1, Renquan Lv1,6, Junchao Li1, Ruodan Chen1, Qingteng Chen1, Zhibo Yang2, Hu Wei1, Lin Qu1, Shuai Bai2,†, Bing Zhao1,† 1阿里巴巴集团,2Qwen团队,阿里巴巴集团,3中国科学院大学,4清华大学,5阿尔伯塔大学,6浙江大学 \*同等贡献,†通讯作者 wangjinghang\.wjh@alibaba\-inc\.com (https://arxiv.org/html/2608.06931v1/mailto:[email protected]) [![[未命名图片]](https://arxiv.org/html/2608.06931v1/x2.png)代码](https://github.com/SKYLENAGE-AI/science-edge-evaluation) 摘要大型语言模型 \(LLMs\) 越来越多地参与到科学发现中,但它们能否支持复杂的真实实验室科学仍不清楚。在此,我们引入了**科学边缘评估**(Science Edge Evaluation, SEE),这是一个多模态基准测试,由专家精心挑选的问题构成,问题基于同行评审文献以及化学、生物学和材料科学中的实验实践。对19个多模态大型语言模型 \(MLLMs\) 的评估显示,即使表现最好的模型也仅达到48.7%的准确率。此外,通用模型平均表现优于科学专用模型。在视觉智能体评估中,工具的使用将最佳准确率提升至52.7%。工具使用可以扩展模型可获取的信息,但更多信息并不一定带来可靠的科学推理。关键挑战在于模型能否在原始实验证据的边界内管理工具获取的信息。总之,这些发现揭示了当前MLLMs仍无法可靠地从实验结果中做出有依据且受证据约束的推断,而这正是真实科学发现中的一项基本能力。弥合这一差距要求MLLMs从解释已确立的科学概念转向从实验数据中得出新颖且基于证据的见解。 大型语言模型 \(LLMs\) 正通过加速科学发现过程中的若干主要阶段——包括文献筛选、计算模拟、代码合成以及最近的自主实验——来改变科学发现的方式。随着这些模型能力不断增强并被广泛采用,它们开始塑造跨学科科学知识的产生、评估和应用方式。这一新兴角色使LLMs不仅作为信息检索或文本生成的工具,而且成为更广泛研究工作流程中的积极参与者。 当前的评估范式往往优先考虑广度而非深度,并严重依赖经过净化的、考试式的问题,这类问题奖励模式匹配和记忆。这种设置无法捕捉真实科学发现中动态、多阶段且由证据驱动的本质。因此,它们只能提供一个有限的视角来判断模型能否支持现实的研究工作流程。因此,基于真实科学任务的基准测试对于衡量真实分析能力、同时降低标准教育数据污染风险至关重要。 多模态同样不可或缺。真实的科学推理很少仅依赖文本。相反,它产生于对图形、光谱、显微镜图像、表格、数值测量和书面语境的联合解读。如果不对视觉、数值和文本证据的这种融合进行评估,基准测试得分便无法反映实验室科学的实际需求。因此,一个具有科学意义的基准测试必须评估模型是否能从异质证据中推理,而不仅仅是依赖语言先验。 科学基准测试还必须随着自然科学本身的发展而演变。从历史上看,物理、化学、生物学和医学等学科常常被视为独立领域。然而,在现代研究中,关键问题越来越多地出现在这些学科的交叉点上,在那里概念、方法和数据类型紧密交织。因此,仅在孤立学科内评估模型,会遗漏真实科学推理的一个核心要求,即跨领域整合知识的能力。跨学科问题对于揭示模型知识边界处的脆弱推理、幻觉触发点和迁移失败也至关重要。 综合来看,这些考量揭示了当前科学评估中的一个核心空白。现有基准测试通常测试模型是否知道科学事实或解决简化问题,而真实的实验室科学要求模型从不完整、异质且跨学科的实验证据中进行推理。随着LLMs进入科学工作流程和智能体研究系统,这一区别变得越来越重要。因此,科学评估应超越知识回忆,转向基于证据的、多模态的、跨学科的以及具有不确定性意识的推理。 为填补这一空白,我们引入了**科学边缘评估**(SEE),这是一个基于化学、生物学和材料科学中真实科学任务构建的多模态基准测试。我们的评估表明,当前MLLMs在现实实验环境中仍然不可靠,其局限性不能仅用知识获取来解释。相反,SEE揭示了基于证据的科学推理中的一个根本性缺陷。我们通过工具增强的视觉智能体分析进一步表明,工具访问可以扩展证据获取,但并不能消除在整个交互轨迹中对可靠证据管理的需求。当前模型难以在保持对现有证据严格遵循的同时“看清”跨学科的多模态观察结果。从这个意义上说,SEE不仅评估模型是否了解科学内容,还评估它们能否从多模态实验数据中得出有依据且受证据约束的见解。 ## 2 相关工作 #### 通用学术基准 学术基准对于评估LLM和MLLM能力至关重要。诸如MMLU[17 (https://arxiv.org/html/2608.06931#bib.bib10)]、MMLU-Pro[55 (https://arxiv.org/html/2608.06931#bib.bib11)]和GPQA[42 (https://arxiv.org/html/2608.06931#bib.bib12)]等通用学术基准以不同难度水平评估模型在广泛学术领域的表现。所测试的能力包括通用学术推理、科学问答、数学推理和代码生成。诸如CMMLU[23 (https://arxiv.org/html/2608.06931#bib.bib16)]等区域特定扩展进一步拓宽了评估范围。为了在专家级推理前沿挑战模型,诸如HLE[39 (https://arxiv.org/html/2608.06931#bib.bib13)]等基准测试被专门设计用于纳入难度极高的封闭式问题。 #### 多模态基准 诸如ScienceQA[29 (https://arxiv.org/html/2608.06931#bib.bib17)]和MMMU[59 (https://arxiv.org/html/2608.06931#bib.bib18)]等多模态基准代表着有意义的进展,它们通过纳入覆盖科学和学术科目的视觉输入,将评估扩展到纯文本范式之外,而MMMU-Pro[60 (https://arxiv.org/html/2608.06931#bib.bib72)]进一步移除了可仅凭文本解答的问题,以强制进行真正的多模态推理。其他补充工作包括MM-Vet[58 (https://arxiv.org/html/2608.06931#bib.bib14)]、MathVista[28 (https://arxiv.org/html/2608.06931#bib.bib15)]和SciFIBench[43 (https://arxiv.org/html/2608.06931#bib.bib54)],分别针对集成多模态能力、视觉情境中的数学推理和科学图形解读。诸如OlympiadBench[16 (https://arxiv.org/html/2608.06931#bib.bib73)]、面向中文的MMSciBench[56 (https://arxiv.org/html/2608.06931#bib.bib74)]、多语言的MME-SCI[44 (https://arxiv.org/html/2608.06931#bib.bib75)]以及基于化学奥林匹克竞赛构建的USNCO[10 (https://arxiv.org/html/2608.06931#bib.bib78)]等奥林匹克和竞赛级基准,通过双语或多语言的多模态科学问题进一步提升了难度。虽然当前基准根植于通用学术和考试式情境,但它们未能捕捉真实科学探究中必不可少的实验数据和工作流驱动的推理。 #### 科学基准 一些最近的基准测试旨在更专门的科学环境中评估模型,包括化学、生物学和材料科学。这些工作侧重于领域特定推理而非广泛学术知识,例如ChemBench[33 (https://arxiv.org/html/2608.06931#bib.bib20)]、SciBench[54 (https://arxiv.org/html/2608.06931#bib.bib21)]、SciEval[49 (https://arxiv.org/html/2608.06931#bib.bib53)]和LAB-Bench[21 (https://arxiv.org/html/2608.06931#bib.bib22)]。其中少数纳入了图形、分子结构、光谱和表格等多模态输入,以及实验结果。例如,MaCBench[1 (https://arxiv.org/html/2608.06931#bib.bib19)]是一个面向化学和材料科学的多模态基准测试,更接近真实研究场景,而Matbench[11 (https://arxiv.org/html/2608.06931#bib.bib49)]则针对材料属性预测。最近的工作进一步探测了模态特定的局限性,例如ChemVTS-Bench[18 (https://arxiv.org/html/2608.06931#bib.bib77)]解构了视觉、文本和符号化学推理。现有科学基准缺乏评估MLLMs应对真实科学研究中复杂跨学科挑战所需的学科广度、实验真实性和诊断深度。 #### 科学LLMs与智能体 科学LLMs通过持续预训练、指令微调以及在科学语料上的领域适应而得到发展。代表性示例包括通用的科学和生物医学模型,如Galactica[51 (https://arxiv.org/html/2608.06931#bib.bib23)]、BioGPT[30 (https://arxiv.org/html/2608.06931#bib.bib24)]、BioMedLM[5 (https://arxiv.org/html/2608.06931#bib.bib25)]、GatorTronGPT[38 (https://arxiv.org/html/2608.06931#bib.bib26)]、Med-PaLM[47 (https://arxiv.org/html/2608.06931#bib.bib27)]和Meditron[9 (https://arxiv.org/html/2608.06931#bib.bib28)];面向化学、分子和材料领域的模型或指令资源,如ChemLLM[61 (https://arxiv.org/html/2608.06931#bib.bib55)]、ChemDFM[62 (https://arxiv.org/html/2608.06931#bib.bib56)]、Mol-Instructions[12 (https://arxiv.org/html/2608.06931#bib.bib57)]、LlaSMol[57 (https://arxiv.org/html/2608.06931#bib.bib60)]、HoneyBee[48 (https://arxiv.org/html/2608.06931#bib.bib58)]和MatterChat[50 (https://arxiv.org/html/2608.06931#bib.bib59)];以及多模态生物医学或科学模型,如LLaVA-Med[22 (https://arxiv.org/html/2608.06931#bib.bib29)]、Med-PaLM M[52 (https://arxiv.org/html/2608.06931#bib.bib30)]、BioMedGPT[31 (https://arxiv.org/html/2608.06931#bib.bib31)]、S1-VL[24 (https://arxiv.org/html/2608.06931#bib.bib96)]、Intern-S2 Preview[20 (https://arxiv.org/html/2608.06931#bib.bib98)]、Intern-S2 Preview-397B[19 (https://arxiv.org/html/2608.06931#bib.bib99)]和Intern-S1 Pro[46 (https://arxiv.org/html/2608.06931#bib.bib97)]。最近的科学智能体进一步将LLMs从静态问答扩展到工具增强和工作流级别的科学辅助,包括ChemCrow[6 (https://arxiv.org/html/2608.06931#bib.bib32)]、Coscientist[4 (https://arxiv.org/html/2608.06931#bib.bib33)]、The AI Scientist[27 (https://arxiv.org/html/2608.06931#bib.bib70)]、Agent Laboratory[45 (https://arxiv.org/html/2608.06931#bib.bib34)]和Co-Scientist[15 (https://arxiv.org/html/2608.06931#bib.bib35)]。虽然这些工作展示了LLMs在科学工作流程中日益增长的作用,但现有评估往往侧重于知识回忆、领域特定任务表现、工具使用成功或最终答案准确性。相比之下,SEE评估MLLMs能否将结论建立在多模态实验证据之上,能否跨学科整合概念,并在可用证据的边界内进行推理。 ## 3 方法 我们通过分阶段的构建和验证工作流来组织SEE,从真实世界数据来源和专家问题设计,到AI辅助质量控制、专家审查,再到最终基准验收(图1 (https://arxiv.org/html/2608.06931#S3.F1))。 参照图注图1:SEE的基准构建流程。问题来源于同行评审文献和专家实验场景,经过AI辅助检查进行标准化和校准,由领域专家审查,并且仅在通过科学准确性、信息充分性、答案唯一性和评估就绪性检查后才被接受。在1116个问题中,1049个公开发布;其余67个被保留,因为它们涉及贡献专家未发表的实验数据。 ### 3\.1 数据收集 SEE是一项协作努力。这些问题由活跃的一线专家贡献,这些专家拥有硕士或博士学位,或是化学、生物学、材料科学或相关跨学科领域的博士生。 参照图注图2:SEE由1116个问题组成,涵盖3个学科和17个报告的子领域。跨学科问题由连接两个或多个子领域的线条表示。线条粗细表示跨报告子领域共现问题的数量。灰色线条表示跨学科重叠(跨越两个学科)。 #### 来源 这些问题来自真实的科学研究场景。来源包括同行评审论文中的图形和数据、近期研究文献,以及专家贡献的第一手实验数据。视觉证据涵盖实验室研究中常见的实验数据结构,包括生物活性测量、冷冻电镜结构、Western blot和凝胶电泳图像、红外光谱、核磁共振 \(NMR\) 和质谱 \(MS\) 等光谱数据、SEM、TEM和AFM等显微镜图像、X射线衍射图样以及热分析曲线。 #### 风格 SEE中的问题包括选择题、简答题、数值题、测量题和图像处理任务。有些问题包含明确的选项列表,而另一些则不使用单独的选项字段,通过标准简答或数值答案进行评估。数据集还记录了任务类型的元数据,包括推理、测量和图像处理类别。每个条目包含文本和相关的视觉文件。这些相关图像可能包括随问题呈现的视觉证据以及用于专家验证的图像。因此,报告中的图像数量并非问题本身显示的确切图形数量。每个条目都附有标准答案,以支持自动评估和专家验证。 #### 标注 SEE中的每个问题都带有学科标签,涵盖生物科学、化学和材料科学。所报告的分析使用一个包含17个细粒度标签的最终分类体系,覆盖全部1116个问题。该标注方案清晰地捕捉了跨学科问题。详细的标注方法和标签

相似文章

SciR:用于LLMs科学推理的可控基准

arXiv cs.AI

SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。

COMPOSITE-STEM

arXiv cs.CL

COMPOSITE-STEM 引入了一个包含70项专家策划的智能体任务的基准测试,涵盖物理、生物、化学和数学领域,旨在评估AI智能体在超越饱和基准测试的科学工作流中的表现。性能最佳的模型(Claude Opus 4.6)仅达到21.4%的准确率,表明科学推理能力存在显著差距。

SEAM: Global consistency beyond local accuracy in scientific machine learning

arXiv cs.LG

SEAM is a generator-agnostic framework that audits global consistency of explanations in scientific machine learning, detecting incompatible local explanations even when predictions are locally accurate and attributing failures to specific channels and overlaps. The paper presents theory and experiments across PDE systems, neural operators, and four open datasets.

SciPaths:预测科学发现的路径

arXiv cs.CL

介绍了SciPaths,这是一个用于预测实现目标科学发现所需的关键贡献的基准,并评估了前沿和开放权重语言模型,发现从贡献反向推理到关键构建块的能力仍有显著提升空间。