AI赋能的科学前沿

arXiv cs.AI 论文

摘要

本文评估了人工智能在27个科学领域中与传统统计学和科学计算的性能对比,发现人工智能通常在更高计算成本下优于统计学,但在更低计算成本下日益优于科学计算,从而重塑了科学前沿。

arXiv:2609.16258v1 公告类型:新 摘要:随着人工智能能力的提升,它越来越被视为一种通用科学方法。但这些说法有多真实?人工智能是否优于所有技术,还是只优于某些技术?情况如何变化?为评估这些说法,我们收集了2000年至2025年初发表的论文中,在27个科学领域内人工智能与其他科学分析技术进行的2,507次直接比较的数据集。我们发现一个深刻的二分法。相对于传统统计学,人工智能通常表现更好,但计算成本显著更高。但也有近四分之一的情况,人工智能既更昂贵且性能不如传统统计技术,这一比例在过去十年中保持稳定。相对于科学计算,人工智能通常表现不佳,但计算成本更低。这种情况开始发生变化:自2020年以来,人工智能与科学计算的对比表现显著增强,现在在超过一半的比较中优于科学计算。这些模式表明,人工智能并非现有方法的普遍替代品,而是新的AI赋能科学前沿中一个宝贵且不断改进的部分。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:58

# AI赋能的科学前沿  
来源:https://arxiv.org/html/2609.16258  

**作者**  
Emma Fu  
隶属机构:MIT CSAIL, MIT FutureTech  
*通讯作者。邮箱:neil\_t@mit\.edu  

**Neil Thompson**  

###### 摘要  
随着人工智能能力的不断提升,它日益被视为一种通用科学方法。但这些说法有多真实?AI是超越了所有技术,还是仅超越部分?这种情况又在如何变化?为评估这些主张,我们汇集了2000年至2025年初发表的论文中,AI与其他科学分析技术在27个学科领域的2,507项直接对比研究。我们发现一个深刻的二分现象:与传统统计方法相比,AI通常表现更优,但计算成本显著更高;然而,也有近四分之一的情况下,AI比传统统计技术成本更高且性能更差,且这一比例十年来保持稳定。与科学计算相比,AI常常表现较弱,但计算成本更低。这种情况正在改变:自2020年以来,AI相对于科学计算的表现显著增强,目前在超过半数的对比中占据优势。这些模式表明,AI并非现有方法的普遍替代品,而是AI赋能科学前沿中宝贵且持续进步的组成部分。  

**一句话概括**  
AI正在开辟AI赋能的科学前沿,重塑科学分析格局——其超越传统统计方法的收益常伴随更高的计算成本,而相对于科学计算的进步则日益以更低的成本实现。  

## 引言  
科学的未来将由研究者选择的分析方法,以及他们愿意通过计算获取的性能表现所塑造\[39 (https://arxiv.org/html/2609.16258#bib.bib1)\]\。一种观点认为,AI正发展为通用科学方法,并可能成为科学界主导的分析途径\[5 (https://arxiv.org/html/2609.16258#bib.bib10),37 (https://arxiv.org/html/2609.16258#bib.bib11),42 (https://arxiv.org/html/2609.16258#bib.bib13)\]\。另一种观点则主张,AI应被视为一种“普通”技术,其优势显著但依赖具体场景\[27 (https://arxiv.org/html/2609.16258#bib.bib14),28 (https://arxiv.org/html/2609.16258#bib.bib15),26 (https://arxiv.org/html/2609.16258#bib.bib16)\]\。本文汇集的证据既不支持简单的普适性论断,也不赞同简单的怀疑论,因而更贴近第二种观点。更重要的是,它表明AI正在日益重塑科学前沿本身。  

过去六十年间,科学计算的进步彻底改变了科学家探索自然的方式:快速傅里叶变换将频谱分析速度提升数个数量级\[11 (https://arxiv.org/html/2609.16258#bib.bib17)\];有限元方法变革了连续介质力学\[10 (https://arxiv.org/html/2609.16258#bib.bib18)\];分子动力学模拟实现了原子级分辨率的计算\[31 (https://arxiv.org/html/2609.16258#bib.bib19)\]。如今,许多人期待另一场革命,这次由人工智能驱动。深度神经网络和大型基础模型已在蛋白质结构预测、中期天气预报及更广泛的地球系统预测等任务中,达到或超越传统分析流程的水平,且计算资源需求常大幅降低\[19 (https://arxiv.org/html/2609.16258#bib.bib12),1 (https://arxiv.org/html/2609.16258#bib.bib20),22 (https://arxiv.org/html/2609.16258#bib.bib21),30 (https://arxiv.org/html/2609.16258#bib.bib22),6 (https://arxiv.org/html/2609.16258#bib.bib23),32 (https://arxiv.org/html/2609.16258#bib.bib24)\]\。这些成功激发了广泛主张,认为AI可能成为通用科学方法,而非领域专用工具。  

与此同时,我们需要保持谨慎。在某一科学场景的成功未必能迁移至另一场景;理论与实证研究已揭示“没有免费午餐”定理的限制、分布偏移下的失效、对狭窄基准的过拟合,以及产生虚幻理解的风险\[43 (https://arxiv.org/html/2609.16258#bib.bib25),21 (https://arxiv.org/html/2609.16258#bib.bib26),23 (https://arxiv.org/html/2609.16258#bib.bib27),26 (https://arxiv.org/html/2609.16258#bib.bib16)\]\。前沿模型的训练预算也急剧攀升\[12 (https://arxiv.org/html/2609.16258#bib.bib28),40 (https://arxiv.org/html/2609.16258#bib.bib29)\],表明成本问题也可能限制AI的应用范围。  

具体案例凸显了各学科与AI交互的多样性:气候建模者可能指出神经网络天气系统在远低于运行成本的前提下,性能媲美或超越领先业务基准\[22 (https://arxiv.org/html/2609.16258#bib.bib21),30 (https://arxiv.org/html/2609.16258#bib.bib22),6 (https://arxiv.org/html/2609.16258#bib.bib23)\];而处理表格型生物医学或经济数据的研究者可能发现,深度模型仅能不一致地提升准确率,或需经大量调优与计算投入\[35 (https://arxiv.org/html/2609.16258#bib.bib30),16 (https://arxiv.org/html/2609.16258#bib.bib31),25 (https://arxiv.org/html/2609.16258#bib.bib32),24 (https://arxiv.org/html/2609.16258#bib.bib33)\]。一个值得注意的单一领域先例来自临床预测:一项系统综述发现,神经网络相比逻辑回归并无整体性能优势\[9 (https://arxiv.org/html/2609.16258#bib.bib34)\]。  

近期综述与基准研究已开始描绘特定领域的科学机器学习图景\[38 (https://arxiv.org/html/2609.16258#bib.bib35)\],但缺乏跨领域的实证地图,用以定位AI方法在由传统统计学习和基于物理的科学计算所定义的广义成本-性能景观中的位置。若无此图,研究者易从自身经验过度推广。  

我们的分析聚焦于AI的分析能力,特别是其替代统计分析或科学计算中其他技术的能力。这区别于研究旨在协助或自动化科学家当前任务的AI系统的工作\[20 (https://arxiv.org/html/2609.16258#bib.bib36),7 (https://arxiv.org/html/2609.16258#bib.bib37),36 (https://arxiv.org/html/2609.16258#bib.bib38)\]。这一焦点至关重要,因为分析技术通常同时设定了科学工作的质量上限与计算瓶颈。若AI系统性地改变了这种权衡,它不仅改变科学方法,更将改变科学发现的节奏与范围\[4 (https://arxiv.org/html/2609.16258#bib.bib2),18 (https://arxiv.org/html/2609.16258#bib.bib9)\]。  

因此,富有成效的问题并非AI是否普适优越,而是AI相对于现有替代方案处于何种位置,其性能表现如何,以及随着AI(及其他技术)随时间演进,这种位置与性能如何变化。为回答这些问题,我们构建了包含2,507项直接对比的数据集,均源自2000年至2025年初的研究,每项对比至少报告了两种方法在相同任务和数据集上的预测性能与计算成本。我们根据数据学习方式将方法分为三类:传统统计、科学计算与AI\[8 (https://arxiv.org/html/2609.16258#bib.bib39)\];并依据主导计算方法将27个学科领域划分为七类。此结构使我们能检验AI的有效性是否取决于其替代对象。  

历史上,科学分析由两个方法家族锚定:传统统计通常计算成本低且基线性能稳健;科学计算能对复杂系统提供更高保真度的表征,但计算开销常大幅增加。我们假设AI可通过两种不同方式改变这一格局:以额外计算成本超越传统统计方法,或以更低成本实现(更好或更差的)科学计算结果。图1 (https://arxiv.org/html/2609.16258#Sx1.F1)阐释了此逻辑,并引入了贯穿全文的参考类别结构。  

五项发现组织了讨论,核心观点是AI最佳理解为开辟了科学前沿的新节点,而非仅作为中间折中方案。其次,当AI替代传统统计方法时,典型结果是以更高计算成本换取更高性能;当AI替代科学计算基线时,它提供了一种更低成本选项,有时提升性能,有时则不然。第三,AI应用的影响高度依赖领域。第四,自2020年以来,AI替代其他方法的成功率显著加速。第五,所有科学方法均随时间演进,因此AI在科学前沿的相对位置相较于其他技术正在变化。  

### 各科学领域的分析技术  
AI被视为变革性还是渐进性,强烈取决于其比较对象。若神经网络天气模型与每日消耗数百万核时的业务集合预报系统相比,即使精度仅有小幅提升但运行成本大幅降低,也会显得意义重大。若相似的神经网络架构在小型表格数据集上与经过良好正则化的随机森林进行基准测试,相关问题则变为:性能提升(若有)是否足以证明额外计算负担合理。图2 (https://arxiv.org/html/2609.16258#Sx1.F2)具象化了此参考类别问题。  

在我们的分析中,参考类别基于文献中的对比推断——即若研究将对比分析作为其经验或分析框架的整合部分并加以记录,则将该对比技术视为相关。图2显示,AI的对比基线并非统一。  

在统计方面,AI通常与强大主力方法比较,如支持向量机、随机森林、逻辑回归、决策树和k近邻。在科学计算方面,基线包括随机模拟、地球物理系统模型、偏微分方程求解器、解析解及量子或原子模拟。这些方法常是高保真科学流程的支柱,可能计算需求极高。因此,图2A表明“AI表现更好”的主张可能指向差异极大的替代对象,取决于主导方法家族。这种异质性并非偶然;而是语料库的结构性特征。图2B显示,在地球与空间科学、物理建模科学中,AI在传统统计与科学计算基线上的评估频率几乎相等。相比之下,生命科学、工程学、环境与农业科学及异质性“其他”类别仍以统计对比为主。  

图2因此揭示两个重要事实:第一,AI的基线并不统一——在某些领域主要试图取代传统统计,在另一些领域则直接与成熟的数值求解器竞争。第二,在AI与科学计算对比的领域,基线方法通常是高保真模型而非玩具模拟,这意味着既有巨大的计算节约空间,也有对保真度的高标准要求。  

### AI替代现有方法时会发生什么?  
当研究者采用AI替代现有方法时,性能和成本如何变化?因这些指标以领域特定单位报告(从准确率、每原子能量到库朗数违规、核时),我们采用两种编码方案统一比较。  

第一种编码方案:根据AI是否提升或降低性能与成本,将每次替代归入离散结果类别。双赢(AI同时实现更优性能与更低成本)、性能优先(AI以更高成本提升准确率)、效率优先(AI降低成本但损害性能)、双输(AI比替代基线精度更低且成本更高)。  

总体而言,AI实现双赢与双输结果的比例接近(21.1% vs 19.3%),但常允许性能优先(45.6%),仅有时实现效率优先(13.9%)。当我们将结果按AI对比传统统计或科学计算分解时(如图3所示),模式更为清晰。  

以下语料库中的四个示例阐明这些场景:  
- •双赢:科学计算→AI。Tubiana等人用几何深度学习模型替代结构同源性基线预测蛋白-蛋白结合位点,AUCPR从0.613提升至0.694,同时计算时间从约30天缩短至约1.5小时\[41 (https://arxiv.org/html/2609.16258#bib.bib6)\]。  
- •性能优先:传统统计→AI。Davagdorji等人用神经网络替代k近邻,基于国家健康调查数据预测患者非传染性疾病风险,分类准确率从85.0%提升至95.0%,但执行时间延长约10.5倍\[13 (https://arxiv.org/html/2609.16258#bib.bib3)\]。  
- •效率优先:科学计算→AI。George与Huerta用卷积神经网络替代匹配滤波器流程估计引力波参数,推理时间缩短约10,000倍,但平均相对误差从18%增至22%\[15 (https://arxiv.org/html/2609.16258#bib.bib5)\]。  
- •双输:传统统计→AI。Ebiwonjumi等人用神经网络替代高斯过程回归预测轻水反应堆乏燃料组件衰变热,发现平均绝对误差从4.28升至5.56,且总训练时间增加约32倍\[14 (https://arxiv.org/html/2609.16258#bib.bib4)\]。  

当存在如示例中的数值时,我们计算第二种编码:对数比度量,通过将基线技术锚定于原点并定向(正值表示改进),捕捉变化幅度并将每次对比置于统一的成本-性能平面。详细方法见

相似文章

评估AI执行科研任务的能力

OpenAI Blog

OpenAI推出FrontierScience,这是一个新的基准测试,用于衡量人工智能在物理、化学和生物学领域的专家级科学能力。GPT-5.2在奥林匹克式任务中达到77%,在研究型任务中达到25%。该论文提供了早期证据,表明GPT-5能显著加速真实的科学工作流程,将工作周期从数周缩短至数小时,同时建立了度量标准,以追踪朝着AI加速科学研究的进展。

AI超越数学家

Reddit r/singularity

AI已经进步到能够为原创数学研究做出贡献的程度,超越了人类数学家,并可能减少对该职业的需求,尽管人类与AI的团队合作可能最终表现出色。

AI科学与经济:系统图谱

Reddit r/artificial

本文认为,尽管AI在模式识别和假设生成方面表现出色,但科学和经济的进步需要与现实世界的接地互动以及制度执行,强调了人机协作的必要性。