AI 用于科学需要推理,而不仅仅是数据
摘要
这篇《麻省理工科技评论》文章认为,基于海量数据集的AlphaFold式深度学习并非加速科学发现的理想模板,而具备推理和实验能力的AI智能体将推动未来的突破。
每隔几十年,就会有人宣称科学已经走到了尽头。1903年,备受尊敬的物理学家阿尔伯特·迈克尔逊写道,“物理科学的事实都已被发现。”1980年代,史蒂芬·霍金预测理论物理学可能在世纪末终结。随着人工智能的爆发式到来,这种感觉再次弥漫开来——而这一次,还伴随着一项诺贝尔奖。
在2024年,Google DeepMind的戴米斯·哈萨比斯和约翰·詹珀因他们的神经网络AlphaFold获得了诺贝尔化学奖的一部分奖项。AlphaFold通过从数千个实验测量的形状中学习,来预测蛋白质的三维结构。这个棘手的问题半个世纪以来一直抵制着系统性的攻克;AlphaFold似乎一劳永逸地解决了它,世界也因此对这种方法的前景着迷。哈萨比斯和他的团队称AlphaFold为“AI如何将整个科学加速到数字速度的模板”。在DeepMind成功的鼓舞下,一波为生物学、化学和材料发现构建基础模型的初创公司筹集了数十亿美元。AlphaFold表明,AI与充足数据的结合可以带来突破性的发现(即使我们并不理解所涉及的底层机制),而且似乎又一次,一条穿越其余科学领域的道路已经展现在我们面前。
诚然,AI将给科学带来非凡的变化,但越来越清楚的是,AlphaFold及其同类可能并非这种蜕变的最佳模板。尽管这是一项深远的成就,但产生AlphaFold这类成果的条件是罕见的,而在其他领域满足这些条件所需的时间将以几十年而非几年来衡量。相反,科学的加速将得益于另一种方法:AI智能体。
AlphaFold成功的主要条件是Protein Data Bank(蛋白质数据银行)的存在。这是一个包含大约17万个经实验验证的蛋白质结构的数据集,DeepMind团队可以在此基础上训练其模型。Protein Data Bank的创建并不简单:它花费了53年的国际科学合作,并且根据最近的一项估算,需要大约210亿美元的实验工作来汇集。这种规模的努力以难以获得资金而闻名,几乎无法协调,执行起来也极其耗时;因此它们常常以失败告终。
但即使在具备必要凝聚力和资源的领域,即使相关数据没有被商业所有权限造成不可访问,另一个障碍也鲜少被讨论:即生成可比数据在科学上的不可能性。就蛋白质结构而言,关键的实验技术——蛋白质晶体学——是一种异常可重复且可靠的工具,以至于超过25项诺贝尔奖都依赖它。但在大多数实验科学中,结果往往不尽相同。细胞系会漂移。化学物质有微量污染物。实验室湿度会变化。要创建足够一致、足够准确、足够精确且足够可扩展的测量数据集,以训练现代神经网络(用于生物学或大部分化学领域),将需要新的测量方式和新的标准化方法——而这些都不会很快准备好。
当然,也有少数领域满足这些要求:天气预报、大部分基因组学、以及非常有限的化学领域。这些领域可能很快就会迎来AlphaFold式的突破,如果还没有的话。政府对那些数据集的生成和协调的支持将至关重要,正如美国国家新兴生物技术安全委员会(US National Security Commission on Emerging Biotechnology)所主张的那样。但对于科学中的大多数未解问题,我们至少短期内需要另一种计划。幸运的是,一些更低调、更谦逊的东西已经开始显示出潜力。
科学家们一直在不确定性中推理。致力于确定新药靶点的生物学家从未拥有完美的数据集。相反,他们结合对接计算和已知结构,考虑分子动力学,进行少量结合实验,并根据每种方法的具体优势和失败点,用自己的判断来权衡每种方法。科学的技能不在于任何单一工具,而在于综合许多工具所产生的东西,并随着证据的出现修正结果。这才是大多数实际研究进行的方式。但直到最近,还没有软件能够做到这一点。
智能体现在可以做到。简单来说,智能体是一个AI推理引擎,它被赋予了访问工具(数字的或物理的)的能力以及使用这些工具的能力。在过去几年中,AI的一个根本性架构转变使这些程序迅速普及,这些程序由大型语言模型驱动,大大减少了对科学专业数据集的需求。对科学而言,这一技术进步代表了一种基础性的变革:它使我们能够创建模拟实际研究中迭代的、高度偶然的过程的数字工具。虽然像AlphaFold这样的工具将强大的方法应用于一个有限的问题,但智能体本质上是通才。它们并不代表一种做科学的新方式——而是以数字方式模拟人类的发现过程。
以谷歌于五月发布的AI Co-Scientist为例。研究人员给了它一页简报和一个目标:弄清楚抗生素耐药性如何在细菌物种之间传播,这是耐药性感染的关键驱动因素。该系统生成了多个子智能体。一个从文献中起草假说。另一个像同行评审一样将它们一一拆解。第三个运行锦标赛来对最强的候选者进行排序。第四个完善获胜的假说。该智能体得出结论:耐药基因搭上了细菌病毒的便车,借助任何能将它们运送到新宿主的病毒。这个假说是正确的。伦敦帝国理工学院的研究人员花费了十年时间,通过艰苦的湿实验工作得出了相同的结论;他们的论文此前未被Co-Scientist看过,仍在同行评审中。
像Co-Scientist这样的智能体仍然是新颖的工具,在它们成为科学过程中无处不在的一部分之前,还有真正的挑战需要克服:它们仍然容易产生幻觉,判断力不稳定,并且有记忆和输入限制,限制了它们自主运行的时间。但这些技术障碍将会消失,随着它们消失,我们将开始注意到科学智能体对科学进行的可靠性、一致性和速度所产生的复合效应。
也许最值得注意的是,智能体为科学的“可重复性危机”——即研究人员无法复制彼此结果的普遍问题——提供了一种结构性修复。几十年来,科学界一直恳求研究人员共享他们的原始数据和确切代码,以努力标准化实验过程。但研究
查看缓存全文
缓存时间: 2026/08/10 13:57
# AI for science 需要推理,而不仅仅是数据
来源:https://www.technologyreview.com/2026/08/10/1141384/ai-agents-for-science
每隔几十年,就会有人宣称科学已经走到尽头。1903 年,备受尊敬的物理学家阿尔伯特·迈克尔逊写道(https://archive.org/details/lightwavestheiru00michrich/page/22/mode/2up),物理科学的“全部事实都已被发现”。20 世纪 80 年代,史蒂芬·霍金预测(https://www.nationalacademies.org/read/10375/chapter/16#:~:text=Stephen%20Hawking%20is%20fond%20of,far%20away%20over%20the%20horizon.),理论物理学可能在本世纪末走到终点。随着人工智能的爆炸式到来,这种感受再次弥漫开来——这一次还伴随着一项诺贝尔奖。
2024 年,Google DeepMind 的 Demis Hassabis 和 John Jumper 凭借其神经网络 AlphaFold 获得了诺贝尔化学奖的一部分,该网络通过从数千个实验测量的形状中学习来预测蛋白质的三维结构。这个棘手的问题半个世纪以来一直抵制系统的攻击;AlphaFold 似乎一劳永逸地解决了它,世界也因此痴迷于其方法的潜力。Hassabis 和他的团队称(https://deepmind.google/blog/alphafold-five-years-of-impact/)AlphaFold 是“AI 如何将整个科学加速到数字速度的模板”。一波为生物学、化学和材料发现构建基础模型的初创公司,在 DeepMind 的成功推动下筹集了数十亿美元。AlphaFold 已经证明,AI 与充足数据的结合可以做出突破性的发现(即使我们并不理解所涉及的底层机制),而且看起来,通往其余科学的道路再次展现在我们面前。
诚然,AI 将为科学带来非凡的变化,但越来越清楚的是,AlphaFold 及其同类可能并不是这种蜕变的最佳模板。虽然它是一项深刻的成就,但产生 AlphaFold 这类成果的条件十分罕见,而在其他领域满足这些条件所需的时间将以数十年计,而非数年。相反,科学的加速将借助另一种方法实现:AI 智能体。
AlphaFold 成功的首要条件是蛋白质数据库(Protein Data Bank)的存在,这是一个包含约 17 万个经过实验验证的蛋白质结构的数据集,DeepMind 团队可以在其上训练模型。蛋白质数据库的创建并不简单:它花了 53 年的国际合作,并且根据最近的一项估计(https://www.cambridge.org/core/journals/quarterly-reviews-of-biophysics/article/protein-data-bank-pdb-fiftythree-years-young-and-having-a-transformative-impact-on-science-and-society/36E04BF6CB3DE157DF3E09EFD8EC47DC),需要约 210 亿美元的实验工作才能汇集而成。这种规模的努力以难以获得资助而闻名,几乎不可能协调,执行起来也极其耗时;因此它们常常以失败告终(https://arxiv.org/abs/1409.0003)。
但即使在那些具备所需凝聚力和资源、且相关数据并未因商业所有权而无法获取的领域,也还有一个较少被讨论的障碍:生成可比数据在科学上是不可能的。就蛋白质结构而言,关键的实验技术——蛋白质晶体学——是一种异常可重复且可靠的工具,以至于超过 25 项诺贝尔奖(https://pubs.acs.org/doi/10.1021/ed500343x)都依赖它。但在大多数实验科学中,结果往往各不相同。细胞系会漂移。化学品含有微量污染物。实验室湿度会变化。要创建足够一致、足够准确、足够精确、足够可扩展的测量数据集,以训练生物学或大部分化学领域的现代神经网络,将需要新的测量方法和新的标准化方法——而这些都不可能很快准备好。
当然,有一小部分领域满足这些要求:天气预报、基因组学的大部分、以及非常有限的化学领域。这些领域可能很快就会看到 AlphaFold 式的突破,如果还没有的话(https://www.nature.com/articles/s41467-025-65823-8)。政府对这些数据集的生成和协调的支持将至关重要,正如美国国家新兴生物技术安全委员会所主张的那样(https://www.biotech.senate.gov/wp-content/uploads/2024/04/NSCEB_WP_Biological-Data-as-a-Strategic-Asset.pdf)。但对于科学中的大多数开放性问题,我们将需要不同的计划,至少短期内如此。幸运的是,一些更低调、更谦逊的东西已经开始显示出希望。
科学家们总是在不确定性下推理。致力于识别新药物靶标的生物学家从未拥有完美的数据集。相反,他们结合对接计算和已知结构,考虑分子动力学,运行少量结合试验,并根据每种方法的特定优势和失败点,运用自己的判断来权衡。科学的技艺不在于任何单一工具;而在于综合许多工具所产生的结果,并随着证据的出现修正结论。这才是大多数实际研究真正进行的方式。但直到最近,还没有任何软件能够做到这一点。
智能体现在可以做到。简单来说,智能体是一种 AI 推理引擎,它被赋予了访问工具(数字或物理)的能力,以及使用这些工具的能力。在过去几年里,AI 架构的一个根本性转变使得这些由大型语言模型驱动的程序迅速激增,大大减少了对科学专业数据集的需求。对于科学而言,这一技术进步代表了一种根本性的变化:它使我们能够创建模拟实际研究迭代性、高度偶然性过程的数字工具。虽然像 AlphaFold 这样的工具将一种强大的方法应用于一个有限的问题,但智能体本质上是通才。它们并不代表一种新的科学研究方式——而是以数字方式模拟人类的发现过程。
以 5 月发布的 Google 的 AI Co-Scientist(https://www.nature.com/articles/s41586-026-10644-y)为例。研究人员给了它一份一页的简报和一个目标:弄清楚抗生素耐药性如何在细菌物种之间传播,这是耐药性感染的关键驱动因素。该系统启动了多个子智能体。一个从文献中起草假设。另一个像同行评审员一样将它们拆解。第三个运行锦标赛来对最强的候选进行排名。第四个完善获胜的假设。该智能体得出结论:耐药基因搭上了细菌病毒的便车,借用任何能将它们运送到新宿主的病毒。这个假设是正确的。伦敦帝国理工学院的研究人员花了十年时间,通过艰苦的湿实验工作得出了同样的结论;他们的论文此前从未被 Co-Scientist 看过,当时仍在同行评审中。
像 Co-Scientist 这样的智能体仍然是新工具,在它们成为科学过程中无处不在的一部分之前,还有真正的挑战需要克服:它们仍然容易产生幻觉,判断力不稳定,而且它们的记忆和输入限制限制了它们自主运行的时间。但这些技术障碍将会消失,随着它们的消失,我们将开始注意到科学智能体对科学研究可靠性、一致性和速度的复合影响。
也许最值得注意的是,智能体为科学的“可重复性危机”提供了一种结构性修复。可重复性危机是指研究人员无法复现彼此结果的普遍问题。几十年来,科学界一直恳求研究人员分享他们的原始数据和确切代码,以努力标准化实验流程。但研究人员长期以来一直抵制这种繁琐的行政工作,因为这项工作发生在有趣的科学研究完成之后。相比之下,智能体会自动记录它们采取的每一个步骤,创建一份导致其结果的方法的精确记录,并允许精确复现。
第二个后果将是科学记忆的放大。研究人员之间的知识转移是一个出了名的模糊过程;如果不是通过多年的训练和观察来完成,研究生们就只能埋头翻阅几十年前辈留下的杂乱实验室笔记本,寻找那些决定其实验方案成败的细节。然而,随着智能体在科学过程中所占比例越来越大,实验室的整个科学历史将被记录在一个集中、标准化的机构知识库中。
但智能体最重要的影响将是速度。在任何领域,当测试一个想法比在会议上争论它花费的时间更少时,人们就会停止辩论,直接去运行测试。一个能在一小时内读完一千篇论文、设计 500 个分子、并在早上从失败的测试中学习的智能体,将降低实验成本,并从根本改变科学完成的节奏。它还将赋予研究人员追逐大胆、奇特问题的自由,这些问题他们以前绝不敢冒险投入时间,从而打开我们尚未想象的科学之门。
虽然 AlphaFold 模板无疑将成为惊人发现的关键,但仅靠它不会带我们走向科学的终点。相反,向智能体 AI 的转变代表了一个更为罕见的突破层级:一种同时涵盖所有科学领域的工具。从历史上看,这种规模的工具只出现过几次:微积分、统计推断、光谱学、计算机。每一个都揭示了一个没有人想过要表述的问题世界,而这些问题反过来又重新定义了它们的领域。随着智能体的到来,又一次这样的转变正在来临。
*Eric Schmidt 于 2001 年至 2011 年担任 Google 首席执行官。2024 年,他与妻子 Wendy 共同创立了 Schmidt Sciences,这是一家致力于资助科学和技术领域非常规探索的公益风险投资机构。*
*Suhas Mahesh 在 Schmidt Sciences 的 AI 中心领导 AI for Science 工作。他是 AI 用于材料发现领域的专家。*
*额外研究由 Eric Schmidt 办公室的助理兼科学负责人 Maya Levin 完成。*
相似文章
AI在分析方面越来越强,但问题仍然在于数据。
作者认为,AI分析的质量更多受到数据获取和可靠性的限制,而非推理能力;结构化数据集能显著提升输出效果。
AI科学家产出结果却未进行科学推理[R]
一项对25,000次AI科学家试验的研究发现,智能体68%的时间忽视证据,极少修正假设,显示流行的脚手架修复方法并未赋予真正的科学推理能力。
AI推理是否因错误的原因而正确?
《Quanta Magazine》的一篇文章探讨了AI推理研究的混乱现状,权衡了关于大型推理模型能力的相互矛盾的证据,以及它们的行为对真正推理意味着什么。
如果人工智能最大的限制不是推理,而是无法积累经验呢?
一篇观点文章,认为人工智能最大的限制可能不是推理,而是无法像人类一样积累经验,并指出持续学习可能比扩大模型规模更具变革性。
个人研究工作与面试准备的一些见解
本文讨论了当前AI在研究级工作中的局限性,认为虽然AI在使用现有包和工程解决方案方面表现出色,但在真正研究所需的深度假设驱动迭代方面仍然举步维艰。作者还警告了关于AI能力的极端观点,并以AlphaFold为例说明结构化问题是最困难的部分,而非优化本身。