实现AI驱动药物发现的数据闭环

MIT Technology Review 新闻

摘要

AI通过预测候选药物和降低成本加速药物发现,但成功依赖于高质量数据以及与实验室系统的集成,以实现数据闭环并验证预测。

<p>药物发现是一项高成本、高风险的事业,在市场日益注重先发优势的压力下,其挑战愈发严峻。</p> <p>自20世纪50年代以来,新药研发成本大约每九年翻一番——这一现象被称为<a href="https://www.oecd.org/en/publications/artificial-intelligence-in-science_a8d820bd-en/full-report/eroom-s-law-and-the-decline-in-the-productivity-of-biopharmaceutical-r-d_f42df75c.html" target="_blank" rel="noreferrer noopener">Eroom定律</a>。如今,将一款新药推向市场平均需要10-15年,成本在<a href="https://cdn.cytivalifesciences.com/api/public/content/srGfSmOLS1yA_mNQchWbKA-pdf" target="_blank" rel="noreferrer noopener">10亿至25亿美元</a>之间,失败率高达90%以上。</p> <p>人工智能已成为制药业提高成功率、缩短研发周期的最大赌注。制药公司越快识别、测试和优化新化合物,后期开发中出现高成本失败的风险就越低。</p> <figure class="wp-block-image size-full is-resized"><img decoding="async" width="1254" height="836" src="https://wp.technologyreview.com/wp-content/uploads/2026/06/iStock-2247435323_f6bf40.jpg" alt="" class="wp-image-1139670" style="width:741px;height:auto" srcset="https://wp.technologyreview.com/wp-content/uploads/2026/06/iStock-2247435323_f6bf40.jpg 1254w, https://wp.technologyreview.com/wp-content/uploads/2026/06/iStock-2247435323_f6bf40.jpg?resize=300,200 300w, https://wp.technologyreview.com/wp-content/uploads/2026/06/iStock-2247435323_f6bf40.jpg?resize=768,512 768w" sizes="(max-width: 1254px) 100vw, 1254px" /></figure> <p>“药物发现的主要成本仍然在临床阶段,因此努力降低风险、提高成功率显然大有裨益,”全球生命科学公司Cytiva的蛋白质研究战略总监Paul Belcher表示。“AI是制药公司希望用来节省时间、压缩周期,同时让更高质量的候选药物进入临床的一种方法。”</p> <p>早期在药物发现中应用AI展现了潜力,但也凸显了对可靠、真实数据以及实验室系统集成的需求。</p> <h3 class="wp-block-heading"><a></a>AI提升实验室效率</h3> <p>AI在药物发现中最有前景的早期应用之一是命中识别。这涉及针对疾病相关靶点(如蛋白质)筛选分子实体库,以找到与其结合的分子。成功命中为研究人员提供了进一步测试和优化的起点,旨在最终开发出可行的药物。</p> <p>Belcher观察到从经验筛选向预测设计的转变:制药公司不再进行物理筛选库,而是利用AI从头设计候选药物,并在投入研发之前预测它们如何与疾病靶点相互作用。</p> <p>这意味着公司不再受限于物理筛选库的能力来识别起点。“AI消除了这一限制,”Belcher说。“而且它可以在需要物理测试之前帮助剔除低质量候选药物,从而节省时间和资源。”</p> <p>Belcher表示,AI目前还无法可靠地预测新化合物的动力学或可开发性。这意味着每个AI生成的候选药物仍需在实验室中进行验证。</p> <p>传统的筛选流程旨在大规模识别命中物,而非详细剖析大量复杂候选物。这给实验室团队带来了更大压力,他们现在必须测试、表征和纯化日益增多、更多样化的AI生成化合物。</p> <p>“目前用于命中识别的技术可以筛选数十万甚至数百万个化合物,使用二元或基于阈值的技术产生低保真数据——是或否的回答,”Belcher解释道。“AI可以增加你获得的命中数,并可能提供更高质量的命中。这增加了对更高通量、信息丰富技术的需求,以验证和表征这些命中。”</p> <h3 class="wp-block-heading"><a></a>模型需要完整、高质量的数据</h3> <p>随着AI加速了对数据密集型实验室系统的需求,它也凸显了对更好、更完整数据的基本需求。</p> <p>许多早期的AI模型是在公开数据集上训练的,现在正撞上Belcher所说的数据墙。由于模型可以访问相同的数据,它们都会得出相似的结论,且收益递减。此外,这些数据集并非为AI设计,缺乏保持模型准确性和无偏见所需的结构、标签和多样性。</p> <p>发表偏见加剧了这一问题。“大多数公开数据集和科学出版物只关注阳性结果,”Belcher说。“没有人愿意分享失败。这种偏见就像被绑住一只手。AI模型可以识别与成功相关的模式,但缺乏对失败的综合理解,而失败本可以使预测更可靠。”</p> <p>Belcher认为能显著改进模型的数据——失败的实验、不结合的化合物——仍然难以获取。“我们经常开玩笑说应该有一本阴性数据期刊,”他说。“这些数据通常埋藏在实验笔记本中,从未用于指导或引导未来研究。”</p> <p>缺乏阴性数据造成了根本性问题:没有广泛的数据,模型无法充分训练以避免偏见。“在所有机器学习应用中,模型性能很大程度上依赖于训练数据的质量和范围,”Belcher指出。</p> <p>AI也使得数据造假变得更加容易,加剧了对数据完整性的担忧。以Western blot为例。这是识别血液或组织样本中蛋白质的标准技术的一部分,也是生物医学研究中常见的篡改目标。Belcher<a href="https://www.nature.com/articles/d41586-020-01363-z" target="_blank" rel="noreferrer noopener">引用了荷兰微生物学家Elisabeth Bik的研究</a>,该研究发现近4%的生物医学论文含有重复或篡改的图像。这还是2016年,在生成式AI使造假变得轻而易举之前。</p> <p>“篡改或伪造的数据在科学界一直是个问题,但在AI世界,尤其是用于训练模型时,可能会产生灾难性后果,”Belcher说。“需要更多工具来验证数据是否未被篡改。”</p> <p>一些供应商已经开始应对这一挑战。Belcher提到像Cytiva的Image Integrity Checker这类解决方案,它使用安全哈希算法(与区块链相同技术)来检测科学图像是否被篡改。“我们看到出版机构对此表现出浓厚兴趣,他们希望将其作为标准采用,因为这是一种快速确保文献中内容真实性的方法,”他补充道。</p> <h3 class="wp-block-heading"><a></a>自主实验室可加速突破</h3> <p>Belcher将药物发现的未来状态描述为完全自主的实验室,只需最少的人工干预。这一愿景的基础是数据和基础设施的一致性。</p> <p>这些AI驱动的黑暗实验室(或闭环实验室)全天候运行。它们循环进行预测、测试和优化,然后将结果反馈给AI模型以指导下一轮实验。Belcher表示,这可以提高进入临床试验的候选药物的成功率。Bett
查看原文
查看缓存全文

缓存时间: 2026/07/27 13:40

# 在AI驱动的药物发现中闭合数据循环 来源:https://www.technologyreview.com/2026/07/27/1139667/closing-the-data-loop-in-ai-driven-drug-discovery 药物发现是一项高成本、高风险的事业,在一个日益由先发优势定义的市场中,它正承受着越来越大的压力。 自20世纪50年代以来,开发新药的成本大约每九年翻一番——这一现象被称为**伊鲁姆定律**(Eroom's Law)([https://www.oecd.org/en/publications/artificial-intelligence-in-science_a8d820bd-en/full-report/eroom-s-law-and-the-decline-in-the-productivity-of-biopharmaceutical-r-d_f42df75c.html](https://www.oecd.org/en/publications/artificial-intelligence-in-science_a8d820bd-en/full-report/eroom-s-law-and-the-decline-in-the-productivity-of-biopharmaceutical-r-d_f42df75c.html))。如今,将一款新药推向市场平均需要10到15年,成本在10亿至25亿美元之间([https://cdn.cytivalifesciences.com/api/public/content/srGfSmOLS1yA_mNQchWbKA-pdf](https://cdn.cytivalifesciences.com/api/public/content/srGfSmOLS1yA_mNQchWbKA-pdf)),失败率超过90%。 AI已成为制药行业提高成功率、缩短研发周期的最重要押注。药物公司越快地识别、测试和优化新的化合物,后期开发中出现代价高昂的失败的风险就越低。 “药物发现的主要成本仍然在临床阶段,因此努力降低风险、提高成功率显然非常有益,”全球生命科学公司Cytiva的蛋白质研究战略总监Paul Belcher说。“AI是制药公司希望不仅能够节省时间、压缩时间线,还能让更高质量的候选药物进入临床的手段之一。” 早期在药物发现中使用AI显示了潜力,但也凸显了对可靠、真实数据以及实验室系统集成的需求。 ### AI为实验室带来效率 AI在药物发现中最有前景的早期应用之一是**命中识别**。这涉及针对疾病相关靶点(如蛋白质)筛选分子实体库,以找到能与之结合的分子。成功的命中为研究人员提供了进一步测试和优化的起点,最终目标是开发出可行药物。 Belcher观察到从经验筛选向预测性设计的转变:制药公司不再进行物理筛选库,而是利用AI从头设计候选药物,并在投入研发(R&D)之前预测它们如何与疾病靶点相互作用。 这意味着公司不再受限于物理筛选能力来识别起始点。“AI消除了这种限制,”Belcher说。“而且它可以在你实际进行物理测试之前帮助淘汰低质量的候选化合物,从而节省时间和资源。” Belcher表示,AI目前还无法可靠地预测新化合物的动力学或可开发性。这意味着每个AI生成的候选化合物仍然需要在实验室中进行验证。 传统的筛选流程旨在大规模识别命中,而不是对大量复杂候选化合物进行详细分析。这给实验室团队带来了更大压力,他们现在需要测试、表征和纯化日益增多、更多样化的AI生成化合物。 “当前用于命中识别的技术可以筛选数十万甚至数百万种化合物,使用二进制或基于阈值的技术,产生低保真数据——是或否的回答,”Belcher解释道。“AI可以增加你获得的命中数量,并可能同时提供更高质量的命中。这就增加了对更高通量、信息丰富技术的需求,以验证和表征这些命中。” ### 模型需要完整、高质量的数据 随着AI加速了对数据丰富实验室系统的需求,它也凸显了对更好、更完整数据的基本需求。 许多早期的AI模型是在公开可用的数据集上训练的,现在正触及Belcher所谓的“数据墙”。由于模型可以访问相同的数据,它们都会得出相似的结论,且随着时间的推移收益递减。此外,这些数据集并非为AI而建,这意味着它们缺乏保持模型准确和无偏见所需的结构、标注和多样性。 发表偏倚加剧了这个问题。“大多数公开可用的数据集和科学出版物只关注阳性结果,”Belcher说。“没有人愿意分享他们的失败。这种偏见几乎就像一只手被绑在背后。AI模型可以识别与成功相关的模式,但它们缺乏对失败的全面理解,而这种理解本可以使预测更可靠。” Belcher认为能够显著改进模型的数据——失败的实验、不结合的化合物——仍然难以获得,令人沮丧。“我们经常开玩笑说,应该有一本《阴性数据期刊》,”他说。“这些数据通常被埋藏在实验笔记本中,从未被用来指导或引导未来的研究。” 这种阴性数据的缺乏造成了一个根本性问题:如果没有广泛的数据库访问,模型就无法得到充分训练以避免偏见。“在所有机器学习应用中,模型的性能在很大程度上依赖于训练数据的质量和范围,”Belcher指出。 AI也使数据造假变得更容易,加剧了对数据完整性的担忧。以蛋白质印迹法为例。这是一种用于识别血液或组织样本中蛋白质的标准技术,也是生物医学研究中最常见的篡改目标之一。Belcher引用荷兰微生物学家Elisabeth Bik的研究([https://www.nature.com/articles/d41586-020-01363-z](https://www.nature.com/articles/d41586-020-01363-z)),她发现近4%的生物医学论文包含重复或篡改的图像。这是在2016年,远在生成式AI使造假变得轻而易举之前。 “篡改或伪造的数据在科学界一直是个问题,但在AI领域,尤其是用于训练模型时,可能会产生灾难性的后果,”Belcher说。“需要有更多的工具来验证数据是否被篡改。” 一些供应商开始应对这一挑战。Belcher提到了如Cytiva的Image Integrity Checker等解决方案,该工具使用安全哈希算法——与区块链中使用的技术相同——来检测科学图像是否被篡改。“我们看到出版社对此产生了浓厚兴趣,他们希望将其作为标准采用,因为这是快速确保文献中发布的内容真实可靠的方法,”他补充道。 ### 自主实验室可以加速突破 Belcher将药物发现的未来状态描述为完全自主的实验室,只需最少的人工干预。这一愿景的基础是数据和基础设施的一致性。 这些AI驱动的“暗实验室”或“入环实验室”全天候运行。它们循环进行预测、测试和优化,然后将结果反馈给AI模型,以指导下一轮实验。这可以提高进入临床试验的药物候选物的成功率,Belcher说。更好的起点,加上更多轮的优化,应该能使更少缺陷的更好候选物进入临床。 但实验室自动化在很大程度上依赖于集成。这意味着可互操作的系统、高度结构化和全面的数据集,以及信息轻松地流入和流出。大多数实验室尚未达到这一水平。“目前,实验室中的许多仪器都是独立的,”Belcher指出。“你可以拥有世界上最好的技术,但如果它是一个封闭的生态系统——如果用户无法获取数据——那就毫无用处。” 集成的基础设施可以使实验室大规模生成FAIR(可查找、可访问、可互操作、可重用)数据。这不仅能服务于单个实验室报告,还能训练后续几代AI模型,从而有效闭合计算驱动的AI干实验室和物理湿实验室之间的循环。 “我们的目标是帮助科学家和研究人员加速他们的突破,使自主实验室的未来状态成为现实可能,”Belcher说。“我们希望帮助他们生成可靠的数据,简化发现中的工作流程,并希望使他们正在研究的内容能够更快、更可靠地成为改变生命的疗法。” ### 关于成本及未来展望 AI驱动的药物发现仍处于早期阶段。值得注意的是,尚未有主要通过AI驱动的设计发现的药物获得FDA的完全批准——尽管Belcher预计这一情况在未来两三年内会改变。 AI最终能在多大程度上影响药物发现?“圣杯将是完全通过计算机模拟预测疗效和毒性,从而消除绝大部分物理湿实验室工作的需要,”Belcher说。但除了模型的成熟度之外,还有许多障碍,包括监管障碍和成本挑战。 斯坦福大学的一项研究([https://epoch.ai/blog/how-much-does-it-cost-to-train-frontier-ai-models](https://epoch.ai/blog/how-much-does-it-cost-to-train-frontier-ai-models))发现,自2016年以来,训练前沿AI模型的成本每年翻一番以上,这给本已以极高研发支出为特征的行业增加了更多财务压力([https://www.sciencedirect.com/science/article/pii/S135964462400285X](https://www.sciencedirect.com/science/article/pii/S135964462400285X))。 Belcher承认这种张力,但对未来仍持乐观态度。“我认为我们将达到一个点,在成本和风险方面,AI与湿实验工作之间会达到平衡,”他说。“只要计算成本永远不会超过临床开发成本,我认为AI将是一个优势。” 了解更多关于Cytiva如何利用更快发现([https://www.cytivalifesciences.com/solutions/protein-research](https://www.cytivalifesciences.com/solutions/protein-research))重塑蛋白质纯化工作流程的信息。 *本内容由MIT Technology Review的定制内容部门Insights制作。它并非由MIT Technology Review编辑团队撰写。它由人类作家、编辑、分析师和插画师进行研究、设计和撰写。这包括调查问卷的编写和调查数据的收集。可能用到的AI工具仅限于经过严格人工审查的次级生产流程。*

相似文章

AI如何帮助科学家设计下一代药物

MIT Technology Review

AI通过预测候选分子和实现多靶点疗法,加速生物药物设计,有潜力将发现时间缩短50%,并针对以前无法治疗的疾病。

AI 正在加速药物开发

Reddit r/singularity

AI 正在改变美国制药研发,通过加速药物发现、临床前测试、临床试验和监管审查,早期证据表明它可以将开发时间缩短大约一半并降低成本。