@AlexanderKalian: 生物学相对于AI所需的数据严重不足——我很遗憾地说。我不确定怎么会有人声称……

X AI KOLs Timeline 论文

摘要

Alexander Kalian认为生物学缺乏AI所需的高质量数据,而César de la Fuente则反驳说数据存在但需要更好的组织,并强调AllTheBacteria预印本作为细菌基因组的开放平台。

生物学相对于AI所需的数据严重不足——我很遗憾地说。 我不确定怎么会有人声称相反。 例如,与人类疾病相关的蛋白质靶点有数万个。对于大多数靶点,我们关于哪些分子与之结合的数据少于20个数据点。 而且这些数据也严重偏向于强结合的分子,而不是不结合的分子。 针对特定靶点的分子结合的深度学习模型通常需要约1000个以上的数据点进行训练,才能很好地泛化到新数据。 深度学习模型还需要训练数据的平衡。 更不用说与ADME、代谢物、下游通路、蛋白质-蛋白质相互作用、不同蛋白质变体(proteoforms)、表观遗传学、毒理学等相关的数据了。
查看原文
查看缓存全文

缓存时间: 2026/07/22 18:35

生物学严重缺乏数据,相对于AI所需的数据量而言——很遗憾这么说。

我不确定怎么会有人持相反观点。

举例来说,与人类疾病相关的蛋白靶标有数万个。而我们现有的关于哪些分子能与每个靶标结合的数据,大多数情况下不到20个数据点。

而且这些数据严重偏向于结合强的分子,而非不结合的分子。

针对特定靶标的分子结合深度学习模型,通常需要约1000个以上的数据点进行训练,才能在新数据上泛化良好。

深度学习模型还需要训练数据具有平衡性。

至于与ADME、代谢物、下游通路、蛋白质-蛋白质相互作用、不同蛋白质形态、表观遗传学、毒理学等相关的数据,就更别提了。

César de la Fuente (@delafuentelab): 生物学并不缺乏数据。挑战在于如何将数据组织得足够好,让科学家——以及机器——能够从中学习。

我们最新的预印本介绍了AllTheBacteria:一个开放的、社区构建的平台,将244万个公开的细菌和古菌基因组转化为……

相似文章

预印本:"发展生物学是否需要生物学?" 由工程师、使用人工智能的生物学家以及哲学家组成的团队认为,AI 可以映射已知的生物学,但仍然需要具身的科学家来发现模型遗漏的内容。

Reddit r/ArtificialInteligence

一篇预印本论文认为,AI 可以映射已知的生物学,但无法执行“种类形成”——即创造新的变量和约束——这需要人类科学家的具身参与。作者提出了一套课程体系,旨在培养科学家成为“未参数化检测器”,以在生物发现中补充 AI 的能力。

2026年6月8日 科学:为生物学中的智能体铺平道路

Anthropic Research

Anthropic研究员Laura Luebbert认为,生物数据基础设施需要为AI智能体重新设计,她通过一个案例研究指出,即使是强大的模型也无法可靠地从NCBI Virus检索序列数据,直到添加了确定性检索层。