@AlexanderKalian: 生物学相对于AI所需的数据严重不足——我很遗憾地说。我不确定怎么会有人声称……
摘要
Alexander Kalian认为生物学缺乏AI所需的高质量数据,而César de la Fuente则反驳说数据存在但需要更好的组织,并强调AllTheBacteria预印本作为细菌基因组的开放平台。
查看缓存全文
缓存时间: 2026/07/22 18:35
生物学严重缺乏数据,相对于AI所需的数据量而言——很遗憾这么说。
我不确定怎么会有人持相反观点。
举例来说,与人类疾病相关的蛋白靶标有数万个。而我们现有的关于哪些分子能与每个靶标结合的数据,大多数情况下不到20个数据点。
而且这些数据严重偏向于结合强的分子,而非不结合的分子。
针对特定靶标的分子结合深度学习模型,通常需要约1000个以上的数据点进行训练,才能在新数据上泛化良好。
深度学习模型还需要训练数据具有平衡性。
至于与ADME、代谢物、下游通路、蛋白质-蛋白质相互作用、不同蛋白质形态、表观遗传学、毒理学等相关的数据,就更别提了。
César de la Fuente (@delafuentelab): 生物学并不缺乏数据。挑战在于如何将数据组织得足够好,让科学家——以及机器——能够从中学习。
我们最新的预印本介绍了AllTheBacteria:一个开放的、社区构建的平台,将244万个公开的细菌和古菌基因组转化为……
相似文章
@AnthropicAI:新科学博客:为什么AI在编程领域进步快于生物学?对智能体而言,生物数据库就像为汽车时代之前建造的城市……
Anthropic的科学博客认为,AI在生物学领域的进展落后于编程,因为生物数据基础设施并非为智能体设计。一项案例研究表明,添加确定性检索层(gget病毒)可将准确率提升至接近100%。
预印本:"发展生物学是否需要生物学?" 由工程师、使用人工智能的生物学家以及哲学家组成的团队认为,AI 可以映射已知的生物学,但仍然需要具身的科学家来发现模型遗漏的内容。
一篇预印本论文认为,AI 可以映射已知的生物学,但无法执行“种类形成”——即创造新的变量和约束——这需要人类科学家的具身参与。作者提出了一套课程体系,旨在培养科学家成为“未参数化检测器”,以在生物发现中补充 AI 的能力。
@rohanpaul_ai: Anthropic新研究表明,AI智能体在代码方面可能表现卓越,但在生物学领域,它们可能在科学工作开始之前就失败……
Anthropic的研究揭示,AI智能体在生物学数据库方面存在困难,对同一个查询会产生高度差异的答案(例如,埃博拉序列计数范围从5到106,而预期为266),但添加一个可重复的检索工具能显著提高一致性和准确性。
2026年6月8日 科学:为生物学中的智能体铺平道路
Anthropic研究员Laura Luebbert认为,生物数据基础设施需要为AI智能体重新设计,她通过一个案例研究指出,即使是强大的模型也无法可靠地从NCBI Virus检索序列数据,直到添加了确定性检索层。
AI在分析方面越来越强,但问题仍然在于数据。
作者认为,AI分析的质量更多受到数据获取和可靠性的限制,而非推理能力;结构化数据集能显著提升输出效果。