标签
Alexander Kalian认为生物学缺乏AI所需的高质量数据,而César de la Fuente则反驳说数据存在但需要更好的组织,并强调AllTheBacteria预印本作为细菌基因组的开放平台。
本文使用来自 TCGA-BRCA 的多组学数据,系统地基准测试了用于 ER 状态预测的经典机器学习模型(Random Forest、XGBoost 等),发现 RNA 表达提供了最强的预测信号,并且在整合的多组学设置中,Random Forest 达到了 90.3% 的平衡准确率。
Google DeepMind 和 Isomorphic Labs 阐述了他们在生物韧性方面的联合方法,重点在于防止AI模型的滥用,并利用AI通过合作以及AlphaFold、Gemini和SynthID等工具来改善传染病的预防、检测和应对。
OpenAI推出了GeneBench-Pro,这是一个研究级基准测试,用于测试AI智能体在计算生物学中导航混乱的生物数据、选择分析路径以及做出判断的能力。
GeneBench-Pro 是 OpenAI 推出的一项全面基准测试,旨在评估人工智能模型在复杂基因组学任务上的表现,包括体细胞肿瘤学、功能基因组学以及临床携带者筛查。
OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。
本文介绍了GRAFT,这是一个精心整理的多模态数据集,将拟南芥的基因表达谱与表型性状关联起来,并提供了用于表型预测的图和超图基准。其目标是推动植物生物学中基因组到表型组的映射研究。
一位推特用户分享了他人推荐的在X上关注AI+生物学领域的最佳账号,涵盖蛋白质设计、基因组学、生物安全和政策。
Colossal与美国鱼类和野生动物管理局将对美国所有濒危物种进行基因组测序,将生物样本存储在Colossal的BioVault中,并公开基因组数据以支持保护工作。
《自然》杂志上来自巴基斯坦基因组资源(PGR)的一篇新论文分析了来自近亲社区的173,303名巴基斯坦人,识别出近三分之一蛋白质编码基因的人类基因敲除,推翻了诸如PRDM9对生育能力必需性等生物学假设。
OpenAI 强调 o3 Deep Research 如何通过整合临床特征、遗传模式、变异证据和科学文献,为专家提供可操作的假设,从而帮助罕见病诊断。
本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。
一项新研究揭示,早期复杂细胞(真核细胞)的基因组是通过来自多种细菌和古菌的多波基因转移构建的,这使得简单的融合模型变得更加复杂。
作者讲述儿子Owen因罕见肺病不幸离世的悲剧,并介绍了Gamow Labs——一个借助AI辅助编码构建的平台,旨在帮助有类似基因诊断的家庭。
LDARNet 是一个拥有1.2亿参数的层次化基因组基础模型,引入了可学习的自适应分词机制(灵感来源于 H-Net 的动态分块),用于DNA序列的掩码语言建模。该模型在5项组蛋白修饰任务上取得了最先进的结果,并在多项基因组基准测试中超越了参数量多达其20倍的模型。其学习到的分词边界与启动子motif和剪接位点等生物学特征高度吻合。
GENEB 是一个大规模诊断基准,在统一的探测协议下,跨 13 个功能类别的 100 项任务对 40 个基因组基础模型进行评估。研究结果揭示了综合排行榜的不稳定性,以及架构匹配度往往比模型规模更具决定性影响。该工作旨在解决基因组机器学习领域评估体系碎片化的问题,类似于 MTEB 在 NLP 领域所做的工作。
OpenAI 推出了专为生命科学研究设计的更新版 GPT-Rosalind 模型,在药物化学、基因组学和药物发现流程方面性能提升,并引入了 LifeSciBench 和 MedChemBench 等新基准。