标签
LC-SEPLM 通过 LoRA 和长程残基对接触监督对 ESM2 进行适配,将结构信息融入蛋白质序列表示,在包括远程同源性识别在内的八项蛋白质层面任务上取得了显著改进。
本综述调查了用于多药理学和多靶点药物设计的几何深度学习(GDL)方法,涵盖了从图神经网络到SE(3)-等变扩散模型等用于捕捉3D分子结构的架构。
本文提出了一种基于偏好的学习框架,用于抗体表达排序,将稀缺的定量数据与来自免疫序列的大规模弱正监督相结合。该方法通过引入联合掩码对数似然近似和基于IMGT的比对,将直接偏好优化(DPO)适配到蛋白质语言模型,从而在多样化的内部数据集上实现了改进的排序性能。
Synbio Studio是一款软件,允许用户数字化设计和模拟细胞与蛋白质,取代昂贵且缓慢的实验室实验。
一篇Reddit帖子,总结了一篇涵盖25种用于scRNA-seq分析的深度学习方法的综述论文,这些方法分为6个子类别,并附有详细表格。
本文介绍了CoDiffGRN,一个用于基因调控网络推断的共进化离散扩散框架,以及一个新的归纳评估基准BEELINE-KGC。它在新型调控发现中取得了最先进的性能。
TheBioCollection是一个526亿令牌的生物学预训练语料库,它将异构资源整合为统一格式以训练大型语言模型,并包含配套的评估套件。在该语料库上训练,生物学基准测试的整体得分提高了一倍以上,同时保持通用语言能力几乎不变。
Prompt-to-Paper是一个多阶段多代理AI框架,用于自动化生物信息学稿件生成。它采用确定性检索增强生成、用于真实实验的自主编码代理以及八维质量评分器,以低成本生成可投稿格式的PDF,并实现了经过验证的质量提升。
一份实用指南,介绍如何使用Oxford Nanopore MinION在家测序自己的基因组,涵盖硬件、协议步骤和分析工具。
本文提出了一种结合稀疏随机投影与多项逻辑回归的新型机器学习方法,用于从DNA甲基化数据中对中枢神经系统肿瘤进行分类,其准确率较现有方法提高了4-5个百分点,达到了最先进水平。
GeneBench-Pro 是 OpenAI 推出的一项全面基准测试,旨在评估人工智能模型在复杂基因组学任务上的表现,包括体细胞肿瘤学、功能基因组学以及临床携带者筛查。
SP-Mind是一个自主AI智能体,统一了空间蛋白质组学分析流程,将自然语言查询转换为端到端的分析工作流,无需微调,并在新的SP-Bench基准测试中取得了最先进的性能。
Arc Institute推出了Proto,一种用于生成生物学的高级编程语言,允许通过代码或自然语言AI提示来编程蛋白质、DNA和RNA系统。
对Transformer架构在大型语言模型之外广泛影响的反思,包括对语言学、遗传学和因果建模的潜在影响,并将其意义与哈伯-博世法相提并论。
APCyc是一个靶点感知的生成框架,通过显式建模环化模式并利用贝叶斯后验引导,设计具有可控理化性质的环肽。
LDARNet 是一个拥有1.2亿参数的层次化基因组基础模型,引入了可学习的自适应分词机制(灵感来源于 H-Net 的动态分块),用于DNA序列的掩码语言建模。该模型在5项组蛋白修饰任务上取得了最先进的结果,并在多项基因组基准测试中超越了参数量多达其20倍的模型。其学习到的分词边界与启动子motif和剪接位点等生物学特征高度吻合。
GENEB 是一个大规模诊断基准,在统一的探测协议下,跨 13 个功能类别的 100 项任务对 40 个基因组基础模型进行评估。研究结果揭示了综合排行榜的不稳定性,以及架构匹配度往往比模型规模更具决定性影响。该工作旨在解决基因组机器学习领域评估体系碎片化的问题,类似于 MTEB 在 NLP 领域所做的工作。
BioManus 是一个 MCP 原生生物医学智能体系统,它采用基于图脚手架的规划方式,对结构化生物学能力进行调度,而非依赖扁平化的基于提示的工具检索,在生物医学基准测试中实现了更优的上下文效率与执行精度。该系统引入了 BioinfoMCP 编译器,用于标准化异构生物信息学工具,并将其组织为类型化异构 MCP 图,以支持可扩展的推理能力。
Google DeepMind 已开源 Science Skills,这是一套针对基因组学、结构生物学和化学信息学等科研任务的智能体技能集合,旨在以科学依据和更高的令牌效率加速智能体工作流程。
CellBRIDGE是一种新方法,通过引入配体-受体相互作用成本来模拟细胞间通讯,增强了对scRNA-seq轨迹推断的最优传输,改进了对齐并实现了可解释的计算机模拟扰动。