标签
PFArena 提出了一个用于评估语言模型在蛋白质修饰任务上表现的基准测试,通过比较蛋白质语言模型和大型语言模型,评估它们在生物应用中的能力。
本文识别了引导蛋白质语言模型中一种名为“离群流形塌缩”的故障模式,即生成序列出现退化,并提出马氏过滤(Mahalanobis filtering)作为一种无需训练的事后处理方法,以提升序列质量和结构合理性。
一项合作研究的发现表明,在训练蛋白质语言模型时,丢弃宏基因组数据集中的单体蛋白质可能是不正确的。
Goodfire的Silico研究平台现已公开可用,其演示展示了蛋白质语言模型(如ESM-C)如何仅从序列表示结构信息,从而支持前沿规模模型的解释与训练。
本文提出了一种两阶段微调流程,结合领域自适应微调和强化学习,生成匹配所需氨基酸组成分布并保持序列质量的蛋白质序列。
Pepti-drift 是一种毒性感知的潜在空间精炼框架,用于生成抗原特异性肽,在保持结合亲和力的同时避免毒性。与现有方法相比,它实现了大幅加速,并产生了多样、有效且低毒性的肽候选物。
ProtoCol将后期交互检索应用于蛋白质同源搜索,将蛋白质表示为残基嵌入集,并使用MaxSim进行评分,在远程同源基准上优于池化方法和基于比对的方法。
本文提出了 SoftBlobGIN 框架,通过将蛋白质语言模型的表示投影到接触图上进行结构感知的消息传递,增强了其可解释性。该框架在酶分类和结合位点检测任务上展现出性能提升,同时提供了可审计的结构化解释。
本文介绍了一种具有新颖“胚系吸收”特性的离散扩散模型,以改善抗体序列的条件生成。该模型解决了蛋白质语言模型中的胚系偏差问题,并在优化抗体结合亲和力和可开发性方面表现出优于现有方法(如 EvoProtGrad)的性能。