@KevinKaichuang:训练蛋白质语言模型时,通常会丢弃那些无法与至少一个其他蛋白质聚类的宏基因组蛋白质…
摘要
一项合作研究的发现表明,在训练蛋白质语言模型时,丢弃宏基因组数据集中的单体蛋白质可能是不正确的。
在训练蛋白质语言模型时,人们通常会丢弃那些不与至少一个其他蛋白质聚类的宏基因组蛋白质(单体)。
与 @riavinod_ @Samir_char @avapamini @lorin_crawford 一起,我们表明这可能不是正确的策略。https://t.co/x0pdjvevfa
查看缓存全文
缓存时间: 2026/08/18 02:23
在训练蛋白质语言模型时,人们通常会剔除那些未能与其他至少一种蛋白质聚类的宏基因组蛋白(即单例蛋白)。
我们(@riavinod_ @Samir_char @avapamini @lorin_crawford )的研究表明,这种策略可能并非最佳选择。https://t.co/x0pdjvevfa
相似文章
引导蛋白质语言模型中的离群流形塌缩
本文识别了引导蛋白质语言模型中一种名为“离群流形塌缩”的故障模式,即生成序列出现退化,并提出马氏过滤(Mahalanobis filtering)作为一种无需训练的事后处理方法,以提升序列质量和结构合理性。
ProtSent:蛋白质句子转换器
本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。
基于自然语言引导的生成器无关的蛋白粘合剂设计短名单筛选方法
本文探讨了使用大型语言模型生成排名策略,从候选池中筛选蛋白粘合剂,在从头设计工作流中相较于基线方法显示出适度的性能提升。
@nkwang24:1/ 好奇像@biohub的ESM-C这样的蛋白质语言模型如何仅从序列中表示结构信息?来…
Goodfire的Silico研究平台现已公开可用,其演示展示了蛋白质语言模型(如ESM-C)如何仅从序列表示结构信息,从而支持前沿规模模型的解释与训练。
通过建模幸存者偏差提升蛋白质功能预测
本文介绍了 Evo-PU,一种正无标签学习框架,通过利用进化突变过程对蛋白质序列数据中的幸存者偏差进行建模。作者证明,在预测流感、RSV 和 SARS-CoV-2 的蛋白质功能方面,Evo-PU 优于标准的正无标签方法和蛋白质语言模型。