@KevinKaichuang:训练蛋白质语言模型时,通常会丢弃那些无法与至少一个其他蛋白质聚类的宏基因组蛋白质…

X AI KOLs Timeline 论文

摘要

一项合作研究的发现表明,在训练蛋白质语言模型时,丢弃宏基因组数据集中的单体蛋白质可能是不正确的。

在训练蛋白质语言模型时,人们通常会丢弃那些不与至少一个其他蛋白质聚类的宏基因组蛋白质(单体)。 与 @riavinod_ @Samir_char @avapamini @lorin_crawford 一起,我们表明这可能不是正确的策略。https://t.co/x0pdjvevfa
查看原文
查看缓存全文

缓存时间: 2026/08/18 02:23

在训练蛋白质语言模型时,人们通常会剔除那些未能与其他至少一种蛋白质聚类的宏基因组蛋白(即单例蛋白)。

我们(@riavinod_ @Samir_char @avapamini @lorin_crawford )的研究表明,这种策略可能并非最佳选择。https://t.co/x0pdjvevfa

相似文章

ProtSent:蛋白质句子转换器

arXiv cs.LG

本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。

通过建模幸存者偏差提升蛋白质功能预测

arXiv cs.LG

本文介绍了 Evo-PU,一种正无标签学习框架,通过利用进化突变过程对蛋白质序列数据中的幸存者偏差进行建模。作者证明,在预测流感、RSV 和 SARS-CoV-2 的蛋白质功能方面,Evo-PU 优于标准的正无标签方法和蛋白质语言模型。