@KevinKaichuang:训练蛋白质语言模型时,通常会丢弃那些无法与至少一个其他蛋白质聚类的宏基因组蛋白质…
摘要
一项合作研究的发现表明,在训练蛋白质语言模型时,丢弃宏基因组数据集中的单体蛋白质可能是不正确的。
在训练蛋白质语言模型时,人们通常会丢弃那些不与至少一个其他蛋白质聚类的宏基因组蛋白质(单体)。
与 @riavinod_ @Samir_char @avapamini @lorin_crawford 一起,我们表明这可能不是正确的策略。https://t.co/x0pdjvevfa
查看缓存全文
缓存时间: 2026/08/18 02:23
在训练蛋白质语言模型时,人们通常会剔除那些未能与其他至少一种蛋白质聚类的宏基因组蛋白(即单例蛋白)。
我们(@riavinod_ @Samir_char @avapamini @lorin_crawford )的研究表明,这种策略可能并非最佳选择。https://t.co/x0pdjvevfa
相似文章
ProtSent:蛋白质句子转换器
本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。
@nkwang24:1/ 好奇像@biohub的ESM-C这样的蛋白质语言模型如何仅从序列中表示结构信息?来…
Goodfire的Silico研究平台现已公开可用,其演示展示了蛋白质语言模型(如ESM-C)如何仅从序列表示结构信息,从而支持前沿规模模型的解释与训练。
通过建模幸存者偏差提升蛋白质功能预测
本文介绍了 Evo-PU,一种正无标签学习框架,通过利用进化突变过程对蛋白质序列数据中的幸存者偏差进行建模。作者证明,在预测流感、RSV 和 SARS-CoV-2 的蛋白质功能方面,Evo-PU 优于标准的正无标签方法和蛋白质语言模型。
@arcinstitute: 教大型语言模型(LLM)人们偏好哪种答案的同一种方法,也可以教蛋白质模型哪些序列更稳定。
ProteinDPO 是一种使用大型语言模型(LLM)偏好学习技术来提高蛋白质模型稳定性的方法,由 Arc Institute 的研究人员开发。
TaxDistill:通过蒸馏基因组基础模型改进宏基因组分类注释
TaxDistill提出了一种知识蒸馏框架,使用拥有5亿参数的基因组基础模型(GenomeOcean)作为教师模型,通过减少相似性搜索工具带来的标签噪声来改进宏基因组分类注释,在CAMI2数据集上实现了显著的F1分数提升。