为什么蛋白质结构预测的置信度分数无法替代生物测定

Reddit r/ArtificialInteligence 新闻

摘要

文章认为,由于预测输入的复杂性以及功能验证的必要性,蛋白质结构预测中的置信度分数无法替代生物测定。

声明:我运营 rewire.it,在那里我发布了下面链接的文章。FASTA 序列并不能完全确定一个蛋白质结构预测任务。单个链、蛋白质复合物和蛋白质-配体复合物需要不同的输入和验证。数据库版本、比对、模板和采样协议也会改变实际测试的内容。置信度分数也需要同样的区分。局部置信度、相对结构域定位和界面置信度涉及预测几何结构的不同方面。它们都不是对特定测定中催化活性或结合的测量。抽取更多的扩散样本可以探索候选结构,但这些样本并不自动构成热力学集合。我写了一份关于这些选择的指南,包括在比较模型或解释其分数之前需要记录的内容:https://rewire.it/blog/a-fasta-file-is-not-a-specification/ 有用的评估问题是输出支持哪个生物学主张。在将模型选择的结构用于下游功能主张之前,您需要什么证据?
查看原文

相似文章

自然界蛋白质折叠的不合理冗余

Hacker News Top

来自Ligo的一篇博客文章,讨论了天然蛋白质折叠的冗余性,以及为生成式生物分子模型扩展结构数据所面临的挑战,文中提及了AlphaFold3和其他最新模型。

结构蛋白质组学引导的共折叠模型

arXiv cs.LG

介绍了AIMS-Fold,一种推理时引导扩散框架,整合了交联质谱(XL-MS)和氢-氘交换(HDX-MS)数据,以改善针对诱导接近药物靶点的蛋白质共折叠预测。

ProtStructQA:蛋白质结构推理中的指称阈值

arXiv cs.CL

ProtStructQA 引入了一个可执行的蛋白质结构问答基准,该基准将自然语言查询编译为类型化的 DSL 程序,以评估 LLM 在精确 3D 测量上的能力,揭示了一个依赖于能力的指称阈值:当模型规模超过一定大小时,思维链变得非常有益。