为什么蛋白质结构预测的置信度分数无法替代生物测定

Reddit r/ArtificialInteligence 新闻

摘要

文章认为,由于预测输入的复杂性以及功能验证的必要性,蛋白质结构预测中的置信度分数无法替代生物测定。

声明:我运营 rewire.it,在那里我发布了下面链接的文章。FASTA 序列并不能完全确定一个蛋白质结构预测任务。单个链、蛋白质复合物和蛋白质-配体复合物需要不同的输入和验证。数据库版本、比对、模板和采样协议也会改变实际测试的内容。置信度分数也需要同样的区分。局部置信度、相对结构域定位和界面置信度涉及预测几何结构的不同方面。它们都不是对特定测定中催化活性或结合的测量。抽取更多的扩散样本可以探索候选结构,但这些样本并不自动构成热力学集合。我写了一份关于这些选择的指南,包括在比较模型或解释其分数之前需要记录的内容:https://rewire.it/blog/a-fasta-file-is-not-a-specification/ 有用的评估问题是输出支持哪个生物学主张。在将模型选择的结构用于下游功能主张之前,您需要什么证据?
查看原文

相似文章

自然界蛋白质折叠的不合理冗余

Hacker News Top

来自Ligo的一篇博客文章,讨论了天然蛋白质折叠的冗余性,以及为生成式生物分子模型扩展结构数据所面临的挑战,文中提及了AlphaFold3和其他最新模型。

Mirror-Score:经校准的仅推理评分揭示了D肽设计中序列兼容性排序的局限

arXiv cs.AI

Mirror-Score 面向D肽/L-蛋白结合剂设计提出了一个经校准、仅推理的评分框架,发布了首个包含31个晶体复合物的公开基准,并表明原始的 ProteinMPNN NLL 是一个很差的亲和力排序指标(Spearman 0.19),而 Boltz-2 的界面 pLDDT 在病毒进入蛋白家族上实现了结构层面的留一法 Spearman 0.90。论文还报告称跨家族校准无法迁移,并针对抗微生物耐药性相关的靶点 LasR 和 LecB 提出了一套前瞻性设计流程。

结构蛋白质组学引导的共折叠模型

arXiv cs.LG

介绍了AIMS-Fold,一种推理时引导扩散框架,整合了交联质谱(XL-MS)和氢-氘交换(HDX-MS)数据,以改善针对诱导接近药物靶点的蛋白质共折叠预测。

ProtStructQA:蛋白质结构推理中的指称阈值

arXiv cs.CL

ProtStructQA 引入了一个可执行的蛋白质结构问答基准,该基准将自然语言查询编译为类型化的 DSL 程序,以评估 LLM 在精确 3D 测量上的能力,揭示了一个依赖于能力的指称阈值:当模型规模超过一定大小时,思维链变得非常有益。