为什么蛋白质结构预测的置信度分数无法替代生物测定
摘要
文章认为,由于预测输入的复杂性以及功能验证的必要性,蛋白质结构预测中的置信度分数无法替代生物测定。
声明:我运营 rewire.it,在那里我发布了下面链接的文章。FASTA 序列并不能完全确定一个蛋白质结构预测任务。单个链、蛋白质复合物和蛋白质-配体复合物需要不同的输入和验证。数据库版本、比对、模板和采样协议也会改变实际测试的内容。置信度分数也需要同样的区分。局部置信度、相对结构域定位和界面置信度涉及预测几何结构的不同方面。它们都不是对特定测定中催化活性或结合的测量。抽取更多的扩散样本可以探索候选结构,但这些样本并不自动构成热力学集合。我写了一份关于这些选择的指南,包括在比较模型或解释其分数之前需要记录的内容:https://rewire.it/blog/a-fasta-file-is-not-a-specification/ 有用的评估问题是输出支持哪个生物学主张。在将模型选择的结构用于下游功能主张之前,您需要什么证据?
相似文章
自然界蛋白质折叠的不合理冗余
来自Ligo的一篇博客文章,讨论了天然蛋白质折叠的冗余性,以及为生成式生物分子模型扩展结构数据所面临的挑战,文中提及了AlphaFold3和其他最新模型。
@Nature: 一个新发布的AI工具生成了超过10亿个预测蛋白质结构图谱以及数十亿个…
一个新发布的AI工具生成了超过10亿个预测蛋白质结构和序列的图谱。
结构蛋白质组学引导的共折叠模型
介绍了AIMS-Fold,一种推理时引导扩散框架,整合了交联质谱(XL-MS)和氢-氘交换(HDX-MS)数据,以改善针对诱导接近药物靶点的蛋白质共折叠预测。
ProtStructQA:蛋白质结构推理中的指称阈值
ProtStructQA 引入了一个可执行的蛋白质结构问答基准,该基准将自然语言查询编译为类型化的 DSL 程序,以评估 LLM 在精确 3D 测量上的能力,揭示了一个依赖于能力的指称阈值:当模型规模超过一定大小时,思维链变得非常有益。
基于自然语言引导的生成器无关的蛋白粘合剂设计短名单筛选方法
本文探讨了使用大型语言模型生成排名策略,从候选池中筛选蛋白粘合剂,在从头设计工作流中相较于基线方法显示出适度的性能提升。