@beckypferdehirt:大多数PDB结构显示一种冻结构象。但蛋白质不是静态的。来自@radials…的@stephanie_mul的新工作…

X AI KOLs Timeline 论文

摘要

研究人员使用qFit重新处理了约80,000个高分辨率PDB结构,以恢复隐藏的构象异质性,生成了超过60,000个多构象模型——迄今为止最大的实验衍生系综数据集,在约90%的情况下拟合效果有所改善。

大多数PDB结构显示一种冻结构象。但蛋白质不是静态的。 来自@radialscience的@diffUSEproject的@stephanie_mul的新工作使用qFit重新处理了约80,000个高分辨率PDB结构,恢复了隐藏的构象异质性。结果:60,000多个多构象模型,这是迄今为止最大的实验衍生系综数据集。在约90%的情况下,对数据的拟合更好(R-free更低)。 基于MD的系综预测器受限于模拟时间和力场精度。这个数据集则直接从X射线/冷冻电镜数据中提取真实的系综信号。 论文、代码、数据: https://thestacks.org/publications/qfit-at-scale…
查看原文
查看缓存全文

缓存时间: 2026/08/14 15:36

大多数PDB结构展示的是单一的冻结构象。但蛋白质并非静态的。

来自@stephanie_mul在@radialscience的@diffUSEproject的新工作,利用qFit重新处理了约80,000个高分辨率PDB结构,恢复了隐藏的构象异质性。结果:60,000多个多构象模型,这是迄今为止最大的实验来源的集合数据集。在约90%的案例中,对数据的拟合更好(更低的R-free)。

基于分子动力学(MD)的集合预测器受限于模拟时间和力场精度。该数据集直接从X射线/冷冻电镜数据中提取真实的集合信号,而非依赖模拟。

论文、代码、数据: https://thestacks.org/publications/qfit-at-scale…


从蛋白质数据银行大规模恢复构象异质性

来源:https://thestacks.org/publications/qfit-at-scale

目的

蛋白质是由相互转换的构象组成的动态集合。这个集合,而非任何单一结构,决定了催化、突变效应和分子识别等功能。预测蛋白质构象集合是结构生物学的核心目标之一,但进展受限于训练数据的短缺。当前的集合预测器依赖于分子动力学模拟,这些模拟在数量上有限,且受制于力场精度和可访问的时间尺度。实验结构数据是训练结构集合预测器的替代数据的未开发来源。X射线晶体学和冷冻电镜测量蛋白质的许多拷贝,并在空间和时间上取平均,因此数据编码了状态的集合。传统精修将这个信号压缩为一组单一的坐标。因此,大多数蛋白质数据银行(PDB)的存放条目报告的是一个单一的平均结构,使得潜在的异质性未被建模,隐藏在实验数据中。在这里,我们应用qFit来大规模恢复这种潜在的异质性信号。从分辨率优于2 Å且存放了结构因子的结构出发,我们重新精修它们并运行qFit多构象建模。这产生了超过60,000个完整的多构象模型,这是迄今为止最大的实验来源的蛋白质结构集合数据集,涵盖了广泛的序列和结构多样性。83.7%的结构在qFit多构象模型下比存放的、重新精修的模型具有更低的R_free。这些模型识别出了存放模型中缺失的广泛侧链异质性。该资源旨在帮助解决集合预测中的数据瓶颈,并将PDB中存放的实验数据重新定位为集合信息的来源。

背景

静态结构预测已被机器学习预测器所变革1–7。然而,蛋白质并非静态的。它们以动态集合的形式存在,包含相互转换的构象8。这个集合,而非任何单一结构,驱动着生物学功能,支配催化、突变效应和分子识别9–10。

预测集合比预测单一结构困难得多,因为目标是加权状态的分布,而不是一组单一的坐标11。除了显著更困难的学习问题之外,学习该分布所需的训练数据稀缺。当前的集合结构预测器在分子动力学(MD)数据上训练并进行基准测试3, 12–14。然而,模拟受限于力场精度、可访问的时间尺度以及训练集的多样性15–17。准确预测构象集合将需要多得多的训练数据。

一个未开发的训练数据资源是用于推导静态结构的实验数据。X射线晶体学和冷冻电镜(cryo-EM)测量数万到数十亿个蛋白质拷贝。这些测量随后在空间和时间上进行集合平均,因此实验数据携带了关于状态集合的信息。虽然晶体堆积和低温限制了可访问的构象空间,但它们并未消除异质性18。然而,传统的建模和精修将这个信号压缩成一个单一的、近似的结构。因此,大多数蛋白质数据银行(PDB)存放条目报告一组单一的平均坐标19–21。这些模型帮助解锁了静态结构预测。实验数据中未建模的异质性本身就是集合的资源。恢复它将显著增加可用的集合训练数据。

然而,识别和建模实验数据中潜在的构象异质性很困难。这通常需要手工操作,使用诸如Coot等可视化工具22来识别通常为亚埃级别的差异。这因低密度和来自许多来源的噪声而复杂化,包括晶体缺陷、辐射损伤和较差的初始建模18, 23–24。手工建模要在整个PDB范围内扩展将极其困难。为了使多构象建模常规化且客观,我们先前开发了qFit25–27。qFit接受一个精修后的单构象结构和一个高分辨率X射线或冷冻电镜实空间图谱作为输入。然后它使用优化算法来识别替代的蛋白质25, 27或配体26构象,补充手工建模。

qFit生成多构象模型28。多构象模型在单一组坐标内表示构象异质性。它在局部将替代状态编码为altloc标记的构象,并赋予每个状态一个与占据率成比例的群体权重。仅当密度需要时才添加altloc,因此有序区域可以由单一构象建模,而更多异质性的区域可以由多个构象建模。相比之下,集合模型将异质性表示为系统的多个完整拷贝。一个采用若干构象的区域会出现为自身的几个略有不同的版本,每个拷贝一个,群体从拷贝的分布中读取,而不是从任何一个单一拷贝中读取。拷贝数量由精修协议设定,而不是由密度的局部复杂性决定,因此即使是高度有序的区域也会在每个模型中被复制29。

在这里,我们对近80,000个分辨率为2 Å或更好且存放了结构因子的PDB结构运行了qFit。在大多数结构中,qFit改善了对实验数据的拟合,并识别出存放数据中潜在的额外构象异质性。这产生了迄今为止组装的最大的多构象蛋白质结构数据集,有助于解决约束集合预测的数据瓶颈。除了集合预测之外,它还为系统研究构象异质性如何影响变构、大分子相互作用和突变提供了丰富资源30–32。

数据生成

初始数据集包括来自PDB Redo的所有分辨率达到2 Å或更好的结构(2024年12月下载;n=80,876)。仅由核酸组成的结构被移除(n=1,043)。然后我们使用如下所示的参数,通过phenix.refine重新精修所有模型33。这个重新精修的结构被用作“存放的”比较对象。随后我们生成一个复合omit图谱,用于运行qFit(版本2025.3),使用默认参数28。最后,我们使用*phenix.refine.*运行qFit后的精修脚本。最终的精修周期在下文概述,并与重新精修的模型相匹配。复现该流程所需的所有代码和参数可在qFit仓库中获得:https://github.com/ExcitedStates/qfit-3.0。所有重新精修的模型(PDB和CIF)、qFit模型(PDB和CIF)以及FASTA文件都包含在Zenodo存储中(https://zenodo.org/records/20801853)。

phenix.refine \
"${pdb}.pdb" \
"${pdb}.mtz" \
"$ligand_cif" \
refinement.main.number_of_macro_cycles=5 \
refinement.main.nqh_flips=True \
refinement.refine.adp.individual.isotropic=all \
refinement.output.write_maps=False \
refinement.hydrogens.refine=riding \
refinement.main.ordered_solvent=True \
refinement.target_weights.optimize_xyz_weight=true \
refinement.target_weights.optimize_adp_weight=true \
ordered_solvent.mode=every_macro_cycle

数据集描述

在进入流程的79,833个结构中,60,549个(85.9%)生成了完整模型。在完成的结构中,中位分辨率为1.70 Å(范围:0.5–2.0 Å)。中位残基数为298(范围:3–2,338)(图1(https://thestacks.org/publications/qfit-at-scale#figure1))。每个结构的链数分布(范围:1-36)。重新精修的模型的中位R_free为0.198(范围0.06–0.71),中位R_work为0.17(范围0.06–0.68)。R_free随分辨率变差而适度上升(斜率0.062,R2 = 0.22)(图2(https://thestacks.org/publications/qfit-at-scale#figure2))。中位R_free约为0.2,对应于实验数据与模型之间约20%的残差分歧。该残差部分反映了将集合平均数据简化为离散模型的局限性,而非实验误差34–35。所有模型均位于Zenodo存储中(https://zenodo.org/records/20801853)。

图1.qFit多构象模型数据集概览(n = 60,549)。A. 分辨率分布;中位分辨率1.70 Å(范围0.50–2.00 Å)。B. 每个结构的总残基分布;中位298个残基(范围3–2,338)。C. 每个结构的链数分布(范围:1-36)。

图2.qFit多构象模型的数据描述(n=60,549)。A. R_work的分布。B. R_free的分布。C. 分辨率与R_free之间的关系(斜率:0.062,R2:0.22)。

为了评估数据集的多样性,我们在序列和结构层面将条目进行聚类。使用MMseqs2 36进行序列聚类,在30%序列一致性下产生16,133个簇,其中许多是单例,在90%序列一致性下产生25,608个簇。使用Foldseek进行结构聚类产生6,590个簇37。

多构象模型改善了对实验数据的拟合

为了评估多构象建模是否改善了对数据的拟合,我们将每个qFit多构象模型的R_free与相应的重新精修的PDB-Redo模型的R_free进行了比较。在60,549个模型中,qFit使R_free平均降低−0.009,中位数降低−0.01(图3(https://thestacks.org/publications/qfit-at-scale#figure3)A/B)。个体结果差异很大,范围从下降0.320到上升0.310,标准差为0.026。然而,54,274个(89.7%)结构在qFit下比存放的、重新精修的模型具有更低的R_free。虽然R_free的平均改善幅度很小,但通过识别和建模构象异质性,它代表了对数据拟合的真实改善(见下文)。此外,R_free的改善部分被异质性模型周围较差的溶剂拟合所掩盖38。值得注意的是,有一小部分结构(1.3%;n=802)中qFit产生了显著更差的R_free,定义为R_free增加超过0.05。检查这些结构时,我们无法找到解释这种R_free增加的模式;这仍是正在进行的工作的主题。

图3.存放模型与qFit模型之间R_free的比较。较低的R_free表示对实验数据的拟合更好。A. 存放R_free与qFit R_free的散点图。对角线以下的点表示qFit模型对数据的拟合更好。B. 每个结构R_free差异(存放值减去qFit值)的直方图。

与静态结构相比,多构象模型具有显著更多的构象异质性

我们使用均方根波动(RMSF)和替代构象(altlocs)的数量来量化qFit模型相对于存放模型的额外异质性。RMSF测量原子位置在建模的构象体之间的空间分布,并捕捉qFit通过多构象建模引入的离散位移的幅度。altloc数量是每个残基分配的离散替代构象的计数,直接衡量qFit从密度中解析出多少不同的构象状态。

在存放模型和qFit模型中,大多数残基有一个altloc(90.4%)(图4(https://thestacks.org/publications/qfit-at-scale#figure4)A)。qFit增加了9.4%残基的altloc数量。在获得构象的残基中,单个额外altloc最常见,为4.9%,其次是两个(3.6%)和三个(0.8%)。丙氨酸、甘氨酸和脯氨酸的额外altloc最少,而亮氨酸和半胱氨酸最多(补充图1(https://thestacks.org/publications/qfit-at-scale#sfig1))。只有0.2%的残基的altloc建模数量有所减少。

在整个数据集中,qFit相对于存放模型使RMSF平均增加0.13 Å,中位差异为0,这与大多数残基没有建模替代构象一致(图4(https://thestacks.org/publications/qfit-at-scale#figure4)B)。然而,一小部分残基显示RMSF大幅增加。毫不奇怪,氨基酸链越长,qFit RMSF越大,其中赖氨酸、精氨酸、谷氨酸和谷氨酰胺的RMSF变化最大(补充图2(https://thestacks.org/publications/qfit-at-scale#sfig2))。与altloc的移除一样,少数残基显示RMSF降低。

图4.qFit与存放模型之间每个残基的altloc数量和RMSF的变化。A. 相对于存放模型,所有qFit模型中每个残基altloc数量差异的分布。y轴以对数刻度显示残基数量。相对于存放模型,9.4%的残基在qFit模型中获得了altloc。B. 相对于存放模型,所有qFit模型中每个残基RMSF差异的分布。y轴以对数刻度显示残基数量。qFit相对于存放模型使RMSF平均增加0.13 Å。中位差异为0 Å。

即使精修统计出色的结构也可能包含存放模型未捕捉的构象异质性。例如,死亡相关蛋白激酶1(DAPK1)与白藜芦醇复合物的晶体结构(PDB 7CCU;图5(https://thestacks.org/publications/qfit-at-scale#figure5)A)。该结构的分辨率为1.65 Å,R_free为0.189,R_work为0.172,约等于我们数据集的中位值。按这些指标衡量,该模型质量相对较高。然而,存放模型没有建模任何替代构象。应用qFit流程后,我们将R_free降低到0.1812,R_work降低到0.159,表明对散射因子的拟合有虽小但有意义的改善。在整个结构中,我们发现约60%(164/277)的残基至少有一个altloc,31%(85/277)的残基有超过2个altloc。当移除存在于相同rotamer阱内的altloc时,我们仍然看到52%(144/277)和17.3%(48/277)的残基分别有一个或多个altloc。图5B

相似文章

结构蛋白质组学引导的共折叠模型

arXiv cs.LG

介绍了AIMS-Fold,一种推理时引导扩散框架,整合了交联质谱(XL-MS)和氢-氘交换(HDX-MS)数据,以改善针对诱导接近药物靶点的蛋白质共折叠预测。

自然界蛋白质折叠的不合理冗余

Hacker News Top

来自Ligo的一篇博客文章,讨论了天然蛋白质折叠的冗余性,以及为生成式生物分子模型扩展结构数据所面临的挑战,文中提及了AlphaFold3和其他最新模型。