
从结构预测到动态预测:科学界面临的新挑战
自AlphaFold2问世以来,蛋白质结构预测领域取得了革命性突破,然而生物学功能不仅依赖于静态结构,更取决于蛋白质在多种构象之间的转换能力以及这些构象互换的时间尺度。与我们对单一结构日益强大的预测能力相比,对蛋白质运动(动力学)的预测能力仍然相形见绌。结构预测的成功得益于蛋白质数据银行(PDB)中数万条结构数据以及大规模测序数据的支撑,但预测蛋白质动力学所缺少的恰恰是结构预测曾经拥有的东西:大规模、标准化的实验观测基准。无论基于深度学习的预测方法还是传统的分子动力学模拟,当前都面临着标准化实验数据匮乏的困境——特别是微秒至毫秒(μs-ms)时间尺度的动态,而这恰恰是酶催化、别构调控、配体结合等关键生物过程所依赖的运动模式。
创新思路:从NMR谱图的“空白”中挖掘动态信息
斯克里普斯研究所和霍华德·休斯医学研究所Dorothee Kern课题组通过精心梳理超过100个核磁共振(NMR)弛豫数据集,发现了一个被长期忽视的现象:毫秒级动态会导致NMR信号展宽至检测限以下,使得生物磁共振数据银行(BMRB)中约10,000个蛋白质的化学位移数据集的某些残基无法被指认。研究团队大胆假设这些缺失指认的残基主要是由μs-ms时间尺度的交换展宽所致,并以此为核心训练标签开发了深度学习模型。令人瞩目的是,这些模型不仅能够预测哪些残基的指认会缺失,还能准确预测通过NMR弛豫实验独立测量的交换信号(Rex)——这是μs-ms动态的直接证据。表现最佳的模型利用多模态语言模型ESM-3的中间层,被命名为Dyna-1。值得注意的是,与生物学功能直接相关的动态——包括酶催化和配体结合——被Dyna-1预测得尤为准确,这与研究团队发现经历μs-ms交换的残基更为保守的结论相一致。相关论文以“Learning millisecond protein dynamics from what is missing in NMR spectra”为题,发表在 Nature上。

弛豫数据库揭示动态与保守性的关联
研究团队最初编译了163个蛋白质结构域的R1/R2/hetNOE弛豫数据集,经过严格筛选——排除具有大量缺失数据或因ps-ns运动表明存在无序区域的蛋白质——最终构建了名为“RelaxDB”的标准化数据库,包含133个蛋白质结构域的主链酰胺¹⁵N弛豫测量数据。为准确识别μs-ms交换,团队开发了一套系统考虑各向异性效应的方法。以蛋白质GB3为例,其螺旋结构导致的各向异性运动在R2/R1比值上产生特征性“锯齿”图案;高度各向异性的螺旋束蛋白alpha-spectrin也呈现类似特征。而Cas9抑制剂AcrIIA4和β-内酰胺酶中某些残基则表现出超出各向异性预期的升高R2/R1值,真实体现了μs-ms交换信号(图1c)。通过对hetNOE与dR2/R1的联合分析发现,许多具有低hetNOE的残基同时具有负的dR2/R1值——这是因为ps-ns时间尺度的运动会同时降低hetNOE和R2值;少数残基同时表现出通过hetNOE检测到的快速运动和指示μs-ms交换的升高的dR2/R1。值得注意的是,该方法可能低估了μs-ms交换,因为当多个时间尺度的运动同时存在时,μs-ms交换升高R2而ps-ns运动降低R2,二者效应可能相互抵消(图1d)。在RelaxDB中,约5%的残基具有μs-ms交换,4%的残基存在缺失指认(图1e)。通过计算序列保守性,研究团队发现一个显著趋势:经历μs-ms交换的残基比无指定运动标签的残基更为保守,而无标签残基又比具有ps-ns运动的残基更为保守。值得注意的是,与弛豫数据中缺失指认的残基在保守性上与明确检测到μs-ms交换的残基无统计学差异(图1f),这为利用缺失指认作为动态代理标签提供了关键支撑。

图1. 133个蛋白质NMR主链弛豫测量基准数据库显示,具有ps-ns运动的残基保守性较低,而具有μs-ms交换的残基保守性更高。(a)许多生物学过程发生在μs-ms时间尺度,然而该尺度上的实验数据尚不足以支撑机器学习。NMR的R1、R2和异核NOE(hetNOE)测量ps至低ns时间尺度的运动,而毫秒时间尺度的交换会导致R2升高(Rex)。(b)研究团队整理的“RelaxDB”基准数据库包含133个单结构域¹⁵N蛋白质主链数据集,每个残基均附有运动性质的标签。饼图显示了RelaxDB中数据的来源。(c)示例蛋白质的原始R2/R1数据(黑色)与刚体翻滚理论计算值的比较,用于获取标签。标签以图例中不同颜色显示,并映射到AF2预测的结构上。R2/R1数据的误差棒计算为作者报告的不确定度与从数据估计的不确定度两者中的最大值。(d)hetNOE与实验值和刚体翻滚理论计算值之间R2/R1变化量的分布。蓝色:ps-ns运动;橙色:μs-ms交换;灰色:无标签。(e)RelaxDB标签的分布。(f)计算这些残基的序列保守性表明,具有μs-ms交换的残基比无指定标签的残基更保守,而无标签残基比具有ps-ns运动的残基更保守。主链酰胺指认缺失的残基在保守性上与具有μs-ms交换的残基无差异。n=12,584个残基。箱线图显示中位数和25/75%四分位距,须线=1.5×四分位距。统计学比较采用双尾独立样本t检验;未进行多重比较校正。:0.01≤p≤0.05;***:p≤0.0001。
千万级训练集的构建:mBMRB数据库
意识到BMRB中约10,000个蛋白质的缺失指认信息具有巨大潜力,研究团队系统性地构建了“mBMRB”数据集(图2a-b)。通过去除氘代、甲基标记等特殊标记样品,并过滤短序列和连续缺失超过15个残基的条目——该阈值基于RelaxDB中连续缺失的最大值为14残基——最终获得9,381个蛋白质(图2b),相比RelaxDB大两个数量级。对该数据集分析发现,缺失指认广泛分布于各种氨基酸类型和二级结构中,尤其在loop区域更为常见(图2d)。重要的是,约45%的蛋白质(2,680/5,906)仅有NMR结构而无X射线或电镜结构(图2e),且缺失NMR指认的残基与X射线/电镜结构中缺失电子密度的残基基本不重叠(图2f-g),B因子分布也无明显差异(图2h),证明mBMRB包含了PDB结构信息之外的独特动态信息。

图2. BMRB中缺失的NMR酰胺主链指认被用作μs-ms交换的标签。(a)在寻找更多μs-ms动态实验数据时,研究团队意识到BMRB中约10,000个蛋白质的数据以缺失主链酰胺指认的形式存在。图中展示了不同时间尺度下双位点交换的理论NMR线形。(b)“缺失指认BMRB”(mBMRB)数据集的整理流程。(c)缺失主链酰胺比例与序列长度的关系,不考虑脯氨酸或未指认的末端。(d)按氨基酸类型和二级结构类型分组的缺失主链酰胺比例,结构由ESMFold预测。(e)BMRB中大多数蛋白质仅有一个NMR结构且无X射线或电镜结构。(f)NMR峰缺失的残基与X射线/电镜结构中缺失的残基明显不同——以DUSP 16的MAP激酶结合结构域为例(BMRB:19330,PDB:3TG3)。指认缺失的残基为红色,X射线密度缺失的残基为蓝色。(g)mBMRB中指认/未指认残基与X射线/电镜结构中解析/未解析残基的对比显示重叠很少。(h)NMR峰存在或缺失的残基的B因子分布相似。实线:中位数,虚线:25/75%百分位数。在(g-h)中:n=71,704个蛋白质数据集,n=306,842个残基。统计学比较采用双尾独立样本t检验;未进行多重比较校正。****:p≤0.0001。
深度学习模型展现卓越预测能力
基于mBMRB数据集,研究团队比较了多种深度学习架构,包括基于AF2对表示的结构聚焦模型、基于ESM-2的序列-only模型,以及利用多模态语言模型ESM-3同时捕捉序列与结构相互作用的架构(图3b)。结果表明,基于预训练模型的架构显著优于朴素基线(图3c),其中表现最佳的是利用ESM-3第22层并结合序列与结构信息输入的模型,AUROC达0.77。在最为严格的训练集划分(30%序列同一性,TM-score 0.5)下,Dyna-1在验证集上的AUROC仍达0.74(图3d),且从最宽松到最严格训练集之间未观察到任何单个蛋白质AUROC的显著跳跃,排除了模型记忆训练数据的可能性。研究团队将这一最终模型命名为“Dyna-1”。
对mBMRB测试集中各蛋白质的AUROC分析显示(图3e),Dyna-1对多个蛋白质的缺失指认预测表现优异。以核糖核酸酶毒素MqsR为例(图3f-iii),Dyna-1预测β2-β3环具有高缺失概率——文献确实报道该环存在交换,其柔性与其结合mRNA的能力相关;抗毒素MqsA并非直接抑制其活性位点,而是通过隔离β2-β3环并限制其运动来发挥抑制作用。在端粒酶蛋白Pof8中(图3f-iv),Dyna-1预测α2-β4环具有高缺失概率但这些残基实际已被指认——然而原作者明确描述该环因“严重线宽展宽”而难以指认并分析弛豫数据,这正是μs-ms交换的明确指标。

图3. Dyna-1架构及其在mBMRB测试集上的表现。(a)数据集划分方案和Dyna-1训练流程。(b)用于生成残基级别预测的三种架构示意图:AF2对表示、ESM-2序列嵌入和ESM-3多模态嵌入。(c)不同模型在mBMRB验证集上的AUROC(左)和AUPRC(右)比较。基于预训练模型的架构显著优于朴素基线。(d)使用不同序列同一性和结构相似性截断训练时,Dyna-1在验证集上的AUROC。(e)mBMRB测试集中各蛋白质的AUROC,按至少有一个缺失指认的蛋白质计算。蓝色标注的蛋白质如(f)所示。(f)Dyna-1预测示例。结构由ESMFold根据mBMRB序列生成(i-iv分别对应BMRB条目5977、50787、51503和50002),管的粗细表示Dyna-1预测的缺失概率。残基按实验数据着色:红色——主链指认缺失,灰色——指认存在,紫色——脯氨酸(无数据)。
跨任务迁移验证:预测弛豫实验中的交换信号
将Dyna-1应用于RelaxDB数据集时,预测缺失指认的任务上各模型表现与mBMRB验证集和测试集相当(图4a-i)。更重要的是,当仅考察已被指认但存在交换的残基时——即测试模型能否泛化到训练数据之外——模型性能虽有所下降,但基于ESM-3、ESM-2和AF2的模型均显著优于对照组(图4a-i),证明Dyna-1能够从预测缺失指认“迁移”到预测可指认残基中的交换。将两类交换信号(缺失指认与可检测到的Rex)合并评估时(图4a-ii),ESM-3第22层(同时输入序列和结构)仍表现最佳。
分析RelaxDB中各蛋白质AUROC与序列长度的关系(图4b),研究团队发现部分蛋白质AUROC低于0.5。深入阅读原始文献后发现,其中22个低分蛋白质中有10个(45%)是DNA/RNA结合蛋白或信号结构域——其生物学功能本应与磷酸基团相互作用,却在实验中使用了磷酸盐缓冲液,导致正电荷表面残基产生非特异性交换伪迹。移除这些蛋白质后Dyna-1的总体AUROC从0.63提升至0.66。
生物学相关动态的精准预测
在牛胰蛋白酶抑制剂(BPTI)中,Dyna-1预测Cys14、Lys15、Cys38和Arg39具有高交换概率(图4c),这些残基已知因二硫键异构化而发生毫秒级构象转换——Shaw等人通过分子动力学模拟也鉴定出该区域存在5个动力学上不同的状态。在更大的蛋白质中(图4d),Dyna-1同样精准预测了具有生物学意义的动态区域:黄素氧还蛋白YcqA中FMN配体结合位点的环区和螺旋区;人嗅觉标记蛋白中被报道具有显著Rex且高度保守的ω-loop(该环现已知作为核输出信号);APOBEC-2中在结构同源物内控制DNA底物特异性的区域。尤其值得关注的是结核分枝杆菌酪氨酸磷酸酶MptpA——Dyna-1在含有apo与holo结构间取向差异残基(W48、Y128、Y129)的环区预测高交换概率(图4d),这些残基被推测参与调节酶的特异性。
进一步分析表明(图4e-f),Dyna-1对更保守的残基具有最强的预测能力,在核心区螺旋和表面环中表现最佳,这与其在单个蛋白质上的观测结果一致。对于MAP激酶p38γ这类高度动态蛋白质——其ps-ns和μs-ms过程遍布整个结构,Dyna-1预测的交换概率普遍较高——区分多重时间尺度动态将是未来改进的方向。此外,在研究Dyna-1在RelaxDB中的预测并重新审视原始数据集时,团队发现了多处无弛豫数据但有其他交换证据的残基,进一步证实了Dyna-1的预测能力。

图4. Dyna-1可预测NMR弛豫数据中具有生物学意义的微秒-毫秒动态。(a)代表性模型在(i)RelaxDB中的缺失指认、(ii)已被指认但存在Rex的残基、(iii)缺失指认与Rex合并后的评估结果。误差棒表示在RelaxDB中各蛋白质上评估的平均AUROC的95%置信区间(n=112个蛋白质)。(b)Dyna-1在RelaxDB中每个蛋白质的AUROC与序列长度的关系,同时考虑缺失指认和具有Rex的残基。仅显示至少有2个残基具有缺失指认或交换的蛋白质。棕色:因磷酸盐缓冲液产生交换的蛋白质;蓝色:高p(exchange)主要位于ps-ns运动区域的蛋白质(参见扩展数据图7);橙色箭头:对无弛豫数据残基的后续研究导致AUROC提升的蛋白质(参见c、d)。(c)Dyna-1对较小蛋白质的预测为与实验数据的详细比较提供了机会。BPTI与R2/R1实验数据及分子动力学中动力学不同底物的异质性一致。汞转运蛋白、SMN Tudor结构域和NtrC接收结构域为高p(exchange)但无可用数据(黑色)、却有其他Rex证据(橙色箭头)的残基提供了前瞻性测试。R2/R1误差棒来自原始整理数据集。(d)代表性较大蛋白质的Dyna-1预测。生物学相关特征以灰色标注。Dyna-1对结核分枝杆菌磷酸酶MptpA的预测重现了NMR测量以及调节特异性侧链(W48、Y128、Y129)的结构异质性(apo: 2LUO,holo: 1U2P)。(e)按核心/表面定位和二级结构类型分组的残基的AUROC表明,Dyna-1在核心区螺旋和表面环中预测能力最强。(f)按核心/表面定位和序列保守性分组的AUROC表明,Dyna-1对更保守的残基预测能力最强。在(e-f)中,条形表示均值;误差棒表示通过自助法(bootstrap)估计的标准误(n=13,810个残基)。
超越常规分析的预测能力:CPMG数据的重新解读
研究团队将Dyna-1应用于直接表征μs-ms交换的¹⁵N CPMG弛豫色散数据(图5)。常规数据处理中(图5a橙色),Rex由最低CPMG场强下R2,eff与R2,eff所趋近的平台值之差估算。然而对亲环蛋白A(CypA)Arg148残基的检查发现(图5a绿色),其R2,eff在所有使用的B1场强下均保持高值——这表明存在微秒时间尺度的交换,但该交换发生太快而无法被所使用的CPMG场强有效抑制。研究团队因此开发了利用HYDRONMR预测各向异性效应来系统性识别未被抑制Rex的新方法(图5b-c)。应用该方法后,全部6个可获得完整色散数据的蛋白质(CypA、β-内酰胺酶、腺苷酸激酶、胆绿素还原酶B、K-Ras和双特异性磷酸酶)的AUROC均得到提升(图5d-e)。在CypA中,Dyna-1正确预测了β-折叠片中存在已知的协同毫秒动态(涉及Ser99、Phe113、Met61和Arg55侧链),同时正确预测另一面的β-折叠片无交换。对于腺苷酸激酶,研究团队使用AF2预测的开放和闭合两种状态分别作为输入——Dyna-1在已知发生构象变化的区域预测了高交换概率。在K-Ras中,Dyna-1预测了开关I和II区域的协同毫秒动态,这些区域对其信号传导活性至关重要。

图5. Dyna-1甚至能预测常规CPMG数据分析所遗漏的交换。(a)亲环蛋白A(CypA)三个残基的¹⁵N CPMG示例数据。误差棒代表谱图背景噪声。Rex通常通过最低场强下R2,eff与R2,eff所趋近的平台值R2^0之差估算。然而Arg148(绿色)的R2,eff表现出不同行为:在所有使用的B1场强下R2,eff均保持高值,表明存在微秒时间尺度的交换,该交换太快而无法被所使用的CPMG场强抑制。(b)CypA的AF2结构,管粗细表示Dyna-1的p(exchange)。右侧图例显示实验数据的着色方案。Dyna-1预测Arg148具有高交换概率。(c)研究团队开发了一种利用HYDRONMR预测R2的数据处理方法,以系统性地指认具有Rex的残基——其中R2,eff被CPMG脉冲序列抑制的为常规Rex(橙色),以及具有升高、未被抑制的Rex的残基(绿色)。图中展示了CypA在25°C采集的代表性数据。(d)纳入未被抑制Rex的标签后,全部6个可获得完整色散数据用于再处理的蛋白质的AUROC均得到提升(绿色箭头所示)。同时显示了无法获得所有残基色散数据、而是根据文献描述整理残基标签的蛋白质的AUROC。(e)使用¹⁵N CPMG表征动态的若干蛋白质的代表性实验数据和Dyna-1预测。对于腺苷酸激酶,使用AF2预测的开放和闭合状态结构作为Dyna-1的输入。
前瞻性实验验证
为前瞻性验证Dyna-1,研究团队从mBMRB测试集中选取了两个此前无弛豫数据的蛋白质进行新的NMR实验(图6)。来自Bryum coronatum的几丁质酶19(BMRB:11441)具有高预测交换概率,而假设蛋白yjbJ(BMRB:5105)预测交换概率低(图6a-c)。¹⁵N CPMG弛豫色散实验证实:几丁质酶在其活性中心和几丁质结合环区确实存在广泛的交换(图6b,e),而yjbJ仅在第2和3位残基检测到可察觉的交换(图6c-d)。在残基水平上,Dyna-1对几丁质酶的AUROC达0.62,对yjbJ达0.72。

图6. Dyna-1在前瞻性实验测试中对酶促运动具有预测能力。(a)mBMRB测试集中Dyna-1预测的蛋白质在序列长度和螺旋/折叠含量上均表现出较宽的p(exchange)均值分布。研究团队选择了两个蛋白质进行Dyna-1预测的前瞻性实验测试:(b)来自Bryum coronatum的几丁质酶19,和(c)假设蛋白yjbJ。(b、c、d)中的残基着色与图5相同。(d)¹⁵N CPMG弛豫色散显示yjbJ仅有两个N-末端残基表现出色散曲线,而几丁质酶在活性中心和几丁质结合位点具有广泛的交换。(e)几丁质结合位点区域I162和L167的代表性¹⁵N CPMG色散数据。
展望:开启动态生物学的新范式
AlphaFold2之所以能够从根本上改变分子生物学的进程,得益于结构预测竞赛(CASP)中明确定义的任务和PDB中大量标准化数据的支撑。尽管人们普遍认识到理解蛋白质动力学对理解蛋白质功能至关重要,但对动态的实验测量——这些测量曾揭示别构调控、特异性、催化等众多生物学功能的基础原理——一直未能被系统地收集为标准化数据集。Dyna-1所展现的预测能力强烈提示:领域亟需系统性地沉积大分子动态实验数据。NMR领域的一个障碍在于测量动态的实验种类繁多且看似复杂。本研究明确界定了一个清晰的任务——对具有μs-ms交换的残基进行分类——并证明了模型在多种实验数据类型(缺失指认、R1/R2/hetNOE中的Rex、CPMG中的多种交换指标)上均具有预测能力。
Dyna-1从缺失指认中学习到预测能力,尽管当前公开数据存在诸多问题——研究团队所使用的原子指认列表仅是NMR数据处理的终点,谱图本身无需沉积,缺乏标准化的谱图沉积要求是科学界的重大损失。峰宽与R2相关,如果每个指认数据集哪怕只被要求沉积一张代表性谱图,科学界本可拥有相当于RelaxDB信息量两个数量级以上的数据。
Dyna-1的进一步改进无疑存在:例如ESM-3未使用侧链信息进行训练,而侧链信息很可能提升预测性能;此外Dyna-1仅在400残基以下的蛋白质上训练,可能限制了其对更大蛋白质动态的预测范围。值得注意的是,将30%序列同一性、0.5 TM-score截断的严格训练集与80%序列同一性、1.0 TM-score截断的宽松训练集相比,性能仅略有提升——这表明未来的模型改进可能需要架构创新,而非仅靠增加数据量。
象泰配资提示:文章来自网络,不代表本站观点。