生物分子结构预测,是每一个想用计算把”这段序列到底折成什么样”搞清楚的人,这两年绕不开的革命性工具。我刚用 AlphaFold2 那阵,拿到模型兴冲冲就去对接,结果发现一个低置信区被当成刚性模板,下游筛出来的苗头全是错的。后来才懂,生物分子结构预测难的从来不是跑出一个结构,而是你读懂没读懂它给你的那两个置信度数字——pLDDT 和 PAE。

过去拿一个蛋白结构,要么等晶体/NMR 几个月,要么自己摸索同源建模猜。现在 AlphaFold2、OmegaFold、RoseTTAFold 把这件事压到了小时级,做药物的人拿预测结构做虚拟筛选,做酶工程的人拿它找突变位点,做结构生物的人拿它补缺失密度。可以说,生物分子结构预测是你从”序列”到”可用模型”的捷径。很多新手把预测结构当实验结构用,直接拿去对接,等到别人问”你这低置信区靠谱吗”,才发现自己根本没看 pLDDT。更现实的是,预测结构在可信区极准,但在无序区、界面区、稀有折叠区常常塌方,盲目信任会带偏后面一整条链路。
主流方法(以 AlphaFold2 为例)的命脉是多序列比对(MSA):把同源序列堆在一起,进化信息就藏在残基间的共变里——哪些位置倾向于一起变,往往意味着它们在结构里靠得近。网络用 Evoformer 把 MSA 和残基对的几何信息反复迭代,最后解出每个残基的坐标。关键认知是,预测的准头高度依赖 MSA 深度:家族越热门、同源越多,预测越准;孤儿蛋白、人工设计序列 MSA 很浅,预测可信度骤降。pLDDT 告诉你每个残基预测得有多稳(>90 高置信、<50 基本不可信),PAE(预测对齐误差)告诉你不同区域之间的相对位置有多可靠——PAE 块对角清晰说明结构整体可信,模糊则说明区域间关系不确定。
MSA 深度是第一杠杆:用全基因库(如 UniRef30 + BFD)搜,比只用 UniRef90 深得多,孤儿序列可以考虑用语言模型(OmegaFold)绕开 MSA。模板(已知同源结构)能补 MSA 不够时的信息,但模板错了会带偏,要甄别。复合物预测(如 AlphaFold-Multimer)对蛋白-蛋白、蛋白-核酸界面很关键,但界面 pLDDT 普遍偏低,要谨慎。我早年预测一个膜蛋白,MSA 用浅了,跨膜区 pLDDT 只有 60,我还当宝拿去对接,苗头全废;后来加深 MSA 并重搜,跨膜区升到 88,结构才合理。另一个常被忽略的点:多构象,AF2 默认给一个代表结构,柔性大的蛋白可能有多个态,单结构会漏掉功能相关的另一态。
第一步,准备序列,去信号肽/跨膜段标注;第二步,跑 MSA(ColabFold 用 MMseqs2 快速搜),确认深度够;第三步,预测结构,多种子取多个模型;第四步,看 pLDDT 和 PAE 挑最可信的模型,标出低置信区;第五步,用 MD 精炼——把预测结构做短时 MD 松弛,让局部应变释放、侧链归位,再用聚类取代表构象。我习惯把 pLDDT 当使用许可证:高置信区直接当模板,低置信区只作参考并加 MD 探索。对复合物先确认界面 pLDDT 再决定要不要做界面 MD 细化。对无序区我会单独做 MD 或增强采样看其构象分布。
我给学生定规矩:AF2 预测结构拿到手,第一件事不是对接,是看 pLDDT 和 PAE。高置信区才当模板,低置信区一律当柔性处理,要么 MD 探索要么实验验证。把低置信区当刚性模板做设计,苗头全废还找不到原因,这种亏我早年替别人交过,不想让学生再交。
对复合物,我特别谨慎。Multimer 的界面 pLDDT 普遍偏低,我一定用 MD 把界面细化验证,不会拿预测界面直接做结合分析。结构预测是带置信区间的草稿,不是实验结构,这一点想不清,后面从对接到突变设计全踩在不可信的地基上。
无序区我从不强迫它出一个固定结构。AF2 默认给一个代表构象,但柔性大的蛋白可能有多个态,单结构会漏掉功能相关的另一态。我会单独做 MD 或增强采样看其构象分布,把”有可能”的区域如实体报出,而不是假装它已经确定了。
Q1:跨膜区 pLDDT 低?MSA 太浅,加深搜索或换模板。 Q2:界面预测不可信?Multimer 界面普遍偏低,用 MD 细化验证。 Q3:结构和实验对不上?模板带偏或种子少,多模型比对。 Q4:柔性区只给一个态?蛋白可能多构象,做 MD 探索。 Q5:孤儿蛋白塌方?MSA 缺失,换语言模型方法或实验辅助。 Q6:侧链位置怪异?短时 MD 松弛后再取聚类构象。 Q7:要不要当实验结构用?仅高 pLDDT 区可信,低区必须验证。
讲一个具体的坑:有次给一个酶做突变设计,我直接拿 AF2 预测结构里一个 pLDDT 只有 55 的环区当刚性模板去设计,结果合成出来的突变体完全没活性。回头一看,那个环区在 MD 里是大幅摆动的,根本不是预测的那一个姿态。从那以后我固定一条规矩:pLDDT < 70 的区域一律当柔性处理,要么 MD 探索要么实验验证,绝不拿去当刚性模板做设计。另一个常被忽略的点:PAE,只看 pLDDT 会漏掉”局部准但相对位置飘”的情况,我交付前一定把 PAE 图一起看。
回过头看,生物分子结构预测最容易被当成”输入序列出结构”的黑箱,但它真正的价值在置信度解读:pLDDT 告诉你哪准、PAE 告诉你能不能信相对位置、MD 帮你把应变释放。我现在的习惯是 MSA 加深、双置信度筛选、再用 MD 精炼,三步少一步都不敢把预测结构拿去支撑设计。结构预测不是万能晶体,它是带置信区间的草稿。把 MSA、置信度、MD 三件事钉死,拿到的模型才敢往下用。
GROMACS分子动力学模拟的性能调优与并行计算
GROMACS分子动力学模拟的性能调优与并行计算
gpcr分子动力学模拟
gromacs自由能计算
高通量分子筛选:从算力并行到结果聚合的工程化路径
GROMACS分子动力学模拟:从建模到轨迹分析完整流程
Gromacs代算 — 科研用户的GROMACS分子动力学外包服务选型与质量验收指南
高斯加速分子动力学模拟 — GaMD突破常规MD采样瓶颈的原理与实践