蛋白与小分子互作是药物发现和酶调控研究的核心,但它的坑不在”算出个结合模式”,而在”算出的结合模式你敢不敢信”。我见过太多项目止步于分子对接的一张图,拿高分构象当结论,结果实验验证全翻车。本文以激酶抑制剂体系为例,把从对接到自由能验证的链路讲清楚。

对接软件(AutoDock Vina、Glide)打分函数的本质是经验势,它对蛋白柔性、溶剂化、熵的刻画都是近似。我做过一组对照:Vina对12个激酶抑制剂打分排序,和实验Ki的相关性只有0.4——也就是说,打分最高的构象不一定真结合最强。原因很直接:Vina默认刚性蛋白(只动侧链或不动物),而真实结合时蛋白活性口袋会”诱导契合”变性。
被证明有效的做法是:对接只用于生成初始构象集合,不用于定性。我把exhaustiveness提到32(默认8),在结合口袋里撒更多采样点,取前20个构象做聚类,再进MD精炼。这一步把对接从”给答案”降级为”给候选”,心态对了,后续翻车率骤降。关于蛋白互作的对接策略,我也常参考蛋白与小分子互作里对诱导契合的讨论。
提高对接可信度还有一招:多软件交叉。我常把Vina和Glide各跑一遍,取两者都靠前的构象进MD,避免单一打分函数的系统偏差。曾有一个项目Vina把某构象排第1、Glide排第9,MD后证明Glide更准——Vina的柔性处理对那个口袋偏乐观。被证明稳妥的是”交叉验证取交集”,而不是迷信某一个软件的打分。对接这一步的目标本就是降维生成候选,多一个软件只是多一层保险。
对接给的构象放进GROMACS做诱导契合MD(20–50 ns),让蛋白和小分子一起弛豫。我习惯先约束小分子重原子做约束MD 5 ns让口袋适应,再放开全自由度跑20 ns。结果常有意思:Vina给的”第一名”构象在MD里漂移了1.5 Å,氢键网络重组,而Vina原本排第5的构象反而最稳。
关键指标是RMSD和结合腔接触频率。小分子重原子RMSD在MD后半段若稳定<0.25 nm,且和某几个残基的接触频率>70%,这个构象才敢往自由能那步送。纯对接构象直接送自由能是赌博,MD先筛一遍是必须。
MD精炼里有个让新手栽跟头的细节:约束MD的力常数。我先用1000 kJ/mol·nm²的强约束把小分子按对接构象固定,让口袋在5 ns内重新排布水分子和侧链,再降到100弱约束跑5 ns,最后放开。若一开始就全放开,小分子可能被溶剂冲离口袋,前功尽弃。约束弛豫的本质是模拟”诱导契合”的慢过程——蛋白先适应、再让配体微调,顺序反了收敛路径就不自然。
自由能验证我分两层。第一层MM/PBSA做残基分解(per-residue decomposition),把总结合自由能按残基拆解,立刻能看到哪几个残基是”锚点”。在一个激酶体系里,分解显示三个疏水残基(Leu、Val、Ile)贡献了-28 kJ/mol,两个极性残基(Asp、His)贡献了-15 kJ/mol—— hydrophobic + polar 的组合,和已知药效团一致。
第二层用FEP或TI做绝对定量,把预测ΔG和实验Ki对标。MM/PBSA残基分解的误差约2–4 kJ/mol/残基,适合做”谁重要”的排序,不适合做绝对值;FEP误差能压到1 kJ/mol内,但只能算相对量。两层配合:分解定位关键残基,FEP给定量可信度。
FEP定量时我习惯先算相对自由能(突变一个甲基、换一个卤素),再拼成绝对ΔG。比如把结合腔里一个H换成F,FEP给出ΔΔG=-2.3 kJ/mol,说明这个位点是疏水填充利好,合成时优先保住。这种”逐基团贡献”的模式比一次性甩一个总ΔG有用得多——它能直接指导结构优化,客户拿到的是”改哪里、改什么、预期强多少”,而不是一个孤立数字。被证明有效的是把FEP拆成3–5个最小化学变换,每个变换单独算ΔΔG,误差可控且可解释。
蛋白-小分子互作里,水桥(water-mediated)氢键贡献常被漏算。我用gmx hbond加第一水壳层分组,发现一个关键Asn通过水桥间接稳定了抑制剂,去掉水桥后结合自由能虚高3 kJ/mol。还有熵:结合过程构象熵损失很大,MM/PBSA不显式算熵时,总ΔG会偏负(虚强结合),必须用PCA或NMODE补熵项。
另一坑是质子化状态。活性口袋Asp在pH 7下可能去质子化,Glide/Vina默认状态若错,对接构象直接废。我在对接前用PROPKA或H++服务器预测蛋白滴定状态,把关键残基质子化状态钉死,再进流程。
质子化状态之外,还有一个隐雷是金属离子。含Zn的蛋白酶(如MMP金属水解酶)里Zn的配位几何在对接里几乎不可能准,我必须在MD前手动把Zn和三个组氨酸/一个水分子配位建好,并用AMBER的Zn参数(如包含极化项的特殊力场)而不是默认GAFF。曾因偷懒用GAFF描述Zn,结果Zn在MD里脱离配位壳、整个口袋塌了。金属中心的处理,是蛋白-小分子互作里最容易翻车也最值得单独花时间的环节。
回过头看,蛋白与小分子互作研究的诚实边界是:对接给候选,MD筛稳定构象,自由能定量验证——三步缺一不可,且任何一步单用都会翻车。我交付客户的报告,从不对”对接打分高”下结论,只对”MD稳定+自由能可信+残基贡献可解释”的组合下结论。
可复用要点:Vina exhaustiveness≥32、对接构象聚类进MD、MM/PBSA残基分解定位锚点、FEP定量对标实验。这条链路在激酶、GPCR、蛋白酶三类靶点都稳。它的边界在变构位点(allosteric)和蛋白-蛋白界面(flat interface,力场对弱作用描述差),那时需要更长的采样和更谨慎的熵处理,单纯对接+短MD远不够。这条蛋白与小分子互作的三步链路,后来成了我和客户谈交付范围时的标准话术。
对接+MD+自由能这条链,我还会在开头加一步”口袋灵活性评估”:用短MD(5 ns)看口袋残基的RMSF,若口袋本身柔性大,刚性对接的构象库要相应放宽。曾有个激酶在激活环柔性极高,默认对接全锁死,放宽后构象池里才出现那个关键的DFG-out构象。口袋柔性决定对接策略,这步前置能省掉后面大量返工。
蛋白-小分子互作研究,我最坚持的是”三层递进、缺一不可”:对接给候选、MD筛稳定、自由能定量。任何一层单用都翻过车。这套链路现在是我和客户谈范围的基准,也是我对酶、激酶、GPCR三类靶点最有底气的交付方式。
高通量分子筛选:从算力并行到结果聚合的工程化路径
GROMACS分子动力学模拟:从建模到轨迹分析完整流程
Gromacs代算 — 科研用户的GROMACS分子动力学外包服务选型与质量验收指南
高斯加速分子动力学模拟 — GaMD突破常规MD采样瓶颈的原理与实践
GROMACS计算自由能 — 从伞形采样到结合自由能的实战复盘
高斯分子动力学模拟 — 从Born-Oppenheimer MD到轨道动力学的方法复盘
Gromacs模拟计算:从建模到自由能的完整经验指南
GROMACS分子动力学模拟:生物分子实战经验全分享
计算化学模拟:从量子化学到分子动力学的工具选择与方法边界
分子动力学模拟势函数 — 从Lennard-Jones到机器学习势的选型艺术
LAMMPS计算表面张力 — 压力张量法与测试面积法的工程实践
LAMMPS分子动力学模拟 — 从in文件编写到后处理的全链路工程复盘
LAMMPS计算服务 — 从in文件定制到并行效率优化的全流程外包方案
分子动力学模拟拉伸 — 单轴拉伸应力-应变曲线的原子级获取
分子动力学模拟粗粒化 — 从全原子到MARTINI的映射策略与精度验证
分子结构预测 — AlphaFold3与MD联用的蛋白质动态构象系综采样
钙钛矿分子动力学模拟:力场参数化与相变分析的实战经验
vasp计算分子动力学模拟:从头算分子动力学方法与实战
生物分子动力学模拟:蛋白质/核酸/膜体系模拟方法
酶分子动力学模拟:催化残基运动与底物结合分析
AIMD分子动力学模拟:第一性原理MD计算方法与应用
平衡分子动力学模拟:NVT/NPT系综平衡策略与判据
AMBER分子动力学模拟:生物分子力场与tleap建模详解
薛定谔分子动力学模拟 — Schrödinger软件中Desmond模块的实战深度复盘