蛋白分子对接预测,是每一个想用计算替实验筛先导化合物的人必须跨过的一道坎。我刚接触对接那会儿,把配体往蛋白活性口袋里一丢,软件吐出一堆打分排名第一的构象,我如获至宝拿去给药理学的同事,结果湿实验一个都不中。当时很受挫。后来才慢慢明白,蛋白分子对接预测真正的价值不在那个排名第一的分数,而在于你有没有把构象采样、打分函数和蛋白柔性这三件事的局限想清楚。把这条链路理顺,对接才真正成了你缩小实验范围的工具,而不是制造假阳性的机器。

分子对接把配体放进蛋白结合位点,通过采样构象并用打分函数估计结合亲和力,用来预测哪个小分子最可能与靶点结合。它是虚拟筛选的第一道闸门,能从百万化合物里快速筛出几千个候选,大幅降低实验成本。做激酶抑制剂、GPCR 配体的人几乎天天和它打交道。可以说,蛋白分子对接预测这件事,决定了你的虚拟筛选能不能把火力集中到真正有戏的分子上。很多新手以为对接打分高就等于能成药,等到实验命中率惨淡,才发现只跑了一个刚性蛋白、一种 protonation 状态,漏掉了真实结合的关键柔性。更现实的是,对接的假阳性率天然高,审稿人和药化专家都清楚它的局限,报告里必须讲清不确定性。
对接分两步:一是构象采样,在口袋里搜索配体的位置、取向和自身构象(扭转角);二是打分,对每一采样构象估算结合自由能近似。采样算法有穷举(如 AutoDock 的遗传算法、Vina 的蒙特卡洛)、碎片生长等;打分函数多是基于经验的加和模型(范德华、静电、氢键、疏水项加权)。核心认知是:对接的瓶颈从来不是算力,而是打分函数的精度——它只是结合自由能的粗糙代理,无法可靠区分相差 1–2 kcal/mol 的构象,所以排名靠前的几个往往难分伯仲。加上蛋白通常被当成刚性(或仅侧链柔性),而真实结合常伴随蛋白构象调整(诱导契合),刚性对接天然会漏掉需要口袋变形的真阳性。
蛋白结构准备是对接最容易翻车的地方。要先修缺失loop、加氢、确定各残基质子化状态(这强烈依赖预测的 pH),再指派合适的质子化与互变异构。我早年对接一个天冬氨酸附近的配体,没注意 ASP 在该 pH 应去质子化,结果静电项全错,筛出的前几名全是假阳性。金属离子、水的处理也要小心,关键结构水可能参与桥接氢键,删了就失真。采样上,对柔性大的配体要放开扭转角,口袋侧链柔性可用侧链优化或诱导契合模式(如 AutoDock 的柔性残基、Schrödinger 的 induced fit)。打分函数别盲信绝对值,我习惯用一套对接结果做后续 MM-GBSA 重打分或短 MD 精修来提高区分度。
第一步,获取并清洗蛋白结构(PDB 修缺、加氢、定质子化、去无关配体);第二步,定义结合口袋(基于已知配体或保守位点),必要时标记柔性残基和关键结构水;第三步,准备配体库,统一质子化并生成 3D 构象;第四步,跑对接(如 Vina/AutoDock),每个配体输出多个 pose 并按打分排序;第五步,对 top 候选做后处理——聚类相似 pose、用 MM-GBSA 或短 MD 重打分、人工检视关键的氢键和疏水接触是否合理。我后来养成一个习惯:对接前先看口袋里有没有必须保留的结构水,并在对接后人工检查前几名的相互作用模式是否”化学合理”,而不是只盯分数。口袋定义我也做敏感性测试,稍微挪动边界看结果是否剧变。
Q1:对接打分高但实验不中?正常,刚性对接+经验打分假阳性高,需后处理精修。 Q2:没有晶体结构怎么办?用同源模建,但模建误差会放大对接不确定性,写清。 Q3:质子化状态不确定?按目标 pH 预测并测试几种,关键残基尤其要核对。 Q4:口袋怎么定?用已知配体或保守位点,做边界敏感性测试避免漏结合区。 Q5:配体柔性太大算不准?放开扭转角并增加采样数,否则漏构象。 Q6:要不要留结构水?关键桥接水建议保留,随意删除会破坏相互作用。 Q7:如何提高命中率?对接后接 MM-GBSA 或短 MD 精修,再做聚类人工研判。
讲一个具体的坑:有次虚拟筛选一个激酶,对接 top1 的配体结合模式里出现了一个明显不可能存在的空间冲突——配体穿进了蛋白主链。我一开始当成”新发现”差点汇报,后来才发现是蛋白结构里有几段未解析的 loop 被当成实心,对接软件把配体塞进了空隙。从那以后我对每个对接结果都做一遍蛋白完整性核查,必要时用模建补 loop 再算。另一个常被问的问题:为什么对接不能直接当结合常数。对接打分是经验加和,缺熵项、缺显式溶剂涨落、蛋白刚性,差几个 kcal/mol 是常态,所以它擅长”粗筛”而非”定量”。我给合作者交付时一定会附一句”排名用于优先级排序,不是亲和力预测”。还有,打分函数对带电和极性相互作用的处理很糙,涉及强极性口袋的体系尤其要后处理。
再说一个细节:构象簇与多样性。很多新手只看第一名,其实前几十个 pose 里聚类出的主导构象模式更有参考价值——如果不同随机种子都收敛到同一类结合模式,可信度才高。我习惯对 top 候选做 pose 聚类,挑代表做 MD 精修。如果你手上的对接命中率总是惨淡,多半是蛋白准备或质子化的基础没打牢,而不是软件的问题。需要可复现的蛋白对接与虚拟筛选模板,可以联系我们拿到现成方案,少走两年弯路。
Q8:靶点有多个构象或突变体怎么对接?要用多个代表构象分别对接,或对接到集合(ensemble docking),避免只用一个静态结构漏掉别构位点;突变体要重新准备结构并核对质子化差异,不能直接套用野生型结果。 Q9:虚拟筛选规模多大才有意义?通常几万到百万配体,但命中率随库质量和后处理强相关;我倾向先小库精筛验证流程,再放大,且对 top 候选必做 MM-GBSA 或 MD 精修降假阳性,单纯堆库量不提质检毫无意义。
回过头看,蛋白分子对接预测并不神秘,难的从来不是把软件跑通,而是把蛋白准备、打分局限和柔性处理这条链路想清楚。我现在的习惯是每接一个靶点,先把蛋白和质子化钉死再筛,并对结果做聚类与精修,基本一次给出可信候选。如果你手上的对接命中率总上不去,多半是前面准备的基础没打牢,与其盲目加库,不如回到蛋白本身重新审视。需要可复现的参数文件和流程脚本,可以联系我们拿到现成模板,少走两年弯路。对接打分高不等于能成药,它是粗筛不是定量,给合作者交付时我一定附一句”排名用于优先级排序”,免得人家拿去当结合常数用,最后坑的是双方。
gromacs自由能计算
高通量分子筛选:从算力并行到结果聚合的工程化路径
GROMACS分子动力学模拟:从建模到轨迹分析完整流程
Gromacs代算 — 科研用户的GROMACS分子动力学外包服务选型与质量验收指南
高斯加速分子动力学模拟 — GaMD突破常规MD采样瓶颈的原理与实践
GROMACS计算自由能 — 从伞形采样到结合自由能的实战复盘
高斯分子动力学模拟 — 从Born-Oppenheimer MD到轨道动力学的方法复盘
Gromacs模拟计算:从建模到自由能的完整经验指南
粗粒化分子动力学模拟
lammps计算声子谱
lammps计算rdf
径向分布函数模拟计算
径向分布函数理论计算
lammps计算自由能
拉伸动力学模拟
计算化学模拟:从量子化学到分子动力学的工具选择与方法边界