分子对接筛选,是每一个做虚拟筛选、想从几十万化合物里捞出几个真苗头的人,绕不开的第一道漏斗。我刚做筛选项目时,直接用默认参数把库跑完,按打分排前一百拿去合成,结果一轮下来没一个活性的——后来才发现库里一半分子质子化状态是错的,活性分子被埋在了排名末尾。后来才懂,分子对接筛选难的从来不是把分子塞进口袋,而是你准备的库和评判的标准,到底有没有还原真实的化学空间。

新药发现的命中率极低,先做湿实验根本不现实,分子对接筛选就是用计算先筛掉绝大部分没戏的,把合成资源压到最前面几百个。做抗肿瘤的人筛激酶抑制剂,做抗感染的人筛靶点抑制剂,做农药的人筛酶位点。可以说,分子对接筛选是你把”大海捞针”变成”小池捞鱼”的关键。很多新手把对接打分当绝对排名,跑完取前 N 就交差,等到实验全阴才想起没做富集检验。更现实的是,打分函数对极性相互作用、去溶剂化描述不准,纯打分排名噪声很大,不加后续精修基本捞不到真阳性。
对接的本质是在受体口袋里搜索配体的构象和姿态,用打分函数估计结合优劣。经典对接(Glide、AutoDock Vina、Gold)先用搜索算法(如 Glide 的层级对接、Vina 的蒙特卡洛)采样姿态,再用经验/半经验打分(加和式力场、基于形状的、基于知识的)排分。关键认知是,打分函数是为了”区分好坏”而非”算准能量”——它和真实结合自由能差出一个数量级很正常,所以对接分只能用来排序,不能直接当 kcal/mol。还有一个点:姿态搜索和打分常常不匹配,某姿态打分高但化学上不合理(如关键氢键没形成、撞进了疏水核心),需要人工或后处理过滤。
化合物库准备是第一道关:质子化状态(按 pH 7.4 算优势态)、互变异构、立体异构、3D 结构,任何一项错都会把活性分子埋没。口袋定义要覆盖真实结合位点,太大增加噪声、太小漏掉别构位点。单一打分噪声大,我习惯用共识打分(多个程序交叉,取交集)提高富集。后处理必做 MM-GBSA 精修,把对接 pose 拿去做单点/短时 MD 求结合自由能,能显著压低假阳性。我早年筛一个激酶库,裸 Vina 排名前一百全阴,加 MM-GBSA 重排后前二十才出现真阳性——打分和自由能排序差太多。另一个常被忽略的点:数据库去重和类药性过滤(如 Lipinski),否则筛出一堆不可合成的分子。
第一步,准备受体(加氢、定质子化、定义口袋网格);第二步,准备库(批量质子化、3D 化、去重、类药过滤);第三步,对接(Vina/Glide 跑姿态);第四步,共识打分 + MM-GBSA 精修重排;第五步,富集检验——用已知的活性/非活性分子做测试集,看排序的富集因子(EF)和 ROC,确认流程靠谱再信排名。我习惯先拿一小批已知分子验证流程富集能力,再放大到全库,避免用没校准的漏斗去捞。对柔性口袋还会做诱导-fit 对接或口袋 MD 采样后再对接,捕捉构象选择效应。
我做虚拟筛选,库准备永远排第一。按目标 pH 算优势质子化态、枚举互变异构、3D 化、去重、类药过滤,这一步偷懒,活性分子就被埋在排名末尾。我宁可多花一天预处理,也不裸对接。库质量决定了漏斗的上限,库错了后面再精修也捞不回真阳性。
富集检验是我交付筛选的硬门槛。先用一小批已知活性/非活性分子验证流程的 EF 和 ROC,确认漏斗靠谱,再放大到全库。没有富集曲线的排名,我不当苗头交付,也不让合作者拿去盲目合成。这一道关拦住的不只是浪费,更是错误的方向。
对柔性口袋我会做诱导-fit 对接或口袋 MD 采样后再对接,捕捉构象选择效应。很多配体不是结合在晶体那样的静态口袋里,而是结合在口袋被它自己诱导出的构象里。忽略构象选择,排名会系统性偏向刚性配体,漏掉真正苗头。
Q1:排名前 N 全阴?库质子化错或只信打分,加 MM-GBSA 精修。 Q2:活性分子排名靠后?打分函数偏,用共识打分和多程序交叉。 Q3:对接姿态化学不合理?过滤撞核心/缺氢键的 pose,人工核查。 Q4:富集因子低?流程没校准,用测试集先验证再放大。 Q5:口袋漏掉别构位?口袋定义太小,扩大或做全蛋白扫描。 Q6:柔性配体结果差?加构象枚举或柔性对接。 Q7:合成不可行?库未做类药/可合成过滤,补上再筛。
讲一个具体的坑:有次筛一个抗菌靶点,库里多数分子在生理 pH 下是两性离子,我用了中性态对接,结果活性分子因电荷错配全被排到末尾,反而是几个中性杂质排前面。从那以后我固定一条规矩:库准备第一步就是按目标 pH 算优势质子化态,宁可多花一天预处理也不裸对接。另一个常被忽略的点:富集检验,我交付任何筛选排名前一定附 EF/ROC,没有富集曲线的排名我不信,也不让合作者拿去盲目合成。
回过头看,分子对接筛选最容易被当成”跑个程序取前 N”的流水线,但它真正的价值在库质量、共识排序和富集验证:库错了全错,单打分噪声大,没富集检验的排名只是数字。我现在的习惯是库先校准、共识加精修、用已知分子验富集,三步少一步都不敢把排名当苗头交付。筛选不是抽奖,它是你把化学空间和打分误差都管住之后的一次受控打捞。把库、共识、富集三件事钉死,捞上来的才可能是真阳性。
GROMACS分子动力学模拟的性能调优与并行计算
GROMACS分子动力学模拟的性能调优与并行计算
gpcr分子动力学模拟
gromacs自由能计算
高通量分子筛选:从算力并行到结果聚合的工程化路径
GROMACS分子动力学模拟:从建模到轨迹分析完整流程
Gromacs代算 — 科研用户的GROMACS分子动力学外包服务选型与质量验收指南
高斯加速分子动力学模拟 — GaMD突破常规MD采样瓶颈的原理与实践