候选药物分子筛选是药物发现的第一道关,但新手最容易把它做成”跑一遍对接、挑分数最高的十个”。真实项目里,对接打分假阳性率极高,单靠它筛出来的分子进实验十有八九不中。我做一个靶点的苗头化合物发现时,用的是递进式漏斗——每一层用不同精度的方法把候选集缩小,最后留给实验的才是有价值的几十个。

起点是靶点结构(X-ray或同源建模)和化合物库(常用药库约100万分子)。第一层用快速的对接或 pharmacophore 匹配,把100万压到1万。这层不求准,求快、求不漏掉潜在活性分子。我用Glide HTVS或Vina的large-scale模式,exhaustiveness调低(4–8)跑全库,按打分取前1%。
化合物库的”前处理”比对接本身更影响命中率。我入库前必做三件事:去重(同一分子不同盐型只留一个)、去已有专利分子(避免客户筛出别人十年前就保护了的骨架)、补三维构象(很多库只有2D SMILES,需先用ETKDG生成3D再优构象)。曾有一个项目直接用供应商原始库跑,结果前50里有12个是同一母核的盐型变体,等于浪费了24%的筛选额度。库的质量决定漏斗底座,底座脏了上层再精也白搭。
这一层的关键是”召回率优先于精度”——宁可多留假阳性,不能漏真阳性。我设的截断线偏松,1万分子里可能有大量打分虚高的,但后续层会清掉。关于候选药物分子筛选的层级设计,我也常参考候选药物分子筛选里对漏斗各层精度的讨论。
进实验前必须过成药性关。很多对接高分分子是”试管里的明星、动物里的废物”——口服生物利用度差、代谢快、毒性高。我用类药五规则(Ro5:分子量<500、LogP<5、氢键供体<5、受体<10、旋转键<10)先砍,再过ADMET预测(hERG心脏毒性、CYP450抑制、血脑屏障穿透)。
这一层能砍掉40–60%的候选。曾有客户执着于一个对接第一的分子,我查出它hERG抑制强(心律失常风险),坚持砍掉,后来文献证实该骨架确实因心脏毒性止步临床。ADMET不是可选项,是保护客户不把经费砸在注定失败分子上的护栏。
ADMET预测我用两套工具交叉:商业的Schrödinger QikProp给标准成药性描述符,开源的SwisADME做二次核对,二者对LogP、溶解度、渗透性的判断差太多时人工复核。另外必过PAINS(泛 assay 干扰结构)过滤器——很多高分分子带醌、醛、重金属螯合等”Assay Artifact”基团,体外看着活性强其实是和蛋白非特异性结合或反应。我那个靶点项目砍掉的40%里,约一半是PAINS或hERG问题。PAINS不过关的分子进实验必翻车,这层过滤是命中率的生命线。
过两层的分子(约2000个)进精准对接:Glide XP或Vina exhaustiveness=32,在结合口袋撒密采样,取前200做聚类。聚类后的代表构象进GROMACS做诱导契合MD(20 ns),筛掉MD里漂移解体、接触频率低的构象。
这一层把2000压到约100。MD的价值在于:对接是刚性蛋白近似,MD让口袋柔性参与,很多对接高分构象在MD里因为立体冲突散架,直接淘汰。剩下的是对接+MD双稳的构象,可信度上了一个台阶。
精准对接之后、进MD之前,我常加一道MM-GBSA快速预排序。MM-GBSA比MM/PBSA快、比纯对接准,用它对聚类后的前200构象先算一遍结合能,砍掉能量明显虚高的,再对剩下的50个进MD。这层”粗筛”能把MD的计算量砍掉四分之三——MD是漏斗里最贵的步骤,能少跑一个是一个。一个经验:MM-GBSA和MD结论的一致性约80%,剩下20%靠MD翻盘的才是真金,所以MM-GBSA只用来砍、不用来定。
最后100个进MM/PBSA或FEP做定量结合自由能,按ΔG排序取前30–50送实验验证(SPR、ITC测Km/Kd)。为什么只送几十个?实验验证贵且慢,一个靶点测50个分子已是极限,必须让这50个的命中率尽可能高。
我那个项目的真实数据:百万库→1万(SBVS)→约4000(ADMET)→约100(对接+MD)→前40送实验,最终命中6个苗头化合物(命中率15%),远高于纯对接筛的<2%命中率。数字说话,漏斗每层都在提高下游命中率。
送实验的候选我还会做”知识产权预检”:用化学相似性搜一遍已发表苗头和在研临床分子,避免客户验证出一个和人家一模一样的”新”分子。那6个命中的苗头里,有1个我查到和某公司在研分子高度相似,及时提醒客户改了骨架方向,规避了潜在的专利冲突。筛选的终点不是”算出活性”,是”给客户一个能安心投入实验和专利的短名单”——这一层价值,往往比多算几个ΔG更被客户记住。
回过头看,候选药物分子筛选不是”算得准”,是”用对的精度在对的层级做对的裁剪”。高精度方法(FEP)太贵不能跑全库,快速方法(对接)太糙不能定结论,漏斗让二者各司其职。
可复用要点:SBVS召回优先→ADMET砍不可成药→精准对接+MD筛稳→自由能定量送实验。这条链路在激酶、蛋白酶、核受体靶点都稳。它的边界在缺乏结构信息的新靶点——那时要先做同源建模或蛋白-蛋白互作预测,结构不准则整条漏斗地基本塌,需要先验证模型质量再投筛选。这条候选药物分子筛选的层级漏斗,最忌讳的是把高精度方法浪费在全库上。
漏斗里还有个常被低估的环节:实验验证的设计。送出去的30-50个分子,我建议客户按”梯度难度”排实验:先做便宜的SPR初筛活性,再对top候选做ITC精测定量,最后挑2-3个做细胞实验。这样每轮实验都在上一轮信息上做决策,经费利用率最高。曾有个项目一次性全做ITC,一半分子不结合白花十几万。
候选药物筛选,我越来越觉得”漏斗”二字的关键是”收口”而非”展开”。展开谁都会(跑个对接就行),难的是每层用对的精度收口,把百万级压成客户真能做的几十个。这套收口逻辑,是筛选项目值钱的地方,也是我和客户复盘时最常被追问的方法论。
高通量分子筛选:从算力并行到结果聚合的工程化路径
GROMACS分子动力学模拟:从建模到轨迹分析完整流程
Gromacs代算 — 科研用户的GROMACS分子动力学外包服务选型与质量验收指南
高斯加速分子动力学模拟 — GaMD突破常规MD采样瓶颈的原理与实践
GROMACS计算自由能 — 从伞形采样到结合自由能的实战复盘
高斯分子动力学模拟 — 从Born-Oppenheimer MD到轨道动力学的方法复盘
Gromacs模拟计算:从建模到自由能的完整经验指南
GROMACS分子动力学模拟:生物分子实战经验全分享
计算化学模拟:从量子化学到分子动力学的工具选择与方法边界
分子动力学模拟势函数 — 从Lennard-Jones到机器学习势的选型艺术
LAMMPS计算表面张力 — 压力张量法与测试面积法的工程实践
LAMMPS分子动力学模拟 — 从in文件编写到后处理的全链路工程复盘
LAMMPS计算服务 — 从in文件定制到并行效率优化的全流程外包方案
分子动力学模拟拉伸 — 单轴拉伸应力-应变曲线的原子级获取
分子动力学模拟粗粒化 — 从全原子到MARTINI的映射策略与精度验证
分子结构预测 — AlphaFold3与MD联用的蛋白质动态构象系综采样
钙钛矿分子动力学模拟:力场参数化与相变分析的实战经验
vasp计算分子动力学模拟:从头算分子动力学方法与实战
生物分子动力学模拟:蛋白质/核酸/膜体系模拟方法
酶分子动力学模拟:催化残基运动与底物结合分析
AIMD分子动力学模拟:第一性原理MD计算方法与应用
平衡分子动力学模拟:NVT/NPT系综平衡策略与判据
AMBER分子动力学模拟:生物分子力场与tleap建模详解
薛定谔分子动力学模拟 — Schrödinger软件中Desmond模块的实战深度复盘