分子模拟筛选是药物和化学材料研发里最常被神化、也最常被误用的环节。我见过太多团队把几百万化合物一股脑丢进对接软件,出来一个排名就当成宝藏,结果合成验证全军覆没。筛选不是跑分比赛,而是一道道漏斗,每一层都在替你淘汰不可信的东西。

我们帮一个农药团队筛先导,第一版他们要”全库逐分精算”,几十万分子直接吓退预算。后来改成两级漏斗:先粗筛砍掉九成,再对剩的下精细打分,成本降一个数量级,命中也没漏关键的。筛分子最忌一上来就上重武器。
另一类常见错是拿单一性质当筛标准,比如只看结合能,结果筛出一堆难溶、有毒、合成不了的分子。分子模拟筛选必须多指标联合,否则筛得越狠离可成药越远。
一个真实的苗头发现流程,对接只是第一层粗筛,后面还有精修、ADMET 预测、合成可行性评估。我们在做分子模拟筛选时,始终把对接分当”相对排序”而非”绝对结论”。一个 分子模拟筛选 如果止步于对接排名,命中率低到令人绝望几乎是注定的,因为它跳过了所有验证环节。
筛选的核心是建立可解释的淘汰逻辑,而不是堆分数。我们习惯把 ADMET 性质、合成可行性、结合模式合理性做成并联闸门,任何一项红牌就出局,避免”分数高但根本做不出来”的伪命中。
打分函数分层也关键。粗筛用快但偏的近似换通量,精筛用更贵但准的模型。两层用不同函数,中间必须做相关性校准,否则粗筛排前面的在精筛里全掉队,漏斗白搭。
第一层用对接快速排除明显不结合的;第二层用 MM-GBSA 或分子动力学给 Top 候选算更接近自由能的量;第三层做类药性和合成可行性过滤。每一层都在用更贵但更准的量,替换前面便宜但粗糙的量。我们内部的筛选流水线严格按这个层级走,宁可少给几个候选,也不给一堆经不起推敲的排名。
决定可信度的三个环节:一是属性预测模型的适用范围,别拿训练集外的化学空间硬套;二是结合模式人工抽检比例,粗筛不能全信机器;三是多指标权重的来源,是文献还是先验,得说清。
构象采样质量也是暗坑。柔性分子不枚举构象,最低能构象可能根本没被采样到,筛掉的真命中后面实验才冒出来。我们对柔性骨架强制构象展开,不让”采样盲区”污染漏斗。
第一是化合物库质量,重复结构、不可能合成的、质子化错误的,进库前就该清掉,否则排名被垃圾占满。第二是口袋与受体处理,刚性受体和错误质子化是假阳性的两大源头。第三是打分策略,单一打分函数不够,我们常做多软件交叉,取共识候选。做筛选最怕”库脏+受体错+单打分”,三件套齐了命中率基本归零。
从库到候选,我们固定五级:结构清洗→属性闸门→粗筛对接→精筛重打分→TOP N 人工复核。每级留淘汰理由,客户回头看任一分子为什么出局都查得到,不是黑箱丢数。
精筛阶段我们强制输出每分子的”出局/晋级证据链”:哪条性质红牌、结合模式哪里 clash。这比单纯给分数表更有用,合成团队拿去立马知道怎么改骨架。
落地步骤:库清洗与标准化→靶点口袋与受体准备→对接粗筛→Top 候选 MM-GBSA/MD 精修→类药性与合成评估→输出可验证苗头清单。当你把 分子模拟筛选 当成”层层降噪”来做,最后剩下的几十个候选里真阳性的比例会明显提升,湿实验同事也愿意接你的清单。
分子模拟筛选最典型翻车是只盯结合能,筛出难溶剧毒分子;其次是粗筛精筛函数没校准,漏斗 upstream 排前面的 downstream 全掉;还有不枚举构象漏掉真命中。
另一类坑是属性模型超出适用范围,比如拿类药小分子训的模型去筛农药大骨架,预测值纯噪声。我们对每类化学空间单独标定模型,不通用硬套。
最频繁的是库没清洗,排名前列全是不可合成的分子。其次是只信一个软件一个打分,假阳性满天飞。还有人跳过精修直接交付几千个”高分”,下游根本用不起。这些坑的根因是”重数量轻质量”,靠库治理和分层验证就能根治。
回过头看,分子模拟筛选最怕”一杆尺子量天下”。结合能、ADMET、合成可行性是几把不同的尺,缺一把就筛出一堆做不出来的伪苗头。
我们的经验:多指标并联闸门 + 两层函数校准 + 构象展开,三件事齐了,漏斗才既省算力又不漏真命中。
回过头看,分子模拟筛选最值钱的是”漏斗思维”和”质量优先”。库要干净、打分要交叉、结论要精修。我们交付的筛选清单,必附富集检验和精修能量,客户拿去合成验证心里有底。把这三件事做扎实,筛选才是研发的加速器而不是噪声制造机。
GROMACS分子动力学模拟的性能调优与并行计算
GROMACS分子动力学模拟的性能调优与并行计算
gpcr分子动力学模拟
gromacs自由能计算
高通量分子筛选:从算力并行到结果聚合的工程化路径
GROMACS分子动力学模拟:从建模到轨迹分析完整流程
Gromacs代算 — 科研用户的GROMACS分子动力学外包服务选型与质量验收指南
高斯加速分子动力学模拟 — GaMD突破常规MD采样瓶颈的原理与实践