结合案例图分析,本文以这个催化剂先导化合物筛选项目为例,讲前置虚拟筛选为什么比硬算重要。这是一个催化剂先导化合物虚拟筛选项目。客户有一个 10⁴ 量级的分子库,想快速找出兼顾活性和选择性的候选,再送实验合成。第一张案例图是 Selectivity-Activity 二维散点图,用红圈圈出的几个 top hits 位于 Selectivity 0.15–0.35、Activity 0.65–0.95 的区间。第二张案例图是 Composite score 排名,C01 以 0.92 居首。

方法上客户一开始想让我”把库里所有分子都 DFT 精算”,我拦住了——10⁴ 量级 DFT 根本不现实(单分子几小时到几天,全库要几年)。我的方案是先算分子描述符(拓扑指纹、三维构象、电荷、HOMO-LUMO 能隙),再用随机森林快速预测活性和选择性,最后多目标优化选 Pareto 前沿,把候选压到几十个再 DFT 精算。 描述符和模型我做了收敛测试:随机森林树数从 100 增到 500 时,交叉验证误差从 0.18 降到 0.12 后平台,故取 500;描述符维度从 50 增到 200 误差变化 < 0.01,说明 200 维已足够。客户要的是可送合成的高分候选,我最终交付了 30 个。
图里读出的数要落地。第一步确认散点分布合理——大多数分子挤在主群说明库本身活性平平,红圈 top hits 偏离主群才是真有潜力的。我对 top hits 的 ML 预测活性标注了误差带 ±0.08(来自交叉验证),C01 综合评分 0.92±0.03 显著高于次优,但我和客户强调这仅是预测。 第二步用 Pareto 前沿选出约 50 个候选,再用 DFT 精算验证 top 10——精算后 C01 活性预测偏差仅 0.05 eV,证明前置筛选有效。第三步加可合成性过滤,最终交付 30 个可合成高分分子。
做的过程中我踩过实打实的坑。第一坑是数据量:我画过模型误差随训练集规模的收敛曲线——训练集 200 条时预测误差 0.25,涨到 2000 条降到 0.13,5000 条后 0.11 平台,说明数据量比模型复杂度重要,小训练集上深度学习过拟合严重。 第二坑是可合成性,没把类药性和合成可及性作为过滤条件,初版选出几个根本合成不出来的分子,白费一轮。第三坑是单目标排序,真正有价值的是 Pareto 前沿上的分子,单排一名会漏掉均衡型候选。
作为可复用的项目经验,第一,top hits 只是候选,最终必须用高精度 DFT 或实验验证,别把 ML 预测当真理。第二,多目标优化比单目标更贴近实际,散点图比单一排名更能说明问题。第三,误差带和候选数量必须透明。客户最终送了 top 10 进实验合成。说到底,高通量筛选项目的价值不在”算了多少”,而在”砍掉了多少无效计算”;能把 10⁴ 压到几十个还能保住活性窗口,才是真本事。
计算工程师团队:500+ | 成功计算案例:5W+ | 1W+ 助力顶刊发布经验
需要模拟代算服务可以联系我们,可免费评估项目的计算费用和免费出计算方案。
GROMACS分子动力学模拟的性能调优与并行计算
GROMACS分子动力学模拟的性能调优与并行计算
gpcr分子动力学模拟
gromacs自由能计算
高通量分子筛选:从算力并行到结果聚合的工程化路径
GROMACS分子动力学模拟:从建模到轨迹分析完整流程
Gromacs代算 — 科研用户的GROMACS分子动力学外包服务选型与质量验收指南
高斯加速分子动力学模拟 — GaMD突破常规MD采样瓶颈的原理与实践