手机版
           

小分子高通量筛选:120 万化合物七级漏斗与富集因子分析

发布时间:2026-09-16   来源:科研学术网    
字号:
 

本项目针对某激酶靶点建立 120 万化合物虚拟筛选流程。流程为七级漏斗:虚拟库→药效团过滤→分子对接→MM-GBSA 重打分→聚类→ADMET 过滤→实验验证。使用 ROC-AUC、富集因子(EF)与配体效率评估筛选性能。

案例分析

120 万化合物经七级漏斗后最终入选 186 个,其中活性物 42 个(n=42),诱饵分子 1600 个用于验证。对接打分分布显示活性物与诱饵存在明显分离;ROC-AUC 为 0.91,精确度 0.82,召回率 0.88。在 1% 数据库比例下富集因子 EF 为 42,说明前 1% 化合物中活性物浓度是随机库的 42 倍。命中化合物的分子量、clogP、TPSA 等性质多落在 Lipinski 合规区域。

模型细节、验证与工程意义

虚拟筛选在 Schrödinger Maestro / KNIME 工作流中完成。对接用 Glide SP,MM-GBSA 重打分用 Prime。活性物 42 个、诱饵 1600 个来自 DUD-E 同源集。ADMET 用 QikProp 评估。验证时 ROC-AUC 0.91 与同类激酶筛选文献相当;富集因子 EF=42 表明前 1% 命中率高,可显著减少实验筛选成本。

总结教训

第一个教训是虚拟筛选性能对 docking 打分函数敏感。本项目先用 Glide SP 初筛,再用 MM-GBSA 重打分,AUC 从 0.78 提升到 0.91。第二个教训是训练集偏差会导致假阳性,必须加入多样化诱饵。第三个教训是 ADMET 过滤应在重打分之后执行,前置过滤会误删潜在活性骨架。

项目经验

  1. 虚拟筛选库规模 120 万化合物。
  2. 采用七级漏斗:库→药效团→对接→MM-GBSA→聚类→ADMET→实验。
  3. 最终入选 186 个,活性物 42 个,诱饵 1600 个。
  4. ROC-AUC = 0.91。
  5. 精确度 0.82,召回率 0.88。
  6. 1% 比例下富集因子 EF = 42。
  7. 命中化合物 Lipinski 合规率高。
  8. Glide SP 初筛 + MM-GBSA 重打分使 AUC 从 0.78 提升至 0.91。
  9. 诱饵分子必须多样化,避免训练集偏差。
  10. ADMET 过滤应置于重打分之后,避免误删活性骨架。
  11. 配体效率(LE)可用于比较不同分子量 hits 的质量。
  12. 对接:Glide SP;重打分:Prime MM-GBSA。
  13. 诱饵集来自 DUD-E,1600 个分子。
  14. 本项目方法可迁移到激酶、GPCR、PROTAC 苗头化合物发现。

补充经验

  1. 分子对接打分需结合实验结构验证,避免晶体构象偏差。
  2. 聚类多样性分析可防止命中化合物集中在同一骨架。
  3. 建议用命中化合物做诱导契合对接,进一步优化结合模式。
  4. 合成可及性(SAscore)应作为最后一道过滤条件。

复现参数速查(案例图硬参数)

参数 数值
化合物库规模 120 万
漏斗级数 七级
最终入选 186
活性物数 42
诱饵数 1600
ROC-AUC 0.91
精确度/召回率 0.82 / 0.88
富集因子 EF 42(1%)
主要方法 Glide SP + MM-GBSA
性质要求 Lipinski 五规则

更多相关仿真经验,可参考本站的 MD 仿真案例栏目

图说天下

×
gromacs计算
lammps计算
VASP计算
分子对接
分子自组装