客户拿到一条 300 残基的底物蛋白序列,想快速定位可能的磷酸化位点。实验上逐个位点做质谱验证成本很高,他希望先用计算方法缩小范围,只针对高置信度位点做实验。
我搭建了一个 kNN + SVM 的集成预测器。特征包括:目标残基上下游各 7 个氨基酸的序列编码、残基可及表面积(从同源建模结构估算)、无序区倾向、以及激酶识别 motif 的打分。训练集用 PhosphoSitePlus 里的人源磷酸化位点数据,负样本随机抽取未注释位点。
模型用 5 折交叉验证调参,输出每个残基的磷酸化打分,阈值设为 0.72。
-分类器-ROC(AUC0.87)-500x250.png)
第一张案例图是整条蛋白序列的磷酸化打分曲线。横坐标是残基索引,纵坐标是打分。可以看到大部分区域打分很低,但有 4 个明显的尖峰,分别位于 S45、T120、Y210 和另一个约 260 位的残基,这些位点的打分都超过了 0.72 的阈值。图中用橙色竖条标出了这些候选区域。
第二张案例图是 ROC 曲线,模型 AUC=0.87。这个数值说明集成模型有较好的区分能力,但不是完美;0.87 的 AUC 对于磷酸化位点预测来说属于中上水平,足以用来优先排序实验验证。
第一,在这个项目里,上下游序列上下文对 AUC 的贡献最大。去掉序列编码后 AUC 从 0.87 掉到 0.78,说明激酶识别 motif 信息非常关键。
第二,结构特征(ASA、无序区)能进一步提升性能,但如果同源模型质量不高,反而会引入噪声。我用的模型 pLDDT 平均 85 以上,才放心把结构特征加进去。
第三,阈值 0.72 是召回率和精确率的折中。如果客户更怕漏掉真实位点,可以把阈值降到 0.60;如果想减少实验验证量,可以提高到 0.80。
做位点预测类项目,最好不要只给客户一个“是/否”列表。我把打分曲线和 ROC 一起交付,客户可以直观看到每个位点的置信度以及模型整体性能。后续如果实验验证了 S45 和 T120,可以再把这两个位点加入训练集做迭代优化。
这篇文章把我在这个项目里用到的计算流程、参数取舍和图上读数做了完整复盘。如果你也在做类似方向,可以参考我的思路:蛋白修饰位点预测。
大分子结构核磁预测:二级化学位移与实验化学位移关联
小分子高通量筛选:120 万化合物七级漏斗与富集因子分析
界面分子动力学模拟:二氧化硅/水界面水化层结构与动力学
高斯分子动力学模拟
GROMACS分子动力学模拟的性能调优与并行计算
GROMACS分子动力学模拟的性能调优与并行计算
gpcr分子动力学模拟
gromacs自由能计算
大分子分子动力学模拟:三链蛋白体系骨架涨落与溶剂可及表面积演化
lammps计算结合能
lammps计算结合能
钙钛矿分子动力学模拟熔化行为
LAMMPS 计算粘度
LAMMPS 计算声子谱
LAMMPS 分子动力学模拟
范德华力模拟计算