手机版
           

蛋白修饰位点预测

发布时间:2026-09-08   来源:科研学术网    
字号:
 

项目过程:300 残基底物磷酸化位点的机器学习预测

客户拿到一条 300 残基的底物蛋白序列,想快速定位可能的磷酸化位点。实验上逐个位点做质谱验证成本很高,他希望先用计算方法缩小范围,只针对高置信度位点做实验。

我搭建了一个 kNN + SVM 的集成预测器。特征包括:目标残基上下游各 7 个氨基酸的序列编码、残基可及表面积(从同源建模结构估算)、无序区倾向、以及激酶识别 motif 的打分。训练集用 PhosphoSitePlus 里的人源磷酸化位点数据,负样本随机抽取未注释位点。

模型用 5 折交叉验证调参,输出每个残基的磷酸化打分,阈值设为 0.72。

案例分析:4 个位点超过阈值,模型 AUC=0.87

第一张案例图是整条蛋白序列的磷酸化打分曲线。横坐标是残基索引,纵坐标是打分。可以看到大部分区域打分很低,但有 4 个明显的尖峰,分别位于 S45、T120、Y210 和另一个约 260 位的残基,这些位点的打分都超过了 0.72 的阈值。图中用橙色竖条标出了这些候选区域。

第二张案例图是 ROC 曲线,模型 AUC=0.87。这个数值说明集成模型有较好的区分能力,但不是完美;0.87 的 AUC 对于磷酸化位点预测来说属于中上水平,足以用来优先排序实验验证。

总结教训:序列特征比结构特征更重要

第一,在这个项目里,上下游序列上下文对 AUC 的贡献最大。去掉序列编码后 AUC 从 0.87 掉到 0.78,说明激酶识别 motif 信息非常关键。

第二,结构特征(ASA、无序区)能进一步提升性能,但如果同源模型质量不高,反而会引入噪声。我用的模型 pLDDT 平均 85 以上,才放心把结构特征加进去。

第三,阈值 0.72 是召回率和精确率的折中。如果客户更怕漏掉真实位点,可以把阈值降到 0.60;如果想减少实验验证量,可以提高到 0.80。

项目经验:预测结果要给出置信度而不是简单 yes/no

做位点预测类项目,最好不要只给客户一个“是/否”列表。我把打分曲线和 ROC 一起交付,客户可以直观看到每个位点的置信度以及模型整体性能。后续如果实验验证了 S45 和 T120,可以再把这两个位点加入训练集做迭代优化。


这篇文章把我在这个项目里用到的计算流程、参数取舍和图上读数做了完整复盘。如果你也在做类似方向,可以参考我的思路:蛋白修饰位点预测

图说天下

×
gromacs计算
lammps计算
VASP计算
分子对接
分子自组装