蛋白质磷酸化是影响蛋白质功能和调控许多细胞过程的最重要的翻译后修饰之一。蛋白质磷酸化的失调通常被认为是癌症和自身免疫疾病的标志。对于磷酸化蛋白质组学而言,除了磷酸化肽段序列的鉴定,确定磷酸化位点也是至关重要的。由于肽段中可能存在多个潜在的磷酸化位点,磷酸基团在质谱碎裂过程中的不稳定性等问题,磷酸化位点的定位准确性仍然需要提升。现有的肽段质谱数据分析方法分为序列搜索方法以及谱图匹配方法,在序列搜索方法中一般根据碎片离子质荷比信息判定磷酸化位点,而基于肽段质谱图库匹配的方法则进一步引入了强度信息。这些不同的磷酸化蛋白质组学数据分析工具所使用的评分标准不同,导致在相似的估计下也可能有不同的位点定位错误率(False localization rate, FLR)。对于谱图库匹配方法来说,肽段质谱图库构建的难度较大。近年来,基于机器学习的肽段质谱图预测方法逐渐受到关注。本文提出了一种基于BERT深度学习模型的工具DeepFLR,DeepFLR不仅可以准确预测磷酸化肽段质谱,同时还可以精确估计位点定位错误率。
DeepFLR巧妙结合了基于深度学习模型的磷酸化肽段串联质谱(MS/MS)预测模块和基于目标-诱饵库方法的FLR估计模块。磷酸化肽段MS/MS预测模块基于BERT模型,使用>467,000张质谱训练,其中包含>184,000个磷酸化肽段和>165,000个非磷酸化肽段。与现有的磷酸化肽段MS/MS预测工具相比,DeepFLR提高了预测精度,DeepFLR的预测质量接近于磷酸化肽段谱图的实验重复。磷酸化肽段诱饵谱图库的构建则是通过随机交换序列中的带磷酸化后修饰的氨基酸残基与另一非STY氨基酸残基而生成的。DeepFLR首先预测了目标肽段和诱饵肽段的二级质谱图,并与实验谱图进行比较计算余弦相似度,对于每一张谱图计算余弦相似度差值,利于目标肽段和诱饵肽段的余弦相似度差值分布进行FLR评估。
图1. (a) DeepFLR模型架构:输入层、嵌入层、BERT编码器和输出层。(b) 目标-诱饵库方法评估FLR的示意图。目标磷酸化肽段为S/T/Y氨基酸磷酸化肽段。陷阱磷酸化肽段由磷酸化S/T/Y氨基酸与另一非S/T/Y氨基酸随机交换生成。DeepFLR首先预测了目标肽段和诱饵肽段的二级质谱图,并与实验谱图进行比较计算余弦相似度,对于每一张谱图计算余弦相似度差值,利于目标肽段和诱饵肽段的余弦相似度差值分布进行FLR评估Ndecoy是数据库中伪目标的总数;Ntarget是数据库中目标的总数;#D是已鉴定的伪目标命中数;#T是已鉴定的目标命中数。
在四个合成磷酸化标肽的数据集上,DeepFLR都可以准确估计FLR。进一步将DeepFLR应用于实际生物样本,我们发现DeepFLR可以定位比基于概率打分的磷酸化位点定位工具鉴定到更多的磷酸化位点,同时我们利用多种方法,例如实验重复性等侧面验证了生物样本中位点定位的可靠性。此外,DeepFLR可以辅助数据非依赖采集(DIA),不仅可以通过谱图预测辅助构建数据依赖采集(DDA)谱图库,并且可以矫正DDA谱图库中的位点,从而得到更高的鉴定灵敏度以及更低的定量变异系数。
图2. (a)DeepFLR在合成磷酸化肽段数据集上的应用。(b) DeepFLR和MaxQuant对于合成样本鉴定到的蛋白质磷酸化位点Venn图。
图3. DeepFLR在DIA上的应用。使用基于DDA的实验谱图库和DeepFLR预测谱图库进行DIA分析。(a) DeepFLR谱图库构建示意图。(b) 使用DeepFLR预测谱图库和基于SpectroMine的实验谱图库对于DIA数据集的磷酸化位点数量Venn图。(c)在DIA数据集的三个技术重复中,基于DeepFLR预测谱图库和基于SpectroMine的实验谱图库鉴定的蛋白质磷酸化位点数量的定量变异系数展示。
点击文末阅读原文可以前往DeepFLR github页面下载DeepFLR。易算生物也即将在生信服务平台 project.omicsolution.com上推出DeepFLR在线服务页面,敬请期待。
DeepFLR能够处理不同仪器类型或物种的数据集,可以与各种数据库搜索工具结合进行分析,可以处理单磷酸化肽段和多磷酸化肽段,可以辅助DDA和DIA。我们期望DeepFLR可以加速磷酸化蛋白质组学发展,并成为磷酸化肽段的FLR估计的关键方法。