复旦大学化学系乔亮老师又发新文!文章题目:Deep Learning Powers Protein Identification from Precursor MS Information,发表期刊:Journal of Proteome Research。该文章开发了一个新方法,MonoMS1,基于深度学习和逻辑回归,可以支持从DDA数据的MS1信息中进行蛋白鉴定。文章将这个方法应用于大肠杆菌、人血清和单细胞蛋白质组分析。结果发现,MonoMS1在MS1 feature鉴定方面有显著提高,在血清和单细胞数据集中,MonoMS1也补充了肽和蛋白的鉴定数量。
基于LC-MS的肽水平鉴定依赖于一级质谱(MS1)获得的准确分子量和二级质谱(MS2)获得的碎片信息。然而,目前应用广泛的数据依赖性采集(data-dependent acquisition, DDA),在MS2扫描中可能无法选择低丰度feature,从而导致缺失值、碎片的半随机性和高丰度肽段的重复采集。这种情况在分析low-input的样本或动态范围较宽的样本时更为明显。尽管DIA技术可以采集所有母离子的所有碎片,但全部母离子的鉴定仍受到现有数据分析策略的限制,也有上限。因此,本文开发了基于DDA数据的MS1鉴定方法,提高MS1 feature的鉴定能力,补充MS2的鉴定深度。
接下来,我们来看下MonoMS1方法的工作流程和分析应用吧!
一、MonoMS1工作流程概述
MonoMS1方法,通过整合四个维度的信息来鉴定MS1 feature,包括肽的分子量、离子迁移率、保留时间和可检测性。其中,后三个信息是通过深度学习进行预测的。随后,使用逻辑回归模型为每个维度信息分配不同的权重,以实现肽的鉴定,并利用MS2鉴定的feature来训练该模型。为了确保结果的可靠性,研究团队还采用了reference-decoy方法在feature和肽水平上评估FDR(假发现率),应用于大肠杆菌、人血清和单细胞蛋白组。
(对于大肠杆菌,用先前鉴定的48783条肽段,对应4014个大肠杆菌蛋白作为reference库,其诱饵库为HeLa肽段序列。对于人血清,用先前报道的27250条肽段,对应2617个蛋白质作为reference库,这是采用去除高丰度和色谱分馏的方式鉴定到的结果,其诱饵库为大肠杆菌。对于单细胞,选择来自相同细胞群的70638条肽段作为reference库,其诱饵库为大肠杆菌。decoy库与reference库1:1混合。)
此外,研究整合了Ivanov等人开发的二项模型计算蛋白质评分,能够提高肽鉴定的准确性,并更有效地建立肽质量控制。
二、利用大肠杆菌数据集评价MonoMS1
在本研究中,研究团队利用timsTOF Pro获取的HeLa细胞DDA数据来训练深度学习模型,并使用训练后的模型预测肽段的各种信息。结果显示,在大肠杆菌数据集中,预测的iRT与实验iRT之间的Pearson相关系数均超过0.99,离子迁移率的预测,双电荷母离子的Pearson相关系数也达到了0.99。这些结果表明,深度学习模型在iRT和离子迁移率的预测中表现出极高的准确性,甚至与最近开发的深度学习工具(如DeepLC和DIA-NN)相当或更优(图S3)。这为基于MS1的多肽鉴定提供了可靠依据。
DeepLC和DIA-NN预测的iRT和离子迁移率与实验的相关性
相较于传统的基于MS2的鉴定方法,MonoMS1在MS1 feature 鉴定方面提升了114%到141%。基于reference-decoy评估,MonoMS1 feature 鉴定准确率达到96.1%。即使在肽FDR 1%的条件下,MonoMS1仍能补充鉴定到21,965个feature,且准确率为99.2%(图2b)。这些结果表明,MonoMS1能够充分利用MS1来增加肽和蛋白质鉴定数量。如图2c所示,MonoMS1在肽FDR 5%条件下补充鉴定了8,985个肽,在肽FDR 1% 条件下,补充鉴定了6,268个肽。此外,MonoMS1还成功在肽水平FDR 5%和1% 条件下补充鉴定了366和79个蛋白质(图2c)。
为进一步验证MonoMS1补充鉴定肽的准确性,研究团队还采集了同一样本的DIA数据进行评估。结果显示,在1%肽水平FDR下,DIA方法与MonoMS1补充鉴定的结果有近一半的重叠;在5%肽水平FDR下,DIA与MonoMS1补充鉴定也有相当大的比例覆盖。需要注意的是,MonoMS1补充鉴定到而DIA未鉴定到的肽并不一定是不准确的,因为DIA虽然采集了所有母离子的所有碎片信息,但全部母离子的鉴定仍受到现有数据分析策略的限制,DIA也有局限性,所以开发MonoMS1提高DDA MS1鉴定能力、补充MS2鉴定深度也是有必要的。
三、用MonoMS1分析人血清蛋白质组
在血清蛋白质组学研究中,由于血清中蛋白质含量的动态范围非常宽,检测低丰度蛋白质一直是一个巨大的挑战。低丰度蛋白质仅能在MS1上产生微弱的信号,而难以获得相应的MS2信息。为解决这一问题,研究团队将MonoMS1方法应用于人血清数据,利用MS1 feature来补充多肽和蛋白质组的鉴定。在这些样品中,加入了PQ500稳定同位素标记的参考肽,作为评估MonoMS1鉴定准确性的手段。
结果显示,与基于MS2的方法相比,在肽水平5% FDR下,MonoMS1补充鉴定了15,252个MS1 feature,在1% FDR下补充鉴定了11,310个MS1 feature,基于reference-decoy方法评估准确率,高达98%和99.7%(图3a)。这使MonoMS1有效补充了MS2方法的肽和蛋白质鉴定(图3b)。具体来说,MonoMS1在5% FDR下鉴定了3,407个肽,其中1,282个是特有鉴定;在1% FDR下共鉴定出2,297条肽,其中534条为MonoMS1特有鉴定。在蛋白质水平上,MonoMS1同样能够补充MS2的结果。
采用PQ500同位素标肽对MonoMS1方法进行验证。研究发现,MS1 feature 在预期的质量偏移处表现出明显的同位素峰,这验证了MonoMS1的鉴定准确性(图3c)。当肽FDR设定为5%时,在鉴定的1,174个MS1 feature 中,有1,071个(91.2%)被match为PQ500同位素标肽;当FDR设定为1%时,这一比例为92.1%(图3d)。需要指出的是,没有同位素峰并不一定意味着鉴定不准确,这可能与样品浓度不足或分离效率不高有关。整体结果表明,MonoMS1 feature 鉴定可靠性超过了91%。
为了进一步评估MonoMS1的定量准确性,研究团队分析了血清样本在三次技术重复中的肽和蛋白质定量CV(图3e)。在1% FDR条件下,基于MS2的方法与MonoMS1方法的肽定量中位CV均小于10%,在蛋白质结果中,MonoMS1的中位CV为5.54%,比MS2的更低。低CV值进一步验证了MonoMS1在肽和蛋白质水平上具有较高的定量准确性。
四、MonoMS1分析单细胞蛋白质组
在单细胞蛋白质组学研究中,由于单细胞内蛋白质含量低,导致许多MS1 feature未被充分利用。为解决这一问题,研究团队将MonoMS1方法应用于单细胞数据集,充分挖掘MS1数据,补充肽和蛋白质的鉴定。该研究的单细胞数据集包含6组实验,分别为1到6个HeLa细胞,每组进行了4个技术重复。
研究结果表明,MonoMS1在肽水平1% FDR和5% FDR的标准下,都能够补充DDA数据MS1 feature的鉴定,并在所有6组数据集中表现出较高的准确性(图4a)。进一步分析显示,MonoMS1显著增加了单细胞中肽(图4b)和蛋白质(图4c)的检测数量。如图4d-f所示,基于MS2和MonoMS1的鉴定结果在6个细胞的重复实验中均展示出较高的定量精度和准确度,证明了MonoMS1在单细胞水平上具有可靠的蛋白质鉴定能力。通过利用这些MS1 feature,MonoMS1不仅补充了现有的肽和蛋白质检测结果,还保持了良好的肽FDR控制,为单细胞蛋白质组学研究提供了有力支持。
好了,以上就是今天的内容。假如你正在或者将要开展DDA蛋白质组学方面的课题,MonoMS1可以助你鉴定到更多更丰富的蛋白/肽段信息,MonoMS1的源代码可以在GitHub上免费访问(https://github.com/lmsac/MonoMS1)。
往期易算合作发文收录在公众号菜单:生信与文献分析->易算案例。
CONTACT US