新年快乐


   DIA定量检测经常让尚未接触过的研究者们心生畏惧,总觉得尝试一种全新定量路线会很麻烦,而且有不可预测的风险。尤其是相对于非标记定量来说,DIA可能还需要额外进行建库实验,感觉耗时耗力,换个样品还得再来一轮。 

    数据非依赖性采集(DIA)是近几年来发展的一种新的质谱数据采集方式。不同于传统的数据依赖性采集(DDA)策略,DIA技术将整个扫描范围划分为若干个可变窗口,将每个窗口内的所有母离子进行碎裂,采集所有母离子的碎片离子,从而完整地获得样本中所有母离子的全部碎片信息。DIA具有通量高、准确性好等优点,对于大规模蛋白质组的定量分析具有显著优势,成为定量蛋白组学新的热门发展方向。目前,典型的DIA定量分析方法的基本流程是预先利用DDA采集构建谱图库,再利用谱图库从DIA数据中提取目标肽段的信号进行定量分析,这使得DIA数据分析受到DDA的限制。


    近日,复旦大学化学系乔亮课题组与生物医学研究院杨芃原课题组、上海易算生物科技有限公司沈诚频团队、澳大利亚国立大学林宇课题组合作,在《自然-通讯》上在线发表了题为“In silico spectral libraries by deep learning facilitate data-independent acquisition proteomics”的研究论文。该研究利用深度学习技术开发了从肽段或蛋白质序列构建谱图库的工具DeepDIA,实现了不依赖于DDA的DIA数据直接分析。

   

算法原理



    如上左图为传统的DIA分析流程,我们需要同时采集DDA建库数据和DIA定量数据,右图则是基于序列数据库直接进行DIA分析的流程,该流程只需要预先训练一套针对我们实验室当前使用的LC/MS系统的学习数据集(比如一套深度分级的Hela数据)即可,无须再对新的样品、物种进行建库操作。

    我们设计了基于卷积神经网络和循环神经网络的深度神经网络模型来预测肽段的二级质谱图(MS/MS)和归一化保留时间(iRT),由DDA鉴定得到的肽段列表生成DIA分析所需的谱图库,并在HeLa细胞数据集上将DeepDIA与另外一种现有的基于深度学习的谱图预测工具Prosit进行了比较测试。



    我们根据已有的经验认为,仅仅基于碰撞能量参数优化并不能解释质谱和质谱之间采集的结果为何存在差异,该差异可能由质谱本身的个体差异、色谱柱、液相参数等各方面综合因素决定的。如上图表明,与使用通用模型Prosit来生成谱图库相比,使用DeepDIA构建专用于特定仪器的模型预测生成的谱图库质量更好,DIA数据分析检测到的肽段和蛋白数量更多,重复性更好,效果接近DDA构建的谱图库。


    为了完全摆脱对DDA鉴定获得肽段列表的依赖,我们还设计了预测肽段在质谱中的可检测性的模型,实现了由蛋白序列构建谱图库。我们从SwissProt物种数据出发,预测蛋白的理论酶切肽段的可检测性,筛选可检测性分数达到一定阈值的肽段来构建谱图库。在HeLa细胞和小鼠组织样品数据集上的测试结果表明,与考虑全部理论肽段相比,可检测性筛选能降低DIA分析的假阳性率并提高蛋白鉴定量。


临床样品尝试



    我们进一步将DeepDIA用于未去高峰度蛋白的血清样品的DIA分析。根据前期研究汇总得到的肽段列表,使用DeepDIA构建谱图库,与现有去高峰度蛋白、色谱分馏、依靠DDA建库的方法相比,DeepDIA检测到蛋白的数量为DDA建库的两倍以上。鉴定的准确率通过添加稳定同位素标记的血清肽段标准品得到了验证。

实际应用


    在建立好模型之后,我们可以直接将预测的数据库导入Spectronaut软件,随后的数据分析流程就完全和常规分析一模一样。

    我们的愿景就是更快更好的推动DIA技术的实用化,未来蛋白质组学实验室可以利用深度学习技术构建专用于特定仪器的模型,将其用于该仪器DIA数据的分析,而无需另外进行DDA实验。如果您对我们的方法感兴趣,希望进行尝试,欢迎和易算联系,我们可以为您的实验室专门打造模型预测和建库平台。

 全文链接:https://doi.org/10.1038/s41467-019-13866-z

如果大家觉得有所收获,想要进一步了解相关分析方案,或者与乔老师和我们进行研究合作。随时和我们联系啦。

上海易算生物科技有限公司 转载请注明出处


更多蛋白质组学技术信息请参阅我们的官方网站:
www.omicsolution.com
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com
support@omicsolution.com
+86-18221381405