---
title: "乔亮组新进展：基于深度学习提高DDA MS1鉴定能力"
author: "omicsolution"
account: "omicsolution"
published_at: "2024-09-10T10:03:55+08:00"
captured_at: "2026-08-26T17:25:36.685992+08:00"
source_url: "https://mp.weixin.qq.com/s/s1EgynR6Tv6CUjVPyuUJpA"
---

# 乔亮组新进展：基于深度学习提高DDA MS1鉴定能力
点击蓝字关注我们

复旦大学化学系乔亮老师又发新文！文章题目：Deep Learning Powers Protein Identification from Precursor MS Information，发表期刊：Journal of Proteome Research。该文章开发了一个新方法，MonoMS1，基于深度学习和逻辑回归，可以支持从DDA数据的MS1信息中进行蛋白鉴定。文章将这个方法应用于大肠杆菌、人血清和单细胞蛋白质组分析。结果发现，MonoMS1在MS1 feature鉴定方面有显著提高，在血清和单细胞数据集中，MonoMS1也补充了肽和蛋白的鉴定数量。

基于LC-MS的肽水平鉴定依赖于一级质谱(MS1)获得的准确分子量和二级质谱(MS2)获得的碎片信息。然而，目前应用广泛的数据依赖性采集(data-dependent acquisition, DDA)，在MS2扫描中可能无法选择低丰度feature，从而导致缺失值、碎片的半随机性和高丰度肽段的重复采集。这种情况在分析low-input的样本或动态范围较宽的样本时更为明显。尽管DIA技术可以采集所有母离子的所有碎片，但全部母离子的鉴定仍受到现有数据分析策略的限制，也有上限。因此，本文开发了基于DDA数据的MS1鉴定方法，提高MS1 feature的鉴定能力，补充MS2的鉴定深度。

![图片 1](images/001.png)

接下来，我们来看下MonoMS1方法的工作流程和分析应用吧！

一、MonoMS1工作流程概述

MonoMS1方法，通过整合四个维度的信息来鉴定MS1 feature，包括肽的分子量、离子迁移率、保留时间和可检测性。其中，后三个信息是通过深度学习进行预测的。随后，使用逻辑回归模型为每个维度信息分配不同的权重，以实现肽的鉴定，并利用MS2鉴定的feature来训练该模型。为了确保结果的可靠性，研究团队还采用了reference-decoy方法在feature和肽水平上评估FDR（假发现率），应用于大肠杆菌、人血清和单细胞蛋白组。

（对于大肠杆菌，用先前鉴定的48783条肽段，对应4014个大肠杆菌蛋白作为reference库，其诱饵库为HeLa肽段序列。对于人血清，用先前报道的27250条肽段，对应2617个蛋白质作为reference库，这是采用去除高丰度和色谱分馏的方式鉴定到的结果，其诱饵库为大肠杆菌。对于单细胞，选择来自相同细胞群的70638条肽段作为reference库，其诱饵库为大肠杆菌。decoy库与reference库1:1混合。）

此外，研究整合了Ivanov等人开发的二项模型计算蛋白质评分，能够提高肽鉴定的准确性，并更有效地建立肽质量控制。

![图片 2](images/002.png)

二、利用大肠杆菌数据集评价MonoMS1

在本研究中，研究团队利用timsTOF Pro获取的HeLa细胞DDA数据来训练深度学习模型，并使用训练后的模型预测肽段的各种信息。结果显示，在大肠杆菌数据集中，预测的iRT与实验iRT之间的Pearson相关系数均超过0.99，离子迁移率的预测，双电荷母离子的Pearson相关系数也达到了0.99。这些结果表明，深度学习模型在iRT和离子迁移率的预测中表现出极高的准确性，甚至与最近开发的深度学习工具（如DeepLC和DIA-NN）相当或更优（图S3）。这为基于MS1的多肽鉴定提供了可靠依据。

![图片 3](images/003.png)

MonoMS1方法预测的iRT和离子迁移率与实验的相关性

![图片 4](images/004.png)

DeepLC和DIA-NN预测的iRT和离子迁移率与实验的相关性

相较于传统的基于MS2的鉴定方法，MonoMS1在MS1 feature 鉴定方面提升了114%到141%。基于reference-decoy评估，MonoMS1 feature 鉴定准确率达到96.1%。即使在肽FDR 1%的条件下，MonoMS1仍能补充鉴定到21,965个feature，且准确率为99.2%（图2b）。这些结果表明，MonoMS1能够充分利用MS1来增加肽和蛋白质鉴定数量。如图2c所示，MonoMS1在肽FDR 5%条件下补充鉴定了8,985个肽，在肽FDR 1% 条件下，补充鉴定了6,268个肽。此外，MonoMS1还成功在肽水平FDR 5%和1% 条件下补充鉴定了366和79个蛋白质（图2c）。

![图片 5](images/005.png)

为进一步验证MonoMS1补充鉴定肽的准确性，研究团队还采集了同一样本的DIA数据进行评估。结果显示，在1%肽水平FDR下，DIA方法与MonoMS1补充鉴定的结果有近一半的重叠；在5%肽水平FDR下，DIA与MonoMS1补充鉴定也有相当大的比例覆盖。需要注意的是，MonoMS1补充鉴定到而DIA未鉴定到的肽并不一定是不准确的，因为DIA虽然采集了所有母离子的所有碎片信息，但全部母离子的鉴定仍受到现有数据分析策略的限制，DIA也有局限性，所以开发MonoMS1提高DDA MS1鉴定能力、补充MS2鉴定深度也是有必要的。

![图片 6](images/006.png)

三、用MonoMS1分析人血清蛋白质组

在血清蛋白质组学研究中，由于血清中蛋白质含量的动态范围非常宽，检测低丰度蛋白质一直是一个巨大的挑战。低丰度蛋白质仅能在MS1上产生微弱的信号，而难以获得相应的MS2信息。为解决这一问题，研究团队将MonoMS1方法应用于人血清数据，利用MS1 feature来补充多肽和蛋白质组的鉴定。在这些样品中，加入了PQ500稳定同位素标记的参考肽，作为评估MonoMS1鉴定准确性的手段。

结果显示，与基于MS2的方法相比，在肽水平5% FDR下，MonoMS1补充鉴定了15,252个MS1 feature，在1% FDR下补充鉴定了11,310个MS1 feature，基于reference-decoy方法评估准确率，高达98%和99.7%（图3a）。这使MonoMS1有效补充了MS2方法的肽和蛋白质鉴定（图3b）。具体来说，MonoMS1在5% FDR下鉴定了3,407个肽，其中1,282个是特有鉴定；在1% FDR下共鉴定出2,297条肽，其中534条为MonoMS1特有鉴定。在蛋白质水平上，MonoMS1同样能够补充MS2的结果。

![图片 7](images/007.png)

采用PQ500同位素标肽对MonoMS1方法进行验证。研究发现，MS1 feature在预期的质量偏移处表现出明显的同位素峰，这验证了MonoMS1的鉴定准确性（图3c）。当肽FDR设定为5%时，在鉴定的1,174个MS1 feature 中，有1,071个（91.2%）被match为PQ500同位素标肽；当FDR设定为1%时，这一比例为92.1%（图3d）。需要指出的是，没有同位素峰并不一定意味着鉴定不准确，这可能与样品浓度不足或分离效率不高有关。整体结果表明，MonoMS1 feature 鉴定可靠性超过了91%。

![图片 8](images/008.png)

为了进一步评估MonoMS1的定量准确性，研究团队分析了血清样本在三次技术重复中的肽和蛋白质定量CV（图3e）。在1% FDR条件下，基于MS2的方法与MonoMS1方法的肽定量中位CV均小于10%，在蛋白质结果中，MonoMS1的中位CV为5.54%，比MS2的更低。低CV值进一步验证了MonoMS1在肽和蛋白质水平上具有较高的定量准确性。

![图片 9](images/009.png)

四、MonoMS1分析单细胞蛋白质组

在单细胞蛋白质组学研究中，由于单细胞内蛋白质含量低，导致许多MS1 feature未被充分利用。为解决这一问题，研究团队将MonoMS1方法应用于单细胞数据集，充分挖掘MS1数据，补充肽和蛋白质的鉴定。该研究的单细胞数据集包含6组实验，分别为1到6个HeLa细胞，每组进行了4个技术重复。

研究结果表明，MonoMS1在肽水平1% FDR和5% FDR的标准下，都能够补充DDA数据MS1 feature的鉴定，并在所有6组数据集中表现出较高的准确性（图4a）。进一步分析显示，MonoMS1显著增加了单细胞中肽（图4b）和蛋白质（图4c）的检测数量。如图4d-f所示，基于MS2和MonoMS1的鉴定结果在6个细胞的重复实验中均展示出较高的定量精度和准确度，证明了MonoMS1在单细胞水平上具有可靠的蛋白质鉴定能力。通过利用这些MS1 feature，MonoMS1不仅补充了现有的肽和蛋白质检测结果，还保持了良好的肽FDR控制，为单细胞蛋白质组学研究提供了有力支持。

![图片 10](images/010.png)

好了，以上就是今天的内容。假如你正在或者将要开展DDA蛋白质组学方面的课题，MonoMS1可以助你鉴定到更多更丰富的蛋白/肽段信息，MonoMS1的源代码可以在GitHub上免费访问(https://github.com/lmsac/MonoMS1)。

往期易算合作发文收录在公众号菜单：生信与文献分析->易算案例。

龙年第三篇【Microbiome】复旦乔亮、澳洲国立林宇与易算团队联合推出ConDiGA：基于宏基因组精准构建宏蛋白组序列库

【Cell Rep】易算共一作：蛋白代谢+机器学习发现肝细胞癌治疗敏感分子

龙年巨献第一篇：浙江大学方群团队最新研究Nat Commun亮相 | PiSPA技术在单细胞蛋白质组领域实现3000+PG新高度

复旦乔亮团队与易算最新研究成果：宏蛋白组建库方法与应用

客户文章—小鼠空间脑图谱，一种快速微量磷酸化蛋白组学技术的空间分析

Nature Commun|复旦-易算携手发表磷酸化位点定位错误率估计算法 DeepFLR

如何深入糖蛋白组的数据挖掘 | Int J Mass Spectrom |复旦大学与易算共同开发在线平台GlycAP文章发表

Frontier Oncology（IF 6.2）|复旦大学与易算发表蛋白组联合代谢组揭示了通路在子宫内膜癌中的作用

NPJ BIOFILMS MICROBI|复旦-交大-易算最新合作成果：DIA如何跨过宏蛋白组的第一宇宙速度

联系我们

CONTACT US

![图片 11](images/011.webp)

![图片 12](images/012.png)
