---
title: "临床大队列蛋白质组学你真的会做么？"
author: "omicsolution"
account: "omicsolution"
published_at: "2021-08-27T10:10:24+08:00"
captured_at: "2026-08-24T11:50:16.156381+08:00"
source_url: "https://mp.weixin.qq.com/s?__biz=MzI2MTI5NDAzNg==&mid=100002425&idx=1&sn=b21ce2c63f4a388b4013b0d143db9dd4&chksm=6a5dd8c25d2a51d42c8d7f53bb7b63b694107a4b1cc48a06c8a1124c38106ae1d51cd1efc792#rd"
---

# 临床大队列蛋白质组学你真的会做么？
●

第一章 色谱重复性评价

●

在我们使用质谱进行大队列样品或者多组学整合定量分析的时候，质谱定量结果的可靠性非常重要，一旦忽视了结果的可靠性，那么往往就会得出和实际情况截然相反的结论。而定量可靠性的影响因素相当多，包括：样品采集，样品制备，色谱分离，质谱检测及分析策略。我们的系列介绍第一章节将为大家介绍色谱柱表现测试。

大多数课题都会在测试间隙插入QC样品（以细胞lysate或测试对象混样为主），然后拿到QC结果后如何进行稳定性评价呢？

根据我的了解，目前很多课题组评价的是鉴定到的蛋白数量稳定性，比如从第一个样品到最后一个保持5900-6100的定性数量即为合格。然而我们最终目的是进行定量，我们汇报蛋白定量值的数据来源是LC-MS检测到的谱峰。无论是MS1还是MS2定量，其precursor或b、y离子构建成的feature定量值组成了肽段定量结果的基本信息，肽段定量结果通过不同算法最终组成蛋白定量结果。所以定量结果的QC必不可少。

在一些已发表的文献中采用的QC方法不尽相同，也缺乏量化指标，比如某篇文献采用iBAQ归一化值评估蛋白水平的PCA和正态分布。

![图片 1](images/001.png)

Matthias Mann在其研究CSF大队列的文献中评估了从样品制备开始的蛋白定量重复性。

We investigated intra- and inter-assayvariability of our automated CSF pipeline by repeated sample preparation(Materials and Methods), which revealed high reproducibility with over 1,000proteins having inter-assay CVs below 20%.

![图片 2](images/002.png)

但经过了软件鉴定，层层过滤、precursor到peptide，peptide到protein group降维得到的定量值往往比最直接的feature定量信息细节更少，起不到严格质控的作用。本文我们通过色谱峰定性、定量一致性评价间接介绍下稳定的色谱体系的重要性和IonOpticks色谱柱的优异稳定性表现。

第一步：

通过添加iRT肽段来评估色谱稳定性。

由Biognosys公司开发的iRT（ki-3002）试剂盒，是由11条人工合成的标准肽段混合物组成，在样品上质谱检测前掺入该试剂，一方面可以作为软件矫正的依据，更精确的识别质谱峰。另一方面，软件可以根据iRT肽段来对采集的数据进行实时监控以及质量评估。在进行大队列临床样本检测之前，我们在每个样本中都掺入适量iRT标肽。

首先，通过11条标肽的出峰时间对色谱梯度设置的合理性及出峰时间的稳定性进行评估。如下图，左图基于11条iRT标肽的出峰时间对检测样品的梯度稳定性进行评估。横坐标为已检测完成的100例样本，纵坐标为保留时间，可以看到样本间出峰时间一致性较好（CV< 3%），说明色谱稳定性极好。11条标肽纵坐标间隔均匀说明梯度设置较合理。右图展示软件预测的保留时间与实际保留时间的偏差值，纵坐标偏差值越小，说明软件预测的结果越精确越有利于鉴定，横坐标不同样本间的一致性好，且基本稳定在2min以内。

![图片 3](images/003.png)

![图片 4](images/004.png)

其次，通过监控11条肽段的半峰宽，可以评估色谱柱效的稳定性。半峰宽稳定在0.2-0.3min是比较理想的状态，如下图即使完成100例样本的检测，色谱峰宽仍然没有明显的变化，柱效保持良好。

![图片 5](images/005.png)

第二步：

蛋白定量结合feature定量的相关性和CV评价稳定性。

我们在很多仪器、CRO公司展示的3次连续进样的重复性上可以看到往往CV都能够平均值小于20%甚至10%。但是这类数据无法评价长期、大队列研究的定量稳定性。感谢我们客户的数据支持，我们在此测试了3套数据集，分析方法是采用Spectronaut、Maxquant或Peaks进行非标定量后取蛋白及feature水平的定量值统计。

![图片 6](images/006.png)

首先我们采用蛋白水平的定量值（不填缺失值）在悟空云上进行相关性分析（https://www.omicsolution.com/wkomics/passwd/Correlationpart2/），将缺失值改成0后计算pearson相关系数。

![图片 7](images/007.png)

![图片 8](images/008.png)

![图片 9](images/009.png)

Mann数据集

客户数据集1

客户数据集2

我们可以看到三套数据集的蛋白水平

我们可以看到三套数据集的蛋白水平CV几乎都非常接近1，可以说都非常完美。那是否就代表这些数据都很理想呢？

让我们升维到feature水平进行比较

![图片 10](images/010.png)

![图片 11](images/011.png)

![图片 12](images/012.png)

Mann数据集

客户数据集1

客户数据集2

在

在feature水平可以看到相关性系数从几乎都是0.99~1降到了0.9~0.98，由于蛋白定量基本上都是将定量强度较高的肽段整合为蛋白定量值，因此会损失大量低丰度信号的定量可靠性评价信息。而feature水平的比较更加接近实际色谱稳定性表现。但是我们需要注意的是相关性系数依然是个降维指标，无法真实反映重复之间的定量一致性。因此我们再升维至所有feature的定量分布来看下真实情况。

![图片 13](images/013.png)

![图片 14](images/014.png)

![图片 15](images/015.png)

Mann数据集

客户数据集1

客户数据集2

上图为上图为CV（横坐标）和所有feature定量强度（纵坐标）散点图

每套数据基本都定量到了8万个左右feature，数据规模基本一致，可以大略看到CV大的feature基本都为信号强度较弱的谱峰，也符合我们的一般认知。但由于feature数量多达8万，无法从散点图上看到实际差异。

![图片 16](images/016.png)

上图，纵坐标为不同区间CV，横坐标为相应的feature数量。

如果我们把CV值分布进行比较的话，可以发现客户数据集2>客户数据集1>Mann数据集。同一根ionOpticks色谱柱的表现好于完全不同批次的ionOpticks色谱柱表现，但都好于Mann数据集，限于信息有限，我们无法判断到底是重复制样的重复性不好还是自制色谱柱的重复性不好。不过可以看到的是，在蛋白、feature水平Pearson相关系数非常理想的情况下，feature的CV分布依然可以发现巨大差异，也提示我们进行定量QC的时候，降维处理并不一定可以发现问题。Feature定量CV不同的情况下，蛋白水平的定量也许并不会有很大差别，但是如果我们关注的是中低丰度蛋白的定量结果的时候，这个影响因素就会放大到可能导致定量不准确的结果。

综上，大队列质谱检测不仅仅是常用的3vs3差异比较蛋白质组的一个简单放大，在需要长期运行稳定性、多次更换色谱柱及质谱系统维护条件下，大队列数据的定量可靠性受液相系统，色谱柱的影响非常之大，我们需要谨慎选择相应的方案进行数据采集，否则系统误差往往会大于样品的实际差异，从而导致得出错误结论。

我们会在后续推文中展开讨论其他影响因素，敬请关注。如果需要稳定的，可重复的色谱表现的话，也欢迎和我们联系采购ionOpticks色谱柱。该色谱柱是如何实现高性能、高可重复性表现的请参考我们往期内容。

即插即用，性能卓越Ionopticks色谱柱值得拥有

www.omicsolution.com

若有任何疑问，欢迎邮件或来电咨询：

marketing@omicsolution.com

support@omicsolution.com

+86-18221381405

●

更多阅读

●

悟空云数聚分析

Spectronaut 15更新介绍

Spectronaut 15全新界面介绍

高精度iRT预测你了解吗？

END
