---
title: "Cancer Cell | 有没有一种可能，你的谱图库白建了？"
author: "shygza"
account: "shygza"
published_at: "2022-12-31T13:40:29+08:00"
captured_at: "2026-08-26T17:39:34.074624+08:00"
source_url: "https://mp.weixin.qq.com/s/IA4vj-YCuL7a6BfpdQaIWA"
---

# Cancer Cell | 有没有一种可能，你的谱图库白建了？
点击蓝字，关注我们

感谢互联网硬件的进步，前两天刚上线Cancer Cell的CPTAC最新大作，一晚上我就能把原始数据都给下完了。

![图片 1](images/001.png)

![图片 2](images/002.png)

80MB/s的下载速度看着甚是令人欣慰。

文中眼花缭乱的多组学分析直接丢给同事研究去了，我作为一个只会搜库的技工，直奔分析方法而去。

随机选了几个raw搜库对比后，有点感慨，直接上

![图片 3](images/003.png)

结论

1.大佬的数据质量，也有值得商榷的地方（高情商）；

2.DIA正在淘汰TMT，但缺乏对DIA方法的充分认识，大佬的谱图库，可能也是白建了（低情商）；

3.抛开生物学问题不提，我们的数据质量妥妥碾压他们（低情商）；

4.即使Cancer Cell里面错别字也是漫山遍野（低情商，本文不讨论）。

直入主题，我们看下该文的

建库策略

![图片 4](images/004.png)

嗯，常规的pool所有样品后建库。

![图片 5](images/005.png)

坑1

从RAW的采集时间可以发现先采集了DIA数据后采集DDA分级建库，这是一个比较谨慎的操作，但最终可能由于时间紧张或各种其他原因，建库依然混合了所有样品，那么问题来了，如果其中个别样品存在污染（无论何种污染），整个library都会因污染而质量下降。正确的做法应该是先把所有DIA样品跑一遍QC，排除所有异常样品后混合建库，或不建库（在最新版SN17的加成下，大队列实验建谱图库已然意义不大）。

然后，让我们来看下

建库效果

![图片 6](images/006.png)

![图片 7](images/007.png)

Confirmatory和Discovery数据库分别得到7600/8279个PG，8W/8.5W Precursor。这个结果算不算多呢？

对比我司采用几乎相同的质谱方法、仪器（Orbitrap Lumos）、色谱梯度（120min）、分析软件（Spectronaut）做的谱图库:

![图片 8](images/008.png)

可以发现蛋白数多了30%，Precursor多了100%+。那其中原因是什么呢？

坑2

谱图库包含血液污染蛋白后鉴定量大幅下降。通过观察谱图库中蛋白丰度情况，可以发现ALB,HBB等常见血液、血细胞蛋白高丰度污染，也就是部分血液未洗净的样品污染了整个谱图库。类似下图，产生了明显拖尾的高丰度TIC，直接大幅降低了低丰度多肽的检测率。

![图片 9](images/009.png)

我也同时统计了CCRCC谱图库中强度排名前1000的高丰度信号和全部平均的区别。如下左图：强度最高的前1000个谱峰比整体平均值高了近3个数量级。而峰宽（下右图）也达到了2分钟之多！而我司的数据通常60分钟梯度平均峰宽10秒，120分钟梯度平均峰宽15秒。

![图片 10](images/010.png)

![图片 11](images/011.png)

那么这样的谱图库对

DIA定量分析的影响

是什么呢？

文章原文采用了Fragpipe建库，DIA-NN定量的策略分析，为了评估谱图库质量好坏对结果的影响，我们随机选择了其中部分样品提取原文中的结果，再采用DIA-NN1.8.1预测谱图库，Spectronaut directDIA，Spectronaut17 HybridDIA等策略进行分析对比，结果如下：

![图片 12](images/012.png)

可以看到，原始文献基于谱图库DIA分析仅能定量6395个蛋白，预测谱图库反而可以定量到7506个蛋白，进一步采用directDIA则实现了7577个蛋白，10W precursor定量的深度，该单针DIA定量结果甚至不比分级谱图库的结果少多少。我们进一步结合Spectronaut的Hybrid策略（directDIA+DDA谱图库）发现提升不到2%，属于聊胜于无。也就是加入谱图库信息无法提升定量深度，而如原文这样直接用谱图库定性定量的话，结果反而非常糟糕。

坑3

如果没有认真评估谱图库数据质量而直接使用的话，有时候反而得不偿失。并不是说谱图库无用，我司自建库相对directDIA可以提升约15-20%的定量深度，因此不是策略有问题，而是没有认真把控实验细节的话可能就会翻车。

![图片 13](images/013.png)

上图是文中DIA数据分析的流程，初入江湖的新手们是不是看的一脸懵逼？但我只能说：事倍功半。

最后我们再稍微对比下

DIA定量

数据

下面两张图分别是文中随机选择5个病人DIA的TIC峰图，以及我司采集的大队列DIA临床病人数据随机的5个TIC峰图。您能看出什么区别么？

![图片 14](images/014.png)

图A

![图片 15](images/015.png)

图B

A图是CCRCC数据，B图是我司的乳腺癌组织数据。稍微学习过TIC图如何看的读者们应该能够看出些区别了吧，要说这是个体差异打死我也是不信的，这也是为何CCRCC只能定量7000左右蛋白，而B组定量超过8000了。PS:通常来说肾组织的蛋白复杂度应该是人体主要器官中居于前列的。

坑4

如果样品采集、前处理、色谱质谱分离过程中任何一步出现差错，体现在TIC上就是信号的不一致，那么这样子信号不一致的结果是否推导出生物学结论是否正确，就很值得深思了。

这边可能有人会问，是不是DIA定量就是比TMT不准或者麻烦呢？当然不是，在我大体浏览一遍原始数据后，可以初步得出结论：整个色谱质谱体系的稳定性还是没有问题的，大概率问题出在样品收集和前处理的不可靠上。这样的话采用TMT定量一样也会产生类似的谱峰，唯一的区别就是在同位素标记后，异质性极大的样品都被混合上样了，也就是你无法轻易看出样品间的高度异质性了，这只能叫做眼不见为净。

最后简单

总结

DIA大队列定量即使采用相对老旧的Lumos质谱，依然可以实现单针8000以上定量深度。谱图库可以提升DIA深度，但前提是必须良好把控谱图库混样样品质量及检测效果，否则可能就如这篇最新的Cancer Cell一样，费心费力后得到了一个很普通的定量结果。定量深度远远差于不建库directDIA。

HAPPY NEW YEAR

年年皆胜意

岁岁都欢愉

上海易算生物科技有限公司

若有任何疑问，欢迎邮件或来电咨询：

marketing@omicsolution.com
support@omicsolution.com
+86-18221381405
