感谢互联网硬件的进步,前两天刚上线Cancer Cell的CPTAC最新大作,一晚上我就能把原始数据都给下完了。
80MB/s的下载速度看着甚是令人欣慰。
文中眼花缭乱的多组学分析直接丢给同事研究去了,我作为一个只会搜库的技工,直奔分析方法而去。
随机选了几个raw搜库对比后,有点感慨,直接上
1.大佬的数据质量,也有值得商榷的地方(高情商);
2.DIA正在淘汰TMT,但缺乏对DIA方法的充分认识,大佬的谱图库,可能也是白建了(低情商);
3.抛开生物学问题不提,我们的数据质量妥妥碾压他们(低情商);
4.即使Cancer Cell里面错别字也是漫山遍野(低情商,本文不讨论)。
直入主题,我们看下该文的
嗯,常规的pool所有样品后建库。
从RAW的采集时间可以发现先采集了DIA数据后采集DDA分级建库,这是一个比较谨慎的操作,但最终可能由于时间紧张或各种其他原因,建库依然混合了所有样品,那么问题来了,如果其中个别样品存在污染(无论何种污染),整个library都会因污染而质量下降。正确的做法应该是先把所有DIA样品跑一遍QC,排除所有异常样品后混合建库,或不建库(在最新版SN17的加成下,大队列实验建谱图库已然意义不大)。
然后,让我们来看下
Confirmatory和Discovery数据库分别得到7600/8279个PG,8W/8.5W Precursor。这个结果算不算多呢?
对比我司采用几乎相同的质谱方法、仪器(Orbitrap Lumos)、色谱梯度(120min)、分析软件(Spectronaut)做的谱图库:
可以发现蛋白数多了30%,Precursor多了100%+。那其中原因是什么呢?
谱图库包含血液污染蛋白后鉴定量大幅下降。通过观察谱图库中蛋白丰度情况,可以发现ALB,HBB等常见血液、血细胞蛋白高丰度污染,也就是部分血液未洗净的样品污染了整个谱图库。类似下图,产生了明显拖尾的高丰度TIC,直接大幅降低了低丰度多肽的检测率。
我也同时统计了CCRCC谱图库中强度排名前1000的高丰度信号和全部平均的区别。如下左图:强度最高的前1000个谱峰比整体平均值高了近3个数量级。而峰宽(下右图)也达到了2分钟之多!而我司的数据通常60分钟梯度平均峰宽10秒,120分钟梯度平均峰宽15秒。
那么这样的谱图库对
是什么呢?
文章原文采用了Fragpipe建库,DIA-NN定量的策略分析,为了评估谱图库质量好坏对结果的影响,我们随机选择了其中部分样品提取原文中的结果,再采用DIA-NN1.8.1预测谱图库,Spectronaut directDIA,Spectronaut17 HybridDIA等策略进行分析对比,结果如下:
可以看到,原始文献基于谱图库DIA分析仅能定量6395个蛋白,预测谱图库反而可以定量到7506个蛋白,进一步采用directDIA则实现了7577个蛋白,10W precursor定量的深度,该单针DIA定量结果甚至不比分级谱图库的结果少多少。我们进一步结合Spectronaut的Hybrid策略(directDIA+DDA谱图库)发现提升不到2%,属于聊胜于无。也就是加入谱图库信息无法提升定量深度,而如原文这样直接用谱图库定性定量的话,结果反而非常糟糕。
如果没有认真评估谱图库数据质量而直接使用的话,有时候反而得不偿失。并不是说谱图库无用,我司自建库相对directDIA可以提升约15-20%的定量深度,因此不是策略有问题,而是没有认真把控实验细节的话可能就会翻车。
上图是文中DIA数据分析的流程,初入江湖的新手们是不是看的一脸懵逼?但我只能说:事倍功半。
最后我们再稍微对比下
数据
下面两张图分别是文中随机选择5个病人DIA的TIC峰图,以及我司采集的大队列DIA临床病人数据随机的5个TIC峰图。您能看出什么区别么?
图A
图B
A图是CCRCC数据,B图是我司的乳腺癌组织数据。稍微学习过TIC图如何看的读者们应该能够看出些区别了吧,要说这是个体差异打死我也是不信的,这也是为何CCRCC只能定量7000左右蛋白,而B组定量超过8000了。PS:通常来说肾组织的蛋白复杂度应该是人体主要器官中居于前列的。
如果样品采集、前处理、色谱质谱分离过程中任何一步出现差错,体现在TIC上就是信号的不一致,那么这样子信号不一致的结果是否推导出生物学结论是否正确,就很值得深思了。
这边可能有人会问,是不是DIA定量就是比TMT不准或者麻烦呢?当然不是,在我大体浏览一遍原始数据后,可以初步得出结论:整个色谱质谱体系的稳定性还是没有问题的,大概率问题出在样品收集和前处理的不可靠上。这样的话采用TMT定量一样也会产生类似的谱峰,唯一的区别就是在同位素标记后,异质性极大的样品都被混合上样了,也就是你无法轻易看出样品间的高度异质性了,这只能叫做眼不见为净。
最后简单
DIA大队列定量即使采用相对老旧的Lumos质谱,依然可以实现单针8000以上定量深度。谱图库可以提升DIA深度,但前提是必须良好把控谱图库混样样品质量及检测效果,否则可能就如这篇最新的Cancer Cell一样,费心费力后得到了一个很普通的定量结果。定量深度远远差于不建库directDIA。