我在2年多前测试了当时比较新的计算机硬件的搜库速度。

计算机硬件与质谱数据分析

。今天,我把当时比较新的AMD TR 1950X作为参考,给大家看看最近2年的硬件提升效果。

同时我们测试了两套较大规模的质谱数据,让大家感受下PEAKS ONLINE的分析速度有多快吧。

CPU测试采用的测试软件为最新版本Maxquant 1.6.10.43,测试数据为

蛋白质组学第4期 文章搜库过程复现中引用的3v3 QE-HF非标记定量数据集。

各位如果想对比测试下自己的计算机性能,可以从我们的百度云下载数据,以及相应我测试用的参数文件和fasta,保证测试标准完全一致,你需要修改的就是线程数量和raw,fasta目录。


我们来看下结果


当年性能领先的TR 1950X到了今年的测试中已然垫底,而最新一代TR 3970X的速度达到了它的两倍,仅仅两小时就能分析完毕一套3v3的长梯度非标记定量分析。同时我们可以看到,在这种数据规模较小的数据分析中,4路志强112核心的平台并没有比32核的平台更快,这是因为多路CPU系统的单核性能差于32核系统,如下图:AMD的TR3970X单核性能502,远高于4路铂金的331单核性能,同时多核性能也达到了4路铂金的一半,因此在处理海量数据或者同时分析多批数据的时候4路铂金系统才能显示其优越性。



当我们把数据量提升到32个RAW文件(100GB大小),把32核计算机性能跑满,大概得到如下结果。




最终我们可以观察到,单核处理的Feature detection并没有增加多少处理时间,而依赖于多核性能的search步骤,就如实反映了数据量增加的效果。

我们以8核CPU处理12个RAW的过程示意如下:



Feature detection是1个核心只能处理1个文件,所以当文件数量大于核心数量,就得排队,使得效率下降;search步骤均为并行处理,所以搜库时间纯粹取决于MS/MS数量,而各种统计、合并、结果生成步骤均只能单核计算,因此分析时间与结果大小成正比。


以上是以Maxquant软件为例展示硬件和数据分析间错综复杂的关系。

最后6个RAW和32个RAW的搜库时间是120分钟vs500分钟,并不是5.3倍的差异,但也并没有体现多核优势。这是为什么呢?在大数据处理中,Maxquant相当多步骤依赖于单核分析,无法利用多核优势,使得很多人会觉得搜库速度很慢。这是算法的问题,无法通过更新硬件提升太多,在搜索大数据库、多修饰和多文件的时候尤其明显。我们需要做的是换更适合处理大数据的软件。我们在

全新一代的Peaks Online搭配使用2路志强铂金

8280,也就是56核心的计算机上测试了两套较大规模数据。


数据集1:

Integrated Proteogenomic Characterization of HBV-Related Hepatocellular Carcinoma

https://www.cell.com/cell/fulltext/S0092-8674(19)31003-7

其中33套TMT11标,每个样品分级48个fraction数据,共1584个raw,数据大小1TB。

仅用时3天


数据集2:120个raw,60分钟HFX,分级非标记定量(内部测试数据)

仅用时10小时42分钟



对于专门针对大数据集优化的软件来说,不再有单核步骤,大部分分析均多核完成,从而大大提升了分析效率,这也是我们能够快速处理大数据的一个基础。

当我们在头疼为何总是搜库搜的那么慢,花了好多万换了台服务器好像也没快多少的时候,你可以考察下是不是你改换软件了呢。是的话赶紧联系我们吧,软件硬件一起搞定。

上海易算生物科技有限公司 转载请注明出处


更多蛋白质组学技术信息请参阅我们的官方网站:
www.omicsolution.com
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com
support@omicsolution.com
+86-18221381405