我在2年多前测试了当时比较新的计算机硬件的搜库速度。
计算机硬件与质谱数据分析。今天,我把当时比较新的AMD TR 1950X作为参考,给大家看看最近2年的硬件提升效果。
CPU测试采用的测试软件为最新版本Maxquant 1.6.10.43,测试数据为
蛋白质组学第4期 文章搜库过程复现中引用的3v3 QE-HF非标记定量数据集。各位如果想对比测试下自己的计算机性能,可以从我们的百度云下载数据,以及相应我测试用的参数文件和fasta,保证测试标准完全一致,你需要修改的就是线程数量和raw,fasta目录。






当年性能领先的TR 1950X到了今年的测试中已然垫底,而最新一代TR 3970X的速度达到了它的两倍,仅仅两小时就能分析完毕一套3v3的长梯度非标记定量分析。同时我们可以看到,在这种数据规模较小的数据分析中,4路志强112核心的平台并没有比32核的平台更快,这是因为多路CPU系统的单核性能差于32核系统,如下图:AMD的TR3970X单核性能502,远高于4路铂金的331单核性能,同时多核性能也达到了4路铂金的一半,因此在处理海量数据或者同时分析多批数据的时候4路铂金系统才能显示其优越性。

当我们把数据量提升到32个RAW文件(100GB大小),把32核计算机性能跑满,大概得到如下结果。


最终我们可以观察到,单核处理的Feature detection并没有增加多少处理时间,而依赖于多核性能的search步骤,就如实反映了数据量增加的效果。





Feature detection是1个核心只能处理1个文件,所以当文件数量大于核心数量,就得排队,使得效率下降;search步骤均为并行处理,所以搜库时间纯粹取决于MS/MS数量,而各种统计、合并、结果生成步骤均只能单核计算,因此分析时间与结果大小成正比。
以上是以Maxquant软件为例展示硬件和数据分析间错综复杂的关系。
全新一代的Peaks Online搭配使用2路志强铂金
8280,也就是56核心的计算机上测试了两套较大规模数据。




Integrated Proteogenomic Characterization of HBV-Related Hepatocellular Carcinoma
其中33套TMT11标,每个样品分级48个fraction数据,共1584个raw,数据大小1TB。
仅用时3天
数据集2:120个raw,60分钟HFX,分级非标记定量(内部测试数据)





对于专门针对大数据集优化的软件来说,不再有单核步骤,大部分分析均多核完成,从而大大提升了分析效率,这也是我们能够快速处理大数据的一个基础。
当我们在头疼为何总是搜库搜的那么慢,花了好多万换了台服务器好像也没快多少的时候,你可以考察下是不是你改换软件了呢。是的话赶紧联系我们吧,软件硬件一起搞定。
上海易算生物科技有限公司 转载请注明出处
更多蛋白质组学技术信息请参阅我们的官方网站:
www.omicsolution.com
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com
support@omicsolution.com
+86-18221381405