---
title: "如何提升搜库速度 2019版"
author: "沈诚频"
account: "沈诚频"
published_at: "2019-12-15T13:16:16+08:00"
captured_at: "2026-08-24T11:50:18.313409+08:00"
source_url: "https://mp.weixin.qq.com/s?__biz=MzI2MTI5NDAzNg==&mid=100000578&idx=1&sn=22035d700e6dee3996ea12a17f10f2b4&chksm=6a5dd1f95d2a58efa9c5f9a2238c6a8d8e7616c2371ac0f9c4808bfb528e76fa4b117bb594ed#rd"
---

# 如何提升搜库速度 2019版
我在2年多前测试了当时比较新的计算机硬件的搜库速度。

计算机硬件与质谱数据分析

。今天，我把当时比较新的AMD TR 1950X作为参考，给大家看看最近2年的硬件提升效果。

同时我们测试了两套较大规模的质谱数据，让大家感受下PEAKS ONLINE的分析速度有多快吧。

CPU测试采用的测试软件为最新版本Maxquant 1.6.10.43，测试数据为

蛋白质组学第4期 文章搜库过程复现中引用的3v3 QE-HF非标记定量数据集。

各位如果想对比测试下自己的计算机性能，可以从我们的百度云下载数据，以及相应我测试用的参数文件和fasta，保证测试标准完全一致，你需要修改的就是线程数量和raw，fasta目录。

![图片 1](images/001.png)

![图片 2](images/002.gif)

![图片 3](images/003.png)

我们来看下结果

![图片 4](images/004.jpg)

当年性能领先的TR 1950X到了今年的测试中已然垫底，而最新一代TR 3970X的速度达到了它的两倍，仅仅两小时就能分析完毕一套3v3的长梯度非标记定量分析。同时我们可以看到，在这种数据规模较小的数据分析中，4路志强112核心的平台并没有比32核的平台更快，这是因为多路CPU系统的单核性能差于32核系统，如下图：AMD的TR3970X单核性能502，远高于4路铂金的331单核性能，同时多核性能也达到了4路铂金的一半，因此在处理海量数据或者同时分析多批数据的时候4路铂金系统才能显示其优越性。

![图片 5](images/005.jpg)

当我们把数据量提升到32个RAW文件（100GB大小），把32核计算机性能跑满，大概得到如下结果。

![图片 6](images/006.jpg)

![图片 7](images/007.png)

最终我们可以观察到，单核处理的Feature detection并没有增加多少处理时间，而依赖于多核性能的search步骤，就如实反映了数据量增加的效果。

我们以8核CPU处理12个RAW的过程示意如下：

![图片 8](images/008.png)

Feature detection是1个核心只能处理1个文件，所以当文件数量大于核心数量，就得排队，使得效率下降；search步骤均为并行处理，所以搜库时间纯粹取决于MS/MS数量，而各种统计、合并、结果生成步骤均只能单核计算，因此分析时间与结果大小成正比。

以上是以Maxquant软件为例展示硬件和数据分析间错综复杂的关系。

最后6个RAW和32个RAW的搜库时间是120分钟vs500分钟，并不是5.3倍的差异，但也并没有体现多核优势。这是为什么呢？在大数据处理中，Maxquant相当多步骤依赖于单核分析，无法利用多核优势，使得很多人会觉得搜库速度很慢。这是算法的问题，无法通过更新硬件提升太多，在搜索大数据库、多修饰和多文件的时候尤其明显。我们需要做的是换更适合处理大数据的软件。我们在

全新一代的Peaks Online搭配使用2路志强铂金

8280，也就是56核心的计算机上测试了两套较大规模数据。

数据集1：

Integrated Proteogenomic Characterization of HBV-Related Hepatocellular Carcinoma

https://www.cell.com/cell/fulltext/S0092-8674(19)31003-7

其中33套TMT11标，每个样品分级48个fraction数据，共1584个raw，数据大小1TB。

仅用时3天

![图片 9](images/009.png)

数据集2:120个raw，60分钟HFX，分级非标记定量（内部测试数据）

仅用时10小时42分钟

![图片 10](images/010.png)

对于专门针对大数据集优化的软件来说，不再有单核步骤，大部分分析均多核完成，从而大大提升了分析效率，这也是我们能够快速处理大数据的一个基础。

当我们在头疼为何总是搜库搜的那么慢，花了好多万换了台服务器好像也没快多少的时候，你可以考察下是不是你改换软件了呢。是的话赶紧联系我们吧，软件硬件一起搞定。

上海易算生物科技有限公司 转载请注明出处

更多蛋白质组学技术信息请参阅我们的官方网站：
www.omicsolution.com
若有任何疑问，欢迎邮件或来电咨询：
marketing@omicsolution.com
support@omicsolution.com
+86-18221381405
