---
title: "悟空云4周年，Nucleic Acids Research发表NAguideR缺失值填充评价工具"
author: "omicsolution"
account: "omicsolution"
published_at: "2020-06-13T21:04:57+08:00"
captured_at: "2026-08-24T11:50:17.847977+08:00"
source_url: "https://mp.weixin.qq.com/s?__biz=MzI2MTI5NDAzNg==&mid=100000774&idx=1&sn=88cf866ac4449ba6f9dceab9342b735b&chksm=6a5dd6bd5d2a5fabce77dd4f31d8b8b4188c2e62e7ba9919830fc21da87612d279935cf1e548#rd"
---

# 悟空云4周年，Nucleic Acids Research发表NAguideR缺失值填充评价工具
>

易算生物推出悟空云四年来，以丰富的分析工具，友好的界面和热烈讨论的QQ群:688728477赢得了广泛的好评，我们深知还有很多缺点，还有很多想法没有实现，并没有大张旗鼓宣传，但也收获了数十篇引用，同时诗盛也孜孜不倦的努力开发更多更好的工具方便广大组学和生物学研究者。

在2019年连发motifeR和psuedoQC两个工具后，今年再次重磅发表一款针对蛋白质组学数据缺失值填充的系统性评价工具，已在线发表在Nucleic Acids Research杂志（IF:11.147）上，并部署在悟空云平台上。

该成果一作为四川大学华西医院蛋白质组学和代谢组学技术平台实验师、再生医学研究中心博士生王诗盛，通讯作者为川大华西医院蛋白质组学和代谢组学平台杨浩老师和耶鲁大学医学院刘延盛老师。

>

原文链接：https://doi.org/10.1093/nar/gkaa498

NAguideR地址：https://www.omicsolution.org/wukong/NAguideR GitHub地址：https://github.com/wangshisheng/NAguideR

如对该文章有任何疑问和想法，欢迎联系wsslearning@omicsolution.com

为使本文简洁明了，现分为如下几点进行介绍：

1. 该工作拟解决的问题

做蛋白质组、代谢组或者基因组相关研究的老师或者同学们通常会遇到数据中出现缺失的情况，即也是常说的missing value，其样式大致如下图，如数据中出现0、NaN、NA、Filtered等等。缺失值问题不解决，后续分析如假设检验、主成分分析、层聚类分析等会受到一定的影响，而且这种影响通常是负面的。因此缺失值的问题需要给予解决。

![图片 1](images/001.png)

（如数据中有很多0，其中每一行是一个蛋白质、每一列是一个样本）

![图片 2](images/002.png)

（如数据中有很多Filtered，其中每一行是一个蛋白质、每一列是一个样本）

2. 研究数据对象的选择

其一，基于作者的研究背景，我们首先聚焦于蛋白质组学数据；其二，传统观点认为，依靠DIA（Data Independent Acquisition，数据非依赖型）技术的得到的数据重现性比较高，但是随着研究的深入，我们注意到即使在DIA模式下，数据的重现性并不能达到令人满意的效果，虽然相比较于DDA（Data Dependent Acquisition，数据依赖型）模式采集到的数据，其在一定程度上是有提升。【PS：对于不理解DIA和DDA概念的小伙伴，没有关系，你就先把它理解为两种不同采集数据的方法即可】

我们发现尤其是在研究蛋白质翻译后修饰（Post Translational Modification）的数据时，如本研究中采集的蛋白质磷酸化数据（Phosphoproteomic dataset），其中有超过75%的磷酸化肽段都无法同时在所有样本中获得完整的定量信息，即在某一些样本中定量数据出现了缺失（missing value）的情况。

所以在该工作中，我们分析了三个层面的蛋白质组数据：磷酸化肽段层次、普通肽段层次、蛋白质层次。三种数据皆是在DIA模式下采集得到。

3. NAguideR处理数据流程

NAguideR处理数据的流程示意图如下，（A）带有缺失值的定性和定量表格数据，其中行是每一个Feature（如蛋白质、肽段、代谢物或者基因等），列是样本。（B）数据质量控制，这里主要通过统计缺失值的占比和计算变异系数来控制参与后续分析的数据质量，如果某个Feature缺失的比例比较高或者变异系数比较大，那么其就会在这一步被删除掉，不会参与后续的分析。（C）23种缺失值填充的方法。（D）2套评价的指标。（E）根据每一个指标得分，辅助指导用户选择相应的缺失值填充的方法。

![图片 3](images/003.png)

对于相应的方法、评价标准介绍和结果分析，这里就不再赘述，感兴趣的老师和同学可以去翻读原文。

4. 一点点有趣的结果说明

在本文最后一个图中，有这样一个有趣的结果，如下（X轴表示有统计学差异的磷酸化肽段的个数，Y轴是每一个缺失值填充的方法。统计差异的判断标准：双尾Student T检验，BH校正后P值小于0.05，倍数变化阈值为1.5）。这个结果是根据磷酸化的数据得到，该数据有2组，每组有10个样本重复（10 VS 10），在蛋白质组学的研究中，每组10个样本重复已不能算少量样本，因此这里我们就可以把不填充的“10 VS 10”数据结果作为“金标准”进行参考（在假设检验的过程，对于每一个磷酸化肽段，如果某样本中有缺失值，即删掉后再进行计算）。对于“3 VS 3”和“5 VS 5”的数据，这里采取的策略是从“10 VS 10”的数据中随机抽取，比如“3 VS 3”就是每组随机抽取3个样本，为了使结果更加稳定可靠，我们将此过程重复100次，因此就有如下云雨图所展示的结果。从结果中我们可以发现，不管采用哪种方法，“3 VS 3”的样本量会很大程度地削弱最后确定有统计学差异磷酸化肽段的能力，而“5 VS 5”的样本量，如果选择了合适的填充方法，其最后的结果基本接近于“10 VS 10”的结果。

因此，这里可以给我们一个暗示：虽然说，做蛋白质组学相关实验成本比较高，但是在条件允许的情况下，尤其是在做预实验的时候，每组最低的样本量建议使用5个。

![图片 4](images/004.png)

5. 结束语

该工具基于R语言编写，有网络版和本地版两种版本，用户可以根据其需求自行选择任一版本进行分析，期望该工具能给参与相关研究的老师和同学一些帮助。如对

目前基于悟空平台开发的分析工具已发表以下文章：

NAguideR模块：

(2020) Shisheng Wang , Wenxue Li, Liqiang Hu, Jingqiu Cheng, Hao Yang, Yansheng Liu, NAguideR: performing and prioritizing missing value imputations for consistent bottom-up proteomic analyses, Nucleic Acids Research, gkaa498. (IF: 11).

motifeR模块：

(2019) Shisheng Wang , Yue Cai, Jingqiu Cheng, Wenxue Li, Yansheng Liu and Hao Yang. motifeR: An Integrated Web Software for Identification and Visualization of Protein Post‐Translational Modification Motifs. Proteomics: 201900245. (IF: 3).

pseudoQC模块：

(2019) Shisheng Wang and Hao Yang. pseudoQC: A Regression‐Based Simulation Software for Correction and Normalization of Complex Metabolomics and Proteomics Datasets. Proteomics: 1900264. (IF: 3).

MetaboGroupS模块：

(2018) Shisheng Wang , ..., and Meng Gong. MetaboGroupS: A Group Entropy-Based Web Platform for Evaluating Normalization Methods in Blood Metabolomics Data from Maintenance Hemodialysis Patients. Anal Chem 90, 11124-11130. (IF: 6).

MixProTool模块：

(2018) Shisheng Wang , ..., and Hao Yang. MixProTool: A Powerful and Comprehensive Web Tool for Analyzing and Visualizing Multigroup Proteomics Data. Journal of computational biology : a journal of computational molecular cell biology 25, 1123-1127. (IF: 1).

![图片 5](images/005.png)

同时悟空平台整合上百个分析模块，包括且远不止以下功能

![图片 6](images/006.png)

而围绕上游质谱数据解析和下游组学应用，我们近期也发表了多篇文章：

(2020)Yi Yang, ..., and Liang Qiao In silico spectral libraries by deep learning facilitate data-independent acquisition proteomics. Nature Communications https://doi.org/10.1038/s41467-019-13866-z (IF:13)

(2020）Shuping Long, ..., Liang Qiao Metaproteomics characterizes human gut microbiome function in colorectal cancer. npj Biofilms and Microbiomes https://doi.org/10.1038/s41522-020-0123-4 (IF: 18)

(2020) Rutan Zhang, ..., Liang Qiao Proteomic and Metabolic Elucidation of Solar-Powered Biomanufacturing by Bio-Abiotic Hybrid System. doi.org/10.1016/j.chempr.2019.11.002 (IF:5)

如有您进一步咨询需求和合作意向。

欢迎和我们联系

www.omicsolution.com

若有任何疑问，欢迎邮件或来电咨询：

marketing@omicsolution.com

support@omicsolution.com

+86-18221381405
