---
title: "悟空云1月更新及2020年总结"
author: "诗盛"
account: "诗盛"
published_at: "2021-02-02T09:07:46+08:00"
captured_at: "2026-08-24T11:50:16.577556+08:00"
source_url: "https://mp.weixin.qq.com/s?__biz=MzI2MTI5NDAzNg==&mid=100001610&idx=1&sn=0ccb93c9bc4e930b93e3628509a861de&chksm=6a5dd5f15d2a5ce7f13690b4177985a185dd3f1ae90160dd36ce51a95b4f716b83c928c3dc30#rd"
---

# 悟空云1月更新及2020年总结
![图片 1](images/001.png)

小前言

春节将近，先祝诸君一切安好。年末了，做下简单的总结吧，向大家分享下，悟空云平台2020都积累了哪些主要更新和优化。作为自己的一项业余爱好，晃眼之间，已经写悟空云近5年了。很感谢各位老师、同学一直的支持和使用。这一路风景，你我相互欣赏，真好~~

![图片 2](images/002.png)

版本和功能模块

![图片 3](images/003.png)

悟空云目前更新到第31版。这一年将悟空云更新了6个版本，每一版都更新或优化一些功能，更新速度符合自己的预期（一般2-3个月更新一版）。

模块功能目前一共有201个，其中主要的功能模块有：数据前处理（12个）、统计分析（35个）、功能分析（28个）、可视化作图（74个）、回归分析（9个）、机器学习（15个）、串烧模块（8个）等。基本涵盖常规的分析模型。

如2020年1月，我们更新了如下功能：

1. 新增GO分层富集分析（该模块主要是提取GO的分层信息，然后在每一层中进行富集分析，最后对结果进行可视化。对于想看各层GO功能信息的用户，可以尝试使用该模块）：

![图片 4](images/004.png)

2. 优化层聚类分析模块（增加自己设置颜色的参数，以及是否给热图中的每个小颜色块加上灰色边框）：

![图片 5](images/005.png)

3. 优化BP神经网络模块（优化用户数据不收敛时，计算出错的问题，这时候用户需要查看自己的数据是否已经经过正态标准化，没有的话建议先进行正态标准化，然后可以适当增加“误差阈值”，以保证结果可以正常计算，但是此时要注意，模型的准确性可能会有所下降）：

![图片 6](images/006.png)

4. 优化数据标准化模块（增加“缩放到某一个范围”方法，如果你想把你的数据缩放到某一范围内，可以选择此参数试试）：

![图片 7](images/007.png)

5. 优化缺失值数据处理模块（经用户反馈，现增加“全局最小值”填充方法，方便用户直接使用。）

![图片 8](images/008.png)

6. 优化画相关性图模块（应用户反馈，现增加一个参数，可以设置图例的数值的范围，方便大家根据自己的数据调节。）

![图片 9](images/009.png)

![图片 10](images/010.png)

用户群体

![图片 11](images/011.png)

基于悟空云平台的初期定位，我们主要想帮助全球相关领域的华人科学家快速分析其数据，因此目前用户主要来自国内外各大学，研究所的老师和学生。这一年，虽然目前总的用户并不是很多，但也已分布10余个国家。

![图片 12](images/012.png)

对于国内用户，也已分布各个省市区，其中以北京、上海、广东、河南、四川、天津、江苏的用户最多。这个跟悟空云平台适合分析的数据集有关，其目前主要用于蛋白质组学和代谢组学数据的分析，而对蛋白质组学和代谢组学研究比较多的单位多数集中在这几个地方。

![图片 13](images/013.png)

![图片 14](images/014.gif)

几个有意思的模块

这一年，个人感觉有几个比较有意思模块，简单挑出来给大家做下分享。并不是说这几个模块有多突出，仅是感觉有点意思而已。大家可以根据自己的分析目的，去平台上多翻翻看看。

1. 缺失值填充模块（NAguideR）

NAguideR主要用于系统性处理缺失值填充的问题（missing value imputation），其汇集了23种常用的缺失值填充的方法，并提供2套评价的标准（经典型[classic criteria]和基于蛋白质组信息型[proteomic criteria]），每一套标准又细分4个指标。通过这些指标的打分，期望能在缺失值方法的选择上给予用户一定的提示。该模块也已发表在Nucleic Acids Research期刊上（https://doi.org/10.1093/nar/gkaa498）。

![图片 15](images/015.png)

2. 差异相关性分析模块。

此模块使用稍微复杂一丢丢，主要是DGCA和MEGENA模型的组合使用，其通过计算各个对象（蛋白质、基因或者代谢物等）的在不同组样本中的相关性，然后计算统计差异，从相关性层面找到有统计学差异的蛋白质、基因或者代谢物对，然后再利用MEGENA模型寻找核心模块及对应的核心基因，并画出相应的网路图。

![图片 16](images/016.png)

3. 秩秩超几何重叠分析（RRHO）模块。

该模块主要使用超几何分布的方法，对数据的秩进行分析，以来得到在两个不同数据集中显著重叠的基因、蛋白质或者代谢物。

![图片 17](images/017.png)

4. COG匹配（Clusters of Orthologous Groups）模块。

该模块主要帮助用户进行COG信息的匹配，查看其鉴定到的蛋白质主要有哪些COGs。数据库来源：http://www.ncbi.nlm.nih.gov/COG。

![图片 18](images/018.png)

5. 带曲线阈值的火山图模块

这种图形在很多文章中已经有所使用，其将传统的阈值直线画成曲线，并不是说就一定要使用曲线，两种展现形式都各有各的道理，可根据自己的喜好，展现这种结果。

![图片 19](images/019.png)

![图片 20](images/020.gif)

关于悟空云平台的致谢或引用

使用悟空云平台，可在文章中进行如下描述：

1) 比如在正文Methods部分：We use 'Wu Kong' platform (https://www.omicsolution.com/wkomics/main/) for relative xxx analysis.

2) 比如在致谢(Acknowledgements)部分：Thank Dr. Shisheng Wang (West China Hospital, Sichuan University) and Dr. Chengpin Shen (Omicsolution Co., Ltd) for giving some advices about data analysis and 'Wu Kong' platform (https://www.omicsolution.com/wkomics/main/) for relative xxx analysis.

这一年，致谢或引用悟空云平台的文章大致有20多篇，数据来源于Google Scholar。虽然不多，但是比往年要多一些，这是一个好现象。如果悟空云在你的数据分析过程有所帮助，也希望大家多多引用或者致谢。

![图片 21](images/021.png)

结束语

![图片 22](images/022.png)

![图片 23](images/023.png)

还是要感谢各位老师和同学对平台的支持，大家相互帮助，最终达到共赢。未来的时间里，我会继续学习相关知识，应该会更新一些多组学分析的模块，也会依据大家的需求和反馈对悟空云进行更新和优化。

2020，艰难中始终坚持；2021，努力中遇见美好。。。
