悟空云

组学数据分析平台

易算生物


点击蓝字 关注我们




悟空云目前已经上线了两百多个分析模块,覆盖数据预处理、统计分析、机器学习、功能注释等常用流程。其中 10 个模块已对应完成方法学论文发表,刊登在 Analytical ChemistryBriefings in BioinformaticsJournal of Proteome ResearchJournal of Computational BiologyCell Reports Methods 等期刊。


值2025国庆假期,我们把这 10 个已发表模块重新梳理一遍,汇总它们各自解决的问题、用到的方法、适用的场景,方便大家在遇到类似需求时能快速查到、留存备用。


接下来按照工具上线时间倒序一一盘点。



10


Ontolomics-P:基于主题本体的蛋白质组数据解读



链接:doi: 10.1021/acs.analchem.5c00390. Epub 2025 May 6.

题目:Ontolomics-P: Advancing Proteomics Data Interpretation through GPT-4o Reannotated Topic Ontology and Data-Driven Analysis


蛋白质组学研究中,功能富集分析(例如GO富集)和跨队列的数据比较是解读结果的常用手段。但传统富集分析往往返回大量冗余且难以归纳的功能术语列表,不同研究的数据很难对比。Ontolomics-P 工具通过本体论和大语言模型,提升蛋白质组数据的功能注释和解释效率。



 


它的工作原理包括两部分


首先,对富集分析结果应用LDA主题模型结合 GO 语义相似度,将大量冗余的GO术语归并为若干主题(topic),每个主题代表一组相关的功能。


然后,引入GPT大语言模型 对这些主题进行重新注释和精炼描述,从而构建出一个全新的主题本体数据库,为每个主题提供简洁精准的生物学涵义。


除了富集分析的改进外,Ontolomics-P 还整合了临床蛋白质组数据库CPTAC中10种不同癌症类型的定量蛋白质组数据,用户可以在该平台上方便地查询特定蛋白在多种癌症中的表达



 


 

Ontolomics-P 可以大幅简化蛋白质组学工作流程中的结果解释环节,将繁杂的信息提炼为少数易解读的主题,并提供交互式的可视化界面展现功能.Ontolomics-P 创新性地利用本体论方法和AI技术来提供功能注释、定量挖掘与可视化相结合的解决方案,帮助科研人员加速从复杂数据中获得有意义的生物学见解。


工具页面:

https://wkomics.omicsolution.com/wukong/Ontolomics-P/




09


DEWNA:动态熵权网络分析挖掘时序标志物


Brief Bioinform, Volume 25, Issue 6, November 2024, bbae564, https://doi.org/10.1093/bib/bbae564


对于具有时间序列或多组别条件的组学数据,如何综合变化模式寻找关键调控分子是一项挑战。(Dynamic Entropy Weight Network Analysis)是一款动态熵权网络分析软件,针对多时间点或多分组数据中的潜在生物标志物和通路动态而设计。该工具基于信息熵赋权思想,融合了多尺度嵌入式基因共表达网络分析和广义报告者得分(generalized reporter score,GRSA)方法,对时间序列蛋白质组/转录组数据进行综合解析。



DEWNA轨迹建模的工作分为三步


熵权分配:计算每个蛋白在时间轴上的表达波动,动态越强,权重越高;


网络分析:构建共表达网络,提取协同响应模块,标出枢纽蛋白;


通路评分(GRSA):按权重加权,计算每个通路在每个时间点的活跃度,判断通路启动、峰值和持续时间。


DEWNA 应用于肺癌细胞(A549)顺铂诱导DNA损伤应答的时间蛋白质组数据(8个时间点)。结果显示,DEWNA 有效识别出了一批在顺铂作用过程中动态变化显著的枢纽蛋白和相关通路,揭示了细胞应对DNA损伤的时序性分子机制。



 

通过将复杂的时序变化转化为易于解读的“熵权网络”,DEWNA 为多时点组学数据提供了一种全新的解析视角,帮助研究者找出关键时间窗口的关键分子。


工具页面:

https://wkomics.omicsolution.com/wukong/DEWNA/



08


PTMoreR:跨物种 PTM 基序映射与注释


 

不同物种间的蛋白质翻译后修饰(PTM)位点是否保守,对理解进化保留的信号通路具有重要意义。PTMoreR 工具提供了一个基于基序的跨物种PTM 比对和注释的新方法。它考虑到PTM 位点周围氨基酸序列的保守性,采用 BLAST 比对时引入了窗口序列相似度的控制,从而以“motif”为中心进行跨种属的映射分析。



 

通过设定序列窗口相似度阈值,PTMoreR 能够在任意两种物种之间映射磷酸化组学结果,即找出一种物种的磷酸化位点在另一物种中对应的保守位点。同时,该工具还能对这些映射的位点进行位点级功能富集分析(例如富集保守磷酸化位点关联的生物过程),并生成激酶-底物调控网络以探索保守的激酶调控关系。



PTMoreR对小鼠<=>人的磷酸化信息进行相互映射


作者利用PTMoreR 将人源磷酸化位点映射到小鼠,结果发现小鼠真实存在的大部分磷酸化位点都可通过人类实验数据推断得到。此外,研究者还利用PTMoreR 预测了129种哺乳动物的磷酸化组组成,并鉴定出一些在环境响应中高度保守的跨物种磷酸化事件。



PTMoreR对129个哺乳动物的磷酸化序列数据进行映射和注释



 

PTMoreR对10个物种的磷酸化定量数据进行分析


PTMoreR 支持在非模式物种中对PTM进行功能研究,并促进不同物种磷酸化数据的定量比较


工具页面:

https://wkomics.omicsolution.com/wukong/PTMoreR/




07


EnrichVisBox:多形式功能富集结果可视化



 高通量组学实验常产生大量基因/蛋白列表,依赖富集分析(如GO和KEGG富集)来挖掘背后的生物学意义。EnrichVisBox 是一个专门用于功能富集分析结果多样化可视化的在线工具。EnrichVisBox 覆盖了气泡图、UpSet集合作用图、极坐标条形图、矩形条带图、山岭图(密度图)、网络图以及变体弦图等多种可视化风格。用户只需通过简单的鼠标点击,即可将富集分析结果转换为上述直观图形,用于展示通路/功能类的显著性及交叠情况。



 

例如,气泡图可以体现富集通路的显著程度和基因数,UpSet图展示富集集之间的交集关系,网络图将富集项和基因以节点-边形式呈现关联,而弦图则可以更华丽地展现不同功能类别之间的联系。该工具帮助研究者更有效地解读富集结果,挖掘出潜在的机制洞见并清晰地向他人展示研究发现。






部分示例









工具页面:

https://wkomics.omicsolution.com/wukong/EnrichVisBox/





06


StatsPro:蛋白质组学差异分析统计方法评价

https://doi.org/10.1016/j.jprot.2021.104386


不同实验条件下检测差异表达蛋白(DEP)是蛋白质组数据分析的核心任务之一。StatsPro 工具帮助研究者评估和筛选统计检验方法,以便更可靠地识别差异蛋白。该工具集成了多达18种常见统计方案,包括12种假设检验(如t检验、秩和检验、ANOVA等)和6种P值整合策略(如Fisher法、Stouffer法等),同时还为每个蛋白计算 Cohen’s d 效应量。



 


StatsPro 的一大特色是在计算出各方法的检测结果后,引入三项性能评价指标供用户参考:(a) 检出的差异蛋白数量、(b) P值与效应量的相关系数、(c) ROC曲线下面积(AUC)。


这些指标从不同角度反映统计方法对数据的敏感性和稳健性,有助于科研人员根据自己数据的特点选择合适的方法。


 

工具页面:

https://wkomics.omicsolution.com/wukong/StatsPro/




05


pseudoQC:基于机器学习的伪质控数据模拟



在大规模蛋白质组和代谢组实验中,引入质量控制样本(QC)是保证数据一致性的关键步骤。然而,有时由于实验设计限制或操作误差,数据集中可能缺少QC样本,或已有QC数据质量欠佳,导致批次效应难以校正。pseudoQC 工具正是为此类场景设计:它利用机器学习回归模型模拟出伪QC样本数据,用于后续批次校正和归一化处理。



pseudoQC 提供了四种常用的回归方法(包括线性和非线性模型),从实际的组学数据中学习并生成与真实QC类似的“伪QC”数据,将这些模拟QC数据并入原始数据集后,研究人员可以像常规QC那样进行校正、标准化处理。

对于缺乏QC样本或存在明显批次效应的项目,pseudoQC 提供了一种创新性的补救思路,有望提升此类数据集的分析可靠性。


工具页面:

https://wkomics.omicsolution.com/wukong/pseudoQC/




04


motifeR:多位点蛋白质翻译后修饰基序分析


Proteomics: 201900254.  DOI: 10.1002/pmic.201900245


随着质谱鉴定的PTM 位点激增,识别这些位点附近的氨基酸序列模式对于理解 PTM 调控机制很关键。motifeR 是一款功能强大的网页工具,专注于蛋白质翻译后修饰(PTM)位点周围基序(motif)的发现和可视化。




motifeR 工具集成了序列预处理、基序发现、富集分析等模块,用户能够对大型PTM数据集提取显著性基序,并生成清晰的序列标志图形。motifeR 还内置了激酶-底物网络分析功能:结合 NetworKIN 数据库,可推断磷酸化位点相关的激酶信号网络,帮助研究者从磷酸化组学数据中描绘激酶调控图。



工具页面:

https://wkomics.omicsolution.com/wukong/motifeR/




03


MetaboGroupS:基于组熵的代谢组数据标准化评价



Anal. Chem. 2018, 90, 18, 11124–11130 

https://doi.org/10.1021/acs.analchem.8b03065



代谢组数据由于液相色谱-质谱分析中的信号波动,常需要进行标准化以减少非生物因素引起的偏差。然而,不同标准化方法效果差异显著,令缺乏生物信息学背景的科研人员难以抉择。MetaboGroupS 是一款面向代谢组学的数据标准化方法比较和评价工具。



MetaboGroupS 引入了“组熵(group entropy)”概念,内置7种常用标准化方法,对给定数据集计算每种方法对应的组内熵和组间熵,并据此自动推荐组内熵更低、组间熵更高的最佳方法。能体现标准化后样本组内部的一致性和组间的可分离度——熵值越低表示组内数据更集中一致,熵值越高表示不同组别之间差异更显著。


作者在一个血液代谢组数据集(含11027个代谢峰)上验证了 MetaboGroupS,仅用时5分钟即完成全部分析流程,并成功选出了最适合该数据的标准化方法。


工具页面:

https://wkomics.omicsolution.com/wukong/MetaboGroupS/




02


NAguideR:缺失值填充方法优选工具



Nucleic Acids Res . 2020 Jun 11;48(14):e83. doi: 10.1093/nar/gkaa498


在质谱定量实验中经常会产生缺失值,而不同的填充算法对下游分析的影响各异。怎么填、填多少、对下游结果影响多大,一直没有统一标准。

NAguideR是一款针对定量蛋白质组学数据缺失值填充问题的评估工具。



NAguideR 的工作流程可简单分为五步:



输入数据:含缺失值的定量矩阵,行是特征(蛋白、肽段等),列是样本;

质量控制:计算缺失率和变异系数,剔除缺失严重或波动过大的特征;

填充方法评估:并行运行 23 种常用填充算法如 kNN、BPCA/SVD、QRILC、MinDet/MinProb、MissForest 等);

指标打分:采用两套评价标准(经典统计指标 + 蛋白质组特征指标),共 8 项;

方法推荐:根据指标得分输出推荐排序,帮助用户选择最合适的填充方案。


悟空云提供网页版界面,不写代码也能用。已在 DIA 的肽段层面、蛋白层面和磷酸化层面多组数据上验证,可显著提高结果一致性与可靠性。



作者用磷酸化数据(两组样本,各 10 个重复)对填充效果进行了验证。以 10 vs 10 的数据作为参考(无填充、删缺失后做统计),再从中分别随机抽取 3 vs 3 和 5 vs 5 的样本子集,重复 100 次进行假设检验。


结果发现:当样本量只有3 vs 3 时,无论采用哪种填充方法,显著差异的肽段数量都明显减少;而5 vs 5 的样本量,如果选择合适的填充方法,结果已能接近10 vs 10 的“金标准”。建议在条件允许的情况下,做预实验时建议每组样本至少5 个,数据可靠性会显著提升。


工具页面:

https://wkomics.omicsolution.com/wukong/NAguideR/





01


MixProTool:多组别定量蛋白质组综合分析



在实际研究中,常需要比较多个实验组或条件下的蛋白质表达差异,MixProTool 正是为此类复杂设计的数据集量身打造。它集成了完整的数据处理流程,包括:质量控制评估、缺失值过滤、数据标准化、主成分分析/聚类等多元统计分析(如 SIMCA 类分析)、差异表达统计检验,以及后续的功能富集分析(GO术语和KEGG通路富集)。



MixProTool 的一大优点是高度兼容当前主流的蛋白质组数据搜库定量结果格式,直接导入进行分析。分析完成后,工具还能将结果以矢量图和表格形式导出,方便科研人员进一步整理和发表. 


工具页面:

https://wkomics.omicsolution.com/wukong/MixProTool/




结语






这十个工具是悟空云在过去几年里方法学工作的一个阶段性总结。


在如今数据量越来越大的组学研究中,分析环节往往比实验更耗时间。悟空云希望通过这些工具,把复杂的计算环节拆解成清晰可复用的模块,让研究者在面对缺失值、标准化、统计检验或功能注释等问题时,有现成可验证的解决方案,而不是再从头摸索。


感谢各位老师与同学长期以来的反馈与使用。国庆小结到此,接下来我们会持续更新新的方法模块,也欢迎在悟空云上直接体验这些已发表工具。



图片



复制下述链接或点击“阅读原文”进入页面

https://www.omicsolution.com/wkomics/main/


END
扫码关注 | 易算蛋白组学前沿方案库


悟空云平台交流视频第六十期---《加权分位数和(WQS)回归》
悟空云平台交流视频第五十九期---《机器学习及ROC曲线》
悟空云平台交流视频第五十八期---《代谢物GSEA KEGG富集分析(自己上传背景库)》
悟空云平台交流视频第五十七期---《蛋白质主题本体组学Ontolomics-P教学视频上线》
悟空云平台交流视频第五十六期---《蛋白质或样本信号熵值变化》
悟空云平台交流视频第五十五期---《GO和KEGG富集分析自备背景库》
悟空云介绍