点击蓝字关注我们


易算整理 | 环境宏蛋白组学研究实战:实验到数据处理的全流程解析【上】

易算整理 | 【中】环境宏蛋白组学研究实战:实验到数据处理的全流程解析


欢迎来到宏蛋白质组学探索的终极环节! 今天,我们要揭开宏蛋白质组学研究中最关键的谜团之一——如何精准地进行物种分类和功能分析。这是整个研究流程中至关重要的部分,它决定了你能否真正理解微生物群落的生态角色和它们在环境中的作用。


Overview of the metaproteomics workflow(https://doi.org/10.1111/1462-2920.16637)

五、物种分类和功能分析

5.1 物种的分类注释

在宏蛋白组学研究中,为了回答“在做什么”的问题,选择适当的物种分类策略至关重要。主要包括以下三种策略:

5.1.1 基于公共数据库的注释

使用UniProt、NCBI-nr、UniRef等,这些数据库已经包含了物种分类和功能注释信息。蛋白质可以直接匹配到这些已知的物种和功能上。其优势是利用现有的注释信息,而且前后的结果可以达到一致。

5.1.2 基于宏基因组或16S rRNA的注释

宏基因组测序:通过宏基因组测序,从特定样本中直接构建蛋白质序列数据库,最大限度地匹配样本中实际存在的蛋白质。这种方法通常用于更深入的分析,因为它能够反映样本中特定微生物群落的实际组成。使用BLAST、Kaiju等工具,可以对宏基因组数据在读段、contigs(组装的DNA片段)、基因等层面进行比对,从而获得更准确的分类注释。

龙年第三篇【Microbiome】复旦乔亮、澳洲国立林宇与易算团队联合推出ConDiGA:基于宏基因组精准构建宏蛋白组序列库

16S rRNA测序:利用16S rRNA测序获取样本中的微生物分类信息,然后在公共数据库(如UniProt)中按物种信息筛选相关物种的蛋白序列。这样可以减少数据库搜索空间,提高识别的特异性。

5.1.3 基于肽段的物种注释

使用比如UniPept(https://unipept.ugent.be )等数据库进行肽段的同源性搜索,你可以提交肽段列表,这类工具将向你返回物种分布图和excel。使用起来比较简单,但是缺点是注释结果往往集中在属级别或更高层级,较细的物种层级比如种注释可能不够高。此外,由于数据库的偏向性,可能对部分微生物群体的分类准确性有所影响。

通过这几种策略,可以根据研究需求选择最合适的分类方法,以确保物种分配的准确性和功能注释的全面性。

5.2 功能注释与解析

在完成蛋白质分类和微生物鉴定后,我们需要为这些蛋白质赋予功能标签,以理解微生物如何响应环境变化以及它们之间的相互作用。宏蛋白组学研究依赖于公共数据库(如UniProt和Genbank)的功能信息,并通过基因本体(Gene Ontology, GO)将蛋白质分类为三大功能类别:生物过程、细胞组分和分子功能。为了确定蛋白质如何获得这些GO术语,通常使用证据代码,例如由专家推断或通过自动化注释生成。一旦蛋白质获得功能标签,我们就可以利用这些标签来解析微生物群落的功能。

5.2.1 自动化功能注释工具

EggNOG-mapper这个工具使用了一个包含超过四百万个直系同源蛋白组的数据库,将识别出的蛋白质与同源群和GO描述匹配,并提供基因名称和最低共同祖先(LCA)分类。EggNOG-mapper还提供酶编号(EC)和KEGG(京都基因与基因组百科全书)标识符(ID),帮助解释微生物群落功能。用户提供的序列会自动获得KEGG Orthology(KO)标识符,并被映射到KEGG通路,生成分子功能的图示。

  • DOI: 10.1093/molbev/msab293



我讲到这里小伙伴可能会比较好奇,那么我做功能注释到底是用蛋白还是肽段?通常,功能分析是基于完整的蛋白质进行的。通过将鉴定出的蛋白质与功能数据库(如Gene Ontology, KEGG等)进行匹配,可以推断蛋白质的功能。然而,在多物种共存的复杂环境中,不同物种的蛋白质可能具有相似的序列,导致蛋白质层面的功能注释变得复杂。此外,当蛋白质在多个物种中共有时,特异性会受到影响。

肽段去做功能注释也是可以的,我这里刚好有一篇文章作为案例。文章《Metaproteomics reveal that rapid perturbations in organic matter prioritize functional restructuring over taxonomy in western Arctic Ocean microbiomes》展示了在复杂微生物群落的研究中,如何使用肽段进行功能注释,示了北极微生物群落在有机质扰动下的功能重构过程。

基于肽段进行功能注释和富集分为这几步:

肽段功能注释:质谱鉴定出的肽段以后,使用Gene Ontology(GO)等功能数据库,将肽段关联到特定的生物过程、细胞组分和分子功能等GO术语上。
LCA(最低共同祖先)分析:由于同一个肽段可能对应多个蛋白质,且这些蛋白质可能来自不同的物种,为了更准确地确定肽段的来源,使用最低共同祖先(LCA)方法将肽段归类到最接近的分类层级(如属、科、纲等),确保物种分类的准确性。
统计肽段与功能的关联数量:在进行LCA分析后,统计每个GO术语与肽段之间的关联数量,通过PSM形式表示,代表每个肽段与特定功能类别的匹配次数。
功能富集分析:计算了经过拉普拉斯校正的GO术语spectral counts的log2倍数变化,使用双尾比例检验(two-tailed test of proportions)对不同时间点间的功能变化进行了比较。通过Bonferroni校正后,如果p值小于0.01,则认为该变化在统计学上显著。在分析中,重点关注了有向无环图(DAG)中最细颗粒度的GO术语,若这些术语在校正后的p值小于0.01,则被认为在统计上显著,并被纳入到富集分析中。实验中对连续的时间点进行了比较(初始样品 vs. 第1天,第1天 vs. 第6天,第6天 vs. 第10天),以捕捉功能变化的时间动态。

https://doi.org/10.1038/s41396-019-0503-z

因此,传统的基于蛋白质的功能分析相比,肽段方法提供了更灵活、更敏感的功能解析方式。

5.2.2 样本元数据整合与建模

为了更好地理解微生物群落功能,除了蛋白质数据,还需要整合样本的元数据(如环境条件、实验设置、样本来源等)。元数据的整合可以帮助我们解释样本间的差异以及蛋白质表达与外部条件的关系。为此,通常需要使用统计测试和建模方法,比如PCA,NMDS, Spearman相关性分析等。

5.2.3 其他生信工具

为了进一步提升我们在微生物组功能分析方面的研究能力,除了Unipept和eggNOG-mapper外,还应重点借鉴以下几个生物信息学工具:

  • MetaGOmics:专门用于肽这个层级的功能分析(Metaproteomics reveal that rapid perturbations in organic matter prioritize functional restructuring over taxonomy in western Arctic Ocean microbiomes这个文章用的就是这个方法),MetaGOmics使用UniProt/SwissProt数据库来进行功能注释,尤其适合需要精细的功能注释的研究。

  • ProPHAnE:作为一个整合多种数据库的工具(如TIGRfams和PFAMs),ProPHAnE提供了功能注释选项,并能够处理复杂的蛋白质家族和功能注释需求。

  • MetaProteomeAnalyzer (MPA):这是一个基于GUI的宏蛋白组学软件包,适合不熟悉命令行的研究人员使用。能自动注释整合多个数据库搜索结果,并提供KEGG和UniPept的功能注释。

  • MetaQuantome:一基于肽定量和功能分析的工具,集成到Galaxy框架中自动生成有用的统计图表和图形。

  • BLAST2GO:虽然BLAST2GO更常用于基因组学和转录组学,但在肽级功能注释方面也表现出色。它使用BLAST算法对肽进行搜索,并通过GO术语进行功能注释,是分析肽功能的工具之一。


好了,以上就是今天的内容。假如你正在或者将要开展宏蛋白质组学方面的课题,想找到更多更有价值的信息,请您和我们联系。假如您的朋友目前有开展宏蛋白组课题的想法,想深入了解相关思路,也请你帮我们把这篇文章转发给他。


继续看

龙年第三篇【Microbiome】复旦乔亮、澳洲国立林宇与易算团队联合推出ConDiGA:基于宏基因组精准构建宏蛋白组序列库
疾病多组学分析的三个切入点:表型、基因组、环境
跨平台合作:质谱、Olink与SomaScan在蛋白质组学研究中的联合策略
近三年Matthias Mann课题组在质谱体液蛋白组研究的启示
基于显微切割的空间蛋白组可以怎么切
Nat Biotechnol|通过研究不同剂量药物对蛋白表达的影响,解析药物如何在细胞中起作用

联系我们

CONTACT US