---
title: "龙年第三篇【Microbiome】复旦乔亮、澳洲国立林宇与易算团队联合推出ConDiGA：基于宏基因组精准构建宏蛋白组序列库"
author: "omicsolution"
account: "omicsolution"
published_at: "2024-03-20T16:02:05+08:00"
captured_at: "2026-08-26T17:29:16.455550+08:00"
source_url: "https://mp.weixin.qq.com/s/kEALebfFRENSS_5MH-B6oQ"
---

# 龙年第三篇【Microbiome】复旦乔亮、澳洲国立林宇与易算团队联合推出ConDiGA：基于宏基因组精准构建宏蛋白组序列库
如果您计划进行宏蛋白组分析，且手头有宏基因组测序数据，强烈推荐尝试使用ConDiGA，这个流程解决了当前基于宏基因组测序构建的宏蛋白质组数据库物种注释可靠性的问题，其优势体现在注释覆盖率、注释准确性和低丰度物种注释等多个方面。

3月19日，复旦大学化学系乔亮团队、澳大利亚国立大学计算机学院林宇团队，联合易算生物在微生物组研究领域权威期刊《Microbiome》在线发表了一项重要研究成果：Contigs directed gene annotation (ConDiGA) for accurate protein sequence database construction in metaproteomics。

林宇博士于2022年10月不幸离世，未能看到该工作的最终发表，谨以此文献给在文章投稿过程中去世的林宇博士。

这项研究采用重叠群注释指导的基因注释（Contigs Directed Gene Annotation, ConDiGA）方法，从宏基因组数据出发进行基因的物种分类注释，继而构建了用于宏蛋白质组分析的蛋白质序列数据库。首先，对组装后的重叠群序列（contigs）进行初步注释，再根据基因组覆盖率和分类丰度精选出最可靠的物种。随后基于选定物种的参考基因组进行基因级别的注释，确保了所构建的蛋白质序列数据库能够真实反映微生物群落的功能特性。

![图片 1](images/001.png)

一. 背景

基于质谱的宏蛋白质组学可以用来探究微生物种群的结构、功能、进化等特征。与单一生物或简单混合样本的分析不同，宏蛋白质组面向的样本中可能存在几十甚至上百种不同的微生物形成的群落。精准的蛋白质鉴定依赖于选择合适的蛋白质序列数据库。理想的数据库应精确反映样本的微生物组成，既包含所有相关微生物的蛋白质序列，又避免包含无关物种的信息。

目前的数据库构建策略包括：

-

（优化）公共蛋白质序列数据库：（肠道等）微生物菌群专用数据库或利用质谱数据过滤大型公共数据库。

-

利用16S rRNA序列信息筛选：基于微生物群落的16S rRNA测序得到样本分类信息，然后在公共数据库，比如Uniprot中按物种信息筛选相关物种的蛋白序列，减少数据库搜索空间，提高识别的特异性。

-

利用宏基因组构建样本特异性数据库：通过宏基因组测序，从特定样本中直接构建蛋白质序列数据库，最大限度地匹配样本中实际存在的蛋白质。

在这几种不同的策略中，通过宏基因组测序构建特异性样本数据库被广泛认为是最佳选择。宏基因组学数据的准确分类注释在蛋白质序列数据库的构建中起着关键作用，不同的方法导致下游宏蛋白质组研究的结果大相径庭。

二、ConDiGA的工作流程

![图片 2](images/002.png)

三种注释策略（MD1、MD2和MD3）的流程

MD1的实现过程：

-

预测基因：从组装好的contigs中预测出基因。

-

基因注释：采用不同的注释工具，以NCBI nr微生物全库等作为参考，直接对这些预测的基因进行注释。

-

缺点：MD1的主要缺点是注释可能不准确，尤其是在基因较短时，导致可能将不存在于样本中的物种错误地注释到基因，且整体注释率较低。

MD2的实现过程：

-

注释contigs：在预测基因之前，先对组装的contigs进行注释。

-

基因注释：预测基因之后，基于contigs的注释信息来注释其内的基因。

-

缺点：MD2可能将不同物种的reads错误地组装到同一个contig上，特别是当物种间存在部分序列相似性时。这可能导致contig包含多个物种信息，从而降低注释的特异性。

MD3（ConDiGA）的实现过程：

-

注释contigs：与MD2相同，首先对contigs进行注释。

-

物种选择：基于基因组覆盖率和分类丰度从contigs的注释结果中选择候选的物种。

-

基因级别的注释：将预测的基因与这些精选物种的参考基因组进行比对以注释基因。

MD3通过结合contigs的注释结果和精选的物种信息，提供了一种更加准确和可靠的注释方法。它理论上能解决MD1和MD2的缺点，提高了注释质量。

实际测试下来如何呢？

三、3种注释策略的基准测试

将重叠群注释指导的基因注释方法（ConDiGA，也称为MD3）与两种常见的注释策略（MD1和MD2）进行了比较。在这三种策略中，分别采用了BLAST、Kaiju和Kraken2等多种注释工具进行了对比分析。此外，建立了一个通过MMseqs2进行六框翻译的meta6FT数据库，以及一个对预测的基因经翻译后的氨基酸序列进行注释的mea taPA数据库（采用Protein BLAST工具和UniProtKB/TrEMBL数据库进行注释）。

![图片 3](images/003.png)

利用12个细菌的微生物群落对不同蛋白质序列数据库做基准测试

为了对这些策略进行基准测试，研究人员混合了12种已知的细菌以制备了一个模拟微生物群落。同时引入了Uniprot参考蛋白质组数据库，在种级（UP-S）、属级（UP-G）和科级（UP-F）三个级别上进行了比较。以UP-S（种级别的Uniprot参考蛋白质组）的识别结果作为参考标准。

直接说结论：

基于对模拟微生物群落的分析，MD3策略在注释覆盖率、注释准确性方面，显示出比MD1和MD2策略更优的性能。特别是结合Kaiju使用的MD3策略，在所有测试方法中表现最佳。

![图片 4](images/004.png)

使用不同数据库从合成微生物群落的12个目标物种中鉴定出的(A)蛋白质和(B)多肽的数量。(C)使用MD3方法构建的数据库和UP-S参考数据库从各个物种鉴定出的蛋白质数量

使用Kaiju-MD3方法（MG）从12个目标物种中鉴定了13537个蛋白质。相比之下，UP-S只能从12个目标物种中鉴定出12,604个蛋白质；UP-G、UP-F和Meta6FT数据库的结果与基于MD3的数据库的结果不具可比性。

研究人员比较了使用MD3_Kaiju、MD3_BLAST、MD3_Kraken2和UP-S从每种细菌中鉴定到的蛋白质，发现除了2种细菌之外，使用基于MD3的数据库鉴定到每个物种的蛋白质数量基本与使用UP-S的结果一致。对于K. pneumoniae，使用MD3-Kaiju和MD3-Kraken2鉴定到的蛋白质数量超过了UP-S的结果。这可能是因为UP-S数据库是基于参考菌株构建，而模拟微生物群落中的菌株可能与参考菌株存在差异。通过宏基因组测序，有可能识别出UP-S中未包含的带有序列变异的蛋白质形式。

四、ConDiGA在真实粪便中的性能测试

先说结论：在实际粪便样本中，MD3的注释率明显高于MD1和MD2，这证明在分析复杂的实际样本时，MD3策略仍然具有优势。

为了测试ConDiGA策略在真实微生物群落中的性能，收集了一名健康志愿者的粪便样本，并对其进行了宏基因组和宏蛋白组分析。利用BLAST、Kaiju和Kraken2等注释工具，分别通过MD1、MD2、MD3三种策略，从宏基因组数据出发，构建了蛋白质序列数据库。

![图片 5](images/005.png)

(A)利用三个方法构建的数据库从粪便样本中鉴定出的有分类注释和无分类注释的蛋白质数量。(B)利用三个方法构建的数据库从粪便样本中鉴定出的物种维恩图

采用MD3策略的三种工具得到的带有分类注释的蛋白质数量，明显超过了MD1和MD2策略，特别是，MD3配合Kaiju的方法，不仅注释效率最高，而且超过90%的蛋白质在种级别获得了成功注释（见原文表格）；

在比较不同策略对物种识别的一致性方面，韦恩分析提示MD3策略表现出了在BLAST、Kaiju和Kraken2等多种注释工具之间的最高的一致性。具体来说，通过MD3结合Kaiju的方法能够识别出最多的物种（143种）。覆盖了MD3_BLAST识别的71.3%（57/80）和MD3_Kraken2识别的64.4%（47/73）的物种。

接下来对粪便样本进行更深入的分析中，研究者比较了宏基因组（MG）和宏蛋白质组（MP）水平上的功能和分类特征。

![图片 6](images/006.png)

宏基因组（MG）和宏蛋白组（MP）水平的KEGG功能注释

通过MD3_Kaiju得到的宏基因组和宏蛋白质组结果，采用KEGG Orthology（KO）在GhostKOALA网站上进行了注释，这两种组学KO注释结果大体一致，在占比最高的代谢类别略有不同。

![图片 7](images/007.png)

宏基因组（MG）和宏蛋白组（MP）的物种丰度对比，颜色表示MG/MP测定的相对丰度对数比

分类特征：宏蛋白质组学将每个物种的所有肽段的定量信息加和，以计算该物种的相对丰度；宏基因组学的相对丰度是通过计算分配给每个物种的基因数目得到的。上图清晰展示了通过计算MG与MP丰度的对数比(log2 MG/MP abundance ratio)揭示的两者间的相对丰度差异。研究结果显示，在不同的分类水平上存在丰度差异，尤其是在目级以下，MP与MG的一致性降低，表现出明显的区分。以拟杆菌科为例，科级MG/MP比值接近1，但在Phocaeicola属中MG丰度较高，而在Bacteroides属中MP丰度较高，说明即使在同一科内，不同物种的相对丰度也可能表现出宏基因组学与宏蛋白质组学之间的异质性。MG的相对丰度与物种的细胞复制数紧密相关，而MP的相对丰度则反映了物种的总蛋白量。

五、ConDiGA的注释灵敏度和准确性

为了进一步衡量处理复杂样本的能力，研究者通过计算混合了合成微生物群落和粪便样本的宏基因组和宏蛋白组数据，并通过上述三种策略进行注释。

MD3流程在宏蛋白质组分析中表现最佳，成功识别并准确归类了所有12种物种，展现了不同注释工具的兼容性。结合Kaiju使用的MD3流程不仅为这12种物种，也为来自粪便样本的其他物种鉴定出了最多的蛋白质，证明了其在提高蛋白质组注释覆盖率、低丰度物种注释灵敏度方面的优势。

![图片 8](images/008.png)

条形图比较从合成微生物群落的12种物种、其他物种，以及无分类物种中鉴定到的蛋白质数目；韦恩图比较了从合成混合微生物宏蛋白质组数据集与粪便宏蛋白质组数据集中鉴定的物种

六、总结

研究者提出了一种基于宏基因组数据的精准分类注释流程，即Contigs Directed Gene Annotation (ConDiGA)。这个流程有效解决了当前基于宏基因组测序构建的宏蛋白质组数据库物种注释可靠性的问题。

ConDiGA技术与现有的流行注释方法（MD1和MD2）相比较，显示出在注释的准确性、尤其是物种级别的精确分类注释方面的显著优势。1）在12种已知的细菌合成的微生物群落样本的基准测试中，ConDiGA方法的表现优于其他工具，同样在2）真实的粪便样本以及3）模拟微生物群落和粪便样本的混合数据集上也表现出高效性和高稳定性。

ConDiGA的代码可在GitHub上开放访问（来自澳洲国立大学林宇博士课题组）。

https://github.com/metagentools/condiga

七、ConDiGA的工作流程如何安排实验和生信准备

7.1实验安排

在ConDiGA的工作流程中，首先通过样本收集启动宏基因组和宏蛋白质组的研究。

宏基因组分析从DNA提取开始，通过高通量测序技术获得短读序列（reads），然后将这些短读序列组装成较长的序列片段重叠群（contigs）。接下来，使用MetaGeneMark等工具对这些组装好的序列进行基因预测，预测出的基因序列随后被翻译成蛋白序列，构建成针对宏蛋白质组分析的专用蛋白质序列数据库。

宏蛋白质组实验涉及到蛋白质的提取、酶解消化，将蛋白质分解成肽段，然后通过液相色谱-质谱联用（LC-MS/MS）技术对肽段进行分离和鉴定。通过将质谱数据与ConDiGA生成的蛋白质序列数据库进行匹配，实现样本中蛋白质的识别和定量。基于这些数据，进行生物学解释，揭示微生物群落在特定环境条件下的功能特性。

7.2生信准备

7.2.1.数据预处理：

读段组装：使用MEGAHIT等工具将宏基因组测序得到的读段（reads）组装成较长的序列片段重叠群（contigs）。

分类注释：应用Kraken2、Kaiju或BLAST等工具对组装好的contigs进行物种分类注释。

覆盖度获取：利用CoverM等工具计算contigs的覆盖度。

基因预测：通过MetaGeneMark等软件在contigs上预测基因，然后将这些基因翻译成蛋白序列。

下载assembly_summary.txt：从NCBI下载细菌的assembly_summary.txt文件，为后续基因注释和物种归属提供了必要的参考基因组信息。

7.2.2.运行ConDiGA生成蛋白质序列数据库：

ConDiGA通过整合上述预处理步骤得到的数据（组装的contigs、物种分类注释结果、基因预测及其翻译的蛋白序列、contigs的覆盖度等），选择最可靠物种进行进一步的注释。

然后，ConDiGA将预测的基因与这些精选物种的参考基因组进行比对，以精确地注释基因，以及输出蛋白质序列。通过这种方法，ConDiGA构建了一个针对宏蛋白质组分析的精确蛋白质序列数据库，该数据库更准确地反映样本的微生物构成。

7.2.3.宏蛋白质组分析：

在获得了ConDiGA生成的蛋白质序列数据库后，将质谱数据与ConDiGA构建的蛋白质序列数据库匹配，实现样本中蛋白质的识别和定量，进行生物学解释，揭示微生物群落在特定环境条件下的功能特性。

ConDiGA策略：宏蛋白组数据库构建

![图片 9](images/009.png)

易算宏蛋白组全流程实操方案

针对宏蛋白质组研究，如果您手头有宏基因组测序数据，我们推荐使用今天分享的构建蛋白序列库新方法——C onDiGA；如果您有16S rRNA测序信息，我们也可以在公共库中筛选物种蛋白序列；如果您目前没有任何测序数据，我们推荐使用无需测序的肠道菌群专用数据库，不同情形不同选择。对于质谱采集和谱图解析，考虑到宏蛋白组样本的复杂性和鉴定深度需求，我们更推荐采用DIA定量模式结合Spectronaut软件数据解析，如果您考虑性价比和实验简便，推荐directDIA方案，如果您想更多鉴定蛋白，推荐谱图库DIA或hybridDIA。更详细的实操方案和产品工具请看下图：

![图片 10](images/010.png)

好了，以上就是今天的内容。假如你正在或者将要开展宏蛋白质组学方面的课题，想找到更多更有价值的信息，请您和我们联系。假如您的朋友目前有开展宏蛋白组课题的想法，想深入了解相关思路，也请你帮我们把这篇文章转发给他。

宏蛋白质组全面学习：

复旦乔亮团队与易算最新研究成果：宏蛋白组建库方法与应用

NPJ BIOFILMS MICROBI|复旦-交大-易算最新合作成果：DIA如何跨过宏蛋白组的第一宇宙速度

DIA+PRM宏蛋白组揭示茅台酒曲中的微生物群落组成和代谢特征
