
宏蛋白质组是研究肠道菌群组成和功能表征的一个直接途径。然而,由于样本的复杂性和异质性,使得宏蛋白质组研究在样本制备、质谱检测和数据搜索等环节节节败退。其中一个很重要的挑战是如何构建合适的蛋白质序列数据库来省时、省力、准确的解析宏蛋白质组学数据,尤其是在缺乏宏基因组测序数据的情况下。基于上述课题,2024年1月5日,复旦大学化学系的乔亮团队与易算生物携手在《Analytical Chemistry》期刊中发表了一篇题为“High-Abundance Protein-Guided Hybrid Spectral Library for Data Independent Acquisition Metaproteomics”的文章,该研究提出了一种基于高丰度蛋白的Hybrid谱图库方法(HAPs-hyblibDIA),用于深度分析DIA宏蛋白质组数据。
HAPs-hyblibDIA方法,具体来说就是,1)首先从公共数据集以及作者之前的研究中收集肠道微生物,再从UniProt中下载相应的高丰度蛋白来构建高丰度蛋白(HAP)数据库,并与宏基因组组装的物种(UMGS)的HAP进行合并,生成合并的HAPs;2)然后通过该HAPs对宏蛋白数据进行初步搜库,获得蛋白鉴定和定量以及物种组成,之后进行富集分析筛选p<0.05的微生物;3)从UniProt中下载相应物种的蛋白序列,进一步构建样本特异性的数据库;4)基于上述样本特异性蛋白序列库和Spectronaut的Hybrid谱图库流程对宏蛋白组进行正式搜库,得到蛋白/肽段的鉴定与定量。
为了验证HAPs-hyblibDIA方法对于宏蛋白质组蛋白/肽段的鉴定能力,文章主要比较了该方法与其他常见的数据库和谱图库策略,主要比较如下:
HAPs数据库_vs_MG数据库;hyblibDIA谱图库策略_vs_directDIA谱图库策略● HAPs数据库:肠道菌群高丰度蛋白(HAPs)数据库;● hyblibDIA策略:使用Hybrid谱图库流程(即将DIA和DDA分级数据合并谱图库)对DIA数据进行解析;● directDIA策略:使用directDIA流程对DIA数据直接进行解析。1. HAPs-hyblibDIA方法的性能评价
方法:对12个已知物种的DIA数据进行混合,随机选取100个物种(包含12个已知物种),构建UniProt数据库(UP100)和HAPs数据库(100 HAPs),以及宏基因数据库(MG),分别在hyblibDIA和directDIA两种谱图库策略下搜库,比较三种数据库和两种谱图库策略的鉴定结果。● 使用HAPs数据库成功过滤到目标物种:在p值<0.05的标准下,所有的12种目标物种都被正确鉴定,无假阳性鉴定。● 比较hyblibDIA和directDIA的鉴定结果:hyblibDIA鉴定的蛋白groups和肽段数量显著多于directDIA。● 比较HAP数据库和MG数据库的鉴定结果:对于某些物种,如Klebsiella pneumonia 和 Escherichia coli,使用MG数据库比HAPs鉴定更多的蛋白groups。而对于Citrobacter freundii 和 Klebsiella aerogenes,使用HAPs数据库比MG鉴定到更多的蛋白数量。对于其他物种,两种数据库的蛋白鉴定数量相似。总的来说,这些结果表明HAPs-hyblibDIA工作流程可以在宏蛋白组分析中实现大规模的蛋白覆盖。
二、 使用HAPs - hyblibDIA在人体肠道菌群样本中应用
样本:收集1名健康志愿者的粪便样本
方法:对比hyblibDIA和directDIA策略以及不同数据库的鉴定结果。
结果:
● 鉴定数量:使用hyblibDIA的方法鉴定到的蛋白质groups和肽段数量显著高于directDIA。
● 肽段韦恩:使用HAPs鉴定出的肽段与使用MG数据库鉴定出的肽段有很高的一致性,验证了使用HAPs-hyblibDIA方法鉴定肽段的可靠性。
● 物种韦恩:通过16S rRNA测序获得的物种组成与使用HAPs和MG数据库在物种水平上一致性较低,但在更高的分类水平上一致性增加。
总体来说,这些结果证明了HAPs-hyblibDIA流程在宏蛋白质组学分析中能够取得广泛的蛋白质覆盖,并且可以鉴定宏基因组未检测到的物种的蛋白质,可以补充宏基因组测序数据库的物种和蛋白覆盖。
三、 使用HAP-hyblibDIA分析加入已知菌株的人类肠道菌群样本
目的:测试该方法在真实样本中对微生物鉴定的准确性和敏感性。
方法:
● 将6种培养的菌株混入另一个粪便样本进行蛋白质组分析。这6种菌株在原始粪便样本的宏基因组结果中未被检测到。
● 使用HAPs数据库对DIA数据进行了初步搜索,其中6个物种被纳入其中。HAPs筛选出了370个菌株,包括6种菌株在内。基于过滤后的HAPs数据库,用于hyblibDIA和directDIA分析。
结果:
比较hyblibDIA和directDIA:通过HAP-hyblibDIA鉴定出25,202个蛋白质groups和125,745个肽段,其中1,849个蛋白和9,924个肽段来自于6种菌株特有表达的。相比之下,无论总的蛋白/肽段鉴定量,或是6种菌株中特有鉴定量,hyblibDIA的宏蛋白组分析结果都优于directDIA。
总之,这一结果进一步证明了HAP-hyblibDIA方法在分析真实肠道菌群样本方面的敏感性和有效性。

四、 使用HAPs-hyblibDIA分析临床队列样本
目的:经过上述在人工混合菌群样本、单例粪便样本、粪便样本掺入已知菌株等层层递进地对HAPs-hyblibDIA进行验证和评价后,作者最后将该工作流应用于临床微生物研究中,并检验使用HAP数据库和先前数据库结果的一致性。
方法:作者分析了先前Long等人发表的结直肠癌(CRC)肠道菌群宏蛋白组数据集,该数据集包括14例CRC患者和14例对照。比较HAPs数据库和先前数据库,以及directDIA和hyblibDIA分析方法的宏蛋白组鉴定结果。
结果:
1. 鉴定数量:虽然使用先前的数据库鉴定到了更多的蛋白质,但使用HAPs-hyblibDIA获得了更多的肽段。
2. 差异蛋白:directDIA和hyblibDIA两种方法分别筛选到4635和5361个差异蛋白。
3. 功能注释:HAPs - hyblibDIA方法获得的差异蛋白被注释到19个COG类别。通过HAPs - hyblibDIA方法和先前报道的数据库,都在CRC患者组中发现了更多上调蛋白。
总之,HAPs - hyblibDIA方法的结果与基于既往文献数据库的结果基本一致,在生物医学研究中具有实用价值。

1)建立一种新型的宏蛋白组建库方法:首先基于公共数据库构建了一个专门的肠道菌群高丰度蛋白(HAPs)数据库,初步搜索宏蛋白数据,筛选p<0.05的微生物用于样本特异性建库;然后基于Spectronaut软件的Hybrid谱图库流程(HAPs-hyblibDIA)对宏蛋白组数据进行搜库鉴定和定量。2)HAPs-hyblibDIA的全面性能验证:通过人工混合12种菌株样本、单例人粪便样本、掺入6种已知菌株的粪便样本和结直肠癌临床队列样本,验证了该方法的准确性和实用价值。3)HAPs-hyblibDIA优于其他数据库:HAPs-hyblibDIA可以提供与宏基因组数据库相当的结果。该方法为无法获得宏基因组测序数据的情况下提供了一种实用的解决方案。与其他公共库方法相比,该方法大大减少了计算时间,提高了肽段覆盖深度。4)DIA质谱技术结合Spectronaut软件解析:本研究提出的HAPs-hyblibDIA方案,是基于Spectronaut软件的Hybrid流程进行搜库,即将DDA和DIA数据合并谱图库。尽管该软件的深度学习算法支持directDIA分析,可以兼顾成本和鉴定量,但谱图库在某些需要深度覆盖的情况还是有必要的,Spectronaut允许无缝衔接DDA数据与directDIA(HybridDIA),确保宏蛋白质组的深度覆盖。
Spectronaut 18: 挣脱大队列蛋白质组通量、速度的桎梏
DIA在肠道微生物群的深度表征中具有广阔的前景。随着Spectronaut软件的进一步迭代,DIA宏蛋白质组学必将更加通用。尤其是文章中采用的Hybrid谱图库流程,显著提高了宏蛋白质组的准确、深度蛋白质鉴定和定量。
如下图,Hybrid谱图库流程就是将directDIA检索数据与DDA深度分级数据合并建库,进行共同机器学习,然后基于混合数据的预测结果进行蛋白定性和定量分析。

对于Hybrid DIA和directDIA两个谱图库流程的比较,我们之前也有做过测试。如下图所示,以Hela细胞单物种为研究对象,图中明显看出,相比“[1]DIA-NN“和“[2]Spectronaut 18-directDIA”搜库方法,采用“[3]Spectronaut 18-Hybrid"搜库方法“显著提升了Precursor和蛋白Groups定量深度。这仅是单物种样本的测试结果,假如换成蛋白组成复杂的粪便样品进行宏蛋白质组数据解析,那么通过Hybrid方法相比DIA-NN和directDIA会对比地更加明显,提升更多的物种蛋白定量,正如文章中提到的那样。

好了,以上就是今天的内容。假如您正在或者将要开展DIA宏蛋白质组学方面的课题,想找到更多更有价值的信息,请你和我们联系。假如您的朋友目前有开展宏蛋白组课题的想法,想深入了解相关数据质量,也请你帮我们把这篇文章转发给他。
marketing@omicsolution.com
support@omicsolution.com
+86-18221381405