---
title: "易算整理 | 【中】环境宏蛋白组学研究实战：实验到数据处理的全流程解析"
author: "王玲"
account: "王玲"
published_at: "2024-08-19T02:17:30+08:00"
captured_at: "2026-08-26T17:26:19.481211+08:00"
source_url: "https://mp.weixin.qq.com/s/KsQBr_BGTt9Pf7DQFILxSw"
---

# 易算整理 | 【中】环境宏蛋白组学研究实战：实验到数据处理的全流程解析
点击蓝字关注我们

延续我们在上一期的探讨，本期我们将聚焦于宏蛋白质组学研究中的两个重要环节——数据采集和数据库构建。

![图片 1](images/001.png)

![图片 2](images/002.png)

Overview of the metaproteomics workflow（https://doi.org/10.1111/1462-2920.16637）

-

三、数据采集和分析

在宏蛋白质组学的研究中，尤其是在处理复杂的环境样本时质谱数据采集的选择直接影响最终的分析结果。两种主要的质谱数据采集模式——数据依赖采集（DDA） 和 数据独立采集（DIA）——各有其独特的应用场景和技术特点。

DDA 是一种较为传统的质谱采集模式。质谱仪在进行全扫描（MS1）后，选择样本中最丰度的肽段进行碎裂分析。这种方法的优势在于能够产生高质量的碎片谱图，对于目标蛋白的解析非常有效。然而，DDA 在处理复杂样本时存在一定的局限性，特别是在肽段共流出和丰度差异较大时，低丰度肽段可能会被忽略，从而无法全面覆盖样本中的所有蛋白质。

相比之下，DIA 作为一种较为新兴的采集模式，通过在预设质量范围内同时获取所有肽段的 MS/MS 数据，极大地提高了肽段的检测覆盖率。DIA 不仅扫描所有前体离子（MS1），还对每个离子窗口的所有前体离子进行碎裂。这种采集方式生成了极为丰富的数据集，但同时也增加了数据分析的复杂性。尤其是在处理高复杂度的环境样本时，DIA 数据的解读和分析往往需要借助更为复杂的算法和强大的计算资源。然而，对于那些需要全面覆盖所有可能蛋白质的研究，DIA 无疑是一个更为合适的选择。

那么，在实际操作中，如何选择 DDA 还是 DIA？

通常，DDA 更适合于对特定蛋白质的深入研究，特别是当研究对象较为明确且样本复杂性较低时。DIA则适合于那些需要全面覆盖样本中所有可能蛋白质的研究，尤其是在处理复杂环境样本（如土壤、水体或污泥中的宏蛋白质组）时，DIA 提供了更高的灵敏度和覆盖率。

在质谱数据采集完成后，随之而来的挑战是蛋白质推断。这一过程涉及将质谱分析生成的原始数据（通常以峰的形式呈现）转化为有意义的生物学信息。每个峰代表一个离子，包含质荷比（m/z）、液相色谱保留时间和相对离子强度等信息。蛋白质推断的核心在于肽谱匹配（PSM），即将实验数据与数据库中的理论肽段进行比较匹配。在宏蛋白质组学研究中，蛋白质推断并不是一个简单的过程。一个主要的挑战是peptide degeneracy 现象，即一个肽段可能匹配多个不同的蛋白质，尤其是在共享结构域或序列的蛋白质之间。这种现象在环境宏蛋白质组学中尤为常见，因为环境样本中往往包含来自多种微生物的蛋白质，这些蛋白质可能共享相同的序列或结构域，导致肽段的多重匹配。这不仅增加了蛋白质鉴定的模糊性，还可能影响对生物功能的正确解析。

为了解决这个问题，通常采用 目标-诱饵策略（target-decoy approach）。该策略通过在数据库中加入诱饵序列来校准匹配的准确性。这种方法在单一物种的蛋白质组学研究中较为有效，但在宏蛋白质组学的复杂环境样本中，诱饵序列的过多引入可能会增加假阳性率影响低丰度蛋白质的准确鉴定。此外，蛋白质分组（protein grouping） 也是常见的应对策略，即将共享肽段的蛋白质归为一组，然后选择覆盖度最高的蛋白质作为代表。在宏蛋白质组学中，这种方法可能会导致错误分类，特别是在不同物种的蛋白质之间存在共享肽段的情况下。为了提高分类的准确性，也有人采用最低公共祖先（LCA）方法，这可以更准确地确定共享肽段所属的生物类群，并帮助推断这些肽段的生态功能。

-

-

四、数据库的构建

-

在宏蛋白质组学研究中，数据库的构建对于质谱数据解析和蛋白质鉴定的准确性很重要。选择适合的数据库和优化策略不仅影响蛋白质鉴定的数量，还对物种识别和功能注释有直接影响。理想的数据库应精确反映样本的微生物组成，既包含所有相关微生物的蛋白质序列，又避免包含无关物种的信息。过大的数据库会导致鉴定的不准确定，假阳性的增加；过小的数据库则其包含的蛋白序列信息不全。目前的数据库构建策略包括

4.1.公共数据库

公共数据库如NCBI的非冗余细菌数据库、UniProt、IGC、HMP等，包含了大量已知的蛋白质序列。这些数据库广泛应用于各种生物学研究，但在宏蛋白质组学中使用时，可能会带来一些挑战。首先，大型数据库容易导致搜索空间膨胀，增加数据分析的时间成本。其次，由于这些数据库包含大量冗余序列，可能导致肽段匹配的复杂性增加，进而影响蛋白质推断的准确性。这些问题在处理复杂的环境样本时尤为明显，可能导致高假阳性率和低鉴定效率。

4.2.基于宏基因组测序数据的数据库

宏基因组测序为宏蛋白质组学研究提供了一个更为精确的数据库构建方式。通过鸟枪法宏基因组测序（shotgun metagenomics），可以生成与样本中实际存在的蛋白质序列高度匹配的数据库。这种方法能显著缩小搜索空间以及提高蛋白质鉴定的覆盖度，被认为是数据库构建的“金标准”。然而，构建此类数据库需要高质量的宏基因组数据，如果测序深度不足或出现组装错误，可能会导致数据库的完整性受到影响，从而影响后续的蛋白质鉴定。

4.3.基于16S/18S rRNA测序的数据库

在宏基因组测序不可行的情况下，可以使用16S/18S rRNA测序数据作为替代，通过筛选公共数据库中的相关序列构建数据库。然而，由于16S/18S rRNA测序的分辨率有限，尤其在物种或属水平，可能导致数据库中包含大量无关的序列，从而增加计算负担，降低灵敏度。尽管如此，这种策略在资源受限或宏基因组数据不可获得的情况下，仍然是一个有用的工具。

为了克服数据库过大带来的分析挑战，人们开发了多种数据库优化策略，以提高蛋白质鉴定的精度和效率。

-

---

4.4.迭代搜库策略

迭代搜库策略是一种通过逐步缩小数据库规模来提高蛋白质鉴定效率的有效方法。在第一轮搜库不设置任何严格的过滤参数，保留所有可能的蛋白质鉴定结果。这些初步结果随后用于构建一个较小的数据库，再进行第二轮或多轮搜库。在后续的每一轮搜库中，通过应用更严格的过滤参数，如错误发现率（FDR），逐步去除冗余序列。这种方法的优势在于可以显著缩短搜库时间并提高蛋白质鉴定的准确性，特别适用于初始数据库非常庞大的情况。

4.5 DirectDIA策略

DirectDIA是一种不依赖于预先构建谱图库的DIA数据分析策略。其通过从DIA数据中生成伪二级谱图，并基于母离子和碎片离子的色谱流出相似性进行分析。

NPJ BIOFILMS MICROBI|复旦-交大-易算最新合作成果：DIA如何跨过宏蛋白组的第一宇宙速度

研究中展示了directDIA技术在覆盖度、鉴定准确性及定量精度方面均优于其他质谱定量方法。文章还重点展示了宏蛋白组学中研究肠道微生物群及其相关疾病病理学的应用。样本来自轻度认知障碍（MCI）患者和胰腺癌（PC）患者，以及相应的对照组。每个队列中约 70,000 个微生物蛋白被定量并注释。

![图片 3](images/003.png)

敲黑板：Spectronaut的使用使得directDIA在数据分析方面取得了显著进步，其性能已能够与基于谱图库的DIA相媲美。

4.6 Hybrid混合策略

混合策略通过结合DDA（数据依赖采集）和DIA（数据独立采集）数据来构建更全面的混合谱图库，从而提升DIA数据的解析深度。这种方案在近几年的预印版你如果用关键词Spectronaut会搜到很多。比如易算合作的团队使用 Spectronaut Pulsar 算法搜索DDA和DIA原始数据展示了该策略在识别微生物样本分类组成方面的准确性和灵敏度。重新分析了之前发布的结直肠癌 (CRC) 肠道微生物元蛋白质组数据集，其中包括 14 名 CRC 患者和 14 名对照者的DIA 和分级 DDA 数据。

![图片 4](images/004.png)

Hybrid混合策略方法获得了更多的肽段（41,699个蛋白质和187,278个肽段），相比之下，directDIA获得了38,683个蛋白质和163,967个肽段。同时，Hybrid混合策略方法筛选到的差异蛋白更多（分别为5,361个和4,635个），COG功能分析结果与先前报道结果总体一致。

4.7 高丰度HAP蛋白质数据库策略

高丰度蛋白质数据库（HAPs）策略是一种专门针对宏蛋白质组学中高丰度蛋白质的分析方法。这种策略通过优先构建一个仅包含高丰度蛋白质的数据库，如核糖体蛋白质和延长因子，从而在进行DIA数据解析时显著提高分析效率和准确性。

这一策略的关键在于初步识别样本中的主要物种，然后基于这些物种构建特定的全蛋白质组数据库。以复旦大学乔亮团队为例，开发了一种基于HAPs的宏蛋白质组DIA分析策略。该HAPs数据库由公共数据库中的核糖体蛋白质和延长因子序列，以及基于宏基因组测序得到的氨基酸序列合并构建，共计包含295,608条蛋白质序列。这种策略通过构建一个相对较小但高效的数据库，能够大幅缩短搜库时间，并提高蛋白质鉴定的灵敏度和准确性。

复旦乔亮团队与易算最新研究成果：宏蛋白组建库方法与应用

![图片 5](images/005.webp)

![图片 6](images/006.webp)

如果你的研究对象是人类肠道菌群，这个HAPs数据库几乎是必不可少的参考工具。即使你的研究领域涉及到其他复杂样本，如土壤或海洋微生物群落，类似的高丰度蛋白质数据库策略同样可以提供有益的借鉴。

---

在第三期，我们将深入探讨以下几个关键步骤：

-

物种的分类和功能分析：我们将详细介绍如何进行物种分类和功能分析，以更好地理解样品中的蛋白质组组成和功能。

-

关键的一些软件：我们将推荐几款常用的蛋白质组学分析软件，并分享其在实际应用中的经验和技巧。

敬请期待下一期的详细解析。

继续看

加速你的Spectronaut

易算整理 | 环境宏蛋白组学研究实战：实验到数据处理的全流程解析【上】

DIA+PRM宏蛋白组揭示茅台酒曲中的微生物群落组成和代谢特征

宏蛋白组学技术方案与实用策略盘点 - 易算团队整理

龙年第三篇【Microbiome】复旦乔亮、澳洲国立林宇与易算团队联合推出ConDiGA：基于宏基因组精准构建宏蛋白组序列库

联系我们

CONTACT US

![图片 7](images/007.webp)

上海易算生物科技有限公司，专注于利用LC-MS/MS和生物信息学技术，为客户提供高质量的研究方案。我们与国内顶尖的蛋白质组实验室紧密合作，开发最新的蛋白质组相关技术和产品。从DIA、PRM分析产品、单细胞及极微量蛋白质前处理，低丰度蛋白深度挖掘，糖蛋白质组，宏蛋白质组整体方案实验室落地方案等，易算均有国际前沿水平并在高分杂志上发表成果的技术产品。易算自研EasyPept AUTO自动化工作站能够将步骤复杂的质谱样本前处理流程，简化为一键式操作，实现对微量临床样本蛋白质组的智能化、高通量、高重复性分析，有效解决了手工效率低、蛋白质提取损失大、富集流程不理想、所需样本量大等问题。

在数据分析和国际软件方面，我们自主研发了EasyDIA综合数据处理平台，对液相系统、质谱仪器运行状态、定性结果、定量结果等多个方面进行质控，集成了质谱定量数据分析过程中所用的统计方法，支持分析结果的交互式或静态式的展示与下载功能，有利于支撑大队列的高效运转。我们还引入了国外先进的软件和产品，包括来自瑞士Biognosys公司、德国Bruker公司、德国PreOmics公司和澳大利亚IonOpticks公司等，为国内科研机构提供先进可靠的实验及软件解决方案。

![图片 8](images/008.webp)

![图片 9](images/009.webp)
