目前我们绝大多数的蛋白质组学实验都是基于bottom-up策略,即首先将蛋白质水解成小肽后进行MS和MS/MS检测,并和该物种的理论序列进行比对后得到肽段序列信息,再结合理论序列进行肽段拼接成蛋白得到最终结果。水解和拼接过程与基因组、转录组、代谢脂质组等方法差异较大,因此容易让初学者产生误解。本文致力于将该过程中相关的技术名词结合Biognosys软件中的命名关系解释清楚。

相关名词:Protein,Protein Group,Proteotypic,Precursor,Peptide,Modified Peptide,PSM

图1. 文献中常见的蛋白质组学研究流程示意图,不过对于初学者来说可能还是有点不够直观。

图1展示的蛋白质组分析流程中,蛋白破碎分离检测再组合的过程虽然较为麻烦,但因此实现了检测通量、蛋白序列覆盖能力的提升。目前我们已经能做到1小时定量1万个蛋白的水平。但bottom-up技术的缺点就是直接检测的是水解多肽,多肽序列还原回蛋白会丢失较多信息且因为序列同源问题出现拼接误差。因此也带来了蛋白质组学数据分析中独有的Protein,Protein Group的差异。

一、Protein Group、Protein

经典的胰酶水解肽长度一般在7-30个氨基酸,平均长度一般12-13左右,也就是说一个蛋白通常会被水解成几十到几百种不同的多肽碎片,当然其中相当一部分长度不满足7-30的质谱最佳检测范围,还有一部分肽段因亲疏水性、易带电性等各类原因难以被质谱有效检测,因此每个蛋白能够在一次质谱检测中也就能检测到不到10条不同肽段。我们来看同一套人蛋白质样品的DDA分级数据,在采用不同fasta序列文件,而用Spectronaut完全相同参数建谱图库的结果差别。其中A采用的是UniProtKB的Proteome数据库,human的one gene one protein fasta(约2万条序列)而B采用的是UniProtKB中所有human sequence(约20万条序列)检索。

A.

B.

图2 UniProt human 20000条序列和200000条全库序列分析结果对比

首先我们看图3中的Protein和Protein Group数量,两个都是human fasta,结果却天差地别。我们随意找个肽段:DVNYGWIIR。在A的结果中匹配到了P00156,MT-CYB蛋白,即线粒体细胞色素b蛋白。该肽段较为保守,并没有在任何其他基因编码的蛋白中有发现。但在B的结果中却匹配到了1838个Protein。在蛋白质组分析结果中通常我们报告的是Protein Group结果,但也有老师会用Protein来计算结果。那么在采用不同fasta的情况下会产生3倍左右的数量差异,具体差异举例如下:

图3 CYB基因编码的三个蛋白序列差异

对于B数据库(20万条序列)来说,其相对于A数据库多收集了CYB基因的近2000种变体、fragment等序列,其中以B有A无的I7GW39,B9EF31为例,这三个蛋白都含有相同的DVNYGWIIR酶切肽。而不同之处在于93号位的C和Y氨基酸差异,194号位的A,T差异。

表1 对两种数据库的CYB蛋白序列进行统计对比

通过表格1列出的3种多肽检出情况可以发现,Protein Group会按照奥卡姆剃刀法则进行最精简的结果输出,而Protein则会列出所有包含该些肽段的蛋白质,但如果P00156所包含的三个肽段都检出(DVNYGWIIR;YLHANGASMFFICLFLHIGR;FFTFHFILPFIIAALATLHLLFLHETGSNNPLGITSHSDK),而能够证明I7GW39,B9EF31独立存在的肽段(YLHANGASMFFIYLFLHIGR;FFTFHFILPFIIAALAALHLLFLHETGSNNPLGITSHSDK)未检出,如情形3,则无论用哪个数据库都只会报告P00156。UniProt认为P00156序列是CYTB蛋白的最主要存在形式,而另两种则是从DOI:10.1093/molbev/mss169这篇研究SNP的文献中提取到的序列以及2009年的一个DNA Variants测序实验中的结果。

我们也简单统计了下如果您选择human所有序列分析质谱数据,那么200K的序列中有一半左右的序列来自如下基因:

表2:UniProt所有human序列的编码基因对应蛋白序列数量统计

Name

Count

HLA

85000

ND

5500

IgX

4000

ATP

2400

COX

2400

CYTB

1900

RHD

500

相信通过本段的解读以及我们前几篇关于UniProt的解读文章,您可以得出结论:

1.数据库的选择取决于SNP,isoform是否在下游分析的考虑中,fasta选择不同,Protein Group的组成形式差异极大;

2.比较不同实验、仪器、文献分析的蛋白质组覆盖深度前,得先确认数据库是否一致,报告的到底是Group还是single Protein;

3.Protein Group相对更能代表样品中可检出的蛋白种类,如选择one gene one protein数据库,则统计数量的结果差异不大

二、Peptide,Unique Peptide,Proteotypic Peptide

RNA翻译得到的完整蛋白经过内源、或外源的酶剪切或水解后会产生一系列的片段,我们一般称之为多肽,通常分子量在10KDa以下。如果片段分子量大于10KDa,一般也会称其为Protein fragment。而bottom-up LCMS实验中的基本测量单位就是Peptide。通常相同样品检测到的不同种类的Peptide越多,证明我们实验无论是前处理还是LCMS都做的相对更好。由于Protein、Protein Group的数量统计通常不会考虑序列覆盖度 Sequence Coverage的信息,而想得到更丰度的定量及Protein定量时,则依赖于更多种类的肽段提供信息。

图4 来自1433E蛋白的不同多肽信号强度(y轴)和保留时间(x轴)分布。

并非我们想象的那样,同一个蛋白不同多肽理论上含量应该一样多,那么其XIC信号强度差不多高,其实因理化性质的不同,不同多肽在质谱中的响应强度天差地别。因此肽段数量检出种类越多,越能提高定量结果精度。

我们在大量的文献中会看到一个名词Unique Peptide,同时在小部分文献中会提到Proteotypic peptide的概念。简单的讲,Unique Peptide是仅在搜库结果中特定一个Protein Group结果中检测到的肽段,而其他任何Protein Group中均无发现,也就是专属于该Group的肽段,无论其group中有多少个不同的Protein。而Proteotypic peptide与搜库结果如何无关,而直接计算Fasta文件中的各个酶解多肽是否仅来自于单一序列。也就是说如果某个peptide是proteotypic peptide,即为在所使用的fasta中,只可能在一个protein sequence中可以找到它,如果我们的实验中检测到该肽段,我们可以下结论,该肽段所属的蛋白质一定存在且无歧义。同源序列越多,则该fasta中的proteotypic 肽段越少,如图1所示。

通过本段落的解释,我们应该可以得出如下结论:

1.Peptide种类也是衡量实验效果的重要指标;

2.Unique Peptide和Protein Group相关而Proteotypic Peptide只和fasta序列库相关。如果某个肽段是Unique的而其所属的Group有大量同源蛋白,只能证明该肽段可能来自于group中的任意蛋白,而如果肽段是Proteotypic的,则可以说基于所提供的fasta序列库,该肽段是唯一属于某个蛋白质的。

三、Peptide,Modified Peptide,Precursor

当您采用 Biognosys系列软件(Spectronaut、SpectroMine、SpectroDive)分析质谱数据时,还将获得与检测到的肽相关的不同水平的信息(3)。

1.肽(Peptide):指氨基酸序列,与分析肽的电荷状态或修饰无关。主要用于蛋白质推断。

2.修饰肽(Modified peptide):报告有关肽的翻译后修饰状态的信息。在我们的报告中,方括号中的氨基酸残基的附加质量(如果有)显示的即为该修饰基团的分子量。

3.母离子(Precursor):指质谱仪中被分析出的实际的唯一的分子单元。母离子包含相关肽段的氨基酸序列、翻译后修饰和带电荷数的信息。最终,碎片离子由这些母离子产生。 

表3:在Biognosys软件中肽段不同记录形式间的关系

Protein Group

Q92688

Peptide

IFGGLDMLAEK

LPNLTHLNLSGNK

Modified
peptide

_IFGGLDMLAEK_

_IFGGLDM(+16)LAEK_

_LPNLTHLNLSGNK_

Precursor

_IFGGLDMLAEK_.2

_IFGGLDM(+16)LAEK_.2

_LPNLTHLNLSGNK_.2

_LPNLTHLNLSGNK_.3

注:.2,.3代表不同电荷,(+16)代表前一个氨基酸发生了修饰及其分子量大小

通过本段落的说明,可以得出结论:

1.母离子Precursor的数量将始终等于或高于修饰肽的数量,而修饰肽等于或高于肽的数量;

2.LC-MS所记录的信息是以Precursor为基本单元,每个precursor包含肽段的电荷信息,随着保留时间而变化的信号强度信息(XIC)及其所有MS/MS谱图的碎片信息。

四、PSM

在传统的DDA实验中,我们经常会提到PSM(Peptide spectrum match)及其数量作为评价实验结果好坏的指标之一,即MS/MS谱图匹配成功的数量。对于DDA实验,一个PSM即代表一个肽段的成功鉴定。而由于质谱根据出峰信号强度及预设的动态离子排除设置不同,单次实验的DDA MS/MS谱图数即使是相同样品的上机重复,通常也会不一样,对应的PSM数量往往也有5%左右的出入。但是对于DIA实验来说,由于单张MS/MS谱图往往包含来自于几个到几十个肽段的碎片信息,因此鉴定结果的数量远大于MS/MS数,因此PSM不具备统计价值。同时因为DIA的扫描是质谱本身的固定设置,和样品谱峰无关,不同的数据间MS/MS数量会完全一致。

A

B

图5 A 常见的DDA MS/MS谱图;B 常见的DIA MS/MS谱图

本段落可以得出的基本结论:

1.PSM的概念在新一代DIA扫描技术替代传统DDA后已经不再重要了;

2.即使对于DDA扫描来说,因为PSM是和单张MS/MS谱图相关,其受到dynamic exclusion时间设置影响很大,无法客观体现实际结果好坏。