何为Proteoform|蛋白质变体


蛋白质存在结构上的改变,而这种改变,DNA和RNA层面的检测往往找不到踪迹。


在生物体内蛋白质有两类结构改变


在行使具体功能时,蛋白会发生序列可变剪切、内源性水解或者突变(一级结构改变)。

此外,蛋白质也可能存在丰富的翻译后修饰(侧链改变),比如常见的赖氨酸乙酰化修饰,色、丝、苏氨酸磷酸化修饰。

由于这些改变对生物学意义会带来的影响,在2013年,Neil L Kelleher等提出以Proteoform来命名,一般翻译为蛋白质变体亚型。


蛋白质变体类型




10.1038/nmeth.2369. VOL.10 NO.3 | MARCH 2013 | nature methods


根据变体的形成机制,主要分为两大类:

一级结构变体

  1. 内源性水解,会导致N,C端缺失

  2. RNA可变剪切使蛋白存在多个独立片段

  3. SNP或突变使编码起点或部分氨基酸改变

侧链变体

  1. 翻译后修饰,常见的有乙酰化、磷酸化、糖基化、甲基化等。

以上变体种类之间的排列组合可能形成海量的变体组合,使得真正的变体种类远多于蛋白质的种类。

目前常规的bottom-up定量蛋白质组学的局限:容易遗漏变体信息



常规蛋白质组和蛋白质变体的关系




如上图,鱼与熊掌目前难以兼得。一次实验或单一检测技术无法检测样本蛋白质组的所有变体


蛋白质变体检测方法及难点



基于质谱的蛋白质变体检测技术大致可分为Top-down和bottom-up


Top-down和Bottom-up基本实验流程




Top-down即用质谱检测完整蛋白,在蛋白水平进行分离纯化后进入质谱(MALDIMS或LCMS均有)进行分子量检测(MS1),如果仅对进入质谱的蛋白质或蛋白质混合物进行分子量扫描得到的MS1信息进行数据分析,一般称之为Intact Mass分析;进一步对分子量扫描中的某个谱峰(即某个特定蛋白质)信号进行二级碎裂进行序列组成、修饰匹配分析则称之为Top-down分析。

Bottom-up额外使用蛋白水解酶如Trypsin切断蛋白质中的赖氨酸、精氨酸C端骨架,行成小肽混合物进行质谱检测,大大提高了灵敏度和检测成功率。然后通过软件将小肽片段组合成蛋白信息。


表1 蛋白质变体检测技术简要对比



技术名称

检测方式

优缺点

Top-down

检测完整蛋白分子量或进一步检测MS2碎片信息

Intact通过一级分子量判定蛋白质变体组成形式,优点:检测难度低,缺点:准确性较差,难以分析复杂谱峰;

Top-down将挑选的Intact的一级信号结合二级碎片比对精确确认变体类型和位点。优点:可以得到准确序列匹配,缺点:检测难度高,灵敏度差

Bottom-up

酶切成多肽后检测MS2碎片信息

优点:检测难度低,灵敏度高,通量高。

缺点:一级结构变体的准确检测需要纯化蛋白质,侧链变体检测无法区分多种变体组合的情况。高通量检测侧链修饰需要预先富集修饰。

Top-down检测流程及其难点


Top-down技术的分析流程简单来说就是首先通过IP、LC或电泳的方式得到相对比较纯化的蛋白质,进入质谱检测其MS1谱图,确认目标蛋白质分子量及其其他检出的分子量是否可能是其变体。如无法确认,则进一步检测每个谱峰的MS2谱峰进行序列比对,确定具体变体种类和位点。

作为目前唯一能够检测完整蛋白质信息的质谱检测方式,Top-down的检测通量和覆盖深度一直都不理想,这也是其目前依然没能成为主流检测技术的主要原因,除了个别专精top-down技术的实验室外,绝大多数情况下我们不得不利用bottom-up的高效检测能力来替代top-down的作用。


检测流程


如下图,基于Top-down技术,理想情况下通过MS1的intact分析,就能够确定蛋白变体存在的多种形式。


蛋白质变体Intact-MS谱图示意



J Proteome Res. 2016 Apr 1; 15(4): 1213–1221


需要获得单个蛋白质的Top-down数据需要在蛋白质水平进行预先分离。分离手段包括:1. 抗体亲和富集(研究特定目标蛋白);2.凝胶电泳(分子量分辨率较低);3.体积排阻色谱(分子量分辨率高);


Top-down数据分析




top-down数据的MS1和MS2解析和bottom-up较为类似,首先对一级谱图进行蛋白质母离子识别和去卷积(即正确识别目标分子的单同位素峰和电荷数,还原其真实分子量),不过对于蛋白来说由于分子量比酶切肽大得多,因此其携带的电荷也多得多,从而形成高度复杂的同位素分布数据,如下图。MS2数据分析则是将碎片离子和蛋白质序列的理论碎片m/z列表进行打分比对得到最可能的蛋白质,由于其母离子为完整蛋白质组,故相对于多肽来说,序列长很多,因此MS2碎片会多很多,且容易携带大量电荷,形成的MS2谱峰高度复杂。

不同分子量蛋白质的同位素谱图






混合蛋白的一级谱图




对于同时进入质谱检测的多个蛋白(可能是不同蛋白也可能是同一个蛋白的不同变体),软件正确解析其准确分子量难度高,同样由于高度卷积的母离子,非标记定量也同样困难重重。


单个蛋白质Top-down MS/MS谱图




www.matrixscience.com

完整蛋白质二级谱能够产生的碎片离子远多于短肽,因此其二级谱的复杂度非常高,上图是一个分辨率极高的FTICR质谱测到的完整蛋白二级谱图,可以看到即便如此,其碎片离子覆盖度也仅50%多,如果未匹配成功的碎片离子上有存在变体修饰,则也无法准确进行位点定位。


难点总结


预分离难度高,如果Top-down的一级谱图复杂度高则解析成功率会非常低,因此蛋白分离纯化要求较高。同时进入质谱的蛋白变体种类越少越好。

因蛋白质的分子量分布范围巨大,分子量越大的分子质谱检测灵敏度越差,同时分子量越大,其谱峰的同位素分布就越复杂导致分子量去卷积难度非常高,分辨率要求同样也大大上升,使之检测成功率较低。

由于翻译后修饰的种类多(>1000种),相对含量都不高,因此未经过修饰富集的变体分析往往只能检索到高含量的诸如:蛋白质N端乙酰化、氧化、部分磷酸化变体。

因此虽然top-down在变体检测中理论上能够覆盖到的信息是最全面的,但受限于检测难度,其成本、通量和灵敏度依然无法满足需求。


Bottom-up检测流程及其难点


Bottom-up是目前最常用的蛋白质组质谱检测技术,其核心方法就是利用蛋白质中赖氨酸、精氨酸含量和分布比较均匀,用猪胰酶将各种大小的蛋白质水解成大约1000-3000Da这类最适合质谱进行MS2碎裂检测的片段。然后使用高效液相色谱将不同亲疏水性的多肽分离后进行质谱检测,随后采用分析软件将小肽重新拼接蛋白质进行归属后定性、定量分析。


Bottom-up实验和数据匹配流程示意




翻译后修饰肽段MS/MS谱图对比




上半图为第四位氨基酸M发生氧化产生的特征离子b4的修饰肽段,下图为未发生氧化的多肽,其b4离子比氧化的少了16Da

如上图,在将蛋白质混合物水解成肽段后进行数据分析我们就可以得到大量的肽段与谱图的匹配结果(PSM:peptide spectrum matching),这是数据分析最直接的结果。而翻译后修饰的检测就是寻找原肽段+修饰分子量对应的谱峰,然后在二级谱中匹配然后我们会将这些片段与数据库里的理论蛋白质序列进行拼接得到蛋白水平结果,和测序不同,基于质谱的肽段匹配往往结果不完整,如图9,匹配的序列往往不到理论序列的50%,对于序列完整度要求非常高的变体研究就有所力有不逮了,容易缺失末端序列而无法判断到底是被剪切掉了还是质谱测不到。


难点总结


蛋白质组中存在大量的同源序列,水解后的短肽如何还原到正确的蛋白质变体十分困难;

质谱无法确保所有短肽都能够检测成功,绝大部分蛋白质的序列覆盖无法大于50%,因此无论是可变剪切、突变还是翻译后修饰,都可能出现漏检,从而无法准确判断是否存在可变剪切和修饰;




上图是典型的bottom-up蛋白检测结果的序列覆盖情况,氨基酸序列粗体灰色背景的是检测到的碎片,其余为理论序列且未检测到,N端的大段序列无法鉴定难以说明是N端被剪切了


一个并不复杂的蛋白Proteoform也可能存在多种排列组合,如1个氧化位点、1个乙酰化位点、2个乙酰化位点、氧化乙酰化同时存在等等。而对于复杂的蛋白混合物来说,由于色谱无法将同一个蛋白的不同proteoform智能化的分离纯化(除非用分离后进行top-down分析),因此高通量的谱图解析十分困难。如下图。这类组合如果存在,通过Top-down方法可以比较容易的进行区分,而Bottom-up则难以做到,近年来发展的COPF技术在原理上可以弥补这类缺陷(待我司实际验证)。不过由于这类复杂排列组合的生物学效应具体如何目前研究较少,无法确定其实际价值。




如上图,Bottom-up实验和Top-down相比,存在多个版本的混合位点变体的时候无法正确区分,因此即使检测到多个修饰位点,也无法判断其到底来自于一种变体还是多种变体同时存在。


未经过目标蛋白富集的bottom-up实验往往同时会进样检测几十甚至上百万种多肽,因此含量低、组成复杂的翻译后修饰变体通常难以检测到。


蛋白质变体检测案例


基于Top-down技术的单一蛋白检测




 ApoA-1参与反向胆固醇运输。酰化ApoA-1的膜蛋白亲和性发生改变可以降低心脏病风险。上图展示了ApoA-1及其油酰酯化变体的谱峰,及其MS2碎片匹配定位。从MS1谱图可以看到在通过富集后ApoA-1在质谱MS1信号中成为最高丰度信号,使其得以成功检测,而MS2谱图和前文总结类似,仅覆盖了50%的序列,而其修饰位点碎片正好检测成功,但我们无法得知作者反复尝试了多少次才得到的这一个结果。



 KRAS在癌症中的多个突变和PTM。采用IP-MS的方式富集KRAS蛋白,然后进行蛋白质变体的解析。

Top Down Proteomics – Kelleher Research Group (northwestern.edu)

可以看到,如果需要准确定位修饰/突变位点,同样依赖于二级碎片离子的高覆盖率,而由于蛋白水平的MS2碎裂更不完整,检索难度更高,其分析难度也远远高于多肽的MS2分析。故作者仅解出个别蛋白质的变体。


基于top-down技术的组学检测





https://doi.org/10.1093/nar/gkab1086  基于现有已发表的文献构建了一套proteoform本体论及数据库,包括多种体液和部分组织和疾病类型中发现的各类蛋白质变体。目前主要收集各类Top-down实验数据集。



Melani et al., Science 375, 411–418 (2022) 收集了不同血液成分和细胞类型并各自进行了top-down proteoform分析,共检测到了17103种proteoform。

血液B细胞,top-down结果和我司bottom-up结果对比统计



top-down B细胞

bottom-up B细胞(易算内部数据,单针DDA)

总蛋白数

1864

4821

所有肽段数

~4800

~44000

N端乙酰化

437

935

赖氨酸乙酰化

117

35

磷酸化

77

201

甲基化

40

58

二甲基化

16

49

三甲基化

13

3

可以看到,即使是Science级别的研究,proteoform的数量也非常有限,且种类也不多。作者希望采用这样的数据库辅助日常鉴定,但个人认为难度依然极大,可应用性不佳。

生物药领域的蛋白变体检测案例


在生物医药领域,目标蛋白质的序列完整性、突变及修饰检测是非常标准的检测方式,由于目标蛋白质往往是表达得到的纯品,能够较为容易的结合Intact-MS和bottom-up技术进行变体分析。




上图为生物药蛋白质变体检测常见流程


如上图,常见样品通过intact mass即可简单判定是否存在变体


但如果需要进一步分析精细结构,则需要采用多种酶切处理目标蛋白质,得到不同长度、位置的多个版本肽段,将其拼合后可以得到非常完整的目标蛋白质序列信息,同时由于超高覆盖度和检测深度,蛋白质的可变剪切及翻译后修饰可以结合intact mass结果进行组合分析。图中不同颜色横条标注不同类型的酶切肽段,字母方框代表不同类的修饰。该方法必须得到数十微克的高纯度目标蛋白才能有效分析。


基于凝胶电泳的蛋白质组变体检测




本人在2012年基于Protomap工具,即采用SDS-PAGE分离,通过尽可能多的分子量条带切割分离替代较难实现的SEC-LC分离。检测不同肝癌细胞系全蛋白质组的多种变体。



图A 通过SDS-PAGE电泳切割分离不同分子量段的20个分组,实现较为粗略的蛋白质水平分子量分离。检测结果的蛋白质理论分子量和SDS marker分子量的对应关系,可以看到结果较为线性。C 通过对比相应分级的理论分子量,发现可用于变体分析的约1850种蛋白质,可能存在可变剪切的变体蛋白质161种。并进一步证实了此类蛋白在肝癌细胞系中参与了CAPN2调控的降解网络。


采用SDS-LCMS分析难度较低,容易快速分析,可以找到部分可变剪切蛋白,不过无法非常准确的确认剪切位点。分子量区分准确度也不如SEC(体积排阻)LC方法,同时难以差异定量。


基于COPF 技术的蛋白质变体检测




https://doi.org/10.1038/s41467-021-24030-x

Systematic detection of functional proteoform groups from bottom-up proteomic datasets

本篇文献提出名为COPF: COrrelation-based functional ProteoForm assessment in bottom-up proteomics data的蛋白质组变体高通量检测方法。其采用以下两种路线基于bottom-up方法尝试解析蛋白质组变体

路线1:基于SEC体积排阻-LCMS直接分离60个fraction后对每个frac进行酶解后正常检测。

路线2:基于常规的多状态分组差异蛋白质组结果,作者认为同一个蛋白的不同位置多肽的差异定量趋势差别较大的话很可能于proteoform相关联,基于这样一个原则进行相关性打分,寻找不同实验分组间的变体差别。


基于体积排阻分离蛋白后的bottom-up proteoform分析策略




COPF基于差异定量蛋白质组变体研究



以Ldb3蛋白为例分析不同组织间的变体差异




COPF应用场景


COPF方法基于肽段水平定量差异聚类找到同一个蛋白不同定量表达模式的肽段,以此作为区分不同变体的依据,可以成为寻找可变剪切的一个可行性工具

  1. 各类差异组学的N、C端可变剪切分析

  2. 不同亚细胞器、组织的结构差异

  3. 结合翻译后修饰富集分析proteoform(磷酸化)

  4. 结合非标记定量的突变结果进行突变的proteoform分析


技术总结


基于top-down技术可发现的蛋白质变体如果仅通过LC,电泳等方法找到的信息以蛋白N端乙酰化最多,该信息用bottom-up技术一样可以大范围筛选,而bottom-up技术明显通量和灵敏度高于top-down,在一次快速的单针Hela bottom-up结果中测到的6800个蛋白中有497个蛋白能够检测到N端乙酰化(1%pep,pro FDR),远比费时费力的Top-down方法测到的多;对于可变剪切,常规bottom-up技术难以准确分析,则可以采用COPF方法进行替代。目前大多数蛋白质组学实验室只有较为成熟的bottom-up实验条件,因此我们总结蛋白质变体分析的初步策略如下:

检测对象

检测目的

分析策略

对应易算产品

单蛋白

定性,修饰、可变剪切

蛋白纯化联用intact mass结合多酶切bottom-up

单抗蛋白方案

单蛋白、蛋白质组

未知修饰蛋白组学

DDA 非标记检测结合PTM open search

蛋白鉴定方案

单蛋白、蛋白质组

未知氨基酸突变SAP

DDA 非标记检测结合SAP open search

蛋白鉴定方案

蛋白质组

定性,修饰、可变剪切

ProtoMap,SDS-LCMS分析

COPF

蛋白质组

定量,可变剪切

COPF结合DIA非标记定量

COPF

蛋白质组

目标修饰蛋白质组学

修饰富集联用DDA/DIA 非标记定量

修饰组学定量

当然,以上总结并不完善,无法完全解决相关分析的需求,有待广大同仁继续发愤图强了。


希望有一天需要用蛋白质组学来应对突发事件的时候,我们能够扛得起来!



上海易算生物科技有限公司 转载请注明出处

更多蛋白质组学技术信息请参阅文章的官方网站:

www.omicsolution.com
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com

support@omicsolution.com

+86-18221381405