点击蓝字,关注我们
  • 分子生物学家眼中的质谱是不是还像前几年吐槽的那样:这也测不到,那也测不准?

  • 蛋白质组学是不是还是那么难做?

  • 现在测蛋白质组费用到底能有多低?

01

背景


在我读书的时候(2010前),导师的梦想之一是每个样品都能检测到10000+个Unique Gene(人大约有20000+种编码基因)。在那个时候,要实现这个目标其实也不是不行,无非就是拼了命的分级+拉长梯度,记得那年CNHUPO的某海报展示了用QE深度分级后成功测到了Hela近8000种蛋白,大为叹服。只不过实际生物学或临床队列研究很难用此方法,太贵、太不稳定、太慢。到了前几年,IonOpticks和另一个日本实验室不约而同的靠DIA+长梯度+精细手艺活实现了单针~10000个蛋白(2-3小时分离梯度)的定性深度。但实事求是说,还是太难了。Biognosys靠深度分级建库+DIA也实现了单针10000左右的检测量。这几年随着软件、硬件的共同进步,也算是慢慢的把深度卷上来了,然后就是卷通量了。以前我们是一天检测一个10000个蛋白的蛋白质组,前两年实现1小时10000,最近又差不多卷到了30分钟10000(还得建个库),等啥时候5分钟10000了我可能就得失业了。

可能有人会问:“为何Hela只能到10000,不能更多么?”一个是边际效应太明显了,当前质谱Hela单针到7000-8000PG,洒洒水,9000-10000,费点劲,11000-12000,那得费老鼻子劲了,做出来了你也不肯买单。

也有人会说:“其实我不关心你能检测到多少个蛋白,我关注的那个基因检测到,是我预期的变化趋势就行了。”定量的事情回头说,鉴定到你要的目标蛋白这事,我有责任,你也有责任。。。现在的蛋白质组卷,分子生物学也卷。丰度高的自然研究的也多,因此现在也都不感兴趣。丰度低的自然难测,研究的也少,因此风险也高,测不出来我又得背锅,太难了。

所以今天我收集了下这几年的Hela数据,从定性深度、成本上来先给你捋一捋。下次做不出来我先用本文预防性甩个锅......

02

数据来源


  1. 2020年HFX质谱,1小时DDA采集+Maxquant:共定性到5188个unique Gene,应该算比较典型的分析结果了(2024 Scientific Data);

  2. 2022年timsPro2质谱,2小时多上样量采集加和+DIA-NN:共9421个unique Gene,日常不实用,仅作参考(2022 Nature Commun);

  3. 2023年timsHT质谱,14分钟DIA-PASEF采集+Spectronaut directDIA:共8557个unique Gene,实用方案,成本几百(易算数据)

  4. 2024年Astral质谱,60分钟DIA采集+Spectronaut directDIA:9668个unique Gene,不实用方案,成本数千,仅作参考(2024 Nature Biotech,HEK293冒充下);

  5. 2024年Astral质谱,14分钟DIA采集+Spectronaut directDIA:8592个unique Gene,实用方案,成本上千(2024 Nature Biotech/易算数据);

PS:更短梯度检测方案个人不推荐(定量问题较多)

需要声明的是条件有限,细胞来源不同,结果不太严谨,仅作参考。


03

数据对比

首先对比数据2,3,4,5,共纳入11000个Hela蛋白,得到如下结果:


可以看到,不同质谱的鉴定一致性还是可以的(毕竟不是同一来源细胞,否则一致性会更好),长梯度检测的收益目前已经越来越小,14分钟左右的检测梯度对于最新一代质谱来说是个甜点参数,相应的Hela确保检测8000+也是较为理想的检测深度(定量点数足够,价格也便宜,实现1毛钱测一个蛋白质不在话下)。

然后,我们来对比下时代的进步,采用数据1,3,5:


可以看到,虽然HFX+DDA的组合在相当部分实验室还是日常使用的,但的确已经老了,新质谱用25%的时间加DIA的新方法实现了接近翻倍的深度。我们的确可以说,时代变了。

那么回到正题,如果单次检测比前几年提升了20-40%,分子生物学家就能对蛋白质组质谱满意了么?答案显然是否定的,因为这不还有一半基因没测到么?

停,说句公道话,有些蛋白在细胞里测到我得怀疑你的样品是不是被污染了,有些我只能说,臣妾做不到啊。

先看下面这组对比,这是将易算近期做的一套血液低丰度富集的5000种左右蛋白质定性列表和细胞的做个对比,可以看到至少有近千种蛋白质是血里独有的。


把这些血里独有检测的这些蛋白做个富集分析如下,database列数字指的是人基因组注释后在该分类下的蛋白质总数,dataset是指我采用的这几个数据集中依然没检测到的蛋白的数量,如果两者高度接近,就说明你关心的这类蛋白在细胞(至少常规细胞)基本别想测到了,不过需要注意,比如免疫球蛋白还有几十个不在本数据集里不代表细胞里能测到,而是因为易算的低丰度血液富集方法也不是万能的,有些血液里的蛋白我还是测不到,实在不好意思。

cellular component

细胞组分

database

dataset

expected

Fold Enrichment

immunoglobulin complex

免疫球蛋白复合物

188

103

8.04

12.81

blood microparticle

血液微粒

143

76

6.12

12.42

platelet dense granule

血小板致密颗粒

21

11

0.9

12.24

high-density lipoprotein particle

高密度脂蛋白颗粒

27

12

1.16

10.39

platelet alpha granule lumen

血小板α颗粒管腔

67

28

2.87

9.77

lipoprotein particle

脂蛋白颗粒

38

15

1.63

9.23

plasma lipoprotein particle

血浆脂蛋白颗粒

38

15

1.63

9.23

protein-lipid complex

蛋白-脂质复合物

41

15

1.75

8.55

platelet alpha granule

血小板α颗粒

91

33

3.89

8.48

collagen-containing extracellular matrix

含胶原的细胞外基质

428

122

18.31

6.66

external encapsulating structure

外部包裹结构

563

149

24.09

6.19

extracellular matrix

细胞外基质

562

148

24.04

6.16

以及蛋白质家族分类富集:


Protein Class

蛋白分类

database

dataset

expected

Fold Enrichment

complement component

补体成分

25

16

1.07

14.96

immunoglobulin

免疫球蛋白

190

96

8.13

11.81

surfactant

表面活性物质

8

3

0.34

8.77

globin

球蛋白

10

3

0.43

7.01

protease inhibitor

蛋白酶抑制剂

131

38

5.6

6.78

apolipoprotein

载脂蛋白

32

9

1.37

6.57

extracellular matrix glycoprotein

细胞外基质糖蛋白

22

6

0.94

6.37

tubulin

微管蛋白

24

6

1.03

5.84

defense/immunity protein

防御/免疫蛋白

655

148

28.02

5.28

cytokine

细胞因子

103

17

4.41

3.86

所以,如果您对以上这些类型蛋白感兴趣,不要轻易在细胞体系尝试,如果能测到,那我也只能说可能被污染了。


那么还有哪些你可能感兴趣的但我想劝退你的蛋白质呢?去除血液蛋白后,我们再比较下检测不到的那些蛋白富集结果:

cellular component

细胞组分

database

dataset

expected

Fold Enrichment

Golgi cis cisterna

高尔基体顺式结构

22

20

6.19

3.23

sperm flagellum

精子鞭毛

34

27

9.57

2.82

acrosomal vesicle

顶体囊泡

28

22

7.88

2.79

Golgi cisterna

高尔基腔

29

20

8.16

2.45

cis-Golgi network

顺高尔基网络

32

22

9.01

2.44

Golgi stack

高尔基叠层

34

21

9.57

2.19

9+2 motile cilium

9+2 运动纤毛

49

30

13.79

2.18

monoatomic ion channel complex

单原子离子通道复合体

141

85

39.69

2.14

motile cilium

运动纤毛

66

39

18.58

2.1

non-motile cilium

非运动纤毛

39

23

10.98

2.1

Molecular Function

分子功能

database

dataset

expected

Fold Enrichment

taste receptor activity

味觉受体活性

25

25

7.04

3.55

odorant binding

气味结合

122

118

34.34

3.44

neuropeptide receptor activity

神经肽受体活性

24

22

6.76

3.26

G protein-coupled amine receptor activity

G 蛋白偶联胺受体活性

39

33

10.98

3.01

fibroblast growth factor receptor binding

成纤维细胞生长因子受体结合

25

21

7.04

2.98

G protein-coupled peptide receptor activity

G 蛋白偶联肽受体活性

89

72

25.05

2.87

peptide receptor activity

肽受体活性

95

76

26.74

2.84

G protein-coupled receptor activity

G 蛋白偶联受体活性

331

261

93.17

2.8

voltage-gated potassium channel activity

电压门控钾通道活性

88

69

24.77

2.79

delayed rectifier potassium channel activity

延迟整流钾通道活性

32

25

9.01

2.78

Protein Class

蛋白分类

database

dataset

expected

Fold Enrichment

G-protein coupled receptor

G 蛋白偶联受体

407

326

114.56

2.85

antimicrobial response protein

抗微生物反应蛋白

37

29

10.41

2.78

transmembrane signal receptor

跨膜信号受体

1147

817

322.84

2.53

peptide hormone

肽类激素

63

44

17.73

2.48

ligand-gated ion channel

配体门控离子通道

63

43

17.73

2.42

cytokine

细胞因子

103

68

28.99

2.35

structural protein

结构蛋白

192

125

54.04

2.31

ion channel

离子通道

319

188

89.79

2.09

growth factor

生长因子

99

58

27.87

2.08

viral or transposable element protein

病毒或转座元件蛋白

53

31

14.92

2.08

intercellular signal molecule

细胞间信号分子

408

236

114.84

2.06

voltage-gated ion channel

电压门控离子通道

99

57

27.87

2.05

basic helix-loop-helix transcription factor

基本螺旋环螺旋转录因子

101

58

28.43

2.04

cell junction protein

细胞连接蛋白

60

34

16.89

2.01

intercellular signal molecule

细胞间信号分子

408

236

114.84

2.06


04

总结加甩锅

    以上粗略统计了现在Hela中难以测到的蛋白质的主要功能、细胞定位或蛋白分类,做个简单总结,作为甩锅预警:

  1. 细胞内理论上不会出现的,如各种分泌蛋白、免疫球蛋白你就别惦记了,另外含量极低的趋化因子、细胞因子等也很难测

  2. 特殊结构、器官中才会有的蛋白质如各种鞭毛、纤毛蛋白

  3. 含量极低、只存在某些亚细胞器中,不富集基本测不到(富集了可能也测不到多少),如各类受体、跨膜结构、转录因子、离子通道蛋白等

  4. 数据库中几乎没有什么注释的蛋白,这种基本就是本身含量就极低,只在测序数据中能发现的,就不要为难质谱了。

    质谱的一个特点(缺点)就是结果无法准确预估,有些时候Histone都有可能测不到。抛开手艺问题、污染问题不谈,蛋白质组本身就有时空特异性,某些蛋白质可能就真的在你的样品中表达量极低。

    另外Western Blotting能够检测到的蛋白质不代表质谱一定能测到(检测原理差异太大,且WB抗体本身的假阳性往往被低估),如果您以WB都测到了来质疑质谱结果,我只能说:“加钱,我用绝对定量标肽+PRM/MRM来尝试吧”这就涉及到下个话题了:质谱定量到底有多不准,敬请期待。

蛋白质组犹如星辰大海,我们依然是如此渺小。