在进行第二部分讲解之前,我们先以一个相对简单而又热门的COVID19病毒为例,讲解下蛋白质组研究和UniProt的关联,质谱检测蛋白质组的特点及其复杂性
本文包含的内容如下:
蛋白质组检测难点及其序列文件重要性
COVID19蛋白质序列数据库获取
COVID19蛋白质检测结果实例
免责声明
由于本人非UniProt相关技术人员,相关资料均来自于网络收集,难免出错敬请谅解。所有参考资料来自于EMBL下属各个网站及其培训网站所下载的视频和文档。
蛋白质组检测难点及其序列文件重要性
图1. COVID19病毒结构示意图
图2. COVID19病毒RNA示意图
本节内容供蛋白质组入门者快速了解蛋白质质谱检测的主要难度。
首先,简单介绍下RNA和蛋白质的结构重要区别,如上图1,新冠病毒结构示意图,新冠病毒只包含单链RNA作为遗传物质,而蛋白质作为生命体的主要组成结构和功能执行者,其经过RNA翻译后会形成多种不同结构、分子量差异达2个数量级以上的蛋白质,这些蛋白质也组成了病毒的主体结构和入侵宿主后才会大展身手的非结构性功能蛋白质。光看图2的上下部分就能看出来新冠病毒蛋白质和RNA的组成差异,其Genome约由30000个核苷酸组成,其中20000多个核苷酸负责编码ORF1ab蛋白,紧接着编码刺突蛋白和E,M,N三个结构蛋白,但在EMN之间还编码了约9个辅助蛋白质。不同蛋白质的丰度,定位,功能差异极大。对于ORF1ab这个庞然大物来说,它还包含多达16个chain会被内切酶切割成不同功能的亚蛋白NSP1-16(None structure protein),发挥其可怕的传染和破坏能力。加之蛋白质不能像RNA一样进行扩增,给蛋白质组的分析带来了巨大的挑战。
| 以上为具有3D结构的ORF1ab剪切后的15个NSP蛋白 | S,刺突蛋白 | ORF3a | E,包膜蛋白 | |
M,膜蛋白 | ORF6 | ORF7a | ORF8 | N,衣壳蛋白 |
ORF10 | ||||
另一个重要区别:测序长度和复杂度,RNA测序相对于蛋白质测序,仅需要检测4种不同分子,测序仪最长可以连续检测几十K的核苷酸长链,而蛋白质却由多达20种不同的氨基酸组成异常丰富而差异极大的复杂3D结构。蛋白质质谱能够检测并准确匹配序列的分子量一般不超过5000Dalton,因此面对分子量往往从几千到几百万Dalton的蛋白质,必须依赖于胰酶将蛋白质水解消化成短肽才能高效检测。对于任何一个高等生物的细胞、组织、体液,水解后会得到几十万到上百万种短肽,外加丰富的各类蛋白质变体(参见Proteoform及其检测难题),
实际应用中,我们必须同时依靠高性能的纳升色谱结合高分辨、高扫描速度的质谱和高准确性、低冗余度的理论蛋白序列来有效检测这些短肽并将它们拼接回各自所属的蛋白质。同时,胰酶所酶切的赖氨酸K和精氨酸R位点虽然在大多数蛋白质中的分布较为均匀,但毕竟自然进化不会那么完美,海量的不适合质谱检测的肽段和不易离子化的氨基酸都会降低检测结果的序列覆盖度。
以上两个影响因素导致大多数蛋白质组质谱分析结果都只能覆盖部分蛋白质及其理论序列的一部分。以人蛋白质组为例,人类有约20000个编码蛋白质,通常同一个器官或细胞可能表达其中80%左右的蛋白质,也就是16000种以上,目前较好的质谱结果大概一次覆盖约10000个蛋白/样品。同时,每个蛋白质也只能检测到部分多肽序列。如下图就是一个典型的丰度还算较高的蛋白质序列匹配情况:
绿色横条对应的氨基酸即为本次质谱可靠检测的多肽序列,红色为有质谱谱图覆盖但可信度不够。其余部分均未检测到。
如果没有理论蛋白质序列协助蛋白质匹配,那不管是软件还是经验丰富的研究人员就只能抓瞎了。那么接下来,我们首先来看一下如何获取一个高准确性、低冗余度的理论蛋白序列数据库。
COVID19蛋白质序列数据库获取
www.uniprot.org
我们以寻找COVID19病毒序列数据库举例,打开www.uniprot.org,点击Proteome图标后输入搜索SARS即可看到下方结果中的Severe acute respiratory syndrome coronavirus搜索结果。UP000000354即其蛋白质组数据库的UniProt ID,包含蛋白15种。下方还列出了多个来源的CoV毒株数据库,点击UP000000354后进入其蛋白质组数据库主页,如下图。
橙色箭头:点击后进入所有蛋白列表
红色箭头:点击下载该蛋白质组所有成熟序列编码蛋白质fasta,可以直接用于质谱搜库
绿色箭头:点击下载该物种所有strain的蛋白质序列集合,一般难以确认具体strain时可以尝试,其中同源蛋白序列较多,不建议直接使用。
你也许会问,刚才介绍的新冠病毒编码蛋白有30个左右,这里怎么才15个?原因是数据库中只列出了ORF1a和ORF1ab而不是其剪切产生的NSP蛋白Chain。如果需要单独列出NSP1-16蛋白Chain,则需要点击黄色箭头的蛋白列表后找到ORF1ab,Replicase polyprotein 1ab,如下图
在浏览ORF1ab的各类背景注释知识的同时,点击PTM/Processing
将各个NSP chain依次点击Add加入序列待下载列表,如下图
然后回到页面最上方,点击basket
全选后,点击download,fasta即可下载所有感兴趣的NSP蛋白的fasta文件。最后通过文本编辑器将之前下载的新冠病毒蛋白序列全库中的ORF1ab序列替换为这次下载的剪切后的独立NSP蛋白即可开工。(亦可将蛋白名称替换为NSP,因新冠病毒的特殊性,我们才需要手动分割ORF1ab蛋白序列以便更好的分析蛋白质组数据,其他大多数物种不需要类似操作)
COVID19蛋白质检测结果实例
如上图示例,比如我呢厨房有台timstof pro2,最近天天家里做抗原,突然发现两条杠了,稳妥起见抽了自己一管血,分离富集低丰度蛋白(易肽DeeP低丰度富集前处理试剂盒),经过我司试剂盒前处理得到多肽样品后上机(在虎年,灵敏度、高通量、高可靠性:全都要!),单针DDA检测70分钟后得到大约3000个蛋白质,当然,其中大部分都是宿主蛋白,过滤COVID数据库来源的蛋白质后可以看到如下图结果,啊,我阳性了。。。既然阳性了,我再挣扎下看看具体结果吧。可以看到含量最高的果然是结构蛋白。即使如此,最高丰度的衣壳蛋白序列覆盖率75%左右,而恶贯满盈的NSP蛋白中覆盖最高的也就只有30%。这也是和RNA-SEQ一大不同。当然了,和抗原抗体就识别个别位点来说覆盖度还是高得多了。
总的来看,虽然我们已经尽力去除了高丰度宿主蛋白质,但也只能检测到结构蛋白中的衣壳、刺突、膜蛋白,一半左右的非结构性蛋白(NSP),以及几个Orf蛋白,其余蛋白质都没有测到。
其丰度覆盖范围相差接近4个数量级,见下图,箭头们标注的都是测到的新冠蛋白,而其他的都是内源性宿主蛋白丰度:
上图中标注的蛋白 | 说明 |
N,衣壳蛋白 | 与病毒基因组RNA结合并形成螺旋核糖核衣壳 |
S,刺突蛋白 | 参与宿主蛋白结合 |
M,膜蛋白 | 介导病毒颗粒的组装和出芽 |
ORFx | 各种功能蛋白 |
NSPx | 非结构蛋白,由ORF1A/B蛋白剪切形成 |
有人会问,没有覆盖到的E蛋白和其余NSP、Orf蛋白到底是因为什么原因无法分析?
这个问题相当复杂,在我对COVID19各个蛋白理论丰度缺乏足够认识的情况下只能猜测其可能丰度过低/易降解/高度糖基化修饰等导致难以检测。
那么,这些蛋白的具体结构和功能或修饰情况在UniProt里是如何被注释和查询的呢?
可以先看下UniProt官方讲解视频或者敬请期待我们的下一篇推文。
总结
使用UniProt不仅能够搜索查询感兴趣物种的蛋白质,下载其理论蛋白质组的fasta序列,更可以根据剪切状态在线进行序列拆分,注释查看等各类相关操作。
同时我也用COVID19感染后的血液做了一个简单质谱实验为您展示了病毒不同蛋白质丰度存在的极大差异。同样可以知道,目前蛋白质组学技术也很难将复杂生物体或复杂生物体内的简单物种蛋白质组进行100%序列覆盖。
如果您对本章节介绍还有疑问,可以后台向我们提问或者继续关注我们。
下一篇,我们将为您带来:
UniProt的背景及其在蛋白质组学研究中的重要角色
UniProt蛋白质序列数据的来源及其组成信息
UniProt蛋白质序列功能注释的过程
UniProt的使用基本操作
上海易算生物科技有限公司
转载请注明出处
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com