本章节主要讲的是序列相关背景,包括但不限于:UniProt为啥强;UniProt蛋白序列来源是哪,可信度如何?Uncharacterized蛋白到底能不能用等问题。
不过原定于5月9日改版的UniProt网站跳票了,所以部分截图或链接会和后续使用的略有出入。请开动脑筋自行调整。原来本章节的第四部分 序列类型及Proteome数据库由于本章节篇幅依然过长,为了再水一篇,挪到下次发布。(其实是没写完)
往期导读:
本文包含的内容简列如下:
为何要使用UniProt的蛋白序列?
UniProt的蛋白序列来源
UniProt序列的命名、信息分类
UniProt序列类型及Proteome数据库(P2.3)
免责声明
由于本人非UniProt相关技术人员,相关资料均来自于网络收集,难免出错敬请谅解。所有参考资料来自于EMBL下属各个网站及其培训网站所下载的视频和文档。
为何使用UniProt的蛋白序列
原因1:如上图,可以看到从INSDC成员到RNA注释数据库到蛋白质数据库以及下游的各类序列注释数据库,EBI的成员数据库做到了几乎全覆盖,只此一家。同样,只要来自于INSDC的测序数据,经过有效注释后都会最终收集整理到UniProt,数据的广泛性也可以得到保障。
原因2:蛋白质序列信息的归类、注释到位,可视化高且易用。目前系统性提供蛋白质序列信息的数据库也就两个,另一个是NCBI数据库,如下图,是NCBI COVID19 N蛋白的页面
可以看到就是纯粹的文本文件在线显示,而UniProt的对应页面
https://covid-19.uniprot.org/uniprotkb/P0DTC9 则内容丰富得多,过于丰富此处不便插入,请自行访问。同时,UniProt对蛋白质序列的版本更替、聚类、经典序列和isoform等变体序列的组织和注释都做得非常详尽,远非NCBI能比,而且对于国内用户来说NCBI序列的下载同样非常难用,UniProt无论是网页、API还是ftp下载都比NCBI易用。最重要的是UniProt的SwissProt数据库会对重要蛋白的各类变体进行详尽注释,对蛋白质组学研究者非常友好。
UniProt序列来源
上图是个人总结的UniProt蛋白质序列来源的一个典型途径:
INSDC数据库汇聚了全世界各地的测序数据:NCBI,EMBL,DDBJ。其中EMBL旗下European Nucleotide Archive是EBI的主要存储数据库网站;
Ensembl,作为一个1999年开始启动的参与人基因组测序的计划,目前Ensembl旗下有Ensembl Bacteria, Fungi, Plants, Protists, Metazoa等多个组织分别进行这几大类物种测序数据的注释。再次体现了EBI下面各机构独立运作的特色。Ensembl这几个分支数据库大约一个季度更新一个版本,每次都会添加几个到几十个新物种的测序注释数据,同时也会更新旧的物种注释数据。相对于NCBI来说,Ensembl虽然散装,但是一旦你查到某个感兴趣的物种被其收录,那么相关的信息、文件下载都会非常简单;
Ensembl中注释完毕的物种会定期被UniProt收录,在蛋白质水平进行注释,如果你在UniProt中没有找到感兴趣物种的Proteome数据库,可以去Enseml的相关物种网站上看看有可能该物种刚刚收入基因组还没来得及注释完毕给UniProt,另外Ensembl Rapid Release每两周更新一次,会把未来计划收录的物种提前放出,但可能注释尚不完整。
举例:
以上图为例,最新版本的Ensembl Rapid收录了yellowfin seabream 黄鳍金枪鱼,包含23479个编码基因,但可以看到UniProt中没有它的蛋白质组,只有之前从其他零散渠道,比如某些文献来的104个蛋白质。所以你在当前需要研究黄鳍金枪鱼的话,可以考虑先去Ensembl Rapid网站下载直接翻译CDS的Acanthopagrus_latus-GCA_904848185.1-2022_03-pep.fa 文件。那么Ensembl下载的fasta和UniProt区别在哪呢?我们以最近刚被UniProt收录的Meleagris gallopavo火鸡为例。如下图:
在Ensembl中统计到了火鸡有16226个编码基因,30708个转录本。而在UniProt Proteome中:
作为来自于同一个Ensembl基因组对应的蛋白质组数据库,UniProt会进行如下过滤:
存在新的更长或更短的RNA(融合或分裂预测基因),缺乏RNA(即使在其他物种中)和/或错误的内含子/外显子边界(在真核中)。其他一些蛋白质序列可能已在文献中被鉴定为假基因。当有足够的证据表明这些CDS不是真正的蛋白质时,UniProt会将它们从UniProtKB中移除。
所以Gene Count少了13个,Proteins少了2471个。当然UniProt没有详细的分析流程报告,无法得知具体处理情况。
另外当我们打开具体文件查看时可以发现,Ensembl的序列名称更加偏向于描述该蛋白的组装项目名称,染色体定位等等来源信息以及基因注释名称:
>ENSMGAP00000019845.1 pep primary_assembly:Turkey_5.1:MT:2821:3795:1 gene:ENSMGAG00000017502.1 transcript:ENSMGAT00000021027.1 gene_biotype:protein_coding transcript_biotype:protein_coding gene_symbol:ND1 description:NADH dehydrogenase subunit 1 [Source:NCBI gene (formerly Entrezgene);Acc:5848011]
同一个蛋白在UniProt里的序列名称得到了极大的精简:
>tr|A9XBD9|A9XBD9_MELGA NADH-ubiquinone oxidoreductase chain 1 OS=Meleagris gallopavo OX=9103 GN=ND1 PE=3 SV=1
蛋白序列号替换为UniProt专属格式,并且主要保留了蛋白名描述和编码基因信息,其他和基因组相关信息均被移除。
你可能会留意到除了常见信息外(下一节详细解释),最后还有两个PE=3和SV=1的标注。
其中SV是sequence version的标识,UniProt数据库定期更新,一旦该蛋白有序列更改,SV数字即+1,比如P02768 · ALBU_HUMAN这个目前最常见的蛋白,它的SV=2,https://beta.uniprot.org/uniprotkb/P02768/history 可以看到1990年六月1日的版本更新中,序列做了如下更改,K替换为了E
PE,即Protein Existence,为蛋白序列来源的标注。从1-5依次为:
1. Experimental evidence at protein level 表明有明确的实验证据证明蛋白质的存在。这些标准包括部分或完整的埃德曼测序,通过质谱法清晰识别,X射线或NMR结构,高质量的蛋白质 - 蛋白质相互作用或通过抗体检测蛋白质。
2. Experimental evidence at transcript level 表明蛋白质的存在尚未得到严格证明,但表达数据(例如cDNA的存在,RT-PCR或Northern印迹)表明存在转录本。
3. Protein inferred from homology 表明蛋白质的存在是可能的,因为明显的同源物存在于密切相关的物种中。
4. Protein predicted 用于在蛋白质、转录本或同源性水平上没有证据的条目。
5. Protein uncertain 表示蛋白质的存在不确定。
对于从INSDC-Enbembl引入的绝大多数蛋白质来说,PE为3或4。只有在进一步注释后才可能标注为1或2。需要注意的是,序列本身正确与否,UniProt并没有能力判断,UniProt只是一个数据收集的中心,蛋白序列准确性依赖于测序本身以及您的样品和所选择的物种的品系相近程度。相对来说PE=1或2的经过较多注释,准确性或者可能的序列变体会得到较多的注释。PE=3或4的一般是测序数据直接注释或者研究较少的物种。准确性应该也没啥问题。PE=5则不好判断到底可不可靠了。
UniProt序列的命名、信息分类
作为Fasta文件的标题起始,>后直接跟着的是数据库类别,即SwissProt(sp)或TrEBML(tr),下一篇推文具体介绍它俩的区别。然后是Accession,|后紧跟着Entry name,再接一个空格后是Protein Name,OS=标注了物种拉丁文名称,对应在UniProt Taxonomy中搜索。OX=是NCBI标准taxonomy的数字编号,是该物种唯一编号,NCBI和EBI通用。GN=基因名称。
Accession number,即A9XBD9这部分。是该蛋白序列在UniProt中的唯一ID,如同身份证号。需要注意,经过数据库更新,必然会有些蛋白被发现序列是多个蛋白融合或者应该被剪切成多个子蛋白。如果是前者,序列被拆分,则会被指定新的Accession并将原来的定义为次要Accession。如果是后者,多个序列被验证是同一来源时,会进行合并,保留主要Accession,其他作为次要ID;如下图的例子:
蛋白P29358,在2004年的时候经过版本更新被拆分蛋白P68260和P68251。拆分出来的新蛋白指定为全新accession,而原蛋白Accession不会被重新归属,标注为这两个蛋白的secondary accession,但不再被使用。
2. Entry,相当多的人会搞错它和Accession的区别。该值为助记符,协助使用者能够快速了解蛋白的类型和物种,该ID不固定,不唯一,版本迭代或进一步注释后会进行修改,所以不应该用来记录质谱分析结果。同源的蛋白也可能拥有同一个助记符。
比如版本最初的Entry Name叫做 A9XBD9_MELGA,而经过一系列迭代注释后可能就会被修改为更容易理解的ND1_MELGA。我们就能够快速知道该蛋白是ND1蛋白,其物种缩写是MELGA经过查询后就知道是火鸡。
3.Protein name, UniProt的蛋白质名称模块,不仅提供名称信息还包括有关蛋白质活性的信息,例如对酶的催化机制的精确描述,或有关其中包含的单个蛋白质链或功能结构域的信息(如果相关)。
在人工注释的SwissProt数据库中无法保证多个来源的注释成同一个名称,因此会标准多种名称信息如:
| 类别字段 | 子类别字段 | 基数 | 描述 |
|---|---|---|---|
| Recommended name | 1 | UniProt 推荐的全名。 | |
| Alternative name(s) | 2-, | 推荐名称(全名)的同义词。 | |
| Short name(s) | 2-, | 全名或首字母缩略词的缩写。 | |
| EC | 2-, | 酶编号。 | |
| Allergen | 0-1 | 过敏原命名。 | |
| Biotech | 0-1 | 在生物技术领域使用的名称。 | |
| CD_antigen | 2-, | 参见人类细胞分化分子命名法。 | |
| INN | 2-, | 国际非专利名称:作为全球公认的公共财产的药物物质或活性药物成分的通用名称。 |
而在自动注释的TrEMBL数据库中,会尽可能统一命名并遵循国际蛋白质命名指南,同时尽可能列出所有同义词名称。经常有老师问我:“你看这蛋白名字都是uncharacterized,靠谱么?” 这其实是UniProt的TrEMBL注释时较为严谨的操作,如果来源数据库没有进行Name注释,则先将名称定义为Uncharacterized,其后版本迭代时会进行进一步的名称注释,可能name就被赋予新的比较容易理解的名称了,但其序列并不会修改,也就是和我们最关注的,该蛋白的序列到底对不对没有关系,请放心食用。
4. Gene Name, 该分类包含四个不同的子类:'Name', 'Synonyms', 'Ordered locus names' 和 'ORF names'
Name:如果该物种有相关的命名委员会,则添加其相关名称“Official Gene Symbol”,如无,则添加其密切同源物种的同源基因名称;
Synonyms:同义词名称,来自于多种来源的基因命名尽可能详细列举;
Ordered Locus Names:OLN名称,用于按顺序为完全测序的基因组或染色体的每个预测基因分配标识符的命名系统。OLN通常基于表示生物体的前缀,后跟一个数字,该数字通常表示染色体上基因的顺序。依赖于基因组测序为核心,OLNs仅用于蛋白质编码基因,或者也用于假基因,以及tRNA编码基因等。如果两个预测的基因合并形成一个新基因,则指示两个OLNs,用斜杠分隔。
Open Read Frame:ORF名称,用于按字母顺序列出由排序项目临时归类于开放阅读框 (ORF) 的名称。此名称可以基于 cosmid 编号系统、大规模 cDNA 项目的克隆名称或任何其他类型的命名系统。示例:SYGP-ORF50、SpBC2F12.04、C06E1.1、CG10954。ORF名称不会跨物种传递。
https://www.uniprot.org/uniprotkb/A9XBD9/entry 以上信息均会在该蛋白的UniProt主页最上方展示,如下图。
再往下各个部分就是详细的注释页面了。我这边先做个简单总结。部分内容下章节展开。
| 类别 | 内容 |
| Sequence status | 指示蛋白质序列是否完整 |
| Sequence processing | 指示蛋白质的成熟形式是否通过前体的加工衍生出来 |
| Sequence | 经典蛋白质序列数据和所述蛋白质isoform列表 |
| Alternative products | 描述从同一基因产生的不同蛋白质 |
| Computationally mapped potential isoform sequences | 真核参考蛋白质组序列的以基因为中心的计算预测的isoform |
| Sequence caution | 有关与蛋白质序列相关的可能错误的警告 |
| RNA editing | 描述由于RNA编辑引起的氨基酸变化 |
| Mass spectrometry | 来自质谱实验的信息 |
| Polymorphism | 多态性的描述 |
| Natural variant | 记录的蛋白质的天然变异 |
| Alternative sequence | 产生替代蛋白质亚型的氨基酸变化 |
| Sequence uncertainty | 序列中的不确定区域 |
| Sequence conflict | 描述未知来源的序列差异 |
| Non-adjacent residues | 指示序列中的两个残基不是连续的 |
| Non-terminal residue | 序列不完整。表明残基不是完整蛋白质的末端残基 |
| Non-standard residue | 蛋白质序列中非标准氨基酸(硒代半胱氨酸和吡咯烷)的发生 |
| Sequence databases | UniProtKB 以外的序列数据库的交叉引用 |
| Genome annotation databases | UniProtKB 以外的基因组注释数据库的交叉引用 |
| Genetic variation databases | UniProtKB 以外的基因水平变异数据库的交叉引用 |
| Keywords 'Coding sequence diversity' | 条目内容采用规范化的语法进行总结的信息 |
总结
作为UniProt的核心功能,序列信息收集整理是其最大优点,本章节中,我们为您解释了序列的来源,如何收集整理入UniProtKB。Uncharacterized名称的由来。以及蛋白名称fasta header中各个部分的解释。
如果您对本章节介绍还有疑问,可以后台向我们提问或者继续关注我们。
下一篇,我们将为您带来质谱分析中最常用的数据库选择和下载部分,也是广大质谱实验相关老师最容易出错的部分。
UniProt的背景及其在蛋白质组学研究中的重要角色
UniProt蛋白质序列数据的来源及其组成信息
UniProt深度解读-p2.3:UniProt蛋白质序列分类及Proteome数据库
UniProt蛋白质序列功能注释的过程
UniProt的使用基本操作
上海易算生物科技有限公司
转载请注明出处
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com