很多人对Uniprot中数据库的选择存在误区,我们早已就Uniprot的背景、使用等做过培训,但发现很难纠正用户平时的使用习惯,因此今天我们直接做直观的对比测试,为大家抛砖引玉,希望大家未来不用再出现FASTA的选择困难症。
Swissprot还是Trembl
首先我们看下官方的定义Swissprot: Records with information extracted from literature and curator-evaluated computational analysis.
Trembl(也可以近似认为是swissprot之外的Uniprot序列):Records that await full manual annotation.
这里的关键字就是Annotation,在Uniprot中Annotation做什么事情呢?我们再来看下官方说明:
可以看到swissprot的人工注释主要添加的是各类文献引用、isoform、功能、通路、相互作用、修饰等信息,并不主要对序列是否正确进行检查。当然有人会说:如果蛋白没有注释,那对我来说也没有价值啊。这个见仁见智,第一:现在没有注释,不代表它完全未知,只是因为Uniprot暂时人手不足还没注释到它,不代表它不应该存在;第二:有些研究目的是找marker,那么该蛋白的功能可能并非是重要信息;第三:可以通过自行注释得到更准确的信息,如blast2go,kobas或者让易算帮忙。
Uniprot其实有个关键字隐藏在FASTA表头中,也就是我们经常忽略的SV和PE,SV:Sequence version,序列信息的版本,从1开始计算,我们不能说SV=1的序列一定不对,只能说SV=2相对于1进行了修正,当然我们只能认为修正应该大多数情况下是往更准确里修正了,数字越大说明该蛋白序列经过了更多次的修正。PE:Protein existence,www.uniprot.org/help/protein_existence, type of evidence that supports the existence of the protein. Note that the 'protein existence' evidence does not give information on the accuracy or correctness of the sequence(s) displayed。该条目只能说明我们对该蛋白目前的认知程度。
同时,我们需要注意的是并不是序列来源于Swissprot就可靠性更高,认知程度就一定更详细。比如我们提取了人、小鼠、拟南芥的swissprot和uniprot proteome的数据库统计了PE不同层级相应蛋白数量的分布情况
PE LEVEL | 说明 | Sp homo sapiens | Sp Mus musculus | Sp ARATH | UP ARATH |
1 | Experimental evidence at protein level | 16358 | 12739 | 7219 | 12652 |
2 | Experimental evidence at transcript level | 2522 | 3869 | 6540 | 8287 |
3 | Protein inferred from homology | 757 | 372 | 1594 | 2032 |
4 | Protein predicted | 141 | 67 | 485 | 4379 |
5 | Protein uncertain | 601 | 9 | 118 | 118 |
总数 | 库中序列数 | 20391 | 17064 | 15956 | 27469 |
已知编码基因数(估计) | 20500 | 23000 | 27000 | 27000 |
对比发现,除了人的SP库相对能够覆盖绝大部分编码基因外(此处不完全准确,SP并非一定和基因一对一),小鼠和拟南芥这样的模式生物SP库也只能覆盖一部分基因组,而UP(uniprot proteome,One protein one gene库)才能够最大限度的覆盖已知基因编码蛋白序列,同时PE=1的序列也不都是归类为SP的。而在SP库中,其实人蛋白序列也还有601个是uncertain的,但这并不影响它们是可以注释的。
我们统计下近期Matthias Mann的几篇组学文献,看看他用的库如何呢?
1. Mann DIAPASEF 2020, Hela, swissprot human, 20,402 entries(未告知时间)
2. Mann SKIN Atlas 2020, human UniProtKB database (October 2017) 未告知数量和版本,经过分析结果的SNE文件发现为UP 21007 entries+ UP 72792 entries联用。
3. Mann 脑脊液DIA 2020, UniProt reference proteome of canonical and isoform sequences with 93,786 entries downloaded in March 2018
4. Mann 100种物种蛋白质组 Nature 2020,Uniprot all 169789 entries.
5. Mann Urine DIA 2020, SwissProt reference proteome of canonical and isoform sequences with 42,431 entries downloaded in July 2019
Mann的文献在选择数据库的时候并没有做太多解释,但我们可以发现不同文献库的选择各自不同,行文描述也差别巨大,我也只能说哪位学生写的可能就用了自己习惯的库了吧。
那到底Mann的选择是不是最优的呢?
我们用Matthias Mann的Skin Atlas数据中规模最大的Fibroblast数据重新检索对比,观察不同数据库的影响。搜库采用Spectromine最新201125版本,PSM,Peptide,PG 三重1%FDR质控。UP为human One protein on gene 序列库,其中包含20305个swissprot蛋白和304个trembl蛋白,基本包含了所有已知人基因编码序列蛋白。Additional库详细信息从 www.uniprot.org/help/human_proteome 了解,主要是经典人编码序列的各种isoform。Trembl+isoform为Uniprot中人序列的最大数据库,额外包含了大量fragment蛋白序列,无法正确归属编码基因的序列以及大量免疫球蛋白序列。
UP | UP+Additional | Trembl+isoform | |
库中蛋白数 | 20609 | 20609+77157 | 216226(包含前两个) |
Mann文献PG | ~10200 | ||
SpectroMine PG | 10138 | 10762 | 11117 |
PSM | 837808 | 836481 | 833367 |
Peptides | 168538 | 169916 | 170098 |
Gene | 10137 | 10137 | 10137 |
采用规模为UP4倍,10倍序列数量的库对鉴定谱图数的提升没有帮助,但的确能够略微发现一些不同的肽段和新的蛋白,但比例非常低。到了最终进行功能分析的层面,没有任何额外基因(有约30个额外蛋白无已知编码基因信息)。
Uncharacterized是不是不可靠?
另一个大家比较纠结的问题就是不少Uniprot蛋白名称就写了个Uncharacterized protein
比如大熊猫的某蛋白2019年的时候名称如下
tr|G1L0C2|G1L0C2_AILME Uncharacterized protein (Fragment) OS=Ailuropoda melanoleuca (Giant panda) OX=9646 PE=4 SV=1
那就算我实验检测到该蛋白,也无法说明它是啥,那是不是这个库很没用呢?
非也,这只能说明Uniprot库中2亿种蛋白,他们没有足够的精力全去注释一遍。
易算提供的注释服务在2019年同期重新注释如下:
tr|G1L0C2|G1L0C2_AILME dynein heavy chain 9, axonemal|dynein complex microtubule motor activity ATP binding
而在2020年9月时,该蛋白Uniprot库中更新注释如下
tr|G1L0C2|G1L0C2_AILME DHC_N1 domain-containing protein OS=Ailuropoda melanoleuca OX=9646 PE=4 SV=1 ,同时对应的序列完全没有更改。因此Uniprot还来不及更新你关注的物种蛋白序列描述的时候,您可以我们帮忙哦。
2019年7月大熊猫部分蛋白序列名称,共有8700个蛋白标注为uncharacterized
2020年9月(uniprot 库2020年10月至今没有更新)大熊猫对应蛋白名称(序列完全没有修改),共有4100个蛋白标注为uncharacterized。所有序列均未作修改(当然不是说一定都是正确的,只是可能没有专人去做大熊猫序列修正)。
2019年7月版本的大熊猫数据库,仅还有86个蛋白无法注释到蛋白描述信息(当然我们只是通过同源比对的方法进行重新注释,无法保证一定正确哦)。
我做人的蛋白研究,是不是没必要经常更新?
我们对比human库,可以发现经过一段时间后部分蛋白序列进行了修正,如:
A8MXQ7|IQANK1蛋白在2020年2月时信息如下(均为swissprot库中蛋白)
sp|A8MXQ7|YH010_HUMAN Putative IQ motif and ankyrin repeat domain-containing protein LOC642574 OS=Homo sapiens (Human) OX=9606 GN=- PE=5 SV=2
2020年9月更改如下,SV(sequence version)从2升到3,PE从5升到4。
sp|A8MXQ7|IQAK1_HUMAN IQ motif and ankyrin repeat domain-containing protein 1 OS=Homo sapiens (Human) OX=9606 GN=IQANK1 PE=4 SV=3
而2个版本的序列alignment结果如下(202009在上,202002在下):
可以看到改动还是相当之大,因此,及时更新我们的数据库也是非常有必要的。
推荐优先选择哪个库呢?
我司内部测试人类样品数据用的最多的是UP-human One protein on gene 序列库,其中包含20305个swissprot蛋白和304个trembl蛋白,基本包含了所有已知人基因编码序列蛋白。
而其他大部分有已知proteome的物种,我们都推荐采用该数据库进行分析。
细菌比较特殊,经常找不到研究对象准确的strain信息,同一个物种不同strain的库可能有几百上千种,有时候怀疑用的库是否正确时也很难判断。这种情况下可以尝试
如果研究对象没有蛋白质组(https://www.uniprot.org/proteomes/ 检索不到),那么代表该研究对象很可能没有已知的完整测序数据库。可以在其他网站,如JGI (https://signon.jgi.doe.gov)或者NCBI上看看是否有比较完整的序列库。也可以在Uniprot中搜索物种信息https://www.uniprot.org/taxonomy
然后寻找比较同源的已知物种进行参考(不太推荐,差一点可能差非常多)。
阅读本文后如果还有疑问的话,那只能找我们单独沟通了,更加复杂的操作暂时就不在这边展开了。
易算为您提供
样品制备
Mann的首选,PreOmics iST与Spectronaut强强联手打造DIA最佳上下游方案
色谱分离
数据分析
质量评估
生信分析