相信近年来发表过蛋白质组学文章的同仁们应该对contaminants.fasta这个文件耳熟能详了,你不用,等你文章审稿的时候早晚也得被逼着补充分析。
现在好多软件和实验室都默认采用Cox的Maxquant提供的该文件进行污染物评价,该数据库包含246个他们整理的污染物蛋白。其内容主要涵盖实验室常用酶,标准蛋白以及人、鼠、猩猩的皮毛角蛋白和牛血清培养基中的高丰度蛋白等。
其中大部分蛋白来自于Uniprot,其余来自于Ensembl或Refseq。经过多年使用后笔者发现,相当一部分蛋白序列都已经在这些数据库中经过完善更新,有的短序列被发现是另一个成熟蛋白的一部分,有的已经删除。同时光看ID,譬如>ENSEMBL:ENSBTAP00000023055 (Bos taurus) 68 kDa protein 你也只能知道是牛源蛋白却不清楚其具体污染蛋白是什么。
有时候我们想要具体查下搜到的污染蛋白是什么,就会遇到:
为了方便广大用户使用和快速分别污染物来源,我们对该文件进行了如下更新:
原本来自于Uniprot的蛋白全部按照2021年最新版本序列进行更新;
原本没有基因名称注释的蛋白全部按照常用名称进行补充注释,注释规则如:GN=trypsin,GN=igglike 我们将补充注释的名字全部小写标注以便区分其名称来源于我司修改还是官方标准命名;
多个蛋白片段注释到同一个完整蛋白的进行合并;
原蛋白为明确标注物种的,均通过Blast确认后标注物种来源,如>Streptavidin (S.avidinii)
标注为:>sp|P22629|SAV_STRAV Streptavidin OS=Streptomyces avidinii OX=1895 PE=1 SV=1
加入质控标肽iRT,>Biognosys|iRT-Kit_WR_fusion|BiognosysIRT 11 tryptic iRT peptide OS=artificial OX=0 GN=irt PE=1 SV=2
大量来自于Refseq的蛋白ID均已无法使用,如
为方便使用,我们均通过blast比对到Uniprot相应基因序列或合并到同源成熟蛋白ID,方便用户使用。
我们将在后续开放给易算用户的QC分析功能中对污染物进行自动标注,方便大家使用。
点击最下方原文链接即可下载更新后的contaminants文件(建议电脑打开)。我们尽可能保证和原文件信息相似,故没有添加额外污染蛋白序列。同时在Spectronaut中,您直接导入该文件,默认Uniprot模板即可完美识别。
如果还有进一步问题,就直接和我们联系吧!
祝您变得更强!