从事蛋白质组学研究的各位专家应该日常都严重依赖于UniProt带来的无比便利。但你到底对UniProt了解有多深入呢?
如果您也有如下的问题,那么本系列可以对你有所帮助:
我在NCBI里也可以找到想要的蛋白序列,为啥用UniProt?现在新的测序物种那么多,UniProt来得及收集么?
TrEMBL库里的序列准确性不如SwissProt,我搜库是不是主要用SwissProt?这样的话我下载human数据库到底是2W,还是9W,还是20W还是多少条?
我平时查搜到的蛋白的理化性质、参考文献、相关疾病、功能域都要找NCBI文献或者各种第三方网站,好麻烦啊。

| 沈诚频 易算生物CEO 本文撰写人 具有丰富的蛋白质组学各类经验 |
UniProt相关解读将分为以下三个部分和一次在线培训,欢迎有兴趣的老师同学点赞追踪。
UniProt的背景及其在蛋白质组学研究中的重要角色
UniProt蛋白质序列数据的来源及其组成信息
UniProt蛋白质序列功能注释的过程
UniProt的使用基本操作
本文包含的内容简列如下:
蛋白质组学研究中UniProt及其相关数据库的角色
蛋白质组学相关数据库之间的关系
EMBL-EBI蛋白质组学数据库之间的关系
UniProt一览
免责声明
由于本人非UniProt相关技术人员,相关资料均来自于网络收集,难免出错敬请谅解。所有参考资料来自于EMBL下属各个网站及其培训网站所下载的视频和文档。
蛋白质组学研究中UniProt及其相关数据库的角色


借用我们产品资料中的一个流程图,从蛋白质组学0基础到培训一个能够独立从样品制备到数据分析的“技术人员”也许只需要1个多月时间。但知其然却不一定知其所以然。我们这回就把潜藏着背后的庞然大物UniProt在整个分析流程中的作用和背景给翻出来好好讲讲。包括Fasta Selection,Annotation Database的背景知识。
UniProt的第一大优势是:提供了目前几乎最全的蛋白质/蛋白质组的成熟序列及其各种形式的变体,序列名称,序列结构特征,功能特征,细胞定位,生化反应,疾病关联,修饰,通路,相互作用等信息,同时提供了序列比对、提取等工具。乍一看你是不是会觉得好像有些数据库也有这些信息?那么它第二大优势就是:数据库更新极快,网站美观易用,和第三方信息对接更新及时。也就是说如果理论上某些信息UniProt应该收集而你没搜到,那么其他公共数据库里搜到的可能性就不大了。
蛋白质组学相关数据库之间的关系


上图是个人总结的蛋白质组数据分析时可能用到的数据库关系网和各自的归属地。很遗憾,我们国内虽然21世纪初就开始入局蛋白质组学,但至今为止并没有一个有国际影响力的重要数据库,仅有的iProX也只是服务于国内的数据共享,并没有国际影响力。可以看出,EMBL-EBI这个神秘组织好像能量很大啊。为啥感觉平时做蛋白质组和他们没啥关系呢?似乎NCBI这个名字更加如雷贯耳啊。我个人认为,这和EMBL和NIH的组织架构不同关系比较大。
EMBL-EBI蛋白质组学数据库之间的关系


可以类比于欧盟和美国的差别。上图是EBI蛋白质组相关的组织架构和目标,EBI的各个数据库和软件很多都有各自独立的网站,风格和使用方式也不太相同,而数据库互相之间相对独立运行,所以你要说一盘散沙不为过。但相对于NCBI这样一个大杂烩,专注于蛋白质的UniProt反而是对我们很友好的一个工具。从EBI和蛋白质组相关的组织机构看到他们在蛋白质分析上布局非常全面,从上游对接测序数据,到下游注释和质谱数据收集,相对应的美国和日本以及我国均没有可以对应的布局策略。
另外就是从网站的界面来看:

KEGG的主页,你平时会经常用哪些部分呢?

NCBI首页,如果你做蛋白质组学,你准备怎么上手呢?
UniProt一览


UniProt主页,是不是顺眼多了?
UniProt 数据库包括 UniProt 知识库 (UniProtKB)、收集拥有完整蛋白质组序列信息和注释的物种数据库(Proteome)、UniProt Reference Clusters (UniRef) 和 UniProt Archive (UniParc),见上图下半部分四个模块。

上图,UniProt数据库内部模块间的关系
UniProt的数据收集、公开流程非常透明且易懂,如上图,从各个第三方收集来的测序数据库首先进入UniParc作为仓库,包括往年淘汰、替换下来的历史信息均能轻松追溯。然后序列进入UniProtKB进行注释,首先通过自动计算进行序列命名、特征注释、功能注释,第三方数据库对接等处理后放入TrEMBL数据库,再通过专业工作人员人工注释比较重要的蛋白质,对信息进行梳理和完善放入SwissProt数据库。得到目前近2.3亿条整理后可以非常容易查询、下载、可视化的UniProtKB数据库。另外专门对蛋白质序列进行同源比对,得到序列相似的蛋白质集合放入UniRef数据库,方便今后进一步的序列跨物种注释和查找。最后将蛋白质信息相对完整的各个物种再进行整合,得到Proteome数据库,物种对应全蛋白质组数据库,通过专家人工校验无误的则标注为Reference Proteome数据库。
总结
作为入门章节的一个小小总结,我说下我对UniProt及EBI的小小看法:
优点:每个分支数据库都做的非常专业,尤其对于蛋白质组学研究者来说非常友好,可能需要用到的信息多数几乎放到你手边,点几下鼠标就能获取了;
缺点:数据库之间ID互相独立,如下图,EBI的下属机构用的ID格式,网站风格,操作方式各不相同,互相之间的数据对接虽然有这样的mapping页面,但实操起来的确费劲,对入门者比较容易管中窥豹,难以梳理出全面认知。

如果您对本章节介绍还有疑问,可以后台向我们提问或者继续关注我们。
下一篇,我们将为您带来:
UniProt的背景及其在蛋白质组学研究中的重要角色
UniProt蛋白质序列数据的来源及其组成信息
UniProt蛋白质序列功能注释的过程
UniProt的使用基本操作
上海易算生物科技有限公司
转载请注明出处
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com
