ΩOmicSolution蛋白质组学技术平台

Sequence database technology

Proteome 与 FASTA 技术

蛋白 FASTA 是质谱搜库的候选序列载体,Proteome 是与物种及基因组组装关联的蛋白集合,UniProt 则负责把序列、注释、证据和版本组织为可检索资源。项目结果是否可靠,取决于这三层是否被正确连接。

序列来源数据库沿革Proteome 构建搜库 FASTA
从基因组、转录本和蛋白证据生成蛋白 FASTA 的来源关系

Sequence carrier

FASTA 是序列格式,不是数据库来源

FASTA 用一行以 > 开头的描述信息加若干行氨基酸序列表示蛋白。相同格式的文件可能来自人工审校数据库、基因组自动注释、转录组翻译、宏基因组组装或研究者自定义序列,其证据强度不能只凭扩展名判断。

项目判断:先确认序列来自哪个物种、哪个组装版本、哪个 release,再决定是否加入搜库。文件能够被软件读取,不等于候选空间适合当前样本。
UniProtKB FASTA header 字段结构示意
UniProtKB header 通常包含库类型、accession、entry name、蛋白名称、物种、Taxon ID、基因名与蛋白证据等级。下游软件对字段解析能力不同,导入前应保留原始文件与来源记录。

一条可追溯的 UniProtKB 记录

>sp|P04637|P53_HUMAN Cellular tumor antigen p53 OS=Homo sapiens OX=9606 GN=TP53 PE=1 SV=4

P04637 是 accession,Homo sapiens / 9606 锁定物种,TP53 是基因名;sp 表示记录来自 Swiss-Prot 审校部分。

序列层

氨基酸字母决定理论酶切肽段、可变修饰位置和候选碎片离子。

标识层

accession、Taxon ID 和 Proteome ID 负责让结果能够回到稳定记录与版本。

注释层

基因名、蛋白名称、证据等级和 isoform 信息用于蛋白归组与结果解释。