序列层
氨基酸字母决定理论酶切肽段、可变修饰位置和候选碎片离子。
Sequence database technology
蛋白 FASTA 是质谱搜库的候选序列载体,Proteome 是与物种及基因组组装关联的蛋白集合,UniProt 则负责把序列、注释、证据和版本组织为可检索资源。项目结果是否可靠,取决于这三层是否被正确连接。
Sequence carrier
FASTA 用一行以 > 开头的描述信息加若干行氨基酸序列表示蛋白。相同格式的文件可能来自人工审校数据库、基因组自动注释、转录组翻译、宏基因组组装或研究者自定义序列,其证据强度不能只凭扩展名判断。
>sp|P04637|P53_HUMAN Cellular tumor antigen p53 OS=Homo sapiens OX=9606 GN=TP53 PE=1 SV=4
P04637 是 accession,Homo sapiens / 9606 锁定物种,TP53 是基因名;sp 表示记录来自 Swiss-Prot 审校部分。
氨基酸字母决定理论酶切肽段、可变修饰位置和候选碎片离子。
accession、Taxon ID 和 Proteome ID 负责让结果能够回到稳定记录与版本。
基因名、蛋白名称、证据等级和 isoform 信息用于蛋白归组与结果解释。
Database history
蛋白序列数据库的发展由人工维护的小型条目集,逐步转向自动翻译、版本化整合和面向完整基因组的 Proteome 组织。数据库规模扩张提高了覆盖范围,也让冗余、错误传播和候选空间控制成为搜库必须面对的问题。
序列相似性搜索工具推动了简洁文本序列格式的广泛使用。
以人工审校、低冗余和交叉引用为核心的蛋白序列知识库建立。
核酸数据库 CDS 自动翻译补充 Swiss-Prot,覆盖快速增长的序列。
Swiss-Prot、TrEMBL 与 PIR 资源整合为统一的蛋白信息体系。
UniProtKB、UniRef、UniParc 与 Proteomes 逐步形成统一访问入口。
以蛋白空间覆盖、聚类和人工复核重构参考集合选择逻辑。
人工审校、低冗余,适合需要稳定名称和功能注释的结果解释。
自动注释、覆盖广,适合新物种和大规模基因组快速进入数据库。
前者追踪唯一序列历史,后者按相似性聚类,均不能直接替代具体项目的物种 Proteome。
Proteome construction
UniProt Proteome 通常对应一个基因组组装的蛋白编码序列集合,也可能包含质粒和细胞器编码蛋白。UPID 指向特定组装,因此同一物种可以存在多个 Proteome;菌株、品系、组装质量和注释管线不同,候选蛋白也会不同。
染色体、contig、质粒与细胞器序列构成注释底座。
整合开放阅读框、剪接模型、RNA 证据和同源证据。
编码区转为氨基酸序列,并处理起止密码子与异常模型。
自动进入 TrEMBL;部分记录经人工审校进入 Swiss-Prot。
按 UPID、组装、Taxon、完整度与 reference status 发布。
候选 Proteome 先经过质量标准,再用 MMseqs2 聚类蛋白,比较同物种集合共享的蛋白簇,并在覆盖蛋白空间与控制参考数量之间平衡。
病毒分类与参考选择遵循 ICTV Virus Metadata Resource 等分类资源,不能直接套用细胞生物的组装筛选逻辑。
优先选择与实验材料的物种、菌株、品系和组装一致的 Proteome;只有在没有直接资源时,才明确记录近缘替代或自建翻译库。
Search-space engineering
DDA 与 DIA 搜库都需要把实验谱图与理论候选进行比较。FASTA 越大并不必然越好:候选空间扩大会增加同分肽段、蛋白归组歧义和多重检验负担;缺少真实序列则会造成结构性漏检。
物种、组织、病原体、宿主和表达系统。
核对 UPID、Taxon、assembly、release 与参考状态。
根据研究问题与归组策略选择 canonical 或 canonical + isoform。
污染物、转基因、抗体、病毒、变异或自建 ORF 分开标注。
检查 header、重复、异常字符、长度、校验值与生成参数。
候选肽段与实验 MS/MS 的匹配依赖 FASTA、酶切规则、修饰和质量容差。缺失真实序列时,再高质量的谱图也无法得到正确肽段。
library-based、directDIA 或预测谱库都要定义候选序列来源。预测谱图和 RT 可以提高打分能力,但不能修复物种或组装选择错误。
结构蛋白质组需要把 LiP 肽段、常规胰蛋白酶肽段和蛋白坐标映射回同一序列。版本变化会直接影响切割位点、肽段归属和候选排序。
Local workflow
本地 UniProt Browser 把 Proteome、Taxonomy、中文物种名、FASTA 文件、条目详情与序列分析放在同一条路径中。中文名用于帮助检索,Taxon ID、UPID、accession 与 release 仍是结果复核的稳定依据。
用中文名、英文俗名、拉丁名、Taxon ID 或 UPID 检索,多个结果时按组装与序列数量选择。
浏览 UniProtKB 条目、canonical 与 isoform 文件,下载时保持 exact 与近似结果分开。
从条目详情直接载入序列,执行理化性质、酶切、Motif、肽段匹配和最多 10 条蛋白的比对。