做质谱分析的人,几乎都绕不开一个问题:
在 UniProt 里到底该选哪个 FASTA?
Swiss-Prot、TrEMBL、Reference Proteome、Isoform……每次打开下载页面,那一长串选项足以让人犹豫。选小了怕遗漏新序列,选大了又担心假阳性暴增。
2025 年的今天,UniProt 数据库规模、注释深度和版本结构都在变化。易算团队基于 UniProt 2025 最新版本以及多篇高质量蛋白质组学文献,整理了一套更贴近实操的选库思路。
Swiss-Prot 由专家手工整理蛋白质记录,每条记录包含大量实验和文献信息,如功能、催化活性、亚细胞定位、疾病关联和翻译后修饰等。UniProt 手册指出,PE(Protein Existence)行标注了蛋白存在的证据等级,从 证据在蛋白质水平(PE=1)到 存在性不确定(PE=5)。
值得注意的是 PE 反映的是存在证据强弱,而非序列准确性。例如 PE=1 表示有直接实验证据,如蛋白纯化、X射线或质谱。由于人工注释耗时,Swiss-Prot 收录速度较慢,但条目质量高,适合关注功能注释的研究。
TrEMBL 收录等待人工注释的蛋白序列,大量来源于 EMBL/GenBank/DDBJ 等核酸数据库的翻译产物。TrEMBL 条目通过 HAMAP、RuleBase 等规则自动注释,包含许多预测蛋白或同源推断的序列。
随着人工注释推进,一部分 TrEMBL 条目会转入 Swiss-Prot。TrEMBL 的优点是覆盖面广,尤其在非模式物种中提供大量序列。
如果研究目标是发现新的肽段或未知蛋白质,TrEMBL 可以提供更丰富的搜索空间;但其注释质量不如 Swiss-Prot,需要后续人工验证、或者你也可以用自己的生信方法找到其可能的注释.
接下来我要说隐藏在FASTA的表头的信息。
PE 值用于说明支持蛋白存在的证据类型:
PE=1 (Evidence at protein level) – 有强的蛋白质实验证据(例如蛋白纯化、X射线结构或质谱)。
PE=2 (Evidence at transcript level) – 有转录本证据但缺乏直接蛋白证据。
PE=3 (Protein inferred from homology) – 依据亲缘物种同源蛋白推断存在。
PE=4 (Protein predicted) – 基因预测得到的蛋白,没有实验或同源证据。
PE=5 (Protein uncertain) – 存在性存疑,可能是伪基因或错误注释。
SV (Sequence Version) 表示某条目序列的版本号。当 UniProt 更新某条目的蛋白质序列时,SV 值会递增;如果只修改注释信息,SV 保持不变。这一字段有助于追踪序列修订
。例如某抗体轻链条目自 1986 年收录起 SV=1,之后多次更新注释但未修改序列,因而 SV 仍为 1。另一方面,当发现序列错误或有新研究证据时,SV 会递增。
UniProt 提供多种 FASTA 库,主要包括:
Swiss-Prot 库 (SP) – 仅包含手工注释条目,注释质量高但数量相对有限。
Reference Proteome (UP) – 遵循“一基因→一蛋白”原则,为每个编码基因提供一个代表性序列,是许多蛋白质组学研究的默认选择。
UP + Isoform(含同种异构体) – 在 Reference Proteome 基础上加入 canonical 序列的所有可变剪接异构体,适用于关注剪接变体的研究。
全 TrEMBL + isoform – 包含 TrEMBL 全部条目及 isoform 的最大数据库,覆盖面最广但冗余度高,适合特殊需求。
截至2025 年 6 月的 UniProtKB/Swiss-Prot 发布版本包含 573,661 条序列。其中20.7 % 的条目具有 PE=1 证据,9.5 % PE=2,67.3 % PE=3,2.2 % PE=4,0.3 % PE=5。
最具代表性的物种条目数为:
人类(Homo sapiens):20,420 条。小鼠(Mus musculus):17,240 条。拟南芥(Arabidopsis thaliana):16,397 条。
这些数字表明 Swiss-Prot 在人类中的覆盖率非常高,但在小鼠和拟南芥中仍有较大缺口。
基因组注释项目 GENCODE 提供了最新的蛋白编码基因及转录本数目:
包含 19,433 个蛋白编码基因(不含 664 个 readthrough 基因)和 211,446 个蛋白编码转录本,拥有 129,801 个不同的蛋白翻译序列。约 15,498 个基因具有超过一个翻译异构体。
具体链接:
https://www.gencodegenes.org/human/stats_49.html
包含 21,530 个蛋白编码基因(不含 230 个 readthrough 基因)和 58,647 个蛋白编码转录本。共有 44,974 个不同蛋白翻译序列,约 10,853 个基因有多个翻译异构体。
具体链接:
https://www.gencodegenes.org/mouse/stats_M38.html
根据 KEGG Genome 数据,拟南芥基因组中有 27,562 个蛋白编码基因。
具体链接:
https://www.kegg.jp/kegg-bin/show_organism?org=ath
这些数字反映了物种基因组的复杂性和 isoform 多样性。值得注意的是,长读长 RNA 测序等研究表明人类基因可能产生超过 300,000 种蛋白 isoform:
Miller, R.M., Jordan, B.T., Mehlferber, M.M. et al. Enhanced protein isoform characterization through long-read proteogenomics.
Genome Biol 23, 69 (2022).
https://doi.org/10.1186/s13059-022-02624-y
然而截至2025 年的注释仍只确认 ~130,000 个翻译 isoform,需要通过长期研究持续挖掘。
EMBL-EBI 为 UniProt Reference Proteomes 发布了一套“主 FASTA”和“额外 isoform FASTA”文件,其规模反映了不同物种的数据库大小。
在2024_02 版本的统计中:
https://ftp.ebi.ac.uk/pub/databases/reference_proteomes/QfO/STATS
主 FASTA 的条目数与基因数接近,而 isoform 文件显著扩大了搜索空间。例如人类 isoform FASTA 包含约 84k 条序列,与 130k GENCODE distinct translations 仍有差距;这种差异来源于 UniProt 选取的是主要 isoform 和经证实的剪接变体,而 GENCODE 注释更全面。
下表汇总了主要模式物种中 Swiss-Prot 与 Reference Proteome 对基因组覆盖率的比较(2025 年数据):
可见,人类 Swiss-Prot 覆盖度接近 100 %,适合作为主数据库;
小鼠和拟南芥的 Swiss-Prot 覆盖率明显较低,在植物和部分模型动物研究中使用 Reference Proteome 或 UP + isoform 更合适。
许多 TrEMBL 条目以 “Uncharacterized protein” 或类似名称出现,这并不意味着序列不可靠或没有表达。它们往往只是缺乏人工注释。PE 值较高的未表征蛋白可能对应重要功能。这些序列通过同源比对和 GO 富集分析,其中大多数可赋予具体名称或功能。随着 UniProt 持续更新,这些序列会逐渐被手工注释。建议对未表征条目进行以下处理:
使用比对等工具进行同源注释。通过比对亲缘物种的已知蛋白,推断其功能或结构。
结合转录组或蛋白质组实验验证,确定其在特定组织或条件下的表达情况。
关注 UniProt 更新,及时替换旧版 FASTA 中的未表征序列。
UniProt 持续修正蛋白序列和功能注释。定期更新 FASTA 数据库可避免使用错误的序列或错过重要修订。
例如,人类 IQANK1 蛋白(UniProt ID: A8MXQ7)曾在 2020 年的更新中将名称由 “Putative IQ motif and ankyrin repeat domain-containing protein” 修订为 “IQ motif and ankyrin repeat domain-containing protein 1”,同时 PE 等级从 5 降至 4,SV 版本升至 3。早期版本中使用旧名称或序列可能导致肽段错配或漏检。
因此建议:
每 3 – 6 个月检查一次 UniProt 更新,尤其在研究周期较长或使用人类样本的项目中。
关注 SV 值的变化,如果序列版本增加,及时下载最新版并重新检索。
记录所用数据库版本(包括 UniProt 版本号、下载日期和库类型)。这有助于结果复现和比较。
如果关注已知功能和高质量注释,可选择 Swiss-Prot 或 Reference Proteome 主 FASTA。
如果希望最大覆盖所有基因并考虑剪接变体,使用 UP + isoform。
若需要发掘新蛋白或特殊片段,可加入 TrEMBL 条目,但需注意假阳性和冗余。
PE=1 – 3 的条目存在一定实验或同源证据,可使用;PE=4 – 5 的条目仍可纳入探索性分析。
SV 值提示序列是否更新。当 SV 增加时应下载新版 FASTA。
在 UniProt proteome 页面搜索目标物种,优先选择标记为 reference proteome 的数据集。
若某菌株或植物种无法在 UniProt 找到完整 proteome,可在 NCBI、JGI 等数据库寻找基因组序列,并自行翻译生成 FASTA;或者使用亲缘物种 proteome 进行临时分析,并在同源注释中加以区分。
建议每隔数个月检查 UniProt 更新,特别是当研究涉及的蛋白质可能存在新发现或修正时。
在文章或实验记录中注明所使用的 UniProt 版本、下载日期和库类型,方便同行复现。
初始分析可采用 Reference Proteome 主 FASTA,以减少搜索空间。
如果有已知的多剪接基因或关注特定异构体,可针对这些基因补充 isoform 库,而不必全局加入所有 isoform。
Q1 : 使用 Swiss-Prot 是否足够?
A : 对于人类样本,Swiss-Prot 覆盖率接近基因组数量, 可满足多数研究需求。对于小鼠、拟南芥等模式生物,Swiss-Prot 覆盖率分别约 80 % 和 60 %,无法覆盖所有编码基因,因此建议使用 Reference Proteome 或 UP + isoform。
Q2 : PE=4 – 5 的条目是否应该剔除?
A : PE 等级反映存在证据强度,而非序列可靠性。PE=4 – 5 的蛋白往往是预测或存在不确定性,但在特定组织中可能真实表达。根据研究目的决定是否纳入;若只关注高可信度蛋白,可在软件中设置过滤;若探索新蛋白则不必排除。
Q3 : SV=1 的序列是否“不可靠”?
A : 不一定。SV=1 仅说明该序列自收录以来未修改过,可能是正确也可能尚未发现问题。应关注 SV 是否在最近更新中改变,如果 SV 增加说明序列发生了修订,需要更新数据库。
Q4 : 是否必须包含 isoform?
A : 是否加入 isoform 取决于研究目标。包含 isoform 会显著增加搜索空间并提高假发现率,但对于研究剪接变体、组织特异性蛋白质组或新异构体的项目非常重要。常规定量可以先使用 Reference Proteome 主 FASTA,再针对感兴趣的基因补充 isoform。
Q5 : 我研究的细菌菌株没有相应 proteome,怎么办?
A : UniProt 对部分菌株更新较慢。可以在 NCBI 或 JGI 等数据库查找该菌株的基因组序列,并使用翻译工具生成自定义 FASTA;或选择同一物种较近的参考菌株,结合同源注释修正差异。这一过程需谨慎标注,以便后续更新时替换为官方数据库。
延申阅读
可以详细和我们聊一聊你的思路和样本