---
title: "易算整理 | 2025 年了，面对 UniProt 的 FASTA 数据库，你还在纠结选哪个吗？"
author: "omicsolution.com"
account: "omicsolution.com"
published_at: "2025-10-07T11:23:09+08:00"
captured_at: "2026-08-26T17:59:01.073378+08:00"
source_url: "https://mp.weixin.qq.com/s/y-nshTfTCa7l0LM22q916w"
---

# 易算整理 | 2025 年了，面对 UniProt 的 FASTA 数据库，你还在纠结选哪个吗？
![图片 1](images/001.png)

点击蓝字 关注我们

![图片](images/002.webp)

---

![图片 3](images/003.png)

![图片 4](images/004.png)

![图片 5](images/005.png)

质谱蛋白组

解决方案

易算生物

![图片 6](images/006.png)

![图片 7](images/007.png)

做质谱分析的人，几乎都绕不开一个问题：

在 UniProt 里到底该选哪个 FASTA？

Swiss-Prot、TrEMBL、Reference Proteome、Isoform……每次打开下载页面，那一长串选项足以让人犹豫。选小了怕遗漏新序列，选大了又担心假阳性暴增。

2025 年的今天，UniProt 数据库规模、注释深度和版本结构都在变化。易算团队基于UniProt 2025 最新版本以及多篇高质量蛋白质组学文献，整理了一套更贴近实操的选库思路。

0 1

UniProtKB 的两大组成：Swiss-Prot 与 TrEMBL

Swiss-Prot：手工注释，高质量序列

Swiss-Prot 由专家手工整理蛋白质记录，每条记录包含大量实验和文献信息，如功能、催化活性、亚细胞定位、疾病关联和翻译后修饰等。UniProt 手册指出，PE（Protein Existence）行标注了蛋白存在的证据等级，从证据在蛋白质水平（PE=1）到存在性不确定（PE=5）。

值得注意的是PE 反映的是存在证据强弱，而非序列准确性。例如 PE=1 表示有直接实验证据，如蛋白纯化、X射线或质谱。由于人工注释耗时，Swiss-Prot 收录速度较慢，但条目质量高，适合关注功能注释的研究。

TrEMBL：自动注释，高覆盖度

TrEMBL 收录等待人工注释的蛋白序列，大量来源于 EMBL/GenBank/DDBJ 等核酸数据库的翻译产物。TrEMBL 条目通过 HAMAP、RuleBase 等规则自动注释，包含许多预测蛋白或同源推断的序列。

随着人工注释推进，一部分 TrEMBL 条目会转入 Swiss-Prot。TrEMBL 的优点是覆盖面广，尤其在非模式物种中提供大量序列。

如果研究目标是发现新的肽段或未知蛋白质，TrEMBL 可以提供更丰富的搜索空间；但其注释质量不如 Swiss-Prot，需要后续人工验证、或者你也可以用自己的生信方法找到其可能的注释.

接下来我要说隐藏在FASTA的表头的信息。

0 2

PE 与 SV：理解 FASTA 表头信息

PE – 蛋白存在证据等级

PE 值用于说明支持蛋白存在的证据类型：

PE=1 (Evidence at protein level)– 有强的蛋白质实验证据（例如蛋白纯化、X射线结构或质谱）。

PE=2 (Evidence at transcript level)– 有转录本证据但缺乏直接蛋白证据。

PE=3 (Protein inferred from homology)– 依据亲缘物种同源蛋白推断存在。

PE=4 (Protein predicted)– 基因预测得到的蛋白，没有实验或同源证据。

PE=5 (Protein uncertain)– 存在性存疑，可能是伪基因或错误注释。

PE 值并不等同于序列可靠性，高 PE 值的条目同样可能含有未修正的序列错误。因此，在数据分析时不应简单根据 PE 值剔除条目，而应结合研究目的与证据类型进行筛选。

![图片 8](images/008.gif)

SV – 序列版本

SV (Sequence Version) 表示某条目序列的版本号。当 UniProt 更新某条目的蛋白质序列时，SV 值会递增；如果只修改注释信息，SV 保持不变。这一字段有助于追踪序列修订

。例如某抗体轻链条目自 1986 年收录起 SV=1，之后多次更新注释但未修改序列，因而 SV 仍为 1。另一方面，当发现序列错误或有新研究证据时，SV 会递增。

选择数据库时应关注 SV 是否发生重大变更，在定期更新时保证使用的 FASTA 与最新版本一致。

0 3

参考蛋白组库与物种覆盖率

UniProt 提供多种 FASTA 库，主要包括：

Swiss-Prot 库 (SP)– 仅包含手工注释条目，注释质量高但数量相对有限。

Reference Proteome (UP)– 遵循“一基因→一蛋白”原则，为每个编码基因提供一个代表性序列，是许多蛋白质组学研究的默认选择。

UP + Isoform（含同种异构体）– 在 Reference Proteome 基础上加入 canonical 序列的所有可变剪接异构体，适用于关注剪接变体的研究。

全 TrEMBL + isoform– 包含 TrEMBL 全部条目及 isoform 的最大数据库，覆盖面最广但冗余度高，适合特殊需求。

![图片 9](images/009.png)

来看看2025统计覆盖率数据

3.1 UniProtKB/Swiss-Prot 2025_03 版本

截至2025 年 6 月的 UniProtKB/Swiss-Prot 发布版本包含573,661条序列。其中20.7 % 的条目具有 PE=1 证据，9.5 % PE=2，67.3 % PE=3，2.2 % PE=4，0.3 % PE=5。

![image.png](images/010.png)

最具代表性的物种条目数为：

人类(Homo sapiens)：20,420 条。小鼠(Mus musculus)：17,240 条。拟南芥(Arabidopsis thaliana)：16,397 条。

![image.png](images/011.png)

这些数字表明 Swiss-Prot 在人类中的覆盖率非常高，但在小鼠和拟南芥中仍有较大缺口。

3.2 GENCODE 基因与 isoform 统计

基因组注释项目 GENCODE 提供了最新的蛋白编码基因及转录本数目：

人类 (GENCODE Release 49)

包含19,433个蛋白编码基因（不含 664 个 readthrough 基因）和211,446个蛋白编码转录本，拥有129,801个不同的蛋白翻译序列。约15,498个基因具有超过一个翻译异构体。

具体链接：

https://www.gencodegenes.org/human/stats_49.html

![图片 12](images/012.png)

小鼠 (GENCODE M38)

包含21,530个蛋白编码基因（不含 230 个 readthrough 基因）和58,647个蛋白编码转录本。共有44,974个不同蛋白翻译序列，约10,853个基因有多个翻译异构体。

具体链接：

https://www.gencodegenes.org/mouse/stats_M38.html

拟南芥 (Arabidopsis thaliana)

根据 KEGG Genome 数据，拟南芥基因组中有27,562个蛋白编码基因。

具体链接：

https://www.kegg.jp/kegg-bin/show_organism?org=ath

![图片 13](images/013.png)

![图片 14](images/014.png)

这些数字反映了物种基因组的复杂性和 isoform 多样性。值得注意的是，长读长 RNA 测序等研究表明人类基因可能产生超过 300,000 种蛋白 isoform：

![image.png](images/015.png)

Miller, R.M., Jordan, B.T., Mehlferber, M.M.et al.Enhanced protein isoform characterization through long-read proteogenomics.

Genome Biol 23, 69 (2022).

https://doi.org/10.1186/s13059-022-02624-y

然而截至2025 年的注释仍只确认~130,000 个翻译 isoform，需要通过长期研究持续挖掘。

3.3 Reference Proteome FASTA 规模

EMBL-EBI 为 UniProt Reference Proteomes 发布了一套“主 FASTA”和“额外 isoform FASTA”文件，其规模反映了不同物种的数据库大小。

在2024_02 版本的统计中：

https://ftp.ebi.ac.uk/pub/databases/reference_proteomes/QfO/STATS

![image.png](images/016.png)

主 FASTA 的条目数与基因数接近，而 isoform 文件显著扩大了搜索空间。例如人类 isoform FASTA 包含约 84k 条序列，与 130k GENCODE distinct translations 仍有差距；这种差异来源于 UniProt 选取的是主要 isoform 和经证实的剪接变体，而 GENCODE 注释更全面。

3.4 Swiss-Prot 覆盖率与参考库对比

下表汇总了主要模式物种中 Swiss-Prot 与 Reference Proteome 对基因组覆盖率的比较（2025 年数据）：

![image.png](images/017.png)

可见，人类 Swiss-Prot 覆盖度接近 100 %，适合作为主数据库；

小鼠和拟南芥的 Swiss-Prot 覆盖率明显较低，在植物和部分模型动物研究中使用 Reference Proteome 或 UP + isoform 更合适。

0 4

未注释蛋白与再注释价值

许多 TrEMBL 条目以 “Uncharacterized protein” 或类似名称出现，这并不意味着序列不可靠或没有表达。它们往往只是缺乏人工注释。PE 值较高的未表征蛋白可能对应重要功能。这些序列通过同源比对和 GO 富集分析，其中大多数可赋予具体名称或功能。随着 UniProt 持续更新，这些序列会逐渐被手工注释。建议对未表征条目进行以下处理：

使用比对等工具进行同源注释。通过比对亲缘物种的已知蛋白，推断其功能或结构。

结合转录组或蛋白质组实验验证，确定其在特定组织或条件下的表达情况。

关注 UniProt 更新，及时替换旧版 FASTA 中的未表征序列。

0 5

为什么需要定期更新数据库？

UniProt 持续修正蛋白序列和功能注释。定期更新 FASTA 数据库可避免使用错误的序列或错过重要修订。

例如，人类 IQANK1 蛋白（UniProt ID: A8MXQ7）曾在 2020 年的更新中将名称由 “Putative IQ motif and ankyrin repeat domain-containing protein” 修订为 “IQ motif and ankyrin repeat domain-containing protein 1”，同时 PE 等级从 5 降至 4，SV 版本升至 3。早期版本中使用旧名称或序列可能导致肽段错配或漏检。

因此建议：

每 3 – 6 个月检查一次 UniProt 更新，尤其在研究周期较长或使用人类样本的项目中。

关注 SV 值的变化，如果序列版本增加，及时下载最新版并重新检索。

记录所用数据库版本（包括 UniProt 版本号、下载日期和库类型）。这有助于结果复现和比较。

0 6

实践建议：如何选择合适的 UniProt FASTA

6.1看研究目的

如果关注已知功能和高质量注释，可选择 Swiss-Prot 或 Reference Proteome 主 FASTA。

如果希望最大覆盖所有基因并考虑剪接变体，使用 UP + isoform。

若需要发掘新蛋白或特殊片段，可加入 TrEMBL 条目，但需注意假阳性和冗余。

6.2检查 PE 与 SV 信息

PE=1 – 3 的条目存在一定实验或同源证据，可使用；PE=4 – 5 的条目仍可纳入探索性分析。

SV 值提示序列是否更新。当 SV 增加时应下载新版 FASTA。

6.3 关注物种覆盖率

在 UniProt proteome 页面搜索目标物种，优先选择标记为 reference proteome 的数据集。

若某菌株或植物种无法在 UniProt 找到完整 proteome，可在 NCBI、JGI 等数据库寻找基因组序列，并自行翻译生成 FASTA；或者使用亲缘物种 proteome 进行临时分析，并在同源注释中加以区分。

6.4 定期更新 FASTA

建议每隔数个月检查 UniProt 更新，特别是当研究涉及的蛋白质可能存在新发现或修正时。

在文章或实验记录中注明所使用的 UniProt 版本、下载日期和库类型，方便同行复现。

6.5 合理设置搜索数据库

初始分析可采用 Reference Proteome 主 FASTA，以减少搜索空间。

如果有已知的多剪接基因或关注特定异构体，可针对这些基因补充 isoform 库，而不必全局加入所有 isoform。

0 7

常见问题解答（FAQ）

Q1 : 使用 Swiss-Prot 是否足够？

A : 对于人类样本，Swiss-Prot 覆盖率接近基因组数量, 可满足多数研究需求。对于小鼠、拟南芥等模式生物，Swiss-Prot 覆盖率分别约 80 % 和 60 %，无法覆盖所有编码基因，因此建议使用 Reference Proteome 或 UP + isoform。

---

Q2 : PE=4 – 5 的条目是否应该剔除？

A : PE 等级反映存在证据强度，而非序列可靠性。PE=4 – 5 的蛋白往往是预测或存在不确定性，但在特定组织中可能真实表达。根据研究目的决定是否纳入；若只关注高可信度蛋白，可在软件中设置过滤；若探索新蛋白则不必排除。

---

Q3 : SV=1 的序列是否“不可靠”？

A : 不一定。SV=1 仅说明该序列自收录以来未修改过，可能是正确也可能尚未发现问题。应关注 SV 是否在最近更新中改变，如果 SV 增加说明序列发生了修订，需要更新数据库。

---

Q4 : 是否必须包含 isoform？

A : 是否加入 isoform 取决于研究目标。包含 isoform 会显著增加搜索空间并提高假发现率，但对于研究剪接变体、组织特异性蛋白质组或新异构体的项目非常重要。常规定量可以先使用 Reference Proteome 主 FASTA，再针对感兴趣的基因补充 isoform。

---

Q5 : 我研究的细菌菌株没有相应 proteome，怎么办？

A : UniProt 对部分菌株更新较慢。可以在 NCBI 或 JGI 等数据库查找该菌株的基因组序列，并使用翻译工具生成自定义 FASTA；或选择同一物种较近的参考菌株，结合同源注释修正差异。这一过程需谨慎标注，以便后续更新时替换为官方数据库。

END

延申阅读

DIA时序蛋白组怎么做？从实验到动态分析的完整方案

易算方案｜空间蛋白组里 ROI 到底切多少才合理

易算特色｜从血浆到修饰，我们在蛋白质组项目中怎么落地？

![图片 18](images/018.png)

可以详细和我们聊一聊你的思路和样本

![图片](images/019.webp)

![图片 20](images/020.png)

易算蛋白组学前沿方案库

---
