点击蓝字 关注我们



组学实验一大痛点经常从一个看似简单的问题开始:这个物种应该使用哪个 FASTA?或者我想测的这个物质有没有注释信息

继续往下做,又会遇到更多彼此关联的问题:


  • 中文物种名在 UniProt 官网很难直接检索,如何找到正确的 Taxon ID 和 Proteome?

  • 目标物种没有直接 Proteome 时,怎样寻找有分类学依据的近似物种,而不是随便挑一个近似名称?

  • 人体外泌体、血液或细胞样本,应该加入哪些污染蛋白、标志蛋白或体液蛋白?

  • 一个代谢物同时有 HMDB、PubChem、ChEBI、InChIKey 和俗名,怎样判断它们是否指向同一对象?

  • 找到结果后,怎样批量下载、导出、分享,并保留可复核的数据来源?

OmicSolution 技术支持网站的“数据库检索”把这些任务集中在同一个入口中:以本地数据库完成高频查询和批量处理,以中文名称、分类关系和研究场景补充官方数据库不直接提供的能力,同时保留官方链接供最终复核。

登录gemma.omicsolution.com 打开数据库检索或点击文末 阅读原文


一、选择入口

当前数据库板块由三个主要工具和一套 UniProt 培训组成。

查物种、Proteome、Taxon ID、UniProtKB 条目或 FASTA(见上图)

进入

UniProt Browser

,可获得 Proteome 详情、条目表、FASTA、序列分析结果和专属查询链接。

构建污染物、EV/血细胞标志物、TOP14 或 PQ500 序列库

进入

常见污染物及标志蛋白指南

,可获得组合 FASTA、筛选表格、分类统计和来源说明。

统一检索 HMDB、PubChem 和 ChEBI

进入

代谢组数据库

,可获得合并详情、候选匹配、结构、外部 ID 和 TSV/CSV。

系统学习 FASTA、UniProt

进入

UniProt 使用培训

,可浏览分章节中文课程、站内实操和官方 Help 索引。

最简单的判断方式是:


  • 研究对象是物种或蛋白:先进入 UniProt Browser。

  • 研究对象是样本背景和质控蛋白:进入常见污染物及标志蛋白指南。

  • 研究对象是小分子化合物:进入代谢组数据库。

  • 不清楚 FASTA 如何选择或如何进入搜库软件:先学习 UniProt 使用培训,再直接跳转到对应工具实操。


二、UniProt Browser:中文检索、Proteome 匹配与 FASTA 获取

进入 UniProt Browser

当前数据库为 UniProt2026_02最新版本,本地包含 36,466 个 Proteome、74,728 个 FASTA/XML/mapping 文件和 147,131,808 条 UniProtKB 注释索引。中文兼容层收录 75,712 个物种别名,其中 2,854 个 Taxon 已具备中文物种名。页面仍保留历史 release,便于旧项目复核和版本差异比较。

1. 一个输入框覆盖常见蛋白数据库标识

UniProt Browser 支持输入:


  • Proteome ID,例如 UP000005640

  • Taxon ID,例如 9606

  • 拉丁学名,例如 Homo sapiens

  • 中文物种名,例如“小鼠”

  • 英文俗名,例如 zebrafish

  • UniProtKB accession,例如 P04637

  • Gene 名称,例如 TP53

  • 多行物种、Taxon ID 或 Proteome ID,用于批量匹配

如果输入看起来像 accession,页面会自动切换到 UniProtKB 条目查询;物种名、Taxon ID 和 Proteome ID 则进入 Proteome 检索。用户不需要先手动进入某个 Proteome,首次打开页面也可以直接查询单蛋白条目。

中文名和英文俗名属于本站建立的本地兼容层,不是 UniProt 官方字段。结果页会同时显示拉丁名、Taxon ID、中文常用名和英文别名,最终选库仍应以 Taxon ID、Proteome ID、菌株或品系信息为准。

我们同时陆续整合常见物种分类的快捷访问入口,方便您的即时使用


2. 没有直接 Proteome 时,沿分类树寻找最近可用子节点

直接匹配失败并不代表数据库完全没有可用参考。系统会先解析目标物种的 Taxon ID,然后沿 taxonomy lineage 向上寻找最近共同祖先,再在该祖先下的子节点中寻找最近的可用 Proteome。


上图以 Morchella esculenta 为例:本地库没有该物种的直接 Proteome,页面返回 Morchella conica CCBAS932,并同步显示中文名“尖顶羊肚菌 / 羊肚菌”、共同祖先和分类距离。

近似结果不会被悄悄并入下载:


  1. 查看候选物种、Taxon ID、Proteome ID、分类距离和蛋白数量。

  2. 精确或近似匹配存在多个 Proteome 时,通过下拉菜单选择;默认优先蛋白数量更多的候选。

  3. 直接匹配与已接受近似匹配提供不同的下载入口,便于后续记录和复核。

对于地方品种、变种、杂交种或尚未收录于 UniProt Proteomes 的物种,还可以使用“AI 搜索匹配”补充 Taxonomy ID、别名和外部蛋白 FASTA 资源线索。输入限制为最多 10 个中文字符或 30 个英文字符,避免把一段描述误当成物种名。此类结果会明确标注来源和获取时间;超过三个月可强制更新。AI 结果是检索线索,不等同于 UniProt 官方注释,下载外部 FASTA 前仍需核对物种、组装版本、注释版本和文件类型。

检索成功后便返回如下内容供您判断使用



3. Proteome 详情不仅是一张统计卡

打开 Proteome 后,可继续查看:


  • Taxon ID、物种、Proteome 状态和 release

  • reference proteome、基因组组装与完整性信息

  • canonical、isoform 和本地文件数量

  • 中文常用名、英文俗名和分类关系

  • UniProt 官网补全信息与原始链接

  • Wikipedia、百度百科或最近上级分类的中英文背景简介

  • UniProtKB 条目、FASTA 文件和序列分析入口

这些信息用于回答三个问题:物种是否正确、版本是否合适、下载范围是否符合本项目。

4. 批量匹配和下载按全部结果处理

多行输入会生成统一的匹配表。表格支持中文名称、搜索、筛选、排序、20/50/100 条每页、页码跳转和全部结果导出。

需要特别注意:


  • 分页只影响屏幕显示,不限制 TSV、CSV 或 FASTA 的导出范围。

  • “下载合并 FASTA ZIP”使用全部已识别结果,而不是当前页或前 200 条。

  • 近似匹配必须先接受;未手动切换候选时,默认使用该组中蛋白数量最多的候选。

  • “仅主库”和“主库 + isoform”应根据搜索软件、研究目标和冗余控制要求选择。

5. 从条目详情直接进入本地序列分析

UniProtKB 条目表可按 accession、Gene、蛋白名称、物种和注释字段检索。打开单蛋白详情后,可以直接把当前序列送入“蛋白序列分析”,无需再次复制 FASTA。

当前本地分析包括:


  • 序列长度、分子量、理论等电点、氨基酸组成和理化性质

  • 多种蛋白酶酶切模拟、漏切设置和肽段长度筛选

  • Motif/正则检索与序列位置可视化

  • 指定 Proteome FASTA 序列文本中的短肽段匹配,最短支持 5 个氨基酸

  • 2–10 条蛋白序列比对、保守位点和差异位点展示

  • 序列性质、LC-MS 可检出性估算和分析表格导出

查询页会生成专属链接。把链接发给同事后,可以恢复相同 release、查询词、筛选范围和当前模块,避免只分享一张无法复现的截图。


三、常见污染物及标志蛋白:按研究场景构建 FASTA

进入常见污染物及标志蛋白指南

目标物种 FASTA 说明“希望鉴定什么”,污染物和标志蛋白则帮助解释“样本中还可能出现什么”以及“样本状态是否符合预期”。

当前页面把不同用途明确分区:


  • 左侧暖色区:公认经典污染蛋白集合。 包括角蛋白、牛源血清与体液蛋白、实验酶与试剂、乳制品蛋白、校准/标签/亲和蛋白等。

  • 中间蓝绿色区:研究场景标志蛋白库。 包括 EV、血细胞残留、溶血、血小板、白细胞、凝血和血清化等标志物。

  • 右侧蓝色区:人源体液蛋白。 包括 TOP14 高丰度蛋白去除靶标和 PQ500 血浆/血清靶向蛋白。


当前主要数据范围

MaxQuant contaminants2021:221 条原始序列

用于识别操作、试剂、环境和人工标准序列。

研究场景标志蛋白库:183 条、8 类、4 个物种

用于 EV、溶血、血细胞、凝血和血清化评估。

PQ500:581 个源 ID、576 条本地序列

用于人血浆/血清靶向蛋白参考。

TOP14:14 个靶标类别

用于高丰度蛋白去除效果评估。

合并目录:934 条本地序列

用于统一筛选、复核和下载。

不同集合可能共享 accession,页面会合并重复序列,同时保留其全部来源和分类标签。

两步完成构库

第 1 步:筛选。 选择物种和一个或多个分类。勾选非人蛋白时,物种范围会自动切换为“全部”,避免被人源筛选条件意外隐藏。

第 2 步:表格复核与下载。 页面直接显示结果表格,不再增加重复预览层。用户可以继续搜索、筛选、排序、分页,打开单蛋白彩色序列详情,批量选择部分条目,或下载当前筛选范围的全部 FASTA 和统计报告。


两个典型场景

人体外泌体研究


  1. 物种选择“人 / Homo sapiens”。

  2. 勾选 EV 跨膜标志物、EV 胞质伴随标志物、血浆 EV 共分离蛋白和细胞残留指示蛋白。

  3. 进入表格检查 Gene、蛋白描述、来源面板和物种。

  4. 下载 FASTA 用于辅助检索,并导出统计报告作为项目记录。

人血液蛋白质组研究


  1. 选择人体血细胞、溶血、血小板、白细胞、凝血和血清化相关分类。

  2. 根据实验流程决定是否加入 TOP14 或 PQ500。

  3. 如果不希望牛源同源蛋白参与污染评估,不勾选“牛源血清与体液蛋白”。

  4. 下载本次筛选得到的 FASTA,和人源目标 Proteome 一并纳入构库记录。

contaminants 和 marker 都是真实 target 序列,不是 decoy。FDR 反向库仍应由搜索软件按项目设置生成,不能把 contaminants FASTA 当作 decoy。


四、代谢组数据库:一次查询打通 HMDB、PubChem 与 ChEBI

进入代谢组数据库

当前本地资源包括 217,920 条 HMDB 代谢物、1,271,922 条 HMDB 同义词、205,304 条 ChEBI 化合物、386,425 条 ChEBI 同义词,以及 178,292,117 个 PubChem CID 范围与对应 SMILES 结构字段索引。跨库映射和名称索引用于快速定位候选,详情页再把结构、标识符和官方来源放回同一条记录中。

同一个代谢物在不同文献和软件中可能使用完全不同的标识。代谢组数据库支持:


  • HMDB ID

  • PubChem CID

  • ChEBI ID

  • InChIKey

  • SMILES

  • IUPAC 名称、英文名和同义词

  • 多行文本、TSV 或 CSV 批量输入

以 Aspirin 为例

输入 aspirin、2244、HMDB0001879 或 CHEBI:15365,系统会把跨库关系合并到同一详情页。


结果可同时显示:


  • 2D 结构与 SDF 下载

  • HMDB ID、PubChem CID、ChEBI ID

  • InChIKey、SMILES、分子式和质量信息

  • 同义词、外部数据库标识和分类层级

  • 文献、专利、来源记录、药理或安全摘要

  • HMDB、PubChem、ChEBI 官方详情链接

名称可能对应多个候选时,页面保留候选列表,而不是把第一个模糊命中当作唯一答案。用户应结合分子式、单同位素质量、InChIKey 和结构确认目标化合物。

批量任务会把每一行输入与匹配结果放入统一表格,支持搜索、筛选、分页以及全部结果 TSV/CSV 导出。分页仍只影响显示,不缩小导出范围。


五、UniProt 使用培训:从“会点按钮”到“知道为什么”

进入 UniProt 使用培训


培训页面不是一张很长的说明书,而是按章节切换的中文在线课程。内容从 FASTA 的基本结构开始,逐步连接到真实搜库工作流:


  1. FASTA 是什么,header 和氨基酸序列分别承担什么作用。

  2. 基因组、基因注释、转录本、蛋白预测与 protein FASTA 的来源关系。

  3. UniProtKB、Proteomes、Taxonomy、ID Mapping 和 UniRef 的数据分工。

  4. canonical 与 isoform、reviewed 与 unreviewed、reference proteome 的选择边界。

  5. DDA 和 DIA 搜索软件如何使用 FASTA 生成候选肽段和理论离子。

  6. 酶切规则、漏切、固定/可变修饰、target-decoy 和 FDR 的关系。

  7. 非模式物种没有 UniProt Proteome 时的替代路线与风险记录。

  8. FASTA 下载、入库质检、版本记录和结果复核。

课程中的实操按钮会在新页面打开对应的本地功能,例如中文物种检索、Proteome 详情、单蛋白条目、Motif 搜索、序列比对和 ID Mapping。学习内容与工具操作使用同一组示例,避免看完概念后还要重新寻找入口。


六、把四个模块串成三个完整工作流

场景 A:为非模式物种准备搜库 FASTA


  1. 在 UniProt Browser 输入中文名、英文名或拉丁名。

  2. 复核 Taxon ID 和精确 Proteome;没有直接结果时检查近似候选。

  3. 比较候选的分类距离、物种中文名、Proteome 状态和蛋白数量。

  4. 接受合适候选,下载 canonical 或 canonical + isoform FASTA。

  5. 根据实验体系,在污染物及标志蛋白指南中选择需要的污染蛋白。

  6. 保存查询专属链接、release、Proteome ID、下载范围和外部资源版本。

场景 B:为人体 EV 或血液项目准备辅助序列库


  1. 使用 UP000005640 打开人类参考 Proteome。

  2. 在 UniProtKB 条目中复核目标 Gene 或 accession。

  3. 在常见污染物及标志蛋白指南中选择 EV、血细胞、凝血、TOP14 或 PQ500。

  4. 查看合并后的序列表,按来源和用途复核。

  5. 下载 FASTA 和统计报告,将其与目标 Proteome、搜索参数和 decoy 策略一起归档。

场景 C:统一项目中的代谢物标识


  1. 把实验表中的名称、HMDB ID、CID、ChEBI ID 或 InChIKey 作为批量输入。

  2. 对模糊名称查看候选,不直接接受第一个结果。

  3. 用分子式、质量、InChIKey 和结构复核。

  4. 导出统一 TSV/CSV,保留原始输入与各数据库映射。

  5. 需要引用或进一步查询时打开对应官方详情页。


七、本地数据库与官网同步能力如何分工

本站本地数据库主要解决三类问题:


  • 速度和批量能力:大表格、分类列表、FASTA 和跨库映射不依赖每次实时访问官网。

  • 中文兼容:补充 UniProt 官方数据中缺少的中文物种名、英文俗名和检索别名。

  • 研究场景组织:把污染物、EV/血细胞标志物、TOP14、PQ500 和代谢物跨库映射组织成可直接筛选和下载的任务。

对于需要官网最新字段的 Proteome 和 UniProtKB 条目,页面会在访问时尝试补全并缓存。用户仍应把下列信息作为项目可复核记录:


  • 数据 release 和访问日期

  • Taxon ID、Proteome ID 或 accession

  • canonical / isoform 范围

  • FASTA 文件名和校验信息

  • 近似匹配、AI 线索或外部资源的来源说明

  • 污染物、marker、target 和 decoy 的角色划分


八、主要数据来源


  • UniProt

  • UniProt Proteomes

  • NCBI Taxonomy

  • HMDB

  • PubChem

  • ChEBI

数据库检索的目标不只是“搜到一个结果”,而是形成一条可以解释、可以下载、可以分享、也可以在项目结束后重新复核的数据链。物种、Proteome、FASTA、污染物、标志蛋白和代谢物标识都放回同一套工作流后,搜库准备才真正从临时操作变成项目资产。