---
title: "基于AI的蛋白质和代谢物数据库查询：易算数据库模块让你不再迷失在数据的海洋里"
author: "GPT5.6"
account: "GPT5.6"
published_at: "2026-07-24T15:28:09+08:00"
captured_at: "2026-08-26T17:05:02.664289+08:00"
source_url: "https://mp.weixin.qq.com/s/IIobV9iL2DqQ0Pe12MyFuQ"
---

# 基于AI的蛋白质和代谢物数据库查询：易算数据库模块让你不再迷失在数据的海洋里
点击蓝字 关注我们

组学实验一大痛点经常从一个看似简单的问题开始：这个物种应该使用哪个 FASTA？或者我想测的这个物质有没有注释信息

继续往下做，又会遇到更多彼此关联的问题：

-

中文物种名在 UniProt 官网很难直接检索，如何找到正确的 Taxon ID 和 Proteome？

-

目标物种没有直接 Proteome 时，怎样寻找有分类学依据的近似物种，而不是随便挑一个近似名称？

-

人体外泌体、血液或细胞样本，应该加入哪些污染蛋白、标志蛋白或体液蛋白？

-

一个代谢物同时有 HMDB、PubChem、ChEBI、InChIKey 和俗名，怎样判断它们是否指向同一对象？

-

找到结果后，怎样批量下载、导出、分享，并保留可复核的数据来源？

OmicSolution 技术支持网站的“数据库检索”把这些任务集中在同一个入口中：以本地数据库完成高频查询和批量处理，以中文名称、分类关系和研究场景补充官方数据库不直接提供的能力，同时保留官方链接供最终复核。

登录gemma.omicsolution.com 打开数据库检索或点击文末阅读原文

![图片 1](images/001.png)

一、选择入口

当前数据库板块由三个主要工具和一套 UniProt 培训组成。

查物种、Proteome、Taxon ID、UniProtKB 条目或 FASTA（见上图）

进入

![图片 2](images/002.jpg)

UniProt Browser

，可获得 Proteome 详情、条目表、FASTA、序列分析结果和专属查询链接。

构建污染物、EV/血细胞标志物、TOP14 或 PQ500 序列库

进入

![图片 3](images/003.jpg)

常见污染物及标志蛋白指南

，可获得组合 FASTA、筛选表格、分类统计和来源说明。

统一检索 HMDB、PubChem 和 ChEBI

进入

![图片 4](images/004.png)

代谢组数据库

，可获得合并详情、候选匹配、结构、外部 ID 和 TSV/CSV。

系统学习 FASTA、UniProt

进入

![图片 5](images/005.png)

UniProt 使用培训

，可浏览分章节中文课程、站内实操和官方 Help 索引。

最简单的判断方式是：

-

研究对象是物种或蛋白：先进入 UniProt Browser。

-

研究对象是样本背景和质控蛋白：进入常见污染物及标志蛋白指南。

-

研究对象是小分子化合物：进入代谢组数据库。

-

不清楚 FASTA 如何选择或如何进入搜库软件：先学习 UniProt 使用培训，再直接跳转到对应工具实操。

二、UniProt Browser：中文检索、Proteome 匹配与 FASTA 获取

进入 UniProt Browser

当前数据库为 UniProt2026_02最新版本，本地包含 36,466 个 Proteome、74,728 个 FASTA/XML/mapping 文件和 147,131,808 条 UniProtKB 注释索引。中文兼容层收录 75,712 个物种别名，其中 2,854 个 Taxon 已具备中文物种名。页面仍保留历史 release，便于旧项目复核和版本差异比较。

1. 一个输入框覆盖常见蛋白数据库标识

UniProt Browser 支持输入：

-

Proteome ID，例如 UP000005640

-

Taxon ID，例如 9606

-

拉丁学名，例如 Homo sapiens

-

中文物种名，例如“小鼠”

-

英文俗名，例如 zebrafish

-

UniProtKB accession，例如 P04637

-

Gene 名称，例如 TP53

-

多行物种、Taxon ID 或 Proteome ID，用于批量匹配

如果输入看起来像 accession，页面会自动切换到 UniProtKB 条目查询；物种名、Taxon ID 和 Proteome ID 则进入 Proteome 检索。用户不需要先手动进入某个 Proteome，首次打开页面也可以直接查询单蛋白条目。

中文名和英文俗名属于本站建立的本地兼容层，不是 UniProt 官方字段。结果页会同时显示拉丁名、Taxon ID、中文常用名和英文别名，最终选库仍应以 Taxon ID、Proteome ID、菌株或品系信息为准。

我们同时陆续整合常见物种分类的快捷访问入口，方便您的即时使用

![图片 6](images/006.png)

2. 没有直接 Proteome 时，沿分类树寻找最近可用子节点

直接匹配失败并不代表数据库完全没有可用参考。系统会先解析目标物种的 Taxon ID，然后沿 taxonomy lineage 向上寻找最近共同祖先，再在该祖先下的子节点中寻找最近的可用 Proteome。

![图片 7](images/007.png)

上图以 Morchella esculenta 为例：本地库没有该物种的直接 Proteome，页面返回 Morchella conica CCBAS932，并同步显示中文名“尖顶羊肚菌 / 羊肚菌”、共同祖先和分类距离。

近似结果不会被悄悄并入下载：

-

查看候选物种、Taxon ID、Proteome ID、分类距离和蛋白数量。

-

精确或近似匹配存在多个 Proteome 时，通过下拉菜单选择；默认优先蛋白数量更多的候选。

-

直接匹配与已接受近似匹配提供不同的下载入口，便于后续记录和复核。

对于地方品种、变种、杂交种或尚未收录于 UniProt Proteomes 的物种，还可以使用“AI 搜索匹配”补充 Taxonomy ID、别名和外部蛋白 FASTA 资源线索。输入限制为最多 10 个中文字符或 30 个英文字符，避免把一段描述误当成物种名。此类结果会明确标注来源和获取时间；超过三个月可强制更新。AI 结果是检索线索，不等同于 UniProt 官方注释，下载外部 FASTA 前仍需核对物种、组装版本、注释版本和文件类型。

![图片 8](images/008.png)

检索成功后便返回如下内容供您判断使用

![图片 9](images/009.png)

3. Proteome 详情不仅是一张统计卡

打开 Proteome 后，可继续查看：

-

Taxon ID、物种、Proteome 状态和 release

-

reference proteome、基因组组装与完整性信息

-

canonical、isoform 和本地文件数量

-

中文常用名、英文俗名和分类关系

-

UniProt 官网补全信息与原始链接

-

Wikipedia、百度百科或最近上级分类的中英文背景简介

-

UniProtKB 条目、FASTA 文件和序列分析入口

这些信息用于回答三个问题：物种是否正确、版本是否合适、下载范围是否符合本项目。

4. 批量匹配和下载按全部结果处理

多行输入会生成统一的匹配表。表格支持中文名称、搜索、筛选、排序、20/50/100 条每页、页码跳转和全部结果导出。

需要特别注意：

-

分页只影响屏幕显示，不限制 TSV、CSV 或 FASTA 的导出范围。

-

“下载合并 FASTA ZIP”使用全部已识别结果，而不是当前页或前 200 条。

-

近似匹配必须先接受；未手动切换候选时，默认使用该组中蛋白数量最多的候选。

-

“仅主库”和“主库 + isoform”应根据搜索软件、研究目标和冗余控制要求选择。

5. 从条目详情直接进入本地序列分析

UniProtKB 条目表可按 accession、Gene、蛋白名称、物种和注释字段检索。打开单蛋白详情后，可以直接把当前序列送入“蛋白序列分析”，无需再次复制 FASTA。

当前本地分析包括：

-

序列长度、分子量、理论等电点、氨基酸组成和理化性质

-

多种蛋白酶酶切模拟、漏切设置和肽段长度筛选

-

Motif/正则检索与序列位置可视化

-

指定 Proteome FASTA 序列文本中的短肽段匹配，最短支持 5 个氨基酸

-

2–10 条蛋白序列比对、保守位点和差异位点展示

-

序列性质、LC-MS 可检出性估算和分析表格导出

查询页会生成专属链接。把链接发给同事后，可以恢复相同 release、查询词、筛选范围和当前模块，避免只分享一张无法复现的截图。

三、常见污染物及标志蛋白：按研究场景构建 FASTA

进入常见污染物及标志蛋白指南

目标物种 FASTA 说明“希望鉴定什么”，污染物和标志蛋白则帮助解释“样本中还可能出现什么”以及“样本状态是否符合预期”。

当前页面把不同用途明确分区：

-

左侧暖色区：公认经典污染蛋白集合。包括角蛋白、牛源血清与体液蛋白、实验酶与试剂、乳制品蛋白、校准/标签/亲和蛋白等。

-

中间蓝绿色区：研究场景标志蛋白库。包括 EV、血细胞残留、溶血、血小板、白细胞、凝血和血清化等标志物。

-

右侧蓝色区：人源体液蛋白。包括 TOP14 高丰度蛋白去除靶标和 PQ500 血浆/血清靶向蛋白。

![图片 10](images/010.png)

当前主要数据范围

MaxQuant contaminants2021：221 条原始序列

用于识别操作、试剂、环境和人工标准序列。

研究场景标志蛋白库：183 条、8 类、4 个物种

用于 EV、溶血、血细胞、凝血和血清化评估。

PQ500：581 个源 ID、576 条本地序列

用于人血浆/血清靶向蛋白参考。

TOP14：14 个靶标类别

用于高丰度蛋白去除效果评估。

合并目录：934 条本地序列

用于统一筛选、复核和下载。

不同集合可能共享 accession，页面会合并重复序列，同时保留其全部来源和分类标签。

两步完成构库

第 1 步：筛选。选择物种和一个或多个分类。勾选非人蛋白时，物种范围会自动切换为“全部”，避免被人源筛选条件意外隐藏。

第 2 步：表格复核与下载。页面直接显示结果表格，不再增加重复预览层。用户可以继续搜索、筛选、排序、分页，打开单蛋白彩色序列详情，批量选择部分条目，或下载当前筛选范围的全部 FASTA 和统计报告。

![图片 11](images/011.png)

两个典型场景

人体外泌体研究

-

物种选择“人 / Homo sapiens”。

-

勾选 EV 跨膜标志物、EV 胞质伴随标志物、血浆 EV 共分离蛋白和细胞残留指示蛋白。

-

进入表格检查 Gene、蛋白描述、来源面板和物种。

-

下载 FASTA 用于辅助检索，并导出统计报告作为项目记录。

人血液蛋白质组研究

-

选择人体血细胞、溶血、血小板、白细胞、凝血和血清化相关分类。

-

根据实验流程决定是否加入 TOP14 或 PQ500。

-

如果不希望牛源同源蛋白参与污染评估，不勾选“牛源血清与体液蛋白”。

-

下载本次筛选得到的 FASTA，和人源目标 Proteome 一并纳入构库记录。

contaminants 和 marker 都是真实 target 序列，不是 decoy。FDR 反向库仍应由搜索软件按项目设置生成，不能把 contaminants FASTA 当作 decoy。

四、代谢组数据库：一次查询打通 HMDB、PubChem 与 ChEBI

进入代谢组数据库

当前本地资源包括 217,920 条 HMDB 代谢物、1,271,922 条 HMDB 同义词、205,304 条 ChEBI 化合物、386,425 条 ChEBI 同义词，以及 178,292,117 个 PubChem CID 范围与对应 SMILES 结构字段索引。跨库映射和名称索引用于快速定位候选，详情页再把结构、标识符和官方来源放回同一条记录中。

![图片 12](images/012.png)

同一个代谢物在不同文献和软件中可能使用完全不同的标识。代谢组数据库支持：

-

HMDB ID

-

PubChem CID

-

ChEBI ID

-

InChIKey

-

SMILES

-

IUPAC 名称、英文名和同义词

-

多行文本、TSV 或 CSV 批量输入

以 Aspirin 为例

输入 aspirin、2244、HMDB0001879 或 CHEBI:15365，系统会把跨库关系合并到同一详情页。

![图片 13](images/013.png)

结果可同时显示：

-

2D 结构与 SDF 下载

-

HMDB ID、PubChem CID、ChEBI ID

-

InChIKey、SMILES、分子式和质量信息

-

同义词、外部数据库标识和分类层级

-

文献、专利、来源记录、药理或安全摘要

-

HMDB、PubChem、ChEBI 官方详情链接

名称可能对应多个候选时，页面保留候选列表，而不是把第一个模糊命中当作唯一答案。用户应结合分子式、单同位素质量、InChIKey 和结构确认目标化合物。

批量任务会把每一行输入与匹配结果放入统一表格，支持搜索、筛选、分页以及全部结果 TSV/CSV 导出。分页仍只影响显示，不缩小导出范围。

五、UniProt 使用培训：从“会点按钮”到“知道为什么”

进入 UniProt 使用培训

![图片 14](images/014.png)

培训页面不是一张很长的说明书，而是按章节切换的中文在线课程。内容从 FASTA 的基本结构开始，逐步连接到真实搜库工作流：

-

FASTA 是什么，header 和氨基酸序列分别承担什么作用。

-

基因组、基因注释、转录本、蛋白预测与 protein FASTA 的来源关系。

-

UniProtKB、Proteomes、Taxonomy、ID Mapping 和 UniRef 的数据分工。

-

canonical 与 isoform、reviewed 与 unreviewed、reference proteome 的选择边界。

-

DDA 和 DIA 搜索软件如何使用 FASTA 生成候选肽段和理论离子。

-

酶切规则、漏切、固定/可变修饰、target-decoy 和 FDR 的关系。

-

非模式物种没有 UniProt Proteome 时的替代路线与风险记录。

-

FASTA 下载、入库质检、版本记录和结果复核。

课程中的实操按钮会在新页面打开对应的本地功能，例如中文物种检索、Proteome 详情、单蛋白条目、Motif 搜索、序列比对和 ID Mapping。学习内容与工具操作使用同一组示例，避免看完概念后还要重新寻找入口。

六、把四个模块串成三个完整工作流

场景 A：为非模式物种准备搜库 FASTA

-

在 UniProt Browser 输入中文名、英文名或拉丁名。

-

复核 Taxon ID 和精确 Proteome；没有直接结果时检查近似候选。

-

比较候选的分类距离、物种中文名、Proteome 状态和蛋白数量。

-

接受合适候选，下载 canonical 或 canonical + isoform FASTA。

-

根据实验体系，在污染物及标志蛋白指南中选择需要的污染蛋白。

-

保存查询专属链接、release、Proteome ID、下载范围和外部资源版本。

场景 B：为人体 EV 或血液项目准备辅助序列库

-

使用 UP000005640 打开人类参考 Proteome。

-

在 UniProtKB 条目中复核目标 Gene 或 accession。

-

在常见污染物及标志蛋白指南中选择 EV、血细胞、凝血、TOP14 或 PQ500。

-

查看合并后的序列表，按来源和用途复核。

-

下载 FASTA 和统计报告，将其与目标 Proteome、搜索参数和 decoy 策略一起归档。

场景 C：统一项目中的代谢物标识

-

把实验表中的名称、HMDB ID、CID、ChEBI ID 或 InChIKey 作为批量输入。

-

对模糊名称查看候选，不直接接受第一个结果。

-

用分子式、质量、InChIKey 和结构复核。

-

导出统一 TSV/CSV，保留原始输入与各数据库映射。

-

需要引用或进一步查询时打开对应官方详情页。

七、本地数据库与官网同步能力如何分工

本站本地数据库主要解决三类问题：

-

速度和批量能力：大表格、分类列表、FASTA 和跨库映射不依赖每次实时访问官网。

-

中文兼容：补充 UniProt 官方数据中缺少的中文物种名、英文俗名和检索别名。

-

研究场景组织：把污染物、EV/血细胞标志物、TOP14、PQ500 和代谢物跨库映射组织成可直接筛选和下载的任务。

对于需要官网最新字段的 Proteome 和 UniProtKB 条目，页面会在访问时尝试补全并缓存。用户仍应把下列信息作为项目可复核记录：

-

数据 release 和访问日期

-

Taxon ID、Proteome ID 或 accession

-

canonical / isoform 范围

-

FASTA 文件名和校验信息

-

近似匹配、AI 线索或外部资源的来源说明

-

污染物、marker、target 和 decoy 的角色划分

八、主要数据来源

-

UniProt

-

UniProt Proteomes

-

NCBI Taxonomy

-

HMDB

-

PubChem

-

ChEBI

数据库检索的目标不只是“搜到一个结果”，而是形成一条可以解释、可以下载、可以分享、也可以在项目结束后重新复核的数据链。物种、Proteome、FASTA、污染物、标志蛋白和代谢物标识都放回同一套工作流后，搜库准备才真正从临时操作变成项目资产。
