---
title: "FASTA数据库导入方式"
author: "omicsolution"
account: "omicsolution"
published_at: "2024-11-15T03:30:24+08:00"
captured_at: "2026-08-27T10:51:44.330866+08:00"
source_url: "https://mp.weixin.qq.com/s?__biz=MzI2MTI5NDAzNg==&mid=2247490389&idx=1&sn=715c4e96c90df1223e2a3700cbdb0221&chksm=ea5dc9eedd2a40f8a322eae7917e055934f8bb93284da3d55d1a67195e434c1187fd485b03f7#rd"
---

# FASTA数据库导入方式
前言

搜库用文件存放位置和修改

![图片 1](images/001.png)

常用的蛋白质序列数据库是以fasta为扩展名的文本文件。Biognosys导入文件后会进行格式转换，整合标题识别模式后，存为bgsfasta格式，无法直接用文本编辑器编辑，请注意。

Protein Database管理

Protein Database模块用于存储及编辑F ASTA蛋白序列数据库。支持数据库的导入、编辑、保存、导出及删除功能。在建库和分析过程中导入的序列数据库都会保存在此处，也可以提前导入一些比较常用的数据库，后续建库和分析的过程中直接勾选即可。具体操作如下所示：

![图片 2](images/002.png)

导入UniProt数据库

UniProt是目前最常用的蛋白质序列数据库，其fasta文件可以直接导入使用。

![图片 3](images/003.png)

Import下载的fasta文件。

![图片 4](images/004.png)

弹出窗口后确保Accession列识别格式正确即可，其他列为注释信息。Name框可以改成方便记忆的名称即可点击import。

导入自建或第三方测序数据库

如果是导入新的序列数据库，需要进一步指定数据库的解析规则（Par sing Rule）即F ASTA文件中各部分文本对应的内容。因为我们使用的数据库来源多种多样，数据库中的信息存储格式不尽相同，所以需要人为指定各部分的含义，后续的检索结果会以我们指定的规则显示，规则的设定方法如下图：

![图片 5](images/005.png)

通过下方的预览窗口，如果显示的表头信息不对或者需要进一步修改的话，点击“New Rule…”可以设定新的规则，我们以“>sp|P60139|PSBL_TOBAC PhotosystemⅡreaction center protein L OS=Nicotiana tabacum OX=4097 GN=psbL PE=2 SV=1”为例，正常情况下，我们希望该蛋白的数据库来源（s p），蛋白的Accession号（P60139），蛋白名称（PSBL_TOBAC），蛋白的描述（PhotosystemⅡreaction center protein L OS=Nicotiana tabacum OX=4097 GN=psbL PE=2 SV=1）分别显示在不同列中，这就需要我们给软件把这部分信息的解析规则设置好，设置的流程即在规则编辑栏依次输入：“>”→选中“Database”→输入“|”→选中“Accession”→输入“|”→选中“Protein Name”→输入“空格”→选中“Protein Description”说明每个蛋白的信息是由“>”起始的，“>”之后是数据库的名称，数据库之后通过“|”隔开，后面紧跟的是蛋白的Accessio n号，之后同理。通过预览窗口检查无误后，点击“Ad d Rule”即设置成功，后续再上传相同来源的数据库可以直接在下拉菜单中选择该规则。

![图片 6](images/006.png)

![图片 7](images/007.png)
