前言
搜库用文件存放位置和修改

常用的蛋白质序列数据库是以fasta为扩展名的文本文件。Biognosys导入文件后会进行格式转换,整合标题识别模式后,存为bgsfasta格式,无法直接用文本编辑器编辑,请注意。
Protein Database管理
Protein Database模块用于存储及编辑FASTA蛋白序列数据库。支持数据库的导入、编辑、保存、导出及删除功能。在建库和分析过程中导入的序列数据库都会保存在此处,也可以提前导入一些比较常用的数据库,后续建库和分析的过程中直接勾选即可。具体操作如下所示:

导入UniProt数据库
UniProt是目前最常用的蛋白质序列数据库,其fasta文件可以直接导入使用。

Import下载的fasta文件。

弹出窗口后确保Accession列识别格式正确即可,其他列为注释信息。Name框可以改成方便记忆的名称即可点击import。
导入自建或第三方测序数据库
如果是导入新的序列数据库,需要进一步指定数据库的解析规则(Parsing Rule)即FASTA文件中各部分文本对应的内容。因为我们使用的数据库来源多种多样,数据库中的信息存储格式不尽相同,所以需要人为指定各部分的含义,后续的检索结果会以我们指定的规则显示,规则的设定方法如下图:

通过下方的预览窗口,如果显示的表头信息不对或者需要进一步修改的话,点击“New Rule…”可以设定新的规则,我们以“>sp|P60139|PSBL_TOBAC Photosystem Ⅱ reaction center protein L OS=Nicotiana tabacum OX=4097 GN=psbL PE=2 SV=1”为例,正常情况下,我们希望该蛋白的数据库来源(sp),蛋白的Accession 号(P60139),蛋白名称(PSBL_TOBAC),蛋白的描述(Photosystem Ⅱ reaction center protein L OS=Nicotiana tabacum OX=4097 GN=psbL PE=2 SV=1)分别显示在不同列中,这就需要我们给软件把这部分信息的解析规则设置好,设置的流程即在规则编辑栏依次输入:“>”→选中“Database”→输入“|”→选中“Accession”→输入“|”→选中“Protein Name”→输入“空格”→选中“Protein Description”说明每个蛋白的信息是由“>”起始的,“>”之后是数据库的名称,数据库之后通过“|”隔开,后面紧跟的是蛋白的Accession号,之后同理。通过预览窗口检查无误后,点击“Add Rule”即设置成功,后续再上传相同来源的数据库可以直接在下拉菜单中选择该规则。

