简介

本指南介绍如何在Spectronaut™ Linux 版本 中使用自定义 FASTA 文件解析规则。通过该功能,您可以灵活定义 FASTA 文件头信息的提取规则,以便在后续分析中生成结构化报告。

使用方法

使用自定义解析规则时,需要通过convertFASTA 命令导入 FASTA 文件并生成 .bgsfasta 格式的文件:

spectronaut convertFASTA -fasta <path_to_fasta_file> --parsingRule <path_to_parsing_rule_json> -o <output_folder>

输出的.bgsfasta 文件可用于后续的搜索流程(类似于普通 FASTA 文件)。

创建解析规则(JSON 文件)

1. 通过 Windows Spectronaut Viewer 创建

1.打开Spectronaut Viewer(Windows 版)

2.进入Database 视角 → Protein Databases

3.选择一个FASTA 文件导入的数据库

4.点击 New Rule 创建新规则,或 Export Rule 导出已有规则

5.保存为 .json 文件

2. 手动创建 JSON 文件

JSON 文件需包含以下字段:

·name:解析规则名称

·proteinIDToken:用于标识蛋白ID 的字段

·keywords:用于匹配FASTA 头部信息的关键词列表

·parsingRule:解析规则字符串

示例JSON 文件

{

"name": "UniProt FASTA",

"proteinIDToken": "Accession",

"keywords": ["Database", "Accession", "UniProtId", "Protein Name", "Protein Description", "Organism", "OrganismId", "Gene", "Protein Existence", "Sequence Version"],

"parsingRule": ">$[Database]$|$[Accession]$[UniProtId]$|$[Protein Name]$ $[Protein Description]$ OS=$[Organism]$ OX=$[OrganismId]$ GN=$[Gene]$ PE=$[Protein Existence]$ SV=$[Sequence Version]$"

}

解析规则说明

解析规则中使用$[Token]$ 表示变量,解析后的字段可在报告中作为列名使用,例如:

·PG.Database

·PG.Accession

·PG.Protein Name

·...

如需在报告中默认显示,建议使用以下关键词命名:

Database, Accession, UniProtId, Protein Name, Protein Description, Organism, OrganismId, Gene, Protein Existence, Sequence Version

提示:如果两个Token 之间没有分隔符,它们将共同匹配一个字段。

常见问题

·如何验证解析规则是否生效?
查看输出的 .bgsfasta 文件内容或生成的报告字段。

·解析失败怎么办?
检查FASTA 头格式是否与规则匹配,确保关键词无拼写错误。

·是否支持批量处理?
是,支持命令行脚本化批量导入。