简介
本指南介绍如何在Spectronaut™ Linux 版本 中使用自定义 FASTA 文件解析规则。通过该功能,您可以灵活定义 FASTA 文件头信息的提取规则,以便在后续分析中生成结构化报告。
使用方法
使用自定义解析规则时,需要通过convertFASTA 命令导入 FASTA 文件并生成 .bgsfasta 格式的文件:
spectronaut convertFASTA -fasta <path_to_fasta_file> --parsingRule <path_to_parsing_rule_json> -o <output_folder>
输出的.bgsfasta 文件可用于后续的搜索流程(类似于普通 FASTA 文件)。
创建解析规则(JSON 文件)
1. 通过 Windows Spectronaut Viewer 创建
1.打开Spectronaut Viewer(Windows 版)
2.进入Database 视角 → Protein Databases
3.选择一个FASTA 文件导入的数据库
4.点击 New Rule 创建新规则,或 Export Rule 导出已有规则
5.保存为 .json 文件
2. 手动创建 JSON 文件
JSON 文件需包含以下字段:
·name:解析规则名称
·proteinIDToken:用于标识蛋白ID 的字段
·keywords:用于匹配FASTA 头部信息的关键词列表
·parsingRule:解析规则字符串
示例JSON 文件
{
"name": "UniProt FASTA",
"proteinIDToken": "Accession",
"keywords": ["Database", "Accession", "UniProtId", "Protein Name", "Protein Description", "Organism", "OrganismId", "Gene", "Protein Existence", "Sequence Version"],
"parsingRule": ">$[Database]$|$[Accession]$[UniProtId]$|$[Protein Name]$ $[Protein Description]$ OS=$[Organism]$ OX=$[OrganismId]$ GN=$[Gene]$ PE=$[Protein Existence]$ SV=$[Sequence Version]$"
}
解析规则说明
解析规则中使用$[Token]$ 表示变量,解析后的字段可在报告中作为列名使用,例如:
·PG.Database
·PG.Accession
·PG.Protein Name
·...
如需在报告中默认显示,建议使用以下关键词命名:
Database, Accession, UniProtId, Protein Name, Protein Description, Organism, OrganismId, Gene, Protein Existence, Sequence Version
提示:如果两个Token 之间没有分隔符,它们将共同匹配一个字段。
常见问题
·如何验证解析规则是否生效?
查看输出的 .bgsfasta 文件内容或生成的报告字段。
·解析失败怎么办?
检查FASTA 头格式是否与规则匹配,确保关键词无拼写错误。
·是否支持批量处理?
是,支持命令行脚本化批量导入。