ΩOmicSolution蛋白质组学技术平台

Spectronaut Workshop

Spectronaut Workshop / 实操课页面

七个实操任务按真实上机顺序覆盖 环境准备workflow 选择condition 设置结果复核report schemaQC命令行 / XIC 导出 七个任务,完整串起 Spectronaut 的实操主线。

7 个上机任务 按上机顺序展开 支持任务复盘 从 GUI 到 CLI 完整走通

可快速定位某个实操任务、字段问题或复核节点。

Roadmap

实操路线与任务目标

每个任务均明确目标、输入、输出与判断标准,七个任务共同构成完整的 discovery 工作流。

七个任务共同覆盖环境、workflow、统计结构、结果复核、交付结构、长期运行与证据回查。

任务 输入 输出 通过标准
任务 1 环境准备raw、library / FASTA、目录、GO、Search Archive可复用的项目工作环境能说清所有输入和输出目录
任务 2 workflow 选择项目目标、样本复杂度、library 状态有理有据的 workflow 决策能说明路线选择依据
任务 3 Conditions 设计样本分组、reference、replicates、fractions正确的统计骨架能说清后续谁和谁比较
任务 4 结果复核analysis 结果矩阵与 post analysis 图稳定性优先的解释顺序先判断质量,再判断候选
任务 5 Report Schema对象层与字段需求对应问题的报表结构能说明 schema 与交付对象的对应关系
任务 6 QC / Pipeline单次成功分析与历史策略长期监控和重复运行逻辑能判断是否进入平台流程
任务 7 CLI / XICGUI 设置、参数文件、report rows可复核、可自动化的高级入口知道如何从结果回到证据层
任务训练的统一结构

每个任务都需要明确三件事:输入是什么,改变的是哪一层对象,最终输出的是什么。Task 2 的输出是可解释的 workflow 决策,Task 5 的输出是一套与当前问题匹配的 report schema。

只要这三层结构明确,整条 discovery 工作流就能被重新组织出来。

Task 1

环境准备与资源就位

第一步不是导入 raw,而是检查本地高速盘、Search Archive 目录、临时目录、结果输出路径、demo data、FASTA 和 GO 是否就位。很多人第一次跑失败,并不是 workflow 不会,而是路径和资源不完整。

这一任务完成后,需要能够明确原始文件位置、library 或 FASTA 来源、结果落点以及后续共享方式。基础文件一旦理顺,后续分析才能稳定展开。

必须确认的内容 当前阶段的意义
raw / library / FASTA / GO 的位置后面所有 workflow 和解释都会依赖这些文件
Search Archive / temp / results 目录如果路径混乱,复跑、共享和自动化都会受影响
demo data 还是正式项目数据避免把演示环境的速度和结果错误外推到正式项目
任务 1 的检查单:正式项目前,至少要把这些文件说清
  • 确认 raw files、library 或 FASTA、GO annotation、Search Archive 和结果目录都位于清晰可追踪的位置。
  • 确认本地高速盘、临时目录和 Search Archive 目录是否足够支撑大队列分析,而不是只够跑 demo。
  • 确认这次是教学演示、方法评估还是正式 discovery 项目,因为这会直接影响后续 workflow 选择和交付标准。

Task 2

workflow 选择

第二个任务是先完成方法选择。开始前应先确认:当前是否已有高质量 library、样本复杂度如何、项目目标更偏向快速启动还是最大覆盖、是否存在 PTM 探索需求。

workflow 选择一旦缺少依据,后续结果差异就很难回溯到输入层;判断重点是形成可复核的选择依据,而不是单纯启动某个向导。

待比较项 更偏向 library-based DIA 更偏向 directDIA / 其他路线
先验知识已有高质量、匹配样本的 library没有可用库,或项目内需要自建知识库
目标强调稳定、长期可比性和标准流程强调快速启动、探索或特殊 search space
特殊需求常规蛋白层 discoveryPTM probing、Method Evaluation、Fast / Deep 权衡
workflow 选型的常见偏差
  • 已有高质量且样本匹配的 library 时,仍然不加判断地改走 directDIA,往往会削弱长期可比性优势。
  • 项目目标是 acquisition benchmark 时,误把 Method Evaluation 当成常规定量 workflow,会让结果解释从起点就偏掉。
  • 把 directDIA 简化成“版本更新后的默认路线”,会掩盖先验知识和 project-specific library 的真实价值。

Task 3

Conditions 设计

这一步需要完成 condition、replicate、fraction、reference condition 以及 quantity correction factor 设置。Condition Setup 直接定义统计比较矩阵。

设置完成后,需要能够清楚说明样本之间的比较关系与 reference 结构。

设置项 常见漏项 后果
condition分组名称和真实实验设计不一致后续比较对象会从根上出错
reference condition默认参照没想清楚就直接选fold change 解释方向会混乱
replicate / fraction重复与分级信息录入不完整统计与 completeness 结构被扭曲
correction factor不知道它会进入 quantity 调整结果数值可能被误读
Condition Setup 的合格标准
  • 完成 Condition Setup 后,不要只看颜色标签,而要用自然语言复述:哪个 condition 是 reference、哪些是 replicates、fractions 是否被正确标记、哪些 correction factor 会作用到 quantity 上。
  • 如果这一步说不清,后面的 PCA、volcano、heatmap 和 report 中的比较结构都很可能被误解。

Task 4

结果复核与候选筛查

结果复核应先看 scoring histograms、run identifications、data completeness、normalization 与 CV,再进入 PCA、candidates、volcano 与 heatmap。

这一顺序先判断矩阵质量,再进入候选与生物学解释层。

任务 4 的 FDR 读法

结果复核阶段的 FDR 不是单独打开一个阈值框再看一眼,而是按顺序进入:先看 scoring histograms 是否形成清晰 target / decoy 分离,再看对象层级对应的 q-value 是否与当前结论一致,最后才看 candidates、volcano 与 heatmap。这样可以避免在矩阵质量尚未站稳时提前放大候选解释。

进入 FDR 实战训练

复核场景 先固定什么 再确认什么
常规 canonical FASTA discoveryscoring histograms、completeness、对象层级 q-value候选与差异解释是否值得继续展开
non-canonical FASTA 或更开放的 search spacedatabase 版本、group 结构、per-group precursor FDR新增命中是否仍处于可解释的风险边界内
先看什么 再看什么 排序依据
scoring histograms、run identifications、completeness、CVPCA、candidates、volcano、heatmap先判断矩阵质量,再解释候选与生物学结构
结果复核的阅读顺序
  • 先看 scoring、completeness、CV、normalization 和对象层级 q-value,再进入 volcano 或 candidates,能够避免在不稳定的结果矩阵上提前放大生物学解释。
  • 标准顺序是:质量层图先确认矩阵是否稳,再由机制层图判断结构是否成立,最后再进入候选优先级排序。
Task 4 练习:non-canonical FASTA 场景如何复核

如果这批 run 同时使用了 canonical + non-canonical FASTA,先不要急着解释新增命中。第一步先确认当前 workflow 是否启用了对应复杂数据库的 precursor 层控制;第二步确认 scoring 与对象层级 q-value 是否仍然稳定;第三步再判断这些新增对象是否只停留在 precursor 层,还是已经被 protein inference 汇总到蛋白层。只有这三步都站稳,新增名录才具备继续解释的前提。

Task 5

Report Schema 与交付结构

这一任务围绕 schema tree、column chooser、filters 与 report preview 展开,同时要求能够区分不同报表结构对应的使用场景。

Protein Group、Peptide、Elution Group、Fragment 与 PTM Site 代表不同粒度的证据载体,交付结构需要据此选择对象层。

任务 5 的蛋白层交付边界

当交付对象落在 Protein Group 层时,必须同时确认 PG.Qvalue、protein inference 与 single-hit protein 策略。只有把对象层级、汇总规则与保留规则写清,蛋白层结果才具备可复核的边界;否则同样的蛋白名录可能来自完全不同的证据压力。

进入蛋白层经验风险说明 · 进入 schema 决策设置

交付前检查项 必须写清的内容 如果缺失,别人会误解成什么
Databasecanonical 还是 canonical + non-canonical,版本号与来源把不同数据库条件下的蛋白层名录当成同一类结果
Protein inference共享 peptide 如何汇总到 protein group同名 protein group 被误读为相同证据结构
Single-hit protein采用默认 stratified 规则还是放宽保留蛋白层数量增加被误读成真实发现提升
PG.Qvalue它代表 Protein Group 层风险,而不是 precursor 层证据强度把蛋白层 q-value 当成单峰质量指标
对象层 主要回答的问题
Protein Group蛋白层总结和大多数项目交付
Peptide / Elution Group更细的定量与峰证据解释
Fragment / PTM Site高阶复核、位点项目和证据下钻
交付判断点 需要固定的内容 如果忽略会出现什么问题
PG.Qvalue明确当前交付对象确实是 Protein Group 层把蛋白层结论误读成 precursor 层证据强度
Protein inference固定汇总规则与数据库结构同名蛋白组在不同项目之间不可比较
Single-hit protein固定保留或分层控制策略蛋白层数量与经验错误比例被放大
对象层与交付结构
  • 如果问题是蛋白层结论,就不该默认把 fragment 层字段全部导出给最终交付对象。
  • 如果问题是位点项目或峰型复核,就必须知道何时下钻到 PTM Site、Elution Group 或 Fragment 层。
  • 高质量 schema 不是字段越多越好,而是对象层、FDR 解释与当前项目的结论边界彼此一致。
Task 5 练习:什么时候不能直接导出蛋白层名单

如果项目使用了 non-canonical FASTA、开放搜索空间或放宽了 single-hit protein 保留策略,蛋白层名单不能只带一列 PG.Qvalue 就直接进入最终交付。更稳的做法是同步写明 database 结构、protein inference 规则与 single-hit protein 策略,并把这三项写进 report schema 对应的说明区或项目方法部分。

Task 6

QC 与 Pipeline

QC Perspective 把结果纳入长期历史,Pipeline 把分析转成重复性流程。这一任务围绕长期监控、重复运行和结果留存展开。

进入这一层后,需要同时考虑批量样本、仪器命名、QC history 归档以及固定输出结构。

维度 核心问题
QC这次 run 放到长期历史里是否仍然稳定
Pipeline这套分析是否值得变成可重复运行的生产流程
结果留存哪些 schema、history 和目录结构必须固定
QC 与 Pipeline 的任务重点
  • QC 不是附加图,而是在问这次 run 放到长期历史里是不是仍然稳定。
  • Pipeline 不是单纯加速,而是在问这套 schema、目录、输出和结果留存方式是否已经足够标准化,值得纳入生产流程。

Task 7

命令行与 XIC 导出

最后一个任务围绕 command arguments file、JSON override、Exit Codes 与 XIC Export DB 展开。GUI 配置在这里进入命令行与自动化环境。

同时,报表行也可以通过 FG.XICDBID 与 XIC SQLite 数据库重新接回 chromatogram 轨迹,形成从 report 到证据层的完整回查路径。

高级能力 至少要学会什么
command arguments file知道 GUI 设置可以被导出并迁入 CLI
JSON override理解它是在固定 schema 上做有限覆盖,而不是随意改配置
Exit Codes知道 Spectronaut 可以被调度器与日志系统托管
XIC Export DB知道如何把 report 行重新接回 chromatogram 证据层
自动化与证据层接口
  • command arguments file 说明 GUI 配置可以迁入 CLI,形成稳定的批处理入口。
  • XIC Export DB 说明 report 行仍可继续回连到 chromatogram 轨迹,使复核和二次开发保持同一证据链。

技术总述

连续课程按完整分析链、报表、QC、设置与自动化主线组织。

连续课程

进入练习页

继续做报表字段题、命令行题和常见误区题。

打开练习页