在线说明书

Part2 Omicscloud用户手册 EasyDIA数据检索任务提交 v20260419

资料文件:Part2_Omicscloud用户手册_EasyDIA数据检索任务提交_v20260419.docx

EasyDIA--DIA数据库检索任务提交说明

(版本号v20260419)

目录

1. 前言 2

2. DirectDIA任务提交流程 3

3. Cohort Real-time Search任务提交 9

4. Time-series任务提交 15

前言

EasyDIA数据库检索模块分为三个子模块:

DirectDIA:推荐用于小规模数据的检索任务提交或者大队列数据采集完成后的检索任务提交,与Cohort Real-time Search的区别在于后者可以预先提交分析任务,数据边采集边检索,而DirectDIA必须所有数据都采集完成再提交分析任务。

Ps:如果有多台服务器资源可用于数据库检索,该模块支持服务器资源的自动分配和搜库任务管理。

Cohort Real-time Search:支持大队列数据的分步式检索,可实现数据边采集边检索,对于大队列数据采集的质量预警更及时。

Time-series:质谱性能的长期监测模块,基于稳定单一来源的QC标肽对数据采集系统的稳定性及性能进行自动化评估及报告生成,推荐在仪器管理过程中进行使用。

DirectDIA任务提交流程

第一步:选择服务器集群,如果是单一集群,不用指定参数,直接点击”下一步“即可;

第二步:选择数据。

  • 选择文件,点击左侧“SELECT SERVER FILE”指定存放原始数据的路径,选择需要提交检索的原始文件即可。

  • 选择目录,则先勾选“Use Diectory Mode”,然后点击“SELECT SERVER DIRECTORY”选择需要上传的文件夹即可。

    选中的文件如需删除,则在右侧窗口选中,然后点击“DELETE SELECTED FILES”删除。

    然后点击“下一步”。

第三步:完善项目信息。

  • Project Name:填写项目名称

  • One-step Hybrid-based DIA:是否采用Hybrid DIA检索模式

OFF:默认不采用,即directDIA模式

ON:采用,如果切换至“ON”,则需点击选框右侧“...”按钮,选择谱图库对应的原始数据。

  • SELECT FASTA:选择检索使用的物种fasta库文件

  • SELECT SET UP:选择检索用的参数文件,软件内置了常用参数模板,可通过下拉选框进行选择。点击“CONFIRM”进行确认。

    PS:如果需要设置自定义的参数模板或者报告模板,勾选“show advance option”显示高级设置。

第四步:设置分组信息。

  • 支持基于网页编辑

    在左侧“Group Info Type”切换到“Custom”,右侧编辑窗口选中要设定的sample,在左上角“输入分组名称”处输入对应的组名,以及“选择分组颜色”设定颜色标识,点击“分配组”即可;

  • 支持表格上传

    在左侧“Group Info Type”切换到“Condition Files”,点击“DOWNLOAD CONDITION FILE”下载表格进行批量编辑,编辑完成之后保存,然后点击“BROESW”按钮上传表格。

    分组信息设置完成,点击“下一步”;

第五步:选择服务器及软件版本。

  • Choose Server:指定数据检索使用的服务器,如果集群部署多个服务器,则右侧窗口会显示服务器的状态,以及目前运行的任务量。选择执行此次检索任务的一个或者多个服务器,如果同时选择多个服务器并行检索任务,则默认第一个服务器执行最后的定性、定量整合步骤,建议第一个服务器指定性能最佳的服务器。

  • Choose Version:选择软件的版本,如果同时安装了多个版本的软件,则此处可以指定检索使用的软件版本。

    点击“CONFIRM”确认上述设置;

第六步:确认分析参数,提交分析任务。

确认上述分析参数无误,则可点击右下角的“提交”按钮提交分析任务。


Cohort Real-time Search任务提交

第一步:选择服务器集群,如果是单一集群,不用指定参数,直接点击“下一步”即可;

第二步:选择数据。

  • 设置目标文件数目,“Target raw file quantity”即该分析任务采集完成最终的原始数据文件数量,平台会持续监测目标文件夹,读取到新的数据产生自动启动数据检索,直至文件数量达到设定的目标数量结束第一轮检索。该数目要设置准确,否则会影响搜库的进程以及最终的结果。

  • 选择目录,点击“SELECT SERVER DIRECTORY”选择需要监控的文件夹。

然后点击“下一步”。

第三步:完善项目信息。

  • Project Name:填写项目名称

  • One-step Hybrid-based DIA:是否采用Hybrid DIA检索模式

OFF:默认不采用,即directDIA模式

ON:采用,如果切换至“ON”,则需点击选框右侧“...”按钮,选择谱图库对应的原始数据。

  • SELECT FASTA:选择检索使用的物种fasta库文件

  • SELECT SET UP:选择检索用的参数文件,软件内置了常用参数模板,可通过下拉选框进行选择。点击“CONFIRM”进行确认。

PS:如果需要设置自定义的参数模板或者报告模板,勾选“show advance option”显示高级设置。

第四步:选择服务器及软件版本。

  • Choose Server:指定数据检索使用的服务器,如果集群部署多个服务器,则右侧窗口会显示服务器的状态,以及目前运行的任务量。选择执行此次检索任务的一个或者多个服务器。

  • Choose Version:选择软件的版本,如果同时安装了多个版本的软件,则此处可以指定检索使用的软件版本。

点击“CONFIRM”确认上述设置;

第五步:确认分析参数,提交预检索分析任务(Search 1)。

确认上述分析参数无误,则可点击右下角的“提交”按钮提交分析任务。

IMG_256

第六步:确认预检索(Search 1)结果,评估异常样本。

在状态栏点击对应的分析任务,进入项目视图,窗口上半部分显示预检索的结果。其中每个矩形块代表一个run,矩形块的颜色代表样本的检索状态:

  • 灰色:未进行预检索

  • 蓝色:正在检索中

  • 红色:文件大小异常(size_check错误)

  • 黄色:检索结果异常(result_check错误)

  • 紫色:检索过程中出错

  • 绿色:检索成功并且结果无异常。

SHOW ALL:点击可显示详细的表格信息。

FIX SELECTED:如果有一些异常结果,综合样本情况以及实验设计确认为正常,则可通过此按钮手动接受,点击该按钮之后选定的run则变更为正常状态。

DELETE SELECTED:通过该按钮删除异常样本,然后重新上传数据启动检索。

SHOW ERROR:点击该按钮,可批量显示异常样本。

IMG_256
IMG_256
第七步:点击“CONTINUE SEARCH”进入到正式检索阶段。
IMG_256

第八步:设置分组信息。

支持基于网页编辑

在左侧“Group Info Type”切换到“Custom”,右侧编辑窗口选中要设定的sample,在左上角“输入分组名称”处输入对应的组名,以及“选择分组颜色”设定颜色标识,点击“分配组”即可;

支持表格上传

在左侧“Group Info Type”切换到“Condition Files”,点击“DOWNLOAD CONDITION FILE”下载表格进行批量编辑,编辑完成之后保存,然后点击“BROESW”按钮上传表格。

分组信息设置完成,点击“CONTINUE CONFIRM”进入到下一步,如果不需要设置分组信息,可直接点击“CONTINUE CONFIRM”进入到下一步;

IMG_256

第九步:选择合并模式。

选择库合并数量:当数据量巨大时,可选择部分样本的预检索结果进行谱图库的构建,以降低对运算资源的消耗以及数据分析的周期。默认会按照预检索的结果,按照鉴定量的从高到低进行排序,可以选择TopN的数据进行合并建库;

每个batch的raw文件数量:lib-based 检索可以分批在多个节点/服务器上进行,可以将原始数据按照节点数量或者服务器的性能进行分割为多个batch,此处可限定每个batch的文件数量;

选择合并模式:当前支持两种合并模式,即

MergeSNE:

  • 逻辑: 所有样本一起进行 Pulsar 搜索,生成统一的谱图库,然后进行 DIA 分析。

  • 优点: 定量准确性最高,利用 MBR (Match Between Runs) 减少缺失值。

  • 缺点: 样本量极大时内存消耗高,运行时间长。

CombineSNE:

  • 逻辑: 适用于分批次分析。假设已有多个独立的 SNE 结果,此模式将它们简单合并为一个报告。

  • 场景: 将多个小队列的结果汇总查看。

重新进行FDR的卡值以及Normalization,仅能导出Normal report结果,无法导出完整的sne文件。对服务器的性能要求较MergeSNE低。

Time-series任务提交

IMG_256
第一步:选择服务器集群,如果是单一集群,不用指定参数,直接点击“下一步”即可;
IMG_256
第二步:选择要监控的目录。点击“SELECT SERVER DIRECTORY”指定要监控的目录,采集的QC数据可设置同步到该目录下,以便平台可以自动读取数据并启动数据库检索以及质控流程;
IMG_256
第三步:选定数据库检索使用的谱图库。
IMG_256
第四步:指定服务器。
第五步:确认参数,提交分析任务。

第六步:在状态栏点击对应的分析任务,查看分析状态。

如果要延长仪器监测的时长,可以在“Time-Series Files Status”模块下的“Project End Time”增加监测的天数,默认是一天。延长监测时间后任务会重新启动。

检索完成的质控结果会显示在“Time-Series Files Status”模块,如须删除某个数据,可将其选中,点击该模块右上方的“DELETE SELECTED”进行删除。

IMG_256
第七步:点击右下角“Report”进行报告查看。