Proteome--定量分析流程任务提交说明
(版本号V20260422)
目录
第一步:上传定量表格

File Format:支持csv/tsv格式
Browser:点击“Browser”上传对应定量表
Rename column:点击编辑表格的表头,如果需要在分析结果中更换样本名称,可在此处对样本所在的定量列表头进行重命名,编辑完成之后点击“update”即可
Assign column type:点击对分析使用的关键列“Accession”以及“Quant Column”进行确认或者指定,如果对“Accession”以及“Quant Column”进行了重新指定,编辑完成之后点击“update”即可
PS:可通过看表格上方的已识别数据列来判断提交表格中成功被识别列的信息,绿色的即为已被成功识别的表头列,关键列”ACC”, “Qt.”能被成功识别即可。
第二步:选择数据库

点击上图Select DB右侧的按钮,跳转到如下图所示的Database页面,在此勾选用于蛋白注释的注释库文件,鼠标点击选中,点击右下角“CHECK”按钮,进行数据库匹配了评估。
PS:数据库会定期进行更新,Date列即为数据库更新的日期。可以选择与搜库所用数据库日期较近的数据库进行CHECK。

评估结果如下图所示,确认注释库无误,点击右下角“Insert”。
PS:如评估结果正常,下图会显示为绿色,如评估结果异常,下图会显示为红色作为提示。

点击“下一步”

第三步:实验设计
Sample Form:实验设计输入的方式,分为Manual Input 和Upload两种方式
Manual Input:基于网页编辑样本分组和对比分析
Sample Info:输入样本对应的分组,点击单元格右下角的矩形块可拖拽填充,编辑完成之后点击左侧“Save Form”确认设置
Compare inf:点击输入对比方案,编辑完成后点击左侧“Save Form”确认设置
PS:
可以填写两两对比分析,对比分析方案填写的时候,前面为实验组,后面为对照组。
可以填写多组对比分析,多组对比分析填写的时候,前面两组按照两两对比填写方式正常填写,后面的组别写在第三列(other Groups列),中间以逗号隔开即可。如下图所示。

Upload:上传编辑好的样本分组和对比分析表格(样本数较多的时候建议使用该方式)
上传编辑好的表格后,依次点击左下角的按钮进行确认填写的信息(需点击的按钮外侧会有浅蓝色边框进行提示)。Sample Info以及Compare Form确认完成之后,点击左下角“CONFIRM”,进入到如下图所示参数确认界面,如信息确认无误,点击“下一步”

第四步:分析参数

分析参数分为3个大的模块:
模块一:Info&Ident
该模块主要涉及项目信息与蛋白鉴定相关参数
Project Name:输入项目名称(可以字母和数字的形式表示,不要以数字开头,不要有空格,也不要有特殊符号,项目名称需在30个字符以内)
Contam Database:污染蛋白的处理方式
Default:易算版本的污染库,选择此选项后,在进行统计分析之前会自动按照易算版本的污染库中的蛋白组成在定量表格中将污染蛋白剔除,将不含有污染蛋白的定量表格用于后续的统计和生信分析。
Upload-acc/upload-fasta(该功能将在后续版本中引入):用户自定义的污染库,上传accession或者fasta序列进行区分和剔除
None:没有使用污染库
Protein Group Type (Quant):上传的蛋白定量表格中protein group的展示方式。
Delimiter Separated:定量表格中,同一个protein group的所有蛋白显示在一个单元格中,蛋白之间以分隔符如“;”隔开,如:spectronaut,DIA_NN导出的定量表格。
Separated Row:定量表格中,同一个protein group的蛋白分别显示在不同的单元格中,显示为多行,如Peaks导出的定量表格。
None:定量表格中,每个protein group的蛋白仅有一个, 一般为预先做过protein group 的处理的表格。
Protein Group Selected Method (Quant):用于进行统计分析的蛋白定量表中protein group的处理方式,该步骤的处理是为了方便进行后续的蛋白功能注释及富集分析,需要将同属于一个protein group的蛋白进行拆分或者去除操作
Keep:保留蛋白定量表格中protein group现有的格式
List all:同一个protein group中的所有的蛋白都进行保留,在后期生信分析结果中展示为同一个protein group的蛋白拆分成多行显示,且这些同一个protein group的蛋白的定量信息一致。
Annot quantity:同一个protein group,只保留一个有注释信息且信息最全的蛋白
Order in data:同一个protein group,只保留第一个蛋白
Protein Group Type (Function):定义在进行功能注释时,蛋白定量表中protein group的展示方式。
Delimiter Separated:定量表格中,同一个protein group的所有蛋白显示在一个单元格中,蛋白之间以分隔符如“;”隔开,如:spectronaut,DIA_NN导出的定量表格。
Separated Row:定量表格中,同一个protein group的蛋白分别显示在不同的单元格中,显示为多行,如Peaks导出的定量表格。
None:定量表格中,每个protein group的蛋白仅有一个, 一般为预先做过protein group 的处理的表格。
Protein Group Selected Method (Function):定义在进行功能注释时,蛋白定量表中protein group的处理方式,该步骤的处理是为了方便进行后续的蛋白功能注释及富集分析,需要将同属于一个protein group的蛋白进行拆分或者去除操作。
Keep:保留蛋白定量表格中protein group现有的格式
List all:同一个protein group中的所有的蛋白都进行保留,在后期生信分析结果中展示为同一个protein group的蛋白拆分成多行显示,且这些同一个protein group的蛋白的定量信息一致。
Annot quantity:同一个protein group,只保留一个有注释信息且信息最全的蛋白
Order in data:同一个protein group,只保留第一个蛋白
PS:理论上进行蛋白质组定量分析时Quant和Function阶段设置的参数前后需保持一致。
模块二:Statistics
该模块主要涉及统计分析相关参数
Exclude Value:定义剔除小于设定数值的定量值,即小于设定的数值则认为该样本中该蛋白为缺失
Missing Cutoff:定义缺失值的剔除策略
为了方便理解,以下实验设计为例进行解释:
| Groups | Group A | Group B | Group C | ||||||||||||
| Samples | A1 | A2 | A3 | A4 | A5 | B1 | B2 | B3 | B4 | B5 | C1 | C2 | C3 | C4 | C5 |
| Sample wide | |||||||||||||||
| Compare wide | |||||||||||||||
| Data wide | |||||||||||||||
Sample Wide:以分组(group)为单位,组内进行缺失值的剔除,此处定义组内缺失值的比例超过多少则认为该蛋白在该组为缺失表达,即该蛋白在该组的定量值全部替换为缺失值,一般设置为70%。
Compare Wide:以对比分组(Compare)为单位,对比分组内进行缺失值的剔除和填充,此处定义对比分组内缺失值的比例超过多少则认为该蛋白为缺失表达,即该蛋白的定量值全部替换为缺失值,一般设置为70%。
Data Wide:基于全局进行缺失值的剔除和填充,一般设置为70%。
Cutoff Fill value:定义缺失值填充的方式,可选择填充为“0”或者“NA”;选择填充为0的时候,缺失值会填为0值,不进行缺失值的填充;选择填充为NA的时候,缺失值会根据Fill Method的填充策略会被进行填充。
Fill Method:定义缺失值的填充策略
1/2 global-min:全局极小值的1/2
Mean:对应蛋白的平均值
Median:对应蛋白的中位数
Global-min:全局的极小值
KNN:KNN法填充
Fill 0:用0填充
randomForest:随机森林
Fill Mode:定义缺失值的填充范围
Sample:分组(group)为单位,选择这种填充方式每个组别填充的值会有差别
Group:对比分组(Compare)为单位,选择这种填充方式每组对比分析填充的值会有差别;如有同一个分组(Group)在不同的对比分析(compare)中,该分组(Group)的填充值会有差别
Global:基于全局进行缺失值的填充,选择这种填充方式所有的缺失值填充的值为一致的。
Data Convert Method:定义数据转换方法
Log2
Log10
Row scale
Test Method:定义差异检验算法
One-way ANOVA(建议多组对比分析时使用)
ANOVA
F-test
Test(建议两两对比分析时使用)
Significance
Custom P
Mann-Whitney Test
PS:如一次分析中,提交的对比分析同时有两两对比和多组对比,只需选择两两对比的差异检验算法,多组对比会自动进行One-way ANOVA进行差异检验。
FDR Method:定义差异检验校正算法
BH
none
Quant Value:定义定量计算的组间对比的数值处理方式
Mean:用组内的所有样本的平均值进行组间差异倍数的计算
Median:用组内的所有样本的中位数进行组间差异倍数的计算
模块三:Function
该模块主要涉及功能注释及富集分析相关的参数
Enrichment Background:定义富集分析背景库的选择方法,study为本项目鉴定蛋白为背景进行富集分析,database为本项目物种数据库为背景进行富集分析
Enrich purified Terms:定义富集分析的展示结果;enrich only为只对显著富集的结果进行作图和展示;Both 为对显著富集的结果和不显著富集的结果分别进行作图和展示; 不显著富集的在结果中展示为purified。
Enrichmeng Test Method:定义富集分析检验算法
Enrichment Correction Method:定义富集分析检验校正算法
第五步:数据前处理


这一步可就前面步骤设置的数据预处理的参数进行确认以及修改,如果进行了进一步的修改,点击左下角“UPDATE SETTINGS”即可进行更新。点击“下一步”进入到差异统计环节。
第六步:差异统计

进入到差异统计界面,软件会自动设定一个相对合理的差异筛选的阈值,如左下角Param模块所示,对应该参数筛选出的差异蛋白的数目见“Diff Sum”模块。如存在多个对比分组,可通过切换“Select Compare”更换对比分组。
如果对差异统计的筛选阈值进行了修改,点击左下角“UPDATE SETTINGS”即可进行更新。点击“下一步”进入到提交分析环节。
第七步:提交分析

该界面可对project信息做一个最终预览,信息无误后带点击右下角“APPLY”提交分析任务。

