
前言

星期六一睁眼,拿起手机,打开微信就看到“王工,请问富集效率是这么看吗?”“小王,请问怎么看鉴定到的位点数啊?”“这个M1,M2是什么意思啊?我能不能不要它啊?”揉揉双眼,心一狠,背上书包来到公司奋笔疾书,希望以后能通过点击转发就能为大家解惑。
随着DIA采集越来越普及,大家使用Spectronaut做常规蛋白质组的数据分析早已驾轻就熟,都能迅速地找到自己所需要的数据导出后用于数据分析。但涉及到修饰组,由于软件中些许概念会与以往搜库软件些许不同,所以容易引起理解上的偏差。
接下来的内容会以磷酸化修饰组数据为主,于Spectronaut directDIA-PTM Workflow入手,从搜库参数设置,结果查看,质控与位点报告导出解读,力求抽丝剥茧,助力各位更深层次理解修饰组学。
其实软件计算位点置信度打分及假阳性率拦截、区分同一条肽段上磷酸化修饰个数等相关背靠算法基本基于这篇文献,doi直接贴在这里,感兴趣的小伙伴可以直接走进全文。doi.org/10.1038/s41467-020-14609-1.
当然,本文攻略只是基础版本,进阶版本还是需要各位多多摸索啦。

一.搜库参数设置

点击“Set up a directDIATM Analysis…”建立一个分析流程→导入DIA原始数据→给该分析命名→点击“Next”→添加FASTA序列数据库→设置分析参数:BGS Phospho PTM Workflow→Modification→Variable Modification→添加你感兴趣修饰位点 →PTM Localization Filter 勾选上→Min Localization Threshold→默认值0.75→PTM Workflow 勾选→无其他特殊需求直接Skip to last,点击“Finish”即开始数据分析。

关于上图
a.兴趣修饰及其位点作为“Variable Modification”添加到相应位置,软件本身不支持open search,建议最多修饰数目不要超过5个,否则搜库速度会极慢,最好明确自己的研究目的。
b.勾选上PTM Localization Filter,Min设置到0.75,目的是为了置信度卡值,只保留置信度大于0.75的位点信息。如果想自助筛选,可以把该值设为0,就会保留所有。

关于上图,全蛋白质组分析中,软件默认将所有鉴定成功的precursors的定量值作为数据标准化的依据,但修饰组如果采用此种方式,受限于富集效率的影响,可能会引入更多偏差,所以此时,可以通过选定后续目的修饰作为标准化依据,软件就会用带有该种修饰的precursors进行数据标准化计算归一化系数,后续将此系数应用至所有肽段,包括非磷酸化部分。

关于上图(敲黑板划重点)
a.“PTM Localization”位点置信度卡值,和上上图无异,此处不赘述;
b.“PTM Analysis”,建议勾选,后续会在Report中以PTM修饰位点为中心作为数据展示,不勾选就没有;
c.“Hierarchical Clustering”问是否需要做聚类分析,默认不勾选;
d.“Multiplicity”这个是被问得最多的,其实也就是被鉴定成功的该条肽段上是否需要将单磷酸化和多磷酸化位点分别统计定量值。虽然肽段都是同一条,但是多发生一个磷酸化,相应质谱响应信号肯定就不一样,理论上分开计数最为严谨,一个磷酸化位点记为M1,两个记为M2,以此类推,再细节可以查看Manual。
e.“Flanking Region”是指以鉴定到位点为中心,读取前后7个氨基酸一同作为读取窗口,后续可用于“Motif”分析。
f.“PTM Consolidation”指向以何种方式实现定量整合,默认是以将肽段定量值sum的方式。
以上,是在搜库参数设置界面需要关注的内容,大家可根据自己需求享用。

二.“Post Analysis”里面我该看什么?

搜库结束后,可进入Post Analysis界面查看鉴定总览情况,直奔Modification Enrichment查看富集效率何如。
如下图,右键同时选中Use Relative Values(%)和Annotate data即可查看百分比(修饰富集率=含有修饰的precursors/总体鉴定precursors数量),将”Use Relative Values (%)“勾掉即可展示鉴定到含有修饰的precursor数量。
![]() | ![]() |
至于PTM Analysis中其他内容,都是基于位点为中心的进行差异分析,可参考Manual中。

三.“Report”里面我该看什么?

在Report中点击PTM Site Report,展示形式分为Normal Report和Pivot Report,前者囊括信息最全,但数据量很大不便于结果查看,常规情况下查看Pivot Report即可。
先普及一下基本概念:关键字解读:Protein、Protein Group、Peptide、Modified peptide、Precursor
(基本概念不认真读,再来问我就会生气,生气了就拖更下一part!强硬!)

关于上图,“PTM.CollapseKey”列作为唯一值向后分析,对应值为“蛋白(protein)_修饰种类及位点_单or多磷酸化分类”,后四列均为对该列进行拆分展示,便于筛选。
当你想要统计该项目所鉴定到磷酸化位点数时,可对“PTM.Modification”列进行筛选留值,当你想要统计该项目中某样本所鉴定到磷酸化位点数时,可在此基础上去除样本对应列缺失值,统计剩余有值部分即可。
如果不需要对磷酸化个数分开进行统计,可在搜库参数界面不勾选“Multiplicity”。
“PTM.CollapseKey”中超过3的都是在这一列均记为M3。

关于上图(又敲黑板划重点)
“PTM.FlankingRegion”列可用于Motif分析。
“PTM.Group”,每个样本会对应一列,数据展示形式与“EG.PrecursorId”类似,对应某个位点在该样本中的“PTM.Quantity”定量值是由对应PTM.Group中的“EG.PrecursorId”的定量值加和。看鉴定位点归属的肽段,就去这一列看。
“PTM.SiteProbability”为对应位点置信度打分,默认大于0.75的才会被留下,否则就是Filtered。
今天到此为止,我要去吃饭了,下一次更新内容会涉及:只统计肽段以及肽段定量值该如何操作,位点可视化相关,数据质控,如何进行全蛋白质组本底扣除以及如何利用小工具进行后续生信分析。或者还有啥看到的,欢迎评论区留言!
886!
p.s. 图有点糊的话烦请各位参照自己软件上阅读查看,年底我们服务器的CPU各个都是100%,点一下要等很久才会动一下,截图好难(ㄒoㄒ)


