点击上方“蓝字”,发现更多精彩。

DIA方法是一种用于全面、可重复和精确蛋白质组定量的强有力的质谱方法。传统DIA数据的分析需要一个谱图库,其中包含所有可被检测到的肽段母离子及其碎片离子的强度和预期的保留时间(RT)。然后, 利用谱图库对DIA数据进行提取,由于谱图库中含有预期的洗脱时间,因此提取的离子流色谱图可以限制在色谱图中的一个预期的特定窗口。我们预测的洗脱时间越准确,所得窗口越小,就可以更快速的处理我们的数据,并且得到更高的特异性和灵敏度。

如上图,如果在整个色谱梯度内进行目标离子的提取,会出现多个干扰峰,如果我们知道预期的保留时间,就可以将目标分析集中在总XIC的一小部分上,从而提高灵敏度和数据质量。但是,如果我们的液相系统不够稳定,或者我们想要采用不同梯度生成的谱图库去分析DIA数据,由于RT在绝对尺度上是不可比较的,就会使我们的鉴定和定量结果无法达到理想的状态。因此就需要一种高精度的RT预测方法,将不同梯度的绝对保留时间进行归一化的处理,生成一个相对的索引保留时间(iRT,indexed retention time)。

那么既然要生成一个索引时间,首先需要一个保留时间量表,这个量表中需要包含若干条参考肽段,并且每条肽都对应一个由经验确定的标准化RT值即iRT值,这些肽段同时要满足信号易检测、强度基本一致,不含易修饰氨基酸、能够跨越整个液相梯度等的特性。经过各种条件的测试,最终诞生了我们目前熟知并广泛应用的iRT肽试剂盒(订购联系易算),如下图,该试剂盒包含了11条非自然存在的肽段(iRT值越小,肽段的亲水性越强,该值是归一化值,因此会出现负值):

F1. iRT肽

将11条iRT肽段掺入到样品中进行DDA/DIA/PRM/MRM数据采集时,可以得到其实际的保留时间,其中,iRT-pep b和iRT-pep l作为固定点(iRT-pep b为第二洗脱出的肽段,iRT值固定为0,iRT-pep l作为最后一个被洗脱出的肽段,iRT值固定为100),由这两条肽段,可以得出其他9条肽的iRT值(F2),从而得到一个固定的保留时间量表(F1),如下图:





F2. iRT计算

F3. 线性回归分析

F4. RT校正

根据11条标肽的实际保留时间和iRT值,可以拟合出一个线性方程iRTx = f (RT) = m × RTx + n(F3,m斜率,n为截距),该方程可被应用到样品中的其他肽段上,对其保留时间进行归一化,根据肽段的实际保留时间预测其iRT值,有了这一个标准化的值,就可以将谱图库应用到不同梯度的实验中进行数据的提取。同样的,进行DIA分析时,需要将iRT值再转换回RT值,iRT-pep b和iRT-pep l作为固定点,由这两条肽段,可以得出其他9条肽的RT值(F4),然后根据拟合出的线性方程RTx = f (iRT) = m × iRTx + n预测出保留时间用来进行DIA数据提取。

目前已有多种针对DIA数据的软件工具, 包括Spectronaut、Open SWATH、PeakView 和Skyline都可以进行RT预测。但是最初的预测方法是基于整个梯度上的线性转换,没有考虑局部波动或非线性梯度,这种情况下就不能继续采用线性模型。

Spectronaut 则使用分段回归来将RT转换为iRT(谱图库生成)和iRT转换为RT(DIA数据分析)。分段回归,简单来说就是将鉴定到的肽段,根据出峰时间进行划分,例如将整个梯度内鉴定到的肽段根据出峰时间等分为20段(包括11条iRT肽),每一段分别根据iRT-pep b(iRT=0)和iRT-pep l (iRT=100)进行线性回归校正。这时,仅11条标肽就不再满足计算的要求, Spectronaut 分段回归方法除了采用11条iRT标肽之外,软件内部还内置了一个大型的iRT标肽数据库(跨越7个物种,16种样本类型,约160,000条肽),而对于数据库中未覆盖的物种Spectronaut内置神经网络机器学习算法,可以基于内部iRT数据库对未覆盖样本中的肽段进行预测,从而实现非线性校正。

Spectronaut X

Spectronaut 新版本

分段回归将iRT的锚定点由11个扩展到数千个,从而可以得到一个稳健的回归模型用于将RT转换为iRT(谱库生成)或iRT转换为RT(目标DIA数据分析)。如下图在使用分段回归(红色)和使用线性回归(绿色)进行校正得到的提取窗口对比,分段回归可以得到一个更小的窗口,从而提高分析的灵敏度和速度。




通过iRT质控,我们可以轻松判断大规模定量数据的波动情况,如下图

尽管,iRT校正能够在一定程度上校正梯度的波动,但是为了达到尽可能理想的鉴定和定量效果,建议构建谱图库和DIA数据采集尽可能的保持系统和梯度的稳定性。如下图,左图数据来源于PXD004188,基于QE, 2h线性梯度进行DDA建库,分别采用1,2,3,4,8小时线性梯度进行DIA数据采集,鉴定结果显示,2h梯度能够得到最好的校正结果。同时易算客户也采用Evosep结合TimsTOF,将293T细胞的蛋白进行了24个fraction的分级DDA建库,建库梯度为44min,DIA分别采用22min,44min和88min梯度,可以看到最终都能得到比较理想的校正效果,但是44min的效果还是要更优于22min和88min。