DIA在近年来越来越火,
但大部分人依然有两个固有观念:

  1. 覆盖要深还得靠TMT;
  2. DIA实验麻烦;

本文致力于破除第一个幻境,而第二个则留在下期解答。

2022 ASMS中,Biognosys官方展示了他们在OE480上2小时梯度,肺癌组织单针定量突破12000PG的结果。我翻箱倒柜找来各种文献和之前攒下的数据,为大家呈现各类不同样品的最新定量水平。

   (以下所有测试数据如无特别提及,均采用1%Pep,1%Protein Group FDR过滤,测试的数据库均采用UniProt one gene one protein数据库)

相关不常见名词含义
PG:蛋白group
SN:spectronaut
LFQ:默认为DDA采集的非标记定量流程(其实DIA也是非标记定量)
directDIA:基于DIA数据不建谱图库直接定性定量分析的流程,和LFQ的数据采集和分析流程高度相似
DL-Hybrid DIA:Spectronaut16中引入的基于deep learning结合DDA-DIA数据同时学习的DIA数据分析策略。
蛋白质组深度覆盖的基本情况
    在了解SN16机器学习到底能把蛋白检测深度提升到什么水平之前,我们得先得有个认知基线,也就是各类不同样品应该达到什么覆盖深度才是主流水平。
    DDA单针
    2018年,CNCP(由中科院计算所主办,两年一届的计算蛋白质组会议)测评采用pierce Hela digest,检测120分钟DDA,评估各个实验室的定性覆盖情况和可能的实验改进空间。在2018年,大部分质谱是QE-HF,Lumos或HF-X。

图1 CNCP 2018 Hela DDA 120分钟定性,Protein Group统计
    大部分实验室可以实现2小时检测4000-5000个左右蛋白的鉴定深度。约占Hela理论表达蛋白数(15000-16000)的1/4~1/3左右。2018年首次发表的timsTOF Pro DDA-PASEF 120分钟Hela定量结果大约6000PG,略少于第一名的HF-X。
    来到2020年,CNCP评测组要求实验室从Hela细胞处理出发,进一步做到非标记DDA120分钟定量。
图2 CNCP 2020 Hela DDA 120分钟定性及LFQ,Protein Group统计
    可以看到,在HF-X和Exploris480上,实现了120分钟约5000-6888个蛋白质的定性、定量深度。大部分新型号质谱的实验结果在6000个蛋白上下。
    即使到了2022年,PD演进到了3.0版本时的90分钟DDA数据也难以突破6000PG。
图3 PD3.0的DDA定性深度
    DDA分级
    在采用了深度分级非标或TMT后(一般至少12个分级以上),可以达到的覆盖深度能够突破10000蛋白(哺乳动物组织)。但是TMT成本高昂,批次效应明显,定量压缩显著。而LFQ定量缺失值高、准确性略低、覆盖深度不够。
    2022年 Nature Method 深度分级
    Mass spectrometry-based draft of the mouse proteome 
https://www.nature.com/articles/s41592-022-01526-y ,通过深度分级(32个分级/组织)实现了不同器官从900013000个Protein Group,小鼠全身器官和细胞一共18000个PG的定性覆盖,90%的小鼠编码基因得到质谱检测。然而这种实验耗费巨大,对操作、仪器稳定性要求极高。
    2020年 Nature 深度分级
    Mann发表的 The proteome landscape of the kingdoms of life,选择了100个物种的典型器官、细胞,同样通过深度分级,得到最多12000种Protein Group的结果,见下图,但大部分高等生物也仅能覆盖10000种不到的PG。
图4 深度分级定性数量最多的物种PG统计

    2020年 Nature Communications 深度分级
    同样在2020年,Mann精细分离不同类型的皮肤组织,通过8-16个分级,得到了极深度的皮肤组织谱图数据库(图5A数据量采用了分级DDA并开启MBR功能进行对齐,故具体数字不具代表性)
A.B.
图5 皮肤组织MBR-定性结果及关闭MBR结果

    进一步采用该谱图库进行了DIA定量,实现了平均5000个PG左右的定量深度。
图6 DIA定量结果
    2020年 GPB
    西湖大学郭天南课题组通过深度分级的人器官定性数据实现了6-8K/器官的定性深度(Genomics Proteomics Bioinformatics 18 (2020) 104–119)   

图7 GPB分级定性结果


CPTAC 癌症临床样品 标记或非标记深度分级
    CPTAC是目前全球最大的癌症多组学研究计划。发表了大量基于TMT,LFQfrac技术的实验结果,其数据汇总网站上可以查询到各个器官所能定量的基因数量。我们做了个简单汇总如下。基因数会略少于Protein Group数量,一般在1~2%误差内。
图8 CPTAC项目不同器官、技术所能定量的基因数量(所有样品加和)
    可以看到在汇总了深度分级加上大批量临床样品检测后的各个癌症样品蛋白质组覆盖深度基本突破10000大关,实现了我们平时孜孜以求的目标。不过需要注意的是,平均到单个样品的定量结果一般会减少至少10%。这也是目前TMT定量实验能达到的最高水平了。

DIA定量近年发展
    传统的基于样品混合后分级建库(相当于不标记的TMT)后,再对每个样品进行定量检测的DIA定量策略自2015年前后开始逐步得到应用。而DIA采集的技术原理我们2018年已经科普过了:
  1. DIA定量技术入门之一:DIA和SWATH-MS的“历史渊源”
  2. DIA定量技术入门之二:SWATH-MS的“那些事”!
  3. DIA定量技术入门之三:如何设计并建立SWATH-MS实验?
  4. DIA定量技术入门之四:如何进行一次SWATH-MS检测?
  5. DIA定量技术入门之五:数据分析算法介绍
    总的来讲,2016年到2022年,DIA技术的主要进步在软硬件两条路线同步发展,图9中,我简单总结了10年来,质谱硬件和DIA分析同步迅猛进步的大致情况,可以发现DDA相关技术几乎就是线性的随着软硬件的进步而提升,也就是说如果硬件不升级,软件对检索的提升只能说按部就班。而DIA则由于质谱硬件能够近乎100%的采集到进样信号的同时,机器学习的算法大踏步发展,最近几年有了迅猛的进步,从落后于DDA到逐步追上到现在可以说完全碾压非标定量并和TMT分级定量在深度上互有胜负。
图9 近年来主要质谱软硬件技术沿革及哺乳动物细胞定量结果的大致数量
2016年
    在2016年起就开始向我服务的国内科研客户开始推荐DIA技术,那时,我起的名字是:DIA-MS, ITRAQ的另一个选择;虽然在2016年我就把DIA定义为数字化无损蛋白质信息采集技术,那时DIA在Nature biotech上的表现也仅仅能够定量4000多个蛋白质。
图10  2016 Nature Biotech DIA定量测评
2017年
    在随后2017年的Spectronaut 10的更新,基于建库的定量蛋白数量已经基本可以超越同期非标定量结果。
图11 Spectronaut 10更新,实现了基于深度分级建库DIA 5600个蛋白定量
2018年
    2018年Spectronaut Pulsar更新,全面支持library free的directDIA流程,可以不建库便能进行DIA分析,不过此时的算法处于起步阶段,虽然已经大幅超越该领域开创者DIA-Umpire的结果,但仍远少于基于library的DIA分析。
2019年
    2019年是令我心潮澎湃的一年,因为timsTOF的出现让我们看到了真正100%离子采集,成为数字化保存蛋白质样品信息的曙光。
    不过此时的DIAPASEF尚处于早期发展中,其数据分析难度、速度和结果尚不能令人满意。
    这一年另一个令人兴奋的进步就是大量的机器学习算法开始陆续进入DIA数据分析领域。虽然此时各类方法的发展还都不太成熟,但是我们坚信要不了几年,DIA技术必然会井喷式发展。而我们也在其中做了一些小小的贡献。
2020年
    疫情的突然爆发让我们的各类开发计划顿时手忙脚乱,但疫情无法打断技术的发展。而我坚信的高通量、高深度、高可重复性的蛋白质组检测在2020年逐步走入了现实。  在年初,Biognosys向我们证明几百上千例的组织样品可以被精确定量,深度可以超过6000。在年中,我们的DIA定量深度逐步站稳了7000PG的大关 起飞,Spectronaut 14 测评,directDIA结果基本可以打败同时期的DDA 非标定量深度了,而其定量重复性则当仁不让的碾压了LFQ。 
    到了年底,在我们对前处理、色谱分离的致力优化以及Spectronaut14的更新后,我们向用户证明,任何人只要认真参照我们的方案,都能够实现前所未有的定量深度。 
2021年
    2021年,我失去了敬爱的导师杨芃原教授:
    在这一年,机器学习和DIA-PASEF如我所料,真正进入主流。在这一年,我们优化了大量的样品前处理、分离手段,测试了大量的样品检测,也测试了各类新的软件算法(DIA-NN, MSFRAG,MAXDIA)。
    在DIA-NN上,第一次实现了1小时梯度 8000PG以上的细胞定量深度(lib-free);
    在Spectronaut15上,第一次实现了1小时梯度 8000PG的组织蛋白定量深度。(directDIA)
    10月,我们参加了cnHUPO,也发布了自己一系列新产品和新进展。
    所做的这些都是为了实现蛋白质组学向50%+人基因组覆盖的目标冲刺。不过遗憾得留到2022年来实现。在这一年,我们也倾家荡产,购入timsTOF Pro2,为来年的爆发做好准备。
2022年
  今年是注定不平凡的一年,欧洲打成一锅粥,上海封城一季度,我们很艰难,但也很兴奋,因为随着各类前期铺垫做好充分准备和Spectronaut16更新的到来,让我们离DIA真正站到C位大大迈进了一步。
    记性不错的客户们应该听过我5年前吹:DIA的数字化无损蛋白质信息采集能够尽可能的保存所有谱图信息,方便我们未来进一步的数据挖掘。今天我来践行下当初吹过的牛:
尿液
    我们的金牌用户黄超兰、高福课题组在2021年发表的 Nature Comm研究 Immune suppression in the early stage of COVID-19 disease 中对新冠、肺炎、正常人尿液进行了蛋白质组DIA-PASEF定量。我们对该数据进行了重分析,除了软件版本升级之外,其他分析参数全部保持不变(数据库20K 人Uniprot)。可以看到,绝大部分样品可定量蛋白数量提升到了5000PG以上,最高的健康人尿液蛋白数量一举突破6000PG大关。
图12 Nature Comm原文的蛋白定量数对比新版本提升,30%提升

        实现了巨幅提升后的结果是否会很不一致呢?可以看到绝大部分原有定量结果均涵盖在内,这次我们又额外定量成功1727个PG。
    图13 新老版本蛋白一致性

组织

    黄老师总是会给我们惊喜,在她实验室自己内部测试中,也同样发现新版本的定量PG相比以前有15~25%提升,正在检测中的某脑组织大队列DIA-PASEF定量(1小时梯度)一举突破10000PG大关,直接迫近12000PG。实现如此惊人的结果既依赖于SN16高效的针对大队列DIA数据机器学习算法的提升,也高度依赖于实验室全流程实验的高水平发挥。
图14 黄超兰课题组在DIA-PASEF 1小时定量实现脑组织12000PG超高深度
    不过实事求是的说,我们自己12000PG达不到,逼近10000PG还是可以尝试的。我们重分析了匿名用户LL在2019年采集的乳腺癌DIA数据,并和目前非常火的DIA-NN进行了对比,SN16在近10年前的质谱上也实现了8000+PG/样品的定量深度。同时,50%以上样品定量PG也达到了8000PG,总定量蛋白9400PG,实现了TMT深度分级才能达到的水平。

图15 某用户3年前采集的Lumos 120分钟梯度,乳腺癌数据重分析后实现了近10000PG定量深度,50%样品覆盖7900PG
    开头提到的Mann前几年发表的Skin Atlas数据,我们对比其文献中采用的SN14版本结果,普遍提升10~50%的定量深度。fibroblast单针DIA定量深度突破8000PG,覆盖超过80%深度分级建库蛋白。
图16 Mann Nature Comm Skin Atlas DIA重分析

    当然还有我们自己在小鼠组织上的测试,实现了总定量14000PG,单个器官6000-9500PG的深度,不过往期内容已经介绍过了,不再赘述:
细胞    
    Hela细胞作为最标准的测试对象目前被翻来覆去的测试。我们翻出质控用的30分钟directDIA-PASEF数据为您展示短梯度的效果,实现稳定单针7000PG,60分钟8000PG。不过实事求是讲,单针上万还需要努力下。
图17 Hela 30分钟 timsTOF Pro DIA-PASEF directDIA结果
    客户用我司试剂盒处理的,流式细胞分选的细胞测试(timsTOF Pro 1小时 DIA-PASEF,分级建库),实现单针9000PG的超高深度。
图18 流式分选单一类型细胞1小时DIA-PASEF实现9000PG深度
血液    
    血液上的进展太多,篇幅原因请各位移步相关产品页面了解,后续我们会单独进行详细介绍。

磷酸化
    翻译后修饰定量数据种类太多,我们测试了Lumos directDIA组织磷酸化大队列结果(未发表),实现了5%~20%的可信磷酸化肽定量提升。

图19 组织directDIA 磷酸化S,T,Y肽段数量的提升
    基于DIA-PASEF的磷酸化数据暂时收集不到(Mann的最新数据尚未公开),各位敬请期待。

可信度
    列举了那么多数据,不少人一定想问,这些结果可信度到底如何?
    Biognosys 展示了基于Human depleted Plasma 1:1, E. coli 1:0.4, S. cerevisiae 1:1.3混合的数据定性+定量测试结果,可以看到提升数量的同时,正确结果数量同步提升。
图20 Biognosys 3 species可信度测试
    我也将近期测试的多套数据进行了多物种搜库的间接准确性测试。简单测试方法:分析时加入多个物种的fasta同时检索(尽可能是低同源物种),结果中去除有share pep的结果后统计非当前物种PG的占比。
    表1 多物种,directDIA或library DIA搜库结果数量及非目标物种PG占比(%FP)
样品
测试方法
结果
人血浆
(DeeP)

 dDIA
人+拟南芥+酵母
3100PG
1.7% FP
人血
(DeeP)
dDIA
人+拟南芥+水稻+小麦+咖啡+菠萝
2600PG
1%FP
GIBCO
胎牛血清
dDIA
人+拟南芥+酵母
3000PG
0.9%FP
小鼠器官
lib DIA
人+拟南芥+酵母
12000PG
1%FP
    我在本文列举了那么多突破上限的数据,落实到具体操作该如何做呢?

    有此疑问的老师敬请期待我们下一期:实操



欢迎继续关注我们给您带来的最新蛋白质组解决方案。
 上海易算生物科技有限公司 转载请注明出处
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com
support@omicsolution.com
+86-18221381405