“爸爸,我为什么要去上学?”
“孩子,你看到很多人是戴眼镜的。因为戴上了眼镜,从前看不见的,现在看见了。从前很小的,现在看的很大了。 从前看不分明的, 现在看的更分明了。所以上学的目的,是为了以后更能让你看清事物的本质。”

大家可还记得,在2014年末,《Nature Methods》杂志将年度技术授予了激光层照荧光显微技术(Light-sheet fluorescence microscopy)。通过这个技术,可以了解活体心脏和运作中的大脑,跟踪了胚胎发育时的细胞迁移。所以说,这个技术好比给我们戴上眼镜,把细胞看的更清楚,帮助人们看清疾病发生发展的进程,系统发育的本质。
这个技术为什么可以做到如此精细的帮助人们观测实验材料? 原因是能够以很高的3D分辨率对生物样本进行长时间的、较为温和的成像。特别是当该技术与高速照相机相结合时,就能够快速地捕捉细胞或亚细胞水平上的动态变化。那么这个技术的崛起,离不开物理学、生物学等多个领域进行跨学科合作,离不开荧光蛋白标记的发展。人们才能充分挖掘出这一技术的潜力。

在这个文章的后面,杂志也大篇幅介绍了2015年值得关注的几个新技术。有一个技术,它不像非编码RNA、新一代CRISPR在科研圈那么火,暂时还没引起大量的注意。
但DNA, RNA,蛋白质,哪一种物质更能解释生物体的表型本质 ? 生物体的外在表现,是由什么物质构建了最终的外部形态?生命通路,网络的功能节点,又是什么成分?
答案是蛋白质。人们为了对全蛋白质组进行分析,往往采用质谱来获取蛋白的信息。 在传统的基于质谱的蛋白质组学分析过程中,往往是依赖以发现为目的的高效液相色谱的鸟枪法蛋白组学(LC-MS/MS)技术,它具有强大的蛋白定性能力,但是在蛋白定量上,还是存在较为明显的缺点。
在扫描质谱图的时候,传统定性定量方式,如ITRAQ所利用的技术是利用一级全扫描检测肽段母离子,把扫描得到的信号按照强度排列,强度满足一定预设值的母离子被随机地选择、分离并进一步碎裂成更小的碎片子离子,这些子离子再进行二级扫描。所以,在母离子选择的过程中,质谱更偏向于扫描高丰度的肽段。同时也考虑了动态排除、电荷选择、背景扣除等因素,尽可能多的排除干扰因素,实现鉴定蛋白的结果最大化。因此,我们把这个方法称之为数据依赖性采集策略(DDA, data-dependent acquisition)。通过这样的方法, 再到数据库中搜索比对,获得这些是什么蛋白,它们如何表达。
但是,DDA这种采集方式方法目前出现了一些瓶颈。
一方面, 数据有丢失。就像我们之前提到的, 在母离子选择的过程中,及一级扫描的过程中,质谱更偏向于扫描高丰度的肽段。所以数据采集上,有了一定的偏好性。这样会令那些扫描低丰度的肽段的谱图,最后根本得不到识别和利用。
第二方面: 重复性差。为什么呢?我们前面提到过,即使是把满足一定强度的母离子挑选出来进行进一步的二级扫描,但由于母离子的选择具有一定的随机性,所以重现性并不好。 也就是说,同样的样品,同样的仪器,两次不同采集,其鉴定结果差别较大。一个重要的弥补方法是设技术重复,即同一个样本,同一个处理, 在质谱上多重复几次。这样以来可以对数据进行结果校准。 质量上来了,随之而来的是成本也上来了。
以上的这些问题使得蛋白质组学,尤其是定量蛋白质组学在临床研究、大规模生物学重复样品的研究中举步艰难,重复多了,成本上升巨大而重复性则一塌糊涂,得不偿失。将样品合并定量,牺牲了大量细节和背景差异,从而使得珍贵的样品无法体现其价值。
我们再回到刚才提到的2015年值得关注的几个新技术,其中一个技术可能没有引起大多数人的注意,叫数据非依赖性采集(data-independent acquisition, DIA)质谱分析法。
相对传统的鸟枪法蛋白分析法,它有哪些方面的创新?它的数据采集模式是一种新型的质谱扫描技术,它将扫描范围划分为以一定质量数为间隔的一系列区间。通过超高速扫描来获得扫描范围内全部离子的所有碎片信息,与传统的shot-gun技术相比,它能够将扫描区间内所有的肽段母离子(而不是某一部分)经过超高速扫描并进行二级碎裂,从而获得完整的肽段信息。类似地毯式的轰炸。采用DIA技术定量蛋白质组,具有较高的准确度和动态范围,可检测到蛋白质的丰度差异极大,跨越4个数量级。样一来,就可以完美弥补传统方法遗留的蛋白检出率不高, 重复性差的两个问题。
这样,我们就像拥有了一个高清的眼镜,把肽段看的更为清晰,更接近本质。

为了实现DIA分析,仪器的扫描速度需要足够快,以便在典型的色谱峰过程中能够获得足够的数据点,只有这样离子图谱才能在满意的信噪比(S/N)下进行重建。所以,新的方法对硬件设备是很大的考验。不仅仅如此,对分析软件,也是一项考验。
我们通过这个基于DIA策略的蛋白质组学方法,汇集所有的蛋白图谱是非常复杂的,其完整地记录了样品中所有物质的碎片离子图谱,得到的数据量有了质的飞跃。后续的数据分析是一个非常具有挑战性的工作。面临的问题也更多。怎么挖掘,才可以从这么广大的数据中获得信息?
传统软件无法从广大的数据中获得信息。 那是因为DIA方法采集到的数据,没有直接的母离子-子离子对应关系,因此,相较于DDA方法的数据处理流程,其数据处理流程更复杂,传统的基于鸟枪法蛋白组学(LC-MS/MS)技术软件,在这里就不能发挥自己的强项了。近几年来有相当多的科学家在这方面做出了各种尝试,那么到底哪种方式适合我们做生命科学研究的终端用户使用呢?
2016年最新一篇NatureBiotechnology对DIA进一步做了评价:"DIA approaches implement a parallel fragmentation of all precursor ions, regardless of their intensity or other characteristics, enabling establishment of a complete record of the sample" 而且在文章中,罗列了五个解决DIA 数据的软件(绝对干货啊!),标题为 “A multicenter study benchmarks software tools for label-free proteome quantification”。
这五个软件分别是:OpenSWATH, SWATH2.0, Skyline, Spectronaut 和 DIA-Umpire。并加入了Biognosys iRT Kit 进行样品的保留时间归一化。它们的数据同时来自两款顶尖质谱。数据被这五个软件分别处理好以后,再通过作者开发的评价工具LFQ-bench来进行后续分析。

这五个软件在面对同一批数据,效果如何? 作者平行对比不同DIA软件,结果显示Spectronaut软件表现尤为出色,在多次平行实验间实现了非常低CV和高灵敏度。而同时OpenSWATH也得到了最低的假阳性结果。

在图中显示的Median CV 即表格的第一列最能代表软件处理数据的性能。 通过分析我们发现,Spectronaut软件的四次结果, 分别是5.9%,6.2%,3.3%,3.3%,与其他软件的值相比,是最低的。 也就代表了数据的重复性上最好的。
另一个显著地优势在于Spectronaut 的分析速度超快并且并不需要非常强力的计算机硬件。比如下图的两个饼图。质谱仪器自带的软件(图A)与Spectronaut(图B)软件进行比较。A用了18.5个小时,42GB的空间来处理和B一样的数据,而B 只花了不到10个小时,占了30GB的电脑空间。时间上快了将近一倍。

总的来说,该文章的结论证实了DIA/SWATH策略能够同时实现高蛋白质组覆盖度、高重现性和精确定量。而最新一个版本的Spectronaut软件进一步的将处理时间缩短近半,使得DIA数据的处理不再成为瓶颈。
DIA-MS的诞生,开启了蛋白质组学领域从DDA(数据依赖性采集)转向DIA(数据非依赖性采集)的进程。这个技术意味着我们可以从同样的样本中, 提取到更多的有用的信息。人们如何看懂这些信息?除了在硬件上做了很大的技术跨越,也和软件信息工具的发展密不可分。毫无疑问这些技术会成为非常有用的研究工具,应用于生物医学的发现,帮我们了解生物的本质。
更多内容,请关注我们的微信公众号。10月27号上午9点复旦中山医院大讲堂(上海市徐汇区枫林路180号 中山医院2号楼,中山大讲堂),我们邀请了DIA技术最早的开拓者Spectronaut公司的知名专家,与您畅聊DIA技术的更多应用。本次讲座免费面向公众开放,并赠送精美礼品,现场还将进行iRT Kit试用装抽奖活动,机会难得! 具体讲座信息,请参考手机下方的原文链接。
10月27号上午9点,我们不见不散!

主办单位:
癌变与侵袭原理教育部重点实验室
复旦大学生物医学研究院
赛默飞世尔科技(Thermo Fisher Scientific)
上海易算生物科技有限公司(OmicSolution)
matchOmicsolution专注于提供蛋白质组学及其他组学研究解决方案,为您提供专业的生物信息学及实验、检测服务。服务涵盖人类、动物、微生物、植物的蛋白质分析测序、相对定量和绝对定量、翻译后修饰鉴定分析等。欢迎垂询!
更多蛋白质组学技术信息请参阅我们的官方网站:
www.omicsolution.com
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com
support@omicsolution.com
+86-18516591405


版权所有:OmicSolution