文章题目:Initial recommendations for
performing, benchmarking and reporting single-cell proteomics experiments
本文重要性:
1、文章介绍了通过串联质谱(MS)分析单个细胞中的蛋白质已经成为技术上可行的方法;
2、强调了影响实验设计、样品准备、数据采集和数据分析的诸多因素,这些因素可能影响结果的准确性和可重复性;
3、提出了项目执行的标准化指标,以增强实验的严谨性、数据质量和实验室之间的一致性;
4、提供了单细胞蛋白质组学实验的最佳实践、质量控制和数据报告建议,有助于广泛采用可靠的定量分析流程。
以及,文章提供了相关资源链接(https://single-cell.net/guidelines),便于读者进一步了解和探讨单细胞蛋白质组学的相关问题。

图片来自https://single-cell.net/guidelines网站

Fig. 1: Emerging
applications of single-cell proteomics by MS(通过MS进行的单细胞蛋白质组学的新应用).
图1概括了单细胞蛋白可以有哪些应用?分为以下几个方面:
单细胞蛋白质组测量可以确定细胞类型和细胞状态簇(cell clustering)
支持拟时序推断(pseudotime inference),以推断细胞在发育、分化或其他动态过程中的相对时序。通过这种方法,可以将无序的单细胞数据组织成有序的连续轨迹,从而揭示细胞在某个生物过程中的发展顺序和状态变化。
将蛋白质水平与功能表型(如吞噬活性)联系起来(phenotype and proteomic profiling)
定量蛋白质共调控(Protein-Protein joint distribution)并将其应用于研究蛋白质复合物(protein complex analysis)
分析蛋白质构象\定量蛋白质修饰(post-translational modifications),如磷酸化等
将来自相同生物系统的蛋白质和RNA数据整合(Pro-RNA joint distribution),可以推断转录和翻译后调控,得以研究转录因子和下游靶转录物的共变情况
虽然单细胞质谱具有巨大的潜力,但其对实验和计算偏差非常敏感,可能导致数据质量和可重复性的问题。为了降低偏差并提高单细胞蛋白质组学的准确性和可重复性,作者提出了关于实验设计、数据评估和解释、以及报告方面的初步建议。
1、实验设计
单细胞质谱的最佳实践应借鉴以往质谱分析的经验,比如建议采用随机化的生物和技术重复试验,并在样品处理过程中使用不同批次的试剂。此外,还应包括适当稀释的批量样本作为技术质量控制。
1.1 单细胞分离
样品制备的主要目标是在最小干扰的情况下保留细胞的生物学状态,假如从组织中取得标本,需要对蛋白酶解,这可能会裂解表面蛋白的细胞外结构。
为了避免潜在的人为干扰,可以使用更温和的细胞分离方法,比如螯合稳定细胞外蛋白相互作用的阳离子,将其降至最低。解离的单细胞应彻底清洗,以尽量减少MS样品与用于组织解离的试剂的污染。
虽然蛋白质通常比转录本更稳定,但大多数用于分离细胞进行单细胞RNA测序(scRNA-seq)和流式细胞仪的办法,如在低温(4℃)下快速处理样品,也适用于蛋白质组学。细胞分离过程的时间和其他参数可能会产生影响,因此应记录下来,以便在下游分析中考虑到与样品分离有关的技术影响。
许多研究已经使用流式细胞仪从单细胞悬浮液中分离细胞。流式细胞术可以表现得非常好,然而,在缺乏高性能分选仪和专家操作员的情况下,它可能是工作流中最不稳定的步骤之一。因此,验证流式细胞仪稳定地分离单个细胞的能力可能会为解决下游分析步骤中的故障节省大量时间。此外,一些研究还通过cellenONE技术分离单个细胞,与流式细胞仪相比,它支持更温和、更稳定的分离,这对原代细胞尤为有益。
在分析组织中单个细胞的蛋白质组时,应尽可能地表征空间背景,包括每个细胞在组织中的位置以及其周围的细胞外基质。尽管这是一个很好的领域,但这类单细胞质谱蛋白质组分析仍处于起步阶段。可行的空间分析方法包括用冷冻切片机进行组织切片以及激光捕获显微切割(LCM),可用于提取单个细胞。LCM已用于空间分辨提取和随后的组织区域质谱分析。采用plexDIA和同位素载体技术显示了将此类分析应用于通过LCM提取的单细胞的潜力。文章建议避免使用需要从洗涤剂中进行清洗的组织破碎方案,而是优先选择使用仅含质谱兼容试剂的方法。
1.2 处理污染
在单细胞蛋白质组检测中减少污染物的重要性。污染离子可能来自多种来源,包括样品制备过程中使用的试剂、不纯的溶剂、与样品接触表面的可提取物和溶出物,以及在液体处理、仪器组件、毛细管和固定相(如针头冲洗液和液相色谱中的柱保留分析物以及毛细管电泳中的储液池)中可能残留的前次单细胞或整体运行的肽。
尽管这些残留肽在连续样品中的定量贡献通常可以忽略不计,但在大量样品与单细胞运行交错时,这些大量样品中的残留肽可能会对单细胞产生的肽含量产生重大污染甚至掩盖。因此,大量样品运行中的污染物通常与同一液相色谱-质谱系统上的定量单细胞分析不兼容。在分析单细胞样品之前,需要严格评估并确保分析柱无残留物。其他非肽类污染物(如溶出的塑化剂、邻苯二甲酸酯和空气中污染物产生的离子)通常表现为单价离子,可以通过离子迁移方法或简单的空气过滤设备来抑制。
由于单细胞制备中样品制备体积与蛋白质含量之比显著增加,因此在单独准备单个细胞时,试剂与蛋白质含量之比也相应增加。因此,减少样品制备体积可以减轻来自试剂(如胰蛋白酶或质量标签)的污染离子的影响。事实上,将样品制备体积减少到2-20纳升,与多孔板方法相比,可以按比例减少每个单细胞的试剂量,从而减少污染。
1.3 样本准备
理想的样品制备应包括尽量减少样品处理、相关损失和污染物引入的最小步骤。对于自下而上的蛋白质组分析,工作流程必须包括细胞裂解-蛋白质提取和蛋白酶消化步骤。由于单个细胞中仅含有皮克克级别的蛋白质,因此在后续分析中,最大限度地减少污染物并最大限度地恢复样品至关重要。幸运的是,来自患者和动物的单个细胞的组成和几何形状适合在相对温和的条件下进行破坏,例如冷冻-加热循环或非离子表面活性剂。这些干净的裂解方法优于需要在质谱分析之前进行容易造成损失的清洁处理的质谱不兼容化学处理(例如,十二烷基硫酸钠或尿素)。
将处理体积缩小至纳升级别可以减少暴露在可能吸附表面的风险。低微升量的样品制备方法提供了广泛的可访问选项。无论选择哪种制备工作流程,建议批量制备尽可能大的细胞以减少样品处理中的技术变异。为此,已经成功地将几种液体处理工具与单细胞蛋白质组工作流程结合,以提高通量并减少技术变异。
1.4 批次效应
只要有可能,处理和分析批次必须随机,以便对批次效应进行校正(估计并从数据中去除批次效应)或建模(例如,将批次效应作为模型中的协变量)。
1.5 统计效能
取决于效应大小、检测的准确性和精确性,以及每个条件下分析的单细胞数量。具有大效应大小的简单实验,如分析不同的细胞系,只需几十个单细胞就能达到足够的统计效能。这样的实验作为演示分析工作流程的原理验证研究很常见。
相比之下,包括原代细胞、较小的效应大小(例如一个细胞类型内的蛋白质变化)或多个治疗组或患者队列的实验设计需要更多的单细胞和患者,以达到足够的统计能力。
1.6 使用不同的MS来交叉验证
作为一个例子,有人观察到在一簇黑色素瘤中存在着表型状态和蛋白质共变的梯度。作者通过用pSCoPE和用plexDIA来分析黑色素瘤细胞,两种方法的结果被直接比较并平行报告,这样可以评估生物和技术的可重复性。交叉验证分析也可以用于使用不同的样品制备方法或蛋白质消化的酶。在这样的交叉验证分析中,由多种方法和生物重复支持的定量趋势更有可能反映生物信号,而不是方法特定的假象。
2 、数据评估和解释
2.1 定义和评估可重复性
数据的可重复性和评估可以在几个不同的难度水平上进行,即重复、再现和复制。重复一个计算实验或分析只是简单地使用完全相同的数据、代码、软件和环境(通常是同一台计算机),假设这些仍然可用。
再现一个实验或分析是由另一个人尝试模仿原始设置,通过下载数据和代码,而不一定具有相同的软件环境。
复制则是更大的挑战,它需要使用新的代码、实现和/或软件来获得结果;这只有在对所进行的分析进行详尽和详细的描述时才可能。这种描述必须包括所有使用的软件和数据库的版本以及所有搜索参数,最好保存为结构化文档,例如 xml。
2.2 批次效应和细胞特性
在再现单细胞蛋白质检测时,应考虑两个因素。
首先,没有两个细胞是完全相同的。因此,文章可以合理地期望再现细胞群和趋势(例如不同细胞类型或细胞状态之间的蛋白质丰度差异),但不能再现每个分析细胞的精确分子水平。
其次,批次效应可能干扰你的再现结果,因此,对再现的评估和报告需要具体说明正在再现什么,以及如何受到所有步骤(从细胞分离到数据处理的过程)产生的批次效应的影响。
2.3 定量准确性的评价
定量准确性是衡量测量结果与已知真实值之间的接近程度的指标,例如实验者确定比例混合的蛋白质组(图2a)。
为什么说仅凭可重复性是不足以评估数据质量?
当真实丰度未知时,无法评估准确性,有时会与重复性或精确度混淆。然而,正如图2a所示,数量可能有很大的差异。同样,重复实验之间的高相关性可能被解释为测量结果具有定量准确性的证据。然而这种解释是错误的:许多系统误差可能导致错误的测量结果,尽管这些结果具有很高的可重复性。因此仅凭可重复性是不足以评估数据质量的。

Fig.
2: Evaluating and interpreting single-cell proteomic data.(评估和解释单细胞蛋白质组数据)
a. 定量准确性是指通过无标DIA分析测量的样品A和B之间的蛋白质比例与由虚线表示的相应混合比例之间的关系。有些蛋白的定量精度高,但准确性低(例如核糖体蛋白L8(RPL8)),而有些蛋白质的定量准确性高,精度低(例如RelA)。
因为单细胞蛋白质组学对基于质谱测量的灵敏度要求非常高,所以测量质量取决于从每个单细胞群体测量到的离子数量。例如,如果采样离子太少,采样的随机性会导致计数有噪声,当采样的离子数量过少时,可能导致结果的低精度。这里的低精度是指技术上的蛋白质丰度变化,与生物变异性(即生物体内的自然变化)不同。1:1的混合比例可以用来评估离子采样和精度,但不能评估准确性,因为这个比例对系统偏差(如共隔离和干扰)不敏感。
为了评估准确性,可以将不同物种的蛋白质组按照已知比例混合。这样,可以根据已知的混合比例与测量结果之间的差异来评估测量的准确性。通过这种方法,可以检测到由于系统偏差导致的误差,并提高蛋白质定量的准确性。
通过使用尽量减少偏差的质谱方法,可以帮助降低误差。如果能将所分析的细胞类型作为整体样本分离,那么这种方法还可以包括来自已建立的整体方法的相对定量。另外,可以通过在已知比例下加入相应的肽段,或使用尽可能独立的测量方法,例如荧光蛋白来估算部分蛋白质的准确性。
定量精度和准确性是两个不同的指标,其重要性取决于分析的目的。例如,细胞聚类需要高精度测量,但可以容忍较低的定量准确性。相反,蛋白质共变分析和生物物理建模更依赖于定量准确性。因此,应该明确区分准确性和精度,并关注与生物学目标更相关的指标。
绝对蛋白质强度之间的比较可能导致误导。例如,T细胞和单核细胞蛋白质组之间的高相关性可能被解释为两者非常相似。然而,许多蛋白质在T细胞和单核细胞之间的丰度存在差异。因此,不应将绝对蛋白质丰度估计之间的相关性用作相对蛋白质定量的基准。

b. T细胞和单核细胞的蛋白质组具有很强的相关性,c. 这两种细胞类型中许多蛋白质的丰度不同。
2.4 评价内部一致性
在非专门设计的基准实验中,真实的蛋白质丰度是未知的,因此无法直接评估定量的准确性。然而,文章通常可以通过比较以下两种情况下质谱测量结果的一致性来评估其可靠性:(1)同一肽段的不同肽段片段;(2)来源于同一蛋白质的不同肽段。
例如,可以通过比较一个肽段基于其前体和片段的相对定量来评估该肽段的相对定量的内部一致性,如图2d中单细胞plexDIA数据所示。这种(不)一致性程度可通过这些估计的变异系数(CV)来估计。类似地,根据来自同一蛋白质的不同肽段的相对水平估计的CV可以提供可靠性。

d. 这部分描述了一种通过plexDIA技术对单细胞进行质谱测量的方法。这个方法可以对蛋白HMGA1中的一个肽段进行定量分析。这些数据使研究人员能够在MS1和MS2两个层次上对肽进行定量,并评估这些定量结果的一致性和可靠性。在这个例子中,从前体(桃色)估算的相对水平与相应的求和片段(绿色)估算的相对水平一致。在MS1和MS2水平上,根据接近洗脱峰顶的三个扫描获得三个估计值。这种方法可以用于研究胰腺导管腺癌(PDAC)和单核细胞(U-937)细胞之间的蛋白质差异。
注意:这种CV与使用绝对肽段强度计算的CV或在重复实验中计算的CV非常不同。在后一种情况下,在比较不同分析或实验条件下的CV时,必须考虑数据集大小的变化;也就是说,为了进行公平的比较,我们应该只关注在所有实验条件下共同出现的肽段和蛋白质,而不是那些仅在单个实验中出现的特异性肽段和蛋白质。这样可以确保我们在比较时不会受到特定实验条件下独特识别的肽段和蛋白质的影响。
2.5 单细胞蛋白组的归一化
单个细胞的大小不同,因此蛋白质含量也不同。细胞大小是细胞间蛋白质强度差异的主要干扰因素。这里的基本归一化策略包括从对数转换的蛋白质数量中,减去各自定量的蛋白质的中位数。
然而,如果被定量的蛋白质子集在单个细胞之间有很大的不同,那么上面提到的这种归一化就不合适。这种变化可能源于细胞间蛋白质总量的差异或实验差异,这可能导致缺失值和准确定量的蛋白质数量的差异。在这种特殊情况下,归一化应该基于一个共同的蛋白质子集或针对一个共同的参照。
因此,单细胞MS蛋白组数据的处理在未来可能会随着更先进的归一化策略的发展而得到改善,为了补偿不完美的归一化,文章建议在下游分析中加入一个代表细胞大小的变量,如从LC-MS数据中估计的总蛋白含量或从流式细胞仪中估计的FSC(与细胞的大小和形状有关),作为协变量。
2.6 管理缺失的数据
处理缺失值在单细胞蛋白质组学中,这些问题往往比典型的常规蛋白组实验更普遍,因为一些蛋白质可能低于检测极限(特别是在较小的细胞中),或者可能不是在每个单细胞中都被送去做MS 分析。后面的问题可以通过使用DIA或者优先级数据采集可以大大增加数据的完整性。
许多分析可能只使用观察到的数据(不使用推算值),这就假设观察到的数据能够代表缺失的数据。然而,常常需要对缺失值进行填充(使用推算值),因为这样可以进行更多的下游分析,并且可以对缺失机制进行明确的建模。
在确定适当的推算方法时,做推算应该考虑到缺失数据的性质(例如,随机缺失或非随机缺失)。缺失的类型是由导致缺失值的机制决定的,这取决于质谱分析期间的肽取样算法。使用topN启发式的霰弹枪方法引入的缺失值更有可能是随机发生的,因为它们源于MS 扫描时对前体的随机选择。相比之下,DIA和优先方法大多数缺失值可能对应于低于检测极限的肽,而不是那些随机缺失的肽。
专门用于单细胞蛋白质组学的综合归因方法还没有被开发出来,虽然最近开发的一些用于scRNA数据的方法可以适用于蛋白质组学,但最终,该领域需要专门针对导致肽和蛋白质丢失的机制的方法。
使用不同的缺失数据模型进行数据填充要谨慎,以进一步了解结果敏感性。一个简单的策略示例是对填充后的数据执行下游数据分析(如主成分分析 PCA),并将结果与未填充数据的分析结果进行比较。对不同类型填充模型不敏感的结果更为可靠,而对那些取决于关于缺失的特定假设的有效性的结果则应持怀疑态度。
2.7 降维
高维单细胞数据经常被投影到低维流形上,以帮助可视化和去噪。虽然这样的投影是有用的,但减少的数据表示是完整数据的不完全近似,往往会失去数据的某些方面,如图2e所示,将一个三维数据集投影到不同的二维投影中。因此,不同的低维投影可能会有选择地突出数据的某些方面而掩盖其他方面(图2e)。

e. 讨论了不同的降维方法对数据处理的影响。在这个例子中,研究人员模拟了三个细胞状态的三维数据,一个细胞状态(绿色)逐渐分化为两个不同的细胞状态(蓝色和红色)。当将这些数据降低到二维时,会丢失一些信息。例如,PCA方法会将早期(绿色)和中间(灰色)细胞混合在一起;t-SNE方法不能正确捕捉三个群体之间的距离;而扩散图方法无法捕捉数据中的噪声,并压缩了早期状态的细胞。部分强调了在实际研究中选择合适的降维方法的重要性。
在最坏的情况下,它们可能严重扭曲原始数据。因此,文章建议降维需要进一步审查。如细胞的聚类,应该对高维数据进行验证。验证可以很简单,如计算和比较高维空间中细胞之间的距离,正如基于单细胞RNA和蛋白质数据定义的巨噬细胞集群的那种方法。
虽然降维可以帮助我们更好地可视化数据,但它不能充分评估单细胞数据的定量。降维仅表示细胞是否在低维空间中聚类,但不能说明是什么因素导致了这种聚类。事实上,降维只能解释数据中的部分变异。
例如,PCA方法相对容易解释,但其他非线性方法(如t-SNE和UMAP)可能受到参数选择的影响,导致结果具有主观性。因此,在使用低维表示法时,建议也查看高维空间中的距离。例如在簇内和簇间单细胞之间的成对距离分布。
当降维用于细胞聚类时,我们建议加入阳性对照。这些对照可能是由来自与感兴趣的单细胞相同群体的纯化细胞类型组成的大量样本(如果可能进行此类分离)。这些阳性对照应与单细胞同时准备。接下来,阳性对照和单细胞可以同时在低维流形上投影。这种类型的分析为评估聚类模式提供了有用的证据:阳性对照和相同类型的单细胞聚集在一起的程度表明了测量的一致性。为了进一步确定样本准备是否驱动聚类,我们还建议评估主成分是否与技术协变量(如批次、缺失值率或质量标签)相关,并在需要时对这些依赖关系进行校正。
2.8 结果过滤
如上所述,对缺失数据的假设和降维方法的应用会大大影响最终结论。设定阈值(如排除失败的单细胞或干扰过高的肽段)也会对结果产生影响。这些选择应该基于客观的原则,例如从对照组中得到的真实和假发现率。当阈值设置基于主观选择时,应明确说明,并将其视为结果中的不确定性来源。结果应清晰地展示对实验和方法选择的敏感性。
2.9 解读单细胞的蛋白质组数据
随着数据生成技术的进步,多肽鉴定的算法也在不断发展,以利用大量蛋白质组学数据中越来越多的特征集。在单细胞水平上测量的特征可能与相应的整体样本的特征有很大的不同,因为丰度低的片段可能检测不到,而其他片段相对于背景来说信号较低。为了克服这些挑战,可以努力开发在单细胞水平上具有很强区分能力的稳定模型。这些模型可以将其他特征与搜索引擎的结果结合起来。
为了避免错误识别,我们建议仔细检查那些在单细胞中被识别出来但在整体样本中未被识别的肽段。这些识别可能是错误的,因此应该检查支持它们的光谱(如提取的离子电流)并重新评估数据分析方法。
为了提高蛋白质组覆盖范围,我们可以设计新的搜索引擎并优化利用数据中的规律,例如精确已知且可测量的质量位移。目前的单细胞蛋白质组质谱方法可以测量大量的肽段特征,但在1% FDR下,只有很小一部分特征被分配到序列。成功解决这些挑战的模型将使识别率接近整体实验水平,并扩大单细胞蛋白质组学在生物医学研究中的应用。
最后,文章强调了报告的标准,包括实验设计和方法描述、数据和代码共享、结果报告。
由于该领域的快速发展,具体描述方法比仅仅引用其他文献中的“如前文所述”的方式更受青睐。报告结果时,应明确结果所指的数据。例如,在报告变异系数(CV)时,需要明确指出是对数转换数据的CV还是线性尺度上的CV。CV可以用于量化非常不同的数量,如质谱运行间的重复性或基于不同肽段的蛋白质定量一致性,因此必须明确指定确切的数量。同样,研究人员应系统报告影响结果的数据的主要特征以及在数据分析过程中如何观察和处理这些特征。这通常包括缺失值和批次效应。可重复性要求超越最简化的“材料和方法”部分,这些部分通常无法描述样本和数据的处理以实现复制。
通常,研究包括多组原始、识别和定量文件,解决不同的研究问题,如不同的仪器或质谱设置、不同的细胞类型或生长条件以及不同的个体。建议将文件分成不同文件夹,遵循一致的结构。上文提到的高级README文件应描述每个文件夹对应的内容,每个文件夹都应包含自己的README文件,详细描述其内容和这些文件组旨在解决的具体问题。
数据获取策略对单细胞蛋白质组实验中蛋白质数量和质量有很大影响。报告质谱采集细节对于数据重新分析可能并不必要,但如果没有关键信息,获取相似数据可能变得很困难。智能数据获取策略的出现使这个问题更加突出,因为这些策略通常使用更高级的非标准参数或第三方软件。
幸运的是,大部分原始数据文件都包含了分析所需的参数。理想情况下,这个软件应该描述底层算法,以便他人可以重现类似的方法。
