---
title: "《Nature Methods》肝细胞空间蛋白组研究：实验设计思路的深度解读"
author: "omicsolution"
account: "omicsolution"
published_at: "2023-10-15T09:05:10+08:00"
captured_at: "2026-08-26T17:33:46.697809+08:00"
source_url: "https://mp.weixin.qq.com/s/CqN80nu_OFRxZD0sBtqiWg"
---

# 《Nature Methods》肝细胞空间蛋白组研究：实验设计思路的深度解读
近日，Matthias Mann团队在《Nature Methods》上发表了一篇关于空间蛋白组学的创新研究，名为“Spatial single-cell mass spectrometry defines zonation of the hepatocyte proteome”，重点探讨了单细胞蛋白质组学的新进展。

![图片 1](images/001.png)

这篇文章讲了这么一件事：这一项名为单细胞深度可视蛋白质组学（scDVP）的新技术。这项技术结合了高分辨率成像、激光显微切割和单细胞质谱分析。通过此技术，作者能够解析小鼠肝细胞的空间蛋白质组，并从单个细胞切片中达到了1,700种蛋白（中位数）的深度。

值得注意的是，蛋白质组中有一半是在空间上呈差异性调控的，特别是在中央静脉附近，蛋白质水平发生了显著的变化；而且，研究者使用机器学习技术处理蛋白质组类别和成像数据，这使得他们能够从成像数据中推断细胞的空间蛋白质组分布；单细胞DVP(scDVP)方法消除了对已建立标记或特性的依赖。这使其成为异质组织中部分或未定义的细胞亚型的有前景的方法。

为什么说值得注意？

首先，当研究表明蛋白质组中有一半的蛋白质在空间上呈差异性调控时，这意味着小鼠肝细胞内的蛋白质分布和功能在空间上存在显著的异质性。这种空间异质性可能与细胞功能、组织微环境以及相关的生物学过程有关。中央静脉是肝脏的重要结构之一，与肝脏的血液供应、代谢和解毒功能密切相关。蛋白质在中央静脉附近的显著变化意味着这些蛋白质可能在肝脏的生理和病理过程中起到关键作用。

接着，将机器学习应用于生物医学数据分析并不是全新的概念，但在此研究中，研究者成功地从成像数据中推断细胞的空间蛋白质组分布。这种技术可能会开启一种新的研究范式，允许科学家在没有直接蛋白质组数据的情况下，只通过成像数据来预测和理解细胞的蛋白质组状态。

最后，解决细胞异质性是现代生物学研究的关键挑战之一。传统的细胞生物学方法往往依赖于特定的染色或标记技术来鉴定和研究某一特定的细胞亚群，研究者必须对他们希望探索的细胞具备明确的预知。这在遭遇未知或新识别的细胞亚型时，显然是一个瓶颈。scDVP的突出优势在于，它允许研究者在无需任何预先知识或预设条件的情况下，直接对单一细胞进行深入探索。这种方法对于那些已知存在高度异质性，但其细胞亚群尚不明确或尚未完全被解析的组织（如多种肿瘤组织）来说，具有巨大的潜力。简而言之，scDVP为细胞异质性提供了一个更直观、更全面的研究方法，使我们有望更深入地了解生物系统的复杂性。

对于那些正在开展或打算进入此领域的研究者，这篇文章提供了丰富的实验和分析设计的启示。如果您正在研发与Mann课题组相似的空间蛋白组实验流程，特别是在单细胞层面，那么此篇研究将为您的实验带来宝贵的灵感。

---

一、实验细节

![图片 2](images/002.png)

![图片 3](images/003.png)

单细胞空间蛋白质组分析的实验流程

目标: 在单细胞分辨率下鉴定和定量小鼠肝细胞的蛋白质组

实验方案：

(a) 取样和冷冻:

在心脏停搏后，尽快取出小鼠肝脏；将肝脏嵌入适当的媒介中并立即冷冻。

(b) 固定、切片与染色:

从冷冻肝脏中切取10µm的切片；使用合适的固定液对切片进行固定；使用一步法对切片进行染色，确保标记PVs和CVs、窦状结构、细胞核和细胞膜。

(c) 细胞分割:

使用已经训练好的深度学习模型进行细胞的分割；将分割后的形状或mask传输到激光微切割显微镜。

(d) 使用激光微切割显微镜切取并收集细胞:

在激光微切割显微镜上自动地切取单个形态的细胞；将切割得到的细胞收集到384孔板中。

(e) 自动化蛋白提取与酶解:

在同一孔板中加入适当试剂进行蛋白提取与酶解，确保省略中间的转移步骤。

(f) 肽分离与质谱分析:

使用Evosep系统对样品中的肽进行分离；在最佳条件下将样品注入到timsTOF SCP质谱仪进行分析。

补充注意事项:

考虑肝细胞的大小为20-30µm，从10µm的切片中切取的一个形态对应于一个肝细胞的三分之一或一半。这意味着获得的蛋白输入为约250pg，与一个HeLa细胞的蛋白含量相当。

工作流优化:

根据实验需求，微调样品中的细胞数量；选择特定的肝细胞区域，从随机或特定位置进行五个形状的切割，这有助于验证实验的准确性。

Multiplex-DIA技术调整:

添加DDM表面活性剂以增强肽的回收率；调整色谱流速，确保在较低的流速下实现高离子化效率；使用IonOpticks零死体积柱以提高色谱分辨率；加入已标记的参考蛋白组，确保在mDIA过程中鉴定与定量步骤的完全分离。

---

二、鉴定与定量

![图片 4](images/004.png)

结果有以下特点:

-

a)鉴定的蛋白数量翻倍，中位数1,712种蛋白，这是在三个生物重复和455个单细胞下的结果；一个单细胞鉴定可以最多2,769种蛋白，在所有样品中共鉴定了3,738种蛋白。

-

b)排名前十位的成分包括四种组蛋白和许多转录因子。

-

c)肝细胞中产生的血浆蛋白的丰度中等，血红蛋白亚基没有被检测到（特定的蛋白如Hba、Hbb和Hbd没有被检测到），这表明样品中几乎没有或没有受到周围血液的污染（常规蛋白质组学常见问题）

-

d)检测到的蛋白数量与微切区域的面积成对数关系，说明scDVP需要尽可能高的质谱灵敏度。

-

e)数据完整性随着每个蛋白质的平均强度增加而增加。形态大小相似的细胞的变异系数（CV）小于50%，并且强烈依赖于细胞大小和沿着分区轴的位置，反映了数据中的生物异质性。数据完整性定义为一个特定蛋白质在所有样本中被定量的样本的百分比。

三、分析环节

3.1 基础分析主要步骤：

3.1.数据解析

使用基于Python的RefQuant算法获得蛋白的表达量矩阵。

3.2.样本筛选和归一化

根据检测到蛋白质数量是否低于样本识别中位数加减3倍标准差、是否在806至3,362个已识别蛋白质范围内等条件，排除部分样本。此外，还移除了PCA上异常位置处或细胞大小超过BIAS阈值（1,350 µm²）以上的样本。最后，在保留肝细胞特异性分析所需数据时，先移除动脉小管蛋白组。

3.3.空间蛋白分析

涉及数据的可视化处理，将分析的结果可视化为图形，以便于解释和表示。

3.3.1. 分类的选择：

目的：确定如何将数据分成不同的类或组。

方法：

选择20个类别用于所有比较空间分析。这与从PV到CV的大约细胞数量相匹配。为机器学习选择五个类别，旨在在有意义的分离和每类有足够的样本之间达到平衡。

3.3.2. 主成分分析 (PCA)：

目的：减少数据的维度并识别数据中的主要变异模式。

方法：使用PCAtools软件包进行PCA。这有助于了解哪些特征（在此情况下是蛋白质）对数据中的总变化贡献最大。

3.3. 统计测试：

目的：确定蛋白质组之间的显著差异。

方法：使用Limma软件包在一个至少50%完整的蛋白质数据矩阵上进行统计。应用多重测试校正，使用“FDR”。FDR<5%被认为显著。

3.3.4. 热图生成：

目的：图形化地表示数据的分布和模式。

方法：使用pheatmap进行热图绘制。在图例中指示数据矩阵的完整性。

3.3.5. 蛋白质基因集富集分析：

目的：识别特定的蛋白质集，这些集在生物学上相关，并在数据中表现出显著的丰富程度。

方法：使用WebGestalt在R环境中进行蛋白质基因集富集分析。使用KEGG或Wikipathway作为注释库。报告的FDR阈值为1。FDR <10%被认为显著。

3.3.6. 与其他数据集的比较：

目的：将当前数据与其他已发布的数据进行比较，以确定一致性或差异。

方法：使用其他研究中的数据集，例如Halpern et al.的数据集和Ben-Moshe et al.的数据集。将proteome数据分为等距的空间bins。以上，不仅可以可视化数据，还可以将其与其他相关数据进行比较。

3.4图像处理

使用Python (3.8.11)进行图像数据分析。

3.4.1 准确地从拼接后的图像中找到并提取目标形状, 通过使用Pillow提取

3.4.2. 计算边界框:对于每个形状，首先通过取每个形状坐标的下限和上限来计算边界框；然后在x和y方向上取最大和最小值；这个边界矩形被用来从图像中裁剪出相应的感兴趣区域（ROI）。

3.4.3. 带偏移量的图像提取:确保除了目标形状之外，其周围的环境也被合适地考虑和捕捉。首先计算每个边界矩形的中心，并将其四舍五入到最接近的整数。在每个方向上添加1,000的偏移量，以便额外捕获周围的环境。然后，高亮显示边界框。

3.4.4. 组合图像:

3.4.5. 手动测量距离:使用ImageJ来手动测量形状与其最近的PV和CV的距离。

![图片 5](images/005.png)

通过分析，单细胞空间蛋白组在捕获肝脏中的细胞特异性和位置特异性方面的能力，体现在如下几个方面：

1.生物有效性：

主成分分析（PCA）的应用：为了测试蛋白组数据的生物有效性，首先通过PCA降低了数据的维度。PCA是一种常用于降低数据维度的统计方法，它可以凸显数据的主要变化趋势。

PC1的代表性：PCA揭示了PC1代表了肝细胞与PV（门静脉）和CV（中心静脉）的测量距离。这意味着该主成分与肝细胞的空间位置密切相关。特别是，文章中的图3a,b显示了这一点。

肝脏分区标记的重叠：已知的肝脏分区标记物，例如Cyp2e1和argininosuccinate lyase (Asl)，在PC1上呈现出相反的视觉富集。这表明这些标记与PCA的第一主成分具有空间上的相关性，进一步证明了PCA的效果。

PC2的特点：与PC1不同，PC2并未与测量的距离或肝细胞分区标记物有相关性。相反，它更多地与细胞的骨架组成有关。这表明，除了空间位置外，细胞的其他特性（例如其结构或形态）也在这个数据集中起到了一定的作用。

2.单细胞分辨率的优势：

数据对比：文章中提到了一个问题，即单细胞分辨率是否比结合相邻形状提供更多的好处。为了验证这一点，研究人员结合了形状信息，并对在分区轴上具有相同相对位置的细胞的蛋白质水平进行了平均。

PC1的重要性增加：从结合至少两个形状开始，PC1的重要性随着四分位范围和方差解释的增加而连续增加，而PC2和所有后续PC的解释价值都减少了。这说明，与切割更大区域相比，单细胞数据能更好地捕获微妙的生物差异。

3.分区的蛋白表达：

数据分组：基于PV和CV的距离比，研究者将数据分组到20个空间区间。这大约等于沿着分区轴的细胞的最大数量。

ANOVA检验：通过在所有区间上进行方差分析（ANOVA）检验，研究者发现，在至少一半的样本中检测到的所有蛋白质中，有49%的蛋白在各个区间之间表现出显著差异。

肝细胞分区标记：总蛋白质水平的空间排序也显示了肝细胞的分区标记（见图3c和图3d）。仅有5.8%的这些蛋白在所有区间中都均等地表达。

进一步：单细胞空间蛋白组数据不仅在生物学上是准确的，而且信息丰富

4.蛋白和转录之间的比较：

分区标记的方向性：与scRNAseq数据的跨组学比较确认了最突出的分区标记的方向性，其中皮尔逊的R值为0.97。这表明在单细胞蛋白组和单细胞转录组之间，分区标记的表达模式具有很高的一致性。

全蛋白和转录的相关性：然而，所有蛋白质和转录之间的相关性较低，皮尔逊的R值只有0.12。这意味着，并不是所有的蛋白质和其对应的转录都有高度的空间相关性。

RNA或蛋白维度中的特定调控：一些蛋白质仅在RNA或蛋白维度中被调控，甚至可能呈现出相反的相关性。这表明蛋白的表达和稳定性可能受到额外的后转录调控。

与基于FACS的肝细胞蛋白组的比较：与基于FACS的肝细胞蛋白组比较时，研究人员发现标记的相关性略低，但整体重叠好。

5.功能性蛋白集合的空间富集：

亚细胞注释的添加：当研究者为数据集添加亚细胞注释时很多亚细胞性注释与总体小鼠肝蛋白组没有显著差异。观察到在体外鼠肝蛋白组和scDVP数据中，多数细胞器，如质膜的表现，都显示出微小的差异。这证实了激光显微切割技术能够适应地切除整个细胞。

亚细胞器丰度的空间变化：线粒体与内质网：从PV到CV的空间区间，线粒体和内质网的丰度都呈现下降趋势；高尔基体与核质：同样的区间，高尔基体和核质的丰度则表现出上升趋势。

线粒体蛋白质与Mitocarta的比较：当将scDVP数据与线粒体蛋白质库Mitocarta进行交叉比较时，OXPHOS的五个复合物整体减少了超过25%，但与脂肪酸代谢相关的线粒体蛋白质则轻微增加，这表明在同一个细胞器中存在差异调控。

进一步：单细胞空间蛋白组数据不仅信息丰富，而且从通路里面挖掘到了哪些信息？

6.线粒体与Wnt信号通路的关系：

线粒体部位的表达分布：线粒体是细胞的能源工厂，负责氧化磷酸化（OXPHOS）等一系列生物化学反应，产生细胞能量。在这项研究中，通过scDVP数据集，发现线粒体相关蛋白质的空间分布与肝细胞分区的主要标记蛋白质有所不同。具体来说，这些线粒体蛋白质集合在PV和CV之间的中点达到其最大的空间表达，而不是沿着曲棍球棒形状（hockey-stick distribution）增加，这是分区标记蛋白质的典型表达模式。

Wnt信号通路梯度的依赖性：线粒体部位并不依赖于Wnt信号通路梯度。尽管Wnt信号对某些肝细胞分区标记蛋白质的表达有明确的影响，但线粒体蛋白质的分布似乎并不直接依赖于Wnt信号通路梯度。这可能意味着线粒体功能或调节在分区中有其独特的调控机制，这与Wnt信号通路的调控是分开的。

7.尿素循环与氨固定：

尿素循环在肝细胞中转化氨为尿素，以防止氨中毒。

氨固定的蛋白表达：

scDVP数据显示参与尿素循环中氨固定的蛋白质在门区高表达。门区接收来自消化系统的血液，特别是经消化的高蛋白食物，释放出的氨量较高，因此门区需要迅速处理这些氨。

氨捕获的蛋白表达：

scDVP数据表明，涉及在谷氨酸上捕获氨的蛋白质在近中心区高表达。这暗示该区域存在专门的机制用于进一步处理、存储和转运氨。中心区是肝脏的血液输出区，其氨浓度相对较低，为确保氨的有效捕获和转化，该区域可能提高了相关蛋白质的表达。

8.多种信号通路的分区特征：

PPAR信号的分区特征：研究发现，包括过氧物酰化物酶增殖物激活受体（PPAR）信号在内的其他几个与信号相关的通路也呈现分区。

特定酶的表达：这通过中心部位所需的用于过氧化物体降解的超长链脂肪酸的酶的显著表达得到证实，这些酶参与例如椰子油中富集的双羧C12脂肪酸的ω-氧化。

总体上，单个肝细胞形状的空间蛋白质组数据在生物学上准确且信息丰富，并提供了对肝脏生理学的新见解。

3.2 机器学习

分析目的：探索单细胞蛋白质组与其固有的空间信息和染色强度之间的关系，确定微观图像是否包含足够的信息来预测蛋白质组。

分析步骤：

-

结合单形状蛋白质组、空间信息和染色强度，使用 scDVP 观察到与前面确定的八个蛋白质组类别之间的明显的荧光强度依赖关系。

-

结合丰富的蛋白质组和空间数据，推断微观图像可能包含预测蛋白质组的足够信息。

-

训练一个机器学习模型，使用17个特征从成像数据中预测蛋白质组类别。

-

通过 k-means 聚类将训练集分组为五个蛋白质组类别，并使用所有成像通道中的信息作为预测因子。

-

测试模型在新切片上的性能，并使用类别概率作为权重来预测空间蛋白质组。

具体方法：

计算了每个边界框的平均值、中位数、最小值和最大值以及形状面积。这些特征列表使用pandas保存；蛋白质组学数据使用k-means算法聚类成五个簇；然后，采用监督学习方法根据特征列表对蛋白质组聚类进行分类；训练过程使用scikit-learn包进行，并将数据集（n=408）随机分为训练集和测试集（分割比例为0.2）。分类时，使用RandomForestClassifier（n_estimators=200），并实现了0.90的测试准确率。

![图片 6](images/006.png)

分析确认了测量的单形状蛋白质组的准确性，并且还是预测成像区域的空间蛋白质组的强大预测器。

高精度模型：

使用17个特征训练的机器学习模型在预测蛋白质组类别上表现出色，其平均精度达到了0.94。这意味着在所有预测中，有94%的机会模型能够正确地分类蛋白质组。

需要注意的是，模型在空间上相邻的蛋白质组类别之间出现了一些分类错误。这可能是由于这些空间相邻的类别在某些特征上存在微小的重叠，导致模型难以区分。

新切片上的模型验证：

当模型在未用于训练的新切片上进行测试时，其预测的类别能够正确地在CV或PV附近定位。这一观察结果进一步证实了模型的鲁棒性和预测能力。

尽管存在切割伪影，但模型仍然能够提供精确的预测。这强调了该模型对实际实验数据的高容错率。

空间蛋白质组预测的准确性：

使用类别概率作为权重来预测空间蛋白质组，其预测与实际测量值之间的整体蛋白强度非常接近（R=0.78）。这表示模型不仅能预测蛋白质组类别，还能准确估计蛋白质的空间分布。

空间方向性的准确预测：

当预测整个部分的蛋白质组时，模型能够正确地捕获分区标记物的空间方向性。此外，它还能准确地预测这些标记物预期扩展到的中间区域。

这一结果进一步证明了模型不仅可以预测细胞内的蛋白质组，还可以为蛋白质在肝脏中的空间分布提供准确的空间方向性信息。

模型的实用性：

该机器学习模型不仅确认了所测量的单形状蛋白质组的准确性，还表现出在预测任何成像区域的空间蛋白质组上的强大能力。这意味着此模型可以广泛应用于类似的蛋白质组学研究，为研究者提供准确、高效的数据解读。

---

四、总结启发

技术进步与应用：

蛋白质组学研究的技术驱动：四项关键的技术进步，包括AI辅助的分割和激光显微切割、多重-DIA (mDIA)、低流速梯度和timsTOF SCP质谱仪的超高灵敏度，均为基于MS的单细胞蛋白质组学研究提供了可能。

机器学习的结合：利用机器学习模型仅用视觉信息就能准确预测蛋白质组类别，展现了AI与蛋白质组学研究的深度结合潜力。

scDVP工作流程及其应用：

工作流程的效率：通过整合固定、染色、成像和激光切割等步骤，可以从切片中识别高达2,700种蛋白，为分析小细胞类型或更复杂的组织环境提供了可能性。

应对核心挑战：尽管scDVP取得了显著进展，但整个工作流程的灵敏度仍是一个挑战，需要进一步的技术发展。

广泛的适用性：scDVP具有模块化特点，与多种空间组学技术，如空间转录组学、表观基因组学或多重成像相兼容。

单细胞研究的深度与潜力：

理解生物过程：单细胞的蛋白质组数据准确地揭示了肝脏细胞的生理方向和空间组织，为研究肝脏中的生物过程提供了新的工具。

磷酸化蛋白质组学的应用：结合scDVP从单细胞中获取磷酸化蛋白质组学数据具有显著潜力，尽管这可能限于高丰度的蛋白。scDVP的开放性和模块化设计，使其能够与其他空间组学技术整合，为多组学研究提供了新的可能性和方向。

提供新的研究视角：结合DVP和其他组学方法，可以丰富空间工作流程，进一步探索和理解单细胞层面的生物过程。

这些重点和启示为蛋白质组学和多组学研究提供了全新的思考方向和研究方法。

好了，以上就是今天的内容。假如你正在或者将要开展空间蛋白组学方面的课题，想找到更多更有价值的信息，请你和我们联系。假如您的朋友目前有开展蛋白组课题的想法，也请你帮我们把这篇文章转发给他。

![图片 7](images/007.png)
