在假期结束之际,我们继续关注科学前沿。体液(血液,脑脊液,尿液、灌洗液等)蛋白组学研究一直是很多人关注焦点,其中德国马克斯·普朗克生物化学研究所Matthias Mann团队的工作一直处于领先地位。随着技术的进步,引入自动化高通量样本准备流程、与时俱进的质谱技术和机器学习方法,Mann课题组显著提升了数据的准确性和处理效率,加速了从科研到临床的应用转化。
今天,我们精选六篇,接下来逐篇盘点。
矩形策略,即给尽可能多的个体和条件测量尽可能多的蛋白质,为了快速和自动化的工作流程而设计。与三角工作流相比,初始发现队列会更大。
此研究来自两个独立队列(第一个队列称HBS队列、第二个队列称LCC队列)共215个人的脑脊液样本,包括113名健康对照(HC)和102名PD患者。用于识别PD 潜在生物标志物,以及研究与LRRK2 突变相关的生物学途径。
深度定量的自动化流程是怎么做的?
先说结果:利用较少(40微升)的脑脊液,而且没经过去高丰度或者是低丰度富集就鉴定了超过1700种蛋白,在2022年相当厉害了。
首先将40 μL脑脊液样品分装到96孔板中与裂解缓冲液混合,以便进行后续的蛋白质处理。这一步骤利用iST技术(inStageTip),实现蛋白质的裂解、变性、还原、烷基化及酶解等多个步骤的一体化处理,并完成肽段的纯化。随后,为了创建队列特异性蛋白数据库,每个队列随机选24个样品进行合并。合并后的样品通过高pH反相色谱进行肽段分离,使用“spider fractionator”自动串联收集肽段,每120秒自动切换收集管,确保分离的均匀性和重复性。为了进一步增加数据库的深度,通过超速离心从混合CSF样本中分离细胞外囊泡(EV),并对其进行了与前述相同的消化和纯化处理。采用数据独立采集(DIA)和数据依赖采集(DDA)策略,以获得全面的蛋白质覆盖。
最后,通过Spectronaut软件处理质谱数据,构建针对不同队列的hybrid spectral
libraries,该混合库的三个来源分别是 a)由24个合并的脑脊液样本组成的数据依赖性采集(DDA)构建的库;b)另一个 DDA库,由从混合的 CSF 样本中富集的细胞外囊泡组分构建; c)从所有样品的DIA分析中生成的direct-DIA库,Spectronaut软件继而进行数据过滤和定量。
HBS和 LCC 队列分别产生了 1493 和1626 种蛋白,其中 1300 多种共同鉴定到。平均每个脑脊液样本得到 1357 (HBS) 和 1481 (LCC)种蛋白。
两个独立脑脊液PD队列的基于MS的蛋白质组学分析
标志物的发现过程是这样的:
多变量协方差分析(ANCOVA),把年龄、性别、LRRK2和GBA基因突变状态等算作混杂因素,对帕金森(PD)患者与健康对照组之间的脑脊液蛋白组差异做评估。在两个不同的研究队列(HBS和LCC)中,分别识别出几种与PD显著相关的蛋白质,包括CPM, OMD, RFNG(HBS队列)和PRCP(LCC队列)。
很遗憾,队列之间差异表达分子重叠较少。其中的一个原因可能是多中心LCC研究中的样本采集方案不那么严格。尽管如此,接下来文章将HBS和LCC队列结合起来,以确定可靠的特征,并使用XGBoost机器学习模型对PD患者和健康对照组进行了区分,其中模型的表现(AUC值)为0.72,展示了矩形策略的价值,即使在样本收集不严格或者不一致的情况下也能够得到区分疾病状态的PD相关蛋白。
脑脊液蛋白质组的PD 相关改变和基于机器学习的 PD 状态分类
此外,对携带LRRK2 G2019S突变的个体的分析显示,, LRRK2 G2019S突变显著增加了多种与免疫和炎症响应相关的蛋白,如HLA-DRA、HLA-DRB1和HLA-DPA1的表达。该研究强调LRRK2 G2019S突变能通过改变与免疫调节相关的蛋白表达来起作用。
致病性LRRK2
G2019S突变对脑脊液蛋白质组的影响
影响因子:11.1(EMBO Mol Med)
题目:High-resolution serum proteome trajectories in COVID-19 reveal
patient-specific seroconversion
链接:DOI: 10.15252/emmm.202114167
方向:纵向队列的疾病监测
质谱规模:700+
年份:2021
看点:三年前如何实现12天720份血清样本检测
文献2研究内容
12天完成720例血清蛋白组从样本制备到生成 MS 原始数据和数据分析,放在2021年是奇迹,尤其值得一提的是,这720个样本的肽段消化到纯化的样本前处理仅用了一天时间完成,这一成就在没有自动化设备的支持下难以想象。
纵向取样以及LC/MS系统的蛋白鉴定自动化工作流程
以往研究(2021年之前)采样策略通常是具有单个或几个时间点的小规模研究。然后与对照组相比识别整体趋势。而本研究采样更密集,是究通过在15个不同时间点上追踪COVID-19患者的疾病进展,覆盖了高达54天的血液采样周期,使用液相色谱Evosep One(60 SPD,梯度长度为21分钟)和Bruker timsTOF Pro系统,精确定量了502种血清蛋白。这些蛋白来自31名COVID-19患者的458份纵向血清样本和262名表现出COVID-19症状但阴性的对照组患者的血清样本。
通过这种方法,研究绘制了COVID-19感染后宿主响应的动态变化表达热图,帮助理解疾病机理。
首先,尽管定量到的血清蛋白在当今看来深度不高(502种血清蛋白),但通过比较COVID-19患者与对照样本,发现约26%的血清蛋白(130/502种)在疾病过程中发生了显著变化,提示COVID-19引起的血清蛋白质组广泛重塑。
通过时间轨迹,能够观察到三个主要的蛋白质变化的类别:类1是随住院时间逐渐减少的蛋白,主要与先天性免疫系统相关,类2是逐渐增加的蛋白,主要与脂质稳态和凝血功能相关,类3蛋白在前三周增加后开始下降,主要由免疫球蛋白组成,这在2021以前的工作中尚未报道。
血清蛋白质组不仅可以看队列水平的变化,在个体水平上也同样显著。
COVID-19 中差异调节蛋白的高分辨率轨迹和形成的蛋白簇
使用了五种不同的抗SARS-CoV-2免疫测定来检测各类抗体,并分析了这些免疫测定结果与质谱技术测得的血清蛋白之间的相关性。重要的发现是,这些针对不同抗体的免疫检测与通过质谱蛋白质组学方法定量的广泛免疫球蛋白区域表现出好的相关性。
血清质谱蛋白与 SARS-CoV-2 抗体检测的相关性良好
本研究的特色是高分辨率时间轨迹。由此在长达几十天的血液采样周期里面,精确追踪了COVID-19患者的SARS-CoV-2抗体分泌和血清转化,获得抗体从生成到达到峰值的全过程,并能揭示了显著的个体差异。即使在那些常规抗体测定未显示但是实际上有明显反应的个体中,通过这种高分辨率质谱分析也能够识别出响应病毒感染的关键蛋白质。
比如在一些病例中,尽管抗体免疫测定的信号弱,质谱分析却能显示出免疫球蛋白区域的显著增加,其表达倍数与免疫测定中检测到的阳性反应患者相似。这表明质谱技术能够捕捉到更细微的免疫反应变化,这些变化可能在使用传统方法时未能被检测到。
此外,通过质谱检测,观察到了FCGBP(IgGFc结合蛋白)的水平变化,这种蛋白在先前的研究中已被发现在自身免疫疾病患者的血清中表达上调。在本研究的COVID-19患者样本中,FCGBP的变化与抗体生成过程中的不同阶段相一致,表明其可能是感染后免疫响应的重要标志物。
COVID-19 血清转换期间的抗体分泌
影响因子:8.9(J Cachexia Sarcopenia Muscle)
题目:Plasma
proteome profiling of healthy subjects undergoing bed rest reveals unloading-dependent
changes linked to muscle atrophy
链接:DOI:
10.1002/jcsm.13146
方向:疾病监测
质谱规模:40+
年份:2023
看点:自动化流程 +小队列纵向血液蛋白组
文献3研究内容
自动化流程对于小队列也适用。本文借助“one-buffer sample preparation”来集成从裂解到蛋白的消化与肽段纯化和洗脱的全过程以提高样本处理的效率和一致性。对于质谱分析,使用高分辨率的Orbitrap Exploris 480质谱仪,通过应用数据独立采集(DIA)策略获得全面的蛋白覆盖和定量结果。
在这个模式下,本文检测10名年轻男性---在卧床休息前(BR0)-10天卧床休息(BR10),后(R+2)这三个时间点采样,检测血浆蛋白丰度的变化。为了验证肌肉萎缩与显著变化蛋白之间的相关性,分析了7名癌症患者和年龄匹配的7名对照组的血清样本。总共鉴定到了535个蛋白,技术重复的平均 Pearson 相关性为 >0.96。
结果显示,卧床休息影响了血浆中补体级联蛋白、脂质载体蛋白和组织渗漏源蛋白丰度。teneurin-4在卧床第10天显著上调,而恢复期第二天显著下调;lumican的含量在卧床第10天显著下降,并在恢复期维持低水平。此外,我transthyretin等六种蛋白质能区分易发生肌肉萎缩的个体。癌症恶病质患者血清中haptoglobin-related
protein含量显著降低。HPR同样是区分易萎缩和抗萎缩间的潜在marker。
关键蛋白表达规律、涉及到的网络
研究结果强调了血浆蛋白组变化可以作为潜在生物标志物,用于预测和监测肌肉萎缩。
影响因子:82.9(Nat Med)
题目:Noninvasive proteomic biomarkers for alcohol-related liver disease
链接:DOI: 10.1038/s41591-022-01850-y
方向:早诊标志物
质谱规模:大约700
年份:2022
看点:自动化处理速度 + 肝脏活检+血浆大队列样本如何识别标志物
文献4研究内容
本研究采用基于质谱(MS)的蛋白质组学技术,分析了596位个体(137位健康对照组成员和459位酒精相关肝病-ALD患者)的大量的血浆样本和79份肝活检样本。通过自动化流程在三周内完成了所有样本从制备到检测。构建的机器学习生物标志物组合可检测1)肝纤维化,2)肝轻度炎症 和3)肝脂肪变性。
蛋白质组学工作流程。除了79例肝活检样本仅用了1周时间从制备到质谱检测,大队列血浆样本更是体现了很强的优势,通过自动化液体处理系统在96孔板中进行裂解和消化,使用EvoSep One液相色谱系统与Orbitrap Exploris 480质谱仪配合,采用21分钟梯度进行DIA采集策略,整个血浆过程在两周内完成,因此所有样本加起来刚好3周。
结果显示
肝活检样本获得了5515个蛋白,血浆样本总共获得536个蛋白,且总共有 420 种蛋白质在肝脏和血浆中被定量。
无论在血浆还是肝活检组织中,代谢功能均显示下调,而与纤维化相关的信号传导和免疫反应则上调。通过机器学习模型,研究者选择了9个蛋白标志物组合用于鉴定显著肝纤维化(F2),6个蛋白标志物组合用于鉴定轻度炎症(I2)、12个标志物组合用于鉴定肝脂肪变性(S1)。
特别要强调的是本研究的机器学习模型,分为以下七个步骤。
机器学习识别标志物的流程
1、分类目标的确定:根据临床的相关性设定了二元分类目标。例如,选择显著纤维化(≥F2)、高级纤维化(≥F3)炎症(≥I2)以及脂肪变性(≥S1)作为研究目标,以识别早期病变。
2、选择机器学习分类器:在预选的10个生物标志物的基础上,对比了22种先进的机器学习分类器,以选择最适合本研究数据的模型。
3、蛋白质组特征选择:应用最小冗余最大相关性(mRMR)算法进行特征选择,确定能够最大化模型性能的特征集,范围从1到50个蛋白,根据“使用最小蛋白质集的最大 F1 得分”原则确定每个分类目标的最佳特征数量
4、模型性能评估:模型的性能通过15种临床测试的基准进行评估,采用10次5折交叉验证,并应用DeLong测试对ROC-AUC进行统计验证,同时评估模型的精确度、召回率、F1得分和平衡准确度。
5、低发病率人群的模型准确性评估:在GALA-ALD队列中对未因肝硬度低而接受肝活检的患者子集进行排除验证,计算误分类率。
6、独立队列验证:在一个独立的酒精性肝病(ALD)患者队列中应用最终模型进行疾病分类,评估模型的性能,并与临床测试结果进行比较验证。
7、预测性能评估:对GALA-ALD队列患者的随访数据进行生存分析和预后分析,获得风险评分,并将模型预测的预后能力与现有的非侵入性纤维化生物标志物进行比较。
在这个强大的流程下,检测显著纤维化(接收者操作特性曲线下的面积(ROC-AUC)为0.92,准确度为0.82)和轻度炎症(ROC-AUC为0.87,准确度为0.79),优于现有临床检测方法(DeLong's检测, P < 0.05)。这些生物标志物分子组合准确预测了未来肝相关事件和全因死亡率,Harrell's C指数分别达到了0.90和0.79。另一个独立的验证队列(ALD Validation, n=63)复现了这些诊断模型的表现。
模型性能验证和预测能力评估
影响因子:11.1(EMBO
Mol Med)
题目:integrative
analysis of cell state changes in lung fibrosis with peripheral protein
biomarkers
链接:DOI:
10.15252/emmm.202012871
方向:蛋白标志物用于临床细胞状态监测
年份:2021
看点:单细胞转录组 +(肺泡灌洗液 + 血浆)质谱蛋白组 +机器学习,确定了生物标志物的细胞来源
文献5研究内容
间质性肺病(ILD)以肺纤维化,最终会导致肺功能丧失和呼吸衰竭。传统的基于单细胞转录组的方法已经揭示了ILD病理变化中的细胞类型和状态变化,但如何将这些变化与患者体液中的蛋白质标志物相联系,之前尚未明了。
为此,本研究分析了多个肺纤维化患者队列,包括233,638个单细胞转录组和来自124名患者的肺泡灌洗液(BALF)以及141名患者的血浆蛋白【两者均可用于患者的纵向监测】帮助建立细胞状态变化与体液蛋白标志物之间的关系。
说白了,就是要使用质谱法,来发现与诊断、肺功能和损伤状态相关的蛋白质生物标志物特征,并基于单细胞分析预测这些蛋白的细胞来源。再利用机器学习,证明体液蛋白可以预测肺部特定细胞状态的变化。
从结果看,体液样本定量了1,500多种蛋白质,继而分析了蛋白质表达与33个临床测量值的相关性,包括肺功能测试结果和血浆中乳酸脱氢酶(LDH)水平。这些分析揭示了与疾病特征和肺功能密切相关的蛋白质模块。
肺泡灌洗液中的一些蛋白质标志物,如CFHR1,与肺功能呈显著的负相关性,表明它们可能参与了疾病的进程。根据这个重要线索,使用单细胞数据来阐明 ILD 特异性上调 CFHR1 的细胞来源, SSTR2+周细胞状态与疾病严重程度的相关性因而被找到,且这一发现在肺泡灌洗液中通过CFHR1水平的升高得以体现。
SSTR2+/CFHR1+ 周细胞状态与纤维化重塑的进展相关
此外,研究还发现了新的生物标志物CRTAC1,它在肺泡灌洗液和血浆中的表达反映了肺泡II型上皮细胞的健康状态。通过利用跨模态分析和机器学习技术,研究确定了这些生物标志物的细胞来源,并证明了信息在不同模态间的正确传递,支持了通过体液蛋白质组纵向采样来监测临床细胞状态的可行性。
影响因子:16.6(Angew Chem Int Ed Engl)
题目:Molecular Origin of Blood-Based Infrared Spectroscopic Fingerprints
链接:DOI: 10.1002/anie.202103272
年份:2021
看点:红外光谱+血清质谱蛋白组学+机器学习 = 红外分子指纹变异的起源
基于质谱蛋白组学和红外分子指纹的肺癌诊断workflow
文献6研究内容
本文结合基于质谱的蛋白质组学技术以及红外光谱检测,找出了肺癌变化的一系列重要的生物分子标志物。
这篇文章脑洞有点大。
基于质谱的体液蛋白组检测各类癌症的早诊标志物很常见,但是这篇基于血液的红外光谱指纹的研究却不常见。红外光谱技术传统上用于化学和物质分析,尤其是在有机化合物和工业材料的研究中。
红外光谱技术有什么用?它能够提供生物大分子(如蛋白质、脂类和糖类)的光谱指纹(IMF)。IMF是由分子中的共价键如酰胺键和羧基在特定波长下的吸收峰组成的,反映了分子的结构特征。这些特征对于识别生物标志物非常重要,尤其是在疾病状态下,这些生物分子的结构可能发生变化。但是这个方法有一个BUG, 不同的生物大分子中存在着大量相同的官能团,会导致谱峰重叠或较宽的谱峰。
巧了。
质谱分析能够提供更为精确的分子量测定和蛋白质的定量信息。当红外光谱提供了某些蛋白质结构变化的初步信息后,质谱分析可以精确地量化这些蛋白质的表达水平,从而验证红外光谱所观测到的结构变化。
红外光谱技术和蛋白质组学技术对人类148血清分析流程
简单理解这个流程。首先,收集血清样本。使用傅里叶变换红外光谱仪(FTIR)对每个血清样本进行全谱扫描。这个步骤能够检测到样本中各个生物大分子的特定吸收带,这些吸收带反映了分子的结构信息。接下来,将每个血清样本分离成三个部分:含有大量人血清白蛋白(HSA,将 HSA 与其他蛋白分离很有帮助,因为它可能会掩盖来自其他分子的信号)的蛋白部分、去除HSA的蛋白部分和代谢物部分。对这三个分离后的部分再次进行红外光谱分析获得光谱指纹(IMF);以及对分离后的蛋白质部分进行质谱蛋白质组学分析,以确定蛋白质的种类和含量。接下来分析收集的所有数据,建立模型来理解不同生物分子是如何贡献到血清的红外光谱指纹中的。通过这些数据,研究人员可以开始探索某些光谱特征与特定健康状况或疾病状态之间的关联。
比如作者通过检测肺癌样本并与正常样本对比,揭示了肺癌导致的IMF与血清蛋白成分的变化。这些光谱信息和质谱的蛋白分子信息可以用于建立肺癌诊断分类模型。
结合基于质谱的蛋白组学技术(MS)和红外分子指纹技术(IR)揭示血清中肺癌导致的分子组成的变化
过程是这样的。首先,选择55名肺癌患者和93名参考对照,确保两组在性别、年龄和吸烟状态上匹配。然后,红外光谱分析测量所有样本的红外分子指纹(IMF),并记录每个样本的光谱数据,特别是关注肺癌患者与对照组之间的差异,这些差异被称为“差异指纹”。应用支持向量机(SVM)算法将样本分为两类:癌症病例和参考个体。为此,将数据分为训练集和测试集,采用 10 次重复的 10 倍交叉验证。受试者工作特征(ROC)曲线的曲线下面积(AUC)被用作分类效率的衡量标准。对于肺癌患者与对照组的分类,该模型显示 AUC 为 0.85±0.1,这意味着原则上可以训练 SVM 模型来区分这两组人。
接下来就轮到质谱蛋白组上场了。
随后,他们利用质谱技术具体测量了血清中的蛋白质浓度,特别是那些在红外光谱中显示差异明显的蛋白质。通过比较肺癌患者和参考组的蛋白质差异,研究者识别了12种与肺癌密切相关的蛋白质。根据 12 种已鉴定蛋白质的浓度对肺癌病例与参考个体进行二元分类,得出的 AUC 为 0.82±0.1,接近实验测量的血清光谱值 (0.85±0.1)。这意味着IMF 中有关肺癌状态的大部分信息源于这 12 种蛋白质的分子变化。
有趣的是,在分级分离过程中,变化最大的三种蛋白质主要包含在HSA富集部分中。基于这三种蛋白质浓度的 SVM 二元分类显示 AUC 为 0.82±0.1,与基于上述所有 12 种蛋白质的情况相同。这说明这三种蛋白质的浓度改变才是关键,而不是全部十二种蛋白。
总结而言,文章观察到肺癌患者与健康对照个体之间的血清红外分子指纹(IMF)存在统计学上的显著差异。通过对同一样本集进行生化分级分离和蛋白质组学分析,鉴定了引起这些差异分子,且找到了肺癌特有的蛋白浓度变化。
通过探讨Matthias Mann课题组的这些贡献,我们不仅可以更好地理解体液蛋白组研究的当前前沿地位,还能获得启示,了解未来研究的潜在方向。
CONTACT US
上海易算生物科技有限公司,专注于利用LC-MS/MS和生物信息学技术,为客户提供高质量的研究方案。我们与国内顶尖的蛋白质组实验室紧密合作,开发最新的蛋白质组相关技术和产品。从DIA、PRM分析产品、单细胞及极微量蛋白质前处理,低丰度蛋白深度挖掘,糖蛋白质组,宏蛋白质组整体方案实验室落地方案等,易算均有国际前沿水平并在高分杂志上发表成果的技术产品。易算自研EasyPept AUTO自动化工作站能够将步骤复杂的质谱样本前处理流程,简化为一键式操作,实现对微量临床样本蛋白质组的智能化、高通量、高重复性分析,有效解决了手工效率低、蛋白质提取损失大、富集流程不理想、所需样本量大等问题。
在数据分析和国际软件方面,我们自主研发了EasyDIA综合数据处理平台,对液相系统、质谱仪器运行状态、定性结果、定量结果等多个方面进行质控,集成了质谱定量数据分析过程中所用的统计方法,支持分析结果的交互式或静态式的展示与下载功能,有利于支撑大队列的高效运转。我们还引入了国外先进的软件和产品,包括来自瑞士Biognosys公司、德国Bruker公司、德国PreOmics公司和澳大利亚IonOpticks公司等,为国内科研机构提供先进可靠的实验及软件解决方案。
继续学
Nature 革命性血浆蛋白组+AI算法:衡量器官特异性衰老,预测未来健康趋势
Blood最新封面 | 解读+思维导图 | 单细胞及多组学揭示补体C1Q促进急性骨髓性白血病(AML)的髓外浸润(EMI)和复发
龙年巨献第一篇:浙江大学方群团队最新研究Nat Commun亮相 | PiSPA技术在单细胞蛋白质组领域实现3000+PG新高度