---
title: "EMBO Mol Med复旦-易算最新临床蛋白质组成果 | 准确率90% |利用蛋白分子标志物 + 机器学习对患者风险分层"
author: "omicsolution"
account: "omicsolution"
published_at: "2022-01-04T19:07:50+08:00"
captured_at: "2026-08-26T17:48:41.663137+08:00"
source_url: "https://mp.weixin.qq.com/s/8sNg-V5DQdDgvOT_4ab1tg"
---

# EMBO Mol Med复旦-易算最新临床蛋白质组成果 | 准确率90% |利用蛋白分子标志物 + 机器学习对患者风险分层
关于文章

说个好消息。复旦大学联合易算生物在EMBO Molecular Medicine杂志（IF=12.137）发表了最新的研究成果。文章基于质谱蛋白质组学找到了“颅内动脉瘤”（IA）这个疾病的血清蛋白标志物。

要做成这个项目其实并不容易，有两个原因。

首先，以蛋白作为biomarker有门槛。 人体里能够作为疾病标志物最有价值的就是蛋白质；血液检测具有取样便利、成本低、患者依从性好等诸多优点。然而，想用血液样本进行蛋白质组学分析却很难。因为血液中蛋白质成分极其复杂，动态变化范围也非常大，这个差别可以达到十二三个数量级，这使对血清中的蛋白质进行大规模相对定量，以及寻找biomarker变得非常困难。

挑战还不止这些。这项研究的对象是动脉瘤。它实际上是血管上的凸起，不像肝脏等分泌性器官--病变会有大量的物质释放到血液，如果它没破裂，就没那么多游离出来的线索，等着你熟门熟路的捞。而且血管瘤这类病，手术上不像肝脏、肺、肠肿瘤把病灶给切掉，而是采取夹闭、栓塞等非切除的方式来处理。因而血管瘤组织样品获取非常困难，不利于研究。

难测，量少。在这个情况下研究biomarker，你细品。

但是，有人做到了。

![图片 1](images/001.png)

在探索阶段，我们建立了“颅内动脉瘤”（IA）蛋白的迄今最全知识库，并采用深度学习-DeepPRM的方法，实现对数百种生物标志物的质谱分析设计，建立两套生物标志物组合(P6和P8)。

在验证阶段，这两套蛋白质组合的模型在几百例患者训练集、内部以及外部验证队列中均显示出较强的分层效果，通过酶联免疫吸附试验(ELISA)进一步验证与蛋白质组学结果一致。

其结果显示，根据六种蛋白生物标志物模型（P6），成功地将“颅内动脉瘤”（IA）从对照组中分类，准确率为87.50%；根据八种蛋白标志物模型(P8)，对破裂和未破裂的IA的分类更是达到了91.67%的显著准确率。

疾病背景

说到“颅内动脉瘤”，不得不提几个人。很多媒体可能都会议论现任美国总统拜登 “失语”、“忘词”等，甚至有媒体认为他有早期痴呆的现象，但是很少有人提到他在2007年出版的回忆录《守住诺言》中，坦言自己曾因“颅内动脉瘤”经历两次手术。而在热门影视《权力的游戏》中“龙妈”扮演者差点因这个病无法进入第二季的拍摄。

看到“瘤”，很多人会有个误解。其实 “颅内动脉瘤”不是恶性肿瘤，而是脑血管上出现的异常的凸起。但是，它却比恶性肿瘤更凶险。

就好比有一枚启动倒计时的炸弹，不偏不倚的出现在脑血管壁上。更可怕的是，当它计时的时候，你听不见，你甚至都不知道身体里面有这样的炸弹。一旦这个凸起破裂，意味着有1/3可能性人没了。上世纪七十年代某华人功夫明星的意外离世，就因为它作祟。

都知道体检，但现在的体检很少涉及脑血管。颅内动脉瘤其实在普通人群中可以占到3%，现有的神经影像学方法，比如“颅内动脉瘤”的黄金标准是-数字减影血管造影(DSA) 诊断，就是把其他组织影像消除，仅在影像片上突出血管。但由于无症状，大多数患者没有及时被诊断，而是当动脉瘤变大或破裂时，出现极其严重的头痛才发现。

比如某知名小品王，拍电视剧《乡村爱情3》突发剧烈头痛，送医院诊断为血管瘤破裂，幸运的是他抢救及时。但是很多普通人并没那么幸运。

除了大多数患者没有及时被诊断以外，有破裂风险和随后发生脑血管痉挛的患者目前还无法预测。本研究旨在揭示用于诊断和分类破裂和未破裂IA的特异性、敏感性和非侵入性标志物，以开发新型治疗方法。

主要内容

如何在血清中找到蛋白标志物？这项研究分四步。

![图片 2](images/002.png)

图1：四步法找到biomarker

第一步：构建标志物库。不仅根据目前组织和血清蛋白质组分析中发现改变的蛋白，还加上既往文献研究，组建了一个广泛的候选生物标志物库（SPCBB）-包括多达717种蛋白，使目标标志物验证工作更加灵活和全面；

第二步：完成肽段的PRM预测。使用基于深度学习的方法DeepPRM这个工具，大大提高SPCBB中候选蛋白的质谱PRM检测率；DeepPRM还有个好处就是，在验证大规模肽段的时候，不需要去合成肽段，极大节省成本和时间；

第三步：验证肽段。血清组人群1(n=212)和Ⅱ(n=32)被进一步定量分析其潜在标志物；

第四步：机器学习。机器学习建立两套生物标志物组合(P6和P8)，在外部验证集(n=32)的评估中准确区分IA与健康对照(准确率:87.50%)或对 IA破裂患者进行分类(准确率:91.67%)。

每一步具体怎么实现？

第一步，如何建立候选生物标志物库？文献 + 实验

![图片 3](images/003.png)

图2 血清候选生物标志物库的构建流程

过程：

1.1）对10例IA组织，以及60例IA血清样本各自进行蛋白组质谱实验，获得860个可信的差异蛋白。

1.2）为了充分利用前述IA研究产生的数据，本研究总结了2000年至2020年间在公共数据库中发表的英文文章和评论，共找到了446个与IA有关的基因或蛋白。

1.3）446个与IA有关的基因或蛋白结合本实验获得的860个差异蛋白，去冗余后得到1241个蛋白质。

1.4）根据细胞成分和信号肽预测信息，筛选与IA相关的血清蛋白候选生物标志物库(SPCBB)，这个数据库包含了717个蛋白。这些蛋白质在血清目标蛋白组分析中得到进一步验证。

意义：

这么做，就突破了基于湿实验去确定肽段，将既往文献的研究纳入到标志物筛选，使得目标标志物验证工作更加灵活和全面。

![图片 4](images/004.png)

第二步，怎么保证这些目标蛋白被检测到？DeepPRM。那这个过程在项目中，实现起来复杂吗？我们这么做。

![图片 5](images/005.png)

图3 DeepPRM方法的开发

过程：

2.1）肽段提交：SPCBB中的717个蛋白肽段列表被提交到deepDIA（详细见 https://deepdia.omicsolution.com/），获得特异性肽可检测性和RT（保留时间）信息。

2.2）肽段筛选：对上述结果，选择可检测性>0.5的肽段，1254个。在血清消化混合物中进一步观察到367个肽，再缩小范围到113个肽。

意义：

靶标蛋白质组学，如平行反应监测(PRM)和选择反应监测(SRM)比较繁琐。肽选择、合成和质谱分析，前脚跟着后脚的安排。此外，在没有事先了解肽的可检测性的情况下，肽选择或决定合成数百个肽，常常让科学家感到无从下手。

为了完成规模化的靶标蛋白质的验证和确认，他们需要一个工具：能增加靶向蛋白质组学的覆盖率、节约成本。

这两个需求在去年的时候就有了成熟方案。2020年，复旦大学乔亮教授、杨芃原教授课题组刘晓慧老师与易算生物在Nature Communications上发表了基于深度学习提升DIA数据分析的算法-DeepDIA：用来选择目标多肽。详见【Nat Comm-易算与复旦携手发表DIA深度学习算法】。这个工作，使用深度神经网络的原理，帮你用可检测性分数的阈值来筛选肽段。

而作为技术原理一脉相承、且需要预实验方能定量的PRM技术，深度学习算法更能大显身手，进一步拓展开发DeepPRM算法。

回到我们的研究中来。

第一个需求：怎么增加靶向蛋白质组学的覆盖率？选参数。

DeepPRM帮你获得预测肽段的两个最重要参数：可检测性（Detectability）和保留时间（RT）。

筛选目标肽段的过程很复杂，但是我们已经把它的操作难度降到最低，低到你只要会上传文件就能办到。

![图片 6](images/006.png)

图4 https://deepdia.omicsolution.com可实现预测

在这里，为啥需要预测保留时间（RT）？为了建立关联。

预测保留时间就是将多肽色谱的属性，转变为稳定独立的特征时间属性，其精度越高，识别的目标肽的数量就越多。

一旦建立了这样的关联，再加上信号的可检测性作为依据，用DeepPRM算法来帮助大规模的检测开发，你就能充分体验到这些目标肽的存在感。

就好比你有了一张旺铺表，你就能知道在哪些黄金地段开店能获得更大的客流量。而如果你没有这张表，一切结果只能靠砸钱、碰运气。

到这里你就会问了。DeepPRM算法性能如何？

![图片 7](images/007.png)

图5 DeepPRM和Picky方法相比，性能提升明显

为了验证DeepPRM的性能，本研究将DeepPRM与一个著名的在线PRM和SRM方法--Picky进行了比较。后者提供了目标肽及其对血清和Hela细胞消化液中给定蛋白质数据集的预测保留时间。

DeepPRM 获得了更多具有相应保留时间（RT）信息的目标肽，DeepPRM的检测率(检测到的肽/建议的肽)(85.23%)远远大于Picky的检测率(30.70%)(图4)。而且相对picky来说，由于PRM基于谱图库的深度学习，所以不局限于人和小鼠物种，使得方法更具有普适性和灵活性。

这表明新开发的DeepPRM提供了一个信息量大、效率高的定向肽选择，特别是对于大规模的候选蛋白，这与本研究中广泛的蛋白生物标志物验证的目标相一致。

说完了第一个需求，紧接着就是第二个需求：怎么节约成本？

砍实验步骤。

你在验证大规模肽段的时候，用DeepPRM这个工具，你不需要去合成肽段，极大节省成本和时间。

接下来怎么做？对113个符合标准的肽，在大队列血清样本进行PRM定量。

第三步, PRM检测方法对多少例血清样本进行肽段的定量检测？两个队列，244个样本。

![图片 8](images/008.png)

过程：

3.1）通过设置质量控制样品和iRT肽，来执行严格的实验控制，以监测大规模样本带来的批效应变化。

3.2）将原始数据上传到Skyline，自动进行PRM峰值整合，检测干扰，提取峰强度。

3.3）进一步对212个样品中肽的定量结果，通过纵向和横向策略进行两步归一化，目的是为了消除由仪器性能和批次效应引起的系统变化。

3.4）正交偏最小二乘区分分析(OPLS-DA)基于100个候选蛋白对应的113个肽的归一化峰面积，确定了NC、UR和R三组具有显著的空间分离。此外，还计算了每个特征在投影中的变量重要性(VIP)。

3.5）为了预先选择IA和IA破裂的潜在蛋白质组学特征，采用Mann-Whitney U检验，对其分析差异。

意义：

从113个分子，通过以上步骤的筛选，可进入机器学习环节。

第四步, 用何种方法，来寻找对照组（NC）、未破裂IA组（UR）和破裂IA组（R）的血清中标志物， 并对其预测能力评估呢？机器学习。

![图片 9](images/009.png)

图6 机器学习方法识别潜在的生物标志物组合

A 数据处理和机器学习模型构建的工作流程。

B-G 用于IA和NC(B)或R和UR(E)分类的Logistic回归(LR)模型。基于LR的模型在 IA与NC(C)或R与UR(F)的训练、内部验证和外部验证组中的接收操作特征(ROC)曲线。混淆矩阵显示了模型在外部验证集中对IA和NC(D)或R和UR(G)的分类性能。

过程：

4.1） 为了鉴定不同类型的生物标志物组合，我们首先将R、UR和NC的蛋白质组学数据集分为不同的组：

(i) 对于IA和NC的分类，将R和UR组合并为IA组。

(ii) 对R组和UR组的分类。

4.2）在PRM队列I(n=212)血清蛋白组数据的基础上，我们开发了一个计算流程，包括差异特征保留(DFR)、候选特征选择和最终模型构建(CFS &FMC)。这么做是为了找到潜在的生物标志物组合来对 IA病例进行分类(图5A)。

4.3）在DFR步骤中32个肽对应的 27个蛋白被确定，采用的是(FC>1.2，Pvalue<0.05和VIP>1.0)。

4.4）队列1的R和UR合并的数据集， 以三比一的比例被随机分为训练集和内部验证集。在CFS&FMC步骤中，使用逻辑回归法建立模型，使用重复10次的10折交叉验证与递归特征方法(RFE)进行肽段的筛选和模型的拟合，我们根据最高的平均准确度(Ac)挑选了训练集(队列I的75%)上选择最佳生物标志物的组合，即P6用来区分IA和AC，P8区分R与UR。

4.5）为了验证基于机器学习的IA病例分类的精确度，我们进一步收集了一个新队列(II)的32个血清样本作为外部验证集。为了评估LR模型的准确性，我们统计了真阳性(TP)、真阴性(TN)、假阳性(FP)和假阴性(FN)的数量。然后，计算灵敏度(Sn)、特异性(Sp)、准确性(Ac)、阳性预测值(PPV)、阴性预测值(NPV)和Mathew相关系数(MCC)等六个评估指标，如表1所示。

![图片 10](images/010.png)

4.6）最后，我们绘制了P6模型的学习曲线。训练集和内部验证集的曲线趋平，精度稳定，表明模型拟合良好。

![图片 11](images/011.png)

图7 学习曲线图

横坐标是训练集样本数量，纵坐标是验证准确性；在不同训练样本数量下进行10 times repeated CV 10 fold 交叉验证，对所有验证结果进行平均得出对应训练集样本数量的交叉验证准确性；由图可知当训练样本数量增加，训练集准确性降低，交叉验证结果增加，在样本数量达到最大时趋于稳定，表现出模型未过拟合且具有鲁棒性。

意义：

我们找到了IA分类的生物标志物组合。研究的脚步仍未停歇。随着标志物组合的获得，一些与心血管或脑血管密切相关的蛋白，也逐渐浮出水面。

例如，来自免疫球蛋白的两种候选生物标志物 IGHM 和 IGKV3-20 是炎症反应的重要介质，据报道，炎症反应是多种血管疾病（包括动脉粥样硬化、腹主动脉瘤和动脉炎）的共同病理机制。

此外，FGG和ITIH4在内的两种急性期蛋白(APPs)的水平明显增加，这通常是由于炎症或组织损伤而发生的；FN1和COMP落到焦点粘附途径中，该途径已知可维持脑血管的完整性。四个调控分子LRG1、MPO、CTSG 和 PRTN3 都参与了中性粒细胞脱颗粒途径。值得注意的是，MPO、CTSG 和PRTN3都是与中性粒细胞相关的蛋白，其中 MPO 已被揭示与血管疾病的严重程度有关。而CTSG已被报道可诱导早期动脉粥样硬化病变的形成。

以上提示血清蛋白水平的改变确实反映了IA的病理生理变化。因此，这些蛋白质显示出进一步发展为临床生物标志物的潜力。DeepPRM和我们开发的综合血清生物标志物筛选策略，有望给标志物发现研究，开辟新路径。

总结

到这里，对我们的《Circulating proteomic panels for risk stratification of intracranial aneurysm and its rupture》的进一步解读主要内容结束。我想请你再回头看看检测疾病的蛋白标志物这件事，有这些亮点：

1、对于IA的生物标志物的发现，科学家们往往采用不同的策略和角度进行研究，从而产生了不同的结果。为了充分利用这些宝贵的数据，本研究将以前和本次结果集合起来，形成了最全的蛋白质生物标志物库。

2、提出了一种高效、省时的PRM检测方法(DeepPRM)。由于样品预处理的条件不同仪器的类型不同，以及不同实验室的仪器设置不同，不同研究的多肽检测和RT也不同。本研究在深度学习特定LC-MS平台产生的谱图的基础上，建立了仪器特定的模型，并对肽的可检测性和RT进行了预测，而且获得了更好的检测率。

3、使用LR机器学习策略确定了两个生物标志物组合为生物标志物。这些生物标志物可以对IA 病例的不同结果进行分类，具有较高的Ac、AUC、敏感性和特异性。此外，这些蛋白质的变化为IA的发病机制提供新洞察。

4、这些蛋白质中的一些被报道为与心血管或脑血管疾病有很大关系，可以更好地了解IA形成和破裂的发病机制。

参考文献

Nat Commun. 2020 Jan 9;11(1):146. doi: 10.1038/s41467-019-13866-z.

EMBO Mol Med. 2022 Jan 3:e14713. doi: 10.15252/emmm.202114713.

作者贡献

本推文根据易算参与的数据分析做解读，并得到了刘晓慧老师的指导修改。最后，我们希望通过这篇文章来纪念我们永远的导师杨芃原教授。

关于血液蛋白质组样品，从预处理到数据分析，易算有一套完整且快速迭代的工具箱。如果你也想尝试一下DeepPRM，或者想针对血清寻找蛋白标志物，欢迎致电或留言。

继续学

Nat Comm-易算与复旦携手发表DIA深度学习算法

血浆标志物发现，这波可以到大气层

Matthias Mann综述文章精读：人工智能如何用于蛋白质组学和生物标志物的新发现

上海易算生物科技有限公司 转载请注明出处

更多蛋白质组学技术信息请参阅我们的官方网站：

www.omicsolution.com

若有任何疑问，欢迎邮件或来电咨询：

marketing@omicsolution.com

support@omicsolution.com

+86-18221381405
