---
title: "利用质谱蛋白质组技术与机器学习识别标志物的研究方案【基础版】"
author: "omicsolution"
account: "omicsolution"
published_at: "2024-10-09T21:39:42+08:00"
captured_at: "2026-08-27T10:51:44.135536+08:00"
source_url: "https://mp.weixin.qq.com/s?__biz=MzI2MTI5NDAzNg==&mid=2247491678&idx=1&sn=b8d29cb25cdbf2739841f6ea521332aa&chksm=ea5e32e5dd29bbf393c99d9e7168b52ae324340d2b82ddd24490543faced15940621aa3d4855#rd"
---

# 利用质谱蛋白质组技术与机器学习识别标志物的研究方案【基础版】
目录

1、方案名称及内容概述

2、研究分组

3、研究目的

4 构建基于质谱的血液蛋白组学数据的样本分类系统基本流程

4.1 差异统计与分子机制的研究

4.2 biomarker的研究

5 参考：颅内动脉瘤biomarker识别的过程说明

5.1 队列1与队列2

5.2 发现集的数据预处理8

5.3 发现集的差异特征保留（DFR）

5.4 发现集数据划分

5.5 训练集的候选特征选择和最终模型构建(CFS &FMC)

5.5.1 候选特征选择（CFS）特征

5.5.2 最终模型构建（FMC）过程10

5.6 模型评估与过拟合分析

5.7 可视化及生信统计分析

6 本项目的实施路线图

7、涉及到方案的重要名词理解同步

7.1 内部验证与外部验证集

7.2分类的评估指标

7.3 DIA技术

1、方案名称及内容概述

名称：某某症患者蛋白生物标志物组合的筛选

内容概述：

利用高通量DIA技术结合PQ500优选目标蛋白定量的组合式biomarker发现策略，本研究旨在揭示用于诊断（某某症与健康）和分层（轻微或严重）的特异性、敏感性和非侵入性生物标志物，可作为诊断和监测疾病进程。在此结合基于机器学习的流程，我们建立了两套生物标志物组合（PA和PB）这项生物标志物开发研究，具有高通量、高灵敏的优势，提供了关于某某症生物标志物的宝贵知识。

2、研究分组

健康对照组（NC）

某某症组(分为轻微组\严重组)

3、研究目的

lP1：找到诊断标志物，可以把健康对照组\某某症组区分，目的是检测疾病的存在

lP2：找到分层标志物，对于疾病患者，可以区分轻微或严重，尤其是找到日后病情更严重的人群，他们应该比一般人受到更密切的监测。

4 构建基于质谱的血液蛋白组学数据的样本分类系统基本流程

![图片 1](images/001.png)

-

采用易肽TM DeeP低丰度富集试剂盒（基于纳米石墨烯，蛋白冠富集原理）处理临床大队列样品，得到经过富集的多肽；引进德国Mann实验室iST技术，自研极微量超快速前处理处理本次的160+例样品，可实现大样本、快速自动化处理的精确定量流程；在此基础上结合同位素定量方案PQ500，亦因加入了稳定同位素标肽，可以同时对300-500种关键的血液蛋白能够显著的提升检测的灵敏度。此外，基于内源性肽段与重标肽段的信号强度比值，可以进一步计算出内源性肽段在样本中的实际含量，从而实现绝对定量。

-

采用4D-DIAPASEF技术进行LCMS深度采集，并基于谱图机器学习算法进行蛋白深度定量分析；

-

基于客户实验分组（3组），进行结果的分类、统计、质控和定量；

4.1 差异统计与分子机制的研究

蛋白质组学能够反映疾病特征，我们根据十多年的经验，部署了各类分析工具包，进一步增加生物学理解的颗粒细度，提供量身定制的数据可视化和生物背景，特别是与疾病恶化相关的分子。分析示例如下：

![图片 2](images/002.png)

4.2 biomarker的研究

生物标志物是病理过程或治疗干预的指示因子。对疾病的早期诊断、治疗监测、疾病分级以及预后评估等领域具有重要的价值.随着质谱技术的进步，基于DIA技术的蛋白质组学对血清/血浆/尿液蛋白组学进行表征，利用机器学习发现多个潜在的生物标志物，并分析相关的差异蛋白参与的分子通路和生物学功能.这些差异蛋白可作为诊断疾病和监测疾病进程的标志物，可以预测疾病的易感性和临床结局，亦可以为患者的风险分层提供依据。分析示例如下：

![图片 3](images/003.png)

5 参考：颅内动脉瘤biomarker识别的过程说明

![图片 4](images/004.png)

文章的整体思路

![图片 5](images/005.png)

我们开发了一个计算流程，核心包括差异特征保留(DFR)、候选特征选择和最终模型构建(CFS &FMC)，这个方法体现在了MBO Molecular Medicine杂志，文章“Circulating proteomic panels for risk stratification of intracranial aneurysm and its rupture”基于质谱蛋白质组学找到了“颅内动脉瘤”（IA）这个疾病的血清蛋白标志物。

![图片 6](images/006.png)

5.1 队列1与队列2

在2017年9月至2019年10月期间，总共收集了244份IA患者和健康对照的血液样本，分类如下：NC（n =120），IA（n = 124），UR（n = 63）和R（n = 61）

![图片 7](images/007.png)

5.2 发现集的数据预处理

数据预处理环节可以分为2两个子步骤：（1）缺失值填补（2）数据归一化。

对所有数据进行缺失值填充。之后的归一化建立纵向与横向矫正以消除由仪器性能和批次效应引起的系统差异。

5.3 发现集的差异特征保留（DFR）

-

分组，用于找到两套模型：

区分1：IA(R+ UR) VS NC，用于寻找诊断标志物，可以把健康对照组、IA疾病（R + UR）组区分

区分2：R VS UR, 用于寻找分层标志物

-

保留规则：

FC>1.2 & Pvalue（Mann-WhitneyU检验）<0.05 & VIP(变量投影重要性)>1.0

5.4 发现集数据划分

区分1：对于队列1即发现集（212个）样本，以三比一的比例被随机切割。75%（159个样本）用来训练模型， 25%（53个样本）仅用来评估模型，不用来训练模型。

区分2同样也采用了3：1的切割比例，分别用于75%训练模型和25%评估模型。

5.5 训练集的候选特征选择和最终模型构建(CFS &FMC)

特点：直接把最终将要使用的学习器的性能作为特征子集的评价准则，为给定学习器选择有利于其性能、“量身定做”的特征子集。这个过程最终获得了两套标志物（诊断、分层）。

5.5.1 候选特征选择（CFS）特征

对DFR进行分析。为了选择和优化不同的生物标志物组合. 采用对不同数量的因子进行RFE算法进行递增的特征选择，首先选3个特征（蛋白）来建模评估，然后4个，5个依次递归增加，一直到总基因的个数（可加入自选基因）。其目的是在“最终模型构建（FMC）“的环节，选准确性（Ac）最高的那个特征组合。这些模型的性能将会进行比较，以找到分类准确性（Ac）最高的特征模型。

5.5.2 最终模型构建（FMC）过程

诊断标志物（区分IA（R+UR） VS NC）:

DFR被用作特征识别的初始特征集。用10倍交叉验证法（可选重抽样）来评估标志物的分类性能，队列1中的75%样本， 被随机分成10个大小相同的子集，9个子集被用作训练集来训练标志物的LR模型（采用逻辑回归的方法进行模型建立），剩下的1个子集用作测试集，评估测试集的准确性来衡量标志物的性能（只用于评估性能，而不用于训练）。每个子集依次用作测试集，以获得10个准确率及其对应的平均值。为了进行无偏见的评估，重复上述过程10次（10‐fold CV, repeated 10 times），以找到分类准确性最高的特征模型。

队列1中剩余的25%样本， 作为内部验证数据集，只用于评估性能，而不用于训练。

LR模型，采用逻辑回归的方法进行模型建立。逻辑回归又称logistic回归分析，是一种广义的线性回归分析模型，常用于数据挖掘，疾病自动诊断，经济预测等领域。逻辑回归（Logistic Regression）是一种用于解决二分类（0 or 1）问题的机器学习方法，用于估计某种事物的可能性。

分层标志物（区分R VS UR）：

方法同上。

5.6 模型评估与过拟合分析

为了评估LR模型的准确性，我们统计了真阳性(TP)、真阴性(TN)、假阳性(FP)和假阴性(FN)的数量。然后，计算灵敏度(Sn)、特异性(Sp)、准确性(Ac)、阳性预测值(PPV)、阴性预测值(NPV)和Mathew相关系数(MCC)等六个评估指标，分别对队列1的75%、25%划分的数据集、队列2即外部验证数据集进行统计，如下表所示。

![图片 8](images/008.png)

（注：上表P6代表诊断标志物，P8代表分层标志物）

最后，我们绘制模型的学习曲线。各个数据集的曲线趋平，精度稳定，表明模型拟合良好。曲线中发现当训练样本数量增加，训练集准确性降低，交叉验证结果增加，在样本数量达到最大时趋于稳定，表现出模型未过拟合且具有鲁棒性。

5.7 可视化及生信统计分析

Mann-Whitney U 显着性检验用于差异表达统计；对于数据可视化，使用在线平台（http://www.bioinformatics.com.cn）构建了火山图，热图和维恩图。自制的 MATLAB 脚本用于 GO 注释和通路富集分析。IPA工具用于分析蛋白质的功能和相互作用。

6 本项目的实施路线图

![图片 9](images/009.png)

7、涉及到方案的重要名词理解同步

7.1 内部验证与外部验证集

模型的预测能力评价可分为内部验证（Internal Validation）和外部验证（External Validation）两个环节进行。

内部验证是在给定的建模样本中，拿出大部分样本来建模型，留小部分样本用刚建立的模型进行预测，并计算这小部分样本的预测准确率。内部验证的方法主要有留出法（Hold-Out）和交叉验证法（Cross-Validation）两种。

外部验证（External Validation）是指对一批独立于建模数据，没有参与模型构建和优化的化合物进行预测。相对来说，使用具有代表性且容量足够大的外部验证集对模型进行验证，能更准确地反映模型的实际预测能力。原则上，计算预测模型在实际应用之前，必须要经过外部验证，以保证模型在实际应用中的预测能力。

7.2 分类的评估指标

模型训练完成后，需要评估模型的性能。使用如下步骤来评估性能：1.标记数据集已被划分为训练数据集和测试数据集，使用测试数据集来评估训练过的模型。2.用模型为测试数据集的每行特征生成标签，得到预测标签集。3.比较预测标签和实际标签，评估模型。

一些常用的 评价指标包括接收者操作特征（Receiver Operating Characteristic，ROC）曲线、 AUC、准确性、敏感度、特异性等。

7.3 DIA技术

DIA技术是一种高通量的蛋白质组学研究手段，可应用于临床大样本量高通量差异蛋白质组学研究和翻译后修饰位点分析。

数据非依赖性采集（DIA）技术的原理为：首先将质谱扫描的整个一级质量范围根据离子密度分割为若干窗口，每个窗口依次选择、碎裂、扫描，DIA能够获得每个窗口范围内所有母离子的全部碎片离子信息，循环时间固定，同时数据可以回溯，有效解决了DDA技术存在的随机性和低丰度离子缺失的问题.但是DIA模式产生的碎片离子谱图过于复杂，丢失了母离子与碎片离子的对应关系，因此高度复杂的混合二级谱图对肽段和蛋白质的正确解析提出了挑战.

但是随着近年来机器学习算法的引入，以及通过样本处理的过程优化，DIA在鉴定深度、检测周期、定量准确性等性能有全面提升，DIA数据的挖掘难题得到了解决。因此，在临床蛋白质组学的研究中，DIA技术被广泛应用。
