2016 总纲
蛋白质组的结构与功能读数底物、修饰、互作、构象与 proteotype 状态共同决定蛋白层信息。
蛋白质组质谱课程
原理、技术演进与关键证据
LC-MS/MS 的物理读数经过肽段鉴定与定量,可进一步形成蛋白、修饰、互作、空间位置、单细胞状态和临床标志物证据。2016 年的经典综述建立了结构与功能蛋白组学框架,2025 年的综述则把高灵敏度、DIA、单细胞、空间、AI 和临床应用串成当前主线。
2016 总纲
蛋白质组的结构与功能读数底物、修饰、互作、构象与 proteotype 状态共同决定蛋白层信息。
2025 总纲
从单细胞到临床应用样本处理、仪器、采集策略、AI 分析和临床转化构成现代 MS-based proteomics 主线。
课程目标
从原理进入路线选择样本类型、仪器平台、采集方式和软件结果共同决定实验路线。
核心原理
质谱不是直接“看见蛋白”,而是记录离子在电场、磁场或飞行路径中的质量荷比信号。蛋白质组学通过可重复的前处理、液相分离、离子化、质量分析和软件推断,把这些信号转成可检索、可定量、可解释的蛋白层信息。
读数链路
分辨率
分辨率越高,越容易把质量接近的离子分开;在复杂样本、同位素峰和修饰肽段中尤其关键。
质量精度
ppm 级质量精度能显著减少错误匹配;但结果仍需要碎片谱、保留时间和 FDR 共同约束。
动态范围
血浆、组织和单细胞样本的主要难点不是只有“够不够灵敏”,还包括复杂背景中低丰度肽段是否能稳定定量。
原理教程
教程学习的重点不是背流程名词,而是理解每个物理和软件步骤怎样改变最终结果。下面六个概念可以作为后续阅读任何蛋白质组学论文、软件报告和项目 QC 的基础坐标。
1. m/z
肽段在 ESI 中通常形成 2+、3+ 或更高电荷态。质谱横轴是 m/z,因此同一肽段带不同电荷会出现在不同位置;同位素峰之间的间距也会随电荷数变化。判读谱图时先确认电荷态,再把 m/z 转换为中性质量,才能进入数据库匹配或目标肽段确认。
2. LC 峰
LC 的作用是把复杂肽段混合物按时间展开。峰宽越窄、峰形越对称、保留时间越稳定,软件越容易在 MS1/MS2 中找到一致峰组。短梯度会压缩峰容量,适合高通量但更依赖高速扫描和强软件去卷积;长梯度更利于深覆盖,但降低样本通量。
3. MS/MS
CID/HCD 等碎裂方式会让肽段主链断裂,形成 b/y 离子系列。肽段鉴定依赖理论碎片与实测碎片的匹配程度,同时受到质量精度、信噪比、共碎裂干扰和修饰位点定位影响。DDA 中一个谱图通常围绕一个前体解释;DIA 中一个窗口包含多个前体,软件必须从混合谱图中提取目标肽段的碎片共洗脱证据。
4. FDR
数据库搜索会产生大量候选匹配,target-decoy 策略通过诱饵库估计错误比例。FDR 可以在 PSM、peptide、protein 和 site 层级分别控制,不同层级不能相互替代。DIA 中还存在 precursor、peptide、protein、run-specific 与 experiment-wide 等不同控制方式,直接影响缺失值和定量矩阵。
5. 定量
定量从峰面积或峰高开始,但项目结果通常是经过归一化、缺失值处理、批次校正和蛋白汇总后的矩阵。Label-free 强调 run 间稳定性;TMT/多重化强调通道归一化和比例压缩控制;PRM/MRM 强调目标肽段响应、内标和标准曲线。不同定量路线对应不同误差来源。
6. 蛋白解释
蛋白解释需要把鉴定、定量和生物学层级连接起来。一个蛋白显著变化可能代表表达变化、细胞组成变化、蛋白降解、PTM 改变、复合物状态变化或样本前分析差异。教程中所有方法最终都要回到研究问题:是发现候选、解释机制、建立验证 assay,还是构建临床风险模型。
发展历程
过去十年的核心变化,是质谱蛋白质组学从“更深地测更多蛋白”扩展为“在更低输入、更高通量、更复杂空间和更强解释模型中稳定读出蛋白状态”。
这一阶段的重点是把质谱从“蛋白鉴定工具”升级为“功能状态测量工具”。Aebersold 与 Mann 的框架强调,蛋白丰度只是 proteome 的一部分,PTM、复合物、构象、定位和 proteotype 状态同样能通过质谱或质谱相关技术读出。
DIA 逐渐从 SWATH 概念变成大队列工作流。它用系统性窗口碎裂换取更高数据完整性和回溯能力,软件侧则通过谱图库、保留时间校准、峰组评分和深度学习模型解决混合谱图解释问题。DIA-NN、Spectronaut 等工具让 library-free、预测谱图和大规模队列分析进入常规应用。
这一阶段解决的是“样本更少、通量更高、维度更多”的问题。低损耗前处理和芯片体系降低单细胞/微区组织损失;plexDIA 通过多通道非等重标记提升通量和数据完整性;diaPASEF 利用离子淌度增加选择性;单细胞报告建议开始规范样本数、缺失值、批次和数据共享。
高速高灵敏 MS/MS 平台推动短梯度、低输入和深覆盖 DIA 同时推进;AI 谱图预测、峰组评分、QC 和临床模型进入工作流;空间蛋白组成为年度方法,临床体液蛋白组和药物研发 proteomics 继续扩展应用边界。Guo 等 2025 年综述把这些方向统一为从单细胞到临床应用的技术链。
核心图谱
工作流、低输入样本、临床 assay、AI、PTM、互作结构和 proteotype 状态共同决定现代质谱蛋白质组学的应用边界。
Guo et al. 2025 Fig. 1
现代 MS-based proteomics 从样本进入仪器之前就已经开始决定数据质量。体液、组织和单细胞对应完全不同的蛋白丰度范围、基质复杂度和可用起始量;自动化前处理的价值在于降低人为误差、减少转移损失,并让消化、脱盐、标记和上机顺序在大队列中保持一致。低输入样本尤其容易受到管壁吸附、污染蛋白和干燥损失影响,因此样本处理不能只用“总蛋白量”评价,还要同时看回收率、批内 CV、空白背景和肽段分布。
图中的 multiplexing by chemical labelling 指向两类常见策略:等重标记适合在 MS2 或 MS3 层面比较多个样本,非等重或质量差标记可与 DIA 结合提升通量。多重化可以减少缺失值并提高通量,但也会引入通道串扰、比例压缩、标记效率和 channel-specific FDR 等问题。进入 LC 后,色谱柱、梯度长度、柱温和流速共同决定峰宽、峰容量和低丰度肽段是否能从背景中分开;短梯度能提高通量,但对仪器扫描速度和软件去卷积提出更高要求。
DDA、DIA 和 targeted acquisition 代表三种不同的信息采集哲学。DDA 逐个选择强前体碎裂,谱图解释直观但重复性受采样随机性影响;DIA 系统性碎裂窗口内所有离子,适合队列一致性和回溯分析;PRM/MRM 则围绕预先定义肽段建立高特异性验证方法。数据分析不只是“搜库”,还包括谱图库或预测谱图、保留时间/iRT 校准、峰组评分、蛋白推断、FDR 控制、归一化、批次校正和网络/通路解释。
Guo et al. 2025 Fig. 2
单细胞蛋白组学把蛋白质组测量从群体平均推进到细胞异质性层面。它能区分同一组织或同一培养体系中的细胞状态、药物响应和稀有亚群,但每个细胞的蛋白量极低,导致肽段损失、随机缺失和批次效应被显著放大。常见策略包括高回收率芯片或纳升级反应体系、载体通道、低流速 LC、高灵敏 MS/MS 和面向稀疏数据的软件处理。单细胞结果需要同时说明细胞数、每细胞蛋白覆盖度、缺失值分布、批次结构和归一化策略。
空间蛋白组学的关键不是把组织切成很多点后简单做 LC-MS/MS,而是在蛋白读数中保留组织坐标。激光显微切割、微流控采样、成像质谱、抗体成像和 LC-MS-based spatial proteomics 各有分辨率、覆盖深度和定量精度差异。空间结果需要把 ROI、细胞组成、邻域关系、病理区域和蛋白通路联系起来;如果组织区域过小,蛋白覆盖度会下降,如果区域过大,又会重新回到混合平均信号。
Guo 等 2025 年综述把单细胞与临床应用放在同一条发展线上,是因为低输入能力会直接影响穿刺样本、FFPE、微区组织、循环肿瘤细胞和类器官模型。相关引用中的单细胞报告建议强调实验设计、缺失值、批次和数据共享规范;空间蛋白组年度方法强调 atlas-scale 组织图谱、组织病理联动和多模态整合。
Guo et al. 2025 Fig. 3
临床蛋白质组学的核心矛盾是:discovery 阶段希望尽可能广地覆盖蛋白和通路,临床 assay 阶段则要求稳定、可复核、可解释和可跨中心迁移。一个差异蛋白只有在样本前分析、检测方法、阈值、适用人群和验证证据都明确时,才可能成为 biomarker。血浆、尿液、脑脊液、组织和 FFPE 的前分析变量不同,采血管、离心、冻融、储存时间、溶血和批次都会改变蛋白信号。
从 discovery 进入 verification 时,通常需要把大规模 DIA 或 DDA 发现的候选蛋白压缩为可验证 panel。PRM/MRM 能针对候选肽段进行高特异性定量;稳定同位素内标可以校准回收率和仪器波动;SISCAPA 等免疫富集路线可把低丰度目标从复杂基质中拉出,提高灵敏度和特异性。进入临床队列后,单个项目的“显著差异”不够,必须评估跨队列复现、批次稳定性、干扰因素、模型校准和临床终点相关性。
药物研发中的 proteomics 还会把 abundance、PTM、热稳定性、靶点占有、通路反馈和毒性 readout 放在一起。此时质谱结果既可以用于靶点发现,也可以用于机制验证、药效标志物和伴随诊断候选。临床转化的落点不是把全蛋白质组报告原样交付,而是形成可维护的 assay、QC 体系和结果解释规则。
Guo et al. 2025 Fig. 4
AI 在质谱蛋白质组学中的作用已经从“结果建模”前移到实验和数据处理的多个环节。深度学习模型可以预测肽段碎片谱、保留时间和离子淌度,从而减少实验建库依赖,支持 library-free 或 hybrid library 分析;在 DIA 数据中,AI 可帮助识别共洗脱峰组、区分干扰峰、改进 q-value 估计和提高低丰度肽段的识别稳定性。Carafe、Prosit、DIA-NN 等方向都体现了预测谱图和深度学习评分对 DIA 的推动。
AI 也进入 QC 和临床解释。iDIA-QC 等工作把大规模 DIA 的质量控制从人工阈值推进到模型评分,能识别色谱漂移、喷雾不稳、批次异常和样本异常。临床模型中,机器学习可以把多蛋白 panel、临床变量和疾病终点整合为风险评分,但训练集偏倚、样本前分析差异、平台差异和过拟合会直接影响可转移性。
AI 增强不能替代实验设计。模型预测再强,也需要稳定的 LC-MS/MS 输入、清楚的样本分层、独立验证集和可解释的错误控制。对于教学和项目设计,AI 应被理解为提高谱图识别、质量控制和多变量解释能力的工具,而不是绕过 FDR、QC 和生物学验证的捷径。
Aebersold & Mann 2016 Fig. 1
Bottom-up proteomics 将蛋白酶切为肽段后再进入 LC-MS/MS,是当前大多数 discovery proteomics 的基础路线。它的优势是可处理复杂样本、兼容高通量 LC-MS/MS、数据库搜索成熟,并能在组织、细胞、体液和微量样本中获得较深覆盖。其核心推断逻辑是“肽段证据支持蛋白存在和定量”,因此唯一肽段、共享肽段、蛋白组装规则和 protein inference 会直接影响最终蛋白列表。
这一路线也带来天然限制。蛋白被切成肽段后,完整蛋白异构体、剪接体、蛋白加工形式和多个 PTM 的组合关系可能丢失;同一肽段可能来自多个同源蛋白;某些区域因酶切位点、疏水性或离子化效率不佳而难以覆盖。Top-down 和 middle-down proteomics 可以补充完整蛋白或较长片段信息,但对仪器、分离和数据解释要求更高。
Aebersold & Mann 2016 Fig. 2
翻译后修饰决定蛋白活性、定位、稳定性和互作状态,是蛋白质组学区别于基因组和转录组的重要层面。磷酸化常用于追踪激酶/磷酸酶网络,乙酰化连接染色质和代谢状态,泛素化连接蛋白降解和应激响应,糖基化与分泌蛋白、膜蛋白和免疫识别关系密切。质谱通过修饰肽段的质量偏移和碎片离子来定位修饰位点,但修饰肽通常丰度低、动态范围宽,常需要 TiO2、IMAC、抗体富集或化学富集策略。
PTM 结果的关键风险在于位点定位和定量归因。一个修饰肽显著变化,可能来自修饰比例变化,也可能来自该蛋白总量变化;一个肽段包含多个潜在修饰位点时,需要使用 site localization probability、diagnostic ions 和谱图质量判断位点是否可靠。对于通路解释,位点功能注释、激酶 motif、时间序列和扰动设计比单次差异列表更重要。
Aebersold & Mann 2016 Fig. 3
蛋白质在细胞中通常以复合物、通路模块和结构状态发挥功能。AP-MS 通过亲和纯化 bait 蛋白捕获复合物,适合发现稳定或半稳定互作;BioID、TurboID 和 APEX 等邻近标记可以捕获瞬时或局部邻近关系;cross-linking MS 通过交联剂记录蛋白内部或蛋白之间的空间距离;limited proteolysis、HDX-MS、CETSA 和 thermal proteome profiling 可以把构象变化、配体结合和热稳定性变化转化为肽段或蛋白信号。
结构与互作蛋白组学的结果不能简单解释为“有互作/无互作”。裂解条件、标签位置、交联剂长度、细胞状态、背景蛋白、复合物动态和统计过滤都会改变结果。SAINT 等方法用于 AP-MS 背景建模,BioPlex 等大规模网络把互作结果放到系统层面,药物研发场景则常用热稳定性或化学蛋白组学判断靶点结合、脱靶效应和通路反馈。
Aebersold & Mann 2016 Fig. 4
Proteotype 指一个生物系统在特定遗传背景、环境、时间点和细胞状态下的蛋白质状态集合。它不是蛋白表达量的同义词,而是包括蛋白丰度、剪接/加工形式、PTM、蛋白复合物、亚细胞定位、周转速率和结构状态的综合表型。基因组提供潜在编码能力,转录组提供 RNA 层面响应,而 proteotype 更接近实际执行细胞功能的分子状态。
疾病、药物处理、发育阶段和微环境改变都会重塑 proteotype。肿瘤样本中,同一驱动突变可能对应不同蛋白通路活性;药物处理后,靶点丰度不一定变化,但热稳定性、磷酸化、互作或下游通路可能发生改变;临床体液样本中,炎症、凝血、组织泄漏和免疫反应会共同影响蛋白组合。蛋白质组学的价值正是在这些层面把 molecular state 与 phenotype 连接起来。
技术源流
下表汇总质谱蛋白质组学发展中的关键节点,便于把基础原理、仪器平台、采集策略、软件算法和转化应用放到同一张技术地图中。
总纲
现代蛋白质组学的核心问题从“能否鉴定大量蛋白”扩展为“能否在不同样本状态下稳定解释蛋白功能”。2003 年的总纲确立了 MS-based proteomics 作为系统测量蛋白质组的技术路线;2016 年框架把蛋白表达、修饰、互作、构象和 proteotype 状态合并为功能读数;2025 年框架进一步加入单细胞、空间、AI 和临床 assay。
教程中要把这三层框架串起来:第一层是测量对象,说明蛋白、肽段和修饰位点分别代表什么;第二层是技术路线,说明 DDA、DIA、targeted 和结构蛋白组为什么对应不同问题;第三层是应用场景,说明 discovery、mechanism、verification 和 clinical assay 的证据强度不同。学生如果只记住“质谱能测很多蛋白”,就无法判断项目应该选择全蛋白、PTM、PRM 还是空间路线。
离子化与仪器
ESI 解决了大分子温和进入气相的问题,使肽段和蛋白可以以多电荷离子形式进入质谱。Orbitrap 通过静电轨道阱和图像电流检测实现高分辨、高质量精度测量。TIMS/diaPASEF 在 m/z 与保留时间之外加入离子淌度维度,提高复杂样本中的离子利用率。Astral 代表高速高灵敏 MS/MS 的新平台能力,使短梯度、低输入和深覆盖 DIA 更容易同时成立。
仪器发展改变的是项目可行边界。ESI 让肽段进入气相,Orbitrap 让高质量精度和高分辨成为常规,离子淌度增加一维分离,Astral 类平台提高 MS/MS 采样速度和低丰度信号捕获能力。实际项目中,仪器并不是越新越自动成功;样本复杂度、色谱峰宽、扫描循环、DIA 窗口、AGC/注入时间和软件参数必须匹配,否则高速平台也可能产生干扰峰、低重复性或不稳定定量。
DIA 与软件
DIA/SWATH 将一段 m/z 范围内的前体离子系统性碎裂,避免 DDA 中“只挑最强峰”的随机性。结果分析依赖谱图库或预测模型、保留时间校准、碎片离子共洗脱、峰组评分和 FDR 控制。OpenSWATH 代表开放算法框架,Spectronaut 代表商业化工程实现,DIA-NN 体现深度学习在谱图识别和定量中的作用。
DIA 教程必须把采集和软件放在一起讲。窗口过宽会提高覆盖但增加干扰,窗口过窄会降低干扰但需要更多循环时间;循环时间过长会导致色谱峰采样点不足,影响定量精度。软件侧需要判断多个碎片离子是否在同一保留时间共洗脱、强度比例是否符合谱图库或预测谱图、目标峰是否与干扰峰分离。directDIA/library-free 并不是“不需要知识”,而是把实验谱图库的一部分功能交给预测模型和数据驱动搜索。
PTM 与机制
PTM 分析把“蛋白有多少”推进到“蛋白处于什么调控状态”。磷酸化可反映激酶通路活性,乙酰化、泛素化和 SUMOylation 可指向染色质调控、蛋白稳定性和细胞应激。质谱在 PTM 中的关键不是只找到修饰肽,而是判断修饰位点是否定位可靠、富集是否有偏好、修饰信号是否与蛋白总量变化区分开。
PTM 教程要把“修饰肽段”与“调控机制”之间的证据链讲清楚。首先,富集策略决定进入质谱的分子集合,不同富集方法对位点、序列和蛋白类别有偏好;其次,位点定位需要足够的定位离子和清楚的概率评分;再次,修饰信号应与总蛋白量联动分析,否则无法区分“蛋白变多导致修饰肽变多”和“单位蛋白上的修饰比例改变”。对于激酶通路,单个位点变化通常还需要 motif、上下游蛋白、时间序列或抑制剂扰动支持。
互作与结构
蛋白功能常由复合物和构象环境决定。AP-MS 捕获 bait 蛋白相关复合物,SAINT 等统计模型用于区分真实互作与背景污染;BioPlex 展示了大规模互作网络如何把单个蛋白放回细胞系统;交联质谱和热稳定性分析则能提供空间距离、构象变化和药物结合状态线索。
互作和结构蛋白组学把质谱从“鉴定有哪些蛋白”推进到“这些蛋白如何组织在一起”。AP-MS 适合稳定复合物,但容易受到高丰度背景蛋白影响;邻近标记适合短暂或空间邻近关系,但不等同于直接物理结合;交联质谱提供距离约束,可辅助结构模型;热稳定性和化学蛋白组学适合判断药物结合和蛋白构象改变。不同技术的证据类型不同,不能用同一个语言解释。
单细胞与空间
单细胞蛋白组把群体平均信号拆到细胞层级,适合识别细胞异质性、稀有细胞状态和扰动响应;空间蛋白组保留组织坐标,适合解释肿瘤微环境、发育结构和病理区域差异。两类技术都把样本量推到极低输入区间,因此前处理损失、载体通道、缺失值、批次效应和空间采样策略会直接影响结论。
单细胞和空间技术不是“更高级的普通蛋白质组”。低输入会让污染蛋白、吸附损失、随机缺失和批次效应占据更大比例;空间采样还会引入 ROI 选择、细胞组成混合、组织切片质量和病理标注一致性问题。结果解释时,单细胞聚类需要证明不是批次或缺失值驱动,空间差异需要证明不是区域大小、坏死、血管丰富度或组织组成差异造成。
临床转化
临床和药物研发场景强调可复核、可转移和可解释。Discovery proteomics 适合发现候选蛋白、通路和药物响应模式;验证阶段需要 PRM/MRM、SISCAPA、稳定同位素内标、标准曲线或跨队列复现;进入临床应用前还需要 SOP、质控品、批次监控、报告规则和模型外部验证。
临床教程要强调证据等级。发现阶段可以接受较宽的问题空间,用于提出候选;验证阶段要缩小目标、确认肽段唯一性、选择稳定内标和检查基质干扰;转化阶段要证明 assay 在真实样本、真实批次和真实终点中可重复。一个多蛋白 panel 还需要说明模型如何训练、阈值如何确定、混杂因素如何处理、不同中心和平台是否可迁移。
学习检查
先看同位素峰间距,再用 1/z 估算电荷数;随后把 m/z 转回中性质量。判断正确后,才可以讨论理论肽段质量、修饰质量偏移和数据库匹配。若电荷态判断错误,后续质量误差、肽段候选和修饰解释都会偏离。
DIA 的优势在队列一致性。教程判断应同时检查窗口设计、循环时间、峰组评分、FDR 层级、缺失值比例、QC 聚类、批内/批间 CV 和批次效应。如果鉴定数很高但缺失值和 CV 不稳定,项目仍然不适合进入生物解释。
需要证明修饰位点定位可靠、修饰肽定量稳定,并与总蛋白量变化区分开。通路结论还应有 motif、上游酶、时间序列、扰动实验或多个相关位点支持。单个位点显著变化只能作为机制线索,不能直接等同于通路被激活。
临床 biomarker 需要样本类型、检测方法、目标肽段、内标、阈值、适用人群、干扰因素、验证队列和报告规则。Discovery 只提供候选,verification 和 assay 开发才决定它能否被稳定检测并用于真实决策。
首要风险是低输入带来的随机缺失、污染、批次效应和采样偏差。单细胞项目要检查每细胞蛋白数、缺失值和批次结构;空间项目要检查 ROI、组织组成、病理标注和空间邻域。分辨率提高并不自动代表结论更可靠。
AI 可用于谱图/保留时间/离子淌度预测、DIA 峰组评分、QC 异常识别、缺失值处理、知识图谱解释和临床风险模型。但 AI 输出必须受 FDR、独立验证集、批次控制和生物学验证约束,不能替代实验设计。