ΩOmicSolution蛋白质组学技术平台

蛋白质组质谱课程

原理、技术演进与关键证据

质谱原理与近十年蛋白质组学发展

LC-MS/MS 的物理读数经过肽段鉴定与定量,可进一步形成蛋白、修饰、互作、空间位置、单细胞状态和临床标志物证据。2016 年的经典综述建立了结构与功能蛋白组学框架,2025 年的综述则把高灵敏度、DIA、单细胞、空间、AI 和临床应用串成当前主线。

2 篇 Nature review 8 张核心图 10 年技术演进 DIA / 单细胞 / AI / 临床

2016 总纲

蛋白质组的结构与功能读数

底物、修饰、互作、构象与 proteotype 状态共同决定蛋白层信息。

2025 总纲

从单细胞到临床应用

样本处理、仪器、采集策略、AI 分析和临床转化构成现代 MS-based proteomics 主线。

课程目标

从原理进入路线选择

样本类型、仪器平台、采集方式和软件结果共同决定实验路线。

核心原理

LC-MS/MS 把蛋白样本转化为可解释的肽段证据

质谱不是直接“看见蛋白”,而是记录离子在电场、磁场或飞行路径中的质量荷比信号。蛋白质组学通过可重复的前处理、液相分离、离子化、质量分析和软件推断,把这些信号转成可检索、可定量、可解释的蛋白层信息。

读数链路

从蛋白到谱图

  1. 蛋白消化为肽段:胰蛋白酶等酶切把复杂蛋白转为更适合 LC-MS/MS 的肽段集合。
  2. LC 分离降低复杂度:反相色谱按疏水性分散肽段,让同一时间进入质谱的离子更少。
  3. ESI 形成多电荷离子:肽段带上电荷后进入气相,质谱读取的是 m/z,而不是单纯质量。
  4. MS1 记录前体离子:高分辨质量分析器记录前体离子 m/z、强度和保留时间。
  5. MS2 记录碎片离子:碰撞碎裂产生 b/y 等离子系列,软件据此推断肽段序列。
  6. 软件完成鉴定与定量:FDR、谱图库、directDIA、峰组评分和归一化决定结果可信度。

分辨率

分清近邻离子

分辨率越高,越容易把质量接近的离子分开;在复杂样本、同位素峰和修饰肽段中尤其关键。

质量精度

缩小候选空间

ppm 级质量精度能显著减少错误匹配;但结果仍需要碎片谱、保留时间和 FDR 共同约束。

动态范围

决定低丰度可见性

血浆、组织和单细胞样本的主要难点不是只有“够不够灵敏”,还包括复杂背景中低丰度肽段是否能稳定定量。

原理教程

从一条肽段信号学会判断质谱结果

教程学习的重点不是背流程名词,而是理解每个物理和软件步骤怎样改变最终结果。下面六个概念可以作为后续阅读任何蛋白质组学论文、软件报告和项目 QC 的基础坐标。

1. m/z

质谱看到的是质量荷比

肽段在 ESI 中通常形成 2+、3+ 或更高电荷态。质谱横轴是 m/z,因此同一肽段带不同电荷会出现在不同位置;同位素峰之间的间距也会随电荷数变化。判读谱图时先确认电荷态,再把 m/z 转换为中性质量,才能进入数据库匹配或目标肽段确认。

  • 判断标准:同位素峰间距约为 1/z,2+ 峰间距约 0.5 Th,3+ 峰间距约 0.33 Th。
  • 常见误区:把 m/z 当作肽段质量,会导致质量偏差、修饰判断和电荷分配全部出错。

2. LC 峰

保留时间决定信号是否能被分开

LC 的作用是把复杂肽段混合物按时间展开。峰宽越窄、峰形越对称、保留时间越稳定,软件越容易在 MS1/MS2 中找到一致峰组。短梯度会压缩峰容量,适合高通量但更依赖高速扫描和强软件去卷积;长梯度更利于深覆盖,但降低样本通量。

  • 判断标准:同一 QC 样本的 RT 漂移、峰宽、峰容量和总离子流应保持稳定。
  • 常见误区:只看总鉴定数,不检查色谱峰形和 RT 漂移,会漏掉早期系统性故障。

3. MS/MS

碎片离子提供序列证据

CID/HCD 等碎裂方式会让肽段主链断裂,形成 b/y 离子系列。肽段鉴定依赖理论碎片与实测碎片的匹配程度,同时受到质量精度、信噪比、共碎裂干扰和修饰位点定位影响。DDA 中一个谱图通常围绕一个前体解释;DIA 中一个窗口包含多个前体,软件必须从混合谱图中提取目标肽段的碎片共洗脱证据。

  • 判断标准:可靠鉴定应有连续离子系列、合理质量误差、稳定 RT 和可控 FDR。
  • 常见误区:只看到几个匹配碎片就认为位点可靠,忽略同分异构修饰和共碎裂干扰。

4. FDR

错误发现率控制结果可信度

数据库搜索会产生大量候选匹配,target-decoy 策略通过诱饵库估计错误比例。FDR 可以在 PSM、peptide、protein 和 site 层级分别控制,不同层级不能相互替代。DIA 中还存在 precursor、peptide、protein、run-specific 与 experiment-wide 等不同控制方式,直接影响缺失值和定量矩阵。

  • 判断标准:报告中应说明 FDR 层级、阈值、是否按 run 控制、蛋白推断规则和修饰位点定位标准。
  • 常见误区:把 1% PSM FDR 等同于 1% protein FDR,或把位点鉴定等同于位点定位可靠。

5. 定量

强度不是结果,矩阵才是结果

定量从峰面积或峰高开始,但项目结果通常是经过归一化、缺失值处理、批次校正和蛋白汇总后的矩阵。Label-free 强调 run 间稳定性;TMT/多重化强调通道归一化和比例压缩控制;PRM/MRM 强调目标肽段响应、内标和标准曲线。不同定量路线对应不同误差来源。

  • 判断标准:同组重复 CV、缺失值比例、QC 聚类、批次分布和内标稳定性应同时检查。
  • 常见误区:把软件导出的 protein intensity 直接当作绝对浓度,忽略肽段响应和归一化假设。

6. 蛋白解释

从肽段回到生物问题

蛋白解释需要把鉴定、定量和生物学层级连接起来。一个蛋白显著变化可能代表表达变化、细胞组成变化、蛋白降解、PTM 改变、复合物状态变化或样本前分析差异。教程中所有方法最终都要回到研究问题:是发现候选、解释机制、建立验证 assay,还是构建临床风险模型。

  • 判断标准:重要结论应能说明蛋白证据、位点证据、通路证据和实验设计证据如何互相支持。
  • 常见误区:把差异蛋白名称直接写成机制结论,而没有验证位置、修饰、互作或功能方向。

发展历程

2016-2025:从结构功能框架到临床与单细胞应用

过去十年的核心变化,是质谱蛋白质组学从“更深地测更多蛋白”扩展为“在更低输入、更高通量、更复杂空间和更强解释模型中稳定读出蛋白状态”。

2016 结构与功能蛋白组学框架成型

这一阶段的重点是把质谱从“蛋白鉴定工具”升级为“功能状态测量工具”。Aebersold 与 Mann 的框架强调,蛋白丰度只是 proteome 的一部分,PTM、复合物、构象、定位和 proteotype 状态同样能通过质谱或质谱相关技术读出。

  • 学习重点:区分 protein abundance、PTM site、protein complex 和 proteotype。
  • 项目判断:如果问题是机制或药物作用,单纯全蛋白差异通常不够。
2017-2020 DIA 与深度学习软件进入主流

DIA 逐渐从 SWATH 概念变成大队列工作流。它用系统性窗口碎裂换取更高数据完整性和回溯能力,软件侧则通过谱图库、保留时间校准、峰组评分和深度学习模型解决混合谱图解释问题。DIA-NN、Spectronaut 等工具让 library-free、预测谱图和大规模队列分析进入常规应用。

  • 学习重点:DIA 的核心指标是队列完整性、CV、缺失值和 FDR,而不只是单针鉴定数。
  • 项目判断:大队列 discovery、血液样本和临床前验证通常优先考虑 DIA 工程稳定性。
2021-2023 低输入、plexDIA、diaPASEF 与空间/单细胞规范化

这一阶段解决的是“样本更少、通量更高、维度更多”的问题。低损耗前处理和芯片体系降低单细胞/微区组织损失;plexDIA 通过多通道非等重标记提升通量和数据完整性;diaPASEF 利用离子淌度增加选择性;单细胞报告建议开始规范样本数、缺失值、批次和数据共享。

  • 学习重点:低输入能力会放大污染、吸附、缺失值和批次效应。
  • 项目判断:单细胞和空间项目必须在分辨率、覆盖深度和稳定性之间取舍。
2024-2025 Astral、AI 和临床转化加速

高速高灵敏 MS/MS 平台推动短梯度、低输入和深覆盖 DIA 同时推进;AI 谱图预测、峰组评分、QC 和临床模型进入工作流;空间蛋白组成为年度方法,临床体液蛋白组和药物研发 proteomics 继续扩展应用边界。Guo 等 2025 年综述把这些方向统一为从单细胞到临床应用的技术链。

  • 学习重点:AI 是识别、QC 和解释工具,不是替代实验设计和验证的捷径。
  • 项目判断:临床转化必须从 discovery 进入 verification、assay、SOP 和外部验证。

核心图谱

质谱蛋白质组学的技术框架

工作流、低输入样本、临床 assay、AI、PTM、互作结构和 proteotype 状态共同决定现代质谱蛋白质组学的应用边界。

Basic MS-based proteomics workflow

Guo et al. 2025 Fig. 1

MS-based proteomics 的完整工作流

现代 MS-based proteomics 从样本进入仪器之前就已经开始决定数据质量。体液、组织和单细胞对应完全不同的蛋白丰度范围、基质复杂度和可用起始量;自动化前处理的价值在于降低人为误差、减少转移损失,并让消化、脱盐、标记和上机顺序在大队列中保持一致。低输入样本尤其容易受到管壁吸附、污染蛋白和干燥损失影响,因此样本处理不能只用“总蛋白量”评价,还要同时看回收率、批内 CV、空白背景和肽段分布。

图中的 multiplexing by chemical labelling 指向两类常见策略:等重标记适合在 MS2 或 MS3 层面比较多个样本,非等重或质量差标记可与 DIA 结合提升通量。多重化可以减少缺失值并提高通量,但也会引入通道串扰、比例压缩、标记效率和 channel-specific FDR 等问题。进入 LC 后,色谱柱、梯度长度、柱温和流速共同决定峰宽、峰容量和低丰度肽段是否能从背景中分开;短梯度能提高通量,但对仪器扫描速度和软件去卷积提出更高要求。

DDA、DIA 和 targeted acquisition 代表三种不同的信息采集哲学。DDA 逐个选择强前体碎裂,谱图解释直观但重复性受采样随机性影响;DIA 系统性碎裂窗口内所有离子,适合队列一致性和回溯分析;PRM/MRM 则围绕预先定义肽段建立高特异性验证方法。数据分析不只是“搜库”,还包括谱图库或预测谱图、保留时间/iRT 校准、峰组评分、蛋白推断、FDR 控制、归一化、批次校正和网络/通路解释。

  • 低输入样本:优先控制回收率、污染、转移损失和空白背景,而不是单纯追求最高鉴定数。
  • DIA 项目:窗口设计、谱图库或 directDIA 策略、峰组评分和缺失值模式共同决定队列可信度。
  • 临床队列:样本前分析、自动化批次、QC 样本、报告版本和数据留痕必须同步设计。
Single-cell and spatial proteomics

Guo et al. 2025 Fig. 2

单细胞与空间蛋白组

单细胞蛋白组学把蛋白质组测量从群体平均推进到细胞异质性层面。它能区分同一组织或同一培养体系中的细胞状态、药物响应和稀有亚群,但每个细胞的蛋白量极低,导致肽段损失、随机缺失和批次效应被显著放大。常见策略包括高回收率芯片或纳升级反应体系、载体通道、低流速 LC、高灵敏 MS/MS 和面向稀疏数据的软件处理。单细胞结果需要同时说明细胞数、每细胞蛋白覆盖度、缺失值分布、批次结构和归一化策略。

空间蛋白组学的关键不是把组织切成很多点后简单做 LC-MS/MS,而是在蛋白读数中保留组织坐标。激光显微切割、微流控采样、成像质谱、抗体成像和 LC-MS-based spatial proteomics 各有分辨率、覆盖深度和定量精度差异。空间结果需要把 ROI、细胞组成、邻域关系、病理区域和蛋白通路联系起来;如果组织区域过小,蛋白覆盖度会下降,如果区域过大,又会重新回到混合平均信号。

Guo 等 2025 年综述把单细胞与临床应用放在同一条发展线上,是因为低输入能力会直接影响穿刺样本、FFPE、微区组织、循环肿瘤细胞和类器官模型。相关引用中的单细胞报告建议强调实验设计、缺失值、批次和数据共享规范;空间蛋白组年度方法强调 atlas-scale 组织图谱、组织病理联动和多模态整合。

  • 单细胞:每细胞蛋白数、缺失值、carrier 风险、批次校正和细胞注释必须共同报告。
  • 空间:ROI 大小、采样深度、组织结构、空间邻域和病理标注决定解释边界。
  • 共同基础:高灵敏仪器、低损耗前处理、稳定 LC 和稳健软件缺一不可。
Clinical assays from discovery proteomics

Guo et al. 2025 Fig. 3

从 discovery 到临床 assay

临床蛋白质组学的核心矛盾是:discovery 阶段希望尽可能广地覆盖蛋白和通路,临床 assay 阶段则要求稳定、可复核、可解释和可跨中心迁移。一个差异蛋白只有在样本前分析、检测方法、阈值、适用人群和验证证据都明确时,才可能成为 biomarker。血浆、尿液、脑脊液、组织和 FFPE 的前分析变量不同,采血管、离心、冻融、储存时间、溶血和批次都会改变蛋白信号。

从 discovery 进入 verification 时,通常需要把大规模 DIA 或 DDA 发现的候选蛋白压缩为可验证 panel。PRM/MRM 能针对候选肽段进行高特异性定量;稳定同位素内标可以校准回收率和仪器波动;SISCAPA 等免疫富集路线可把低丰度目标从复杂基质中拉出,提高灵敏度和特异性。进入临床队列后,单个项目的“显著差异”不够,必须评估跨队列复现、批次稳定性、干扰因素、模型校准和临床终点相关性。

药物研发中的 proteomics 还会把 abundance、PTM、热稳定性、靶点占有、通路反馈和毒性 readout 放在一起。此时质谱结果既可以用于靶点发现,也可以用于机制验证、药效标志物和伴随诊断候选。临床转化的落点不是把全蛋白质组报告原样交付,而是形成可维护的 assay、QC 体系和结果解释规则。

  • discovery:用于寻找候选蛋白、通路和亚型信号,重点是覆盖度、FDR 和队列结构。
  • verification:用于评估候选是否可重复、可定量、可转移,重点是目标肽段和内标体系。
  • clinical assay:需要 SOP、质控品、批次记录、阈值规则、模型验证和可追溯数据管理。
AI empowers MS-based proteomics

Guo et al. 2025 Fig. 4

AI 对质谱蛋白质组学的增强

AI 在质谱蛋白质组学中的作用已经从“结果建模”前移到实验和数据处理的多个环节。深度学习模型可以预测肽段碎片谱、保留时间和离子淌度,从而减少实验建库依赖,支持 library-free 或 hybrid library 分析;在 DIA 数据中,AI 可帮助识别共洗脱峰组、区分干扰峰、改进 q-value 估计和提高低丰度肽段的识别稳定性。Carafe、Prosit、DIA-NN 等方向都体现了预测谱图和深度学习评分对 DIA 的推动。

AI 也进入 QC 和临床解释。iDIA-QC 等工作把大规模 DIA 的质量控制从人工阈值推进到模型评分,能识别色谱漂移、喷雾不稳、批次异常和样本异常。临床模型中,机器学习可以把多蛋白 panel、临床变量和疾病终点整合为风险评分,但训练集偏倚、样本前分析差异、平台差异和过拟合会直接影响可转移性。

AI 增强不能替代实验设计。模型预测再强,也需要稳定的 LC-MS/MS 输入、清楚的样本分层、独立验证集和可解释的错误控制。对于教学和项目设计,AI 应被理解为提高谱图识别、质量控制和多变量解释能力的工具,而不是绕过 FDR、QC 和生物学验证的捷径。

  • 数据处理:谱图、保留时间和离子淌度预测能降低实验建库成本,提高 DIA 启动效率。
  • 质量控制:模型评分可帮助识别仪器漂移、批次异常和样本异常,但仍需可解释阈值。
  • 临床预测:需要跨队列、跨平台、前瞻性验证和清楚的模型适用边界。
Bottom-up proteomics workflows

Aebersold & Mann 2016 Fig. 1

Bottom-up proteomics 工作流

Bottom-up proteomics 将蛋白酶切为肽段后再进入 LC-MS/MS,是当前大多数 discovery proteomics 的基础路线。它的优势是可处理复杂样本、兼容高通量 LC-MS/MS、数据库搜索成熟,并能在组织、细胞、体液和微量样本中获得较深覆盖。其核心推断逻辑是“肽段证据支持蛋白存在和定量”,因此唯一肽段、共享肽段、蛋白组装规则和 protein inference 会直接影响最终蛋白列表。

这一路线也带来天然限制。蛋白被切成肽段后,完整蛋白异构体、剪接体、蛋白加工形式和多个 PTM 的组合关系可能丢失;同一肽段可能来自多个同源蛋白;某些区域因酶切位点、疏水性或离子化效率不佳而难以覆盖。Top-down 和 middle-down proteomics 可以补充完整蛋白或较长片段信息,但对仪器、分离和数据解释要求更高。

  • 鉴定层面:PSM、peptide、protein 三个层级的 FDR 不能混为一谈。
  • 定量层面:肽段强度需要经过峰提取、归一化、缺失值处理和蛋白汇总。
  • 解释层面:蛋白列表只是入口,仍需结合 PTM、互作、定位和通路。
Analysis of post-translational modifications

Aebersold & Mann 2016 Fig. 2

翻译后修饰分析

翻译后修饰决定蛋白活性、定位、稳定性和互作状态,是蛋白质组学区别于基因组和转录组的重要层面。磷酸化常用于追踪激酶/磷酸酶网络,乙酰化连接染色质和代谢状态,泛素化连接蛋白降解和应激响应,糖基化与分泌蛋白、膜蛋白和免疫识别关系密切。质谱通过修饰肽段的质量偏移和碎片离子来定位修饰位点,但修饰肽通常丰度低、动态范围宽,常需要 TiO2、IMAC、抗体富集或化学富集策略。

PTM 结果的关键风险在于位点定位和定量归因。一个修饰肽显著变化,可能来自修饰比例变化,也可能来自该蛋白总量变化;一个肽段包含多个潜在修饰位点时,需要使用 site localization probability、diagnostic ions 和谱图质量判断位点是否可靠。对于通路解释,位点功能注释、激酶 motif、时间序列和扰动设计比单次差异列表更重要。

  • 实验设计:富集策略决定可见修饰类型,样本量和起始蛋白量决定深度。
  • 数据分析:修饰位点、修饰肽段和对应蛋白总量应分开建模。
  • 生物解释:位点方向、通路上下游和时间动态共同决定机制可信度。
Interaction and structural proteomics

Aebersold & Mann 2016 Fig. 3

互作与结构蛋白组

蛋白质在细胞中通常以复合物、通路模块和结构状态发挥功能。AP-MS 通过亲和纯化 bait 蛋白捕获复合物,适合发现稳定或半稳定互作;BioID、TurboID 和 APEX 等邻近标记可以捕获瞬时或局部邻近关系;cross-linking MS 通过交联剂记录蛋白内部或蛋白之间的空间距离;limited proteolysis、HDX-MS、CETSA 和 thermal proteome profiling 可以把构象变化、配体结合和热稳定性变化转化为肽段或蛋白信号。

结构与互作蛋白组学的结果不能简单解释为“有互作/无互作”。裂解条件、标签位置、交联剂长度、细胞状态、背景蛋白、复合物动态和统计过滤都会改变结果。SAINT 等方法用于 AP-MS 背景建模,BioPlex 等大规模网络把互作结果放到系统层面,药物研发场景则常用热稳定性或化学蛋白组学判断靶点结合、脱靶效应和通路反馈。

  • 互作证据:需要阴性对照、重复、背景模型和 bait/prey 方向信息。
  • 结构证据:通常提供距离、稳定性或可及性约束,而不是完整三维结构本身。
  • 机制解释:应结合丰度变化、PTM、定位和功能实验,避免单一证据过度外推。
Proteotype states and phenotypes

Aebersold & Mann 2016 Fig. 4

Proteotype 状态与表型

Proteotype 指一个生物系统在特定遗传背景、环境、时间点和细胞状态下的蛋白质状态集合。它不是蛋白表达量的同义词,而是包括蛋白丰度、剪接/加工形式、PTM、蛋白复合物、亚细胞定位、周转速率和结构状态的综合表型。基因组提供潜在编码能力,转录组提供 RNA 层面响应,而 proteotype 更接近实际执行细胞功能的分子状态。

疾病、药物处理、发育阶段和微环境改变都会重塑 proteotype。肿瘤样本中,同一驱动突变可能对应不同蛋白通路活性;药物处理后,靶点丰度不一定变化,但热稳定性、磷酸化、互作或下游通路可能发生改变;临床体液样本中,炎症、凝血、组织泄漏和免疫反应会共同影响蛋白组合。蛋白质组学的价值正是在这些层面把 molecular state 与 phenotype 连接起来。

  • 状态集合:丰度、PTM、互作、定位和周转共同构成 proteotype。
  • 项目设计:不同问题需要不同 readout,不能用总蛋白表达覆盖所有机制问题。
  • 结果交付:临床或药物项目应把蛋白状态转换为可解释的通路、panel 或 assay。

技术源流

关键方法与应用节点

下表汇总质谱蛋白质组学发展中的关键节点,便于把基础原理、仪器平台、采集策略、软件算法和转化应用放到同一张技术地图中。

总纲

从 2003、2016 到 2025

现代蛋白质组学的核心问题从“能否鉴定大量蛋白”扩展为“能否在不同样本状态下稳定解释蛋白功能”。2003 年的总纲确立了 MS-based proteomics 作为系统测量蛋白质组的技术路线;2016 年框架把蛋白表达、修饰、互作、构象和 proteotype 状态合并为功能读数;2025 年框架进一步加入单细胞、空间、AI 和临床 assay。

教程中要把这三层框架串起来:第一层是测量对象,说明蛋白、肽段和修饰位点分别代表什么;第二层是技术路线,说明 DDA、DIA、targeted 和结构蛋白组为什么对应不同问题;第三层是应用场景,说明 discovery、mechanism、verification 和 clinical assay 的证据强度不同。学生如果只记住“质谱能测很多蛋白”,就无法判断项目应该选择全蛋白、PTM、PRM 还是空间路线。

  • 概念:proteome 不是静态清单,而是受细胞类型、扰动、时间和空间位置影响的动态状态。
  • 课程用途:后续讲 DDA、DIA、PRM、PTM、单细胞和临床转化时,都要回到“蛋白状态如何被可靠测量”这个主问题。

离子化与仪器

ESI、Orbitrap、TIMS 与 Astral

ESI 解决了大分子温和进入气相的问题,使肽段和蛋白可以以多电荷离子形式进入质谱。Orbitrap 通过静电轨道阱和图像电流检测实现高分辨、高质量精度测量。TIMS/diaPASEF 在 m/z 与保留时间之外加入离子淌度维度,提高复杂样本中的离子利用率。Astral 代表高速高灵敏 MS/MS 的新平台能力,使短梯度、低输入和深覆盖 DIA 更容易同时成立。

仪器发展改变的是项目可行边界。ESI 让肽段进入气相,Orbitrap 让高质量精度和高分辨成为常规,离子淌度增加一维分离,Astral 类平台提高 MS/MS 采样速度和低丰度信号捕获能力。实际项目中,仪器并不是越新越自动成功;样本复杂度、色谱峰宽、扫描循环、DIA 窗口、AGC/注入时间和软件参数必须匹配,否则高速平台也可能产生干扰峰、低重复性或不稳定定量。

  • 概念:仪器性能不是单一灵敏度指标,而是分辨率、扫描速度、离子传输、动态范围和稳定性的组合。
  • 课程用途:解释为什么同样是 DIA,不同平台会采用不同梯度长度、窗口宽度、上样量和 QC 阈值。

DIA 与软件

一次采集,反复挖掘

DIA/SWATH 将一段 m/z 范围内的前体离子系统性碎裂,避免 DDA 中“只挑最强峰”的随机性。结果分析依赖谱图库或预测模型、保留时间校准、碎片离子共洗脱、峰组评分和 FDR 控制。OpenSWATH 代表开放算法框架,Spectronaut 代表商业化工程实现,DIA-NN 体现深度学习在谱图识别和定量中的作用。

DIA 教程必须把采集和软件放在一起讲。窗口过宽会提高覆盖但增加干扰,窗口过窄会降低干扰但需要更多循环时间;循环时间过长会导致色谱峰采样点不足,影响定量精度。软件侧需要判断多个碎片离子是否在同一保留时间共洗脱、强度比例是否符合谱图库或预测谱图、目标峰是否与干扰峰分离。directDIA/library-free 并不是“不需要知识”,而是把实验谱图库的一部分功能交给预测模型和数据驱动搜索。

  • 概念:DIA 的优势不是单针最高鉴定数,而是队列完整性、缺失值控制和可重复定量。
  • 课程用途:后续讲 Spectronaut、directDIA、library-free search、CV 和批次效应时,需要先理解 DIA 数据不是简单的 MS2 列表。

PTM 与机制

从表达量走向调控位点

PTM 分析把“蛋白有多少”推进到“蛋白处于什么调控状态”。磷酸化可反映激酶通路活性,乙酰化、泛素化和 SUMOylation 可指向染色质调控、蛋白稳定性和细胞应激。质谱在 PTM 中的关键不是只找到修饰肽,而是判断修饰位点是否定位可靠、富集是否有偏好、修饰信号是否与蛋白总量变化区分开。

PTM 教程要把“修饰肽段”与“调控机制”之间的证据链讲清楚。首先,富集策略决定进入质谱的分子集合,不同富集方法对位点、序列和蛋白类别有偏好;其次,位点定位需要足够的定位离子和清楚的概率评分;再次,修饰信号应与总蛋白量联动分析,否则无法区分“蛋白变多导致修饰肽变多”和“单位蛋白上的修饰比例改变”。对于激酶通路,单个位点变化通常还需要 motif、上下游蛋白、时间序列或抑制剂扰动支持。

  • 概念:位点层 readout 与蛋白层 readout 不能混用;同一个蛋白的不同位点可能代表不同生物含义。
  • 课程用途:解释为什么 PTM 项目需要富集、位点定位评分、修饰特异性 QC 和独立的统计模型。

互作与结构

复合物、邻近关系和构象状态

蛋白功能常由复合物和构象环境决定。AP-MS 捕获 bait 蛋白相关复合物,SAINT 等统计模型用于区分真实互作与背景污染;BioPlex 展示了大规模互作网络如何把单个蛋白放回细胞系统;交联质谱和热稳定性分析则能提供空间距离、构象变化和药物结合状态线索。

互作和结构蛋白组学把质谱从“鉴定有哪些蛋白”推进到“这些蛋白如何组织在一起”。AP-MS 适合稳定复合物,但容易受到高丰度背景蛋白影响;邻近标记适合短暂或空间邻近关系,但不等同于直接物理结合;交联质谱提供距离约束,可辅助结构模型;热稳定性和化学蛋白组学适合判断药物结合和蛋白构象改变。不同技术的证据类型不同,不能用同一个语言解释。

  • 概念:互作证据通常是概率性和条件依赖的,受细胞状态、裂解条件、标签位置和背景蛋白影响。
  • 课程用途:连接蛋白丰度、复合物变化、药物靶点占有和结构功能解释,避免把差异蛋白直接等同于机制。

单细胞与空间

分辨率提升带来新 QC 问题

单细胞蛋白组把群体平均信号拆到细胞层级,适合识别细胞异质性、稀有细胞状态和扰动响应;空间蛋白组保留组织坐标,适合解释肿瘤微环境、发育结构和病理区域差异。两类技术都把样本量推到极低输入区间,因此前处理损失、载体通道、缺失值、批次效应和空间采样策略会直接影响结论。

单细胞和空间技术不是“更高级的普通蛋白质组”。低输入会让污染蛋白、吸附损失、随机缺失和批次效应占据更大比例;空间采样还会引入 ROI 选择、细胞组成混合、组织切片质量和病理标注一致性问题。结果解释时,单细胞聚类需要证明不是批次或缺失值驱动,空间差异需要证明不是区域大小、坏死、血管丰富度或组织组成差异造成。

  • 概念:分辨率提升会牺牲部分覆盖深度和稳定性,需要用更严格的 QC 说明数据边界。
  • 课程用途:解释为什么单细胞和空间项目不能只报告鉴定数,还必须说明细胞数、ROI、缺失值、批次和组织注释。

临床转化

从候选发现到可复核 assay

临床和药物研发场景强调可复核、可转移和可解释。Discovery proteomics 适合发现候选蛋白、通路和药物响应模式;验证阶段需要 PRM/MRM、SISCAPA、稳定同位素内标、标准曲线或跨队列复现;进入临床应用前还需要 SOP、质控品、批次监控、报告规则和模型外部验证。

临床教程要强调证据等级。发现阶段可以接受较宽的问题空间,用于提出候选;验证阶段要缩小目标、确认肽段唯一性、选择稳定内标和检查基质干扰;转化阶段要证明 assay 在真实样本、真实批次和真实终点中可重复。一个多蛋白 panel 还需要说明模型如何训练、阈值如何确定、混杂因素如何处理、不同中心和平台是否可迁移。

  • 概念:biomarker 不是一个差异蛋白名称,而是一套包含样本、检测方法、阈值、适用人群和验证证据的 assay。
  • 课程用途:连接 discovery、verification、absolute quantification、OmicsCloud 留痕和最终报告交付。

学习检查

关键判断问题

1. 如何从 m/z 判断肽段电荷态?

先看同位素峰间距,再用 1/z 估算电荷数;随后把 m/z 转回中性质量。判断正确后,才可以讨论理论肽段质量、修饰质量偏移和数据库匹配。若电荷态判断错误,后续质量误差、肽段候选和修饰解释都会偏离。

2. 一个 DIA 项目为什么不能只看鉴定数?

DIA 的优势在队列一致性。教程判断应同时检查窗口设计、循环时间、峰组评分、FDR 层级、缺失值比例、QC 聚类、批内/批间 CV 和批次效应。如果鉴定数很高但缺失值和 CV 不稳定,项目仍然不适合进入生物解释。

3. PTM 结果怎样才支持机制结论?

需要证明修饰位点定位可靠、修饰肽定量稳定,并与总蛋白量变化区分开。通路结论还应有 motif、上游酶、时间序列、扰动实验或多个相关位点支持。单个位点显著变化只能作为机制线索,不能直接等同于通路被激活。

4. 为什么临床 biomarker 不是差异蛋白列表?

临床 biomarker 需要样本类型、检测方法、目标肽段、内标、阈值、适用人群、干扰因素、验证队列和报告规则。Discovery 只提供候选,verification 和 assay 开发才决定它能否被稳定检测并用于真实决策。

5. 单细胞或空间蛋白组的首要风险是什么?

首要风险是低输入带来的随机缺失、污染、批次效应和采样偏差。单细胞项目要检查每细胞蛋白数、缺失值和批次结构;空间项目要检查 ROI、组织组成、病理标注和空间邻域。分辨率提高并不自动代表结论更可靠。

6. AI 能在哪些地方提高质谱工作流?

AI 可用于谱图/保留时间/离子淌度预测、DIA 峰组评分、QC 异常识别、缺失值处理、知识图谱解释和临床风险模型。但 AI 输出必须受 FDR、独立验证集、批次控制和生物学验证约束,不能替代实验设计。