ΩOmicSolution蛋白质组学技术平台

Data-independent acquisition

DIA 定量蛋白质组与 LFQ Benchmark

DIA 系统采集预设质量范围内的碎片离子信息,LFQ 再把可复核的离子信号转换为跨样本相对丰度。可靠结果依赖采集窗口、色谱稳定性、峰组识别、FDR、干扰控制、归一化和蛋白汇总共同成立。

采集与定量链路HYE 已知比例基准精密度与准确性经典方法文献

测量逻辑

DIA 解决“采到什么”,LFQ 解决“如何比较”

DIA 是采集策略,不等同于某个搜索软件或单一蛋白定量公式。无标记定量通常以离子峰面积或强度为基础,输出的是跨样本相对丰度;没有外部校准物时,不应解释为绝对浓度。

Acquisition

DIA 系统覆盖预设窗口

仪器按连续 m/z 窗口共同碎裂多条共洗脱前体,减少 DDA 依赖强度触发选择所造成的随机漏采。代价是 MS2 谱更混合,需要更严格的提取、打分与干扰控制。

Identification

识别是受控的证据匹配

肽段查询信息可来自实验谱库、预测谱库或 DIA 数据内部搜索。碎片离子、保留时间、峰形和共洗脱关系共同形成候选峰组,随后用 target-decoy 与 q-value 控制错误发现。

Quantification

定量来自可追溯的色谱峰组

软件从 MS1 或 MS2 提取离子色谱并积分,剔除明显干扰,再完成运行间校准、归一化及 precursor、肽段和蛋白层汇总。每一步都可能改变完整性和比值偏差。

从样品到蛋白丰度矩阵任何一环失稳,都可能让“鉴定到”与“定量可信”分离。
01酶解与 LC肽段分离和保留时间稳定性
02DIA 窗口采集规则覆盖 MS1 / MS2 范围
03候选肽段实验库、预测库或内部搜索
04峰组打分碎片、RT、峰形与共洗脱
05FDR 控制分层 q-value 与错误发现边界
06定量与归一化峰面积、干扰校正和样本尺度
07蛋白汇总由 precursor / 肽段形成蛋白矩阵
为什么重要

大队列需要的是可重复矩阵,不只是单针鉴定数

临床队列、药物筛选和多批次项目都依赖跨运行比较。DIA 的系统采集为重复提取同一批肽段提供基础,但最终是否稳定仍取决于 QC、批次平衡、峰组边界、归一化和低丰度干扰。鉴定深度、完整性、CV、比值误差和批次漂移应共同报告。

技术沿革

从宽窗口碎裂到大规模、预测驱动的定量矩阵

技术演进的主线不是单纯增加蛋白数,而是提高采集一致性、自动化峰组识别、跨运行对齐、定量准确性和大队列可扩展性。

DIA 早期宽窗口定量

Venable 等以不依赖单前体触发的串联质谱采集,展示复杂肽混合物的自动定量路径。

Nature Methods

SWATH 与 peptide-centric 提取

Gillet 等把系统性 DIA 碎片离子图与谱库查询结合,建立一致检测和定量的经典框架。

Molecular & Cellular Proteomics

OpenSWATH 与 MaxLFQ

OpenSWATH 推进自动化靶向提取;MaxLFQ 用肽段比值和延迟归一化改进蛋白层无标记定量。二者分别位于 DIA 处理和蛋白汇总链路。

OpenSWATH · MaxLFQ

Spectronaut 的完整 DIA 工作流

Bruderer 等在受控混合样品和生物模型中展示谱库、iRT、打分及定量集成工作流。

Molecular & Cellular Proteomics

LFQbench 与跨运行对齐

LFQbench 用已知物种比例系统评价软件的识别、精密度和准确性;TRIC 则改善多运行间峰组对齐与一致定量。

LFQbench · TRIC

跨实验室重复性验证

多实验室研究把 DIA 的定量表现从单一平台推进到跨地点、跨运行的可重复性评估。

Nature Communications

预测谱库与神经网络

Prosit 预测碎片谱和保留时间;DIA-NN 把神经网络打分、干扰校正和高速处理用于常规及短梯度 DIA。

Prosit · DIA-NN

短梯度、大队列与线性扩展

高扫描速度、预测驱动分析和 directLFQ 等可扩展汇总方法,使数千到数万样本的定量计算成为可执行工程问题。

大规模 DIA 重复性 · directLFQ

已知真值

LFQ Benchmark 用预设混合比例检验结果能否恢复真实变化

benchmark 的价值在于预先知道每类蛋白在 A、B 两组之间应保持不变、升高或降低,从而把覆盖、精密度和准确性放进同一套数据中评价。

经典 HYE124 设计人、酵母和大肠杆菌蛋白作为三类独立真值。

混合物 A

H. sapiens65%
S. cerevisiae30%
E. coli5%

混合物 B

H. sapiens65%
S. cerevisiae15%
E. coli20%
物种A:BB/A页面理论 log2FC
H. sapiens1:110
S. cerevisiae2:10.5−1
E. coli1:442
01

先固定比值方向

同一套 HYE 数据既可写 A:B,也可写 B/A。当前 LFQ Benchmark 页面以 B/A 计算,因此 yeast 的理论 log2FC 为 −1,E. coli 为 2。方向写反会让整张准确性图看似系统偏移。

02

再区分覆盖与准确性

能识别很多蛋白不代表比值准确。只有参照组和比较组均有有效定量值的对象才能进入 fold change 误差计算;其余对象仍应计入覆盖、缺失率和完整性。

03

按丰度检查边界

低丰度端更容易出现缺失、干扰和比值压缩。把误差、CV 和完整性按平均丰度分箱,才能定位可靠区间,而不是只给全局中位数。

04

避免共享序列制造伪真值

同一 precursor 或肽段若可归属于多个物种,不具备唯一物种真值。此类对象可用于总数统计,但不应进入物种比值准确性或可靠性计算。

另一类评估

微量物种 QC 不比较互不相同的掺入条件

大队列微量掺入策略关注同一掺入条件的重复稳定性,以及“应存在的物种必须检出、不应存在的物种不应检出”。它与 HYE 已知比值 benchmark 的问题不同,不应保留没有日期结构的跨日期图,也不应把 yeast-only、E. coli-only 与双菌条件直接解释为理论 fold change。

比较两套 Demo

结果解读

一个可信 benchmark 至少同时回答六类问题

单一相关系数、单一 CV 或蛋白总数都不能独立证明定量可靠。不同指标对应不同误差来源。

Coverage

覆盖度

报告了多少蛋白组、肽段或 precursor,以及各物种和各样品的有效定量数量。它描述“看见多少”,不直接描述比值是否正确。

Completeness

完整性

每个对象在应有样品中的非缺失比例。应使用完整结果统计,不能用页面抽样或当前分页代替。

Precision

精密度

同组重复的一致性,常用 CV 或重复相关性表示。CV 受均值、低丰度和缺失处理影响,必须说明计算层级和有效重复数。

Accuracy

准确性

观测 log2FC 与理论 log2FC 的距离。中位绝对误差反映典型偏差,P90 反映尾部风险;符号偏差可提示系统性比值压缩或方向错误。

Specificity

特异性

在物种掺入设计中检查错误物种检出、共享序列和潜在干扰。存在性判断与丰度比值判断应分开。

Robustness

稳健性

按日期、批次、仪器、丰度区间和分析层级检查结论是否稳定。没有对应实验结构时,不应生成空图或强行解释。

为什么常用 log2 fold change

log2FC = log2(比较组 / 参照组)。比值 1 对应 0;2 倍对应 1;4 倍对应 2;减半对应 −1。对数转换把倍数上调与下调放到以 0 为中心的对称尺度,也便于直接计算绝对误差。例如理论 log2FC 为 2、观测为 1.75,则绝对误差为 |1.75 − 2| = 0.25 log2,相当于观测倍数与理论倍数相差约 2^0.25 ≈ 1.19 倍。

分析路径

实验谱库、预测谱库与 directDIA 不是同一概念

谱库策略决定候选肽段知识从哪里来。最终定量仍需要对 DIA 运行执行峰组提取、打分、FDR 控制和定量汇总。

Library-based DIA

实验谱库

使用 DDA、分级或历史项目建立的碎片谱和保留时间信息。优势是证据直观且可复用;限制是额外实验成本、库与当前样品/仪器不匹配,以及库覆盖对结果上限的约束。

Predicted library

预测谱库

从 FASTA 或候选肽段预测碎片强度与保留时间,减少实验建库需求。搜索空间、模型适配和实测校准仍影响 FDR、速度与结果深度。

directDIA

项目内两步式工作流

以 DIA 原始数据和 FASTA 先执行 spectrum-centric 搜索,生成项目特异谱库,再对同一批 DIA 运行进行 peptide-centric 靶向提取和定量。它绕过预先建立的外部实验库,但不绕过数据库、搜索空间和 FDR。

Spectronaut directDIA 分析向导,显示运行文件选择步骤
directDIA 输入仍需明确。运行文件、FASTA、注释和设置共同定义项目内搜索与建库空间。图示来源:本门户 Spectronaut 正式手册资料。
Spectronaut directDIA 工作流和方法评估设置界面
方法评估与正式定量要区分。采集方法比较用于选择 DIA 方法,不等同于带生物学分组的正式定量实验。图示来源:本门户 Spectronaut 正式手册资料。

实验设计

把 benchmark 做成项目质量控制,而不是一次性演示

01

定义真值和方向

在采集前固定参照组、比较组、理论比例、log2FC 方向和可进入准确性计算的唯一归属对象。

02

设置重复与批次平衡

生物学重复、技术 QC 和样品随机化用于区分方法波动、批次漂移与真实生物差异。

03

保留层级

precursor/肽段层用于定位干扰和缺失来源,蛋白层用于评价最终报告;两层结论不能互相替代。

04

完整数据统计

大表可以抽样绘图或分页展示,但总数、分位数、CV、完整性、阈值占比和打分必须使用完整结果。

05

报告可靠区间

按丰度、物种和批次说明在哪些区间内 CV、完整性和误差可接受,并列出需要复核或不能外推的对象。

06

保存参数与来源

报告应记录软件版本、搜索策略、FDR、定量层级、归一化、缺失处理、分组和阈值,以支持复算与审计。

常见结论可以支持不能自动支持
重复 CV 较低当前组内测量具有较好精密度理论比值恢复准确、没有系统偏差
Pearson r 较高样品整体丰度排序相似低丰度蛋白可靠、每个 fold change 都准确
蛋白鉴定数较高当前搜索和阈值下覆盖较深跨样品完整、干扰较低、物种特异
HYE 误差较低受控混合样品的比值恢复良好所有真实生物样品、基质和动态范围都同样可靠

原始文献

经典方法与 benchmark 研究

以下论文分别对应 DIA 采集、peptide-centric 提取、LFQ 汇总、软件工作流、跨运行对齐、混合物种 benchmark、预测谱库、神经网络分析和大队列重复性。

  1. 2004 · DIA 前身Venable JD, et al. Automated approach for quantitative analysis of complex peptide mixtures from tandem mass spectra.Nature Methods · DOI
  2. 2012 · SWATHGillet LC, et al. Targeted data extraction of the MS/MS spectra generated by data-independent acquisition.Molecular & Cellular Proteomics · DOI
  3. 2014 · OpenSWATHRöst HL, et al. OpenSWATH enables automated, targeted analysis of data-independent acquisition MS data.Nature Biotechnology · DOI
  4. 2014 · MaxLFQCox J, et al. Accurate proteome-wide label-free quantification by delayed normalization and maximal peptide ratio extraction.Molecular & Cellular Proteomics · DOI
  5. 2015 · SpectronautBruderer R, et al. Extending the limits of quantitative proteome profiling with data-independent acquisition.Molecular & Cellular Proteomics · DOI
  6. 2016 · LFQbenchNavarro P, et al. A multicenter study benchmarks software tools for label-free proteome quantification.Nature Biotechnology · DOI
  7. 2016 · TRICRöst HL, et al. TRIC: an automated alignment strategy for reproducible protein quantification in targeted proteomics.Nature Methods · DOI
  8. 2017 · 多实验室Collins BC, et al. Multi-laboratory assessment of reproducibility, qualitative and quantitative performance of SWATH-MS.Nature Communications · DOI
  9. 2019 · PrositGessulat S, et al. Prosit: proteome-wide prediction of peptide tandem mass spectra by deep learning.Nature Methods · DOI
  10. 2020 · DIA-NNDemichev V, et al. DIA-NN: neural networks and interference correction enable deep proteome coverage in high throughput.Nature Methods · DOI
  11. 2020 · 大规模重复性Bruderer R, et al. Strategies to enable large-scale proteomics for reproducible research.Nature Communications · DOI
  12. 2023 · directLFQAmmar C, et al. Accurate label-free quantification by directLFQ to compare unlimited numbers of proteomes.Molecular & Cellular Proteomics · DOI