DIA 系统覆盖预设窗口
仪器按连续 m/z 窗口共同碎裂多条共洗脱前体,减少 DDA 依赖强度触发选择所造成的随机漏采。代价是 MS2 谱更混合,需要更严格的提取、打分与干扰控制。
Data-independent acquisition
DIA 系统采集预设质量范围内的碎片离子信息,LFQ 再把可复核的离子信号转换为跨样本相对丰度。可靠结果依赖采集窗口、色谱稳定性、峰组识别、FDR、干扰控制、归一化和蛋白汇总共同成立。
测量逻辑
DIA 是采集策略,不等同于某个搜索软件或单一蛋白定量公式。无标记定量通常以离子峰面积或强度为基础,输出的是跨样本相对丰度;没有外部校准物时,不应解释为绝对浓度。
仪器按连续 m/z 窗口共同碎裂多条共洗脱前体,减少 DDA 依赖强度触发选择所造成的随机漏采。代价是 MS2 谱更混合,需要更严格的提取、打分与干扰控制。
肽段查询信息可来自实验谱库、预测谱库或 DIA 数据内部搜索。碎片离子、保留时间、峰形和共洗脱关系共同形成候选峰组,随后用 target-decoy 与 q-value 控制错误发现。
软件从 MS1 或 MS2 提取离子色谱并积分,剔除明显干扰,再完成运行间校准、归一化及 precursor、肽段和蛋白层汇总。每一步都可能改变完整性和比值偏差。
临床队列、药物筛选和多批次项目都依赖跨运行比较。DIA 的系统采集为重复提取同一批肽段提供基础,但最终是否稳定仍取决于 QC、批次平衡、峰组边界、归一化和低丰度干扰。鉴定深度、完整性、CV、比值误差和批次漂移应共同报告。
技术沿革
技术演进的主线不是单纯增加蛋白数,而是提高采集一致性、自动化峰组识别、跨运行对齐、定量准确性和大队列可扩展性。
Gillet 等把系统性 DIA 碎片离子图与谱库查询结合,建立一致检测和定量的经典框架。
Molecular & Cellular Proteomics已知真值
benchmark 的价值在于预先知道每类蛋白在 A、B 两组之间应保持不变、升高或降低,从而把覆盖、精密度和准确性放进同一套数据中评价。
同一套 HYE 数据既可写 A:B,也可写 B/A。当前 LFQ Benchmark 页面以 B/A 计算,因此 yeast 的理论 log2FC 为 −1,E. coli 为 2。方向写反会让整张准确性图看似系统偏移。
能识别很多蛋白不代表比值准确。只有参照组和比较组均有有效定量值的对象才能进入 fold change 误差计算;其余对象仍应计入覆盖、缺失率和完整性。
低丰度端更容易出现缺失、干扰和比值压缩。把误差、CV 和完整性按平均丰度分箱,才能定位可靠区间,而不是只给全局中位数。
同一 precursor 或肽段若可归属于多个物种,不具备唯一物种真值。此类对象可用于总数统计,但不应进入物种比值准确性或可靠性计算。
大队列微量掺入策略关注同一掺入条件的重复稳定性,以及“应存在的物种必须检出、不应存在的物种不应检出”。它与 HYE 已知比值 benchmark 的问题不同,不应保留没有日期结构的跨日期图,也不应把 yeast-only、E. coli-only 与双菌条件直接解释为理论 fold change。
比较两套 Demo结果解读
单一相关系数、单一 CV 或蛋白总数都不能独立证明定量可靠。不同指标对应不同误差来源。
报告了多少蛋白组、肽段或 precursor,以及各物种和各样品的有效定量数量。它描述“看见多少”,不直接描述比值是否正确。
每个对象在应有样品中的非缺失比例。应使用完整结果统计,不能用页面抽样或当前分页代替。
同组重复的一致性,常用 CV 或重复相关性表示。CV 受均值、低丰度和缺失处理影响,必须说明计算层级和有效重复数。
观测 log2FC 与理论 log2FC 的距离。中位绝对误差反映典型偏差,P90 反映尾部风险;符号偏差可提示系统性比值压缩或方向错误。
在物种掺入设计中检查错误物种检出、共享序列和潜在干扰。存在性判断与丰度比值判断应分开。
按日期、批次、仪器、丰度区间和分析层级检查结论是否稳定。没有对应实验结构时,不应生成空图或强行解释。
log2FC = log2(比较组 / 参照组)。比值 1 对应 0;2 倍对应 1;4 倍对应 2;减半对应 −1。对数转换把倍数上调与下调放到以 0 为中心的对称尺度,也便于直接计算绝对误差。例如理论 log2FC 为 2、观测为 1.75,则绝对误差为 |1.75 − 2| = 0.25 log2,相当于观测倍数与理论倍数相差约 2^0.25 ≈ 1.19 倍。
分析路径
谱库策略决定候选肽段知识从哪里来。最终定量仍需要对 DIA 运行执行峰组提取、打分、FDR 控制和定量汇总。
使用 DDA、分级或历史项目建立的碎片谱和保留时间信息。优势是证据直观且可复用;限制是额外实验成本、库与当前样品/仪器不匹配,以及库覆盖对结果上限的约束。
从 FASTA 或候选肽段预测碎片强度与保留时间,减少实验建库需求。搜索空间、模型适配和实测校准仍影响 FDR、速度与结果深度。
以 DIA 原始数据和 FASTA 先执行 spectrum-centric 搜索,生成项目特异谱库,再对同一批 DIA 运行进行 peptide-centric 靶向提取和定量。它绕过预先建立的外部实验库,但不绕过数据库、搜索空间和 FDR。
实验设计
在采集前固定参照组、比较组、理论比例、log2FC 方向和可进入准确性计算的唯一归属对象。
生物学重复、技术 QC 和样品随机化用于区分方法波动、批次漂移与真实生物差异。
precursor/肽段层用于定位干扰和缺失来源,蛋白层用于评价最终报告;两层结论不能互相替代。
大表可以抽样绘图或分页展示,但总数、分位数、CV、完整性、阈值占比和打分必须使用完整结果。
按丰度、物种和批次说明在哪些区间内 CV、完整性和误差可接受,并列出需要复核或不能外推的对象。
报告应记录软件版本、搜索策略、FDR、定量层级、归一化、缺失处理、分组和阈值,以支持复算与审计。
| 常见结论 | 可以支持 | 不能自动支持 |
|---|---|---|
| 重复 CV 较低 | 当前组内测量具有较好精密度 | 理论比值恢复准确、没有系统偏差 |
| Pearson r 较高 | 样品整体丰度排序相似 | 低丰度蛋白可靠、每个 fold change 都准确 |
| 蛋白鉴定数较高 | 当前搜索和阈值下覆盖较深 | 跨样品完整、干扰较低、物种特异 |
| HYE 误差较低 | 受控混合样品的比值恢复良好 | 所有真实生物样品、基质和动态范围都同样可靠 |
原始文献
以下论文分别对应 DIA 采集、peptide-centric 提取、LFQ 汇总、软件工作流、跨运行对齐、混合物种 benchmark、预测谱库、神经网络分析和大队列重复性。