信号预测
从肽段序列预测碎片离子强度、保留时间、离子淌度或可检出性,缩小候选验证成本。
AI-assisted proteomics
AI 已进入谱图、保留时间和离子淌度预测,肽段打分,质量控制,蛋白结构与知识检索。它提高候选排序和异常识别效率,但不能替代实验设计、FDR 控制、独立验证或因果判断。
Capability map
不同模型面对的输入、输出和误差并不相同。谱图预测服务于候选匹配,异常检测服务于样本与批次 QC,结构模型服务于假设生成,语言模型服务于知识检索和结果组织。
从肽段序列预测碎片离子强度、保留时间、离子淌度或可检出性,缩小候选验证成本。
结合实验谱图、预测谱图、RT 和 CCS 特征提高 target/decoy 分离,但最终仍需受控 FDR。
识别色谱漂移、喷雾不稳、污染、批次异常和样本离群,帮助决定是否放行。
学习样本或蛋白的低维表示、进行 feature ranking;插补结果不可冒充真实测量。
预测蛋白结构与置信度,辅助解释突变、结合界面和结构响应,但不是直接结合证据。
连接 UniProt、通路、疾病和文献证据,生成可追踪的候选清单;每条结论必须回到来源。
Search and quantification
谱图、RT 和 CCS 预测把序列候选转换为可与实验信号比较的特征。数据库、酶切、修饰和 decoy 决定搜索空间;模型负责排序或过滤,二者职责不能混淆。
从 Proteome FASTA 理论酶切,定义修饰、电荷和漏切。
生成碎片强度、RT、CCS 或可检出性。
提取峰组并比较质量、共洗脱、离子强度与预测特征。
结合 target/decoy、q-value 与层级 FDR 控制错误发现。
检查干扰、线性、缺失、CV 和跨批次稳定性。

预测谱库、directDIA 候选打分、RT 校准、离子淌度过滤和干扰识别。
错误物种 FASTA、缺失真实蛋白序列、不合理搜索参数和失控的多重检验。
除识别数外,还要比较肽段级校准、已知比例准确性、CV、完整性和独立验证通过率。
Quality control
异常分数本身不是结论。可用的 QC 系统需要指出异常来自哪类指标、与哪个参考分布比较、是否影响定性或定量,并保留人工复核入口。
| 任务 | 模型可以做什么 | 必须保留的人工判断 |
|---|---|---|
| 离群样本识别 | 整合多指标给出风险排序和相似样本。 | 区分技术异常与真实生物异质性。 |
| 批次监控 | 检测时间漂移、设备状态改变和分布偏移。 | 判断是否重跑、校正或分批报告。 |
| 缺失值处理 | 估计缺失机制并给出插补候选。 | 避免把 MNAR 当作随机缺失,报告插补影响。 |
| 自动解释 | 把指标转为可读摘要和待复核清单。 | 确认阈值、证据和最终放行结论。 |
Structure and knowledge
结构预测可定位保守区域、结构域和潜在界面;知识模型可汇总条目、通路和文献。两者最适合帮助确定下一步验证,而不是把预测概率写成直接实验事实。
把差异肽段、LiP 切割位点、突变或 PTM 位点映射到结构区域,寻找需要验证的机制线索。
用 accession 和 gene 锁定对象,再聚合 UniProt、通路、疾病和文献证据,避免同名歧义。
候选最终回到 PRM、免疫学、突变、竞争、剂量响应或功能实验验证。
Validation boundary
模型名称和总体准确率不足以判断能否用于真实项目。数据来源、划分方式、校准、失败模式和版本漂移都要进入放行标准。
物种、仪器、梯度、样本类型和标签来源是否匹配。
是否按蛋白、项目或批次隔离,避免近重复泄漏。
模型分数能否对应实际错误率和风险等级。
低丰度、未见物种、新仪器和极端批次时如何退化。
记录模型、数据、参数版本和分布漂移。
| 可接受表述 | 不可直接得出的结论 | 补充证据 |
|---|---|---|
| 模型提高了候选区分度。 | 新增候选全部是真实鉴定。 | target/decoy、合成肽或独立数据验证。 |
| 异常分数提示样本偏离参考分布。 | 该样本应自动删除。 | 原始信号、批次记录和生物学背景。 |
| 结构预测支持潜在界面假设。 | 蛋白已被证明直接结合。 | 竞争、占靶、突变或生物物理实验。 |
| 语言模型汇总了相关证据。 | 生成摘要可替代来源核验。 | 稳定数据库标识符、原始论文和日期。 |