---
title: "糖肽分析突破数据库壁垒，曹纬倩、曾文锋最新Nature Commun：pGlycoNovo重磅上线"
author: "omicsolution"
account: "omicsolution"
published_at: "2024-09-15T10:59:59+08:00"
captured_at: "2026-08-26T17:25:12.771198+08:00"
source_url: "https://mp.weixin.qq.com/s/EjF4La6HHl-GbrBSVJtflw"
---

# 糖肽分析突破数据库壁垒，曹纬倩、曾文锋最新Nature Commun：pGlycoNovo重磅上线
点击蓝字

关注我们

质谱技术对位点特异性糖链进行精确定位在糖蛋白质组学中至关重要。然而，不同物种间糖链组合的多样性显然是当前糖数据库无法涵盖的，这导致糖组成和人、老鼠等糖型数据库较完整的物种差异较大物种的糖肽分析往往解析率较低。对于蛋白序列，我们现在可以通过测序来解决这个难题，而糖分析，则不得不更加依赖基于质谱数据的软件直接解析。

当前蛋白组糖基化的搜索引擎使用了三种主流的搜索策略分别是：peptide-first，glycan-removal以及glycan-first，其中最适合发现罕见糖链的是glycan-first算法，这类算法考虑全体Y-ion的使用效率。

复旦大学曹纬倩、计算所曾文锋2021年（Nature Methods）发表的pGlyco软件，是广受好评的已知糖肽分析软件，同年再次联合乔亮教授课题组发表了（Nature Commun） | DIA糖蛋白质组分析工具GproDIA，2022年和北航刘超合作又进一步支持了非标定量，发表了pGlycoquant软件（Nature Commun），同年易算也与曹纬倩合作发表GlycAP软件，助力糖肽分析普及。当来到2024年，对稀有糖型、缺乏糖库物种糖肽分析再进一步，今日Nature Commun上线了最新大作：pGlycoNovo软件。易算生物小伙伴协助本文统计及作图分析。（文末阅读原文访问）

插播广告：曾文锋研究员新进入职西湖大学，致力于进一步挖掘质谱数据中的甜蜜信息，如有志于投身质谱数据研究的博士、博士后，欢迎和他联系：zengwenfeng@westlake.edu.cn

![图片 1](images/001.png)

1

pGlycoNovo原理

pGlycoNovo 通过考虑所有可能的单糖组合，实现了对带有罕见糖链的完整糖肽的de novo搜库（图1a）。

pGlycoNovo搜库流程分为四个步骤，分别是：峰值互补质量的多聚糖计数和匹配、基于鉴定的Y离子生成Y离子图像、从y离子图中推断和过滤出的聚糖候选物、提取已鉴定的糖肽，然后进行糖肽评分和质量控制（图1c）。

通过鉴定昆虫细胞中表达的SARS-CoV-2棘突蛋白中完整的N糖肽和O糖肽，验证了pGlycoNovo在罕见的聚糖发现和搜索速度方面优于其他工具的性能，并且将糖链搜索结果扩大了16至1000倍，与非开放搜索方法相比，同时保持了准确性、灵敏度和速度（图1d）。

通过酵母、小鼠肝脏以及hela细胞的完整糖肽数据库调整了pGlycoNovo参数来展示出其在灵敏度，准确性和搜库速度上的优势。pGlycoNovo在三个数据集中表现出了超过98.5%的高精度，同时保持了超过70.9%的高效灵敏度，在搜库速度上也优于pGlyco3（图1g）

![图片 2](images/002.png)

图1

2

评估pGlycoNovo在SARS-CoV-2棘突蛋白上的搜索性能

作者对比了6种糖肽搜库软件的结果来评估pGlycoNovo在SARS-CoV-2棘突蛋白上的搜索性能，pGlycoNovo在罕见糖肽的搜索上表现最好，占比总糖肽的12.96%，其余基于数据库搜索的都没有发现罕见糖肽，而StrucGP仅有0.85%（图2a）。同时，作者还对比了五个搜索引擎的搜索速度，基于多样本多cpu核心的搜索策略，pGlycoNovo搜库速度优于其他软件（图2b）。并且pGlycoNovo对比已发现的糖肽，额外鉴定了230种糖肽，而且这230种糖肽覆盖了已发现糖肽的15个位点，说明pGlycoNovo鉴定的糖肽是无偏的（图2c）。作者还分析了pGlycoNovo鉴定的523个糖肽的糖型信息，发现罕见糖型主要分布于12个位点上，高度发生在功能连接处，从位点N1074到N1194（图2d）。此外，pGlycoNovo在该数据集中鉴定出了30个具有难以区分的相邻位点的O聚糖组成，其中12个是含有木糖和己糖醛酸单糖的罕见聚糖（图2e）。

![图片 3](images/003.png)

图2

pGlycoNovo和pGlyco3对于不同模式生物的N-糖蛋白组分析结果比较

作者进一步选取了五种模式生物，包含植物(A. thaliana)、蠕虫 (C. elegans)、果蝇 (D. melanogaster)、斑马鱼 (D. rerio)和小鼠 (M. musculus)，使用pGlycoNovo进行无糖库的N糖基化搜库以及有糖库的pGlyco3搜库，生成了一个丰富的，包含32549位点特异性糖链、4602糖蛋白以及643045糖肽谱图的N糖数据库，里面各物种的鉴定情况见图3b、图3c。

pGlyco3和pGlycoNovo的GPSMs的鉴定覆盖度从54.47%到73.74%，pGlycoNovo单独鉴定到的位点特异性糖链是8.21%到23.08%，其中蠕虫占比最高（图3d、图3e）。

作者还分析了这五个物种特异性糖链的糖型分布情况，其中蠕虫的未分类的聚糖占比最高有18.7%，相反的小鼠的占比最低，仅有5.04%，单糖的分型情况如图3g所示， 岩藻糖是各物种发生率最高的单糖，木糖出现在植物的单糖比例最高为66.29%。对pGlyco3和pGlycoNovo单独鉴定的糖肽类的比较分析表明，pGlycoNovo具备发现不同物种数据库中未记录的罕见聚糖的能力，增强了对不同物种中聚糖类型的挖掘。除此以外还通过NaN比值的方法来验证了pGlycoNovo的FDR小于1%（图3i、图3j）。

![图片 4](images/004.png)

图3

4

pGlycoNovo搜库结果中N糖基化蛋白的特性

作者对所有物种进行每个N糖基化蛋白的宏观不均一性分析，发现五个模式物种展示的糖蛋白中的单位点占比最多，且占比都超过50%（图4a）。其次对糖基化蛋白进行微观不均一性统计，发现都只有不到50%的位点拥有一个糖型种类（图4b），还比较了每个物种的单糖总量的信息，发现小鼠和斑马鱼的单糖总量组成最丰富（图4c）。细胞定位分析发现这些物种的糖蛋白主要富集在细胞膜和高尔基体上，小鼠和植物在杂合子糖型上表达最多，斑马鱼物种在 岩藻糖主要富集在细胞系中，远多于其他物种，蠕虫则主要富集在细胞膜上（图4d）。类似的，还将各物种的多糖和单糖富集在了motif和蛋白二级结构上，五种模式生物的pGlycoNovo搜库结果在糖基化motif中的比例以及结构域上都是正常与相似的，其中小鼠鉴定到的位点数是最多的，多样性的水平是最高的（图4e/4f）。于是比较了五种小鼠组织和三种植物组织的位点特异性糖基化修饰的相关性，结果发现小鼠的脑、心、肾、肝、肺以及植物的芽、种、叶的糖基化修饰表达谱都是独特的（图4g/4h）。

5

不同物种的未知糖肽碎片离子的探索

基于pGlycoNovo优秀的鉴定糖基化碎片离子的能力，使用pGlyco3和pGlycoNovo搜索了来自不同样本类型的糖肽数据，并在本研究和其他已发表的研究中进行了质谱分析（图5a）。在共同鉴定到的Y离子GPSMs上，发现具有五糖核心的Y离子都有较高的相对丰度（图5b），在pGlycoNovo单独鉴定到的Y离子谱图上，如蠕虫的core-fucose Y-H(3)N(2)F(2)以及其他物种的core-fucose，都展示出其独特的能力。

目前，一些搜库软件如StrucGP、PEAKS GlycanFinder等也有对糖肽的de novo搜库功能，但是这些软件在对于现有糖谱图库的搜库能力依然有限。pGlycoNovo通过独特的质控打分算法，在完整糖肽的鉴定中展示了其强大的鉴定能力和分析效率，特别是在罕见和未知的聚糖上面。

![图片 5](images/005.png)

图1

图4

易算生物长期和曹纬倩、曾文锋、乔亮、刘超、水雯菁等课题组合作，致力于质谱方法、算法、软件的实用化应用，如果您在相关领域遇到问题、希望寻求合作或者希望落地相关方法，欢迎和我们联系。

继续阅读

-

Nature Communications | 复旦大学乔亮、曹纬倩团队开发DIA糖蛋白质组分析工具GproDIA

-

Nature Methods|中科院计算所曾文锋与复旦大学曹纬倩合作发展蛋白质位点特异性糖基化解析工具pGlyco3

-

如何深入糖蛋白组的数据挖掘 | Int J Mass Spectrom |复旦大学与易算共同开发在线平台GlycAP文章发表

-

pGlycoQuant：Nat Commun | 复旦曹纬倩团队与北航刘超团队发表完整糖肽的糖蛋白质组定量工具

易算近期其他合作成果

-

互作组新进展：水雯箐/庄敏提出膜蛋白互作新方法

-

Cell Reports Methods | PTMoreR：跨物种翻译后修饰motif比对、富集和注释

-

乔亮组新进展：基于深度学习提高DDA MS1鉴定能力

-

【Cell Rep】易算共一作：蛋白代谢+机器学习发现肝细胞癌治疗敏感分子

-

龙年第三篇【Microbiome】复旦乔亮、澳洲国立林宇与易算团队联合推出ConDiGA：基于宏基因组精准构建宏蛋白组序列库

-

复旦乔亮团队与易算最新研究成果：宏蛋白组建库方法与应用

合作实验室招聘启事

-

代发：上海博士后或助理研究员招聘 （临港实验室）

-

代发：海南医科院工程师招聘
