很多人从不抽烟,但是还是会得肺癌。大多数研究肺癌的队列都纳入了吸烟人群,不吸烟人群又有哪些独特的特征?


本研究收集了103名患者的标本,来自于代表东亚人口的台湾患者。他们发现, 东亚地区肺癌的特点有三个:


这篇文章来自cell,去年发表。文章很长,而对蛋白质组学数据解读工作最大价值点的是结果六和结果七,容易迁移到自己的分析流程里面。今天只看结果六(Proteomic Subtypes Resolve the Heterogeneity in Early Stage Lung Adenocarcinoma)。


结果六,采用了一致性聚类、功能和通路、生存分析等方法。 


根据这些分析结果, 研究者建议IB期NSCLC患者进行EGFR突变的检测。除了NCCN指南上提到的可以用来指导患者术后的辅助用药以外,EGFR检测还有助于区分高风险的IB期患者,给他们进行更密切的随访和可能的辅助治疗。

这些分析怎么做的呢?为什么研究者会给出上述建议呢?


我把结果六分为三个步骤:找亚型、做比较、看突变




步骤一:无监督一致性聚类找亚型


我们获得组学知识的第一步就是聚类。

这里用到的无监督一致性聚类(Unsupervised consensus clustering)被用来将研究者队列中的腺癌患者分为分子亚型。


无监督一致性聚类(Unsupervised consensus clustering)怎么做的呢?


首先,准备工具。研究者使用ConsensusClusterPlus R软件包(Wilkerson and Hayes, 2010)对不同分子水平的患者样本进行无监督聚类。


接下来,数据的选择和过滤。使用的是基于标准差排名的前50%的蛋白质、RNA和磷酸位点。对于蛋白质组学和RNA数据,有缺失值的基因被预先排除,而对于缺失值小于20%的磷蛋白组学数据,研究者在Perseus 1.6中所有数值的标准差的20%范围内,从正态分布中估算出缺失数据。


最后, 确认重要参数。根据k-means聚类、欧氏距离和1,000次重采样重复,在2到7个聚类的范围内得出患者聚类。经验累积分布函数(CDF)图最初显示所有分子水平的3到4个集群之间的最佳分离。为了评估k=3和k=4的共识集群的稳定性,研究者在Rstudio中使用 " cluster "库制作了Silhouette plots。


在排除小的或不稳定的聚类后,研究者确定了三个蛋白质组、三个RNA和四个磷蛋白组亚型(图S6A)。


 图S6A 蛋白质组学、RNaseq和磷蛋白组学通过一致性聚类确定的不同集群的Silhouette plots。为下游分析选择的聚类用虚线标出。




除了第4个RNA簇被排除之外,k=4的簇总体上更稳定。第4个蛋白质组聚类也由于其体积小而被排除。这样,研究者确定了三个蛋白质组、三个RNA和四个磷蛋白组的患者亚型。




步骤二:做比较


亚型之间有什么不一样? 亚型在组学之间(蛋白质组、RNA、磷酸化)之间差异大吗?

 

亚型之间的差异,要结合临床特征来看。


首先, 我们先把目光放在蛋白质组所确定的三个患者亚型上。


整体上看,蛋白质组学亚型与临床特征的比对显示了按肿瘤分期以及按驱动基因突变的清晰分离(图6A)。

 

图6A:三种蛋白质组亚型中受不同调控的蛋白质热图(方差分析,FDR<0.05)与临床特征注释。


亚型1包括最大的群体,特征是:代表晚期肿瘤(分期超过II)、有内脏胸膜侵犯的肿瘤、TP53突变和最高的突变负荷(图6B); 

图6B:每个蛋白质组亚型的肿瘤突变负荷的图表(Wilcoxon秩和检验,P < 0.05)。


而亚型2是一个较小的群体,由没有EGFR-L858R突变的早期患者(主要是IA和IB)组成;


到了亚型3代表早期阶段(主要是IA阶段),无TP53突变。研究者在亚型之间, 找到1,514个不同差异调节的磷酸位点(方差分析,FDR<0.1),体现出对癌症、PI3K-AKT信号通路和细胞周期等富集(图S6B)。

图S6B: 使用蛋白质校正的磷酸化丰度(方差分析FDR<0.1)的三种蛋白质组学亚型之间的差异调节的磷酸位点(列)的热图。行代表患者,点的大小越大表示相对磷酸化程度越高。只显示与癌症相关的KEGG信号通路中的蛋白质的磷酸化点。底部面板显示了各自的信号通路。星号表示比非差异性调控的磷酸位点有明显富集(Fisher's exact test, Benj. Hoch. FDR < 0.1)。


有趣的是,关键信号通路的磷酸化点在亚型3中显示出更高的磷酸化(图S6B),这将暗示在肿瘤发展过程中,肺癌早期被激活的信号特征。具体示例见图S6C,并标明了可药用的蛋白。这些可用药的蛋白怎么得到的?DGIdb。


图S6C: 期3号亚型中具有代表性的上调的磷酸位点的Boxplots。已知抑制剂靶向的磷酸蛋白(来源:DGIdb,http://www.dgidb.org/)用绿色标记突出。


此外,参与免疫信号传导的蛋白质上的酪氨酸磷酸化在3号亚型中也有较高的水平。我们前面说过, 亚型3代表IA阶段的肺癌。  这表明在肺癌早期阶段,免疫信号传导的调控作用增强(图S6D)。

 

图S6D: 在早期亚型 3 中具有上调的代表性磷酸酪氨酸位点的热图和箱线图。


然后, 我们再把目光放在三个RNA和四个磷蛋白组亚型上。


按分期分组在RNA亚型中不太明显,但是在磷蛋白组亚型上,研究者发现通过APOBEC特征(磷酸化亚型1和2,图S6E)有很好的分离,可能反映了信号传导的广泛改变。


图S6E : RNA和磷蛋白组学亚型与临床特征的吻合。

那么问题来了。亚型在组学之间(蛋白质组、RNA、磷酸化)之间差异大吗? 

拿RNA和磷酸化亚型与蛋白质组亚型作比较以后发现, RNA和磷酸化亚型与蛋白质组亚型只有部分重叠(图S6F),强调了多组学肿瘤分析在患者分类工作中的互补性。

 

图S6F: 蛋白质组学、RNA和磷蛋白组学亚型之间的重叠。在每一个蛋白质组学亚型中,明显过度的RNA和磷酸化亚型显示为网络(Fisher's exact test, p < 0.05)。


紧接着就要引入突变了。


开头我们提到,东亚地区肺癌的特点是从不吸烟的人比例高,发病早,并以EGFR突变为主。EGFR突变根据NCCN的非小指南,已经要求在IB期就开始检测了。 


讲一讲背景:在分子水平上,EGFR激活性突变,主要包括L858R突变和E746_A750外显子19缺失,在东亚地区发生的频率更高(>50%,尤其是在从不吸烟的女性中)(Yang等人,2020;Shi等人,2014)。尽管带有EGFR突变的患者从使用酪氨酸激酶抑制剂的靶向治疗中获益,但他们中的大多数最终会产生耐药性(Tomasello等人,2018)。鲜明的是,与EGFR 19号外显子缺失的患者相比,EGFR-L858R突变的患者显示出较短的总生存期和较高的恶性胸腔积液和肿瘤转移倾向(Kelly等人,2018)。


因此, 更全面地了解与早期致癌性EGFR突变相关的分子重塑将有助于设计出更有效的治疗方法。那么放在亚型中,EGFR突变又有哪些特征?




步骤三:看突变


我们再把目光放回到按照蛋白质组分类的亚型中。有一个值得注意的现象:一些早期肿瘤与亚型1中的晚期肿瘤聚集在一起(图6A)。


 图6A: 三种蛋白质组亚型中受不同调控的蛋白质热图(方差分析,FDR<0.05)与临床特征注释。


研究者提出可以利用蛋白质组为肿瘤分期做精细的分类,将蛋白质组亚型1中发现的IA期和IB期患者再细分出来,分别为"IA期 late-like "和" IB期late-like "(图6C)。这样一来,“Refined class”总共就有五类:IA,IB, IA期 late-like,  IB期late-like,late

图6C:由蛋白质组学提供信息的精细版本的分期分类。临床注释的颜色编码与图6A相同。


你会发现精细分法, 能抓住这些特征:

1、几乎所有有内脏胸膜侵犯的IB期患者都属于" IB期late-like "。

2、在IB期,与没有这种驱动突变的IB期肿瘤相比,具有EGFR-L858R突变的肿瘤突出地聚集在蛋白质组注释的晚类组中。此外,与蛋白质组学亚型2和3中发现的IB期肿瘤相比,IB期late-like组富含TP53突变。

3、所有具有EGFR-L858R/TP53双重突变肿瘤的IB期患者都在IB期late-like类中发现。

4、与IA期肿瘤相比,“IA期late-like”型肿瘤富含有吸烟史的患者,且突变负荷略高(图6D)。


 

图6D:每个细化的分期分类的突变负荷的图表(Wilcoxon秩和检验,P < 0.05)。


要把I期分的这么细还可以发现什么? 

紧接着就是生存分析了。


研究者在一个独立的回顾性队列中研究了EGFR-L858R患者与EGFR-19Del患者相比, 是否有不同的结果,该队列包括无治疗、完全切除的病理阶段IA(n = 143)和IB(n = 65)肺腺癌患者,主要包括从不吸烟(74%)和女性(61%)患者,有生存数据(原文的表S6C 和S6D,此处略)。


诊断为IA期的患者在L858R和Del19 EGFR突变组之间的总生存率没有差异(图6E)。然而,在IB阶段,与19Del患者相比,EGFR-L858R患者的总生存率明显较低(p = 0.028,图6F)。


图6E 和F:在一个独立的209名患者的回顾性队列中,具有野生型EGFR和具有EGFR-L858R或Del19突变的IA(E)和IB(F)患者组的生存图(log-rank检验)。


这一点需要特别注意。患者群体很可能在IB阶段出现分歧。这与他们报告的较高的癌症转移倾向和较短的时间相一致。IB阶段的EGFR检测,会帮医生把这群容易出现恶化的患者找出来。


最后,利用差异表达分析,研究者定义了一个生物标志物候选组,以区分早期与早期晚期或晚期肿瘤(log2T/N值,方差分析,FDR < 0.05,图6G)。为了探索它们作为血清生物标志物或治疗靶点的可能,研究者提供了来自各种资源的注释,包括血浆蛋白质组数据库(PPD)、人类蛋白质组图谱(HPA)、Ingenuity Pathway Analysis(IPA)、FDA批准的药物目标、治疗目标数据库(TTD)、药物-基因相互作用数据库(DGIdb)和ChEMBL。

 

图6G:精细分类之间具有不同调控的蛋白质面板的指数图(ANOVA,FDR < 0.05)。中心线代表中位数,方框的边界代表第一和第三四分位数,上下须延伸至1.5×IQR内的最高或最小值。来自血浆蛋白质组数据库(PPD)、人类蛋白质组图谱(HPA)、Ingenuity Pathway Analysis(IPA)的注释,药物靶点来自FDA批准的药物靶点、治疗靶点数据库(TTD)、药物-基因相互作用数据库(DGIdb)和ChEMBL的注释。


图6H中显示了晚期类的特征。研究者提出,基于蛋白质组学的分类可以将早期NSCLC患者分为与临床结果相关的群体,超出了临床分期和基因组驱动突变的水平。

 

图6H:HIA和IB阶段的 "晚期同类 "的特征总结。




总结


下一期我们讲结果七,cell里面对WGCNA分析的解读。再见。


相关阅读:

CKG|怎么利用临床知识图谱,将蛋白质组学数据整合到临床决策

临床大队列蛋白质组学你真的会做么?

通路分析里面的级联反应

为什么癌症精准治疗需要蛋白质组学?



 

www.omicsolution.com

若有任何疑问,欢迎邮件或来电咨询:

marketing@omicsolution.com

support@omicsolution.com

+86-18221381405

- END -